출처

Rapid-MLX: Apple Silicon 맥에서 로컬 LLM을 OpenAI 호환 서버로 띄우는 추론 엔진

개요

Rapid-MLX는 Apple Silicon 맥에서 MLX 커널을 사용해 로컬 LLM을 실행하고, 이를 OpenAI 및 Anthropic API 호환 서버로 제공하는 추론 엔진입니다. 연속 배칭, 프롬프트 캐시, 양자화된 KV 캐시를 지원하며 llama.cpp나 별도의 Metal 중간 계층을 사용하지 않는다고 설명합니다. Claude Code, Codex CLI, Hermes, Aider 등 코딩 에이전트와의 연결을 지원하고, 모델별 도구 호출 형식 차이를 줄이기 위한 파서와 자동 복구 기능을 제공합니다. 프로젝트는 Ollama보다 2~4배 빠르다고 주장하지만, 원문에서는 저장소 README에 이를 뒷받침하는 비교 벤치마크 표가 없으므로 사용 환경에서 직접 측정할 필요가 있다고 설명합니다.

핵심 포인트

  • Apple Silicon 전용으로 설계되었으며, 순수 MLX 커널 기반의 로컬 추론을 목표로 합니다.
  • http://localhost:8000/v1에서 OpenAI API를, http://localhost:8000에서 Anthropic /v1/messages 형식을 제공해 기존 SDK와 클라이언트를 연결할 수 있습니다.
  • rapid-mlx launch claude-code 같은 명령으로 Claude Code, Cursor, Cline, Continue 등의 설정을 자동으로 연결할 수 있습니다.
  • 11개 에이전트와 LangChain, PydanticAI, smolagents 등 3개 Python 프레임워크에 대한 통합 테스트를 제공하며, Claude Code·Codex CLI·Hermes·Aider는 릴리스마다 최신 클라이언트 바이너리로 종단간 검증한다고 설명합니다.
  • 기본 설치는 텍스트 전용 약 460MB 구성이고, 비전·음성·영상 생성·임베딩·DFlash 추측 디코딩은 선택적으로 추가 설치합니다.
  • RAM 용량에 따라 qwen3.5-4b-4bit, gpt-oss-20b-mxfp4-q8, qwen3.6-35b-8bit, gpt-oss-120b-mxfp4-q8 등을 기본 모델로 추천합니다.
  • Apache 2.0 라이선스로 배포되며, 음성 API와 영상 생성 API도 선택 기능으로 제공합니다. 영상 생성은 메모리 문제를 줄이기 위해 한 번에 하나씩 직렬 처리한다고 안내합니다.

왜 중요한가

M 시리즈 맥에서 로컬 모델을 코딩 에이전트에 연결하려면 추론 성능뿐 아니라 API 호환성과 도구 호출 안정성도 중요합니다. Rapid-MLX는 OpenAI와 Anthropic 양쪽 API를 제공하고 주요 에이전트 연결 명령과 릴리스별 검증을 지원해, 로컬 모델을 기존 개발 도구에 연결하는 설정 부담을 줄이는 접근을 제시합니다. 다만 Apple Silicon에 한정된 프로젝트이며, 성능 우위를 판단하려면 자신의 맥과 모델 조합에서 rapid-mlx bench로 직접 비교해야 합니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-05-pytorchkr-topic-11516-rapid-mlx-apple-silicon-llm-openaisource_url 및 HTML 원문과 함께 저장되어 있습니다.