출처
- source_url: https://aisparkup.com/posts/15050
- author: Spark
- published: Fri, 07 Aug 2026 02:32:31 +0000
- raw: raw source:
2026-08-07-aisparkup-post-15050-llm
맥에서 로컬 LLM 돌리는 법이 갈라졌다, 속도냐 메모리냐
개요
Apple Silicon용 로컬 추론 프로젝트가 최근 속도와 도구 호출을 높이려는 방향, 제한된 메모리에서 큰 모델을 실행하려는 방향으로 나뉘고 있다. Rapid-MLX는 Apple Silicon에서 빠른 추론과 OpenAI·Anthropic 호환 API 서버 제공을 목표로 한다. TurboFieldfare는 Gemma 4 26B-A4B의 필요한 전문가만 SSD에서 스트리밍해 약 2GB 메모리로 실행하는 방식을 사용한다. 두 프로젝트의 성능 수치는 개발자가 직접 측정한 값이므로 서로 직접 비교하기 어렵다. 어떤 도구가 적합한지는 Mac의 메모리, 필요한 모델 유연성, 코딩 에이전트 연동 여부, macOS·개발 환경 호환성에 따라 달라진다.
핵심 포인트
- Rapid-MLX는 Ollama 대비 2~4배 빠른 속도와 캐시 상태에서 0.08초의 첫 토큰 지연을 제시하지만, 이는 프로젝트 자체 측정치다.
rapid-mlx serve명령으로 로컬 8000번 포트에 서버를 띄우고 Claude Code, Cursor, Aider 등에 연결할 수 있으며, 17종의 도구 호출 파서를 제공한다.- Rapid-MLX는 기기 메모리에 따라 적합한 모델을 자동 추천하며, 8
15GB에서는 2.6B급, 2431GB에서는 Gemma 4 26B, 96GB 이상에서는 122B 모델을 제안한다. - TurboFieldfare는 Gemma 4 26B-A4B의 전체 가중치를 메모리에 올리지 않고, 공유 코어와 KV 캐시를 상주시킨 뒤 토큰마다 필요한 전문가를 SSD에서 읽는다.
- TurboFieldfare의 측정 결과는 8GB M2 MacBook Air에서 초당 5.1
6.3토큰, 24GB M5 Pro에서 초당 3135토큰이었지만 프롬프트 길이와 캐시 상태 등에 따라 달라질 수 있다. - TurboFieldfare는 macOS 26, Metal 4, Xcode 26, Swift 6.2 및 arm64 환경이 필요하고 특정 모델에 맞춘 런타임이라 다른 모델로 확장하기 어렵다.
- Rapid-MLX 설치 시
curl | bash보다 릴리스 자산의 cosign 서명 검증, Homebrew, pip 등 문서에서 안내하는 검증된 경로를 사용하는 편이 안전하다.
왜 중요한가
두 프로젝트는 로컬 추론에서 모델이 실행되는지만이 아니라 첫 토큰 지연, 생성 속도, 도구 호출, 코딩 에이전트 연동, 메모리 요구량이 중요한 선택 기준이 되고 있음을 보여준다. 메모리가 넉넉하고 여러 개발 도구에 로컬 서버를 연결하려면 Rapid-MLX가 더 적합할 수 있다. 반대로 8~16GB Mac에서 더 큰 모델을 시도하려면 TurboFieldfare가 다른 접근법을 제시한다. 다만 두 프로젝트의 벤치마크 조건과 대상 모델이 다르므로 실제 사용 환경에서 직접 측정해야 한다.
참고 링크
- 원문: https://aisparkup.com/posts/15050
- Rapid-MLX: https://github.com/raullenchai/Rapid-MLX
- TurboFieldfare: https://github.com/drumih/turbo-fieldfare
- Open MLX Model Mirror: https://models.rapidmlx.com/
- Gemma 4 모델 카드: https://ai.google.dev/gemma/docs/core/model_card_4
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-07-aisparkup-post-15050-llm에 source_url 및 HTML 원문과 함께 저장되어 있습니다.