출처

TurboFieldfare: 8GB 맥북에서 Gemma 4 26B를 약 2GB 메모리로 실행하는 Swift 런타임

개요

TurboFieldfare는 Apple Silicon 맥에서 Gemma 4 26B-A4B를 실행하기 위해 Swift와 Metal로 직접 구현한 모델 전용 추론 런타임이다. 약 14.3GB인 4비트 양자화 체크포인트 전체를 메모리에 올리지 않고, 공용 가중치와 KV 캐시만 메모리에 유지하며 필요한 전문가 가중치를 SSD에서 토큰 단위로 읽어 온다. 저자 측정에서 8GB M2 맥북 에어에서도 약 1.9~2.1GB의 메모리 사용량으로 실행되지만, SSD 읽기 때문에 메모리가 넉넉한 환경의 MLX보다 속도는 느리다. 프로젝트는 런타임 구현뿐 아니라 103건의 실험과 실패한 최적화 과정도 문서로 공개한다.

핵심 포인트

  • Gemma 4 26B-A4B의 128개 전문가 중 토큰마다 선택된 8개를 읽으며, 레이어별 16칸 LFU 캐시로 일부 전문가 가중치를 재사용한다.
  • 공용 가중치 약 1.35GB와 FP16 KV 캐시를 상주시키고, 라우팅 전문가 가중치는 레이어별 파일에서 필요할 때 pread로 불러온다.
  • 8GB M2 환경에서 디코드 속도는 약 5.106.30 tok/s, 24GB M5 Pro에서는 3135 tok/s로 측정됐다.
  • 같은 24GB M5 Pro에서 mlx-lm은 76.3382.07 tok/s를 기록했지만, RSS 8.39.8GB와 GPU 할당 14.7~15.3GB를 사용했다.
  • 설치기는 원본 체크포인트 전체를 Swift 메모리에 올리지 않고 필요한 바이트 범위를 스트리밍해 .gturbo 형식으로 변환하며, 중단된 설치의 재개와 해시 검증을 지원한다.
  • 맥 앱, CLI, 루프백 OpenAI 호환 서버, 리패커를 제공하지만 Gemma 4 26B-A4B 명령 튜닝 체크포인트 하나와 텍스트 입력만 지원한다.
  • macOS 26, Metal 4, Swift 6.2 이상 및 arm64 환경이 필요하며, 서버에는 원격 인증과 TLS가 없어 로컬 루프백 사용만 권장된다.

왜 중요한가

TurboFieldfare는 모델 전체를 메모리에 적재하는 일반적인 로컬 추론 방식 대신, MoE 모델의 선택적 전문가 활성화 특성을 활용해 메모리가 부족한 기기에서도 실행 가능성을 확보한 사례다. 다만 실행 가능성을 얻는 대신 SSD 입출력 비용으로 속도를 희생하므로, 처리량이 중요하거나 메모리가 충분한 환경에서는 MLX 계열이 더 적합하다는 비교 결과도 함께 제시한다. 또한 Metal 커널, 전문가 스트리밍, 캐싱, 프리필·디코드 경로와 실패한 실험까지 공개해 온디바이스 추론 런타임 설계를 학습하는 참고 자료로 활용할 수 있다.

후속으로 볼 링크 및 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-03-pytorchkr-topic-11502-turbofieldfare-8gb-gemma-4-26b-2gb-swiftsource_url 및 HTML 원문과 함께 저장되어 있습니다.