개요
Threads 게시물은 비드래프트가 그래픽카드 없이 일반 CPU만으로 대형 언어모델을 실행하는 온디바이스 모델군 POCKET을 공개하고 Hugging Face에 배포했다는 소식을 소개한다. 게시물에 따르면 POCKET은 Google Gemma4-26B와 Qwen3.6-35B 계열을 각각 경량화했으며, 노트북·PC CPU에서 초당 약 20토큰의 응답 속도를 목표로 한다. 모델은 MoE 구조를 활용해 전체 파라미터보다 실제 토큰당 연산량을 줄이고, llama.cpp 계열 런타임인 Ollama·LM Studio 등에서 별도 빌드 없이 실행할 수 있다고 설명한다.
핵심 내용
- CPU 온디바이스 실행: GPU 서버나 클라우드 없이 노트북·PC의 일반 CPU에서 최신급 LLM을 직접 구동하는 것을 목표로 한다.
- 두 계열: Gemma4-26B 기반 POCKET-26B와 Qwen3.6-35B 기반 POCKET-35B가 언급된다.
- MoE 활용: 전문가 혼합 구조를 통해 전체 모델 크기와 실제 추론 시 활성 연산량 사이에 차이를 만들고 CPU 실행 가능성을 높인다.
- 배포 형식: Hugging Face의 POCKET 모델 컬렉션에서 GGUF와 MLX 계열 모델을 확인할 수 있다. 컬렉션에는 POCKET-35B-GGUF, POCKET-26B-GGUF, POCKET-EN-GGUF, POCKET-KR-GGUF, POCKET-KR-MLX 등이 올라와 있다.
- 기존 도구와의 호환: 게시물은 Ollama·LM Studio 등 llama.cpp 계열 도구에서 별도 빌드 없이 바로 열 수 있다고 주장한다.
- 성능 주장: 게시물은 CPU에서 초당 약 20토큰을 제시하지만, CPU 모델·메모리 대역폭·양자화 수준·컨텍스트 길이에 따라 달라지는 측정값이므로 독립 재현이 필요하다.
왜 중요한가
POCKET의 방향은 대형 모델 사용을 GPU 서버나 API에만 묶어 두지 않고, 사용자의 노트북과 데스크톱에서 프라이버시를 유지하며 실행하려는 흐름과 맞닿아 있다. 특히 모델 가중치와 추론 엔진이 로컬에 있으면 네트워크 없이도 사용할 수 있고, 민감한 프롬프트를 외부 서비스로 보내지 않아도 된다. 반면 20B~35B급 모델은 여전히 상당한 RAM과 저장 공간을 요구하므로 “GPU가 필요 없다”는 말이 곧 “저사양 기기에서 가볍다”는 의미는 아니다.
실무 적용 시 확인할 것
- GGUF인지 MLX인지, 사용하는 CPU·운영체제에 맞는 포맷을 선택한다.
- 모델 카드의 양자화 수준, 최소 RAM, 컨텍스트 길이, 라이선스와 원본 모델 계보를 확인한다.
- 동일한 프롬프트와 컨텍스트 길이로 토큰 생성 속도, 첫 토큰 지연, 메모리 사용량을 직접 측정한다.
- Qwen3.6·Gemma4 계열이라는 설명은 게시물과 컬렉션의 표기를 기준으로 한 것이므로, 실제 모델 카드의 base model과 변환·양자화 절차를 확인한 뒤 배포에 사용한다.
맥북(macOS) 설치 요약
POCKET은 맥북에서 MLX(Apple Silicon 최적화)와 GGUF(범용) 두 포맷으로 실행할 수 있다. 한국어 사용자라면 POCKET-KR-* 계열이 가장 적합하다. 라이선스는 전 모델 Apache-2.0.
RAM별 추천 모델
| 맥북 RAM | 추천 모델 | 파일 크기 | 포맷 |
|---|---|---|---|
| 8GB (에어/기본형) | POCKET-KR-MLX / POCKET-KR-IQ2_M.gguf | ~5.1GB | MLX / GGUF |
| 16GB (M-Pro 보통) | POCKET-KR-160-Q2_K.gguf | 8.5GB | GGUF |
| 32GB+ (M-Max/Ultra) | POCKET-35B-Q4_K_M.gguf | 21GB | GGUF |
극저양자화(IQ1_M 등)는 한국어 품질을 영어보다 약 2.8배 더 떨어뜨리므로, 한국어를 쓸 거라면 최소 Q2_K 이상을 권한다.
실행 방법
1) MLX — Apple Silicon(M1~M4) 추천
pip install mlx-lm # 또는 uv tool install mlx-lm
mlx_lm.chat --model "FINAL-Bench/POCKET-KR-MLX" # 인터랙티브 채팅(자동 다운로드)
mlx_lm.server --model "FINAL-Bench/POCKET-KR-MLX" # OpenAI 호환 API 서버2) Ollama — 가장 간단한 CLI
ollama run hf.co/FINAL-Bench/POCKET-KR-GGUF:Q2_K3) LM Studio — GUI 선호 시
lmstudio.ai 앱 설치 뒤 딥링크로 열기: lmstudio://open_from_hf?model=FINAL-Bench/POCKET-KR-GGUF
4) llama.cpp — 직접 제어
brew install llama.cpp
llama serve -hf FINAL-Bench/POCKET-KR-GGUF:Q2_K # 서버
llama-cli -m POCKET-KR-IQ2_M.gguf -p "대한민국의 수도는" -ngl 0 -t 8 # CPU 전용(Metal 끄기)-t 스레드 수는 물리 코어 수에 맞춘다(최대 ~32).
성능 참고치
게시자가 측정한 M3 Pro 18GB 기준 속도. Metal(GPU) 켜면 초당 약 25토큰, CPU만 쓰면 약 14~20토큰 수준이라 게시물의 “초당 약 20토큰” 주장과 대체로 일치한다. 단, Intel Mac이나 8GB 기기에서는 현저히 느릴 수 있다.
| 구성 | 속도 |
|---|---|
| Metal(GPU) 생성 | 25.4 tok/s |
| CPU(8스레드) 생성 | 13.8 tok/s |
| Metal 프롬프트 처리 | 240.7 tok/s |
| POCKET-35B Q2_K CPU 생성 | 19.5 tok/s |
확인된 배포 표면
- Hugging Face POCKET-MODELs 컬렉션
- POCKET-35B-GGUF
- POCKET-26B-GGUF
- POCKET-35B CPU 비교 Space
- POCKET-26B CPU 비교 Space
검증 상태와 한계
원문 Threads 게시물은 공개 HTML 메타데이터와 Jina Reader를 통해 확인했다. 게시물 내용과 Hugging Face 컬렉션의 모델 목록은 일치하지만, 초당 20토큰이라는 성능 수치와 “별도 빌드 없이 바로 실행” 여부는 이 저장 과정에서 직접 벤치마크하거나 설치해 검증하지 않았다. 따라서 해당 수치는 게시자의 주장으로 기록한다.