출처
- 원문 URL: https://discuss.pytorch.kr/t/bonsai-27b-27b-llm-feat-prismml/11263
- 작성자: 9bow (PyTorchKR)
- 원문 보존: raw source:
web-2026-07-16-pytorchkr-topic-11263-bonsai-27b-27b-llm-feat-prismml
개요
Bonsai 27B는 PrismML이 Qwen3.6-27B의 아키텍처를 유지한 채 가중치를 이진 또는 삼진 표현으로 변환해 온디바이스 실행을 시도한 연구다. 원문 보고서에 따르면 삼진 모델은 약 5.9GB의 이론적 발자국으로 노트북에서, 이진 모델은 약 3.9GB로 iPhone 17 Pro Max급 기기에서 동작한다. 연구팀은 저비트 가중치를 직접 처리하는 MLX·CUDA 커널과 4비트 KV 캐시, DSpark 추측 디코딩을 함께 제시했다. H100 기준 사고 모드 평균 점수는 삼진 80.49, 1비트 76.11로 FP16 기준선 85.07보다 낮지만, 원문은 기존 사후 양자화의 2비트대 빌드보다 작은 발자국에서 더 높은 점수를 보고한다.
핵심 포인트
- 실제 비트 폭을 기준으로 비교:
Q4_K_XL은 라벨과 달리 평균 5.2 bits/weight·17.6GB,IQ2_XXS는 2.8 bits/weight·9.4GB인 반면, Ternary Bonsai는 이론상 1.71 bits/weight·5.9GB, 1-bit Bonsai는 1.125 bits/weight·3.9GB다. 삼진의 실제 배포 크기는 현재 2비트 슬롯 사용 때문에 약 7.2GB로 제시된다. - 기존 모델에서 변환: BitNet처럼 처음부터 저비트로 사전학습하는 대신, 이미 학습된 Qwen3.6-27B에서 출발해 사고·도구 호출·에이전트 워크플로 능력을 보존하는 변환을 목표로 한다는 것이 원문의 설명이다.
- 기기별 운영 지점: 원문 벤치마크에서 M5 Pro는 이진 약 44.2 tok/s, 삼진 약 26.2 tok/s, iPhone 17 Pro Max는 이진 약 11.0 tok/s를 기록했다. H100에서는 이진 104.8 tok/s, 삼진 98.0 tok/s로 측정됐다.
- KV 캐시와 추측 디코딩: 4비트 KV 캐시로 256K 컨텍스트의 FP16 기준 약 17GB를 약 4.3GB로 줄이는 구성을 제시하며, H100의 DSpark 결합 측정에서는 이진 1.37배, 삼진 1.34배의 속도 향상이 보고됐다. Apple Silicon에서는 DSpark 검증 비용 때문에 기본적으로 꺼져 있다.
- 품질의 선택적 하락: 15개 벤치마크 평균에서 삼진은 FP16 대비 94.6%, 1비트는 89.5%로 보고됐다. 수학·코딩보다 명령 따르기·에이전트 도구 호출·비전에서 손실이 더 크게 나타나며, 원문은 삼진을 노트북용 품질 지점, 이진을 스마트폰용 크기 지점으로 설명한다.
- 공개 실행 경로와 한계: Mac·iPhone·iPad용 Apple MLX와 NVIDIA CUDA 커널, Apache 2.0 가중치, Bonsai-demo를 공개했다. 장기적인 다중 파일 코딩 에이전트 작업은 아직 주요 목표가 아니며, 삼진 네이티브 커널과 더 낮은 비트의 KV 캐시는 후속 과제로 남아 있다.
왜 중요한지
27B급 모델은 FP16 기준 가중치만 약 54GB라서 일반 스마트폰과 소비자용 노트북의 메모리 예산을 넘기기 쉽다. 이 연구는 모델 품질만 높이는 대신 가중치 저장량과 토큰 생성 때의 메모리 이동량을 줄여, 같은 계열의 모델을 로컬·오프라인·프라이버시 민감 환경에서 실행할 가능성을 다룬다. 다만 성능과 메모리 수치는 원문이 제시한 벤치마크 결과이며, 이 노트에서 독립적으로 재현한 결과는 아니다.
후속으로 볼 링크 / 키워드
- PrismML
- Qwen3.6-27B FP8 · Qwen3.6-27B 논문
- Bonsai-demo GitHub
- Bonsai 27B Hugging Face 컬렉션
- Bonsai 27B WebGPU 커널 데모
- BitNet · 1.58비트 후속 연구 · HQQ
- 키워드:
binary quantization,ternary weights,bits per weight,on-device LLM,KV cache quantization,speculative decoding,DSpark,MLX,CUDA,WebGPU