출처

개요

PrismML은 Qwen3.6 27B 기반 멀티모달 모델인 Bonsai 27B를 1비트급 가중치 압축으로 줄여, 1비트 버전을 3.9GB까지 축소했다고 발표했습니다. 이는 27B급 모델의 일반적인 54GB 크기와 비교해 크게 줄어든 용량이며, 원문은 아이폰 17 프로에서 실행 가능한 크기라고 설명합니다. 삼진 버전은 5.9GB, 1비트 버전은 3.9GB이며, 각각 원본 모델 성능의 95%와 90%를 유지했다고 PrismML은 주장합니다. 이 모델은 추론, 구조화된 툴 호출, 컴퓨터 사용 에이전트 작업, 이미지·문서·카메라 입력을 지원하는 것을 목표로 합니다. 다만 애플과의 협력은 아직 초기 단계의 논의로 소개됩니다.

핵심 포인트

  • PrismML은 Bonsai 27B의 가중치를 1~1.71비트 수준으로 압축했습니다.
  • 삼진 Bonsai 27B는 가중치에 −1, 0, +1을 사용하며 5.9GB로 줄였습니다.
  • 1비트 Bonsai 27B는 −1과 +1만 사용해 3.9GB까지 축소됐습니다.
  • 저비트 표현은 임베딩, 어텐션, MLP, 출력층 등 모델 전체에 적용됐으며, 비전 타워는 4비트로 압축됐습니다.
  • 15개 벤치마크에서 삼진 버전은 원본의 95%, 1비트 버전은 90% 성능을 유지했다고 발표됐습니다.
  • 수학·코딩·툴 호출 성능은 상대적으로 유지됐지만, 이미지 이해·명령어 이행·비전 관련 항목의 성능 하락은 더 컸습니다.
  • PrismML의 비교에서 9.4GB로 압축한 Qwen3.6 27B는 72.7점, 3.9GB 1비트 Bonsai 27B는 76.1점을 기록했습니다.

왜 중요한가

에이전트 작업은 하나의 요청을 처리하기 위해 모델을 여러 차례 호출할 수 있으므로, 온디바이스 실행은 클라우드 호출 비용과 네트워크 지연을 줄일 가능성이 있습니다. 화면·문서·카메라 등 개인 데이터를 기기 밖으로 보내지 않고 처리할 수 있다는 점도 온디바이스 모델의 활용 이유로 제시됩니다. 원문은 이를 상시 작동하는 개인 에이전트, 오프라인 어시스턴트, 로컬·클라우드 하이브리드 시스템의 기반으로 설명하지만, 실제 제품 적용과 성능·전력 효율은 추가 검증이 필요합니다.

참고 링크

관련 위키

원문 보존 위치

원문 전체는 2026-07-19-aisparkup-post-14555-27b-ai-prismmlsource_url 및 HTML 원문과 함께 저장되어 있습니다.