개요
17GB 디스크 파일 하나(Qwen3.8-27B, 8월 14일 Apache-2.0 공개)를 에이전트 하네스 Pi의 기본 모델로 쓰는 구성을 소개한 6연쓰레드다. llama.cpp 서버 연결 순서, 작은 하네스가 로컬 모델에 유리한 이유, 출고 기본값인 xhigh 추론 강도의 함정, 벤치 점수 해석 주의가 한 편에 들어 있다.
게시물 요지
- 모델: Qwen3.8-27B. SWE-bench Pro 61.7로, 같은 표의 Opus4.6 Max 공식 보고 53.4를 앞선다고 소개한다.
- 연결 순서:
llama-server --models-dir ~/models --no-models-autoload --jinja --host 127.0.0.1 --port 8080 -ngl 999 -c 32768로 모델 없이 띄운 뒤 Pi에서/login llama.cpp→/llama로 모델 올리기 →/model로 대화에 붙이기.--model을 주면 단일 모델 모드가 되므로 모델 없이 띄우는 것이 포인트다. - 작은 하네스가 유리한 이유: Pi 기본 도구가 read·write·edit·bash 4개뿐이라 도구 정의가 가볍고 시스템 프롬프트가 작아 prefill에 유리하다. 로컬 모델의 가장 비싼 구간이 prefill이라는 설명이다.
- 추론 강도 함정: 출고 기본값이 xhigh라서 Simon Willison의 펠리컨 자전거 SVG가 22,276 사고 토큰·21분이 걸렸고, 추론을 끄자 137초에 끝났다. “처음엔 low나 추론 없음으로 돌려라”는 조언을 인용한다.
- 점수 해석 주의: 코딩 항목 대부분은 Qwen을 Claude Code 하네스에 얹어 다시 잰 값이고, Opus4.6 Max는 SWE-bench Pro만 공식 보고다. 터미널 코딩은 73.0 대 78.2로 여전히 뒤지고, 맥북프로 속도도 초당 15~30 토큰이다.
- 운용 결론: 프론티어를 버리는 게 아니라 파일 수정·스크립트 실행은 로컬에, 막히면
/model로 큰 모델을 부른다. 작성자는 이를 “로컬 모델의 승리가 아니라 기본값이 바뀐 사건”으로 읽는다.
확인 범위와 한계
- 벤치 수치·Willison 일화·명령어 모두 2차 인용으로, 이 노트에서 llama.cpp·Pi 실기 검증은 하지 않았다.
- 원문 링크(x.com/xiaom…, Hugging Face, github.com/earen…)는 단축 표기라 정확한 원전 URL은 별도 확인이 필요하다.
관련 위키
검증
- Threads 게시물을 ego-browser로 2026-09-10에 직접 렌더링해 6개 포스트 전문을 캡처했다.
- 원문은
raw/articles/2026-09-10-threads-qwen3-8-27b-pi.md에 보존했고 SHA-256을 기록했다.