출처: @yulmu_coffee (2026-09-10) — alexgetmancom의 Reddit 실측 인용 + ARC-AGI-3 공식 벤치비용표
개요
응답 1회당 단가가 싼 쪽이 총사용량도 싸다는 직관이 깨졌다. 율무커피가 정리한 Reddit 실측에 따르면 Astra xHigh는 65턴으로 끝낼 일을 Medium은 122턴에 끝내며, 매 턴 약 104K 토큰 컨텍스트를 재처리해 총사용량이 2배로 불었다. ARC-AGI-3 공식 벤치비용도 같은 방향이다: Max 18,147 < High 19,285 < Low 23,457 — effort를 올릴수록 려 싸진다. 모델 선택은 moc-ai-models의 가격 추적선과 함께 본다.
한눈에 보는 요약
- 단가 vs 총량: Medium의 응답당 비용은 xHigh보다 34% 저렴. 그러나 턴 수가 2배라 총사용량은 Medium이 2배로 역전.
- 실측: xHigh 65턴 vs Medium 122턴, 턴마다 약 104K 토큰 대화 컨텍스트 재처리.
- 벤치비용(ARC-AGI-3 공식): Max가 가장 저렴하고 Low가 가장 비쌈. None(추론 없음)이 최고가($23,457) — 헤매는 게 제일 비싸다.
- 설계 근거: Astra는 agentic workflow에 적극 행동하도록 설계. 공식 가이드도 장시간 initiative·follow-through, 완료 전 광범위 테스트 성향을 명시.
- 운용 제안: Medium
Low급 일은 GPT-5.6 Sol에 토스, Astra는 복잡한 설계에만 xHighMax로 집중.
핵심 한 줄: 싼 머리를 오래 돌리는 게 제일 비싸다 — 무거운 머리를 짧게가 총량은 싸다.
세부 내용
왜 역전이 생기나
낮은 effort는 턴당 토큰은 적지만 끝맺음이 약하다. 같은 일을 두 배 턴으로 나누면, 매 턴 쌓인 컨텍스트를 다시 읽는 비용이 복리로 붙는다. 104K × 추가 57턴이 역전의 핵심이다. “응답당 비용”이 아니라 “작업당 총사용량”으로만 비교해야 한다는 것이 이 노트의 방법론적 요점이다.
벤치비용표 읽기
| Effort | 벤치비용 |
|---|---|
| Max | $17,332 |
| xHigh | $18,147 |
| High | $18,817 |
| Medium | $19,285 |
| Low | $21,298 |
| None | $23,457 |
None이 최고가라는 점이 함의가 크다: 추론을 안 시키는 게 아끼는 게 아니라, 못 끝내고 헤매는 비용이 더 크다. 2026-09-10-codex-astra-luna-agent-tree의 “작은 일은 트리 생략”과 함께 읽으면 기준이 선다 — 오케스트레이션은 생략해도 effort는 낮추지 말 것.
운용 제안의 타당성과 한계
제안(가벼운 일→Sol, 복잡한 일→Astra xHigh~Max)은 단일 Reddit 실측 + 단일 벤치표에 근거한다. Pro 20x 플랜의 주간 사용량 기준이므로 플랜·워크로드가 다르면 수치는 달라진다. 다만 방향성(역전 존재)은 공식 벤치비용과 정합하므로 채택 가치가 있다. 자신의 세션에서 턴 수·컨텍스트 재처리량을 실측해 임계점을 잡는 것이 다음 단계다.
실무 체크리스트
- 내 워크로드에서 effort별 턴 수·총 토큰 실측(최소 5작업)
- 가벼운 일의 Sol 토스 기준(복잡도 임계) 문서화
- 주간 사용량 대시보드에 effort 필드 추가 — 응답당이 아닌 작업당 집계
관련 노트
- 2026-09-10-codex-astra-luna-agent-tree — Astra 지휘·Luna 실행 분업의 오버헤드 관리
- 2026-09-10-deepseek-v4-1-flash-release — 1% 비용 모델의 대안축
- moc-ai-models — 모델·벤치·가격 MOC
- moc-productivity — 비용·생산성 운용 MOC