출처: @yulmu_coffee (2026-09-10) — alexgetmancom의 Reddit 실측 인용 + ARC-AGI-3 공식 벤치비용표

개요

응답 1회당 단가가 싼 쪽이 총사용량도 싸다는 직관이 깨졌다. 율무커피가 정리한 Reddit 실측에 따르면 Astra xHigh는 65턴으로 끝낼 일을 Medium은 122턴에 끝내며, 매 턴 약 104K 토큰 컨텍스트를 재처리해 총사용량이 2배로 불었다. ARC-AGI-3 공식 벤치비용도 같은 방향이다: Max 18,147 < High 19,285 < Low 23,457 — effort를 올릴수록 려 싸진다. 모델 선택은 moc-ai-models의 가격 추적선과 함께 본다.

한눈에 보는 요약

  • 단가 vs 총량: Medium의 응답당 비용은 xHigh보다 34% 저렴. 그러나 턴 수가 2배라 총사용량은 Medium이 2배로 역전.
  • 실측: xHigh 65턴 vs Medium 122턴, 턴마다 약 104K 토큰 대화 컨텍스트 재처리.
  • 벤치비용(ARC-AGI-3 공식): Max가 가장 저렴하고 Low가 가장 비쌈. None(추론 없음)이 최고가($23,457) — 헤매는 게 제일 비싸다.
  • 설계 근거: Astra는 agentic workflow에 적극 행동하도록 설계. 공식 가이드도 장시간 initiative·follow-through, 완료 전 광범위 테스트 성향을 명시.
  • 운용 제안: MediumLow급 일은 GPT-5.6 Sol에 토스, Astra는 복잡한 설계에만 xHighMax로 집중.

핵심 한 줄: 싼 머리를 오래 돌리는 게 제일 비싸다 — 무거운 머리를 짧게가 총량은 싸다.

세부 내용

왜 역전이 생기나

낮은 effort는 턴당 토큰은 적지만 끝맺음이 약하다. 같은 일을 두 배 턴으로 나누면, 매 턴 쌓인 컨텍스트를 다시 읽는 비용이 복리로 붙는다. 104K × 추가 57턴이 역전의 핵심이다. “응답당 비용”이 아니라 “작업당 총사용량”으로만 비교해야 한다는 것이 이 노트의 방법론적 요점이다.

벤치비용표 읽기

Effort벤치비용
Max$17,332
xHigh$18,147
High$18,817
Medium$19,285
Low$21,298
None$23,457

None이 최고가라는 점이 함의가 크다: 추론을 안 시키는 게 아끼는 게 아니라, 못 끝내고 헤매는 비용이 더 크다. 2026-09-10-codex-astra-luna-agent-tree의 “작은 일은 트리 생략”과 함께 읽으면 기준이 선다 — 오케스트레이션은 생략해도 effort는 낮추지 말 것.

운용 제안의 타당성과 한계

제안(가벼운 일→Sol, 복잡한 일→Astra xHigh~Max)은 단일 Reddit 실측 + 단일 벤치표에 근거한다. Pro 20x 플랜의 주간 사용량 기준이므로 플랜·워크로드가 다르면 수치는 달라진다. 다만 방향성(역전 존재)은 공식 벤치비용과 정합하므로 채택 가치가 있다. 자신의 세션에서 턴 수·컨텍스트 재처리량을 실측해 임계점을 잡는 것이 다음 단계다.

실무 체크리스트

  • 내 워크로드에서 effort별 턴 수·총 토큰 실측(최소 5작업)
  • 가벼운 일의 Sol 토스 기준(복잡도 임계) 문서화
  • 주간 사용량 대시보드에 effort 필드 추가 — 응답당이 아닌 작업당 집계

관련 노트