문제 — 서브에이전트가 부모 모델을 그대로 상속

Codex의 spawn_agent 도구는 자식 에이전트에 별도 모델·추론 강도를 지정할 수 없다. 부모 설정을 그대로 복사하기 때문에, 메인 에이전트를 GPT-5.6 Sol Ultra로 두면 생성되는 모든 서브에이전트도 Sol Ultra로 돈다. 한 작업에 서브에이전트 3개가 붙으면 Sol Ultra 인스턴스 3개가 동시에 최고 속도로 할당량을 태운다 — 5x·20x Pro 플랜이 빠르게 소진되는 원인이다.

해결 — config.toml로 오케스트레이터/실행자 역할 분리

계획·아키텍처·위임 판단을 하는 오케스트레이터 모델 하나와, 그 계획을 실행하는 값싸고 빠른 실행자(executor) 모델들을 나눈다. Codex는 config.toml + 커스텀 에이전트 정의(~/.codex/agents/)로 이 구조를 이미 지원한다. 역할별 에이전트를 정의하고 라우팅 정책을 넣으면, 이후 작업 제출 방식은 그대로 두고 Codex가 자동으로 라우팅한다. 저자는 이 조합으로 토큰 사용량을 약 50% 줄였다고 한다.

권장 구성:

역할모델 / 추론 강도용도
루트 오케스트레이터Sol Extra High계획·아키텍처·위임 판단
routine_workerSol Medium일반 코딩·테스트·문서·제한된 수정
deep_workerSol High어려운 디버깅·아키텍처·보안·모호한 다단계 작업
fast_scanTerra High (read-only)빠른 검색·코드베이스 탐색·경량 분석

서브에이전트에서는 Luna·Low·Ultra를 피한다. max_threads = 6, max_depth = 1[agents]에 설정한다. 프롬프트에 “Sol만 사용” 또는 “서브에이전트 사용 안 함”을 넣으면 라우팅을 우회할 수 있다.

근거 — 이번 주 벤치마크 두 건 기반

GPT-5.6은 모델 3종(Sol·Terra·Luna) × 추론 6단계 = 18조합이지만 대부분 서브에이전트 용도로는 부적합하다. 저자는 2026-07-12-artificial-analysis-intelligence-index(종합 지능 지수)와 2026-06-14-artificial-analysis-deepswe-coding-agent-index(DeepSWE 코딩 에이전트 지수) 두 보고서를 근거로 4개 변형만 골랐다.

  • Ultra를 피하는 이유: Ultra는 한 에이전트 안에서 병렬 서브-서브에이전트 4개를 띄워 더 비싸다. Terminal-Bench에서 Sol Ultra 91.9% vs Sol 88.8% — 약 3배 비용으로 3.1점 차이. 이미 서브에이전트인 곳에 Ultra를 쓰면 재귀 스폰이 발생해 Codex 문서도 금지한다.
  • 오케스트레이터에 Max/Ultra 대신 Extra High: Intelligence Index에서 Sol max 59점 vs Sol xHigh 58점 — 1점 차이에 비용은 약 3배. 계획 품질은 사실상 동일하다.
  • 일상 작업에 Sol Medium: Agents’ Last Exam(55개 전문 분야 장기 워크플로)에서 Sol Medium이 claude-fable-5를 11.4점 앞서며 비용은 약 1/4. Codex 팀도 daily driver로 Sol Medium을 권장.
  • 경량 작업에 Luna 대신 Terra High: Luna는 토큰 단가가 싸지만(6 vs Terra 15) 스텝이 많다. DeepSWE v1.1(2026-07-09): Terra max 70%·3.03·102스텝. Luna는 긴 입력 회수(Nerova) 41.3%로 대형 코드베이스를 놓친다(Terra 89.6%, Sol 91.5%). Terra max는 Fable 5와 같은 DeepSWE 70%를 1/4 비용(21.63)에 낸다.

관련 노트