개요
Artificial Analysis의 Intelligence Index v4.1은 9개 평가를 종합한 인공지능 모델 성능 지수다. 아래 표는 2026-07-12 기준 화면 차트를 전사한 것으로, 점수 막대가 표시된 상위 50개 모델을 옮겼다. 화면에는 55개 모델이 선택돼 있으나 점수가 찍힌 50개만 정리했다.
9개 평가를 4개 카테고리(Agents 34% · Coding 24% · Scientific Reasoning 24% · General 18%)로 묶어 가중 평균한 0~100 점수다. 카테고리별 구성·개별 가중치·각 평가가 재는 능력은 아래 “지수 설명” 절에 정리했다.
이전 초안에 있던
gpt-oss-120b (high)(24점)는 현재 화면에서 점수 막대가 없어 아래 50개에서 제외했다. 선택된 55개 중 5개가 점수 막대 없이 표시된 것으로 보인다.
지수 설명
Intelligence Index는 9개 평가를 4개 카테고리로 묶어 가중 평균한 0~100 점수다. v4.1은 가중치를 에이전틱 작업 쪽으로 크게 옮겨, Agents 카테고리가 34%로 가장 큰 비중을 차지한다(이전 세대는 4개 카테고리가 대체로 균등했다).
카테고리 구성과 가중치 (v4.1)
| 카테고리 | 가중치 | 포함 평가 (개별 가중치) |
|---|---|---|
| Agents (에이전틱) | 34% | GDPval-AA v2 (20%) · τ³-Banking (14%) |
| Coding (코딩) | 24% | Terminal-Bench v2.1 (16%) · SciCode (8%) |
| Scientific Reasoning (과학추론) | 24% | Humanity’s Last Exam (12%) · GPQA Diamond (6%) · CritPt (6%) |
| General (일반) | 18% | AA-Omniscience 정확도 (8%) · 비환각률 (4%) · AA-LCR (6%) |
아래 “코딩 인덱스”·“에이전틱 인덱스” 표는 각각 Coding·Agents 카테고리의 하위 점수를 따로 뽑은 것이다. 종합 Intelligence Index는 이 4개 카테고리를 위 가중치로 합산한다. (개별 10개 가중치 합 = 100%: 20+16+14+12+8+8+6+6+6+4.)
9개 평가가 재는 것
| 평가 | 측정 대상 | 규모·채점 |
|---|---|---|
| GDPval-AA v2 | 44개 미국 직업의 경제적 가치가 있는 실무 산출물 | 220개 과제, 인간 전문가(Elo 1000 기준) 대비 Elo 채점 |
| τ³-Banking | 은행·핀테크 시나리오의 멀티턴 도구 연쇄 호출·지식 검색 | 97개 과제, 백엔드 DB 최종 상태 대조 pass@1 |
| Terminal-Bench v2.1 | 실제 터미널 환경의 SWE·시스템 관리 에이전트 과제 | 89개 과제, 테스트 통과 pass@1 |
| SciCode | 물리·수학 등 과학 계산 코드 작성 | 288개 하위 문제, 파이썬 단위테스트 통과 |
| Humanity’s Last Exam | 수학·인문·자연과학 대학원급 난제 | 2,158개 텍스트 문항 |
| GPQA Diamond | 생물·물리·화학 대학원급 과학 문제 | 198개 문항 |
| CritPt | 연구 수준 물리 문제(수치·기호·함수형 답) | 70개 문제 |
| AA-Omniscience | 광범위 지식 정확도 + 환각 억제 | 6,000개 문항 (정확도 8% + 비환각률 4%) |
| AA-LCR | 여러 문서 유형의 장문맥(long-context) 추론 | 100개 문항, LLM 동등성 채점 |
v4.1에서 바뀐 점
v4.1의 핵심은 “에이전틱 워크로드로의 이동”이다. 프론티어 모델을 더 잘 가르는 어렵고 현실적인 에이전트 시나리오로 평가를 갈아끼웠다.
- Terminal-Bench Hard → Terminal-Bench 2.1
- τ²-Bench Telecom → τ³-Bench Banking
- GDPval-AA → GDPval-AA v2 (Elo 재기준화, 에이전트 턴 한도 100→250으로 확장)
- IFBench 제거 — 포화(frontier 모델 간 변별력 소실)
채점 방식 메모
- 종합 점수는 0~100 스케일 가중 평균이며, 95% 신뢰구간은 약 ±1% 미만으로 보고된다.
- 온도(temperature): 비추론 모델 0, 추론 모델 0.6(모델 랩 권장값이 있으면 그 값).
- 최대 출력 토큰: 추론 모델은 제작사 공개값, 비추론 모델은 16,384.
- 세부 구성·실행 방식은 Intelligence Index methodology와 v4.1 개편 글에서 확인한다.
범례
- 사선 무늬 막대 — 추정치(독립 평가 예정)
- 전구 아이콘 — 추론 모델
- 동일 점수는 원본 차트의 표시 순서를 유지한다.
- 추정치(사선 막대) 항목은 Codex GPT-5.3 (xhigh)와 DeepSeek V4 Pro/Flash의 일부 변형 — 점수가 확정 전이다.
모델별 Intelligence Index
| 순번 | 모델 | 점수 |
|---|---|---|
| 1 | Claude Fable 5 (with fallback) | 60 |
| 2 | GPT-5.6 Sol (max) | 59 |
| 3 | GPT-5.6 Sol (xhigh) | 58 |
| 4 | GPT-5.6 Sol (high) | 56 |
| 5 | Claude Opus 4.8 (max) | 56 |
| 6 | GPT-5.6 Terra (max) | 55 |
| 7 | GPT-5.5 (xhigh) | 55 |
| 8 | Grok 4.5 (high) | 54 |
| 9 | GPT-5.6 Sol (medium) | 54 |
| 10 | Claude Sonnet 5 (max) | 53 |
| 11 | GPT-5.5 (high) | 53 |
| 12 | GPT-5.6 Terra (xhigh) | 52 |
| 13 | GPT-5.4 (xhigh) | 51 |
| 14 | GPT-5.6 Luna (max) | 51 |
| 15 | GLM-5.2 (max) | 51 |
| 16 | Muse Spark 1.1 (xhigh) | 51 |
| 17 | GPT-5.5 (medium) | 50 |
| 18 | Gemini 3.5 Flash | 50 |
| 19 | GPT-5.6 Sol (low) | 49 |
| 20 | GPT-5.6 Luna (xhigh) | 49 |
| 21 | GPT-5.6 Terra (high) | 49 |
| 22 | Gemini 3.1 Pro Preview | 46 |
| 23 | GPT-5.6 Luna (high) | 46 |
| 24 | Qwen3.7 Max | 46 |
| 25 | GPT-5.6 Terra (medium) | 46 |
| 26 | MiniMax-M3 | 44 |
| 27 | DeepSeek V4 Pro (max) | 44 |
| 28 | Codex GPT-5.3 (xhigh) | 44 |
| 29 | Kimi K2.6 | 44 |
| 30 | GPT-5.5 (low) | 43 |
| 31 | MiMo-V2.5-Pro | 42 |
| 32 | Claude Sonnet 5 (Non-reasoning) | 42 |
| 33 | GPT-5.6 Sol (Non-reasoning) | 41 |
| 34 | DeepSeek V4 Pro (high) | 41 |
| 35 | GPT-5.6 Terra (low) | 40 |
| 36 | DeepSeek V4 Flash (max) | 40 |
| 37 | GPT-5.6 Luna (medium) | 38 |
| 38 | Nemotron 3 Ultra | 38 |
| 39 | Grok 4.3 (high) | 38 |
| 40 | DeepSeek V4 Flash (high) | 37 |
| 41 | GLM-5.2 | 34 |
| 42 | GPT-5.6 Terra (Non-reasoning) | 34 |
| 43 | Qwen3.5 397B A17B | 34 |
| 44 | GPT-5.6 Luna (low) | 33 |
| 45 | DeepSeek V4 Pro | 31 |
| 46 | Mistral Medium 3.5 | 30 |
| 47 | Claude 4.5 Haiku | 30 |
| 48 | Gemma 4 31B | 29 |
| 49 | DeepSeek V4 Flash | 29 |
| 50 | GPT-5.6 Luna (Non-reasoning) | 27 |
코딩 인덱스 (Coding Index)
Intelligence Index의 Coding 카테고리(24%) 하위 점수다. Terminal-Bench v2.1(16%)과 SciCode(8%) 를 2:1로 가중 평균한 0~100 값으로, 아래 표는 화면에서 확인되는 45개 모델을 순서대로 정리했다(중복 항목 제거).
- Terminal-Bench v2.1 — 실제 터미널에서 SWE·시스템 관리 과제를 끝까지 수행하는 에이전트 능력(89개 과제, 테스트 통과 pass@1). 도구를 쓰는 “행동” 코딩에 가깝다.
- SciCode — 물리·수학 등 과학 계산 코드를 직접 작성해 단위테스트를 통과하는 능력(288개 하위 문제). 순수 코드 생성 정확도에 가깝다.
주의 — 이 “코딩 인덱스”는 별도의 “Coding Agent Index”가 아니다. 여기 코딩 인덱스는 Intelligence Index 안의 카테고리 점수로, 모델 자체를 평가한다. 반면 2026-06-14-artificial-analysis-deepswe-coding-agent-index가 다루는 Coding Agent Index는 DeepSWE·Terminal-Bench v2·SWE-Atlas-QnA(총 321개 과제)로 모델+하네스 조합의 실전 SWE 성능을 재는 별도 리더보드다. 두 지표를 혼동하지 말 것.
| 순위 | 모델 | 점수 |
|---|---|---|
| 1 | GPT-5.6 Sol (xhigh) | 78.3 |
| 2 | GPT-5.6 Sol (max) | 77.4 |
| 3 | GPT-5.6 Sol (high) | 77.2 |
| 4 | GPT-5.6 Terra (max) | 76.7 |
| 5 | Claude Fable 5 (with fallback) | 76.5 |
| 6 | GPT-5.6 Sol (medium) | 76.3 |
| 7 | GPT-5.5 (xhigh) | 74.9 |
| 8 | Claude Opus 4.8 (max) | 74.3 |
| 9 | Grok 4.5 (high) | 72.4 |
| 10 | GPT-5.5 (high) | 71.6 |
| 11 | Claude Sonnet 5 (max) | 71.5 |
| 12 | GPT-5.5 (medium) | 71.5 |
| 13 | GPT-5.6 Luna (max) | 71.4 |
| 14 | Muse Spark 1.1 (xhigh) | 71.3 |
| 15 | GPT-5.4 (xhigh) | 71.1 |
| 16 | GPT-5.6 Terra (xhigh) | 70.6 |
| 17 | Gemini 3.5 Flash | 70.1 |
| 18 | GPT-5.6 Sol (low) | 69.7 |
| 19 | Gemini 3.1 Pro Preview | 68.8 |
| 20 | GLM-5.2 (max) | 68.8 |
| 21 | GPT-5.6 Luna (xhigh) | 68.6 |
| 22 | GPT-5.6 Terra (high) | 67.1 |
| 23 | Claude Sonnet 5 (Non-reasoning) | 66.4 |
| 24 | Qwen3.7 Max | 66.0 |
| 25 | GPT-5.6 Sol (Non-reasoning) | 65.1 |
| 26 | GPT-5.6 Terra (medium) | 64.7 |
| 27 | GPT-5.6 Luna (high) | 63.3 |
| 28 | Kimi K2.6 | 61.8 |
| 29 | GPT-5.5 (low) | 60.9 |
| 30 | MiMo-V2.5-Pro | 60.2 |
| 31 | DeepSeek V4 Pro (max) | 59.4 |
| 32 | MiniMax-M3 | 58.6 |
| 33 | GPT-5.6 Terra (low) | 58.1 |
| 34 | DeepSeek V4 Flash (max) | 56.2 |
| 35 | GPT-5.6 Terra (Non-reasoning) | 52.3 |
| 36 | GPT-5.6 Luna (medium) | 50.7 |
| 37 | Nemotron 3 Ultra | 49.3 |
| 38 | Qwen3.5 397B A17B | 48.2 |
| 39 | Mistral Medium 3.5 | 46.9 |
| 40 | GLM-5.2 | 46.5 |
| 41 | GPT-5.6 Luna (low) | 44.2 |
| 42 | Claude 4.5 Haiku | 43.9 |
| 43 | Gemma 4 31B | 43.4 |
| 44 | Grok 4.3 (high) | 42.2 |
| 45 | GPT-5.6 Luna (Non-reasoning) | 39.3 |
에이전틱 인덱스 (Agentic Index)
Intelligence Index의 Agents 카테고리(34%) 하위 점수로, v4.1에서 가장 큰 비중을 가진 카테고리다. GDPval-AA v2(20%)와 τ³-Banking(14%) 를 가중 평균한 0~100 값이며, 아래 표는 화면에서 확인되는 45개 모델을 순서대로 정리했다.
- GDPval-AA v2 — 44개 미국 직업의 실제 업무 산출물을 만들어내는 능력(220개 과제). 인간 전문가 대비 Elo(1000 기준)로 채점하고, v4.1에서 턴 한도를 100→250으로 늘려 더 긴 에이전트 궤적을 허용한다.
- τ³-Banking — 은행·핀테크 시나리오에서 도구를 여러 번 호출하고 지식을 검색하는 멀티턴 대화 능력(97개 과제). 백엔드 DB 최종 상태로 성공을 판정(pass@1)한다.
에이전틱 비중이 큰 이유: v4.1은 “모델이 도구를 써서 긴 호흡의 실무를 끝까지 해내는가”를 지능의 핵심 축으로 본다. 그래서 종합 Intelligence Index에서도 Agents가 34%로 가장 크다.
| 순위 | 모델 | 점수 |
|---|---|---|
| 1 | GPT-5.6 Sol (max) | 54.0 |
| 2 | Claude Fable 5 (with fallback) | 52.8 |
| 3 | GPT-5.6 Sol (xhigh) | 51.8 |
| 4 | GPT-5.6 Sol (high) | 48.5 |
| 5 | GPT-5.6 Terra (max) | 47.4 |
| 6 | Claude Opus 4.8 (max) | 47.2 |
| 7 | Claude Sonnet 5 (max) | 46.7 |
| 8 | Grok 4.5 (high) | 45.7 |
| 9 | GPT-5.6 Luna (max) | 45.6 |
| 10 | GPT-5.5 (xhigh) | 44.9 |
| 11 | GPT-5.6 Terra (xhigh) | 44.7 |
| 12 | GPT-5.6 Sol (medium) | 44.5 |
| 13 | GPT-5.5 (high) | 43.5 |
| 14 | GLM-5.2 (max) | 43.1 |
| 15 | GPT-5.6 Luna (xhigh) | 42.9 |
| 16 | GPT-5.6 Terra (high) | 41.3 |
| 17 | GPT-5.4 (xhigh) | 41.1 |
| 18 | GPT-5.6 Luna (high) | 40.1 |
| 19 | GPT-5.6 Sol (low) | 40.0 |
| 20 | GPT-5.5 (medium) | 37.8 |
| 21 | Muse Spark 1.1 (xhigh) | 37.5 |
| 22 | Gemini 3.5 Flash | 37.4 |
| 23 | GPT-5.6 Terra (medium) | 37.0 |
| 24 | DeepSeek V4 Pro (max) | 36.4 |
| 25 | MiniMax-M3 | 35.4 |
| 26 | GPT-5.6 Sol (Non-reasoning) | 34.9 |
| 27 | GLM-5.2 | 34.8 |
| 28 | Claude Sonnet 5 (Non-reasoning) | 33.7 |
| 29 | DeepSeek V4 Flash (max) | 31.1 |
| 30 | GPT-5.6 Luna (medium) | 31.0 |
| 31 | GPT-5.6 Terra (low) | 30.6 |
| 32 | Qwen3.7 Max | 30.6 |
| 33 | GPT-5.5 (low) | 30.4 |
| 34 | Kimi K2.6 | 30.3 |
| 35 | GPT-5.6 Terra (Non-reasoning) | 29.3 |
| 36 | MiMo-V2.5-Pro | 29.1 |
| 37 | Nemotron 3 Ultra | 27.4 |
| 38 | GPT-5.6 Luna (low) | 25.4 |
| 39 | Grok 4.3 (high) | 24.1 |
| 40 | GPT-5.6 Luna (Non-reasoning) | 22.0 |
| 41 | Gemini 3.1 Pro Preview | 21.4 |
| 42 | Qwen3.5 397B A17B | 19.8 |
| 43 | Mistral Medium 3.5 | 19.0 |
| 44 | Claude 4.5 Haiku | 16.4 |
| 45 | Gemma 4 31B | 14.4 |
플래그십 모델 API 가격
최신 모델 — 토큰 100만 개당(per MTok) 가격, USD
OpenAI GPT-5.x
Long context 요금은 입력 토큰이 272K를 초과할 때 적용된다. Long: 입력·캐시 요금은 Short의 2배, 출력은 1.5배다. Cache writes(캐시 쓰기)는 입력 단가의 1.25배로, GPT-5.6 계열부터 별도 과금된다(이전 세대는
-).
| 모델 | Short: Input | Short: Cached input | Short: Cache writes | Short: Output | Long: Input | Long: Cached input | Long: Cache writes | Long: Output |
|---|---|---|---|---|---|---|---|---|
| gpt-5.6-sol | $5.00 | $0.50 | $6.25 | $30.00 | $10.00 | $1.00 | $12.50 | $45.00 |
| gpt-5.6-terra | $2.50 | $0.25 | $3.125 | $15.00 | $5.00 | $0.50 | $6.25 | $22.50 |
| gpt-5.6-luna | $1.00 | $0.10 | $1.25 | $6.00 | $2.00 | $0.20 | $2.50 | $9.00 |
| gpt-5.5 | $5.00 | $0.50 | - | $30.00 | $10.00 | $1.00 | - | $45.00 |
| gpt-5.5-pro | $30.00 | - | - | $180.00 | $60.00 | - | - | $270.00 |
| gpt-5.4 | $2.50 | $0.25 | - | $15.00 | $5.00 | $0.50 | - | $22.50 |
| gpt-5.4-mini | $0.75 | $0.075 | - | $4.50 | - | - | - | - |
| gpt-5.4-nano | $0.20 | $0.02 | - | $1.25 | - | - | - | - |
| gpt-5.4-pro | $30.00 | - | - | $180.00 | $60.00 | - | - | $270.00 |
가격 검증(2026-07-12): OpenAI 공식 API 문서(Pricing)와 전 행 일치. 출력 단가는 모든 GPT-5.6 티어에서 입력의 6배다.
Anthropic Claude
Claude는 272K 같은 long context 할증이 없다 — Fable 5·Opus 4.8·Sonnet 5는 1M 컨텍스트 전 구간을 표준 단가로 과금한다. Cache write는 5분(입력의 1.25배)·1시간(입력의 2배) 두 종류이고, cache read(hit)는 입력의 0.1배다. 인덱스 표의 effort 표기(max·xhigh 등)는 추론 강도일 뿐 토큰 단가는 동일하다.
| 모델 | Input | Cache write (5m) | Cache write (1h) | Cache read (hit) | Output |
|---|---|---|---|---|---|
| Claude Fable 5 | $10.00 | $12.50 | $20.00 | $1.00 | $50.00 |
| Claude Opus 4.8 | $5.00 | $6.25 | $10.00 | $0.50 | $25.00 |
| Claude Sonnet 5 | $2.00 | $2.50 | $4.00 | $0.20 | $10.00 |
| Claude Haiku 4.5 | $1.00 | $1.25 | $2.00 | $0.10 | $5.00 |
Claude Sonnet 5는 2026-08-31까지 도입가(10)이며, 9월 1일부터 표준가 15(cache write 5m 6, read 10/$50(연구 프리뷰), Batch API는 입력·출력 50% 할인. Fable 5는 이 인덱스 1위 모델이라 참고용으로 함께 넣었다. 가격 검증(2026-07-12): Anthropic 공식 문서(Pricing)와 전 행 일치.
xAI · Zhipu · DeepSeek
프로바이더마다 캐시 회계가 다르다. Grok·GLM은 표준 입력가와 캐시 읽기(cache read) 단가를, DeepSeek은 cache-miss(신규) 와 cache-hit(재사용) 입력가를 따로 매긴다. 아래 Input 열은 캐시되지 않은 표준 입력 기준(DeepSeek은 cache-miss)이다.
| 모델 | Input | Cached input | Output |
|---|---|---|---|
| Grok 4.5 | $2.00 | $0.50 | $6.00 |
| Grok 4.3 | $1.25 | - | $2.50 |
| GLM-5.2 | $1.40 | $0.26 | $4.40 |
| DeepSeek V4 Pro | $0.435 | $0.00363 | $0.87 |
| DeepSeek V4 Flash | $0.14 | $0.00280 | $0.28 |
Grok 4.5 캐시 입력은 표준가의 75% 할인(0.42/$1.32). DeepSeek의 Cached input은 cache-hit(재사용) 단가로 극단적으로 저렴하고, Input 열은 cache-miss(신규) 단가다. effort 표기(max 등)는 토큰 단가에 영향 없다. 가격 검증(2026-07-12): Grok=xAI 공식 Models, DeepSeek=공식 Pricing, GLM=Z.ai 1차 API 기준.
가성비 분석 — 작업당 비용(Cost per Task) 기준 역할별 라우팅
핵심: 가성비는 토큰 단가(per MTok)가 아니라 **작업당 비용(cost per task)**으로 판단해야 한다. 추론 모델은 답 하나에 수천~수만 토큰을 뿜고, 스텝 수·장문맥 회수율이 실제 청구액을 좌우하기 때문이다. Artificial Analysis는 각 평가의 입력·캐시·추론·출력 토큰을 모두 합산해 과제 수로 나눈 작업당 비용을 별도로 공개한다.
관점 1 — Intelligence Index 작업당 비용 (원천 지능 가성비)
“작업당 비용”은 AA가 9개 평가를 완주하는 데 든 실제 비용이고, 점수/$ = 지능 점수 ÷ 작업당 비용은 이 노트에서 계산한 파생 가성비 지표다(높을수록 우수).
| 모델 | 지능 | 작업당 비용 | 점수/$ (파생) | 메모 |
|---|---|---|---|---|
| DeepSeek V4 Pro (max) | 44 | $0.04 | ~1,100 | 압도적 저비용 · 중상위 지능 — 예산·자체호스팅의 정답 |
| GPT-5.6 Luna (max) | 51 | $0.21 | ~243 | 프론티어 근접 최고 가성비. GLM-5.2·Gemini 3.5 Flash와 지능 동급 이상인데 더 쌈 |
| GPT-5.6 Terra (max) | 55 | $0.55 | ~100 | 고지능·저비용 균형점 |
| GPT-5.5 (xhigh) | 55 | $0.99 | ~56 | 구세대지만 여전히 좋은 값 |
| GPT-5.6 Sol (max) | 59 | $1.04 | ~57 | 프론티어 2위를 Fable의 약 1/3 비용에 |
| Claude Opus 4.8 (max) | 56 | $1.78 | ~31 | 프론티어급, 중간 가성비 |
| Claude Fable 5 | 60 | $3.25 | ~18 | 지능 1위 · 가성비 최하 — “반드시 이겨야 할 때”만 |
- 파레토 프론티어(같은 비용에 최고 지능 / 같은 지능에 최저 비용): DeepSeek V4 Pro → Luna → Terra → Sol → Fable 순으로 비용이 오른다. 이 곡선 위에 없는 조합(같은 점수인데 더 비싼 것)은 값을 치를 이유가 약하다.
- Sol ≈ Fable, 1/3 값: Sol max는 59점으로 Fable(60점)에 1점 뒤지지만 작업당 비용은 약 1/3이다. 대부분의 실무에서 Sol이 합리적 상한.
- Luna·Terra가 경량·중국 모델을 값으로 압도: AA는 “Luna max가 GLM-5.2 max·Gemini 3.5 Flash와 지능이 같거나 앞서면서 더 싸다”고 명시한다. 즉 저가대에서도 GPT-5.6 계열이 파레토 프론티어를 잡고 있다.
관점 2 — 실전 에이전트 코딩 (DeepSWE 작업당 비용)
주의: 관점 1의 가성비 1위 Luna가 실전 코딩에선 1위가 아니다. Luna는 토큰 단가는 싸지만 스텝 수가 많고(DeepSWE 102스텝) 장문맥 회수율이 낮아(Nerova 41.3% vs Terra 89.6%·Sol 91.5%) 큰 코드베이스를 통째로 놓친다. 장기 코딩 궤적에서는 가성비가 역전된다.
| 등급/모델 | DeepSWE | 작업당 비용 | 포지션 |
|---|---|---|---|
| GPT-5.6 Sol Medium | 61 | $1.86 | 일상 코딩 가성비 최고 — 스텝 수도 적음 |
| GPT-5.6 Sol Extra High | 71 | $4.70 | 고난도 상한 — Terra max보다 점수↑·비용↓ |
| GPT-5.6 Terra max | 70 | $4.95 | 서브에이전트 경량 작업 (Luna 대신) |
| GPT-5.6 Luna max | 67 | $3.03 | 싸 보여도 102스텝·회수율↓로 실전 비효율 |
| Fable 5 Extra High | 70 | $13–22 | Sol xHigh와 동급 점수, 약 3배 비용(하네스별 21.63) |
관점 1(Intelligence Index)과 관점 2(DeepSWE)의 작업당 비용은 서로 다른 벤치마크·스케일이므로 숫자를 직접 비교하지 말 것. 관점 1은 “원천 지능당 값”, 관점 2는 “실전 코딩 1건당 값”이다.
역할별 추천 모델 (가성비 라우팅)
오케스트레이터 하나에 값싼 실행자 여럿을 붙이는 구조가 핵심이다(Codex config.toml 라우팅 실측 기준 토큰 ~50% 절감). 상위 등급은 계획·검토에만 잠깐 쓰고, 반복 실행은 중·저가 등급으로 내린다.
| 역할 | 1순위 (가성비) | 예산형 대안 | 근거 |
|---|---|---|---|
| 오케스트레이터 (Orchestrator) | GPT-5.6 Sol Extra High | Grok 4.5 High · Opus 4.8 (max) | 계획·위임 품질은 max와 1점 차(58 vs 59)인데 비용 ~1/3 |
| 계획·설계 (Plan) | GPT-5.6 Sol High | Grok 4.5 High | 강한 추론 필요, max는 과잉 |
| 빌더·구현 (Builder) | GPT-5.6 Sol Medium | Gemini 3.5 Flash · GLM-5.2 | 일상 코딩 61점/$1.86 · 스텝도 적음 |
| 실행자 (Task Execute) | GPT-5.6 Sol Medium | Terra High | 표준 편집·테스트·제한된 수정 |
| 코딩 (Coding) | 일상 Sol Medium / 고난도 Sol xHigh | Gemini 3.5 Flash · GLM-5.2 · Terra High | 난도로 등급 분리 |
| 문서 작성 (Doc Write) | GPT-5.6 Luna · Gemini 3.5 Flash | Claude Haiku 4.5 · GLM-5.2 | 추론 부담 적음 → 최저가가 정답 |
| 탐색·검색 (Fast Scan, read-only) | Terra High | DeepSeek V4 Flash · Gemini 3.5 Flash | 빠르고 싸게 코드베이스 훑기 |
| 예산·자체호스팅 (Budget/Self-host) | DeepSeek V4 Pro/Flash | GLM-5.2 · Kimi K2.6 | 트래픽 60~80%를 저가로, 어려운 20%만 프론티어로 승격 |
서브에이전트에서 피할 것: Luna(장문맥 회수율↓ — 대형 코드베이스 누락), Ultra/max(재귀 스폰·3배 비용에 겨우 1점 차), Low(품질 급락). 서브에이전트 기본값은 Sol Medium(실행)·Terra High(탐색).
코딩 작업 예시 — “결제 API에 지수 백오프 재시도 + 멱등성 키 추가”
한 작업을 역할별로 쪼개 각 단계에 맞는 등급을 배정한 흐름이다. 상위 등급(1·3·6단계)만 잠깐 쓰고 나머지는 중·저가로 내린다.
| # | 단계 | 담당 역할 / 모델 | 하는 일 |
|---|---|---|---|
| 1 | 분해·위임 | 오케스트레이터 · Sol xHigh | 작업을 4개 서브태스크로 나누고 의존성·순서 결정 |
| 2 | 탐색 | Fast Scan · Terra High (read-only) | 기존 결제 클라이언트·HTTP 래퍼·설정 파일 위치 파악 |
| 3 | 설계 | Plan · Sol High | 재시도 정책(최대 5회·지수 백오프+지터), 멱등성 키 전략, 회로차단 여부 결정 |
| 4 | 구현 | Builder · Sol Medium | retry 미들웨어 작성, 멱등성 키 생성·헤더 전달, 단위테스트 작성 |
| 5 | 문서화 | Doc Write · Luna / Gemini 3.5 Flash | 변경 요약, PR 설명, README 재시도 정책 절 갱신, 주석 |
| 6 | 검토 | Reviewer · Sol xHigh (또는 Opus 4.8) | 중복 결제·경쟁 조건·테스트 커버리지 최종 점검 |
비용 효과: 6단계를 전부 Fable 5로 돌리면 매 단계가 최고가다. 위처럼 라우팅하면 고비용 등급은 계획·설계·검토(3개 단계)에만 쓰이고 구현·문서·탐색은 중·저가로 처리된다 — Codex 실측 기준 품질을 유지하면서 토큰 ~50% 절감. 규모가 크면 4·5단계를 GLM-5.2·DeepSeek V4로 더 내려 추가 절감할 수 있다.
가성비 데이터 출처(2026-07-12 확인): Intelligence Index 작업당 비용은 Artificial Analysis v4.1 개편 글과 AA X 포스트(Sol max 0.55·Luna max 0.04·Opus 4.8 3.25). DeepSWE 작업당 비용은 2026-07-12-gpt-5-6-sol-medium-daily-tier-deepswe·2026-07-12-codex-pro-plan-config-toml-subagent-routing(confidence 각각 low·medium). “점수/$“는 이 노트에서 계산한 파생 지표이므로 순위 참고용이다.
관련 노트
- raw source:
web-2026-07-12-artificial-analysis-gpt-5-6-sol-luna-terra-intelligence-vs-cost— 원본 X 포스트: 같은 Artificial Analysis 데이터의 ‘Intelligence vs Cost per Task’ 차트 — GPT-5.6 Sol·Luna가 파레토 프론티어 전 구간에서 Terra를 앞서고, Luna가 특히 비용 효율적이라는 분석 - raw source:
web-2026-07-12-sebastian-raschka-grok-4-5-muse-spark-intelligence-vs-cost— 후속 X 포스트: Sebastian Raschka가 같은 ‘Intelligence vs Cost’ 차트에 이 표의 Grok 4.5 (high)(54점)와 Muse Spark 1.1 (xhigh)(51점)를 추가한 업데이트 버전 — Grok 4.5가 파레토 프론티어에 놓인 가성비 모델이라는 평(하네스 정보 포함) - moc-ai-models — 이 노트를 등록한 모델·벤치마크 이정표
- 2026-06-14-artificial-analysis-deepswe-coding-agent-index — 자매 노트: Artificial Analysis Coding Agent Index 개편(SWE-Bench Pro→DeepSWE), Fable 5가 1위로 데뷔
- 2026-07-12-gpt-5-6-sol-medium-daily-tier-deepswe — 이 표의 GPT-5.6 Sol (medium)(9위·54점)을 DeepSWE 기준으로 실전 활용한 등급 가이드: 일상은 Sol Medium, 고난도만 Sol Extra High
- 2026-07-12-codex-pro-plan-config-toml-subagent-routing — 응용: 이 지수를 근거로 Codex 서브에이전트 모델을 config.toml로 라우팅(Sol xHigh/Medium·Terra High)해 Pro 플랜 토큰 ~50% 절감하는 실무 팁
- 2026-06-26-openrouter-list-benchmarks-api-reference — OpenRouter 벤치마크 API가
intelligence_indexcomposite score(AA Intelligence Index)를 노출 - 2026-06-19-ai-frontier-ep100-mythos-fable5 — 차트 정상 claude-fable-5(1위·60점)와 Claude Mythos를 다룬 AI 프론티어 EP100
- 2026-06-14-new-coding-models-glm-kimi-fable-opus-gpt — 본 인덱스 상위권과 겹치는 신규 코딩 모델 비교(GLM-5.2·Kimi vs Fable 5·Opus 4.8·GPT-5.5)
- moc-chinese-llm-models — DeepSeek V4·GLM-5.2·Qwen3.x·Kimi K2.6·MiniMax 등 스냅샷에 다수 포함된 중국계 모델 비교
- 엔티티: claude-fable-5 · deepseek-v4 · glm-5.2 · kimi-k2 · nemotron · qwen · codex · anthropic