개요

Artificial Analysis의 Intelligence Index v4.1은 9개 평가를 종합한 인공지능 모델 성능 지수다. 아래 표는 2026-07-12 기준 화면 차트를 전사한 것으로, 점수 막대가 표시된 상위 50개 모델을 옮겼다. 화면에는 55개 모델이 선택돼 있으나 점수가 찍힌 50개만 정리했다.

9개 평가를 4개 카테고리(Agents 34% · Coding 24% · Scientific Reasoning 24% · General 18%)로 묶어 가중 평균한 0~100 점수다. 카테고리별 구성·개별 가중치·각 평가가 재는 능력은 아래 “지수 설명” 절에 정리했다.

이전 초안에 있던 gpt-oss-120b (high)(24점)는 현재 화면에서 점수 막대가 없어 아래 50개에서 제외했다. 선택된 55개 중 5개가 점수 막대 없이 표시된 것으로 보인다.

지수 설명

Intelligence Index는 9개 평가를 4개 카테고리로 묶어 가중 평균한 0~100 점수다. v4.1은 가중치를 에이전틱 작업 쪽으로 크게 옮겨, Agents 카테고리가 34%로 가장 큰 비중을 차지한다(이전 세대는 4개 카테고리가 대체로 균등했다).

카테고리 구성과 가중치 (v4.1)

카테고리가중치포함 평가 (개별 가중치)
Agents (에이전틱)34%GDPval-AA v2 (20%) · τ³-Banking (14%)
Coding (코딩)24%Terminal-Bench v2.1 (16%) · SciCode (8%)
Scientific Reasoning (과학추론)24%Humanity’s Last Exam (12%) · GPQA Diamond (6%) · CritPt (6%)
General (일반)18%AA-Omniscience 정확도 (8%) · 비환각률 (4%) · AA-LCR (6%)

아래 “코딩 인덱스”·“에이전틱 인덱스” 표는 각각 Coding·Agents 카테고리의 하위 점수를 따로 뽑은 것이다. 종합 Intelligence Index는 이 4개 카테고리를 위 가중치로 합산한다. (개별 10개 가중치 합 = 100%: 20+16+14+12+8+8+6+6+6+4.)

9개 평가가 재는 것

평가측정 대상규모·채점
GDPval-AA v244개 미국 직업의 경제적 가치가 있는 실무 산출물220개 과제, 인간 전문가(Elo 1000 기준) 대비 Elo 채점
τ³-Banking은행·핀테크 시나리오의 멀티턴 도구 연쇄 호출·지식 검색97개 과제, 백엔드 DB 최종 상태 대조 pass@1
Terminal-Bench v2.1실제 터미널 환경의 SWE·시스템 관리 에이전트 과제89개 과제, 테스트 통과 pass@1
SciCode물리·수학 등 과학 계산 코드 작성288개 하위 문제, 파이썬 단위테스트 통과
Humanity’s Last Exam수학·인문·자연과학 대학원급 난제2,158개 텍스트 문항
GPQA Diamond생물·물리·화학 대학원급 과학 문제198개 문항
CritPt연구 수준 물리 문제(수치·기호·함수형 답)70개 문제
AA-Omniscience광범위 지식 정확도 + 환각 억제6,000개 문항 (정확도 8% + 비환각률 4%)
AA-LCR여러 문서 유형의 장문맥(long-context) 추론100개 문항, LLM 동등성 채점

v4.1에서 바뀐 점

v4.1의 핵심은 “에이전틱 워크로드로의 이동”이다. 프론티어 모델을 더 잘 가르는 어렵고 현실적인 에이전트 시나리오로 평가를 갈아끼웠다.

  • Terminal-Bench Hard → Terminal-Bench 2.1
  • τ²-Bench Telecom → τ³-Bench Banking
  • GDPval-AA → GDPval-AA v2 (Elo 재기준화, 에이전트 턴 한도 100→250으로 확장)
  • IFBench 제거 — 포화(frontier 모델 간 변별력 소실)

채점 방식 메모

  • 종합 점수는 0~100 스케일 가중 평균이며, 95% 신뢰구간은 약 ±1% 미만으로 보고된다.
  • 온도(temperature): 비추론 모델 0, 추론 모델 0.6(모델 랩 권장값이 있으면 그 값).
  • 최대 출력 토큰: 추론 모델은 제작사 공개값, 비추론 모델은 16,384.
  • 세부 구성·실행 방식은 Intelligence Index methodologyv4.1 개편 글에서 확인한다.

범례

  • 사선 무늬 막대 — 추정치(독립 평가 예정)
  • 전구 아이콘 — 추론 모델
  • 동일 점수는 원본 차트의 표시 순서를 유지한다.
  • 추정치(사선 막대) 항목은 Codex GPT-5.3 (xhigh)와 DeepSeek V4 Pro/Flash의 일부 변형 — 점수가 확정 전이다.

모델별 Intelligence Index

순번모델점수
1Claude Fable 5 (with fallback)60
2GPT-5.6 Sol (max)59
3GPT-5.6 Sol (xhigh)58
4GPT-5.6 Sol (high)56
5Claude Opus 4.8 (max)56
6GPT-5.6 Terra (max)55
7GPT-5.5 (xhigh)55
8Grok 4.5 (high)54
9GPT-5.6 Sol (medium)54
10Claude Sonnet 5 (max)53
11GPT-5.5 (high)53
12GPT-5.6 Terra (xhigh)52
13GPT-5.4 (xhigh)51
14GPT-5.6 Luna (max)51
15GLM-5.2 (max)51
16Muse Spark 1.1 (xhigh)51
17GPT-5.5 (medium)50
18Gemini 3.5 Flash50
19GPT-5.6 Sol (low)49
20GPT-5.6 Luna (xhigh)49
21GPT-5.6 Terra (high)49
22Gemini 3.1 Pro Preview46
23GPT-5.6 Luna (high)46
24Qwen3.7 Max46
25GPT-5.6 Terra (medium)46
26MiniMax-M344
27DeepSeek V4 Pro (max)44
28Codex GPT-5.3 (xhigh)44
29Kimi K2.644
30GPT-5.5 (low)43
31MiMo-V2.5-Pro42
32Claude Sonnet 5 (Non-reasoning)42
33GPT-5.6 Sol (Non-reasoning)41
34DeepSeek V4 Pro (high)41
35GPT-5.6 Terra (low)40
36DeepSeek V4 Flash (max)40
37GPT-5.6 Luna (medium)38
38Nemotron 3 Ultra38
39Grok 4.3 (high)38
40DeepSeek V4 Flash (high)37
41GLM-5.234
42GPT-5.6 Terra (Non-reasoning)34
43Qwen3.5 397B A17B34
44GPT-5.6 Luna (low)33
45DeepSeek V4 Pro31
46Mistral Medium 3.530
47Claude 4.5 Haiku30
48Gemma 4 31B29
49DeepSeek V4 Flash29
50GPT-5.6 Luna (Non-reasoning)27

코딩 인덱스 (Coding Index)

Intelligence Index의 Coding 카테고리(24%) 하위 점수다. Terminal-Bench v2.1(16%)과 SciCode(8%) 를 2:1로 가중 평균한 0~100 값으로, 아래 표는 화면에서 확인되는 45개 모델을 순서대로 정리했다(중복 항목 제거).

  • Terminal-Bench v2.1 — 실제 터미널에서 SWE·시스템 관리 과제를 끝까지 수행하는 에이전트 능력(89개 과제, 테스트 통과 pass@1). 도구를 쓰는 “행동” 코딩에 가깝다.
  • SciCode — 물리·수학 등 과학 계산 코드를 직접 작성해 단위테스트를 통과하는 능력(288개 하위 문제). 순수 코드 생성 정확도에 가깝다.

주의 — 이 “코딩 인덱스”는 별도의 “Coding Agent Index”가 아니다. 여기 코딩 인덱스는 Intelligence Index 안의 카테고리 점수로, 모델 자체를 평가한다. 반면 2026-06-14-artificial-analysis-deepswe-coding-agent-index가 다루는 Coding Agent Index는 DeepSWE·Terminal-Bench v2·SWE-Atlas-QnA(총 321개 과제)로 모델+하네스 조합의 실전 SWE 성능을 재는 별도 리더보드다. 두 지표를 혼동하지 말 것.

순위모델점수
1GPT-5.6 Sol (xhigh)78.3
2GPT-5.6 Sol (max)77.4
3GPT-5.6 Sol (high)77.2
4GPT-5.6 Terra (max)76.7
5Claude Fable 5 (with fallback)76.5
6GPT-5.6 Sol (medium)76.3
7GPT-5.5 (xhigh)74.9
8Claude Opus 4.8 (max)74.3
9Grok 4.5 (high)72.4
10GPT-5.5 (high)71.6
11Claude Sonnet 5 (max)71.5
12GPT-5.5 (medium)71.5
13GPT-5.6 Luna (max)71.4
14Muse Spark 1.1 (xhigh)71.3
15GPT-5.4 (xhigh)71.1
16GPT-5.6 Terra (xhigh)70.6
17Gemini 3.5 Flash70.1
18GPT-5.6 Sol (low)69.7
19Gemini 3.1 Pro Preview68.8
20GLM-5.2 (max)68.8
21GPT-5.6 Luna (xhigh)68.6
22GPT-5.6 Terra (high)67.1
23Claude Sonnet 5 (Non-reasoning)66.4
24Qwen3.7 Max66.0
25GPT-5.6 Sol (Non-reasoning)65.1
26GPT-5.6 Terra (medium)64.7
27GPT-5.6 Luna (high)63.3
28Kimi K2.661.8
29GPT-5.5 (low)60.9
30MiMo-V2.5-Pro60.2
31DeepSeek V4 Pro (max)59.4
32MiniMax-M358.6
33GPT-5.6 Terra (low)58.1
34DeepSeek V4 Flash (max)56.2
35GPT-5.6 Terra (Non-reasoning)52.3
36GPT-5.6 Luna (medium)50.7
37Nemotron 3 Ultra49.3
38Qwen3.5 397B A17B48.2
39Mistral Medium 3.546.9
40GLM-5.246.5
41GPT-5.6 Luna (low)44.2
42Claude 4.5 Haiku43.9
43Gemma 4 31B43.4
44Grok 4.3 (high)42.2
45GPT-5.6 Luna (Non-reasoning)39.3

에이전틱 인덱스 (Agentic Index)

Intelligence Index의 Agents 카테고리(34%) 하위 점수로, v4.1에서 가장 큰 비중을 가진 카테고리다. GDPval-AA v2(20%)와 τ³-Banking(14%) 를 가중 평균한 0~100 값이며, 아래 표는 화면에서 확인되는 45개 모델을 순서대로 정리했다.

  • GDPval-AA v2 — 44개 미국 직업의 실제 업무 산출물을 만들어내는 능력(220개 과제). 인간 전문가 대비 Elo(1000 기준)로 채점하고, v4.1에서 턴 한도를 100→250으로 늘려 더 긴 에이전트 궤적을 허용한다.
  • τ³-Banking — 은행·핀테크 시나리오에서 도구를 여러 번 호출하고 지식을 검색하는 멀티턴 대화 능력(97개 과제). 백엔드 DB 최종 상태로 성공을 판정(pass@1)한다.

에이전틱 비중이 큰 이유: v4.1은 “모델이 도구를 써서 긴 호흡의 실무를 끝까지 해내는가”를 지능의 핵심 축으로 본다. 그래서 종합 Intelligence Index에서도 Agents가 34%로 가장 크다.

순위모델점수
1GPT-5.6 Sol (max)54.0
2Claude Fable 5 (with fallback)52.8
3GPT-5.6 Sol (xhigh)51.8
4GPT-5.6 Sol (high)48.5
5GPT-5.6 Terra (max)47.4
6Claude Opus 4.8 (max)47.2
7Claude Sonnet 5 (max)46.7
8Grok 4.5 (high)45.7
9GPT-5.6 Luna (max)45.6
10GPT-5.5 (xhigh)44.9
11GPT-5.6 Terra (xhigh)44.7
12GPT-5.6 Sol (medium)44.5
13GPT-5.5 (high)43.5
14GLM-5.2 (max)43.1
15GPT-5.6 Luna (xhigh)42.9
16GPT-5.6 Terra (high)41.3
17GPT-5.4 (xhigh)41.1
18GPT-5.6 Luna (high)40.1
19GPT-5.6 Sol (low)40.0
20GPT-5.5 (medium)37.8
21Muse Spark 1.1 (xhigh)37.5
22Gemini 3.5 Flash37.4
23GPT-5.6 Terra (medium)37.0
24DeepSeek V4 Pro (max)36.4
25MiniMax-M335.4
26GPT-5.6 Sol (Non-reasoning)34.9
27GLM-5.234.8
28Claude Sonnet 5 (Non-reasoning)33.7
29DeepSeek V4 Flash (max)31.1
30GPT-5.6 Luna (medium)31.0
31GPT-5.6 Terra (low)30.6
32Qwen3.7 Max30.6
33GPT-5.5 (low)30.4
34Kimi K2.630.3
35GPT-5.6 Terra (Non-reasoning)29.3
36MiMo-V2.5-Pro29.1
37Nemotron 3 Ultra27.4
38GPT-5.6 Luna (low)25.4
39Grok 4.3 (high)24.1
40GPT-5.6 Luna (Non-reasoning)22.0
41Gemini 3.1 Pro Preview21.4
42Qwen3.5 397B A17B19.8
43Mistral Medium 3.519.0
44Claude 4.5 Haiku16.4
45Gemma 4 31B14.4

플래그십 모델 API 가격

최신 모델 — 토큰 100만 개당(per MTok) 가격, USD

OpenAI GPT-5.x

Long context 요금은 입력 토큰이 272K를 초과할 때 적용된다. Long: 입력·캐시 요금은 Short의 2배, 출력은 1.5배다. Cache writes(캐시 쓰기)는 입력 단가의 1.25배로, GPT-5.6 계열부터 별도 과금된다(이전 세대는 -).

모델Short: InputShort: Cached inputShort: Cache writesShort: OutputLong: InputLong: Cached inputLong: Cache writesLong: Output
gpt-5.6-sol$5.00$0.50$6.25$30.00$10.00$1.00$12.50$45.00
gpt-5.6-terra$2.50$0.25$3.125$15.00$5.00$0.50$6.25$22.50
gpt-5.6-luna$1.00$0.10$1.25$6.00$2.00$0.20$2.50$9.00
gpt-5.5$5.00$0.50-$30.00$10.00$1.00-$45.00
gpt-5.5-pro$30.00--$180.00$60.00--$270.00
gpt-5.4$2.50$0.25-$15.00$5.00$0.50-$22.50
gpt-5.4-mini$0.75$0.075-$4.50----
gpt-5.4-nano$0.20$0.02-$1.25----
gpt-5.4-pro$30.00--$180.00$60.00--$270.00

가격 검증(2026-07-12): OpenAI 공식 API 문서(Pricing)와 전 행 일치. 출력 단가는 모든 GPT-5.6 티어에서 입력의 6배다.

Anthropic Claude

Claude는 272K 같은 long context 할증이 없다 — Fable 5·Opus 4.8·Sonnet 5는 1M 컨텍스트 전 구간을 표준 단가로 과금한다. Cache write는 5분(입력의 1.25배)·1시간(입력의 2배) 두 종류이고, cache read(hit)는 입력의 0.1배다. 인덱스 표의 effort 표기(max·xhigh 등)는 추론 강도일 뿐 토큰 단가는 동일하다.

모델InputCache write (5m)Cache write (1h)Cache read (hit)Output
Claude Fable 5$10.00$12.50$20.00$1.00$50.00
Claude Opus 4.8$5.00$6.25$10.00$0.50$25.00
Claude Sonnet 5$2.00$2.50$4.00$0.20$10.00
Claude Haiku 4.5$1.00$1.25$2.00$0.10$5.00

Claude Sonnet 5는 2026-08-31까지 도입가(10)이며, 9월 1일부터 표준가 15(cache write 5m 6, read 10/$50(연구 프리뷰), Batch API는 입력·출력 50% 할인. Fable 5는 이 인덱스 1위 모델이라 참고용으로 함께 넣었다. 가격 검증(2026-07-12): Anthropic 공식 문서(Pricing)와 전 행 일치.

xAI · Zhipu · DeepSeek

프로바이더마다 캐시 회계가 다르다. Grok·GLM은 표준 입력가와 캐시 읽기(cache read) 단가를, DeepSeek은 cache-miss(신규)cache-hit(재사용) 입력가를 따로 매긴다. 아래 Input 열은 캐시되지 않은 표준 입력 기준(DeepSeek은 cache-miss)이다.

모델InputCached inputOutput
Grok 4.5$2.00$0.50$6.00
Grok 4.3$1.25-$2.50
GLM-5.2$1.40$0.26$4.40
DeepSeek V4 Pro$0.435$0.00363$0.87
DeepSeek V4 Flash$0.14$0.00280$0.28

Grok 4.5 캐시 입력은 표준가의 75% 할인(0.42/$1.32). DeepSeek의 Cached input은 cache-hit(재사용) 단가로 극단적으로 저렴하고, Input 열은 cache-miss(신규) 단가다. effort 표기(max 등)는 토큰 단가에 영향 없다. 가격 검증(2026-07-12): Grok=xAI 공식 Models, DeepSeek=공식 Pricing, GLM=Z.ai 1차 API 기준.

가성비 분석 — 작업당 비용(Cost per Task) 기준 역할별 라우팅

핵심: 가성비는 토큰 단가(per MTok)가 아니라 **작업당 비용(cost per task)**으로 판단해야 한다. 추론 모델은 답 하나에 수천~수만 토큰을 뿜고, 스텝 수·장문맥 회수율이 실제 청구액을 좌우하기 때문이다. Artificial Analysis는 각 평가의 입력·캐시·추론·출력 토큰을 모두 합산해 과제 수로 나눈 작업당 비용을 별도로 공개한다.

관점 1 — Intelligence Index 작업당 비용 (원천 지능 가성비)

“작업당 비용”은 AA가 9개 평가를 완주하는 데 든 실제 비용이고, 점수/$ = 지능 점수 ÷ 작업당 비용은 이 노트에서 계산한 파생 가성비 지표다(높을수록 우수).

모델지능작업당 비용점수/$ (파생)메모
DeepSeek V4 Pro (max)44$0.04~1,100압도적 저비용 · 중상위 지능 — 예산·자체호스팅의 정답
GPT-5.6 Luna (max)51$0.21~243프론티어 근접 최고 가성비. GLM-5.2·Gemini 3.5 Flash와 지능 동급 이상인데 더 쌈
GPT-5.6 Terra (max)55$0.55~100고지능·저비용 균형점
GPT-5.5 (xhigh)55$0.99~56구세대지만 여전히 좋은 값
GPT-5.6 Sol (max)59$1.04~57프론티어 2위를 Fable의 약 1/3 비용
Claude Opus 4.8 (max)56$1.78~31프론티어급, 중간 가성비
Claude Fable 560$3.25~18지능 1위 · 가성비 최하 — “반드시 이겨야 할 때”만
  • 파레토 프론티어(같은 비용에 최고 지능 / 같은 지능에 최저 비용): DeepSeek V4 Pro → Luna → Terra → Sol → Fable 순으로 비용이 오른다. 이 곡선 위에 없는 조합(같은 점수인데 더 비싼 것)은 값을 치를 이유가 약하다.
  • Sol ≈ Fable, 1/3 값: Sol max는 59점으로 Fable(60점)에 1점 뒤지지만 작업당 비용은 약 1/3이다. 대부분의 실무에서 Sol이 합리적 상한.
  • Luna·Terra가 경량·중국 모델을 값으로 압도: AA는 “Luna max가 GLM-5.2 max·Gemini 3.5 Flash와 지능이 같거나 앞서면서 더 싸다”고 명시한다. 즉 저가대에서도 GPT-5.6 계열이 파레토 프론티어를 잡고 있다.

관점 2 — 실전 에이전트 코딩 (DeepSWE 작업당 비용)

주의: 관점 1의 가성비 1위 Luna가 실전 코딩에선 1위가 아니다. Luna는 토큰 단가는 싸지만 스텝 수가 많고(DeepSWE 102스텝) 장문맥 회수율이 낮아(Nerova 41.3% vs Terra 89.6%·Sol 91.5%) 큰 코드베이스를 통째로 놓친다. 장기 코딩 궤적에서는 가성비가 역전된다.

등급/모델DeepSWE작업당 비용포지션
GPT-5.6 Sol Medium61$1.86일상 코딩 가성비 최고 — 스텝 수도 적음
GPT-5.6 Sol Extra High71$4.70고난도 상한 — Terra max보다 점수↑·비용↓
GPT-5.6 Terra max70$4.95서브에이전트 경량 작업 (Luna 대신)
GPT-5.6 Luna max67$3.03싸 보여도 102스텝·회수율↓로 실전 비효율
Fable 5 Extra High70$13–22Sol xHigh와 동급 점수, 약 3배 비용(하네스별 21.63)

관점 1(Intelligence Index)과 관점 2(DeepSWE)의 작업당 비용은 서로 다른 벤치마크·스케일이므로 숫자를 직접 비교하지 말 것. 관점 1은 “원천 지능당 값”, 관점 2는 “실전 코딩 1건당 값”이다.

역할별 추천 모델 (가성비 라우팅)

오케스트레이터 하나에 값싼 실행자 여럿을 붙이는 구조가 핵심이다(Codex config.toml 라우팅 실측 기준 토큰 ~50% 절감). 상위 등급은 계획·검토에만 잠깐 쓰고, 반복 실행은 중·저가 등급으로 내린다.

역할1순위 (가성비)예산형 대안근거
오케스트레이터 (Orchestrator)GPT-5.6 Sol Extra HighGrok 4.5 High · Opus 4.8 (max)계획·위임 품질은 max와 1점 차(58 vs 59)인데 비용 ~1/3
계획·설계 (Plan)GPT-5.6 Sol HighGrok 4.5 High강한 추론 필요, max는 과잉
빌더·구현 (Builder)GPT-5.6 Sol MediumGemini 3.5 Flash · GLM-5.2일상 코딩 61점/$1.86 · 스텝도 적음
실행자 (Task Execute)GPT-5.6 Sol MediumTerra High표준 편집·테스트·제한된 수정
코딩 (Coding)일상 Sol Medium / 고난도 Sol xHighGemini 3.5 Flash · GLM-5.2 · Terra High난도로 등급 분리
문서 작성 (Doc Write)GPT-5.6 Luna · Gemini 3.5 FlashClaude Haiku 4.5 · GLM-5.2추론 부담 적음 → 최저가가 정답
탐색·검색 (Fast Scan, read-only)Terra HighDeepSeek V4 Flash · Gemini 3.5 Flash빠르고 싸게 코드베이스 훑기
예산·자체호스팅 (Budget/Self-host)DeepSeek V4 Pro/FlashGLM-5.2 · Kimi K2.6트래픽 60~80%를 저가로, 어려운 20%만 프론티어로 승격

서브에이전트에서 피할 것: Luna(장문맥 회수율↓ — 대형 코드베이스 누락), Ultra/max(재귀 스폰·3배 비용에 겨우 1점 차), Low(품질 급락). 서브에이전트 기본값은 Sol Medium(실행)·Terra High(탐색).

코딩 작업 예시 — “결제 API에 지수 백오프 재시도 + 멱등성 키 추가”

한 작업을 역할별로 쪼개 각 단계에 맞는 등급을 배정한 흐름이다. 상위 등급(1·3·6단계)만 잠깐 쓰고 나머지는 중·저가로 내린다.

#단계담당 역할 / 모델하는 일
1분해·위임오케스트레이터 · Sol xHigh작업을 4개 서브태스크로 나누고 의존성·순서 결정
2탐색Fast Scan · Terra High (read-only)기존 결제 클라이언트·HTTP 래퍼·설정 파일 위치 파악
3설계Plan · Sol High재시도 정책(최대 5회·지수 백오프+지터), 멱등성 키 전략, 회로차단 여부 결정
4구현Builder · Sol Mediumretry 미들웨어 작성, 멱등성 키 생성·헤더 전달, 단위테스트 작성
5문서화Doc Write · Luna / Gemini 3.5 Flash변경 요약, PR 설명, README 재시도 정책 절 갱신, 주석
6검토Reviewer · Sol xHigh (또는 Opus 4.8)중복 결제·경쟁 조건·테스트 커버리지 최종 점검

비용 효과: 6단계를 전부 Fable 5로 돌리면 매 단계가 최고가다. 위처럼 라우팅하면 고비용 등급은 계획·설계·검토(3개 단계)에만 쓰이고 구현·문서·탐색은 중·저가로 처리된다 — Codex 실측 기준 품질을 유지하면서 토큰 ~50% 절감. 규모가 크면 4·5단계를 GLM-5.2·DeepSeek V4로 더 내려 추가 절감할 수 있다.

가성비 데이터 출처(2026-07-12 확인): Intelligence Index 작업당 비용은 Artificial Analysis v4.1 개편 글AA X 포스트(Sol max 0.55·Luna max 0.04·Opus 4.8 3.25). DeepSWE 작업당 비용은 2026-07-12-gpt-5-6-sol-medium-daily-tier-deepswe·2026-07-12-codex-pro-plan-config-toml-subagent-routing(confidence 각각 low·medium). “점수/$“는 이 노트에서 계산한 파생 지표이므로 순위 참고용이다.

관련 노트

  • raw source: web-2026-07-12-artificial-analysis-gpt-5-6-sol-luna-terra-intelligence-vs-cost — 원본 X 포스트: 같은 Artificial Analysis 데이터의 ‘Intelligence vs Cost per Task’ 차트 — GPT-5.6 Sol·Luna가 파레토 프론티어 전 구간에서 Terra를 앞서고, Luna가 특히 비용 효율적이라는 분석
  • raw source: web-2026-07-12-sebastian-raschka-grok-4-5-muse-spark-intelligence-vs-cost — 후속 X 포스트: Sebastian Raschka가 같은 ‘Intelligence vs Cost’ 차트에 이 표의 Grok 4.5 (high)(54점)와 Muse Spark 1.1 (xhigh)(51점)를 추가한 업데이트 버전 — Grok 4.5가 파레토 프론티어에 놓인 가성비 모델이라는 평(하네스 정보 포함)
  • moc-ai-models — 이 노트를 등록한 모델·벤치마크 이정표
  • 2026-06-14-artificial-analysis-deepswe-coding-agent-index — 자매 노트: Artificial Analysis Coding Agent Index 개편(SWE-Bench Pro→DeepSWE), Fable 5가 1위로 데뷔
  • 2026-07-12-gpt-5-6-sol-medium-daily-tier-deepswe — 이 표의 GPT-5.6 Sol (medium)(9위·54점)을 DeepSWE 기준으로 실전 활용한 등급 가이드: 일상은 Sol Medium, 고난도만 Sol Extra High
  • 2026-07-12-codex-pro-plan-config-toml-subagent-routing — 응용: 이 지수를 근거로 Codex 서브에이전트 모델을 config.toml로 라우팅(Sol xHigh/Medium·Terra High)해 Pro 플랜 토큰 ~50% 절감하는 실무 팁
  • 2026-06-26-openrouter-list-benchmarks-api-reference — OpenRouter 벤치마크 API가 intelligence_index composite score(AA Intelligence Index)를 노출
  • 2026-06-19-ai-frontier-ep100-mythos-fable5 — 차트 정상 claude-fable-5(1위·60점)와 Claude Mythos를 다룬 AI 프론티어 EP100
  • 2026-06-14-new-coding-models-glm-kimi-fable-opus-gpt — 본 인덱스 상위권과 겹치는 신규 코딩 모델 비교(GLM-5.2·Kimi vs Fable 5·Opus 4.8·GPT-5.5)
  • moc-chinese-llm-models — DeepSeek V4·GLM-5.2·Qwen3.x·Kimi K2.6·MiniMax 등 스냅샷에 다수 포함된 중국계 모델 비교
  • 엔티티: claude-fable-5 · deepseek-v4 · glm-5.2 · kimi-k2 · nemotron · qwen · codex · anthropic