개요
Artificial Analysis Intelligence Index가 4판(1월) 8개월 만에 4.2판으로 올랐다는 소식을 두 Threads 게시물이 각자 전했다. 포화된 GPQA Diamond를 빼고 수주짜리 프로젝트형 비공개 시험(Briefcase)과 100개 PDF 4,592쪽 종합 추론 시험을 넣었으며, 비공개 문제 비중이 40%(직전의 2배)로 커졌다.
게시물 요지
- @billionnapkin: 새 순위 1위 Claude Fable 5.1, 2위 GPT-6 Astra, 이후 Meta·SpaceXAI·Moonshot·Z.AI·Google 순. PDF 시험만 보면 Astra 33.2 vs Fable 5.1 26.2로 뒤집힌다. “문제가 새면 시험을 바꾸는 속도가 곧 순위표의 신뢰”라는 평이 핵심이다.
- @tilnote: 같은 업데이트를 速報로 전하며 1위 Fable Max·2위 GPT-5 Astra Max·3위 Opus Max·5위 Muse Spark Max로 적었다. 댓글에서 구글 순위 하락이 화제가 됐고, 작성자는 7월 최대 규모 사전훈련 착수를 근거로 연말~내년 초 Gemini 4 윤곽을 점쳤다.
- 양쪽의 모델명 표기(Max 계열 vs 베이스명)가 서로 달라 동일 지수 내 서로 다른 컷(과금 티어별)일 가능성이 있다.
확인 범위와 한계
- 지수 원문(artificialanalysis.ai) 직접 확인 없이 Threads 2건 기준이다. 정확한 점수표·시험 정의는 원문이 필요하다.
- @tilnote의 “GPT 5 Astra” 표기는 오기(게시물 원문 그대로 “2뤼” 오타 포함)일 가능성이 있어 모델명 인용에 주의한다.
관련 위키
검증
- Threads 게시물 2건을 ego-browser로 2026-09-10에 직접 렌더링해 전문을 캡처했다.
- 원문은
raw/articles/2026-09-10-threads-artificial-analysis-4-2.md에 보존했고 SHA-256을 기록했다.