Anthropic이 2026년 4월 7일 공개한 Claude Mythos Preview. 역대 가장 강력한 모델이나 일반 사용자에게는 제공하지 않고 내부 R&D 용도로만 사용.
Official Benchmark Scores (vs Opus 4.6)
| 벤치마크 | Mythos | Opus 4.6 |
|---|---|---|
| SWE-bench Pro | 77.8% | 53.4% |
| SWE-bench Verified | 93.9% | 80.8% |
| SWE-bench Multilingual | 87.3% | 77.8% |
| SWE-bench Multimodal | 59.0% | 27.1% |
| Terminal-Bench 2.0 | 82.0% (4hr: 92.1%) | 65.4% |
| GPQA Diamond | 94.6% | 91.3% |
| Humanity’s Last Exam (no tools) | 56.8% | 40.0% |
| Humanity’s Last Exam (with tools) | 64.7% | 53.1% |
| BrowseComp | 86.9% (4.9x fewer tokens) | 83.7% |
| OSWorld-Verified | 79.6% | 72.7% |
| CyberGym (vuln reproduction) | 83.1% | 66.6% |
핵심 발표
- 몇 주 만에 모든 주요 OS와 브라우저에서 수천 개의 제로데이 취약점 발견
- Project Glasswing 발표: critical software securing initiative
- Risk report: 전반적 위험 “매우 낮지만, 이전 모델보다 높음”
- Anthropic 기준 가장 잘 정렬된 모델
갱신 (2026-07-25)
- 이후 후속 정식 모델이 잇따라 출시되며 “Anthropic 최강”의 기준이 이동했다: 같은 달 Opus 4.7(정식, SWE-bench Verified 87.6% / Pro 64.3%), Fable 5(2026-06-09, 코딩 최강), Opus 4.8.
- Mythos Preview 자체는 여전히 미출시 내부 R&D 프론티어(시스템 카드 명시)로, 본 페이지 수치는 2026-04-07 발표 기준으로 유효하다.
- 본 도입부의 “역대 가장 강력”, “가장 잘 정렬된” 표현은 발표 시점 한정 서술로 읽을 것.
- 아키텍처 가설은 2026-04-19-openmythos-recurrent-depth-transformer 참조.