출처
- source_url: https://aisparkup.com/posts/14594
- author: Spark
- published: Mon, 20 Jul 2026 11:15:59 +0000
- raw: 2026-07-20-aisparkup-post-14594-kimi-k3-1-39
개요
같은 모델(Kimi K3)을 두고 벤치마크마다 정반대 성적표가 나왔다. 프론트엔드 코드 순위에서는 Claude Fable 5·GPT-5.6 Sol을 제치고 1위를 차지했지만, 고난도 수학 벤치마크에서는 같은 상대들에게 절반도 안 되는 점수로 크게 뒤졌다. Moonshot AI의 오픈모델이 서구 최상위 모델과 실제로 얼마나 가까운지를 둘러싼 벤치마크들이 서로 다른 그림을 그리고 있다.
핵심 포인트
- 중국 모델 최초 프론트엔드 코드 1위: 사람의 선호도 평가 기반 Code Arena: Frontend 벤치마크에서 Kimi K3가 1,679점으로 Claude Fable 5(1,631점)·GPT-5.6 Sol(1,618점)을 포함한 전체 모델을 앞섰다. 벤치마크 수치가 아니라 사람이 두 모델의 코드 결과물을 직접 비교해 고른 순위라는 점에서 의미가 있다.
- 고난도 수학은 39점: Epoch AI 집계 기준 FrontierMath Tier 4(연구자 수준 전문가급 수학 문제)에서 Kimi K3 정확도는 약 39%. 같은 문제에서 OpenAI·Anthropic 모델은 경우에 따라 90%에 가까운 점수를 낸다 — 두 배 넘게 벌어진 격차.
- 정확도와 환각률이 함께 올랐다: Artificial Analysis의 AA-Omniscience 평가에서 K3의 정답 정확도는 K2.6의 33%→46%로 개선됐지만, 환각률도 39%→51%로 함께 뛰었다. 더 정확해졌지만 동시에 더 자주 틀린 내용을 사실처럼 말하게 됐다는 뜻이라 한쪽 수치만으로 “좋아졌다”고 판단하기 어렵다.
- 에이전틱 작업 역량은 뚜렷이 개선: 실무 시나리오 종합 평가 GDPval-AA v2에서 K3는 Elo 1668(K2.6 대비 1190에서 대폭 상승)로 GLM-5.2·GPT-5.5·Claude Opus 4.8을 앞섰고, 업무 자동화 워크플로를 흉내 낸 AutomationBench-AA에서는 53%로 1위. 다만 환각률 상승은 실무 투입 전 별도 검증이 필요한 대목.
- 사이먼 윌리슨의 “펠리컨 벤치마크”가 짚은 한계: 21개월째 반복해온 “자전거 타는 펠리컨 SVG” 테스트에서 K3 결과물은 그럴듯했고 비용은 25센트에 불과했다. 하지만 이 단발성 테스트가 실제 실력과 잘 맞아떨어지던 시절은 지났다고 지적 — GPT-5.6·Fable 5의 펠리컨 그림이 GLM-5.2에 밀리지만 GLM-5.2가 Fable급이라 보긴 어렵기 때문. 더 근본적으로 펠리컨 테스트·코드 순위·수학 정확도 모두 “긴 대화에서 도구 호출을 얼마나 안정적으로 해내는가”라는, 장시간 에이전트 운용의 핵심 지표는 건드리지 못한다.
왜 중요한가
여러 벤치마크가 상충하는 성적표를 내놓는다는 것 자체가 “이 모델이 좋다/나쁘다”라는 단일 결론으로 정리될 수 없다는 신호다. 프론트엔드 코드 작업이 많다면 K3가 눈여겨볼 선택지지만, 복잡한 수학적 추론이나 사실 정확성이 핵심인 작업이라면 격차와 환각 위험을 함께 감안해야 한다 — 벤치마크 선택 자체가 유스케이스에 따라 완전히 다른 결론으로 이어지는 사례.
참고 링크
- 원문: https://aisparkup.com/posts/14594
- 출처 글: Moonshot’s Kimi K3 outperforms Fable 5 in frontend code but lags far behind in complex math — The Decoder
- 참고자료: Kimi K3, and what we can still learn from the pelican benchmark — Simon Willison
- 참고자료: Kimi K3 achieves #3 in the Artificial Analysis Intelligence Index — Artificial Analysis
관련 위키
- kimi-k3
- 2026-07-20-aisparkup-post-14567-kimi-k3 — 같은 주 공개된 K3의 자율 작업(칩 설계·연구 재현) 데모 노트
- moc-ai-models