이번 주(2026-06) 새로 나온 주요 코딩 모델은 GLM-5.2와 Kimi K2.7 Code 두 가지다. 이를 기존 프런티어 모델(claude-fable-5 · Claude Opus 4.8 · gpt-5.5)과 함께 정리한다.
결론 먼저. 공개 점수 기준으로는 Fable 5 > Opus 4.8 > GPT-5.5(터미널/툴 강세) 순. 다만 GLM-5.2는 비교 가능한 공식/독립 벤치가 거의 없고, Kimi K2.7 Code는 표준 점수보다 Moonshot 자체 벤치 위주라 동일 선상 비교가 아직 어렵다.
신규 모델 요약
| 모델 | 상태 | 핵심 |
|---|---|---|
| glm-5.2 | 2026-06-13 공개/배포 | Z.ai / Zhipu 계열. GLM Coding Plan 전 티어 지원 시작. 1M 컨텍스트(glm-5.2[1m]). API·MIT 오픈웨이트는 다음 주 순차 공개 |
| kimi-k2-7-code | 2026-06-12 공개 | Moonshot AI 코딩 특화. 1T MoE(활성 32B). 256K 컨텍스트. thinking 강제(non-thinking 미지원). Modified MIT |
1. 공통 표준 벤치마크 비교
Fable 5 / Opus 4.8 / GPT-5.5는 Anthropic System Card 기반 공개 표에서 비교 가능하다. GLM-5.2와 Kimi K2.7 Code는 같은 표준 벤치 점수가 아직 부족해 “미공개”로 둔다.
| 벤치마크 | GLM-5.2 | Kimi K2.7 Code | Claude Fable 5 | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| SWE-bench Pro | 미공개 | 미공개 | 80.0~80.3% | 69.2% | 58.6% |
| SWE-bench Verified | 미공개 | 별도 독립 결과 제한적 | 95.0% | 88.6% | 미공개 |
| Terminal-Bench 2.1 | 미공개 | 미공개 | 84.3% | 82.7% | 83.4% |
| OSWorld-Verified | 미공개 | 미공개 | 85.0% | 83.4% | 78.7% |
| FrontierCode Diamond | 미공개 | 미공개 | 29.3% | 13.4% | 5.7% |
| Legal Agent | 미공개 | 미공개 | 13.3% | 10.4% | 2.1% |
| Blueprint-Bench 2 | 미공개 | 미공개 | 38.6% | 14.5% | 36.2% |
주: Terminal-Bench 2.1의 Opus 4.8 수치는 출처 간 편차가 있다(일부 2차 소스 74.6%). 위 표는 사용자 제공 System Card 정리 기준.
2. Kimi K2.7 Code 전용 비교 (Moonshot 자체 벤치)
K2.6 대비 크게 개선(Kimi Code Bench v2 +21.8%, MLS Bench Lite +31.5%)됐지만, 같은 표 안에서는 대부분 GPT-5.5 / Opus 4.8보다 낮고 MCP Mark Verified에서만 Opus 4.8을 앞선다. Kimi 공식 문서 기준.
| 벤치마크 | Kimi K2.7 Code | GPT-5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Kimi Code Bench v2 | 62.0 | 69.0 | 67.4 |
| Program Bench | 53.6 | 69.1 | 63.8 |
| MLS Bench Lite | 35.1 | 35.5 | 42.8 |
| Kimi Claw 24/7 Bench | 46.9 | 52.8 | 50.4 |
| MCP Atlas | 76.0 | 79.4 | 81.3 |
| MCP Mark Verified | 81.1 | 92.9 | 76.4 |
3. GLM-5.2 상태 — 점수 비교 보류
GLM-5.2는 지금 점수 비교를 하면 안 된다. Z.ai 문서상 GLM Coding Plan에서 glm-5.2,
glm-5.2[1m] 사용과 1M 컨텍스트 설정이 안내되지만, 출시 직후 기준으로 공개 표준 벤치마크나
독립 검증 점수가 아직 부족하다. 초기 홍보/벤치가 많아 독립 검증 부족 지적이 특히 강하다.
실전 기준 순위 (코딩 에이전트 / 장기 작업)
| 용도 | 현재 우위 |
|---|---|
| 가장 강한 장기 코딩/에이전트 | Claude Fable 5 |
| 검증된 고성능 코딩 모델 | Claude Opus 4.8 |
| 터미널·툴 사용·Codex 워크플로우 | GPT-5.5 |
| 오픈웨이트 가성비 코딩 모델 | Kimi K2.7 Code |
| 기대주이나 아직 점수 부족 | GLM-5.2 |
주의사항
- Fable 5 접근 중단: 성능은 1위로 보이나 2026-06-12 미국 정부 수출통제 지시로 Anthropic이 Fable 5 / Mythos 5를 전 고객 대상 즉시 비활성화(외국 국적자 접근 차단). 실사용 가능 여부는 별도 확인 필요. → claude-fable-5
- 벤치 신뢰도: 두 신규 모델 모두 초기 홍보/벤치 위주. GLM-5.2는 독립 벤치 검증 부족,
Kimi K2.7 Code는 표준 벤치보다 자체 벤치 위주 → 본 페이지
confidence: medium,contested: true. 표준 점수 공개 시 갱신 필요. - GLM-5.2는 Coding Plan 중심으로 먼저 풀렸고 API/오픈웨이트는 순차 공개 예정.
관련 노트
- glm-5.2 · kimi-k2-7-code · claude-fable-5 · claude-opus-4.7 · gpt-5.5 · kimi-k2
- 2026-06-14-artificial-analysis-deepswe-coding-agent-index — Coding Agent Index 개편(Fable 5 1위)
- 2026-04-20-kimi-k2-6-vs-qwen3-6-vs-opus-4-7 — 직전 세대 코딩 모델 선택 가이드
- 2026-03-29-minimax-glm-kimi-coding-comparison — GLM-5.1 세대 비교
- 2026-04-16-agent-skills-realistic-benchmark-gap — 벤치마크-현실 괴리
- moc-ai-models · moc-ai-coding · moc-chinese-llm-models