이번 주(2026-06) 새로 나온 주요 코딩 모델은 GLM-5.2Kimi K2.7 Code 두 가지다. 이를 기존 프런티어 모델(claude-fable-5 · Claude Opus 4.8 · gpt-5.5)과 함께 정리한다.

결론 먼저. 공개 점수 기준으로는 Fable 5 > Opus 4.8 > GPT-5.5(터미널/툴 강세) 순. 다만 GLM-5.2는 비교 가능한 공식/독립 벤치가 거의 없고, Kimi K2.7 Code는 표준 점수보다 Moonshot 자체 벤치 위주라 동일 선상 비교가 아직 어렵다.

신규 모델 요약

모델상태핵심
glm-5.22026-06-13 공개/배포Z.ai / Zhipu 계열. GLM Coding Plan 전 티어 지원 시작. 1M 컨텍스트(glm-5.2[1m]). API·MIT 오픈웨이트는 다음 주 순차 공개
kimi-k2-7-code2026-06-12 공개Moonshot AI 코딩 특화. 1T MoE(활성 32B). 256K 컨텍스트. thinking 강제(non-thinking 미지원). Modified MIT

1. 공통 표준 벤치마크 비교

Fable 5 / Opus 4.8 / GPT-5.5는 Anthropic System Card 기반 공개 표에서 비교 가능하다. GLM-5.2와 Kimi K2.7 Code는 같은 표준 벤치 점수가 아직 부족해 “미공개”로 둔다.

벤치마크GLM-5.2Kimi K2.7 CodeClaude Fable 5Claude Opus 4.8GPT-5.5
SWE-bench Pro미공개미공개80.0~80.3%69.2%58.6%
SWE-bench Verified미공개별도 독립 결과 제한적95.0%88.6%미공개
Terminal-Bench 2.1미공개미공개84.3%82.7%83.4%
OSWorld-Verified미공개미공개85.0%83.4%78.7%
FrontierCode Diamond미공개미공개29.3%13.4%5.7%
Legal Agent미공개미공개13.3%10.4%2.1%
Blueprint-Bench 2미공개미공개38.6%14.5%36.2%

주: Terminal-Bench 2.1의 Opus 4.8 수치는 출처 간 편차가 있다(일부 2차 소스 74.6%). 위 표는 사용자 제공 System Card 정리 기준.

2. Kimi K2.7 Code 전용 비교 (Moonshot 자체 벤치)

K2.6 대비 크게 개선(Kimi Code Bench v2 +21.8%, MLS Bench Lite +31.5%)됐지만, 같은 표 안에서는 대부분 GPT-5.5 / Opus 4.8보다 낮고 MCP Mark Verified에서만 Opus 4.8을 앞선다. Kimi 공식 문서 기준.

벤치마크Kimi K2.7 CodeGPT-5.5Claude Opus 4.8
Kimi Code Bench v262.069.067.4
Program Bench53.669.163.8
MLS Bench Lite35.135.542.8
Kimi Claw 24/7 Bench46.952.850.4
MCP Atlas76.079.481.3
MCP Mark Verified81.192.976.4

3. GLM-5.2 상태 — 점수 비교 보류

GLM-5.2는 지금 점수 비교를 하면 안 된다. Z.ai 문서상 GLM Coding Plan에서 glm-5.2, glm-5.2[1m] 사용과 1M 컨텍스트 설정이 안내되지만, 출시 직후 기준으로 공개 표준 벤치마크나 독립 검증 점수가 아직 부족하다. 초기 홍보/벤치가 많아 독립 검증 부족 지적이 특히 강하다.

실전 기준 순위 (코딩 에이전트 / 장기 작업)

용도현재 우위
가장 강한 장기 코딩/에이전트Claude Fable 5
검증된 고성능 코딩 모델Claude Opus 4.8
터미널·툴 사용·Codex 워크플로우GPT-5.5
오픈웨이트 가성비 코딩 모델Kimi K2.7 Code
기대주이나 아직 점수 부족GLM-5.2

주의사항

  • Fable 5 접근 중단: 성능은 1위로 보이나 2026-06-12 미국 정부 수출통제 지시로 Anthropic이 Fable 5 / Mythos 5를 전 고객 대상 즉시 비활성화(외국 국적자 접근 차단). 실사용 가능 여부는 별도 확인 필요. → claude-fable-5
  • 벤치 신뢰도: 두 신규 모델 모두 초기 홍보/벤치 위주. GLM-5.2는 독립 벤치 검증 부족, Kimi K2.7 Code는 표준 벤치보다 자체 벤치 위주 → 본 페이지 confidence: medium, contested: true. 표준 점수 공개 시 갱신 필요.
  • GLM-5.2는 Coding Plan 중심으로 먼저 풀렸고 API/오픈웨이트는 순차 공개 예정.

관련 노트