출처
- source_url: multiple (see body)
- author: (다출처 리서치 캡처, 개별 출처는 본문·raw 참조)
- published: 2026-06-12 ~ 2026-06-14 (개별 발표일은 항목별 상이)
- raw: raw source:
web-2026-06-14-glm-5-2-kimi-k2-7-code-research
요약
이 노트는 2026년 6월 둘째 주에 새로 공개된 주요 코딩 모델인 GLM-5.2(Z.ai/Zhipu)와 Kimi K2.7 Code(Moonshot AI)를 중심으로, Claude Fable 5·Claude Opus 4.8·GPT-5.5와 비교하기 위해 여러 매체 기사를 종합한 다출처 리서치 캡처다. 단일 출처가 아니라 다수의 2차 보도와 벤더 발표를 교차 인용한 자료라는 점이 특징이며, 각 항목마다 독립 검증 여부를 명시하고 있다.
**GLM-5.2(Z.ai/Zhipu)**는 2026-06-13 공개돼 GLM Coding Plan 전 티어(Lite/Pro/Max/Team)에 즉시 배포됐다. 컨텍스트는 1M 토큰(모델 ID glm-5.2, 1M 설정은 glm-5.2[1m]), 최대 출력 131,072 토큰이며 High/Max 두 종류의 thinking 모드를 제공하고 복잡한 코딩에는 Max가 권장된다. Claude Code, Cline, OpenCode, Roo Code, Goose, Crush, OpenClaw, Kilo Code와 박스 단위로 호환되는 coding-first 포지셔닝을 취하지만, 출시 시점에 벤치마크 수치가 공개되지 않아 “powerful coding”, “strong long-horizon” 같은 벤더 주장만 존재하고 독립 검증은 부재한 상태다. API·챗봇·MIT 오픈웨이트는 순차 공개 예정으로 안내됐다.
**Kimi K2.7 Code(Moonshot AI)**는 2026-06-12 Hugging Face에 등장했으며, 1T 파라미터 MoE(활성 32B, 전문가 384개) 아키텍처에 256K 컨텍스트, Modified MIT 라이선스를 갖췄다. 코딩·에이전트 특화 장기 실행(long-horizon)에 초점을 맞추며 thinking이 강제되어 non-thinking 모드는 지원하지 않는다. 이전 버전 K2.6 대비 thinking 토큰을 약 30% 절감하면서도 자체 벤치마크 6종 전부에서 상회했다고 주장하며, 네이티브 멀티모달(텍스트/이미지/비디오 입력)을 지원한다. 가격은 백만 토큰당 입력 4.00이며 오픈웨이트는 약 340GB다. Moonshot이 공개한 비교표에 따르면 Kimi Code Bench v2에서 Kimi K2.7 Code 62.0, GPT-5.5 69.0, Claude Opus 4.8 67.4; Program Bench에서 각각 53.6/69.1/63.8; MLS Bench Lite 35.1/35.5/42.8; Kimi Claw 24/7 Bench 46.9/52.8/50.4; MCP Atlas 76.0/79.4/81.3; MCP Mark Verified 81.1/92.9/76.4로, 대부분의 지표에서 GPT-5.5·Claude Opus 4.8에 못 미치는 수치를 스스로 공개했다는 점이 눈에 띈다. 다만 이는 아직 표준 3자(제3자) 벤치마크가 아니라 Moonshot 자체 수치에 의존한 결과다.
비교 기준점으로 Claude Fable 5는 2026-06-09 GA, Opus 위의 새 티어로 1M 컨텍스트에 입력 50(백만 토큰당)이며 SWE-bench Verified 95.0%, SWE-bench Pro 80.3%를 기록했으나 사이버보안·생물·화학·모델 증류 관련 요청은 안전장치로 Opus 4.8로 폴백된다. Claude Opus 4.8은 2026-05-28 출시, 입력 25로 SWE-bench Verified 88.6%, Pro 69.2%를 보였고, GPT-5.5는 터미널·툴 사용과 Codex 워크플로우에 강점을 두며 공개표 기준 SWE-bench Pro 58.6%다. System Card 기반 비교표에서는 SWE-bench Pro(Fable 5 80.0~80.3%, Opus 4.8 69.2%, GPT-5.5 58.6%), SWE-bench Verified(95.0%, 88.6%, 미공개), Terminal-Bench 2.1(84.3%, 82.7%, 83.4%), OSWorld-Verified(85.0%, 83.4%, 78.7%), FrontierCode Diamond(29.3%, 13.4%, 5.7%), Legal Agent(13.3%, 10.4%, 2.1%), Blueprint-Bench 2(38.6%, 14.5%, 36.2%) 수치가 제시되며, Terminal-Bench 2.1의 Opus 4.8 수치는 출처 간 편차(일부 2차 소스는 74.6% 보고)가 있다고 캡처는 주석을 달아 둔다.
마지막으로 별도 항목으로 Fable 5 / Mythos 5 접근 중단이 기록되어 있다. 2026-06-12 17:21(ET) Anthropic이 미국 정부로부터 수출통제 지시를 받아, 미국 내외를 불문한 모든 외국 국적자(외국 국적 Anthropic 임직원 포함)의 Fable 5·Mythos 5 접근을 차단하라는 요구를 받았고, 이에 따라 컴플라이언스를 위해 전 고객 대상으로 두 모델을 즉시 비활성화했다(다른 모델 접근은 영향 없음). 정부는 구체적 사유를 명시하지 않았으나 Anthropic은 Fable 5의 “탈옥(jailbreak)” 기법 인지가 배경이라 이해했으며, 시연된 기법은 기존에 알려진 경미한 취약점 소수를 식별하는 수준이었다고 보도됐다.
관련 위키
원문 보존 위치
원문 전체는 raw source: web-2026-06-14-glm-5-2-kimi-k2-7-code-research에 source_url과 함께 저장되어 있다(다출처 리서치 캡처이므로 개별 출처 URL은 raw 문서 본문을 참조).