출처

개요

Moonshot AI는 총 2.78T개, 활성 104.2B개의 매개변수를 사용하는 네이티브 멀티모달 MoE 모델 Kimi K3의 가중치와 47쪽 분량의 기술 문서를 공개했습니다. Kimi K3는 모델 규모 확장뿐 아니라 사전 학습, 강화학습, 추론 예산, 100만 토큰 컨텍스트를 함께 확장하는 접근을 취합니다. 아키텍처는 KDA와 Gated MLA를 결합한 하이브리드 어텐션, 깊이 방향의 AttnRes, 폭 방향의 Stable LatentMoE로 구성됩니다. 문서는 이러한 설계가 Kimi K2 대비 약 2.5배의 스케일링 효율 개선을 목표로 했다고 설명합니다.

핵심 포인트

  • 모델 규모와 구성: 총 매개변수 2.78T, 활성 매개변수 104.2B, 93개 레이어, 1,048,576토큰 컨텍스트를 사용합니다. MoE에는 라우팅 전문가 896개 중 토큰당 16개와 공유 전문가 2개가 활성화됩니다.
  • KDA와 Gated MLA의 3:1 결합: KDA 69개와 Gated MLA 24개를 배치해, 긴 시퀀스의 효율적인 상태 갱신은 KDA가 담당하고 전역 토큰 상호작용은 MLA가 담당하도록 분업합니다.
  • KDA의 수치 안정화: 감쇠 로짓에 하한 g_min = -5를 두어 누적 감쇠의 역수 폭발을 제한하고, 대각 타일도 조밀 행렬곱으로 처리할 수 있도록 설계했습니다. KDA 출력에는 입력 의존적인 전랭크 게이트와 RMSNorm도 적용됩니다.
  • Gated MLA와 NoPE: MLA 레이어에서 명시적인 위치 인코딩을 제거하고, 위치 정보는 KDA의 재귀적 감쇠와 게이팅을 통해 제공하도록 했습니다. 기술 문서는 이 구성이 긴 컨텍스트 확장 시 RoPE 주파수 재조정이나 YaRN 보간을 요구하지 않는다고 설명합니다.
  • Block AttnRes: 표준 잔차 연결 대신 깊이 방향의 이전 레이어 표현을 선택적으로 참조하며, 실제 모델에서는 블록 크기 12의 Block AttnRes를 사용해 메모리와 통신 부담을 줄입니다.
  • Stable LatentMoE와 SiTU-GLU: 라우팅 전문가를 히든 차원의 절반인 3,584차원 잠재 공간에서 실행하고, 집계 결과에 RMSNorm을 추가합니다. SiTU-GLU는 β₁ = 4, β₂ = 25의 매끄러운 상한을 적용해 활성값을 제한하면서 SwiGLU의 근방 동작을 유지하도록 설계되었습니다.
  • Quantile Balancing: 전문가별 부하 균형을 고정 학습률 기반 편향 갱신 대신 라우터 점수의 분위수에서 직접 계산합니다. 대규모 분산 학습에서는 전문가별 마진을 히스토그램으로 집계해 통신 비용을 줄이는 방식을 사용합니다.

왜 중요한가

Kimi K3의 기술적 의미는 단순히 매개변수 수를 늘린 데 있지 않고, 초대형 MoE를 실제 학습·추론 시스템으로 운영하기 위해 아키텍처, 수치 안정성, 라우팅, 병렬화 커널을 함께 조정했다는 점에 있습니다. 특히 선형 어텐션과 전역 어텐션의 결합, 깊이 방향 어텐션 잔차, 잠재 공간 MoE, 분위수 기반 부하 균형은 대규모 오픈 웨이트 모델의 효율성과 확장성을 다루는 구체적인 설계 사례를 제공합니다. 다만 게시글의 성능 및 효율성 수치는 기술 문서와 작성자의 설명에 근거한 것이므로, 실제 비교 시에는 공개 가중치와 평가 조건을 별도로 확인할 필요가 있습니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-07-29-pytorchkr-topic-11455-kimi-k3-2-8tsource_url 및 HTML 원문과 함께 저장되어 있습니다.