출처

요약

원문 URL: https://discuss.pytorch.kr/t/moba-feat-moonshotai/11324

Hermes CLI 요약 생성에 실패하여 원문 앞부분 기반의 임시 요약을 저장합니다.

원문 발췌

MoBA: 어텐션에 전문가 혼합을 적용해 긴 문맥을 효율적으로 처리하는 블록 어텐션1536×1024 193 KB MoBA 소개 MoBA는 긴 문맥(long-context)을 다루는 대형 언어 모델(LLM)의 어텐션 비용 문제를, 어디에 주목할지를 모델이 스스로 학습하도록 두어 해결하려는 어텐션 기법입니다. 이름은 Mixture of Block Attention의 약자로, 전문가 혼합(Mixture of Experts, MoE)의 원리를 어텐션 메커니즘에 처음으로 적용한 것이 핵심입니다. Moonshot AI, 칭화대학교, 저장랩/저장대학교 연구진이 함께 발표했으며, 이미 Kimi의 긴 문맥 요청을 처리하는 실서비스에 적용되어 있습니다. 긴 문맥과 어텐션 비용의 딜레마 인공지능이 인간 수준의 인지를 흉내 내는 복잡한 작업으로 나아가려면, 긴 시퀀스를 이해하고 생성하는 능력이 필수적입니다. Kimi, Claude, Gemini 같은 모델이 수십만 토큰의 입력을 받아들이는 방향으로 발전해 온 것도, 그리고 DeepSeek-R1 이나 Kimi k1.5 처럼 긴 사고 사슬(chain-of-thought)을 출력하는 추론 모델이 등장한 것도 모두 이 흐름 위에 있습니다. 문제는 표준 트랜스포머(Transformer)의 어텐션이 문맥 길이 N 에 대해 계산량이 제곱, 즉 O(N^2) 으로 늘어난다는 점입니다. 문맥을 100만 토큰 규모로 늘리려는 순간 이 제곱 비용은 감당하기 어려운 부담이 됩니다. 다행히 어텐션 점수(attention score)에는 본질적인 희소성(sparsity)이 존재합니다. 수학적으로는 소프트맥스(softmax)…

관련 위키

원문 보존 위치

원문 전체는 2026-07-21-pytorchkr-topic-11324-moba-feat-moonshotaisource_url 및 HTML 원문과 함께 저장되어 있습니다.