출처
- source_url: https://discuss.pytorch.kr/t/instella-moe-amd-instinct-gpu-16b-moe/11518
- author: 9bow
- published: Tue, 04 Aug 2026 21:30:34 +0000
- raw: raw source:
2026-08-05-pytorchkr-topic-11518-instella-moe-amd-instinct-gpu-16b-moe
Instella-MoE: AMD Instinct GPU에서 처음부터 학습한 완전 오픈 16B MoE 모델
개요
Instella-MoE는 AMD가 Instinct MI300X 및 MI325X GPU와 ROCm 소프트웨어 스택을 사용해 처음부터 학습한 16B 규모의 희소 활성 MoE 언어 모델이다. 전체 파라미터는 16B지만 토큰당 2.8B만 활성화하며, 학습 코드·데이터 배합·설정·중간 체크포인트까지 공개하는 완전 오픈 모델을 목표로 한다. 모델은 64개 라우팅 전문가 중 6개와 2개의 공유 전문가를 사용하고, Gated MLA와 FarSkip-Collective를 적용했다. 학습은 7.1T 토큰 사전학습부터 미드트레이닝, 64K 롱컨텍스트 확장, SFT, DPO, 강화학습까지 6단계로 구성된다.
핵심 포인트
- 완전 오픈 학습 과정: 가중치뿐 아니라 학습 코드, 데이터셋과 배합, 하이퍼파라미터, 단계별 체크포인트를 공개해 학습 과정의 재현과 분석을 지원한다.
- 희소 활성 MoE 구조: 전체 16B 파라미터 중 토큰당 2.8B만 사용한다. 27개 디코더 층 중 첫 층은 밀집 FFN이고, 나머지 26개 층은 MoE 층으로 구성된다.
- 전문가 구성: 64개 라우팅 전문가 중 토큰마다 6개를 선택하며, 모든 토큰이 통과하는 공유 전문가 2개를 별도로 둔다. 라우터는 시그모이드 점수와 편향 기반 부하 균형 방식을 사용한다.
- Gated MLA: MLA의 어텐션 출력에 입력에 따라 달라지는 게이트를 적용해, 토큰별로 유용성이 낮은 어텐션 응답을 감쇠할 수 있도록 설계했다.
- FarSkip-Collective: 전문가 병렬화 과정에서 통신이 완료될 때까지 기다리지 않고 부분적·이전 활성값을 이용해 다음 계산을 시작함으로써 통신과 연산을 겹친다. 원문은 학습 처리량 12.7% 향상을 보고하지만, 추론 TTFT의
39.2수치는 본문과 그림의 표현이 서로 달라 정확한 정의를 후속 자료에서 확인할 필요가 있다. - 6단계 학습 파이프라인: 7.1T 토큰 사전학습, 미드트레이닝, 4K→64K 롱컨텍스트 확장, SFT, DPO, 강화학습 순서로 진행되며 각 단계의 체크포인트가 공개되어 있다.
공개 체크포인트
왜 중요한가
Instella-MoE는 완전 오픈 모델의 재현성, MoE의 낮은 토큰당 활성 파라미터, AMD GPU·ROCm 기반 학습이라는 세 가지 측면을 함께 다룬 사례다. 단계별 체크포인트가 공개되어 있어 미드트레이닝, 롱컨텍스트 확장, SFT, DPO, 강화학습이 모델 능력에 미친 영향을 독립적으로 비교할 수 있다. 또한 대규모 모델 학습이 특정 GPU와 소프트웨어 생태계에만 의존하지 않고 AMD 하드웨어와 오픈 스택에서도 수행될 수 있는지를 검토할 수 있는 자료를 제공한다.
후속으로 볼 링크와 키워드
- 원문: https://discuss.pytorch.kr/t/instella-moe-amd-instinct-gpu-16b-moe/11518
- 학습 프레임워크: AMD Primus
- 강화학습 프레임워크: Miles
- AMD ROCm의 Primus 소개
- FarSkip-Collective 논문 및 AMD 기술 소개
- 키워드:
Mixture-of-Experts,Gated MLA,FarSkip-Collective,Expert Parallelism,Multi-Token Prediction,ROCm,롱컨텍스트,완전 오픈 모델
관련 위키
원문 보존 위치
원문 전체는 raw source: 2026-08-05-pytorchkr-topic-11518-instella-moe-amd-instinct-gpu-16b-moe에 source_url 및 HTML 원문과 함께 저장되어 있습니다.