출처

요약

원문 URL: https://discuss.pytorch.kr/t/soofi-s-30b-a3b-mamba-moe/11331

Hermes CLI 요약 생성에 실패하여 원문 앞부분 기반의 임시 요약을 저장합니다.

원문 발췌

Soofi S 30B-A3B: 독일어와 영어를 위한 주권형 오픈소스 하이브리드 Mamba-MoE 모델1536×1024 313 KB 대형 언어 모델(Large Language Model)을 실제 서비스에 올릴 때는, 모델이 얼마나 똑똑한가만큼이나 얼마나 빠르고 저렴하게 돌아가는가가 중요합니다. 이 리포트는 독일어와 영어에 특화된 주권형(sovereign) 오픈소스 파운데이션 모델 Soofi S 30B-A3B 를 소개하며, 역량과 배포 효율을 동시에 잡기 위한 하이브리드 Mamba-Transformer 혼합 전문가(Mixture-of-Experts, MoE) 설계와 약 27 조 토큰 규모의 완전 공개 사전학습 레시피를 다룹니다. 실제로 Soofi S는 최상위권 역량을 유지하면서도 40\text{K} 컨텍스트 기준 측정 처리량에서 비교 대상 중 가장 빠른 축에 속합니다. Soofi S 소개 오픈 모델에 남아있는 세 가지 격차 오픈 언어 모델은 빠른 속도로 발전해 왔지만, 막상 무엇을 배포할지 결정하는 입장에서 보면 여전히 세 가지 격차가 눈에 띕니다. 첫째, 이름뿐이 아닌 실질적 개방성입니다. 수많은 모델이 공개되고 있지만 대부분은 가중치(weight)만 공개하는 방식이며, 학습 과정을 총 토큰 수 정도로만 기술한 채 재현이나 감사를 위해 필요한 데이터, 레시피, 의사결정을 생략합니다. 무엇으로 학습했는지 알 수 없다면, 그 모델을 검증하거나 다시 만들 수 없습니다. 둘째, 언어입니다. 범용 다국어 모델은 영어 중심이거나, 수십 개 언어에 용량을 얇게 나눠 씁니다. 그 결과 독일어는 경제적, 학문적 비중에 비해 과소대표됩니다. 지금까지의 유럽 주권형 시도들(Teuken,…

관련 위키

원문 보존 위치

원문 전체는 2026-07-21-pytorchkr-topic-11331-soofi-s-30b-a3b-mamba-moesource_url 및 HTML 원문과 함께 저장되어 있습니다.