개요
KRAFTON의 A.X K2 Raon-Speech는 한국어와 영어를 지원하는 통합 음성 언어 모델이다. 음성 인식(STT), 음성 합성(TTS), 음성·텍스트 질의응답, 화자 조건부 음성 합성, 음성 이어 말하기를 하나의 멀티모달 모델에서 제공한다. 사용자가 제공한 “한국어 기능이 압도적으로 좋다”는 평가는 모델 카드의 한국어 aggregate 1위 보고와 방향은 일치하지만, 독립적인 청취·재현 평가가 아닌 공식 벤치마크 결과와 사용자 관찰로 구분해야 한다.
핵심 특징
- 총 약 21.2B 파라미터, 활성 파라미터 약 3.5B인 MoE 구조
- SK텔레콤 A.X K2 Light 20B-A3B 텍스트 백본 기반
- KRAFTON이 자체 학습한 약 317M 파라미터 AuT 음성 인코더와 약 96M 파라미터 Mimi 스타일 오디오 코덱 통합
- STT, TTS, SpeechQA, SpokenQA, TextQA, 턴 기반 멀티모달 채팅 지원
- 감정·억양 등 음성의 준언어적 정보를 반영하는 응답 생성
- 참조 음성 기반 화자 조건부 TTS 및 참조 음성에서 이어 말하기
벤치마크와 의미
KRAFTON은 한국어 24개·영어 22개를 포함한 46개 벤치마크에서 평가했다고 밝힌다. 30B 이하 공개 음성 언어 모델 비교에서 한국어 aggregate 0.72로 1위, 영어 aggregate 0.75로 3위라고 보고했다. 이는 모델 카드가 제시한 수치이며 독립 재현 결과는 아니다.
한국어 음성 AI 관점에서 중요한 점은 단순한 ASR 모델이 아니라, 인식과 생성·질의응답·화자 조건부 합성을 하나의 음성 모델 제품군으로 공개했다는 것이다. 다만 BF16 체크포인트가 약 42.4GB이고 80GB GPU 또는 멀티 GPU가 권장되므로 일반적인 로컬 Mac에서 바로 구동하는 경량 모델은 아니다.
실행 및 라이선스
Hugging Face Space 데모를 통해 체험할 수 있으며, 로컬 사용은 Python·Transformers·CUDA GPU 환경을 요구한다. 모델 라이선스는 CC BY-NC 4.0이고, 상업적 사용 및 음성 복제 시 별도 라이선스와 당사자 동의 조건을 확인해야 한다.
from raon import RaonPipeline
pipe = RaonPipeline("KRAFTON/A.X-K2-Raon-Speech-21B-A3B", device="cuda", dtype="bfloat16")
text = pipe.stt("audio.wav")
audio, sample_rate = pipe.tts("안녕하세요. 만나서 반갑습니다.")관련 노트
- moc-ai-models
- 2026-07-25-local-open-tts-models
- local-llm
- 2026-08-05-hada-32125-krafton-ax-k2-raon-speech — Hada News의 모델 큐레이션·댓글·공식 자료 교차 확인
출처 및 검증
- 데모: https://huggingface.co/spaces/KRAFTON/ax-k2-raon-speech-demo
- 모델 카드: https://huggingface.co/KRAFTON/A.X-K2-Raon-Speech-21B-A3B
- 코드: https://github.com/krafton-ai/Raon-Speech
- 사용자 제공 관찰문과 공식 모델 카드 내용을 별도 raw capture로 보존했다.