출처

한 줄 요약

A.X K2 Raon-Speech는 단순한 한국어 음성 인식기가 아니라, STT·TTS·음성 질의응답·화자 조건부 생성·음성 이어 말하기를 하나의 MoE 음성 언어 모델에 묶은 KRAFTON의 공개 모델이다. Hada의 핵심 가치는 모델 카드의 기술 설명을 한국어로 압축하고, 실제 청취 감상과 실행 비용을 함께 드러낸 데 있다.

Hada 큐레이션의 핵심

Hada News 32125는 2026-08-04 게시된 GeekNews 큐레이션이다. 설명에 따르면 모델은 SK텔레콤 A.X K2 Light 20B-A3B 텍스트 백본, KRAFTON이 학습한 약 317M 파라미터 AuT 음성 인코더, 약 96M 파라미터 Mimi 계열 음성 코덱을 결합한다. 총 파라미터는 약 21.2B이고 토큰마다 활성화되는 파라미터는 약 3.5B다.

공식 모델 카드와 기존 조사 기록으로 확인되는 주요 기능은 다음과 같다.

  • 한국어·영어 STT와 TTS
  • SpeechQA·SpokenQA·TextQA
  • 턴 기반 멀티모달 대화와 도구 호출
  • 감정·억양 같은 준언어적 정보의 반영
  • 참조 음성을 이용한 화자 조건부 TTS
  • 참조 음성의 운율을 이어가는 TTS continuation

텍스트 백본은 48개 레이어와 2,048 차원 은닉 상태, 128개 라우팅 전문가 중 top-8 활성화, 최대 131,072 토큰 컨텍스트로 설명된다. 이 수치는 Hada의 독립 측정이 아니라 KRAFTON 모델 카드에서 전달된 설계 설명이다.

성능 주장과 해석의 경계

KRAFTON은 한국어 24개·영어 22개 등 46개 벤치마크를 사용해 평가했다고 보고한다. 30B 이하 공개 음성 언어 모델 비교에서 한국어 aggregate 0.72로 1위, 영어 aggregate 0.75로 3위라는 수치다.

이 결과는 한국어 음성 모델의 공개 경쟁 구도에서 의미 있는 신호지만, 다음을 구분해야 한다.

  • 확인된 것: 모델 카드가 해당 벤치마크와 aggregate 수치를 보고했다.
  • 확인되지 않은 것: 이번 조사에서 벤치마크 실행, 음성 샘플의 독립 청취 평가, 타 모델과의 동일 조건 재현을 수행하지 않았다.
  • 따라서 가능한 표현: “KRAFTON이 한국어 aggregate 1위를 보고한 모델”
  • 피해야 할 표현: “객관적으로 한국어 음성 품질이 세계 최고로 검증된 모델”

Hada 댓글의 “일반인이 말하는 것 같다”는 반응도 흥미로운 사용 감상이지만, 표본·재생 조건·비교군이 없는 커뮤니티 관찰이다.

실행 비용과 공개 범위

BF16 체크포인트가 약 42.4GB이고 80GB GPU 또는 다중 GPU가 권장된다. 따라서 전체 모델을 일반적인 Mac 로컬 앱처럼 즉시 실행하는 경량 모델로 보기는 어렵다. 실제 로컬 실행 가능성은 양자화·메모리 절약 구현·GPU 종류·오디오 입출력 경로를 별도로 확인해야 한다.

모델 라이선스는 CC BY-NC 4.0으로, 연구와 비상업적 프로토타이핑 범위에 주의해야 한다. 특히 참조 음성을 이용한 음성 복제는 식별 가능한 화자의 동의와 사용 권한을 전제로 해야 한다. 공식 코드 저장소 krafton-ai/Raon-Speech의 GitHub API 메타데이터는 2026-08-05 확인 당시 Python, Apache-2.0 저장소 라이선스, 104 stars, 12 forks, open issues 0으로 표시됐지만, 이것은 모델 가중치 라이선스(CC BY-NC 4.0)와 별개의 코드 저장소 정보다.

커뮤니티 반응

Hada의 댓글 5개는 기술 분석보다 데모의 체감 품질에 집중되어 있다.

  • 음성 샘플이 실제 사람과 거의 구분되지 않는다는 감탄
  • 게임회사인 KRAFTON이 이런 모델을 공개했다는 놀라움
  • 배틀그라운드 음성과의 연관성을 묻는 농담성 추측
  • 샘플이 일반인의 대화처럼 들린다는 청취 감상

이 반응들은 “사람 같은 음성”이라는 제품 인상을 보여 주지만, 실제 게임 적용·상용 배포·인지 품질·지연 시간의 증거는 아니다. 특히 배틀그라운드와의 연결은 댓글의 추측일 뿐 공식 확인 사항이 아니다.

나의 생각

이 모델에서 가장 중요한 변화는 STT와 TTS의 품질 경쟁 자체보다 음성을 텍스트의 입출력 주변부가 아니라 언어 모델의 주된 표현 공간으로 취급한다는 점이다. 하나의 모델이 듣고, 답하고, 말하고, 화자·억양·감정 정보를 조건으로 사용할 수 있으면 음성 인터페이스는 “말을 글자로 바꾼 뒤 LLM에 전달하는 파이프라인”에서 대화 상태의 일부로 이동한다.

다만 “실제 사람과 차이가 0에 수렴한다”는 감탄은 가장 조심해서 받아들여야 한다. 자연스러운 짧은 샘플과 장시간 대화, 감정 변화, 발음 오류, 겹침 발화, 노이즈, 화자 동의·삭제 요구를 모두 만족하는 제품은 다른 문제다. 이 모델을 평가한다면 평균적인 음성 자연스러움뿐 아니라 다음을 따로 측정해야 한다.

  • 한국어 방언·고유명사·코드 스위칭의 인식 오류
  • 긴 대화에서의 의미 보존과 턴 전환
  • 음성 복제의 화자 유사도와 오용 방지
  • 생성 지연·GPU 메모리·동시 사용자 비용
  • 감정·억양 제어의 일관성
  • 참조 음성의 보관·삭제·동의 증적

KRAFTON이 게임 회사라는 점은 단순한 화제성이 아니라 잠재적 적용 맥락을 제공한다. 게임 캐릭터, 실시간 NPC, 인터랙티브 스토리텔링은 음성 모델의 강점과 잘 맞을 수 있다. 그러나 Hada 댓글의 배틀그라운드 추측을 실제 제품 로드맵이나 적용 사례로 확대해서는 안 된다.

사실성·미검증 범위

  • Hada는 공식 모델 카드와 9B 관련 모델을 연결한 2차 큐레이션이다. 모델 구조·성능 수치의 최종 근거는 KRAFTON/Hugging Face 자료다.
  • Hada의 댓글은 짧은 감상·추측·샘플 청취 보고이며 독립적인 벤치마크가 아니다.
  • 이번 작업에서는 모델 다운로드, GPU 로컬 실행, STT/TTS 추론, 음성 복제, benchmark 재현을 하지 않았다.
  • CC BY-NC 4.0의 상업적 사용 범위와 음성 데이터 처리 조건은 실제 배포 전에 원문 라이선스와 관련 법률을 별도로 검토해야 한다.

관련 노트

검증

  • Hada canonical URL과 사용자 제공 query URL을 대조했다.
  • Hada 게시 시각은 HTML article:published_time2026-08-04T10:01:01+09:00으로 확인했다.
  • Hada 제목·본문 요약·댓글 5개를 readable-page extraction으로 확인하고 별도 raw capture로 보존했다.
  • 공식 모델 카드의 기존 raw capture와 대조해 모델 구조·기능·평가 수치·라이선스 주장을 분리했다.
  • GitHub 공식 저장소 API를 2026-08-05에 조회해 코드 저장소 메타데이터와 모델 라이선스를 구분했다.