개요
Qwen-Audio-3.0-TTS는 Alibaba Tongyi Lab이 2026년 7월 공개한 호스팅형 텍스트 음성 합성 모델이다. 공식 발표는 같은 계열에서 실시간 상호작용용 Flash와 자연스러움·음색 보존을 우선하는 고품질 생성용 Plus를 제공한다고 설명한다.
사용자가 제공한 Qwen 공식 X 게시물은 이 발표를 재확인하며, 인라인 표현 태그, 자연어 스타일 제어, 16개 언어, 잡음이 있는 참조 음성 처리, 최대 3분 원패스 생성, Artificial Analysis TTS 리더보드 1위를 핵심 메시지로 제시한다.
핵심 기능
- 두 가지 변형: Flash는 첫 오디오 패킷 지연이 약 300ms 수준인 실시간 용도에 맞춰졌고, Plus는 속도보다 자연스러움과 음색 충실도를 우선한다.
- 다국어: 아랍어·중국어·영어·프랑스어·독일어·인도네시아어·이탈리아어·일본어·한국어·말레이어·포르투갈어·러시아어·스페인어·타갈로그어·태국어·베트남어 등 16개 언어를 지원한다. 중국어 방언 영역도 별도로 다룬다.
- 스타일 제어: “화난 목소리”, “경기장 아나운서처럼” 같은 자연어 지시로 감정·역할·상황·속도를 조절할 수 있다.
- 세밀한 비언어 표현:
[angry],[giggles],[gasp],[sighing],[whispers]등의 인라인 태그로 웃음·숨·속삭임·감정 변화를 직접 지시할 수 있다. - 불완전한 참조 음성: 잡음과 잔향이 섞인 음성에서도 음색을 보존하면서 음성 복제를 개선하도록 학습되었다고 발표됐다.
- 긴 오디오와 스트리밍: 최대 3분 원패스 합성, WebSocket 양방향 스트리밍, PCM/WAV/MP3/Opus 출력, 최대 48kHz 출력이 소개됐다.
성능 주장과 검증 상태
Tongyi Lab은 16개 언어 중 10개 언어에서 WER/CER가 가장 좋았다고 보고했으며, 평균 WER/CER는 Flash 3.87, Plus 3.96으로 제시했다. 화자 유사도는 Plus 82.75, Flash 80.44로 Plus가 16개 언어 평균에서 1위라고 주장한다.
또한 공식 발표는 Qwen-Audio-3.0-TTS-Plus가 Artificial Analysis의 독립 TTS 리더보드에서 1위라고 명시한다. 이 기록은 2026-07-24에 확인했지만, 벤치마크 수치와 순위는 제공자 발표 및 시점별 리더보드 스냅샷이므로 직접 재현한 결과가 아니다.
접근 방식과 제약
현재 확인 가능한 자료상 모델은 다운로드 가능한 오픈 웨이트가 아니라 Alibaba Cloud Model Studio를 통해 제공되는 호스팅 모델이다. 따라서 실제 사용에는 API·지역·가격·서비스 정책 확인이 필요하다. 공식 발표의 원래 GitHub Pages URL은 저장 시점에 404를 반환했으며, Tongyi Lab의 공식 Substack 발표를 실질적인 원문 보조 출처로 보존했다.
실무적 의미
실시간 음성 에이전트에는 지연을 우선하는 Flash, 내레이션·더빙·게임 캐릭터·고품질 콘텐츠 생성에는 Plus를 검토할 수 있다. 특히 자연어 스타일 지시와 비언어 태그를 함께 제공하므로 별도 음향 파라미터를 세밀하게 조정하지 않고도 연기 지시를 프롬프트에 포함하는 워크플로우가 가능하다.
관련 페이지
- qwen
- moc-ai-models
- moc-multimedia
- 2026-07-25-local-open-tts-models — Qwen이 호스팅형이라 로컬 오픈소스 TTS로 대체할 때
- 2026-04-15-gemini-3-1-flash-tts
- 2026-04-26-vibevoice-microsoft-voice-ai