Qwen-Audio-3.0-TTS는 다운로드 불가능한 호스팅 모델이라, 로컬 무료 사용이 필요하면 아래 오픈소스 TTS로 대체한다.
개요
2026-07-24-qwen-audio-3-0-tts는 Alibaba Cloud Model Studio를 통해서만 제공되는 호스팅 TTS다. 오픈 웨이트가 아니라서 로컬에서 무료로는 실행할 수 없다. 이 노트는 로컬에서 돌릴 수 있는 인기 오픈소스 TTS 후보를 한국어 지원·음성 복제(클로닝)·하드웨어 요구량 기준으로 비교한다.
2026-07 기준 r/LocalLLaMA·TTS-Arena·개발자 블로그에서 가장 자주 거론되는 모델은 Kokoro-82M(기본값), GPT-SoVITS(한국어 zero-shot 클로닝), XTTS-v2(클로닝 + 다국어 밸런스) 세 축이다.
비교 표
| 모델 | 파라미터 | 라이선스 | 한국어 | 음성 복제 | 하드웨어 | 한 줄 평 |
|---|---|---|---|---|---|---|
| Kokoro-82M | 82M | Apache 2.0 | 지원 | 불가 | CPU 가능 / GPU ~2–3GB VRAM | TTS-Arena 오픈소스 1위, 가장 빠르고 가벼운 기본값 |
| GPT-SoVITS | ~407M(V3) | MIT 계열 | 지원 | 강력(zero-shot, 5초 샘플) | GPU 권장 | 한국어 zero-shot 클로닝 커뮤니티 1위 |
| XTTS-v2 (Coqui) | 중형 | CPML(상업 제약) | 지원 | 우수(~6초 샘플) | GPU 권장 | 다국어 17개 + 클로닝, “무료 ElevenLabs” |
| F5-TTS | 중형 | CC-BY-NC(비상업) | 부분 지원 | 우수 | GPU 필요 | 음질·클로닝 충실도 최상위, 속도는 느림 |
| Fish Speech (S2) | 중형 | Apache 2.0 계열 | 부분 지원 | 우수 | GPU 필요 | TTS-Arena 오픈소스 최상위권 (S2) |
| Piper | 초경량 | MIT | 음성별 모델 필요 | 불가 | CPU-first(라즈베리파이 가능) | 임베디드/오프라인 기기용, 속도 최강 |
| Bark | 중형 | MIT | 부분 | 약함 | GPU 필요 | 웃음·한숨 등 비언어 표현·감정 표현력 |
| Parler-TTS | 중형 | Apache 2.0 | 미확인 | 약함 | GPU 필요 | 텍스트로 목소리 묘사(“친절한 여성처럼”) |
라이선스는 상용 여부의 핵심이다. Apache 2.0과 MIT는 상업 이용이 자유롭지만, F5-TTS의 CC-BY-NC(비상업)와 XTTS-v2의 CPML은 상업 이용에 제약이 있다. 프로덕션 상용이라면 Kokoro·GPT-SoVITS·Piper 계열이 안전하다.
목적별 추천
그냥 빠르고 깔끔한 한국어 TTS → Kokoro-82M (내장 목소리만, 클로닝 불가)
특정 목소리를 복제하고 싶다 → GPT-SoVITS (한국어 zero-shot 1위)
또는 XTTS-v2 (다국어 + 깨끗한 샘플)
음질이 최우선 → F5-TTS / Fish Speech S2
라즈베리파이/CPU/오프라인 기기 → Piper
웃음·한숨·감정 같은 비언어 표현 → Bark
다운로드
핵심 가중치는 모두 HuggingFace에서 받습니다. 설치·사용 가이드는 각 GitHub 저장소를 참고하세요.
Kokoro-82M
- 모델: https://huggingface.co/hexgrad/Kokoro-82M (현재 v0.19)
- 코드: https://github.com/hexgrad/kokoro
- 데모: https://huggingface.co/spaces/hexgrad/Kokoro-TTS
- 설치:
pip install kokoro— 패키지가 알아서 가중치를 가져온다
GPT-SoVITS
구조가 복잡해 여러 파일을 받아 GPT_SoVITS/pretrained_models/에 넣어야 한다.
- 전체 모델팩: https://huggingface.co/lj1995/GPT-SoVITS — 기본 GPT/SoVITS + BERT(chinese-roberta-wwm-ext-large, chinese-hubert-base 등) 포함
- 코드·설치 가이드: https://github.com/RVC-Boss/GPT-SoVITS
- v4 가중치: https://huggingface.co/kevinwang676/GPT-SoVITS-v4 —
gsv-v4-pretrained/s2v4.pth(또는.ckpt)와vocoder.pth추가 - G2PW(G2P): https://paddlespeech.cdn.bcebos.com/Parakeet/released_models/g2p/G2PWModel_1.1.zip
- 중국 접속 미러: https://gitee.com/hf-models/GPT-SoVITS
Qwen-Audio-3.0-TTS와의 관계
Qwen의 차별점은 자연어 스타일 지시(“화난 목소리로”)와 인라인 감정 태그([giggles], [gasp])를 한 프롬프트에서 함께 쓸 수 있다는 점이다. 오픈소스 중 이 맛에 가장 가까운 것은 Bark(비언어 표현)과 Parler-TTS(텍스트 묘사 제어)다. 단 둘 다 한국어 자연스러움은 Kokoro·GPT-SoVITS에 밀린다. 즉 로컬 오픈소스 하나로 Qwen의 “감정 제어 + 다국어 고품질”을 완전히 대체하기는 아직 어렵고, 용도에 따라 모델을 골라야 한다.
관련 페이지
- 2026-07-24-qwen-audio-3-0-tts — 이 비교의 출발점, 호스팅형 TTS
- moc-multimedia — 음성·TTS 노트 이정표
- 2026-04-19-local-korean-xtts-engine — 한국어 로컬 XTTS-v2 엔진 (이 노트의 XTTS-v2 실사례)
- 2026-07-07-openvoice-instant-voice-cloning — OpenVoice zero-shot 클로닝
- 2026-04-26-vibevoice-microsoft-voice-ai — Microsoft VibeVoice ASR/TTS
- 2026-04-15-gemini-3-1-flash-tts — Gemini 3.1 Flash TTS
- 2026-04-26-local-llm-formats-comparison — 로컬 추론 포맷(MLX/GGUF) 비교, 로컬 실행 맥락