Qwen-Audio-3.0-TTS는 다운로드 불가능한 호스팅 모델이라, 로컬 무료 사용이 필요하면 아래 오픈소스 TTS로 대체한다.

개요

2026-07-24-qwen-audio-3-0-tts는 Alibaba Cloud Model Studio를 통해서만 제공되는 호스팅 TTS다. 오픈 웨이트가 아니라서 로컬에서 무료로는 실행할 수 없다. 이 노트는 로컬에서 돌릴 수 있는 인기 오픈소스 TTS 후보를 한국어 지원·음성 복제(클로닝)·하드웨어 요구량 기준으로 비교한다.

2026-07 기준 r/LocalLLaMA·TTS-Arena·개발자 블로그에서 가장 자주 거론되는 모델은 Kokoro-82M(기본값), GPT-SoVITS(한국어 zero-shot 클로닝), XTTS-v2(클로닝 + 다국어 밸런스) 세 축이다.

비교 표

모델파라미터라이선스한국어음성 복제하드웨어한 줄 평
Kokoro-82M82MApache 2.0지원불가CPU 가능 / GPU ~2–3GB VRAMTTS-Arena 오픈소스 1위, 가장 빠르고 가벼운 기본값
GPT-SoVITS~407M(V3)MIT 계열지원강력(zero-shot, 5초 샘플)GPU 권장한국어 zero-shot 클로닝 커뮤니티 1위
XTTS-v2 (Coqui)중형CPML(상업 제약)지원우수(~6초 샘플)GPU 권장다국어 17개 + 클로닝, “무료 ElevenLabs”
F5-TTS중형CC-BY-NC(비상업)부분 지원우수GPU 필요음질·클로닝 충실도 최상위, 속도는 느림
Fish Speech (S2)중형Apache 2.0 계열부분 지원우수GPU 필요TTS-Arena 오픈소스 최상위권 (S2)
Piper초경량MIT음성별 모델 필요불가CPU-first(라즈베리파이 가능)임베디드/오프라인 기기용, 속도 최강
Bark중형MIT부분약함GPU 필요웃음·한숨 등 비언어 표현·감정 표현력
Parler-TTS중형Apache 2.0미확인약함GPU 필요텍스트로 목소리 묘사(“친절한 여성처럼”)

라이선스는 상용 여부의 핵심이다. Apache 2.0과 MIT는 상업 이용이 자유롭지만, F5-TTS의 CC-BY-NC(비상업)와 XTTS-v2의 CPML은 상업 이용에 제약이 있다. 프로덕션 상용이라면 Kokoro·GPT-SoVITS·Piper 계열이 안전하다.

목적별 추천

그냥 빠르고 깔끔한 한국어 TTS      → Kokoro-82M (내장 목소리만, 클로닝 불가)
특정 목소리를 복제하고 싶다         → GPT-SoVITS (한국어 zero-shot 1위)
                                              또는 XTTS-v2 (다국어 + 깨끗한 샘플)
음질이 최우선                       → F5-TTS / Fish Speech S2
라즈베리파이/CPU/오프라인 기기      → Piper
웃음·한숨·감정 같은 비언어 표현     → Bark

다운로드

핵심 가중치는 모두 HuggingFace에서 받습니다. 설치·사용 가이드는 각 GitHub 저장소를 참고하세요.

Kokoro-82M

GPT-SoVITS

구조가 복잡해 여러 파일을 받아 GPT_SoVITS/pretrained_models/에 넣어야 한다.

Qwen-Audio-3.0-TTS와의 관계

Qwen의 차별점은 자연어 스타일 지시(“화난 목소리로”)와 인라인 감정 태그([giggles], [gasp])를 한 프롬프트에서 함께 쓸 수 있다는 점이다. 오픈소스 중 이 맛에 가장 가까운 것은 Bark(비언어 표현)과 Parler-TTS(텍스트 묘사 제어)다. 단 둘 다 한국어 자연스러움은 Kokoro·GPT-SoVITS에 밀린다. 즉 로컬 오픈소스 하나로 Qwen의 “감정 제어 + 다국어 고품질”을 완전히 대체하기는 아직 어렵고, 용도에 따라 모델을 골라야 한다.

관련 페이지