음성 인식(STT), 음성 합성(TTS), 음성 입력 앱, Apple Speech API 관련 노트 모음


음성 입력 앱 (macOS)

노트설명
2026-04-04-whispree-korean-stt-llm-voice-input한국어 개발자용 STT + LLM 교정 음성 입력 (Groq/Codex)
2026-04-04-vvrite-on-device-voice-typingQwen3-ASR 온디바이스 음성 타이핑 (한국어 우수)
2026-04-04-freeflow-voice-dictationGroq 기반 무료 음성 받아쓰기 (컨텍스트 인식)

Apple Speech API

노트설명
2026-04-04-apple-speech-api-whisper-alternativeSpeechAnalyzer/SpeechTranscriber — Whisper 대비 2.2배 빠른 전사

음성 인식 모델

노트설명
2026-05-27-whisper-diarizationWhisper + NeMo 기반 화자 분리 ASR (5.5K★)
2026-04-04-apfel-mac-builtin-aiMac 내장 Apple 온디바이스 LLM 활용 도구 (FoundationModels.framework)

비디오·미디어 다운로드

노트설명
2026-04-05-open-source-video-download-extensionsVDH 대안 — Media Downloader Unleashed, Turbo DM, VidBee 등
2026-05-07-react-video-asciiWebGL2로 비디오를 ASCII 문자로 렌더링하는 React 컴포넌트

오디오-비주얼 생성

노트설명
2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generation교차 모달 메모리와 DMD 증류로 최대 5분 멀티샷 오디오-비디오 생성을 시도하는 모델

음성 입력 앱 비교

모델한국어네트워크후처리비고
WhispreeGroq/Codex + LLM우수 (교정)필요LLM 교정Structured Mode, Visual Context
vvriteQwen3-ASR우수불필요없음온디바이스 전용
FreeFlowGroq + LLM보통필요LLM 후처리컨텍스트 인식
Apple Speech APISpeechAnalyzer미확인불필요없음34분 영상 45초 처리

2026-07-18 신규 유입 (고아 정리)

노트설명
2026-07-25-local-open-tts-modelsQwen-Audio-3.0-TTS 대신 로컬에서 돌릴 수 있는 오픈소스 TTS(Kokoro·GPT-SoVITS·XTTS-v2 등) 비교.
2026-04-19-local-korean-xtts-engine한국어 숏츠 내레이션을 위한 로컬 one-take XTTS-v2 엔진.
2026-07-10-snapotterSnapOtter는 이미지, 영상, 오디오, PDF, 일반 파일 작업을 자체 서버에서 처리하는 셀프호스팅 도구 모음이다.
2026-07-07-openvoice-instant-voice-cloning짧은 참조 오디오만으로 화자 음색을 복제하고 감정·억양·언어를 별도 제어하는 feed-forward 구조의 오픈소스 Zero-shot TTS, MyShell.ai가 실서비스에 적용.
2026-07-11-vibevoice-microsoft-asr-ttsQwen2.5 기반의 7.5Hz 초저프레임 음성 토크나이저로 60분 ASR, 90분 다화자 TTS, 300ms 초저지연 스트리밍 TTS를 통합 제공하는 Microsoft 오픈소스 모델군.

관련 MOC