음성 인식(STT), 음성 합성(TTS), 음성 입력 앱, Apple Speech API 관련 노트 모음


화면 녹화·영상 편집

노트설명
[[summaries/2026-09-04-github-kajisho5-ffmpeg-skill2026-09-04-github-kajisho5-ffmpeg-skill]]
2026-08-05-sechak-ag-capptivo멀티플랫폼 Tauri 화면 녹화·편집 앱 — ScreenCaptureKit/Windows.Graphics.Capture/PipeWire, 자막·줌·export
2026-08-09-github-microsoft-zoomitformacmacOS 메뉴 막대형 ZoomIt — 화면 확대·주석·OCR·MP4 녹화·웹캠 PIP·스크롤 파노라마

음성 입력 앱 (macOS)

노트설명
2026-04-04-whispree-korean-stt-llm-voice-input한국어 개발자용 STT + LLM 교정 음성 입력 (Groq/Codex)
2026-04-04-vvrite-on-device-voice-typingQwen3-ASR 온디바이스 음성 타이핑 (한국어 우수)
2026-04-04-freeflow-voice-dictationGroq 기반 무료 음성 받아쓰기 (컨텍스트 인식)
2026-08-08-wispr-flow-vs-handy-korean-sttWispr Flow와 Handy/Qwen3-ASR 1.7B의 한국어·로컬 처리·비용·성능 근거 비교

Apple Speech API

노트설명
2026-04-04-apple-speech-api-whisper-alternativeSpeechAnalyzer/SpeechTranscriber — Whisper 대비 2.2배 빠른 전사

음성 인식 모델

노트설명
[[summaries/2026-05-27-whisper-diarization2026-05-27-whisper-diarization]]
2026-04-04-apfel-mac-builtin-aiMac 내장 Apple 온디바이스 LLM 활용 도구 (FoundationModels.framework)

음성 합성 모델

노트설명
2026-08-08-github-kyutai-labs-pocket-ttsKyutai의 100M 파라미터 CPU 중심 TTS — 24kHz streaming, voice state 재사용·cloning, Python API/CLI/FastAPI
2026-08-13-github-openbmb-voxcpmOpenBMB VoxCPM2 — tokenizer-free 30개 언어·48kHz TTS, voice design·cloning·streaming·LoRA
[[summaries/2026-08-15-x-gas1688-voxcpm22026-08-15-x-gas1688-voxcpm2]]

외부 큐레이션·커뮤니티

노트설명
[[summaries/2026-08-05-hada-32125-krafton-ax-k2-raon-speech2026-08-05-hada-32125-krafton-ax-k2-raon-speech]]

비디오·미디어 다운로드

노트설명
2026-04-05-open-source-video-download-extensionsVDH 대안 — Media Downloader Unleashed, Turbo DM, VidBee 등
2026-05-07-react-video-asciiWebGL2로 비디오를 ASCII 문자로 렌더링하는 React 컴포넌트
2026-08-08-github-oso95-scroll-world프레임 고정형 dive/connector 영상과 vanilla-JS scroll scrub engine을 묶은 3D landing page 스킬

오디오-비주얼 생성

노트설명
2026-08-15-github-starknightt-night-streetThree.js + R3F로 빌드한 Golden Hour 도시 거리 — 모든 텍스처·메시·조명·사운드가 코드로 생성된 프로시저럴 3D 렌더링. Web Audio 합성 DSP 포함.
[[summaries/2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generation2026-07-12-pytorchkr-topic-11207-joyai-echo-long-audio-visual-generation]]
2026-08-15-x-owenyuwono-poseidonThree.js WebGPU/TSL로 GPU에서 FFT·파도 스펙트럼·거품을 계산하는 실시간 해양 시뮬레이션 — X 티저와 저장소 심층 정리

음성 입력 앱 비교

모델한국어네트워크후처리비고
WhispreeGroq/Codex + LLM우수 (교정)필요LLM 교정Structured Mode, Visual Context
vvriteQwen3-ASR우수불필요없음온디바이스 전용
FreeFlowGroq + LLM보통필요LLM 후처리컨텍스트 인식
Wispr Flowcloud ensemble지원필요filler/formatting/context100+ 언어, 비영어 정확도 한계 명시
HandyQwen3-ASR 1.7B 등 선택지원불필요(core)optional post-processingMIT, 로컬·오프라인; Qwen 1.7B catalog 확인
Apple Speech APISpeechAnalyzer미확인불필요없음34분 영상 45초 처리

2026-07-18 신규 유입 (고아 정리)

노트설명
2026-07-25-local-open-tts-modelsQwen-Audio-3.0-TTS 대신 로컬에서 돌릴 수 있는 오픈소스 TTS(Kokoro·GPT-SoVITS·XTTS-v2 등) 비교.
2026-04-19-local-korean-xtts-engine한국어 숏츠 내레이션을 위한 로컬 one-take XTTS-v2 엔진.
2026-07-10-snapotterSnapOtter는 이미지, 영상, 오디오, PDF, 일반 파일 작업을 자체 서버에서 처리하는 셀프호스팅 도구 모음이다.
2026-07-07-openvoice-instant-voice-cloning짧은 참조 오디오만으로 화자 음색을 복제하고 감정·억양·언어를 별도 제어하는 feed-forward 구조의 오픈소스 Zero-shot TTS, MyShell.ai가 실서비스에 적용.
2026-07-11-vibevoice-microsoft-asr-ttsQwen2.5 기반의 7.5Hz 초저프레임 음성 토크나이저로 60분 ASR, 90분 다화자 TTS, 300ms 초저지연 스트리밍 TTS를 통합 제공하는 Microsoft 오픈소스 모델군.

관련 MOC