개요
JoyAI-Echo는 JD Joy Future Academy Echo 팀이 공개한 추론 전용 긴 영상 생성 프레임워크로, 하나의 프롬프트 JSON에서 최대 5분 길이의 연속 멀티샷 오디오-비디오를 생성하는 것을 목표로 한다. 교차 모달 오디오-비주얼 메모리 뱅크로 샷 사이의 인물 외형과 음성 맥락을 유지하고, 메모리 기반 강화학습과 DMD(Distribution Matching Distillation)를 결합해 소수 스텝 추론을 지원한다. 원문은 기존 다단계 파이프라인 대비 약 7.5배 속도 향상과 저자 측 사용자 선호도 평가 결과를 보고하지만, 해당 수치는 독립 재현이 아닌 저자 측 주장이다.
핵심 포인트
prompts리스트의 각 문자열이 하나의 샷이 되며, 여러 샷을 넣으면 앞선 샷의 정보를 이어받는 멀티샷 스토리를 생성한다.- 영상과 오디오를 한 파이프라인에서 함께 생성하며, 이전 샷의 시각적 정체성과 음성 맥락을 메모리 뱅크로 다음 샷에 전달한다.
- DMD 증류 기반 소수 스텝 추론으로 원래 다단계 파이프라인 대비 약 7.5배 빠른 추론을 보고한다.
- 저자 측 GSB 평가에서 긴 영상 비교 대상 대비 시각적 완성도 63.6%, 오디오 품질 81.7%, 프롬프트 준수 80.6%, IP 일관성 59.4%의 선호도를 보고했다.
- 평가 규모는 100개 벤치마크 스토리, 3,000개 생성 샷, 샷당 241프레임(25fps)으로 제시됐다.
- 참조 환경은 Python 3.11·PyTorch 2.8·CUDA 12.8이며, 기본 설정에서 약 46~50GB GPU 메모리와 약 46GB 체크포인트가 필요하다고 안내한다.
- Echo-SR과 Director Agent는 게시 시점에 저장소 TODO List의 공개 예정 항목으로 언급되며, 현재 공개 릴리스의 범위를 넘는다.
왜 중요한가
긴 영상 생성에서 시간축 일관성, 인물 정체성, 음성 연속성을 함께 다루려는 오픈소스 접근이라는 점이 핵심이다. 특히 샷 단위 생성과 메모리 전달을 결합해 짧은 클립 생성에서 멀티샷 스토리 생성으로 확장하려는 설계 방향을 보여준다. 다만 추론 전용 공개이고 하드웨어 요구량이 높으며, LTX-2 Community License Agreement에 따라 원문은 학술·연구 목적의 비상업적 사용과 상업적 사용 전 라이선스 확인을 안내한다.
후속으로 볼 링크/키워드
- 프로젝트 페이지: https://echo-team-joy-future-academy-jd.github.io/Echo-LongVideo-Page/
- GitHub 저장소: https://github.com/jd-opensource/JoyAI-Echo
- Hugging Face 모델: https://huggingface.co/jdopensource/JoyAI-Echo
- ComfyUI 노드: https://github.com/zhuang2002/ComfyUI_JoyAI_Echo
- 라이선스: https://github.com/jd-opensource/JoyAI-Echo/blob/main/LICENSE
- 관련 위키: moc-multimedia, moc-ai-models, 2026-04-10-open-sora-2-video-generation
- 키워드: 멀티샷 비디오 생성, 긴 영상 생성, 오디오-비주얼 메모리, DMD 증류, LTX-2, Gemma-3-12b, ComfyUI