출처

요약

원문 URL: https://discuss.pytorch.kr/t/vidu-s1-shengshu/11332

Hermes CLI 요약 생성에 실패하여 원문 앞부분 기반의 임시 요약을 저장합니다.

원문 발췌

Vidu S1: 음성으로 실시간 제어하는 무한 길이 대화형 영상 생성 모델 / Vidu S1: a real-time interactive video generation model1536×1024 271 KB Vidu S1 소개: 기다리는 영상에서 대화하는 영상으로 영상 생성 AI에 프롬프트를 넣고 몇 분씩 기다려 완성된 영상을 받는 경험은 이제 익숙합니다. 하지만 생성이 끝날 때까지 우리는 그저 수동적으로 기다릴 뿐, 만들어지는 도중에 끼어들어 방향을 바꿀 수는 없습니다. Vidu S1 은 바로 이 지점을 겨냥한 연구입니다. 사용자가 음성으로 지시하면 화면 속 디지털 캐릭터가 실시간으로 그 동작을 수행하는, 음성 제어 기반의 실시간 대화형 영상 생성 모델(real-time interactive video generation model)입니다. 이 모델은 Tsinghua University와 Shengshu Technology(生数科技, Vidu 개발사)가 공동으로 발표했습니다. 핵심 특징을 한 줄로 요약하면, 사용자가 언제든 말로 개입해 캐릭터의 다음 행동을 지시할 수 있고, 흐릿함이나 화면 붕괴 없이 무한 길이로 이어지며, 일반 소비자용 GPU에서 540p 해상도를 최대 42 FPS로 만들어 낸다는 것입니다. 오프라인 일괄 생성 방식의 한계 Sora, Veo, Wan, [Seedance](https:…

관련 위키

원문 보존 위치

원문 전체는 2026-07-21-pytorchkr-topic-11332-vidu-s1-shengshusource_url 및 HTML 원문과 함께 저장되어 있습니다.