출처

SeedRealtime: ByteDance Seed의 오디오 비주얼 전이중 모델

개요

ByteDance Seed는 2026년 8월 5일 오디오와 영상을 함께 처리하는 전이중(Full-Duplex) 모델 SeedRealtime을 공개했습니다. 이 모델은 오디오·영상 스트림을 계속 받아들이면서 사용자의 발화 종료를 기다리는 대신, 언제 듣고 말할지와 먼저 개입할지를 모델 내부에서 판단한다고 소개되었습니다. ByteDance Seed는 기존 ASR·VLM·TTS 캐스케이드 방식에서 발생하는 지연과 정보 손실을 줄이고, 장면 이해·능동적 상호작용·자연스러운 대화 타이밍을 구현하는 것을 목표로 제시했습니다. 가중치·기술 보고서·공개 API는 제공되지 않았으며, ByteDance는 자사 Doubao 앱에 전면 배포했다고 밝혔습니다.

핵심 포인트

  • 오디오 비주얼 결합 이해: 음성뿐 아니라 화면 속 인물, 물체, 손짓, 장면을 함께 참고해 발화의 의미를 해석합니다.
  • 전이중 대화: 외부 VAD가 사용자의 발화 종료를 판정한 뒤 응답하는 반이중 구조와 달리, 듣는 중에도 말할 시점과 끼어들기 여부를 계속 판단합니다.
  • 능동적 상호작용: 박물관의 특정 유물이 화면에 들어오거나, 에스프레소 추출 과정에서 문제가 발견되는 등 사용자가 직접 질문하지 않아도 필요한 순간에 먼저 반응합니다.
  • 연속적인 시각 지각: 빠르게 넘어가는 ResNet 논문에서 요청한 학습 설정 절을 찾아 멈추는 것처럼, 스트림을 지켜보다가 목표 정보를 발견하면 자발적으로 개입하는 사례가 제시되었습니다.
  • 소음과 잡담 처리: 공항 안내 방송이나 주변 통화처럼 무관한 음성을 걸러내면서도, 필요한 발화와 시각 정보를 유지해 대화 타이밍을 조절한다고 설명되었습니다.
  • 공개 평가의 한계: 캐스케이드 모델과 비교해 대화 타이밍 문제가 절반으로 줄었다는 자체 사람 평가 결과가 공개됐지만, 비교 모델과 세부 정량표는 제시되지 않았습니다.

왜 중요한가

기존 실시간 음성·비전 시스템은 ASR, VLM, TTS와 별도 턴 판정 모듈을 조합하는 경우가 많아 지연과 모달리티 변환에 따른 정보 손실이 발생할 수 있습니다. SeedRealtime은 ByteDance Seed의 설명대로라면 지각·이해·판단·응답 생성을 하나의 종단간 오디오 비주얼 모델 안에서 병렬적으로 처리해, 사람처럼 듣고 보면서 대화하는 상호작용을 겨냥합니다. 다만 현재 공개된 근거는 공식 시연과 제한적인 자체 평가 중심이며, 모델 구조·가중치·공개 API가 제공된 것은 아니므로 기술적 성능을 독립적으로 검증할 자료는 제한적입니다.

후속으로 볼 링크와 키워드

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-08-pytorchkr-topic-11561-seedrealtime-bytedance-seed-full-duplexsource_url 및 HTML 원문과 함께 저장되어 있습니다.