출처

  • source_url: https://aisparkup.com/posts/15009
  • author: Spark
  • published: Wed, 05 Aug 2026 08:48:06 +0000
  • raw: raw source: 2026-08-05-aisparkup-post-15009-3-12kb-video-use

프레임 3만 장 대신 12KB, 코딩 에이전트를 영상 편집기로 만든 video-use

개요

video-use는 원본 영상 파일이 있는 폴더에서 Claude Code나 Codex 같은 코딩 에이전트와 대화해 영상을 편집하는 오픈소스 도구다.
LLM이 전체 프레임을 직접 분석하는 대신, 음성을 단어 단위 타임스탬프와 화자·오디오 이벤트가 포함된 약 12KB의 텍스트로 변환해 기본 편집 정보로 사용한다.
시각 정보는 필요한 구간에 한해 필름스트립·파형·단어 라벨 이미지로 추가 확인한다.
에이전트는 전사, 편집 판단, EDL 생성, 렌더링, 자체 평가를 거치며, 문제가 발견되면 최대 세 번까지 수정 후 재렌더링한다.
토킹 헤드·인터뷰·튜토리얼처럼 음성 중심인 영상에 적합하며, 대사가 적거나 프레임 단위 타이밍이 중요한 편집에는 근거가 제한적일 수 있다.

핵심 포인트

  • 텍스트 중심 영상 분석: 프레임 약 3만 장을 직접 입력하는 대신, 모든 테이크의 전사 결과를 하나의 읽기용 파일로 패킹한다.
  • 승인 후 편집: 에이전트가 먼저 소스를 분석하고 편집 전략을 제안하며, 사용자가 승인한 뒤 edit/ 폴더에 결과물을 생성한다.
  • 선택적 시각 확인: 침묵 구간, 테이크 비교, 컷 지점 확인 등 필요한 경우에만 필름스트립과 파형을 호출한다.
  • 자동 편집 및 렌더링: 필러 워드, 잘못 시작한 부분, 테이크 사이의 빈 구간을 제거하고 컷마다 30ms 오디오 페이드를 적용한다.
  • 렌더 결과 자체 평가: 컷 경계의 화면 전환, 오디오 팝, 자막 가림 등을 검사하고 문제가 있으면 수정 후 다시 렌더링한다.
  • 규칙과 취향의 분리: 오디오 팝 제거처럼 제작상 정확성이 필요한 항목은 규칙으로 고정하고, 색감이나 자막 스타일 같은 취향은 변경 가능하게 둔다.
  • 세션 기억: 작업 상태와 맥락을 project.md에 기록해 이후 세션에서 이어서 작업할 수 있다.

왜 중요한가

video-use는 영상 편집 에이전트에 모든 시각 데이터를 입력하기보다, 먼저 구조화된 전사 정보를 제공하고 시각 검사를 선택적으로 수행하는 방식을 보여준다. 이는 browser-use가 스크린샷 대신 구조화된 DOM 정보를 활용하는 접근을 영상 편집에 적용한 사례로 볼 수 있다. 다만 음성 경계와 침묵 구간을 중심으로 편집하므로 모든 영상 편집 작업을 대체하는 도구라기보다, 음성 중심 콘텐츠의 자동화 가능성을 탐색한 구현에 가깝다.

참고 링크

관련 위키

원문 보존 위치

원문 전체는 raw source: 2026-08-05-aisparkup-post-15009-3-12kb-video-usesource_url 및 HTML 원문과 함께 저장되어 있습니다.