자주 묻는 질문 (FAQ)
Video Use는 타임라인 GUI 편집기 프로그램인가요?
아니요, Video Use는 전통적인 그래픽 타임라인 기반 GUI 소프트웨어가 아닙니다. Claude Code, Codex와 같은 AI 코딩 에이전트에 스킬(Skill) 형태로 등록하여 터미널 인터페이스에서 자연어 대화로 명령을 내리고, 에이전트가 백엔드에서 FFmpeg 스크립트를 제어해 영상을 완성하는 오픈소스 파이프라인입니다.
영상 프레임을 직접 LLM에 전달하지 않는데 어떻게 정밀한 컷 편집이 가능한가요?
ElevenLabs Scribe API를 활용해 음성 데이터에서 단어 단위의 정확한 타임스탬프와 추임새, 무음 구간 정보를 추출하고 이를 텍스트 대본으로 압축합니다. AI 에이전트는 이 텍스트를 기반으로 1차 편집 결정을 내린 후, 정밀 검증이 필요한 컷 경계면에서만 타임라인 시각화 스크립트를 호출해 필름스트립 및 오디오 파형 이미지를 부분 생성하여 검증합니다.
ElevenLabs API 키가 반드시 필요한가요? 다른 음성 인식 도구로 대체 가능한가요?
현재 기본 헬퍼 스크립트는 단어 단위 타임스탬프 및 높은 정확도의 화자 분리를 위해 ElevenLabs Scribe API를 사용하도록 작성되어 있습니다. 필요에 따라 Whisper 계열의 로컬 GPU 인식 모델로 스크립트를 직접 커스텀하여 사용할 수도 있지만, 레포지토리의 기본 파이프라인 동작을 위해서는 ElevenLabs API 키 설정이 권장됩니다.
컷 편집 시 오디오가 튀거나 뚝뚝 끊기는 현상(Poping Issue)은 어떻게 해결하나요?
Video Use는 프로덕션 표준 무결성 규칙을 준수하도록 설계되었습니다. 모든 Segment 자르기 및 합치기 시 컷 경계면에 30ms 길이의 오디오 페이드 인/아웃 필터를 자동으로 삽입하며, 최종 필터 체인 최하단에서 자막 및 오버레이를 렌더링함으로써 음성 팝 현상과 프레임 열화를 방지합니다.
기존 NLE 소프트웨어(Premiere Pro, Final Cut Pro)와 비교했을 때 가장 큰 장점은 무엇인가요?
수십 분 분량의 촬영본에서 추임새(“어…”, “음…”) 제거, 반복 촬영분 선별, 색보정, 자막 생성, 2-단어 강조 애니메이션 삽입 등 단순 반복적인 컷 구성 및 후가공 작업을 자연어 한 문장으로 몇 분 만에 자동화할 수 있다는 점입니다.