AI ASMR 판별이 어려운 이유는 미세한 재질 변화와 손동작, 소리의 타이밍을 함께 봐야 하는데 VLM은 워터마크 같은 표면 단서에 기대기 쉽기 때문입니다. Video Reality Test는 “영상이 그럴듯한가”와 “판별기가 생성 흔적을 실제로 이해하는가”를 한 번에 시험하는 벤치마크입니다.
AI ASMR 진짜, 가짜 판별, VLM 정확도가 56%에 그친 이유: 워터마크 편향
왜 하필 ASMR이 현실성 시험에 적합한가
ASMR 영상은 짧아도 검증할 요소가 많습니다. 칼이나 도구가 물체에 닿는 순간, 재질이 눌리거나 잘리는 모양, 그 변화와 마찰음, 절단음의 시간적 일치가 동시에 자연스러워야 합니다. 배경이나 인물이 멋있게 보이는 것만으로는 통과하기 어렵습니다.
벤치마크는 실제 ASMR 80개와 여섯 생성 모델이 만든 가짜 영상 480개를 사용합니다. 영상 길이는 5~10초입니다. 생성 모델은 짧은 시간 안에서도 물체의 형태, 동작의 연속성, 오디오-비디오 동기화를 모두 유지해야 하고, 탐지 모델은 어느 한쪽 단서에만 의존하지 않아야 합니다.
생성과 판별을 서로 다른 역할로 평가했다
평가는 같은 모델이 자기 결과를 칭찬하는 구조를 피하기 위해 creator와 reviewer 역할을 분리합니다. 리뷰 기준도 하나의 총점에 묻지 않고 네 축으로 나뉩니다.
- visual fidelity: 물체와 재질이 시각적으로 자연스러운가
- audio fidelity: 소리가 재질과 동작에 맞는가
- audio-visual consistency: 접촉 순간과 소리가 맞물리는가
- temporal consistency: 프레임 사이의 변화가 이어지는가
이 분리는 실무에도 유용합니다. 생성 모델을 비교할 때 “좋다/나쁘다”만 기록하면 재생성 전략을 세울 수 없습니다. 시각, 소리, 동기화, 시간 연속성 중 어디서 실패했는지 나눠야 prompt나 후처리를 바꿀 수 있습니다.
숫자보다 워터마크 실험이 더 중요하다
원문이 정리한 전체 판별 정확도는 인간 81.25%, Gemini 1.5 Pro 56%, GPT-4o 52.5%, Claude 3.5 51.25%입니다. 오디오를 함께 제공했을 때 개선 폭은 작았습니다. 이 결과만 보면 VLM이 우연 수준에 가깝다고 말할 수 있지만, 더 중요한 단서는 워터마크와 로고를 가린 실험입니다.
VLM은 특정 워터마크나 생성 서비스 로고를 가짜의 지름길로 사용했고, 이를 제거하거나 가리자 성능이 떨어졌습니다. 즉 높은 점수가 영상 속 물리 오류를 읽은 결과인지, 데이터 출처 표식을 외운 결과인지 분리해야 합니다. 탐지 시스템을 만들 때는 원본 영상 평가와 함께 워터마크 제거, crop, 재인코딩 같은 단서 교란 조건을 반드시 넣어야 합니다.
이 결과를 일반 영상 전체로 확대하면 안 된다
데이터는 ASMR 560개, 길이 5~10초에 집중돼 있습니다. 긴 서사 영상, 대화 영상, 스포츠처럼 다른 시간 구조에 같은 정확도가 적용된다고 볼 수 없습니다. API로 접근하는 폐쇄형 VLM의 동작도 버전과 설정에 따라 달라질 수 있습니다.
따라서 이 벤치마크의 실용적인 결론은 “어느 모델이 탐지 1등인가”가 아닙니다. 첫째, 사람이 볼 때와 모델이 볼 때의 단서를 분리합니다. 둘째, audio-only, video-only, audio-video 조건을 비교합니다. 셋째, 워터마크를 제거한 뒤에도 성능이 유지되는지 봅니다. 마지막으로 실제 서비스와 같은 압축, 길이, 도메인에서 다시 검증합니다. 생성물 탐지는 단일 정확도보다 단서가 사라졌을 때도 판단이 버티는가로 평가해야 합니다.
탐지 실험은 원본과 단서 교란본을 짝으로 만든다
워터마크가 있는 원본만 평가하면 모델이 생성 흔적을 이해했는지 출처 표식을 읽었는지 알 수 없습니다. 같은 영상을 워터마크 가림, 가장자리 crop, 재인코딩 조건으로 하나씩 바꾸고 판정이 어떻게 달라지는지 비교해야 합니다. 콘텐츠는 거의 같은데 특정 표식이 사라졌다는 이유로 답이 뒤집힌다면 탐지 근거가 약합니다.
| 실험 쌍 | 확인하려는 단서 | 위험 신호 |
|---|---|---|
| 원본, 워터마크 가림 | 로고 의존성 | 가림 뒤 정확도가 크게 흔들림 |
| 영상만, 오디오만 | 모달리티별 기여 | 한쪽이 무작위인데 결합 답은 확신함 |
| 원본, 재인코딩 | 압축 흔적 의존성 | 화질만 바뀌어 판정이 뒤집힘 |
| 전체, crop | 화면 가장자리 의존성 | 본 장면보다 테두리 정보에 민감함 |
각 쌍에서는 정답뿐 아니라 모델이 제시한 근거가 실제 frame과 sound에 있는지 확인합니다. “질감이 부자연스럽다”는 일반 문장만 반복한다면 근거가 아닙니다. 어느 접촉 순간, 어떤 물체 경계, 어떤 소리의 시차를 보았는지 시간 구간을 지정하게 하고 사람이 표본 검수합니다.
점수는 정확도 하나보다 오류 방향으로 읽는다
실제 영상을 가짜로 분류하는 false positive와 생성 영상을 실제로 놓치는 false negative는 사용처에 따라 비용이 다릅니다. 업로드를 자동 차단하는 시스템이라면 실제 창작물을 잘못 막는 오류가 중요하고, 내부 검수 대상을 고르는 시스템이라면 의심 영상을 놓치는 오류가 중요할 수 있습니다. 전체 정확도가 같아도 두 오류의 비율은 다를 수 있습니다.
따라서 실제, 생성 각각의 회수율과 판정 보류 비율을 기록합니다. 확신이 낮은 영상을 사람에게 넘길 수 있다면 모든 사례를 강제로 이진 분류하는 것보다 안전합니다. 다만 보류가 너무 많으면 자동화 효과가 사라지므로, 사람 검수량과 놓친 위험 사례를 함께 봐야 합니다.
인간과 VLM은 서로의 답을 복제하지 말아야 한다
사람 검수자가 모델 답을 먼저 보면 같은 워터마크 단서에 끌릴 수 있습니다. 독립적으로 판정한 뒤 불일치 사례만 비교하면 어떤 단서에서 판단이 갈렸는지 알기 쉽습니다. 시각 fidelity, 오디오 fidelity, 두 신호의 동기화, 시간 연속성을 별도 칸에 기록하면 최종 진짜, 가짜 답보다 재현 가능한 근거가 남습니다.
탐지기를 운영에 넣기 전에는 서비스에서 실제로 들어오는 해상도, 길이, 압축, 장르를 반영한 검증 세트를 고정합니다. 모델이나 API 버전이 바뀔 때 같은 세트를 다시 실행하고, 워터마크 없는 데이터에서도 성능이 유지되는지 봅니다. 이 절차가 없으면 탐지기는 생성 기술보다 플랫폼 표식을 분류하는 도구가 될 수 있습니다.
ASMR 장면은 접촉 전, 순간, 후로 나눠 본다
재질 변화와 소리의 정렬을 확인하려면 영상 전체에 한 설명을 붙이기보다 사건의 시간 구조를 나눕니다. 접촉 전에는 도구와 대상의 위치가 자연스러운지, 접촉 순간에는 표면 변형과 소리 시작이 맞는지, 접촉 후에는 잘린 조각이나 눌린 흔적이 다음 frame에도 남는지 봅니다. 이 세 구간 중 어디서 문제가 생겼는지 기록하면 단순한 “가짜 같음”보다 재현 가능한 판정 근거가 됩니다.
같은 물체에 여러 번 접촉하는 영상에서는 각 사건을 따로 표시합니다. 첫 절단은 자연스럽지만 두 번째에 도구가 물체를 통과하거나, 소리는 이어지는데 화면의 접촉이 끝날 수 있습니다. 평균적인 시청 인상은 짧은 오류를 놓칠 수 있으므로 frame 구간과 audio 파형의 시작점을 함께 대조해야 합니다.
VLM에 이 구조를 질문할 때도 먼저 실제, 생성 여부를 묻기보다 관찰 항목을 분리합니다. “도구가 닿은 시점”, “그 직후 물체의 변화”, “소리 시작 시점”을 각각 답하게 한 뒤 최종 판정을 요청하면 어떤 중간 관찰이 틀렸는지 알 수 있습니다. 다만 자세한 설명을 생성한다는 사실이 실제 관찰을 보장하지 않으므로 사람이 지정 구간을 확인해야 합니다.
배포 임계값은 탐지 목적에 맞춰 정한다
연구 벤치마크의 이진 정답과 운영 정책은 다릅니다. 자동 삭제처럼 되돌리기 어려운 조치는 높은 확신과 사람 확인이 필요하고, 내부 검수 queue의 우선순위를 정하는 용도라면 낮은 임계값으로 의심 사례를 넓게 모을 수 있습니다. 판정 결과에 사용한 단서와 불확실성을 함께 남기지 않으면 사용자는 왜 영상이 보류됐는지 이해하기 어렵습니다.
운영 중에는 생성 서비스의 워터마크 형식이나 영상 압축 방식이 바뀔 수 있습니다. 특정 로고가 나타난 데이터만 추가하면 shortcut을 더 강화할 수 있으므로, 표식이 없는 생성 영상과 같은 표식이 들어간 실제 영상 같은 반례를 함께 넣습니다. 성능 저하를 발견하면 단순 재학습 전에 어느 단서 쌍에서 판정이 무너졌는지부터 확인하는 편이 안전합니다.
함께 읽으면 이해가 이어지는 글
- AI 논문 그림, 한 번에 생성하면 왜 틀릴까? PaperBanana의 4단계 검수 — PaperBanana가 관련 그림 검색, 내용, style 설계, neural, code rendering, VLM self-critique를 나눠 학술 도식의 글자, 화살표, 수치 오류를 줄이는 방법과 검수 한계를 설명합니다.
- 예, 아니오 VQA에 VLM 전체 레이어가 필요할까? Super Neuron 조기 종료 — 범주형 시각 질의에서 초기 레이어의 특정 활성값으로 답을 일찍 결정하는 Super Neuron의 탐색법, 최대 5.1배 수치와 적용 한계를 설명합니다.
- AVControl은 LoRA 하나로 Audio, Video 제어를 끝낼까: Parallel Canvas 비용 — LTX-2를 고정하고 제어 신호를 추가 attention 토큰으로 넣는 AVControl 구조를 살펴보며, 적은 학습 파라미터와 길어진 시퀀스 비용을 함께 계산합니다.
자주 묻는 질문
VLM 정확도가 낮았던 가장 중요한 이유는 무엇인가요?
VLM이 재질과 동작의 물리적 오류보다 워터마크나 서비스 로고 같은 표면 단서에 의존한 점이 중요한 원인으로 드러났습니다.
오디오를 함께 주면 가짜 영상 판별이 해결되나요?
원문에서는 개선 폭이 작았습니다. audio-only, video-only, 결합 조건을 나눠 어느 단서가 실제 판단에 쓰였는지 확인해야 합니다.
이 벤치마크 결과를 모든 생성 영상에 적용해도 되나요?
아닙니다. 5~10초 ASMR 영상에 집중된 데이터이므로 긴 영상이나 다른 장르, 실제 서비스의 압축 조건에서 다시 평가해야 합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.