포스트

이미지 한 장이 5턴 뒤 답변을 바꿀 수 있을까? VMI 공격이 노리는 기억

가능하다고 논문은 보여 줍니다. 다만 이는 공격자가 Qwen3-VL의 내부에 접근해 이미지를 최적화한 화이트박스 조건의 결과이며, 모든 모델과 이미지에서 같은 효과가 난다는 뜻은 아닙니다. 실무에서 가져갈 핵심은 특정 공격 성공률보다, 업로드 순간에만 이미지를 검사하는 한 턴 보안 평가가 장기 기억의 위험을 놓칠 수 있다는 점입니다.

Visual Memory Injection 논문은 이미지가 처음 등장한 시점이 아니라 여러 대화 뒤에 모델의 답변을 바꾸는 공격을 다룹니다. 일반적인 이미지 공격은 바로 다음 응답에서 이상이 드러나지만, VMI는 초반 질문에는 정상적으로 답하게 만들어 검수를 지나간 뒤 특정 주제가 나왔을 때 목표 행동을 유도합니다.

VMI는 왜 첫 답변에서 드러나지 않나요?

공격 이미지는 원본에서 눈에 띄는 차이를 줄이면서 두 목표를 동시에 만족하도록 최적화됩니다. 하나는 지정된 주제에서 목표 응답을 끌어내는 것이고, 다른 하나는 초반의 평범한 이미지 질문에는 정상적으로 답하게 하는 것입니다. 논문 설정의 섭동 한도는 $8/255$입니다.

VMI 공격의 전체 흐름

여기서 중요한 공격 표면은 이미지 파일 자체만이 아닙니다. 모델이 이미지를 대화 기억에 계속 포함하고 이후 질문과 연결하는 방식이 핵심입니다. 공격자는 가짜 대화 맥락을 반복하는 context cycling으로 여러 턴 뒤에도 효과가 남게 하고, anchoring prompt로 초반 이미지 질의응답이 자연스럽게 유지되도록 합니다.

이는 “이미지를 한 번 검사했으니 이후 턴도 안전하다”는 가정을 흔듭니다. 첫 답변이 정상이라는 사실은 장기 대화에서 이미지가 어떤 조건 신호로 작동할지 증명하지 못합니다.

일반적인 즉시 공격과 VMI의 차이는 이상 행동이 나타나는 시간입니다. 즉시 공격은 이미지 직후의 질문과 응답을 검사해도 잡힐 수 있지만, 지연형 공격은 정상적인 여러 문답 사이에 이미지 표현이 남아 있다가 특정 주제와 결합될 때 효과가 나타납니다. 따라서 입력 필터가 이미지를 통과시킨 기록만으로 이후 답변의 신뢰도를 유지해서는 안 됩니다.

기억에 남는다는 말도 모델이 이미지를 사람처럼 장기 기억한다는 뜻은 아닙니다. 서비스가 이전 이미지나 그 표현을 다음 추론의 컨텍스트에 다시 포함하고, 모델이 현재 질문과 그 표현 사이의 관련성을 계산하기 때문에 영향이 이어지는 것입니다. 실제 위험 범위는 원본 이미지를 계속 넣는지, 요약이나 임베딩만 남기는지, 몇 턴 뒤 제거하는지에 따라 달라집니다.

지연 효과와 일반적인 대화 편향은 어떻게 구분하나요?

뒤늦게 답변이 바뀌었다는 사실만으로 이미지 공격이라고 단정할 수는 없습니다. 중간 대화의 문장, 시스템 지침, 검색 결과나 샘플링 변동이 응답을 바꿀 수도 있습니다. 이미지가 원인인지 확인하려면 같은 대화를 이미지 없이 실행한 조건, 원본 이미지와 처리된 이미지를 넣은 조건, 대화 순서만 바꾼 조건을 함께 비교해야 합니다.

평가 시드와 생성 설정을 고정할 수 있다면 반복 변동을 줄이는 데 도움이 됩니다. 그래도 한 번의 성공 사례보다 여러 표현의 질문과 여러 대화 길이에서 경향이 반복되는지를 보아야 합니다. 특정 문구 하나에서만 결과가 나오면 모델의 넓은 취약점이라기보다 좁은 조건 결합일 가능성이 있으므로 보고 범위를 그 조건에 맞춰 제한합니다.

어떤 실험 조건에서 효과가 관찰됐나요?

연구는 주식, 정치, 제품 등 네 가지 시나리오와 표현을 바꾼 질문을 사용합니다. Qwen3-VL을 대상으로 최적화한 실험에서 다섯 턴 이후에도 공격 성공률이 80%를 넘는 조건을 보고했습니다.

여러 턴에서의 VMI 결과

또한 같은 계열에만 머무르지 않고 파인튜닝된 SEA-LION과 Med3로의 전이도 관찰했습니다. 그러나 전이 결과가 곧 모든 폐쇄형 모델이나 서비스에서 재현된다는 의미는 아닙니다. 모델의 이미지 전처리, 대화 기억 방식, 리사이즈와 압축 정책이 달라지면 결과도 바뀔 수 있습니다.

80%가 넘었다는 수치는 논문의 공격 목표, 질문 집합, 턴 수와 최적화 조건 안에서 읽어야 합니다. 서비스 방어율이나 일반 사용자의 피해 확률로 바로 변환할 수 없습니다. 특히 화이트박스 공격은 대상 모델의 내부 정보로 이미지를 맞추므로, 내부 접근이 없는 공격자가 동일한 계산 비용으로 재현할 수 있는지는 별도로 검증해야 합니다.

파인튜닝 모델로의 전이는 중요한 신호지만 범용 전이를 증명하지 않습니다. 같은 기초 모델에서 출발한 모델들은 시각 표현이나 전처리 일부를 공유할 수 있고, 서로 다른 제공자의 폐쇄형 서비스는 컨텍스트 구성 방식조차 공개되지 않을 수 있습니다. 전이 평가는 모델 이름 수를 늘리는 것보다 서로 다른 전처리, 기억 정책을 가진 조건을 분리하는 편이 해석에 도움이 됩니다.

VMI 공격의 전이 평가

다중 턴 서비스는 어디에서 다시 검사해야 하나요?

이 연구에서 바로 가져올 수 있는 실무 질문은 공격을 재현하는 법이 아니라 입력과 기억을 어디서 다시 검증할지입니다.

  1. 업로드 직후뿐 아니라 이미지가 이후 답변의 근거로 다시 사용될 때 검사하는가
  2. 오래된 이미지가 현재 질문과 무관한데도 컨텍스트에 남아 있는가
  3. 특정 주제로 전환한 뒤 답변 분포가 급격히 달라지는지 추적하는가
  4. 원본과 리사이즈, 압축본 사이에서 안전 평가 결과가 일관적인가
  5. 이미지 근거를 제거한 답변과 비교할 수 있는가

대화 단계별 공격 분석

이미지 정규화나 노이즈 제거는 검토할 방어 후보일 수 있지만, 이 논문만으로 검증된 해결책이라고 단정할 수는 없습니다. 강한 전처리는 정상 이미지 정보도 훼손할 수 있어 공격 성공률과 일반 이미지 성능을 함께 측정해야 합니다.

검사 위치는 업로드 단계, 기억 저장 단계, 기억을 다시 꺼내는 단계, 최종 응답 단계로 나눌 수 있습니다. 업로드 때에는 파일 형식과 기본 안전성을 확인하고, 저장 단계에서는 원본과 파생 표현 중 무엇을 얼마나 오래 보관할지 정합니다. 검색 단계에서는 현재 질문과 관련 없는 과거 이미지를 제외하고, 응답 단계에서는 오래된 이미지 하나가 결론을 지배하는지 근거를 확인합니다.

기억을 무조건 짧게 자르면 정상적인 상담이나 문서 분석 품질도 떨어질 수 있습니다. 그래서 턴 수 하나로 삭제하기보다 업무 유형별 보존 기간, 현재 질문과의 관련도, 이미지 출처의 신뢰 수준을 조합하는 정책이 필요합니다. 사용자가 이미지를 제거하면 원본뿐 아니라 캐시, 요약, 임베딩에서도 영향이 사라지는지도 시험해야 합니다.

운영 로그에는 이미지 원본을 다시 저장하지 않더라도 어느 응답이 어떤 과거 입력을 참조했는지 추적할 최소 메타데이터가 필요합니다. 그래야 특정 주제로 전환한 뒤 이상 응답이 증가했을 때 영향 범위를 찾을 수 있습니다. 다만 보안을 이유로 민감한 이미지와 대화 전체를 장기간 남기면 새로운 개인정보 위험이 생기므로 접근 권한과 보존 기간을 함께 제한해야 합니다.

방어 후보는 어떤 시험표로 비교해야 하나요?

한 가지 전처리만 켜고 공격 성공률을 재는 것으로는 부족합니다. 원본, 리사이즈, 재인코딩, 압축 조건을 나누고 각 조건에서 정상 이미지 질의 정확도와 지연을 함께 측정합니다. 그다음 이미지가 현재 턴에 있을 때와 여러 턴 전에 있을 때, 관련 질문과 무관한 질문을 할 때를 교차해 방어가 지연 효과에도 유지되는지 확인합니다.

모델 조건도 공격에 사용한 모델, 같은 계열의 다른 체크포인트, 다른 전처리를 쓰는 모델로 나눕니다. 대화 조건은 중간 턴 수와 문장 표현을 바꾸되 목표 의미는 유지합니다. 이 표에서 공격 효과는 낮추지만 정상 이미지 이해도도 크게 낮추는 방어는 실제 서비스에 쓰기 어렵고, 특정 압축률에서만 작동하는 방어는 우회 가능성을 별도로 살펴야 합니다.

최종 판단에는 공격 성공률만 아니라 정상 과제 성능, 추가 지연, 잘못 차단한 비율, 기억 삭제의 완전성을 함께 둡니다. 논문이 완성된 방어를 제시하지 않는 만큼, 이 평가표는 하나의 제품 등급을 선언하기보다 취약한 구간을 찾는 회귀 테스트로 운영하는 편이 적절합니다.

논문이 아직 답하지 못한 질문은 무엇인가요?

이 연구의 가장 큰 제약은 화이트박스 최적화입니다. 공격자가 모델 내부 확률과 기울기를 볼 수 없는 환경에서도 같은 비용으로 작동하는지는 별도 문제입니다. 서비스가 적용하는 압축, 재인코딩, 크기 변경에 대한 견고성도 충분히 검증되지 않았고, 논문은 완성된 방어 체계를 제시하지 않습니다.

VMI의 추가 실험

따라서 이 결과는 공포를 키울 근거보다 테스트 범위를 넓힐 근거로 쓰는 편이 낫습니다. 멀티모달 챗봇의 보안 평가는 한 턴의 유해 응답만 확인해서는 부족하며, 정상 대화 뒤 주제가 바뀌는 장기 시나리오와 이미지 제거 대조군까지 포함해야 합니다.

서비스 담당자는 먼저 실제 제품이 과거 이미지를 어떤 형태로 다음 요청에 전달하는지 문서화해야 합니다. 그 경로가 없다면 논문의 위협 모델을 그대로 적용할 이유가 줄고, 경로가 있다면 기억 수명과 재검사 지점을 우선 시험할 수 있습니다. 연구 결과를 정확히 쓰는 방법은 “모든 이미지가 시한폭탄”이라고 말하는 것이 아니라, 장기 컨텍스트를 새로운 공격 표면으로 보고 제품의 구체적인 기억 경로를 검증하는 것입니다.

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    7개 장 19 분읽는 시간