포스트

검색 결과가 최신이어도 믿어야 할까? MMA의 출처, 시간, 충돌 점수

최신이라는 이유만으로 믿어서는 안 됩니다. MMA는 검색 유사도와 별개로 출처 신뢰도, 시간에 따른 가치 저하, 다른 기억과의 합의를 계산하고 근거가 약하면 답변을 보류합니다.

논문이 겨냥한 문제는 검색 자체보다 검색된 기억의 품질입니다. 기존 RAG는 질문과 가까운 문서나 이미지를 잘 찾더라도, 그 정보가 오래됐는지 또는 서로 모순되는지까지 자동으로 판별하지 못합니다. 이미지가 포함됐다는 이유만으로 모델이 그 근거를 과신하는 현상도 멀티모달 환경에서는 더 까다롭습니다.

유사도 위에 신뢰도를 다시 계산한다

MMA는 각 기억의 동적 신뢰도 $R_i$를 세 요소로 구성합니다.

  • 출처 자체의 신뢰도
  • 시간이 흐르며 적용되는 감쇠
  • 다른 근거들과 일치하는 정도

검색기는 먼저 관련 후보를 모으고, MMA는 이 점수로 근거의 비중을 다시 조정합니다. 오래된 기록이라도 변하지 않는 사실이면 가치가 남을 수 있고, 방금 생성된 정보라도 신뢰하기 어려운 출처이거나 다른 근거와 충돌하면 낮게 평가될 수 있습니다. 핵심은 “새 정보 우선”이 아니라 질문에 필요한 신뢰 조건을 명시하는 것입니다.

점수가 임계값보다 낮을 때는 억지로 하나를 고르지 않고 답변을 보류합니다. 정확도만 측정하면 이런 보류가 손해처럼 보일 수 있으므로, 논문은 답할 때의 효용과 위험할 때의 선택적 거절을 함께 보는 지표를 사용합니다.

MMA-Bench가 일부러 만든 어려운 상황

MMA-Bench는 화자의 신뢰도, 텍스트와 이미지의 모순, 시간에 따라 바뀌는 사실을 통제해 구성합니다. 단순히 관련 이미지를 찾아내는 능력보다 어떤 근거를 채택하고 어떤 근거를 버리는지가 평가 대상입니다.

연구에서는 GPT-4o와 Claude 3.5를 백본으로 사용하고, Faiss와 Milvus에 시간, 출처 메타데이터를 저장했습니다. FEVER에서는 예측 변동성이 35.2% 줄었다고 보고했고, LoCoMo에서는 긴 대화의 기억 안전성을 평가했습니다. MMA-Bench의 시각적 Type-B 항목에서는 기본 방식이 0이었던 조건에서 MMA가 41.18을 기록했습니다.

이 숫자는 모든 시각 질문에서 41.18%라는 뜻이 아닙니다. 논문이 정의한 특정 오류 유형과 설정에서 얻은 결과입니다. 특히 이미지가 있다는 사실 자체를 논리적 근거보다 강하게 받아들이는 “시각적 플라시보”를 드러낸 결과로 읽는 편이 맞습니다.

실제 RAG에 넣을 때 필요한 데이터

프레임워크를 적용하려면 임베딩 외의 메타데이터가 먼저 갖춰져야 합니다. 적어도 문서별 출처, 생성 또는 갱신 시점, 서로 같은 사건을 가리키는 연결 정보를 남겨야 합니다. 이 정보가 없으면 신뢰도 공식이 정교해도 입력 자체가 비어 있습니다.

운영 순서는 다음처럼 잡을 수 있습니다.

  1. 검색 결과와 함께 출처, 시각 메타데이터를 반환한다.
  2. 질문의 성격에 따라 시간 감쇠 강도를 달리한다.
  3. 텍스트와 이미지가 충돌하면 각각의 근거를 분리해 기록한다.
  4. 낮은 신뢰도에서는 답변 대신 추가 확인을 요청한다.

뉴스처럼 빠르게 변하는 질문과 오래된 매뉴얼을 찾는 질문에 같은 감쇠율을 쓰면 안 됩니다. 신뢰도 기준도 조직과 업무에 따라 달라지므로, 숫자 하나를 보편적인 정답으로 취급하기보다 오류 비용에 맞춰 조정해야 합니다.

합의가 곧 진실은 아니다

MMA에도 분명한 한계가 있습니다. 여러 출처가 같은 잘못된 내용을 복제하면 네트워크 합의 점수는 오히려 높아질 수 있습니다. 출처 신뢰도를 누가 어떤 근거로 부여하는지도 주관적일 수 있고, 후보 간 관계를 계산하는 만큼 검색 지연도 늘어납니다.

따라서 안전한 사용법은 MMA 점수를 최종 판정기로 두는 것이 아니라 감사 가능한 보조 신호로 쓰는 것입니다. 어떤 근거가 시간 감쇠를 받았고 왜 다른 근거보다 앞섰는지 로그로 남길 수 있을 때, 이 접근은 “가장 비슷한 기억”을 “지금 답변에 써도 되는 기억”으로 한 단계 더 거르는 장치가 됩니다.

함께 읽으면 이해가 이어지는 글

출처 신뢰도는 누가 어떤 근거로 정해야 할까?

도메인과 질문에 따라 같은 출처의 가치가 달라질 수 있습니다. 제품 사양은 제조사 문서가 직접 근거가 될 수 있지만 장애 현황은 현장 로그가 더 빠를 수 있고, 개인의 일정은 본인 캘린더가 일반 웹페이지보다 적합합니다. 사이트 전체에 영구 점수 하나를 붙이기보다 정보 유형과 원문성, 수정 이력을 함께 봐야 합니다.

신뢰도 표를 사람이 만들 때는 평가 근거와 마지막 검토일을 남깁니다. 조직의 선호를 사실의 정확성으로 오인하거나 특정 언어와 매체를 일괄 낮게 두면 시스템 편향이 생깁니다. 점수를 바꾼 뒤 대표 질문의 답과 보류율이 어떻게 변하는지 검토할 수 있어야 합니다.

출처를 알 수 없는 스크린샷과 재게시 이미지는 원본 기사와 같은 점수를 받아서는 안 됩니다. 이미지 안 텍스트가 사실이어도 촬영, 편집 시각과 맥락이 없으면 최신성과 적용 범위를 판단하기 어렵습니다. 멀티모달 메타데이터에는 원본 링크, 캡처 시각, 변환 여부를 가능한 범위에서 보존해야 합니다.

시간 감쇠는 질문마다 어떻게 달라져야 할까?

주가, 교통, 장애 상태처럼 빠르게 바뀌는 정보는 짧은 시간이 지나도 가치가 줄지만, 법칙이나 오래된 설계 결정은 단순히 오래됐다는 이유로 버리면 안 됩니다. 질문을 변동성이 높은 유형과 안정적인 유형으로 나누고 서로 다른 감쇠 설정을 적용할 수 있습니다. 문서의 갱신 시각과 사실이 유효한 시각도 구분해야 합니다.

새 문서가 과거 사실을 설명하는 경우에는 게시 시각만 우선하면 오류가 생깁니다. “지난달의 상태”를 묻는 질문에서는 당시 기록이 최신 요약보다 직접 근거가 될 수 있습니다. 검색 시 질문의 기준 시각과 각 기억의 사건 시각을 맞추는 시험이 필요합니다.

감쇠율을 조정할 때는 정답률뿐 아니라 오래된 정답을 버린 비율과 최신 오답을 선택한 비율을 나눠 봅니다. 최신성은 신뢰도의 한 요소이지 다른 출처와 내용 검증을 대체하지 않습니다. 자동 삭제보다 점수 하향과 원문 보관을 분리하면 과거 감사에도 사용할 수 있습니다.

근거가 충돌할 때 답변을 언제 보류해야 할까?

동일 사건을 다루는 독립 출처가 서로 다른 값을 말하면 합의 평균으로 덮지 말고 충돌 필드와 시각을 표시합니다. 복제된 기사 여러 개가 같은 원문 하나를 공유한다면 독립 합의 수를 부풀리지 않아야 합니다. 출처 계보를 추적할 수 없으면 다수결에 더 낮은 확신을 둘 수 있습니다.

텍스트와 이미지가 충돌하는 경우에는 이미지가 더 직접적으로 보인다는 이유만으로 우선하지 않습니다. 이미지가 과거 것이거나 일부만 잘렸을 수 있고, 텍스트도 잘못된 캡션을 붙였을 수 있습니다. 각각의 provenance와 시간, 질문과의 직접성을 보여 주고 결정에 필요한 근거가 없으면 보류합니다.

threshold는 보류율과 답변 오류율의 관계로 정합니다. 임계값을 높여 거의 답하지 않으면 안전해 보이지만 시스템의 효용이 사라지고, 낮추면 근거가 약한 답이 늘어납니다. 업무별 오류 비용을 기준으로 선택하고 임계값 근처의 사례를 사람이 정기적으로 검토해야 합니다.

보류 응답도 단순한 “모름”보다 부족한 근거와 다음 확인 방법을 알려 줄 수 있습니다. 어떤 출처가 충돌했고 어느 시점의 정보가 필요한지 제시하면 사용자가 원문을 확인할 수 있습니다. MMA의 신뢰 점수가 유용하려면 최종 숫자뿐 아니라 그 구성 요소를 설명할 수 있어야 합니다.

메타데이터가 비어 있거나 틀리면 어떻게 처리할까?

출처와 시각이 없는 기억에 임의의 기본값을 넣으면 신뢰도 계산은 가능해 보여도 결과의 의미가 흐려집니다. 알 수 없는 출처를 중간 신뢰도로 자동 배정하거나 수집 시각을 사건 시각으로 대신하면, 정보 부족이 정상 근거처럼 통과할 수 있습니다. 누락 상태 자체를 점수와 설명에 표시하고 중요한 질문에서는 추가 확인 사유로 사용하는 편이 안전합니다.

수집 파이프라인도 평가 대상입니다. 문서의 수정 시각, 이미지 촬영 시각, 웹페이지 게시 시각을 하나의 timestamp로 합치면 질문의 기준 시간과 잘못 맞출 수 있습니다. 원문 출처, 수집 시각, 문서가 주장하는 사건 시각, 마지막 검증 시각을 가능한 범위에서 구분하고 어느 값이 추정인지 남겨야 합니다.

잘못된 메타데이터를 고친 뒤에는 벡터 색인과 캐시된 신뢰 점수, 이미 생성된 요약이 함께 갱신되는지 확인합니다. 원문 화면만 고쳐지고 검색 캐시가 이전 점수를 유지하면 같은 질문에서 오류가 계속될 수 있습니다. 대표 질의를 다시 실행해 근거 순서와 보류 결정이 예상대로 바뀌는지 보는 것이 수정 완료 조건입니다.

신뢰도 계산의 추가 지연은 어떻게 판단할까?

MMA는 검색 후보를 얻은 뒤 출처, 시간, 합의를 더 계산하므로 평면 유사도 검색보다 처리 단계가 늘어납니다. 후보가 많을수록 근거 관계 비교가 커질 수 있어, 검색 시간과 재점수화 시간, 답변 생성 시간을 따로 기록해야 합니다. 지연을 줄이려고 후보 수를 과도하게 줄이면 정답 근거가 신뢰도 평가에 들어오기도 전에 사라질 수 있습니다.

실시간 응답이 중요한 서비스는 모든 질문에 같은 수준의 합의 검사를 적용할 필요가 없습니다. 위험이 낮은 개인 메모 검색과 외부에 영향을 주는 의사결정 질문을 구분하고, 후자에 더 넓은 후보와 보수적인 보류 기준을 둘 수 있습니다. 다만 위험 분류가 틀렸을 때를 대비해 사용자가 근거 확인을 요청하면 더 깊은 평가로 전환할 경로가 필요합니다.

운영 대시보드에는 평균 지연만 아니라 보류율, 메타데이터 누락률, 충돌 근거 비율, 보류 뒤 사람이 내린 결정을 함께 볼 수 있어야 합니다. 신뢰도 계층이 느려졌다는 이유로 조용히 건너뛰지 말고, 계산 실패 때 답변을 제한할지 기존 검색 결과를 경고와 함께 보여 줄지 정책을 명시합니다. MMA의 가치는 추가 점수 자체보다 정보 부족과 충돌을 숨기지 않는 데 있습니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    10개 장 20 분읽는 시간