포스트

MoAI는 왜 외부 CV 모델 4개를 붙이나: Compressor와 Mixer

MoAI는 이미지 인코더만으로 놓치기 쉬운 객체, 관계, 문자를 외부 컴퓨터 비전 모델에서 받아, Compressor와 Mixer로 언어 모델의 추론에 연결합니다.

MoAI 동작 예시

외부 모델을 붙인다고 장면 이해가 자동으로 정확해지는 것은 아닙니다. 질문에 필요한 보조 정보가 무엇인지와 그 정보가 틀렸을 때 최종 답이 어떻게 흔들리는지를 함께 추적해야 MoAI의 이득을 제대로 평가할 수 있습니다.

문제는 이미지 전체보다 세부 장면 이해다

원문이 짚은 기존 대형 언어, 비전 모델의 약점은 세 가지입니다. 이미지 안의 물체를 잘못 찾거나, “사과가 테이블 위에 있다” 같은 공간, 관계 정보를 놓치거나, 이미지 속 글자를 정확히 읽지 못할 수 있습니다.

MoAI는 기본 모델을 더 크게 만드는 대신 이미 각 문제를 다루는 CV 모델의 출력을 보조 정보로 사용합니다. 구조는 두 단계로 읽으면 됩니다.

  1. MoAI-Compressor가 외부 모델의 다양한 결과를 언어 모델이 다룰 수 있는 형태로 정리합니다.
  2. MoAI-Mixer가 이미지 특징, 보조 정보, 언어 정보를 현재 질문에 맞춰 결합합니다.

이 구분 덕분에 “어떤 정보를 모으는가”와 “그 정보를 언제 얼마나 쓰는가”를 따로 볼 수 있습니다.

Compressor는 네 종류의 보조 정보를 언어화한다

MoAI가 사용하는 외부 CV 정보는 다음 네 범주입니다.

  • Panoptic Segmentation: 객체와 배경 영역을 구분
  • Open-World Object Detection: 미리 정한 범주를 넘어 객체 후보를 탐지
  • Scene Graph Generation: 객체 사이의 관계를 표현
  • Optical Character Recognition: 이미지 안의 문자를 인식

MoAI-Compressor 구조

각 모델의 원시 출력은 형식과 길이가 서로 다릅니다. Compressor는 이를 언어 모델이 활용할 수 있는 보조 표현으로 줄여 전달합니다. 원문 마지막 그림이 보여 주는 언어화가 이 연결을 이해하는 단서입니다.

보조 정보 언어화 예시

이 방식은 세부 정보를 보강하지만 외부 모델이 틀린 결과도 함께 들어올 수 있습니다. OCR이나 탐지 결과가 최종 답과 어긋날 때는 언어 모델만 점검하지 말고 어느 보조 모델에서 정보가 시작됐는지 추적해야 합니다.

Mixer는 시각, 보조, 언어 정보의 비중을 바꾼다

Mixer에는 세 종류의 전문가 역할이 있습니다.

  • 시각 전문가는 CLIP 기반 이미지 정보를 사용합니다.
  • 보조 전문가는 탐지, OCR, 관계 등 Compressor가 정리한 정보를 사용합니다.
  • 언어 전문가는 질문 이해와 언어 추론을 담당합니다.

MoAI-Mixer 구조

Gating Network는 입력 상황에 따라 세 정보의 가중치를 조절합니다. 모든 질문에 OCR 결과를 똑같이 강하게 넣는 대신, 문자 질문에서는 보조 정보를 더 활용하고 다른 질문에서는 시각이나 언어 정보의 비중을 바꿀 수 있는 구조입니다.

Mixer의 정보 결합

따라서 MoAI의 핵심은 단순한 모델 앙상블보다 “질문에 필요한 보조 정보를 선택적으로 섞는가”에 있습니다.

표의 숫자보다 파이프라인 비용까지 비교한다

원문에 제시된 zero-shot 결과는 다음과 같습니다.

모델Q-BenchTextVQA
GPT-4V63.858.2
LLaVA 1.558.750.1
MoAI70.267.8

이 표에서는 MoAI가 두 지표 모두 가장 높습니다. Q-Bench는 전반적인 시각, 언어 성능, TextVQA는 이미지 문자 이해를 비교하는 열로 소개됐습니다. 다만 두 벤치마크만으로 모든 장면 이해 능력이나 실제 서비스 속도를 결론 내릴 수는 없습니다.

적용 판단에는 최소한 다음 비용도 포함해야 합니다.

  • 네 외부 CV 모델을 함께 실행하는 계산량과 지연 시간
  • 외부 출력이 길거나 서로 충돌할 때 Compressor가 보존하는 정보
  • Gating이 질문별로 어떤 전문가를 선택했는지 확인할 방법
  • OCR, 탐지 오류가 최종 답에 전달되는 실패 경로

MoAI는 외부 지식을 공짜로 얻는 모델이 아니라 여러 CV 도구를 하나의 추론 흐름으로 조직하는 모델입니다. 세밀한 객체, 관계, 문자 정보가 실제 과제의 병목일 때 가장 설득력 있는 선택입니다.

한 질문이 네 보조 모델을 거치는 경로를 추적한다

거리 사진에서 “표지판 아래에 무엇이 있는가”를 묻는 상황을 생각해 볼 수 있습니다. OCR은 표지판 글자를 읽고, 탐지는 객체 후보를 찾고, panoptic segmentation은 도로와 건물 영역을 나누며, scene graph는 위, 아래 관계를 표현합니다. 질문에 따라 필요한 정보는 이 중 일부뿐이므로 Mixer가 어떤 전문가에 높은 비중을 주었는지 확인하는 것이 중요합니다.

보조 출력이 충돌하는 경우도 별도 시험해야 합니다. OCR은 한 글자로 읽었지만 이미지 특징은 다른 단어를 지지하거나, 탐지기는 객체를 찾았지만 segmentation 경계가 다른 물체와 합쳐질 수 있습니다. 이때 최종 답만 채점하면 오류의 출발점을 알 수 없습니다. 원시 외부 출력, Compressor가 줄인 표현, Mixer 가중치, 최종 답을 한 trace로 남겨야 수정할 모듈을 찾을 수 있습니다.

평가 세트는 전체 장면 질문, 작은 객체 질문, 공간 관계 질문, 문자 질문으로 나누는 편이 좋습니다. 기본 시각 모델과 네 보조 정보를 하나씩 추가한 ablation을 비교하면 어느 유형에서 어떤 모듈이 실제로 기여했는지 드러납니다. 정확도와 함께 외부 모델 호출 시간, 압축 뒤 token 수, 최대 메모리도 기록해야 표의 성능 향상이 운영 비용을 정당화하는지 판단할 수 있습니다.

MoAI가 맞지 않는 상황도 분명하다

업무가 큰 객체 분류처럼 단순하고 지연 시간이 엄격하다면 네 외부 모델의 비용이 얻는 정보보다 클 수 있습니다. OCR이 이미 별도 파이프라인으로 검증되는 문서 처리라면 그 결과를 다시 범용 Mixer에 넣는 것이 오히려 오류 원인을 흐릴 수도 있습니다.

반대로 문자, 관계, 영역을 한 질문에서 함께 묻고, 기존 모델이 어떤 세부를 놓쳤는지 확인할 수 있는 환경이라면 통합의 가치가 큽니다. 첫 도입에서는 모든 모듈을 상시 실행하기보다 질문 유형에 따라 필요한 보조 모델만 호출하고, 불일치가 크면 답을 보류하는 정책을 시험하는 편이 안전합니다.

배포 판단은 평균 정확도 하나로 끝내지 않는 편이 좋습니다. 작은 글자, 가려진 객체, 복잡한 공간 관계처럼 MoAI를 도입한 이유가 드러나는 질문군을 따로 만들고, 기본 모델보다 나아진 정도를 유형별로 비교해야 합니다. 외부 모듈 하나가 응답하지 않았을 때의 성능과 지연도 함께 재면 부분 장애에서 답을 중단할지 기본 모델로 우회할지 정할 수 있습니다. 개선 폭이 호출 비용과 운영 복잡도를 넘지 못한다면, 필요한 OCR이나 탐지만 기존 파이프라인에 선택적으로 붙이는 구성이 더 단순한 답입니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

MoAI는 외부 컴퓨터 비전 모델을 다시 학습하나요?

핵심은 분할, 탐지, 관계, OCR 모델의 출력을 Compressor로 정리하고 Mixer에서 시각, 언어 정보와 결합하는 것입니다. 각 외부 모델의 오류도 입력으로 전달될 수 있습니다.

Compressor와 Mixer는 무엇이 다른가요?

Compressor는 서로 다른 형식과 길이의 보조 출력을 언어 모델이 다룰 표현으로 줄입니다. Mixer는 현재 질문에 따라 시각, 보조, 언어 정보의 사용 비중을 조절합니다.

도입 전에 가장 먼저 무엇을 측정해야 하나요?

질문 유형별 정확도와 각 외부 모듈의 오류 전파를 먼저 봐야 합니다. 이어서 전체 호출 지연, token 수, 메모리를 기본 모델과 같은 조건에서 비교해야 합니다.

답변 하나를 감사 가능한 기록으로 남긴다

검수 화면에는 원본 이미지와 최종 답만 두기보다 네 외부 모델의 핵심 출력도 함께 보여 주는 편이 좋습니다. 탐지 box와 class, segmentation 영역, OCR 문자열과 confidence, scene graph 관계를 나란히 두면 사람이 답의 근거를 빠르게 확인할 수 있습니다. Compressor가 어떤 항목을 버렸는지도 전후 길이와 함께 기록하면 압축 손실을 찾기 쉽습니다.

실패 사례는 보조 정보가 없는 경우, 하나만 틀린 경우, 서로 충돌하는 경우로 나눕니다. 보조 정보가 없어도 기본 시각 특징으로 답할 수 있는지, OCR이 틀렸을 때 다른 전문가가 이를 바로잡는지, 관계와 탐지가 모순일 때 모델이 확신을 낮추는지를 확인합니다. 정답률이 같아도 모순을 숨기고 단정하는 시스템은 실제 서비스에서 더 위험합니다.

운영 단계에서는 외부 모델 버전도 함께 고정해야 합니다. OCR이나 detector만 교체해도 Compressor 입력 분포가 바뀌고 Mixer의 선택이 달라질 수 있습니다. 모듈을 갱신할 때는 전체 benchmark를 다시 돌리고, 지연 시간과 오류 유형이 이전 release와 어떻게 달라졌는지 비교해야 합니다.

최종 보고에는 어느 질문 유형에서 어떤 보조 모델이 선택됐는지까지 남겨야 합니다. 이 기록이 있어야 외부 모델을 제거하거나 교체했을 때 성능 변화의 원인을 설명할 수 있습니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1

키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    9개 장 17 분읽는 시간