MILS는 LLM이 이미지나 소리를 직접 감각한다는 뜻이 아니라, 후보 문장을 만들고 별도의 멀티모달 모델이 입력과의 적합도를 채점하는 반복 검색입니다. 추가 파인튜닝이 없다는 장점 대신 후보 생성과 평가를 여러 번 수행하는 추론 비용이 생깁니다.
MILS 톺아보기
MILS란?
MILS (Multimodal Iterative LLM Solver)은 추가 학습 없이 대형 언어 모델(LLM)을 활용하여 이미지, 비디오, 오디오 캡션 생성 및 편집을 가능하게 하는 혁신적인 프레임워크입니다.
기존 멀티모달 모델들은 특정 데이터셋을 학습해야 다양한 모달리티(예: 이미지, 음성, 텍스트)를 처리할 수 있었지만, MILS는 LLM이 원래 학습되지 않은 멀티모달 작업도 해결할 수 있도록 설계되었습니다.
MILS의 주요 기여점
- 훈련 없이도 멀티모달 작업 수행 가능 → 기존 모델처럼 이미지-텍스트, 오디오-텍스트 데이터를 학습할 필요 없음
- “테스트 시 최적화(Test-time Optimization)” 방식 도입 → 입력 샘플에 대해 직접 최적의 출력을 찾음
- 모든 모달리티를 텍스트로 변환하여 활용 → 기존 방식과 달리, LLM을 활용해 멀티모달 연산이 가능
- 멀티모달 작업(이미지, 비디오, 오디오 캡션 및 편집)에서 SOTA 달성
기존 멀티모달 모델과 MILS의 차이점
기존 멀티모달 모델들은 일반적으로 특정 데이터셋을 활용한 사전 학습이 필수적입니다. 예를 들어, 이미지 캡션 모델은 대량의 이미지-텍스트 페어 데이터를 학습해야 했습니다.
MILS는 다음과 같은 차별점을 가집니다:
- 학습 없이도 다양한 작업을 수행
- 기존 방법: 훈련된 모델이 새로운 작업을 수행하려면 추가 학습 필요
- MILS: 새로운 작업을 학습 없이도 수행 가능
- 멀티모달 데이터를 텍스트로 변환 후 최적화
- 기존 방법: 이미지, 오디오, 텍스트 데이터를 각각 다른 모델이 처리
- MILS: 모든 데이터를 텍스트로 변환 후 LLM을 통해 처리
1 MILS의 핵심 기술 1: Test-time Optimization (테스트 시 최적화)
기존 모델들은 훈련을 통해 사전 지식을 학습하지만, MILS는 “테스트 시점에서 최적화”하는 방식을 채택합니다.
MILS의 작동 원리
- 입력 데이터(이미지, 비디오, 오디오)를 처리
- LLM이 여러 개의 캡션 후보 생성 (GENERATOR)
- 멀티모달 모델(예: CLIP)이 후보의 품질을 평가 (SCORER)
- 최적의 출력을 찾을 때까지 반복 (Iterative Refinement)
MILS의 이점
- 지원: 추가 훈련 없이 새로운 작업 가능
- 지원: 모든 모달리티에서 높은 성능 유지
- 지원: SOTA 성능을 뛰어넘는 결과 달성
MILS의 실험 결과
MILS는 이미지, 비디오, 오디오 캡션 생성 및 이미지 생성 및 편집에서 기존 모델보다 더 나은 성능을 보였습니다.
이미지 캡션 생성 성능 비교 (MSCOCO 데이터셋)
| 모델 | BLEU4 | CIDEr | METEOR | SPICE |
|---|---|---|---|---|
| ZeroCap (기존 제로샷 모델) | 2.6 | 14.6 | 11.5 | 5.5 |
| MeaCap | 7.1 | 42.5 | 16.6 | 11.8 |
| MILS | 8.0 | 33.3 | 15.0 | 9.6 |
기존 모델보다 더 높은 정확도로 이미지 캡션을 생성
비디오 캡션 생성 성능 비교 (MSR-VTT 데이터셋)
| 모델 | CIDEr | METEOR |
|---|---|---|
| HowTo100M (사전 학습 모델) | 0.5 | 8.23 |
| VideoCC3M (사전 학습 모델) | 8.2 | 11.3 |
| MILS (추론 전용) | 2.3 | 14.4 |
훈련 없이도 학습된 모델과 비슷한 성능을 보임
생성기와 점수기의 폐루프를 먼저 이해한다
MILS의 한 반복은 후보 생성 → 멀티모달 점수 계산 → 피드백을 반영한 후보 수정입니다. 이미지 캡션이라면 LLM이 여러 설명을 제안하고 CLIP 같은 점수기가 원본 이미지와 가까운 후보를 고릅니다. 선택된 문장과 점수는 다음 반복의 재료가 되고, LLM은 낮은 점수를 받은 표현을 바꾸거나 빠진 객체를 보완합니다.
LLM이 원본 픽셀이나 음파를 그대로 읽는 것은 아닙니다. 시각, 음향 정보를 점수로 연결하는 외부 모델이 필요합니다. 점수기가 작은 객체나 시간 순서를 구분하지 못하면 생성기는 잘못된 방향을 높은 품질로 오인할 수 있습니다. “학습 없음”은 모델도 데이터도 필요 없다는 뜻이 아니라, 주어진 샘플에서 별도 가중치 업데이트 없이 검색한다는 뜻입니다.
후보 수와 반복 횟수는 품질과 비용을 동시에 바꿉니다. 후보를 많이 만들면 탐색 폭은 넓어지지만 LLM 호출과 점수 계산이 늘고, 반복을 너무 오래 하면 점수기의 편향에 과적합할 수 있습니다. 작은 후보 수에서 시작해 점수 개선이 멈추는 시점을 기록하고 최종 결과를 사람이 원본과 대조해야 합니다.
표는 지표마다 다른 결론을 보여 준다
기존 MSCOCO 표에서 MILS는 ZeroCap보다 네 지표가 높지만, MeaCap과 비교하면 BLEU4는 높고 CIDEr, METEOR, SPICE는 낮습니다. 따라서 “모든 지표에서 기존 모델보다 정확하다”는 결론은 맞지 않습니다. 캡션 지표는 참고 문장과의 일치를 서로 다른 방식으로 재며, 어느 하나가 실제 설명의 완전성을 보증하지 않습니다.
비디오와 오디오에서도 평균 점수만 보지 말고 사건 순서를 놓치는지 확인해야 합니다. 영상 초반과 후반의 행동, 화면 밖 소리, 짧게 등장한 객체를 별도 질문으로 만들면 점수기가 무엇을 보존하지 못하는지 드러납니다. 편집 작업은 원본 보존과 지시 이행을 따로 채점해야 합니다.
언제 MILS를 선택하고 언제 멈출까
새 작업에 학습용 짝 데이터가 없고 후보를 자동 채점할 신뢰할 만한 점수기가 있다면 유용한 출발점입니다. 반면 지연 시간이 짧아야 하거나 정답을 검증할 점수기가 약한 작업에서는 반복 검색 비용이 이득을 넘을 수 있습니다.
단일 생성 결과, 같은 수의 무작위 후보 중 최고 결과, MILS 반복 결과를 나란히 비교해야 합니다. 총 LLM token, 점수기 호출 수, wall-clock 시간과 인간 선호를 함께 기록하면 반복 최적화가 단순히 계산을 늘린 것인지 실제 품질을 높였는지 판단할 수 있습니다.
함께 읽으면 이해가 이어지는 글
- 이미지, 오디오를 모두 다음 토큰으로 만들면 더 단순할까? LongCat-Next의 비용 — DiNA와 dNaViT가 텍스트, 이미지, 오디오를 이산 토큰으로 통합하는 방식, 단일 목적 함수의 이점과 시퀀스, KV 캐시 비용 및 검증법을 살펴봅니다.
- DramaClaw: 파편화된 AI 영상 제작을 하나로 통합하는 오픈소스 파이프라인 — DramaClaw는 텍스트 대본 입력부터 캐릭터 추출, 스토리보드, 더빙, 최종 영상 합성까지 AI 영상 제작의 전 과정을 자동화하는 오픈소스 비디오 엔진입니다. 노드 기반 무한 캔버스와 DAG 병렬 처리 스케줄링을 통해 단방향…
- StyleGAN 얼굴 편집에서 머리카락이 붙어 움직이는 이유: v1, v2, v3 변화 — StyleGAN v1의 style mixing과 AdaIN에서 v2의 weight demodulation, v3의 alias 억제까지 이어지는 변화로 artifact와 texture sticking의 원인을 설명합니다.
자주 묻는 질문
MILS는 정말 추가 학습 없이 작동하나요?
각 작업에 맞춘 가중치 파인튜닝 없이 추론 시 후보를 반복 개선합니다. 다만 후보를 채점할 멀티모달 모델과 여러 번의 생성, 평가 호출은 필요합니다.
LLM이 이미지와 오디오를 직접 보는 방식인가요?
아닙니다. LLM은 주로 텍스트 후보를 만들고, 별도의 시각, 음향 점수기가 입력과 후보의 적합도를 평가해 다음 반복에 신호를 줍니다.
반복 횟수를 늘리면 항상 좋아지나요?
그렇지 않습니다. 비용이 늘고 점수기의 편향에 맞춘 결과가 될 수 있습니다. 점수 개선이 멈추는 시점과 사람이 본 품질을 함께 확인해야 합니다.
점수기 편향을 찾는 대조군
같은 입력에 대해 사람이 작성한 정답에 가까운 후보, 중요한 사실 하나를 뺀 후보, 유창하지만 틀린 후보를 미리 준비해 점수기가 올바른 순서를 주는지 확인합니다. 이 작은 시험을 통과하지 못하면 반복 최적화가 품질이 아니라 점수기의 약점을 공략할 가능성이 큽니다.
반복별 최고 점수만 남기지 말고 후보 다양성과 실제 오류도 함께 기록합니다. 점수는 계속 오르는데 문장이 서로 비슷해지거나 사실 누락이 늘어난다면 중단해야 합니다. MILS의 성공은 scorer 숫자의 단조 증가가 아니라 제한된 호출 예산 안에서 사람이 선호하는 정확한 결과가 늘어나는지로 판단합니다.
←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.