포스트

5B 이미지 모델이 80B보다 낫다는 말은 어디까지 사실일까: DeepGen 1.0

DeepGen 1.0의 핵심은 “5B가 언제나 80B보다 강하다”가 아니라, 특정 생성, 편집 벤치마크에서 계층적 VLM 특징과 강화학습을 조합해 더 큰 비교 모델보다 높은 점수를 냈다는 데 있습니다. SCB와 Think Token은 이해 모델의 여러 수준 정보를 생성 백본에 전달하고, MR-GRPO는 복수의 보상으로 결과를 조정합니다. 실제 선택에서는 논문 수치보다 대상 이미지의 보존성, 배치 정확도, 메모리, 지연을 같은 조건에서 비교해야 합니다.

28%와 37% 개선을 왜 따로 읽어야 할까?

원문은 WISE 이미지 생성 평가에서 5B DeepGen 1.0이 80B HunyuanImage보다 28% 높은 성과를, UniREditBench 이미지 편집 평가에서는 27B Qwen-Image-Edit보다 37% 높은 성과를 기록했다고 설명합니다. 생성과 편집의 기준 모델도, 지표도 다르므로 두 수치를 하나의 종합 우위로 합치면 안 됩니다.

특히 모델 크기만으로 품질을 설명할 수 없습니다. 학습 데이터, 해상도, 샘플링 설정, 평가 프롬프트와 사람 평가 조건이 달라지면 순위가 바뀔 수 있습니다. 이 결과는 해당 벤치마크에서 구조와 학습 전략이 파라미터 수를 보완했다는 근거로 읽는 편이 정확합니다.

비율을 읽을 때는 비교 대상이 무엇인지 먼저 확인해야 합니다. WISE에서는 생성 모델과, UniREditBench에서는 편집 모델과 비교하므로 한쪽의 개선을 다른 과제로 옮길 수 없습니다. 기준 점수와 평가 단위가 다르면 28과 37이라는 숫자의 크기만 비교하는 것도 의미가 없습니다.

제품 시험에서도 생성과 편집을 분리해야 합니다. 텍스트에서 새 이미지를 만드는 능력이 좋아도 기존 인물이나 배경을 보존하면서 일부만 바꾸는 데 실패할 수 있습니다. 각 과제에서 반드시 지켜야 할 조건과 허용 가능한 변화를 따로 정해야 벤치마크의 의미를 실제 요구에 연결할 수 있습니다.

SCB와 Think Token은 어떤 정보를 생성기로 넘길까?

DeepGen 1.0은 VLM과 DiT 생성 백본 사이에 Stacked Channel Bridging(SCB)을 둡니다. 마지막 레이어 하나만 쓰지 않고 여러 계층의 특징을 모아, 형태, 색, 배치 같은 낮은 수준 정보와 전체 의미, 관계 같은 높은 수준 정보를 함께 전달하려는 설계입니다.

Think Token은 이미지를 만들기 전에 구성에 필요한 잠재 표현을 형성하도록 돕고, SCB는 이 표현을 생성 백본에 연결합니다. 이 과정이 실제로 어떤 편집 유형에 가장 기여하는지는 제거 실험과 실패 사례를 함께 봐야 합니다. 계층을 여러 개 읽는 만큼 단일 특징 경로보다 메모리 이동과 계산이 늘어날 수 있습니다.

여러 계층을 쓰는 이유는 세부와 의미가 같은 층에 동일하게 남지 않기 때문입니다. 낮은 수준 특징이 형태와 색의 단서를 제공하고 높은 수준 특징이 객체 관계와 지시 의미를 담는다면, SCB는 둘 중 하나를 버리지 않고 DiT가 사용할 수 있게 연결하려는 선택입니다. 다만 더 많은 특징을 전달한다고 항상 지시 준수가 좋아지는 것은 아닙니다.

Think Token 역시 사람이 읽을 수 있는 단계별 계획과 같다고 단정해서는 안 됩니다. 이미지를 만들기 전 내부 표현을 형성하는 장치이며, 그 표현이 올바른 배치를 보장하는지는 결과와 제거 실험으로 확인해야 합니다. 다중 객체의 위치, 텍스트 표기, 원본 보존처럼 서로 다른 실패 유형에서 기여도가 같은지도 별도 문제입니다.

5천만 샘플과 세 단계 학습은 각각 무엇을 맡을까?

원문은 약 5천만 개의 이미지-텍스트 샘플을 사용한 세 단계 학습을 설명합니다.

  1. 정렬 사전학습으로 VLM과 DiT 표현을 맞춥니다.
  2. 생성, 편집, 시각 추론 데이터를 섞은 공동 SFT를 수행합니다.
  3. MR-GRPO로 여러 보상 신호를 이용해 결과를 조정합니다.

MR-GRPO는 텍스트 정렬, 미적 품질, 선호 신호를 섞어 그룹 안의 상대 보상을 최적화하는 것으로 소개됩니다. 여러 보상을 사용해도 보상 해킹이 사라지는 것은 아닙니다. 점수를 올리기 위해 지나치게 선명하거나 화려한 결과로 치우치는지, 원본 보존이 필요한 편집에서 불필요한 부분까지 바꾸는지 따로 평가해야 합니다.

세 단계는 서로 다른 실패를 겨냥합니다. 정렬이 불안정하면 VLM 특징이 생성 백본에 제대로 전달되지 않고, 공동 SFT가 부족하면 생성과 편집 중 한쪽에 치우칠 수 있으며, 보상 조정이 과하면 사람이 선호할 법한 표면적 특성을 지나치게 강화할 수 있습니다. 최종 점수만으로 어느 단계가 실제 개선을 만들었는지는 알기 어렵습니다.

5천만 샘플이라는 규모도 데이터의 구성과 품질을 대신하지 않습니다. 생성, 편집, 시각 추론 데이터의 비중과 중복, 지시의 난도가 결과에 영향을 줄 수 있습니다. 특정 유형의 결과가 강하다면 구조만이 아니라 그 유형이 학습 데이터와 보상에서 얼마나 자주 등장했는지도 함께 살펴야 합니다.

5B라는 크기만으로 로컬 실행을 결정해도 될까?

5B는 비교 모델보다 작지만 양자화 여부, 정밀도, 이미지 해상도, DiT 샘플링 횟수에 따라 실제 메모리와 지연이 크게 달라집니다. 원문은 소비자 GPU와 온디바이스 가능성을 강조하지만, 이 글에는 재현 가능한 실행 코드나 측정 조건이 없습니다. 따라서 특정 GPU에서 원활히 돈다고 단정할 근거로 쓰기 어렵습니다.

도입 판단에는 생성과 편집을 나눠 대상 프롬프트를 평가하고, 원본 정체성 보존, 텍스트 렌더링, 다중 객체 위치, 지연, 최대 메모리를 같은 설정에서 측정해야 합니다. 5B라는 숫자는 후보를 좁히는 정보이지 배포 승인 기준은 아닙니다.

비교 실험에서는 해상도와 샘플링 횟수를 고정해야 합니다. 더 많은 단계를 쓰거나 낮은 해상도로 실행한 결과를 섞으면 모델 크기와 품질, 속도의 관계를 판단하기 어렵습니다. 생성에서는 지시 준수와 반복 가능한 스타일을, 편집에서는 변경 대상 밖의 픽셀과 정체성 보존을 따로 기록하는 편이 좋습니다.

실패 조건도 명확합니다. 5B라는 이름과 달리 목표 하드웨어에서 메모리를 넘거나, 필요한 해상도에서 지연이 허용 범위를 벗어나거나, 편집 때 원본의 중요한 부분을 반복해서 바꾼다면 벤치마크 우위만으로 채택할 수 없습니다. 반대로 같은 자원 조건에서 대상 프롬프트의 필수 요소를 더 안정적으로 지키고 검수 부담을 줄인다면 작은 모델 구조의 실용적 가치가 생깁니다.

결국 DeepGen 1.0을 평가하는 질문은 “더 큰 모델을 이겼는가”가 아니라 “우리 생성, 편집 작업을 같은 자원에서 더 정확하게 수행하는가”입니다. 논문의 두 비교 수치를 출발점으로 삼되, 과제별 대표 입력과 실패 기준을 고정한 자체 평가가 최종 판단을 맡아야 합니다.

자체 평가 프롬프트는 어떻게 구성해야 할까?

생성 세트에서는 한 객체의 속성, 여러 객체의 수와 위치, 이미지 안 텍스트, 전체 스타일을 나눠야 합니다. 모든 조건을 한 프롬프트에 넣으면 실패 원인을 알기 어렵습니다. 같은 의미를 다른 어순으로 지시해 특정 표현에만 맞는지도 확인할 수 있습니다.

편집 세트는 바꿔야 할 영역과 보존해야 할 영역을 동시에 정의합니다. 옷 색만 바꾸라는 요청에서 얼굴, 배경, 자세가 유지되는지, 객체를 추가할 때 기존 객체의 수와 위치가 바뀌지 않는지를 비교합니다. 보기 좋은 결과라도 요청 밖의 영역을 넓게 수정하면 편집 과제로는 실패입니다.

SCB와 Think Token의 이점을 보려면 관계와 구성이 중요한 입력을 포함해야 합니다. 단순 미적 품질만 평가하면 계층적 VLM 특징이 위치와 지시 준수에 기여했는지 알 수 없습니다. MR-GRPO의 부작용을 찾기 위해 화려한 결과가 원래 지시를 덮는 사례도 표시할 수 있습니다.

각 입력은 동일 해상도, 샘플링 횟수, 정밀도에서 여러 번 생성하고 성공률과 변동성을 봅니다. 한 장의 좋은 예시보다 필수 조건을 안정적으로 지키는 비율, 최대 메모리, 결과 한 장당 시간을 함께 기록해야 합니다. 이 절차에서 5B의 이점이 확인될 때 벤치마크 수치를 실제 배포 근거로 연결할 수 있습니다.

사람 평가자는 모델 이름을 가린 상태에서 지시 준수와 시각 품질을 따로 채점하는 편이 좋습니다. 더 선명한 이미지를 더 정확한 이미지로 오인하지 않도록 객체 수, 위치, 보존 영역처럼 확인 가능한 항목을 먼저 봅니다. 의견이 갈린 사례는 평균 점수에 묻지 말고 어떤 요구가 모호했는지 기록해야 합니다.

편집 결과에는 입력 이미지와 마스크 또는 지시, 생성 설정을 함께 보관합니다. 모델 업데이트 뒤 같은 편집이 달라지면 원본 보존 문제와 재현성을 다시 확인할 수 있습니다. 개인정보나 인물 이미지가 들어가는 경우에는 평가 데이터의 보관과 사용 권한도 별도 조건입니다.

작은 모델이더라도 대량 생성에서는 에너지와 검수 비용이 누적됩니다. 처리량만 늘고 실패 결과를 사람이 더 많이 골라야 한다면 총비용이 줄지 않을 수 있습니다. 자동 점수, 사람 수정 시간, 재생성 횟수를 묶어 비교해야 실제 효율을 판단할 수 있습니다.

논문 페이지

함께 읽으면 이해가 이어지는 글

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    6개 장 18 분읽는 시간