포스트

이미지, 오디오를 모두 다음 토큰으로 만들면 더 단순할까? LongCat-Next의 비용

텍스트, 이미지, 오디오를 모두 이산 토큰으로 바꾸면 학습 목적은 단순해지지만, 고해상도 신호가 긴 시퀀스로 바뀌어 추론 비용까지 자동으로 줄지는 않습니다. LongCat-Next의 장점과 병목은 같은 선택, 즉 모든 모달리티를 next-token prediction으로 통일한 데서 나옵니다.

LongCat-Next 자료는 LLM, 비전 인코더, diffusion 생성기를 따로 이어 붙이는 대신 DiNA(Discrete Native Autoregressive) 구조를 제안합니다. 텍스트와 시각, 음향 신호를 공통 토큰 흐름으로 만들어 하나의 Transformer가 다음 토큰을 예측합니다.

LongCat-Next의 통합 멀티모달 구조

dNaViT가 임의 해상도를 계층형 토큰으로 바꾼다

dNaViT는 이미지를 패치로 나눈 뒤 RVQ(Residual Vector Quantization)로 여러 단계의 이산 코드를 만듭니다. 큰 형태를 담는 코드와 세부 질감을 보완하는 코드를 겹쳐 표현하고, 경량 pixel decoder가 토큰을 다시 이미지로 복원합니다. 고정 크기 입력만 받는 토크나이저보다 다양한 해상도를 다루려는 설계입니다.

dNaViT와 RVQ의 이미지 토큰화

토크나이저와 디토크나이저 학습 흐름

“같은 토큰”이라는 말이 입력 전처리까지 완전히 같다는 뜻은 아닙니다. 텍스트, 이미지, 오디오는 각 토크나이저와 복원기가 필요합니다. 공통되는 것은 Transformer의 예측 공간과 목적 함수입니다.

단일 목적 함수는 연결부를 줄이지만 시퀀스를 늘린다

별도 cross-attention과 diffusion 서버를 관리하지 않고 하나의 체크포인트에서 이해와 생성을 다룰 수 있다는 것이 원문의 장점입니다. 같은 이산 공간을 쓰면 본 이미지를 설명하고 설명에서 이미지를 만드는 능력의 정렬도 직접 학습할 수 있습니다.

반면 이미지 한 장이 수천 개 이상의 토큰이 되면 어텐션과 KV 캐시가 커집니다. diffusion의 여러 denoising step을 없애도 오토리그레시브 토큰을 순서대로 생성하는 시간이 생깁니다. 모델 개수가 하나라는 사실과 서빙 메모리, 지연이 작다는 결론은 동일하지 않습니다.

이해와 생성 벤치마크 비교

복원 품질과 의미 정확도를 따로 검증한다

원문 그림은 frozen vision encoder와 복원 방식에 따른 디테일 차이를 보여 줍니다. 픽셀 재구성이 좋아도 객체 수와 관계를 정확히 이해한다는 보장은 없고, 질문 답변 점수가 높아도 생성 이미지의 작은 글자가 맞는다는 뜻은 아닙니다.

비전 인코더별 이미지 복원 결과

원문의 파이썬은 텍스트, 이미지, 오디오 토큰을 이어 붙이는 개념적 목업입니다. 실제 tokenizer 반환 차원, 모달리티 경계 토큰, 샘플링과 디코더 API가 빠져 있어 실행 예제가 아닙니다. 구현을 시험하려면 공개 저장소의 현재 코드와 체크포인트 전제를 확인해야 합니다.

도입은 입력 해상도와 출력 길이 예산부터 정한다

PoC에서는 모달리티별 토큰 수, 첫 토큰 지연, 전체 생성 시간, 최대 VRAM을 기록합니다. 4K 이미지를 그대로 넣기보다 업무에 필요한 읽기 가능한 최소 해상도와 RVQ 레벨을 찾고, 긴 오디오, 비디오에는 청킹 전략이 필요합니다. vLLM 같은 서빙 엔진이 해당 토큰 형식과 디코더를 지원하는지도 확인해야 합니다.

LongCat-Next는 파편화된 멀티모달 학습을 하나의 언어 모델 문제로 바꾸는 명확한 설계를 보여 줍니다. 하지만 단순한 도식 뒤에 토큰 폭증과 복원기 운영이 남습니다. 구조의 우아함보다 실제 요청 한 건의 품질, 지연, 메모리로 채택 여부를 결정해야 합니다.

“하나의 모델”이 운영도 하나라는 뜻은 아니다

Transformer checkpoint가 통합돼도 이미지, 오디오를 토큰으로 만드는 encoder와 결과를 복원하는 decoder는 남습니다. tokenizer 버전이 모델과 맞지 않으면 같은 정수 token도 다른 의미가 되고, decoder가 실패하면 언어 응답은 정상인데 생성 이미지가 깨질 수 있습니다. 배포 artifact와 health check를 모달리티별로 관리해야 하는 이유입니다.

요청 routing도 완전히 사라지지 않습니다. 텍스트 질문, 이미지 이해, 이미지 생성과 오디오 출력은 허용하는 입력 크기와 timeout이 다릅니다. 하나의 queue에서 모두 처리하면 긴 이미지 생성 요청이 짧은 텍스트 응답을 막을 수 있어 workload별 batch와 우선순위를 분리할 수 있습니다. 통합 모델은 능력의 인터페이스를 단순화하지만 자원 격리까지 자동으로 해 주지는 않습니다.

토큰 경제성은 어떻게 계산하나

비용의 첫 변수는 원본 byte가 아니라 modality token 수입니다. 같은 이미지라도 해상도와 RVQ level에 따라 입력, 출력 token이 달라지고, 오디오 길이는 sequence를 빠르게 늘립니다. 요청 유형별 평균 token 수, 첫 token 지연, 초당 생성 token과 KV cache를 측정해야 텍스트 LLM의 비용표와 비교할 수 있습니다.

고해상도를 줄였을 때 어떤 정보가 먼저 사라지는지도 봅니다. 상품 사진에서는 작은 라벨, 문서에서는 글자, 과학 영상에서는 축과 범례가 중요할 수 있습니다. 단순한 perceptual score가 비슷해도 업무 정답은 달라질 수 있으므로 필요한 최소 해상도는 실제 질문과 생성 과제로 정합니다.

이해와 생성은 어떤 test matrix로 나눌까

이미지 이해는 객체 수, 공간 관계, OCR, 세부 속성을 따로 평가합니다. 이미지 생성은 prompt 준수, 객체 관계, 텍스트 표현과 시각 품질을 나눕니다. 오디오는 음성 내용, 화자, 음색, 배경음과 시간 정렬을 각각 봅니다. 통합 점수 하나만 쓰면 강한 모달리티가 약한 모달리티를 가릴 수 있습니다.

모달리티 사이의 왕복 검사도 유용합니다. 이미지를 설명한 뒤 그 설명으로 다시 생성했을 때 핵심 객체와 관계가 유지되는지, 오디오를 text로 옮긴 뒤 다시 만들었을 때 내용과 길이가 어떻게 달라지는지 확인합니다. 다만 왕복 일치가 진실성을 보장하지는 않습니다. 두 방향이 같은 오류를 공유할 수 있어 원본 정답과 독립된 평가가 필요합니다.

RVQ 단계는 품질과 길이를 어떻게 바꾸나

Residual Vector Quantization은 앞 단계가 큰 구조를 담고 뒤 단계가 잔여 오차를 보완하는 방식입니다. 더 많은 level을 쓰면 세부 복원이 좋아질 수 있지만 예측해야 할 code와 decoder 비용이 늘어납니다. 모든 이미지에 같은 level을 강제하기보다 업무에 필요한 detail과 장치 예산에 따라 제한하는 전략을 검토할 수 있습니다.

level별 ablation에서는 픽셀 지표만 보지 말고 의미 task 성능을 함께 기록합니다. 어느 지점부터 OCR이나 객체 관계가 개선되지 않는다면 추가 token은 시각 질감만 높이는 비용일 수 있습니다. 반대로 얼굴이나 의료 영상처럼 미세 구조가 중요한 영역은 평균 벤치마크보다 높은 level이 필요할 수 있으며 별도 위험 검토가 필요합니다.

기존 멀티모달 stack과 무엇을 비교해야 하나

비교 대상은 모델 수가 아니라 같은 업무를 끝내는 전체 경로입니다. 별도 vision encoder와 LLM, diffusion model을 연결한 기존 stack과 LongCat-Next 계열의 end-to-end latency, peak VRAM, 배포 크기, 실패 복구를 비교합니다. 한 요청에서 이해와 생성이 연속되는 업무라면 중간 표현을 공유하는 이점이 커질 수 있고, text 요청이 대부분이면 큰 통합 모델을 항상 띄우는 비용이 더 클 수 있습니다.

기존 도구의 독립 업그레이드 가능성도 비용입니다. OCR만 교체하거나 이미지 생성기만 scale-out해야 하는 조직에는 분리된 stack이 유연합니다. 하나의 checkpoint가 모든 능력을 같이 개선한다는 장점은 한 능력의 회귀가 전체 배포를 막는 단점과 함께 봐야 합니다.

안전성과 provenance는 어디에 붙이나

모든 모달리티가 token 흐름으로 들어와도 외부 이미지의 지시문과 사용자 정책은 구분해야 합니다. 생성된 이미지, 오디오의 필터, 저작권과 데이터 출처 검토도 decoder 밖의 계층으로 남습니다. 모델이 이해와 생성을 모두 할 수 있으면 입력 내용을 조금 바꿔 재생성하는 공격 경로도 늘어날 수 있습니다.

출력에는 모델, tokenizer, decoder 버전과 생성 설정을 연결해 재현할 수 있게 합니다. 생성물 표시나 provenance metadata가 필요한 서비스에서는 이미지, 오디오 변환 과정에서 해당 정보가 사라지지 않는지 확인해야 합니다. 단일 next-token objective가 거버넌스까지 통합하는 것은 아닙니다.

함께 읽으면 이해가 이어지는 글

자주 묻는 질문

이산 토큰이면 diffusion보다 항상 빠른가요?

denoising step은 줄 수 있지만 긴 token을 순차 생성하는 비용이 생깁니다. 해상도, token 수, sampling과 하드웨어를 같은 출력 품질에서 비교해야 합니다.

텍스트와 이미지는 정말 같은 tokenizer를 쓰나요?

공통 Transformer가 이산 token을 예측하지만 원신호를 code로 바꾸고 복원하는 모달리티별 구성 요소는 필요합니다. “같은 token 형식”과 “전처리까지 동일”은 다른 뜻입니다.

통합 모델 하나로 모든 멀티모달 서비스를 대체할 수 있나요?

업무 분포와 운영 요구에 따라 다릅니다. 이해와 생성이 자주 이어지는 경우에는 장점이 있지만, 모달리티별 독립 확장과 교체가 중요한 시스템은 분리 구성이 더 경제적일 수 있습니다.

THE END / OPSOAI

여기까지 읽었습니다

핵심 장면을 한 번 더 떠올려 보세요. 이해가 남았다면 이 책은 제 역할을 다했습니다.

다른 책 고르기
표지 1 —

←→ 키와 좌우 스와이프를 지원합니다. 읽던 페이지는 이 기기에 저장됩니다.

CONTENTS

이 책의 목차

    12개 장 17 분읽는 시간