Ultrafast mode는 답변 생성 속도가 서비스 병목인 음성, 코딩, 운영 에이전트에서 시험할 프리뷰입니다. 초당 최대 750토큰은 출력이 시작된 뒤의 처리량 지표로, 첫 토큰 시간이나 검색, 도구, 음성 합성을 포함한 전체 응답 시간이 14배 줄어든다는 뜻은 아닙니다. 가격과 일반 제공 일정도 공개되지 않았으므로 기존 API를 대체하기보다 동일 요청으로 종단 지연과 비용을 비교해야 합니다.
flowchart TD
A[OpenAI & Cerebras GPT-5.6 Sol Ultrafast 발표] --> B[Cerebras 웨이퍼 스케일 엔진 기반 API 계층]
B --> C[표준 대비 최대 14배 속도 및 초당 750토큰 생성]
C --> D[실시간 음성 에이전트 / 장애 대응 / 금융 조사 활용]
D --> E[현재 대기열 기반 제한적 프리뷰 단계]
AI가 아무리 똑똑해져도 답답한 응답 속도 때문에 실시간 서비스 도입을 주저했던 경험이 있으신가요? OpenAI가 Cerebras와 손잡고 기존 표준 처리보다 최대 14배 빠른 GPT-5.6 Sol Ultrafast mode를 전격 공개하며 이 문제를 해결하겠다고 나섰습니다.
초당 750토큰을 해석하는 데 필요한 지표
- 출력 처리량: 응답 스트리밍이 시작된 뒤 일정 시간에 생성되는 토큰 수입니다. 긴 답변의 출력 구간은 잘 보여 주지만 요청을 보낸 직후의 대기까지 설명하지는 않습니다.
- 첫 토큰 시간(TTFT): 요청 전송부터 첫 출력 조각이 도착할 때까지의 시간입니다. 답이 짧은 대화형 서비스에서는 최고 처리량보다 체감 속도에 더 큰 영향을 줄 수 있습니다.
- 종단 지연 시간: 네트워크, 대기열, 첫 토큰 계산, 전체 생성, 도구 호출과 후처리를 모두 합쳐 사용자가 결과를 받기까지 걸린 시간입니다. 표준 모드와 비교할 때 같은 입력과 출력 길이를 써야 합니다.
- 제한적 프리뷰: 정식 일반 제공 전에 선택된 사용자에게 기능과 운영 조건을 시험하는 단계입니다. 이 글의 공개 시점에는 가격과 일반 제공 일정이 확정되지 않았으므로 프리뷰 수치를 장기 운영 조건으로 간주하면 안 됩니다.


