OpenAI13일 Ultrafast의 제한적 미리보기를 시작했습니다. 이는 GPT-5.6 Sol을 위한 가속 제공 모드로, 회사에 따르면 표준 추론보다 최대 14배 빠르며 초당 최대 750개의 출력 토큰을 처리합니다.

새로운 점

이러한 속도 향상은 Cerebras와의 협력에서 나왔습니다. OpenAI의 제공 인프라는 그 밖에는 Nvidia 기반이며, 이번은 회사가 다른 벤더의 가속기에서 프런티어 모델을 생산 규모로 공개적으로 구동한 첫 사례입니다. Cerebras는 모델 가중치를 칩 내 메모리에 담는 웨이퍼 스케일 프로세서를 만들기 때문에, 자사의 추론 수치가 늘 빠를 수밖에 없었습니다. 다만 프런티어 연구소가 이를 실제로 출하할지는 미지수였습니다.

초당 750토큰이 바꾸는 것

표준 프런티어 속도에서는 긴 에이전트 실행 경로가 분 단위로 측정됩니다. 이 속도라면 모델은 사람이 문장을 읽는 것보다 더 빨리 문단 하나를 끝냅니다. 이는 여러 제품 범주를 비동기형에서 상호작용형으로 바꿉니다. OpenAI는 사건 대응, 고객 서비스, 금융 분석, 전자상거래를 예로 들었는데, 이들 모두에서 병목은 답이 아니라 대기 시간입니다.

공개된 한계

이번 미리보기는 선별된 고객 집단을 대상으로 하며, OpenAI는 "용량이 늘어남에 따라" 접근을 확대하겠다고 밝혔습니다. 이는 수요가 아니라 Cerebras의 공급 능력이 상한을 정한다는 사실을 인정한 셈입니다. 가격은 공개되지 않았으며, 14배750 수치는 지속 처리량이 아닌 상한치입니다.

지연 시간 이상의 의미

추론을 대량 구매하는 모든 기업은 2년 동안 제2 공급원을 확보하려고 노력해 왔습니다. 프런티어 연구소가 자사 대표 모델을 비-Nvidia 하드웨어에서 제공한 것은, 대체 실리콘이 벤치마크 외의 용도에서도 작동한다는 가장 강한 실증입니다.