OpenAI의 개발자 문서에서 GPT-6 Astra는 대부분의 출시 보도에서 빠뜨린 가격 규정을 두고 있으며, 모델이 겨냥한 바로 그 워크로드의 경제성을 뒤집는다. 공시된 입력 토큰 백만 개당 $10, 출력 토큰 백만 개당 $50 요금은 임계치 아래에서만 적용되며, 이를 넘으면 전체 요청이 재가격 책정된다.
임계치는 초과분이 아니라 전체에 적용된다
모델 페이지는 이를 분명히 밝힌다. "272K 입력 토큰을 초과하는 프롬프트는 전체 요청에 대해 입력 및 캐시 요금은 2배, 출력은 1.5배로 책정됩니다." 전체 요청에 대해라는 표현이 비용을 좌우한다. 273,000토큰 프롬프트는 마지막 1,000토큰에만 할증이 붙는 표준 요금이 아니라, 전체가 재가격 책정되어 입력 $20, 출력 $75가 된다. 이보다 2,000토큰 짧은 프롬프트는 비용이 절반이다.
캐시 쓰기는 새 입력보다 더 비싸다
같은 표는 캐시된 입력을 백만 개당 $1.00, 캐시 쓰기를 $12.50로 책정한다. 페이지는 쓰기 요금이 캐시되지 않은 입력 요금의 1.25배로 청구된다고 적고 있다. 프롬프트 캐시는 보통 절감 수단으로 제시되지만, 여기서는 재사용할 때만 회수되는 선결제 프리미엄이다. Batch와 Flex는 표준 요금의 절반이고, Fast 모드는 두 배이며, 페이지는 Fast 모드가 "EU 데이터 레지던시를 사용하는 GPT-6 Astra에서는 사용할 수 없습니다"라고 덧붙인다.
모델이 더는 받지 않는 제어값
OpenAI의 변경 로그에는 제약이 나열돼 있다. none reasoning-effort level 지원 없음, 사용자 지정 temperature나 top_p 없음, logprobs 없음이다. 이는 거의 쓰이지 않는 매개변수를 조금 덜어낸 수준이 아니다. 평가 하네스, 분류기 파이프라인, 토큰 확률 작업을 수행하는 모든 시스템은 Astra로 아예 이식할 수 없다. 벤치마크 점수가 어떻든 마찬가지다.
받아들여진 설명이 놓친 점
추적기와 해설은 백만 토큰 모델에 대해 $10/$50 고정 요금이라고 적는다. 그러나 양쪽 모두 오해를 낳는다. 이 가격은 단기 컨텍스트 사례에 적용될 뿐이며, OpenAI가 Astra를 위해 홍보하는 에이전트형 및 컴퓨터 사용 실행은 임계치를 넘는 영역에 있고 $20/$75 모델이다. 또한 "1M 컨텍스트" 수치는 페이지에 명시된 1,050,000토큰 컨텍스트 윈도를 뜻하며, 여기에는 생성 여유분이 포함된다. 여기에 페이지에 함께 명시된 최대 출력 토큰 128,000개를 감안하면, 실제 사용 가능한 입력은 약 922,000개 토큰이다. OpenAI는 이 차감 계산을 공개하지 않았으며, "1M 입력"을 기준으로 문서 파이프라인을 설계하는 사람은 대략 128K를 과대 추정한 셈이다.
