xAI는 12일 Grok 4.6를 공개하며, 이를 새로운 기반 모델이 아니라 Grok 4.5의 후훈련 정교화라고 설명했다. 두 모델은 모두 같은 1.5조 파라미터 "V9" 기반 위에 있다.

실제로 바뀐 것

이번 작업은 에이전트 환경에서의 강화학습과 지도 미세조정으로 이뤄졌다. 즉, 원시적 규모 확대가 아니라 장시간 도구 사용에 초점이 맞춰졌다. xAI는 Artificial Analysis Intelligence Index에서 Grok 4.6이 61점을 기록해 Grok 4.5의 56점을 웃돌았다고 밝혔다. 이는 해당 지수에서 GPT-5.6 Sol과 동률이다. 컨텍스트는 여전히 50만 토큰이며, 입력은 텍스트와 이미지이고, 지식 기준 시점은 2026년 2월 1일이다. 호출자에게는 새로운 xhigh 추론 노력 단계도 제공된다.

우위를 보이지 못한 부분

코딩 성능에서는 그림이 덜 인상적이다. Grok 4.6은 CursorBench v3.2에서 69.9%, DeepSWE v1.1에서 65.9%, FrontierCode v1.1에서 61.3%, Terminal-Bench v3.0에서 26%를 기록했다. DeepSWE 수치는 GPT-5.6의 약 73%보다 의미 있게 낮다. 하나의 종합 지수 동률이 소프트웨어 엔지니어링에서의 우위를 뜻하는 것은 아니다.

가격과 이용 가능성

20만 토큰 이하 프롬프트에서는 입력 토큰 100만 개당 2달러, 캐시된 입력은 0.50달러, 출력은 6달러다. 이를 넘어서면 4달러 / 1달러 / 12달러로 올라간다. "fast" 변형은 이 요금의 두 배다. 이 모델은 Grok Build의 기본값이며, 모든 Cursor 요금제에서 이용할 수 있고, 첫 주에는 포함 사용량이 두 배로 제공된다. 공개 가중치는 없다.

삭제할 만한 숫자 하나

일부 보도에서는 Grok 4.6의 "1753 ELO" 수치가 돌았다. 그러나 이는 Arena ELO가 아니라 모델의 GDPVal-AA v2 점수이며, 둘은 비교할 수 없다. 8월 7일부터 롤아웃이 시작됐다는 주장도 xAI 자체 자료에서는 확인되지 않는다.

이 흐름이 의미하는 것

새로운 사전학습 없이 5점의 지수 상승을 얻는 것은 현재 최전선 경쟁의 모습이다. 비싼 단계는 끝났고, 성과는 이후에 무엇을 하느냐에서 나온다. 또한 버전 번호만으로 두 모델 사이에 얼마나 많은 컴퓨트가 들어갔는지를 판단하기 어렵다는 점도 보여준다.