xAI lanzó Grok 4.6 el 12 de agosto, describiéndolo como un refinamiento de postentrenamiento de Grok 4.5 y no como un nuevo modelo base. Ambos se apoyan en la misma base fundacional "V9" de 1,5 billones de parámetros.

Lo que realmente cambió

El trabajo consiste en ajuste fino supervisado y aprendizaje por refuerzo en entornos agénticos: uso prolongado de herramientas, no mayor escala bruta. xAI reporta 61 en el Artificial Analysis Intelligence Index frente a 56 para Grok 4.5, que empata con GPT-5.6 Sol en ese índice. El contexto sigue en 500K tokens, las entradas son texto e imágenes, y el corte de conocimiento es el 1 de febrero de 2026. Un nuevo nivel de esfuerzo de razonamiento xhigh está disponible para los usuarios que llaman al modelo.

Donde no lidera

En programación, el panorama es menos favorable. Grok 4.6 registra 69,9% en CursorBench v3.2, 65,9% en DeepSWE v1.1, 61,3% en FrontierCode v1.1 y 26% en Terminal-Bench v3.0. La cifra de DeepSWE queda claramente por debajo del aproximadamente 73% de GPT-5.6; empatar en un índice compuesto no equivale a liderar en ingeniería de software.

Precio y disponibilidad

Por debajo de un prompt de 200K tokens, el modelo cuesta 2 dólares por millón de tokens de entrada, 0,50 dólares en caché y 6 dólares de salida; por encima, 4 / 1 / 12 dólares. La variante "fast" duplica esas tarifas. Es el modelo predeterminado en Grok Build, está disponible en todos los planes de Cursor y se lanzó con el uso incluido duplicado durante la primera semana. No hay pesos abiertos.

Una cifra que conviene borrar

En la cobertura ha circulado una cifra de "1753 ELO" para Grok 4.6. Se trata de la puntuación GDPVal-AA v2 del modelo, no de un ELO de Arena, y ambas no son comparables. Tampoco hay respaldo en los materiales propios de xAI para un despliegue que habría comenzado el 7 de agosto.

El patrón al que responde

Una ganancia de cinco puntos en el índice sin una nueva ronda de preentrenamiento es hoy la forma que adopta la competencia en la frontera: la parte cara ya está hecha, y los retornos proceden de lo que ocurre después. También convierte los números de versión en una mala guía sobre cuánta computación separa a dos modelos.