Anthropic lanzó Claude Opus 5 el viernes con una propuesta que es, esencialmente, aritmética. El modelo se queda a menos del 0,5% del propio sistema frontier de la compañía, Claude Fable 5, en un importante benchmark de programación — a la mitad del coste por tarea y exactamente al precio que cobraba su predecesor. La entrada sigue en 5 dólares por millón de tokens y la salida en 25 dólares, sin cambios respecto a Opus 4.8; Fable 5 figura en 10 y 50 dólares. Opus 5 pasa a ser el modelo predeterminado en Claude Max y la opción más potente disponible en Claude Pro.

Lo que afirma la hoja de benchmarks

En Frontier-Bench v0.1, la evaluación de ingeniería de software de Anthropic, Opus 5 encabeza a todos los demás modelos y más que duplica el rendimiento de Opus 4.8 con un menor coste por tarea. En CursorBench 3.2, con esfuerzo máximo, queda dentro del 0,5% de la puntuación máxima de Fable 5 por la mitad del coste por tarea, y supera a todos los demás modelos en rendimiento por dólar en los ajustes de esfuerzo alto, xhigh y max.

Gráfico de Frontier-Bench v0.1: puntuación de programación en terminal agentic frente al coste por intento por nivel de esfuerzo, con Claude Opus 5 por encima de Fable 5, Opus 4.8 y GPT-5.6 Sol
Programación en terminal agentic (Frontier-Bench v0.1): puntuación frente al coste por intento en cada nivel de esfuerzo. Opus 5 (rojo) se sitúa por encima de Fable 5 (naranja) con un coste mucho menor. Fuente: Anthropic.
Gráfico de CursorBench 3.2: puntuación de programación agentic frente al coste por tarea por esfuerzo, con Opus 5 alcanzando dentro del 0,5 por ciento de Fable 5 a la mitad del coste
Programación agentic (CursorBench 3.2): con esfuerzo máximo, Opus 5 queda dentro del 0,5% del pico de Fable 5 por la mitad del coste por tarea. Fuente: Anthropic.
Gráfico del Artificial Analysis Coding Agent Index: puntuación del índice frente al coste por tarea por nivel de esfuerzo entre los cuatro modelos
Artificial Analysis Coding Agent Index, puntuación del índice frente al coste por tarea por nivel de esfuerzo. Fuente: Anthropic.

El patrón se repite fuera del código:

  • ARC-AGI 3, que exige resolver problemas nuevos: la puntuación de Opus 5 es tres veces la del siguiente mejor modelo.
  • Zapier AutomationBench, que mide si un modelo puede completar de principio a fin una tarea empresarial: tasa de acierto alrededor de 1,5 veces la del siguiente mejor modelo al mismo coste por tarea — e incluso en su ajuste de esfuerzo más bajo, Opus 5 completa más tareas que cualquier otro modelo.
  • OSWorld 2.0, un benchmark de uso del ordenador: supera el mejor resultado de Fable 5 con apenas algo más de un tercio del coste y lidera a todos los modelos a cualquier punto de precio dado.
Gráfico de ARC-AGI-3: puntuación de resolución de problemas nuevos frente al coste total de evaluación, con Opus 5 cerca del 30 por ciento, aproximadamente el triple que GPT-5.6 Sol y muy por encima de Opus 4.8
Resolución de problemas nuevos (ARC-AGI-3): Opus 5 obtiene alrededor del 30%, aproximadamente el triple que GPT-5.6 Sol y muy por encima de Opus 4.8. Fuente: Anthropic.
Gráfico de AutomationBench: tasa de acierto en flujos de trabajo empresariales agentic frente al coste por tarea por esfuerzo, con Opus 5 muy por encima del resto
Flujos de trabajo empresariales agentic (AutomationBench): la tasa de acierto de Opus 5 se sitúa muy por encima de la de cualquier otro modelo. Fuente: Anthropic.
Gráfico de OSWorld 2.0: puntuación de uso agentic del ordenador frente al coste por tarea por esfuerzo, con Opus 5 superando el mejor resultado de Fable 5 a cerca de un tercio del coste
Uso agentic del ordenador (OSWorld 2.0): Opus 5 supera el mejor resultado de Fable 5 a aproximadamente un tercio del coste por tarea. Fuente: Anthropic.

Anthropic también afirma obtener los mejores resultados y los más eficientes en coste en AA Coding Agent Index, GDPval-AA v2, HLE, AutomationBench y DeepSearchQA. El único ámbito en el que admite abiertamente una desventaja es la ciberseguridad, donde Mythos 5 — el modelo solo por invitación ofrecido a través de Project Glasswing — sigue por delante.

Gráfico de GDPval-AA v2: puntuación Elo de trabajo del conocimiento en el mundo real frente al coste de ejecutar el benchmark completo por nivel de esfuerzo
Trabajo del conocimiento en el mundo real (GDPval-AA v2): puntuación Elo frente al coste de ejecutar el benchmark completo, por nivel de esfuerzo. Fuente: Anthropic.
Gráfico de Humanity's Last Exam con herramientas: tasa de acierto en razonamiento multidisciplinar frente al coste por tarea por nivel de esfuerzo
Razonamiento multidisciplinar (Humanity's Last Exam, con herramientas), tasa de acierto frente al coste por tarea por esfuerzo. Fuente: Anthropic.
Gráfico de DeepSearchQA: tasa de acierto en búsqueda agentic frente al coste por tarea por nivel de esfuerzo entre los modelos
Búsqueda agentic (DeepSearchQA), tasa de acierto frente al coste por tarea por nivel de esfuerzo. Fuente: Anthropic.

La letra pequeña bajo el gráfico principal

La nota al pie bajo el gráfico de esfuerzo de Frontier-Bench merece leerse. Esos números proceden de una ejecución interna en el entorno mini-SWE-agent con un backend GKE, puntuados como recompensa media en cinco intentos por tarea. Y cada vez que un clasificador de seguridad rechazó una solicitud durante esa ejecución — en Opus 5 o en Fable 5 — Opus 4.8 se sustituyó como respaldo, de modo que las líneas representadas no son estrictamente resultados de un único modelo.

La hoja de resultados completa — incluidas las pérdidas

La propia tabla comparativa de Anthropic es el artefacto aislado más útil del lanzamiento, porque es donde Opus 5 deja de ganar. Lidera 9 de 14 filas — pero Fable 5 sigue llevándose la versión sin herramientas de Humanity's Last Exam, el tramo de programación de FrontierCode y el benchmark jurídico; GPT-5.6 Sol de OpenAI encabeza una evaluación de programación agentic sin discusión; y Mythos 5, de invitación, conserva la ventaja en salud. Cada cifra es propia de Anthropic, con cada modelo en su mejor ajuste de esfuerzo:

Hoja completa de benchmarks de Anthropic comparando Claude Opus 5, Fable 5, Opus 4.8 y GPT-5.6 Sol en 14 evaluaciones, con el líder de categoría en negrita
La hoja completa de Anthropic: Claude Opus 5 frente a Fable 5, Opus 4.8 y GPT-5.6 Sol de OpenAI en 14 benchmarks. La negrita marca al líder de la categoría; la columna de Fable 5 cita Mythos 5 en las dos filas así indicadas. Fuente: Anthropic.

Hay dos cosas que llaman la atención en la cuadrícula y que el texto pasa por alto. En DeepSWE v1.1, un benchmark de programación, el 72,7% de GPT-5.6 Sol supera a todos los Claude, incluido Opus 5. Y las victorias titulares de Opus 5 están desigualmente repartidas por categorías: más que duplica al resto en ARC-AGI-3 (30,2% frente a 7,8%) y los supera por nueve puntos en AutomationBench (26,0% frente a 18,1%), pero en los tramos de programación todo el grupo queda dentro de aproximadamente un punto entre sí.

Tres tareas que Anthropic dice que nada más consiguió terminar

La parte más sólida del caso de Anthropic no son las puntuaciones, sino la persistencia. Tres ejemplos de sus evaluaciones y pruebas de acceso anticipado:

  • Ante un dibujo de una pieza de máquina y la petición de reconstruirla como un modelo 3D de FreeCAD — sin posibilidad de ver el dibujo directamente — Opus 5 escribió su propio pipeline de visión por ordenador para extraer la geometría de los píxeles en bruto y luego reconstruyó la pieza completa. Lo hizo de forma repetida. Anthropic afirma que ningún modelo competidor con la misma configuración lo resolvió en cinco intentos.
  • Ante un fallo real en un popular gestor de paquetes de código abierto, encontró la causa raíz y corrigió un caso límite que el parche de la comunidad había pasado por alto. Un modelo competidor solo arregló el síntoma superficial y luego informó de que el error estaba resuelto.
  • Un ingeniero de una firma de trading lo utilizó para construir un feed de datos de mercado para una nueva bolsa en una sola sesión — un trabajo que modelos anteriores no pudieron completar en absoluto, ni siquiera con planes extensos. Al no encontrar un feed en vivo con el que validar, el modelo construyó su propio entorno de pruebas para comprobar que su código analizaba correctamente los datos de la bolsa.

Lo que midieron realmente los primeros clientes

Anthropic publicó 22 testimonios de clientes con acceso anticipado, y un número inusual de ellos incluye cifras concretas:

  • Ben Kus, CTO de Box: Opus 5 supera a Opus 4.8 en un 8% en conjunto, con mejoras del 11% en análisis de datos y del 17% en due diligence.
  • Fabian Hedin, cofundador de Lovable: mejora en un 22% respecto a Opus 4.7 en las tareas agentic de programación más difíciles de la empresa y es "más estable, con mucha menos variación de una ejecución a otra".
  • Wade Foster, CEO de Zapier: Opus 5 lideró AutomationBench "sin gastar más tokens que los modelos Claude anteriores". En un flujo de trabajo de prevención de bajas en el que los modelos anteriores fallaron por completo, alcanzó el 100%.
  • Un equipo de IA jurídica informó de una calidad comparable con niveles de razonamiento más bajos, generando un 26% menos de tokens que Opus 4.8 al razonamiento máximo. El responsable de evaluaciones financieras midió 9 puntos porcentuales más de precisión con un tercio menos de turnos y llamadas a herramientas y un 60% menos de tiempo. Un benchmark de trading registró su mejor resultado hasta la fecha con Opus usando aproximadamente un séptimo de los tokens de razonamiento y menos de la mitad de la latencia de Opus 4.8.
  • Scott Wu, CEO de Cognition, dijo que "se acerca al rendimiento de nivel Fable a la mitad del coste" dentro de Devin, con una fuerza particular en depuración y análisis de causa raíz. Madhav Jha, CTO de Vercel, lo calificó como "el mayor salto en la familia Opus desde 4.5".

Un informe anticipa hacia dónde se dirige la programación agentic: un equipo de benchmark de frontend dijo que el modelo abrió sus propias páginas en un navegador con anchuras de escritorio y de teléfono, detectó un producto oculto por debajo del pliegue móvil y un botón de pago fuera de la pantalla, y corrigió ambos antes de devolver el trabajo.

Química, proteínas y un túnel de viento

Opus 5 supera a Opus 4.8 en todas las evaluaciones internas de ciencias de la vida de Anthropic, que abarcan biología estructural, química orgánica y bioinformática. Las mayores mejoras son de +10,2 puntos porcentuales en tareas de química orgánica, como inferir estructuras moleculares a partir de datos de espectroscopia, y de +7,7 puntos en trabajo con proteínas, como predecir cómo las variaciones de una secuencia cambian su función. Anthropic también destaca una salida visual más potente, incluida una simulación interactiva de túnel de viento que el modelo construyó para visualizar el flujo de aire sobre objetos aerodinámicos — y deliberadamente no aerodinámicos —.

El modelo más alineado que Anthropic ha auditado

En la auditoría conductual automatizada de la compañía, Opus 5 obtuvo 2,3 en comportamiento desalineado global, la cifra más baja de sus modelos recientes. Anthropic afirma que se ajusta mejor a la Constitución de Claude que Opus 4.8, Sonnet 5 o Fable 5, muestra las tasas más bajas de comportamiento engañoso, es el menos susceptible de ser manipulado para usos indebidos y es su modelo más seguro hasta la fecha a la hora de evitar acciones temerarias con efectos secundarios difíciles de revertir.

Fuerte encontrando vulnerabilidades, limitado al explotarlas

Anthropic afirma que Opus 5 no avanza el estado del arte en capacidad dual de uso arriesgado y que, en evaluaciones realizadas junto a socios del sector privado y del gobierno, sigue por detrás de Mythos 5 tanto en investigación biológica como en ciberseguridad ofensiva. Igual que con Opus 4.8, la empresa dice que evitó entrenar deliberadamente a Opus 5 en tareas cibernéticas — y, aun así, el modelo mejoró en ellas, únicamente como subproducto de hacerse más capaz en general. Ahora se aproxima a Mythos 5 a la hora de encontrar vulnerabilidades de software.

La distancia que conserva está en la segunda mitad de esa cadena. En OSS-Fuzz, una evaluación interna de si un modelo puede encontrar una vulnerabilidad y luego explotarla sin mucha orientación humana, Opus 5 iguala a Mythos 5 en identificación, pero queda muy por detrás en el desarrollo del exploit — el paso que convierte un fallo en una amenaza cibernética material.

Cómo funcionan realmente las salvaguardas

Los clasificadores cibernéticos de Opus 5 permiten la búsqueda de vulnerabilidades en código fuente, pero bloquean el escaneo de vulnerabilidades basado en binarios — un método que Anthropic asocia más con actores maliciosos —, así como las pruebas de penetración y la generación de exploits. Según sus propias pruebas, la compañía espera que esos clasificadores intervengan aproximadamente un 85% menos que los de Fable 5. En Claude.ai, Claude Code y Claude Cowork, las solicitudes marcadas recurren por defecto a Opus 4.8, y el mismo respaldo puede activarse en la API. Las empresas e investigadores que ya están dentro del Cyber Verification Program de Anthropic obtienen acceso inmediato a una versión con menos restricciones.

En biología, la dirección se invierte. Como Opus 5 incorpora aproximadamente el mismo conjunto de salvaguardas que Opus 4.8, y no el de Fable 5, ahora es el modelo científicamente más capaz de Anthropic disponible de forma general — y las solicitudes de biología que se bloqueen en Fable 5 pasarán ahora a Opus 5 en lugar de a Opus 4.8. La compañía sigue señalando límites en la investigación autónoma de larga duración, el ámbito que considera de mayor riesgo, donde dice que Mythos 5 sigue siendo más fuerte.

Qué tienen que cambiar los desarrolladores

Este no es un simple cambio de cadena de modelo. Hay dos cambios incompatibles:

  • El pensamiento adaptativo está activado por defecto. Opus 4.8 funcionaba sin pensar salvo que se le pidiera; Opus 5 piensa salvo que se le indique lo contrario — y como max_tokens es un límite duro para pensamiento y texto visible juntos, hay que revisar los presupuestos existentes.
  • El pensamiento solo puede desactivarse en esfuerzo high o inferior. Combinar thinking: {"type": "disabled"} con xhigh o max devuelve ahora un error 400.

Además, el mínimo del prompt que puede almacenarse en caché baja a 512 tokens desde 1.024, por lo que los prompts breves que antes no podían almacenarse ahora sí, sin cambios de código. Dos funciones llegan en beta: mid-conversation tool changes, que permiten a los desarrolladores añadir o retirar herramientas entre turnos sin invalidar la caché del prompt (cabecera mid-conversation-tool-changes-2026-07-01), y automatic fallbacks, que redirigen las solicitudes marcadas por seguridad a otro modelo en lugar de devolver un rechazo (fallbacks: "default", cabecera server-side-fallback-2026-07-01).

Hay dos capacidades que no se trasladan: la herramienta web fetch no está disponible en Opus 5, y Priority Tier no está compatible. El prefijado de mensajes de asistente y los valores no predeterminados de temperature, top_p o top_k siguen devolviendo errores 400, como en Opus 4.8. Anthropic también advierte de que las respuestas predeterminadas son más largas que en Opus 4.8, y de que reducir el esfuerzo recorta el pensamiento sin acortar de forma fiable la salida visible — pide brevedad, en su lugar. Su consejo sobre el esfuerzo es hacer una nueva pasada completa en lugar de arrastrar los ajustes de Opus 4.8, porque low y medium son significativamente más potentes en esta generación.

La ficha técnica

Opus 5 mantiene una ventana de contexto de 1M tokens y una salida máxima de 128k — hasta 300k a través de la beta de salida ampliada de la API Batch — y admite los cinco niveles de esfuerzo: low, medium, high (el predeterminado), xhigh y max. Sus datos de entrenamiento llegan hasta mayo de 2026, cuatro meses más recientes que el corte de Fable 5 en enero de 2026. El modo Fast lo ejecuta a aproximadamente 2,5 veces la velocidad predeterminada por el doble del precio base, en Claude Platform y mediante créditos de uso en Claude Code. Los desarrolladores lo llaman como claude-opus-5 en la Claude API; también se ofrece en Amazon Bedrock, Claude Platform on AWS, Google Cloud y Microsoft Foundry. Igual que los modelos Opus anteriores, el acceso general no conlleva requisitos de retención de datos. La documentación de Anthropic también dirige a los usuarios del ya descontinuado Claude Opus 4.1 — que se retira el 5 de agosto de 2026 — hacia Opus 5 como destino de migración.