Anthropic lanzó Claude Opus 5 el viernes con una propuesta que es, esencialmente, aritmética. El modelo se queda a menos del 0,5% del propio sistema frontier de la compañía, Claude Fable 5, en un importante benchmark de programación — a la mitad del coste por tarea y exactamente al precio que cobraba su predecesor. La entrada sigue en 5 dólares por millón de tokens y la salida en 25 dólares, sin cambios respecto a Opus 4.8; Fable 5 figura en 10 y 50 dólares. Opus 5 pasa a ser el modelo predeterminado en Claude Max y la opción más potente disponible en Claude Pro.
Lo que afirma la hoja de benchmarks
En Frontier-Bench v0.1, la evaluación de ingeniería de software de Anthropic, Opus 5 encabeza a todos los demás modelos y más que duplica el rendimiento de Opus 4.8 con un menor coste por tarea. En CursorBench 3.2, con esfuerzo máximo, queda dentro del 0,5% de la puntuación máxima de Fable 5 por la mitad del coste por tarea, y supera a todos los demás modelos en rendimiento por dólar en los ajustes de esfuerzo alto, xhigh y max.



El patrón se repite fuera del código:
- ARC-AGI 3, que exige resolver problemas nuevos: la puntuación de Opus 5 es tres veces la del siguiente mejor modelo.
- Zapier AutomationBench, que mide si un modelo puede completar de principio a fin una tarea empresarial: tasa de acierto alrededor de 1,5 veces la del siguiente mejor modelo al mismo coste por tarea — e incluso en su ajuste de esfuerzo más bajo, Opus 5 completa más tareas que cualquier otro modelo.
- OSWorld 2.0, un benchmark de uso del ordenador: supera el mejor resultado de Fable 5 con apenas algo más de un tercio del coste y lidera a todos los modelos a cualquier punto de precio dado.



Anthropic también afirma obtener los mejores resultados y los más eficientes en coste en AA Coding Agent Index, GDPval-AA v2, HLE, AutomationBench y DeepSearchQA. El único ámbito en el que admite abiertamente una desventaja es la ciberseguridad, donde Mythos 5 — el modelo solo por invitación ofrecido a través de Project Glasswing — sigue por delante.



La letra pequeña bajo el gráfico principal
La nota al pie bajo el gráfico de esfuerzo de Frontier-Bench merece leerse. Esos números proceden de una ejecución interna en el entorno mini-SWE-agent con un backend GKE, puntuados como recompensa media en cinco intentos por tarea. Y cada vez que un clasificador de seguridad rechazó una solicitud durante esa ejecución — en Opus 5 o en Fable 5 — Opus 4.8 se sustituyó como respaldo, de modo que las líneas representadas no son estrictamente resultados de un único modelo.
La hoja de resultados completa — incluidas las pérdidas
La propia tabla comparativa de Anthropic es el artefacto aislado más útil del lanzamiento, porque es donde Opus 5 deja de ganar. Lidera 9 de 14 filas — pero Fable 5 sigue llevándose la versión sin herramientas de Humanity's Last Exam, el tramo de programación de FrontierCode y el benchmark jurídico; GPT-5.6 Sol de OpenAI encabeza una evaluación de programación agentic sin discusión; y Mythos 5, de invitación, conserva la ventaja en salud. Cada cifra es propia de Anthropic, con cada modelo en su mejor ajuste de esfuerzo:

Hay dos cosas que llaman la atención en la cuadrícula y que el texto pasa por alto. En DeepSWE v1.1, un benchmark de programación, el 72,7% de GPT-5.6 Sol supera a todos los Claude, incluido Opus 5. Y las victorias titulares de Opus 5 están desigualmente repartidas por categorías: más que duplica al resto en ARC-AGI-3 (30,2% frente a 7,8%) y los supera por nueve puntos en AutomationBench (26,0% frente a 18,1%), pero en los tramos de programación todo el grupo queda dentro de aproximadamente un punto entre sí.
Tres tareas que Anthropic dice que nada más consiguió terminar
La parte más sólida del caso de Anthropic no son las puntuaciones, sino la persistencia. Tres ejemplos de sus evaluaciones y pruebas de acceso anticipado:
- Ante un dibujo de una pieza de máquina y la petición de reconstruirla como un modelo 3D de FreeCAD — sin posibilidad de ver el dibujo directamente — Opus 5 escribió su propio pipeline de visión por ordenador para extraer la geometría de los píxeles en bruto y luego reconstruyó la pieza completa. Lo hizo de forma repetida. Anthropic afirma que ningún modelo competidor con la misma configuración lo resolvió en cinco intentos.
- Ante un fallo real en un popular gestor de paquetes de código abierto, encontró la causa raíz y corrigió un caso límite que el parche de la comunidad había pasado por alto. Un modelo competidor solo arregló el síntoma superficial y luego informó de que el error estaba resuelto.
- Un ingeniero de una firma de trading lo utilizó para construir un feed de datos de mercado para una nueva bolsa en una sola sesión — un trabajo que modelos anteriores no pudieron completar en absoluto, ni siquiera con planes extensos. Al no encontrar un feed en vivo con el que validar, el modelo construyó su propio entorno de pruebas para comprobar que su código analizaba correctamente los datos de la bolsa.
Lo que midieron realmente los primeros clientes
Anthropic publicó 22 testimonios de clientes con acceso anticipado, y un número inusual de ellos incluye cifras concretas:
- Ben Kus, CTO de Box: Opus 5 supera a Opus 4.8 en un 8% en conjunto, con mejoras del 11% en análisis de datos y del 17% en due diligence.
- Fabian Hedin, cofundador de Lovable: mejora en un 22% respecto a Opus 4.7 en las tareas agentic de programación más difíciles de la empresa y es "más estable, con mucha menos variación de una ejecución a otra".
- Wade Foster, CEO de Zapier: Opus 5 lideró AutomationBench "sin gastar más tokens que los modelos Claude anteriores". En un flujo de trabajo de prevención de bajas en el que los modelos anteriores fallaron por completo, alcanzó el 100%.
- Un equipo de IA jurídica informó de una calidad comparable con niveles de razonamiento más bajos, generando un 26% menos de tokens que Opus 4.8 al razonamiento máximo. El responsable de evaluaciones financieras midió 9 puntos porcentuales más de precisión con un tercio menos de turnos y llamadas a herramientas y un 60% menos de tiempo. Un benchmark de trading registró su mejor resultado hasta la fecha con Opus usando aproximadamente un séptimo de los tokens de razonamiento y menos de la mitad de la latencia de Opus 4.8.
- Scott Wu, CEO de Cognition, dijo que "se acerca al rendimiento de nivel Fable a la mitad del coste" dentro de Devin, con una fuerza particular en depuración y análisis de causa raíz. Madhav Jha, CTO de Vercel, lo calificó como "el mayor salto en la familia Opus desde 4.5".
Un informe anticipa hacia dónde se dirige la programación agentic: un equipo de benchmark de frontend dijo que el modelo abrió sus propias páginas en un navegador con anchuras de escritorio y de teléfono, detectó un producto oculto por debajo del pliegue móvil y un botón de pago fuera de la pantalla, y corrigió ambos antes de devolver el trabajo.
Química, proteínas y un túnel de viento
Opus 5 supera a Opus 4.8 en todas las evaluaciones internas de ciencias de la vida de Anthropic, que abarcan biología estructural, química orgánica y bioinformática. Las mayores mejoras son de +10,2 puntos porcentuales en tareas de química orgánica, como inferir estructuras moleculares a partir de datos de espectroscopia, y de +7,7 puntos en trabajo con proteínas, como predecir cómo las variaciones de una secuencia cambian su función. Anthropic también destaca una salida visual más potente, incluida una simulación interactiva de túnel de viento que el modelo construyó para visualizar el flujo de aire sobre objetos aerodinámicos — y deliberadamente no aerodinámicos —.
El modelo más alineado que Anthropic ha auditado
En la auditoría conductual automatizada de la compañía, Opus 5 obtuvo 2,3 en comportamiento desalineado global, la cifra más baja de sus modelos recientes. Anthropic afirma que se ajusta mejor a la Constitución de Claude que Opus 4.8, Sonnet 5 o Fable 5, muestra las tasas más bajas de comportamiento engañoso, es el menos susceptible de ser manipulado para usos indebidos y es su modelo más seguro hasta la fecha a la hora de evitar acciones temerarias con efectos secundarios difíciles de revertir.
Fuerte encontrando vulnerabilidades, limitado al explotarlas
Anthropic afirma que Opus 5 no avanza el estado del arte en capacidad dual de uso arriesgado y que, en evaluaciones realizadas junto a socios del sector privado y del gobierno, sigue por detrás de Mythos 5 tanto en investigación biológica como en ciberseguridad ofensiva. Igual que con Opus 4.8, la empresa dice que evitó entrenar deliberadamente a Opus 5 en tareas cibernéticas — y, aun así, el modelo mejoró en ellas, únicamente como subproducto de hacerse más capaz en general. Ahora se aproxima a Mythos 5 a la hora de encontrar vulnerabilidades de software.
La distancia que conserva está en la segunda mitad de esa cadena. En OSS-Fuzz, una evaluación interna de si un modelo puede encontrar una vulnerabilidad y luego explotarla sin mucha orientación humana, Opus 5 iguala a Mythos 5 en identificación, pero queda muy por detrás en el desarrollo del exploit — el paso que convierte un fallo en una amenaza cibernética material.
Cómo funcionan realmente las salvaguardas
Los clasificadores cibernéticos de Opus 5 permiten la búsqueda de vulnerabilidades en código fuente, pero bloquean el escaneo de vulnerabilidades basado en binarios — un método que Anthropic asocia más con actores maliciosos —, así como las pruebas de penetración y la generación de exploits. Según sus propias pruebas, la compañía espera que esos clasificadores intervengan aproximadamente un 85% menos que los de Fable 5. En Claude.ai, Claude Code y Claude Cowork, las solicitudes marcadas recurren por defecto a Opus 4.8, y el mismo respaldo puede activarse en la API. Las empresas e investigadores que ya están dentro del Cyber Verification Program de Anthropic obtienen acceso inmediato a una versión con menos restricciones.
En biología, la dirección se invierte. Como Opus 5 incorpora aproximadamente el mismo conjunto de salvaguardas que Opus 4.8, y no el de Fable 5, ahora es el modelo científicamente más capaz de Anthropic disponible de forma general — y las solicitudes de biología que se bloqueen en Fable 5 pasarán ahora a Opus 5 en lugar de a Opus 4.8. La compañía sigue señalando límites en la investigación autónoma de larga duración, el ámbito que considera de mayor riesgo, donde dice que Mythos 5 sigue siendo más fuerte.
Qué tienen que cambiar los desarrolladores
Este no es un simple cambio de cadena de modelo. Hay dos cambios incompatibles:
- El pensamiento adaptativo está activado por defecto. Opus 4.8 funcionaba sin pensar salvo que se le pidiera; Opus 5 piensa salvo que se le indique lo contrario — y como
max_tokenses un límite duro para pensamiento y texto visible juntos, hay que revisar los presupuestos existentes. - El pensamiento solo puede desactivarse en esfuerzo
higho inferior. Combinarthinking: {"type": "disabled"}conxhighomaxdevuelve ahora un error 400.
Además, el mínimo del prompt que puede almacenarse en caché baja a 512 tokens desde 1.024, por lo que los prompts breves que antes no podían almacenarse ahora sí, sin cambios de código. Dos funciones llegan en beta: mid-conversation tool changes, que permiten a los desarrolladores añadir o retirar herramientas entre turnos sin invalidar la caché del prompt (cabecera mid-conversation-tool-changes-2026-07-01), y automatic fallbacks, que redirigen las solicitudes marcadas por seguridad a otro modelo en lugar de devolver un rechazo (fallbacks: "default", cabecera server-side-fallback-2026-07-01).
Hay dos capacidades que no se trasladan: la herramienta web fetch no está disponible en Opus 5, y Priority Tier no está compatible. El prefijado de mensajes de asistente y los valores no predeterminados de temperature, top_p o top_k siguen devolviendo errores 400, como en Opus 4.8. Anthropic también advierte de que las respuestas predeterminadas son más largas que en Opus 4.8, y de que reducir el esfuerzo recorta el pensamiento sin acortar de forma fiable la salida visible — pide brevedad, en su lugar. Su consejo sobre el esfuerzo es hacer una nueva pasada completa en lugar de arrastrar los ajustes de Opus 4.8, porque low y medium son significativamente más potentes en esta generación.
La ficha técnica
Opus 5 mantiene una ventana de contexto de 1M tokens y una salida máxima de 128k — hasta 300k a través de la beta de salida ampliada de la API Batch — y admite los cinco niveles de esfuerzo: low, medium, high (el predeterminado), xhigh y max. Sus datos de entrenamiento llegan hasta mayo de 2026, cuatro meses más recientes que el corte de Fable 5 en enero de 2026. El modo Fast lo ejecuta a aproximadamente 2,5 veces la velocidad predeterminada por el doble del precio base, en Claude Platform y mediante créditos de uso en Claude Code. Los desarrolladores lo llaman como claude-opus-5 en la Claude API; también se ofrece en Amazon Bedrock, Claude Platform on AWS, Google Cloud y Microsoft Foundry. Igual que los modelos Opus anteriores, el acceso general no conlleva requisitos de retención de datos. La documentación de Anthropic también dirige a los usuarios del ya descontinuado Claude Opus 4.1 — que se retira el 5 de agosto de 2026 — hacia Opus 5 como destino de migración.
