Anthropic ha lanzado hoy, 24 de julio de 2026, Claude Opus 5. No hemos ejecutado un benchmark propio: lo que sigue es una lectura crítica de la tabla de lanzamiento de Anthropic y de la cobertura que la ha cruzado en las últimas horas (OfficeChai, MacRumors, Interesting Engineering).
Separamos el dato verificable del multiplicador de marketing. Las gráficas que acompañan el texto son propias de Kroniq, construidas a partir de esas cifras citadas — no son capturas de ninguna otra web.
Conclusión en 30 segundos: Opus 5 mantiene la tarifa exacta de Opus 4.8 (5 $ / 25 $ por millón de tokens) y, según Anthropic, más que duplica su rendimiento en ingeniería de software. En dos pruebas más —CursorBench 3.2 y OSWorld 2.0— se acerca o supera a Fable 5, su propio modelo de gama superior, gastando entre un tercio y la mitad del presupuesto. Si ya usas Opus 4.8, actualizar no tiene coste y sí beneficio. Si dudabas entre pagar el precio de Fable 5, esta es la razón para volver a probar con Opus 5 antes.
Qué ha lanzado Anthropic y qué cambia realmente
Antes de entrar en cifras, conviene situar dónde encaja Opus 5 en el catálogo de Anthropic, porque buena parte de la cobertura del día del lanzamiento da esta jerarquía por sabida y no lo es:
Haiku → Sonnet → Opus → clase “Mythos” (Fable 5 y Mythos 5). Estos dos últimos, lanzados el 9 de junio de 2026, “se sitúan por encima de la clase Opus en capacidad”, según la propia Anthropic.1 Mythos 5 tiene acceso restringido —inicialmente solo a socios de ciberseguridad del Proyecto Glasswing—; Fable 5 es de uso general, a 10 $ de entrada y 50 $ de salida por millón de tokens.
Opus 5 sigue siendo “clase Opus”, el nivel intermedio-alto del catálogo. Lo que cambia es que, por primera vez, se acerca al rendimiento de la clase superior en varias pruebas concretas, sin subir de precio: 5 $ de entrada y 25 $ de salida por millón de tokens, exactamente lo mismo que costaba Opus 4.8.23 El modo rápido (fast mode) cuesta el doble a 2,5 veces la velocidad, igual que ya ocurría con la generación anterior.
Está disponible en Claude.ai, en la API (claude-opus-5), en Claude Code y en Claude Cowork; es el modelo por defecto de Claude Max y el más potente al que puede acceder un usuario de Claude Pro.2
Los benchmarks de Opus 5, uno por uno
Esto es lo importante: Anthropic no publicó, en la mayoría de los casos, una puntuación absoluta de 0 a 100. Publicó multiplicadores y deltas relativos frente a otro modelo. Tratar eso como si fuera una puntuación exacta sería inventar un dato que la fuente no da; por eso esta tabla se ciñe a lo que Anthropic dijo, con su propia unidad de medida:
| Benchmark | Qué mide | Lo que declara Anthropic |
|---|---|---|
| Frontier-Bench v0.1 | Ingeniería de software agéntica | Opus 5 más que duplica a Opus 4.8, a menor coste por tarea |
| CursorBench 3.2 (esfuerzo máximo) | Agente de código en edición asistida | Opus 5 queda a 0,5 puntos porcentuales del máximo de Fable 5, a ~mitad de coste |
| ARC-AGI-3 | Resolución de problemas novedosos (no memorizables) | Opus 5 triplica al siguiente mejor modelo evaluado |
| Zapier AutomationBench | Automatización agéntica de herramientas | Opus 5 logra ~1,5 veces la tasa de éxito del siguiente mejor modelo, a coste equivalente |
| OSWorld 2.0 | Uso de ordenador (computer use) | Opus 5 supera el mejor resultado de Fable 5 con ~un tercio de su presupuesto |
Fuente de las cinco filas: anuncio oficial de Anthropic, cruzado con la cobertura de OfficeChai, MacRumors e Interesting Engineering.2456
Hay una lectura honesta que hacer aquí, y es la misma que aplicaríamos a cualquier tabla de lanzamiento: estas cifras las elige y las mide quien lanza el producto. Anthropic no tiene ningún incentivo para escoger el benchmark en el que queda mal, y ARC-AGI-3, Frontier-Bench v0.1 o CursorBench 3.2 no tienen todavía el historial largo y auditado de un SWE-bench clásico.
Eso no las hace falsas: tres medios independientes reprodujeron los mismos números horas después del anuncio, lo que descarta un error de transcripción. Pero sí las convierte en una foto que hay que confirmar con uso real, no en una sentencia definitiva sobre qué modelo es “mejor”.
Precio: la sorpresa real del lanzamiento
Si solo te quedas con un dato de este artículo, que sea este: Opus 5 no ha subido de precio respecto a Opus 4.8. Cuesta lo mismo, 5 $ y 25 $ por millón de tokens de entrada y salida.3 La historia del lanzamiento no es “Anthropic ha bajado precios”, es “Anthropic ha subido el rendimiento sin tocar la factura”.
Frente a Fable 5, la diferencia sí es de precio doble (10 $ / 50 $), lo que convierte el resultado de CursorBench y OSWorld en el argumento comercial más fuerte del lanzamiento: casi el mismo resultado, o mejor, por la mitad o un tercio del coste.
Dicho esto, el precio por token nunca es el coste real de un flujo de trabajo. Si Opus 5 necesita más reintentos que Fable 5 en una tarea concreta, o si tu proceso ya está afinado alrededor del comportamiento exacto de Opus 4.8, la variable que importa es el coste por resultado aceptado, no el precio de la ficha técnica. Ningún benchmark de lanzamiento mide eso por ti.
Opus 5 frente a Fable 5 y Mythos 5
La comparación que Anthropic sí documenta con claridad es la interna: Opus 5 contra su propia familia. No hay, a fecha de esta pieza, una tabla del propio lanzamiento que cruce Opus 5 con modelos de otros proveedores en los mismos cinco benchmarks citados arriba —varios de ellos son evaluaciones nuevas o propietarias, sin historial cruzado todavía—. Por honestidad, este artículo no fuerza esa comparación donde las fuentes no la sostienen.
Si vienes de comparar modelos de otros proveedores, puede interesarte también nuestra review a fondo de GPT-5.6 Sol, Terra y Luna frente a Claude, que analiza esa misma familia Opus/Fable con la competencia de OpenAI.
Lo que sí queda claro dentro de la familia Anthropic:
- Frente a Opus 4.8: mejora sin coste añadido en ingeniería de software (Frontier-Bench v0.1) y en conocimiento científico (ver siguiente sección). Migrar no tiene motivo económico en contra.
- Frente a Fable 5: se acerca mucho en dos pruebas (CursorBench, OSWorld) a una fracción del precio, pero Fable 5 sigue siendo el modelo pensado para autonomía larga y verificación de su propio trabajo, según el posicionamiento que Anthropic mantiene desde su lanzamiento en junio.1
- Frente a Mythos 5: en ciberseguridad, Opus 5 queda cerca en encontrar vulnerabilidades, pero “sustancialmente por detrás” en explotarlas, según recoge MacRumors del propio material de Anthropic.5 Mythos 5 tiene acceso restringido, así que esta comparación es más una referencia de techo que una alternativa real para la mayoría de equipos.
La mejora que menos titulares se lleva: ciencias de la vida
Casi toda la cobertura del lanzamiento se centró en código y automatización. Dos cifras que han pasado más desapercibidas y que probablemente importan más a equipos de I+D biomédica o farmacéutica: Opus 5 mejora 10,2 puntos porcentuales en evaluaciones de química orgánica y 7,7 puntos porcentuales en predicción de estructura de proteínas, ambas frente a Opus 4.8.6
Anthropic no detalla el conjunto de preguntas ni el protocolo exacto de puntuación de estas dos evaluaciones, así que trátalas como una señal direccional —“mejora clara en conocimiento científico especializado”— y no como una cifra que puedas reproducir sin más contexto.
Lo que Opus 5 todavía no resuelve
La parte que ninguna tabla de lanzamiento destaca por iniciativa propia, y que aquí sí queremos dejar clara:
- Alineación: Anthropic reporta una puntuación de 2,30 en su escala interna de comportamiento desalineado, “la más baja de cualquier modelo Claude reciente” (menor es mejor).4 Es una buena noticia relativa, pero Anthropic no publica en esta nota la escala completa ni las puntuaciones exactas de los modelos anteriores, así que no se puede verificar de forma independiente cuánto ha mejorado en términos absolutos.
- Investigación biológica autónoma: la propia Anthropic reconoce que “el modelo todavía muestra limitaciones importantes en tareas de investigación autónomas y de larga duración, que es donde esperamos que los modelos de IA presenten el riesgo más sustancial relacionado con biología”.2 Es una advertencia del propio fabricante, no una crítica externa, y merece citarse tal cual.
- Ciberseguridad ofensiva: como se ha visto arriba, la distancia con Mythos 5 en explotación de vulnerabilidades sigue siendo notable.
Ninguno de estos tres puntos invalida las mejoras de rendimiento. Simplemente son la parte de la historia que no cabe en un titular de “duplica a su predecesor”.
A quién le conviene actualizar ya
| Situación | Recomendación |
|---|---|
| Ya usas Opus 4.8 en Claude Code o vía API | Actualiza sin reparo: mismo precio, mejor rendimiento declarado en código y ciencia. |
| Evaluabas Fable 5 solo por rendimiento, pero el precio te frenaba | Vuelve a probar con Opus 5 en tu propia tarea antes de comprometerte con la tarifa de Fable 5. |
| Tienes un flujo ya afinado en torno al comportamiento exacto de Opus 4.8 | Prueba en paralelo antes de sustituir: un cambio de modelo altera comportamiento aunque el precio no cambie. |
| Tu caso de uso es investigación autónoma de larga duración o ciberseguridad ofensiva | Los propios límites que reconoce Anthropic aplican aquí con más fuerza; no asumas que Opus 5 cierra esa brecha. |
Mi recomendación práctica, con la información pública disponible hoy: si ya pagas por Claude, prueba Opus 5 en tu flujo real —no en el benchmark de otro— y mide tú mismo tasa de aceptación y coste por tarea antes de decidir si además te compensa dar el salto a Fable 5. Los multiplicadores de un anuncio son una buena señal de por dónde mirar primero; no sustituyen una prueba con tus propios datos. Si usas Opus 5 como motor de un agente de código, nuestra guía sobre qué pueden hacer de verdad los agentes de código en 2026 es un buen siguiente paso para diseñar esa prueba con criterio.
Fuentes y metodología
Todas las cifras de precio, disponibilidad y benchmarks proceden del anuncio oficial de Anthropic del 24 de julio de 2026 y de la nota de lanzamiento de Fable 5 y Mythos 5 del 9 de junio de 2026, cruzadas con al menos dos medios independientes en el caso de las cifras que Anthropic no desglosa en prosa. Este artículo no reporta ninguna prueba propia de Kroniq: donde el fabricante publicó un multiplicador relativo en lugar de una puntuación absoluta, así se ha mantenido, en vez de inventar una cifra que no existe en la fuente.
Footnotes
-
Anthropic, Claude Fable 5 and Claude Mythos 5, 9 de junio de 2026. ↩ ↩2
-
Anthropic, Claude Opus 5, 24 de julio de 2026. ↩ ↩2 ↩3 ↩4
-
Finout, Claude Opus 4.8 Pricing 2026, consultado el 24 de julio de 2026. ↩ ↩2
-
OfficeChai, Anthropic Releases Claude Opus 5, Beats Fable On Many Benchmarks At Half The Price, 24 de julio de 2026. ↩ ↩2
-
MacRumors, Anthropic’s New Claude Opus 5 Nearly Matches Flagship Fable 5 at Half the Cost, 24 de julio de 2026. ↩ ↩2
-
Interesting Engineering, Anthropic debuts Claude Opus 5 with top coding benchmarks at half the per-task cost, 24 de julio de 2026. ↩ ↩2