⏱️ Lectura: 14 min
Anthropic subió el techo de precio y rendimiento de sus modelos: Claude Opus 5 ya está disponible y, según la propia empresa, se acerca a la inteligencia de frontera de Claude Fable 5 pagando la mitad por tarea. El anuncio llegó el 24 de julio de 2026 y convierte a Opus 5 en el modelo por defecto de Claude Max y en el más potente disponible en Claude Pro.
📑 En este artículo
El salto no es solo de precio. En Frontier-Bench v0.1, la evaluación de ingeniería de software que usa Anthropic internamente, Opus 5 más que duplica el puntaje de su predecesor Opus 4.8 y supera a todos los modelos evaluados en esa prueba, con un costo por tarea menor.
TL;DR
- Anthropic lanzó Claude Opus 5 el 24 de julio de 2026, disponible de inmediato en todos los planes.
- Se acerca al desempeño de Claude Fable 5 en benchmarks clave, pero cuesta la mitad por tarea.
- Es ahora el modelo por defecto en Claude Max y el más fuerte disponible en Claude Pro.
- En Frontier-Bench v0.1 más que duplica el puntaje de Opus 4.8, su predecesor, a menor costo.
- En ARC-AGI 3 obtiene un puntaje tres veces mayor que el segundo mejor modelo evaluado.
- En OSWorld 2.0 supera el mejor resultado de Fable 5 usando poco más de un tercio de su costo.
- Mejora hasta 10.2 puntos porcentuales sobre Opus 4.8 en tareas de química orgánica.
- Sigue detrás de Claude Mythos 5 en evaluaciones de ciberseguridad, según reconoce Anthropic.
Introducción
Cada modelo nuevo de Anthropic responde a una pregunta distinta. Fable 5 apuntó a la inteligencia pura, sin mirar tanto el costo. Mythos 5 se afinó para ciberseguridad. Claude Opus 5 responde a una pregunta más práctica: cuánta inteligencia de frontera se puede empaquetar en un modelo que alguien use todos los días, para trabajo real, sin que la factura se dispare.
La respuesta de Anthropic es que Opus 5 mantiene el mismo costo que Opus 4.8, su predecesor directo, mientras mejora sustancialmente en las evaluaciones de código, trabajo de conocimiento y uso de computadora. Es, en palabras de la empresa, un modelo pensado y proactivo, diseñado para uso diario.
Qué pasó
El 24 de julio de 2026 Anthropic publicó el anuncio oficial de Claude Opus 5 y lo puso a disposición de inmediato en sus planes de suscripción y en la API. Dos cambios de producto acompañan el lanzamiento: Opus 5 pasa a ser el modelo por defecto en Claude Max, la suscripción de mayor volumen de uso, y es el modelo más fuerte disponible dentro de Claude Pro.
Anthropic ubica a Opus 5 como nuevo estado del arte en evaluaciones de código y trabajo de conocimiento como Frontier-Bench y GDPval-AA. La única salvedad que la propia empresa reconoce: en tareas de ciberseguridad, Opus 5 queda detrás de Claude Mythos 5, el modelo de la familia afinado específicamente para ese dominio.
Contexto e historia
Opus 5 llega como sucesor directo de Opus 4.8 y se suma a una familia que ya incluye a Fable 5, el modelo de mayor inteligencia bruta, y Mythos 5, el especializado en ciberseguridad. La estrategia de Anthropic con la línea Opus siempre fue distinta a la de Fable: en lugar de perseguir el máximo puntaje posible sin importar el costo, Opus busca el mejor punto en la curva de costo-rendimiento para uso constante en producción.
Esa lógica se nota en cómo Anthropic mide a Opus 5: no solo por su puntaje máximo, sino por su puntaje en cada nivel de esfuerzo (effort). Los modelos de Claude permiten ajustar ese esfuerzo entre low, high, xhigh y max, para que quien lo use decida si prioriza inteligencia o ahorra tokens y tiempo de respuesta. Opus 5 mejora en toda esa curva, no solo en el extremo más caro.
Detalles técnicos y rendimiento de Claude Opus 5
Código y agentes
En Frontier-Bench v0.1 Opus 5 supera a todos los demás modelos evaluados y más que duplica el desempeño de Opus 4.8 con un costo por tarea más bajo. En CursorBench 3.2, con el esfuerzo al máximo, Opus 5 queda a 0.5 puntos porcentuales del máximo puntaje de Fable 5, pero a la mitad del costo por tarea; en los niveles high, xhigh y max de esfuerzo logra mejor rendimiento por costo que cualquier otro modelo evaluado.
Devin reporta que en FrontierCode 1.1 Claude Opus 5 se acerca al nivel de Fable 5 a la mitad del costo, con una fortaleza particular en depuración difícil y análisis de causa raíz. Cursor coincide: en CursorBench queda apenas debajo de Fable 5 y reproduce buena parte de su comportamiento, a la velocidad y el costo de un Opus.
Un ejemplo que destaca Anthropic: a Opus 5 le dieron el dibujo de una pieza mecánica y le pidieron reconstruirla como modelo 3D en FreeCAD mediante código, sin darle forma directa de ver el dibujo. El modelo escribió su propio pipeline de visión por computadora para extraer la geometría de los píxeles crudos y reconstruyó la pieza completa, de forma repetible. Ningún modelo competidor, con la misma configuración, resolvió la tarea en cinco intentos.
Ciencia y razonamiento
En ARC-AGI 3, la evaluación diseñada para medir la resolución de problemas nuevos, el puntaje de Opus 5 triplica al del siguiente mejor modelo. En Zapier AutomationBench, que mide si un modelo completa tareas de negocio de principio a fin, Opus 5 aprueba alrededor de 1.5 veces más tareas que el segundo mejor modelo al mismo costo por tarea; incluso en su nivel de esfuerzo más bajo, aprueba más tareas que cualquier otro modelo evaluado.
En OSWorld 2.0, el benchmark de uso de computadora, Opus 5 supera a cualquier otro modelo en cualquier nivel de costo y llega a superar el mejor resultado de Fable 5 usando poco más de un tercio de su costo. Anthropic también lo señala como el modelo más fuerte y más eficiente en costo en GDPval-AA v2, HLE, AutomationBench y DeepSearchQA.
Para investigación científica, Opus 5 mejora sobre Opus 4.8 en todas las evaluaciones de ciencias de la vida de Anthropic, que cubren biología estructural, química orgánica y bioinformática. La mejora más notable aparece en química orgánica: 10.2 puntos porcentuales más que Opus 4.8 al inferir estructuras moleculares a partir de datos de espectroscopía. En tareas de proteínas, como predecir cómo una variación en la secuencia afecta su función, la mejora es de 7.7 puntos porcentuales.
Verificación y trabajo agéntico
Anthropic insiste en que la mejora central de Opus 5 no es solo el puntaje: es la capacidad de verificar su propio trabajo e iterar con cuidado hasta lograr el resultado correcto. Un ingeniero de una firma de trading usó Opus 5 para construir, en una sola sesión, un feed de datos de mercado para un exchange nuevo; modelos anteriores no lograban completar la tarea ni con planes extensos preparados de antemano. Al no tener un feed en vivo contra el cual validar, Opus 5 construyó su propio arnés de pruebas para confirmar que su código interpretaba correctamente los datos del exchange.
En un caso con un bug real de un gestor de paquetes open source popular, Opus 5 encontró la causa raíz y corrigió un caso límite que el parche de la comunidad había pasado por alto. Un modelo competidor, frente al mismo bug, corrigió solo el síntoma superficial y reportó el problema como resuelto.
💡 Tip: el nivel de esfuerzo (effort) es el dial más importante para controlar el costo en Opus 5: en low ya supera a otros modelos en AutomationBench, así que conviene probar ahí antes de subir a high o max.
Cómo probarlo
Claude Opus 5 ya está activo en Claude Max y Claude Pro sin ningún paso adicional: si tenés una de esas suscripciones, el selector de modelo en la app o la web ya debería mostrarlo como opción por defecto o disponible. Para integrarlo por API, el flujo es el mismo que con cualquier modelo Claude reciente, cambiando el identificador de modelo.
Un llamado mínimo por API, usando curl (funciona igual en Windows con PowerShell, macOS y Linux):
curl https://api.anthropic.com/v1/messages \
-H "content-type: application/json" \
-H "x-api-key: $ANTHROPIC_API_KEY" \
-H "anthropic-version: 2026-07-24" \
-d '{
"model": "claude-opus-5",
"max_tokens": 1024,
"messages": [
{"role": "user", "content": "Resumime en tres puntos que es Frontier-Bench v0.1."}
]
}'
Ese llamado devuelve un JSON con el campo model: confirmá ahí que dice claude-opus-5 y no el identificador de Opus 4.8, sobre todo si tu código todavía apunta al modelo anterior por defecto.
Para trabajo agéntico real, como revisar un pull request o depurar código de producción, conviene usar el SDK y ajustar el nivel de esfuerzo según el caso:
import anthropic
client = anthropic.Anthropic()
response = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
effort="high",
messages=[
{
"role": "user",
"content": "Revisa este pull request y explica la causa raiz del bug en el parser de CSV, no solo el sintoma."
}
],
)
print(response.content[0].text)
Con effort en low o medium el costo baja, pero en tareas de depuración profunda, que es donde Devin reporta la mayor fortaleza de Opus 5, conviene empezar en high y subir a xhigh o max solo si el resultado no alcanza:
flowchart TD
A["Tarea a resolver con Opus 5"] --> B["Effort: low"]
B --> C{"Resultado suficiente?"}
C -->|"Si"| D["Usar respuesta"]
C -->|"No"| E["Effort: high"]
E --> F{"Resultado suficiente?"}
F -->|"Si"| D
F -->|"No"| G["Effort: xhigh o max"]
G --> D
Impacto y análisis
El mensaje de Anthropic con Opus 5 es que la inteligencia de frontera ya no exige el precio de frontera. La siguiente tabla resume dónde se ubica cada modelo de la familia según lo que la propia Anthropic reporta:
| Modelo | Punto fuerte | Costo relativo | Limitación |
|---|---|---|---|
| Claude Opus 5 | Nuevo estado del arte en Frontier-Bench y GDPval-AA | Igual a Opus 4.8 | Detrás de Mythos 5 en ciberseguridad |
| Claude Opus 4.8 | Predecesor directo, base de comparación | Referencia (1x) | Frontier-Bench duplicado por Opus 5 |
| Claude Fable 5 | Inteligencia de frontera, el techo de la familia | Más alto por tarea (hasta ~3x en OSWorld 2.0) | Costo por tarea mucho mayor |
| Claude Mythos 5 | Especializado en tareas de ciberseguridad | No especificado por Anthropic | No pensado para uso diario general |
Para las empresas que ya integran Claude en flujos de negocio, el caso de Zapier es el más concreto: Opus 5 lideró el leaderboard de AutomationBench sin gastar más tokens que modelos Claude anteriores. Tomó una hoja de cálculo cruda de salud de cuentas y corrió una secuencia completa de prevención de abandono: marcó cuentas en riesgo, alertó al dueño correcto de cada cuenta y resumió todo para el equipo de retención. Modelos anteriores no aprobaban esa tarea; Opus 5 llegó al 100%.
Lovable, que construye producto sobre modelos Claude, reporta que Opus 5 quedó adelante de todos los modelos previos de su familia en las evaluaciones internas de Lovable, con una mejora del 22% sobre Opus 4.7 en las tareas de código agéntico más difíciles y, algo que destacan especialmente, menos varianza entre una corrida y otra.
📌 Nota: Anthropic es explícita en que Opus 5 no es el modelo más fuerte para todo: en ciberseguridad, Mythos 5 sigue por delante. Elegir modelo según el dominio, no solo por nombre o fecha de lanzamiento, sigue siendo la decisión correcta.
Anthropic también mostró dos ejemplos de salida visual generados por Opus 5: una simulación interactiva de un túnel de viento que visualiza el flujo de aire sobre objetos aerodinámicos y no aerodinámicos, y una ilustración interactiva simplificada de una célula. Son ejemplos de producto, no un benchmark cuantificado, pero muestran que la mejora no se limita a código y texto.
Qué sigue
Anthropic no dio fecha para el próximo modelo de la línea Opus, pero el patrón de lanzamientos de la empresa (Opus 4.8, ahora Opus 5, junto a Fable 5 y Mythos 5 como modelos hermanos especializados) sugiere que la estrategia de tres familias con roles distintos (inteligencia máxima, ciberseguridad y uso diario costo-eficiente) se mantiene. Lo más probable en el corto plazo es que más plataformas que ya integran Claude, como Devin, Cursor y Lovable, muevan su modelo por defecto a Opus 5 y publiquen sus propios números, algo que ya empezó a pasar el mismo día del anuncio.
📖 Resumen en Telegram: Ver resumen
Probalo vos: si ya tenés una API key de Anthropic, cambiá el model de tu último llamado a claude-opus-5 y compará el campo model de la respuesta contra tu versión anterior.
Preguntas frecuentes
¿Qué es Claude Opus 5?
Es el modelo más reciente de la línea Opus de Anthropic, lanzado el 24 de julio de 2026. Según Anthropic, se acerca al desempeño de Claude Fable 5 en varias evaluaciones clave pagando la mitad por tarea, y es ahora el modelo por defecto de Claude Max y el más fuerte disponible en Claude Pro.
¿Cuánto cuesta usar Claude Opus 5?
Anthropic no publicó una tabla de precios nueva en el anuncio: indicó que Opus 5 mantiene el mismo costo que su predecesor, Opus 4.8, mientras mejora el rendimiento en la mayoría de las evaluaciones reportadas.
¿En qué se diferencia Opus 5 de Claude Fable 5?
Fable 5 es el modelo de mayor inteligencia bruta de la familia; Opus 5 busca acercarse a ese nivel a un costo mucho menor. En CursorBench 3.2, por ejemplo, Opus 5 queda a 0.5 puntos porcentuales del máximo puntaje de Fable 5, pero a la mitad del costo por tarea.
¿Opus 5 es mejor que Mythos 5?
No en todos los dominios. Mythos 5 sigue por delante de Opus 5 específicamente en tareas de ciberseguridad, según reconoce la propia Anthropic en el anuncio.
¿Ya está disponible en Cursor, Devin y Lovable?
Sí. Las tres plataformas publicaron comentarios sobre Opus 5 el mismo día del lanzamiento, con resultados propios de sus benchmarks internos, como FrontierCode 1.1 en el caso de Devin y CursorBench en el de Cursor.
¿Cómo confirmo que estoy usando Opus 5 y no un modelo anterior?
Revisá el campo model en la respuesta JSON de la API: debe devolver el identificador de Opus 5 y no el de Opus 4.8. En la interfaz de Claude Max o Claude Pro, el selector de modelo en la parte superior del chat muestra el modelo activo.
Referencias
- Anuncio oficial de Anthropic: detalle completo de benchmarks, casos de early access y disponibilidad de Claude Opus 5.
- Anthropic: sitio oficial de la empresa que desarrolla la familia de modelos Claude.
- Documentación de la API de Anthropic: referencia técnica para integrar modelos Claude, incluidos los parámetros de esfuerzo (effort).
📱 ¿Te gusta este contenido? Únete a nuestro canal de Telegram @programacion donde publicamos a diario lo más relevante de tecnología, IA y desarrollo. Resúmenes rápidos, contenido fresco todos los días.
Imagen destacada: Foto de Andres Siimon en Unsplash
0 Comentarios