Tiempo limitado · los mismos modelos — GPT 93% off, Claude 80% off
Blog
Comparación

Review de Claude Opus 5

Opus 5 compensa en agentes difíciles y de larga duración; Sonnet 5 sigue siendo más rentable para el trabajo rutinario.

10 min de lecturaOmniaKey
Claude Opus 5Claude CodeAI codingmodel review

Anthropic lanzó Claude Opus 5 el 24 de julio de 2026 con una promesa clara: acercarse a la inteligencia de Claude Fable 5 por la mitad del precio de API. Para un usuario real, la pregunta importante no es si ganó un gráfico de lanzamiento, sino si termina más trabajo útil por dólar que Opus 4.8 o Sonnet 5.

Nuestro veredicto es sí para tareas difíciles y de larga duración. Opus 5 es una actualización lógica desde Opus 4.8 porque mantiene el mismo precio estándar por token y muestra una mejora grande en evaluaciones públicas de programación y trabajo profesional. Para ediciones cortas, extracción, clasificación o chat de gran volumen, Sonnet 5 sigue siendo más barato y normalmente suficiente.

Nota sobre la evidencia, comprobada el 26 de julio de 2026. Esta es una review basada en evidencia pública; OmniaKey no afirma haber repetido todos los benchmarks. Contrastamos el anuncio y la documentación técnica de Anthropic con el leaderboard público de Frontier-Bench y los resultados independientes de GDPval-AA v2 de Artificial Analysis. Identificamos por separado los resultados ejecutados por el proveedor.

Review de Claude Opus 5: respuesta rápida

Tu carga de trabajoPunto de partidaMotivo
Funciones en varios archivos, debugging difícil o agentes largosOpus 5 con effort highMejor equilibrio entre capacidad y gasto; sube a xhigh solo si tus evaluaciones lo justifican
Programación rutinaria, soporte, extracción o alto volumenSonnet 5Menor precio por token y latencia comparativa más rápida
Una integración actual con Opus 4.8Probar y migrar a Opus 5Mismo precio estándar y mejores resultados públicos; los cambios de comportamiento requieren regresión
Capacidad máxima con el coste en segundo planoComparar Opus 5 y Fable 5Fable anuncia un techo mayor, pero Opus cuesta la mitad y se acerca o supera a Fable en varias tareas públicas

La mejora más valiosa no es generar código de una sola vez. Es mantener el rumbo durante una tarea larga: encontrar la causa raíz en vez de tapar el síntoma, usar herramientas hasta verificar el resultado y entregar algo completo sin dejar marcadores de posición.

Qué cambia frente a Opus 4.8

EspecificaciónClaude Opus 5
ID del modelo APIclaude-opus-5
Ventana de contexto1 millón de tokens, valor predeterminado y máximo
Salida síncrona máxima128.000 tokens
Corte de conocimiento fiableMayo de 2026
Precio API estándar$5 / millón de tokens de entrada; $25 / millón de salida
Prompt cache$6,25 / millón por escritura de 5 min; $10 por 1 h; $0,50 por hit
ThinkingAdaptive thinking activado por defecto
Niveles de effortlow, medium, high, xhigh y max; predeterminado high

Los límites principales coinciden con Opus 4.8, pero el comportamiento operativo no. Opus 5 activa thinking por defecto, aprovecha mejor el aumento de effort y reduce el mínimo cacheable de 1.024 a 512 tokens. También ofrece en beta cambios de herramientas a mitad de conversación, de modo que un agente puede añadir o quitar herramientas sin invalidar el prompt cache existente.

Fast mode está disponible como research preview solo en Claude API. Anthropic afirma que funciona unas 2,5 veces más rápido, pero duplica el precio base a $10 de entrada y $50 de salida por millón. Se paga por latencia, no por ahorro.

Benchmarks: resultados fuertes con notas importantes

Frontier-Bench favorece ampliamente a Opus 5

El leaderboard público de Frontier-Bench v0.1 sitúa Opus 5 con mini-SWE-agent en 43,53% +/- 1,65% de resolución. La misma tabla muestra Fable 5 con 33,78% y Opus 4.8 con 21,08%. El resultado publicado de Opus 5 es aproximadamente el doble que el de Opus 4.8 y está unos diez puntos por encima de Fable 5.

Es una señal importante, pero no un laboratorio neutral. La nota de Anthropic indica que fue una ejecución interna sobre GKE, con una media de cinco intentos por tarea. Opus 4.8 actuó además como fallback cuando los clasificadores de seguridad rechazaron una petición a Opus 5 o Fable 5. El dato respalda que Opus 5 es mucho mejor en trabajo agéntico difícil; no demuestra que cada repositorio vaya a mejorar en la misma proporción.

GDPval-AA aporta la señal independiente más sólida

GDPval-AA v2 de Artificial Analysis usa 220 tareas profesionales de 44 ocupaciones. Los modelos trabajan en un bucle de agente con shell y navegador, producen documentos, hojas de cálculo, presentaciones y diagramas, y reciben un Elo mediante comparaciones ciegas por pares.

Modelo y effortElo de GDPval-AA v2Intervalo del leaderboard
Opus 5, max1861-25 / +25
Opus 5, xhigh1827-24 / +24
Fable 5, max1747-17 / +17
Opus 5, high1741-23 / +23
GPT-5.6 Sol, max1735-17 / +17
Opus 5, medium1632-22 / +22
Sonnet 5, max1603-17 / +17
Opus 4.8, max1593-16 / +16
Opus 5, low1454-20 / +20

Hay dos conclusiones útiles. Primero, Opus 5 con max y xhigh lidera esta evaluación independiente por un margen claro. Segundo, effort no es decorativo: hay 407 puntos Elo entre low y max. Con el valor predeterminado high, los intervalos de Opus 5, Fable 5 y GPT-5.6 Sol se solapan; una diferencia de seis puntos no debe venderse como victoria decisiva.

Anthropic también informa de que Opus 5 con max queda a menos de 0,5% del pico de Fable 5 en CursorBench por la mitad del coste por tarea, triplica al siguiente modelo en ARC-AGI 3 y supera el mejor resultado de Fable 5 en OSWorld 2.0 por poco más de un tercio del coste. Son señales útiles, pero proceden del material de lanzamiento y pesan menos en nuestro veredicto que GDPval-AA.

Dónde parece una mejora real

Programación de largo horizonte. La guía de prompting de Anthropic destaca funciones en varios archivos, refactors grandes y entregas de principio a fin. Frontier-Bench encaja con ese posicionamiento. El beneficio práctico es dejar menos stubs y necesitar menos intervención humana a mitad del trabajo.

Debugging y code review. Los primeros usuarios describen mejor análisis de causa raíz y menos arreglos superficiales. Anthropic afirma además que la revisión conserva precisión con effort más bajo. Cada equipo debe medir falsos positivos y omisiones en sus propios pull requests: los testimonios de lanzamiento no sustituyen una evaluación local.

Trabajo visual y documental. Opus 5 mejora en gráficos, diagramas, reproducción de interfaces, hojas de cálculo complejas y presentaciones. La ventaja será mayor cuando el agente pueda abrir el resultado renderizado y corregirlo, no cuando solo genere código una vez.

Autoverificación. El modelo comprueba su trabajo sin que se lo pidan con más frecuencia. Ayuda en tareas abiertas, pero instrucciones heredadas como "verifica todo otra vez" pueden provocar comprobaciones duplicadas, más tokens y demasiada delegación.

En una edición precisa de un solo archivo, con criterios de aceptación claros, la diferencia será menor. Un modelo barato puede terminar antes de que el razonamiento profundo de Opus 5 tenga ocasión de aportar valor.

Cuánto cuesta una tarea real

Para una tarea con 100.000 tokens de entrada sin caché y 10.000 de salida, el cálculo a precio estándar es:

ModeloPrecio estándar entrada / salidaCoste de ejemplo
Claude Fable 5$10 / $50 por millón$1,50
Claude Opus 5$5 / $25 por millón$0,75
Claude Opus 4.8$5 / $25 por millón$0,75
Claude Sonnet 5$3 / $15 por millón$0,45 de tarifa estándar

Sonnet 5 tiene una tarifa introductoria de $2 / $10 hasta el 31 de agosto de 2026, por lo que esa tarea cuesta $0,30 durante la promoción. La tabla no incluye herramientas ni precios de una pasarela.

La ventana de un millón no es capacidad gratuita. Llenarla una vez cuesta $5 solo en entrada; leer ese mismo millón desde caché cuesta $0,50. El prompt cache cambia por completo la economía de consultar repetidamente un repositorio o una base de conocimiento. Una escritura de 5 minutos cuesta $6,25 por millón y una de 1 hora, $10.

El precio por token tampoco es el precio por tarea. Un effort mayor puede añadir pensamiento y llamadas a herramientas, mientras que un modelo mejor puede acabar en menos turnos. Mide el coste por tarea completada. La página de Claude Opus 5 muestra por separado la tarifa actual de OmniaKey y el precio estándar de Anthropic.

Quién debería cambiar

Usuarios de Opus 4.8: migrad después de una regresión enfocada. Precio y contexto no cambian, así que hay poco motivo económico para quedarse si Opus 5 mejora vuestra tasa de finalización. Probad longitud, thinking, llamadas a herramientas y latencia.

Usuarios de Sonnet 5: no migréis todas las peticiones. Conservad Sonnet para turnos rutinarios y elevad bugs ambiguos, arquitectura, refactors grandes o fallos costosos a Opus 5. Enrutar por tarea suele aportar más valor que fijar un solo modelo.

Usuarios de Fable 5: probad primero Opus 5 en producción sensible al coste. Fable conserva el mayor techo anunciado por Anthropic, pero la evidencia pública muestra trabajos donde Opus se acerca, iguala o supera por la mitad del precio. Pagad la prima solo si vuestra evaluación demuestra que importa.

Equipos de seguridad: no extrapoléis los rankings generales. Anthropic no entrenó Opus 5 como su modelo de ciberseguridad ofensiva y sigue por detrás de Mythos 5 al desarrollar exploits. Encontrar una vulnerabilidad y explotarla son tareas distintas.

Riesgos de migración que conviene probar

  1. Cambia el ID exacto de claude-opus-4-8 a claude-opus-5. Los ID sin fecha de Claude 5 son snapshots fijados, no alias móviles.
  2. Revisa max_tokens: thinking está activo por defecto y el límite cubre pensamiento más salida visible.
  3. No combines thinking: {"type": "disabled"} con xhigh o max; la API devuelve HTTP 400. Para ahorrar, conserva thinking y baja effort.
  4. Reducir effort no acorta de forma fiable la respuesta visible. Pide concisión por separado.
  5. Elimina instrucciones heredadas que obligan a verificar o crear subagentes. Opus 5 ya tiende a hacer ambas cosas.
  6. Repite un barrido de effort con tus tareas. Anthropic recomienda empezar en high, subir a xhigh para agentes exigentes y usar low o medium donde la calidad se mantenga.

Un despliegue sensato compara el mismo conjunto fijo en medium, high y xhigh; registra éxito, corrección humana, latencia, entrada, caché, salida y coste de herramientas; y después enruta por clase de tarea. Una conversación espectacular no es una evaluación.

Veredicto final

Claude Opus 5 es la mejor opción predeterminada de Anthropic para desarrolladores cuyos problemas caros son largos, ambiguos y cargados de herramientas. Ofrece a Opus 4.8 una mejora de calidad publicada al mismo precio estándar y acerca resultados de nivel Fable a más cargas de trabajo.

No debe ser el modelo universal. Sonnet 5 sigue siendo más económico para lo rutinario, max puede consumir el ahorro en tokens y buena parte de la evidencia inicial viene de Anthropic. Empieza con high, mide coste por tarea terminada y escala de forma selectiva.

Preguntas frecuentes

¿Claude Opus 5 es mejor que Opus 4.8?

Sí según la evidencia pública disponible. Frontier-Bench muestra 43,53% para Opus 5 frente a 21,08% para Opus 4.8, y GDPval-AA muestra 1861 frente a 1593 Elo con max. El precio estándar es igual, pero tu harness necesita regresión.

¿Claude Opus 5 o Sonnet 5?

Opus 5 para razonamiento difícil y agentes largos; Sonnet 5 para trabajo rutinario más barato y rápido. Enruta por tarea en vez de pagar Opus en cada petición.

¿Cuánto cuesta Claude Opus 5?

La API estándar de Anthropic cuesta $5 por millón de tokens de entrada y $25 por millón de salida. Un cache hit cuesta $0,50. Fast mode cuesta $10 y $50.

¿Claude Opus 5 tiene contexto de 1M?

Sí. Un millón de tokens es el valor predeterminado y máximo, con hasta 128.000 tokens de salida síncrona. Un cliente o gateway puede imponer límites menores.

¿Qué effort debo usar?

Empieza con high. Usa medium cuando tus evaluaciones mantengan calidad, xhigh para programación y agentes exigentes, y max solo cuando gastar sin límite produzca valor medible.

Fuentes consultadas