Opus 5.5 o Sonnet 5.5
Elige según el resultado validado y el costo total.
Para elegir entre Claude Opus 5.5 y Sonnet 5.5, compara el trabajo terminado y su costo total. Sonnet es un buen punto de partida para evaluar funciones acotadas, errores reproducibles y cambios con pruebas de aceptación. Opus merece una evaluación cuando el diagnóstico es ambiguo, hay varias capas de arquitectura implicadas o corregir una solución equivocada resulta caro. Es una recomendación de trabajo, no una clasificación universal.
Sonnet cuesta la mitad por token de entrada y salida estándar, pero ambos cobran lo mismo por leer la caché. Tampoco hay un único ganador en las pruebas de programación publicadas.
Fuentes oficiales verificadas el 29 de septiembre de 2026. No realizamos una prueba independiente entre los modelos. Los resultados están atribuidos y los ejemplos de costo mantienen fija la cantidad de tokens; no son facturas medidas. OmniaKey publica esta guía y ofrece un gateway API cuyas tarifas son distintas de las de Anthropic.
Diferencias entre Opus 5.5 y Sonnet 5.5
Opus 5.5 salió el 22 de septiembre de 2026 y Sonnet 5.5, el 28. La comparación con Sonnet 5 conserva la versión anterior.
| Característica | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| ID de Claude API | claude-sonnet-5-5 | claude-opus-5-5 |
| Contexto / salida máxima estándar | 1M / 128K tokens | 1M / 128K tokens |
| Entrada → salida | Texto e imágenes → texto | Texto e imágenes → texto |
| Effort predeterminado en API | high | medium |
| Razonamiento | Adaptive; admite between_tools | Adaptive, siempre activo |
| Categoría de latencia del proveedor | Fast | Moderate |
| Entrada / salida por millón de tokens | $2 / $10 | $4 / $20 |
| Lectura de caché por millón de tokens | $0.20 | $0.20 |
Fuente: modelos oficiales. La misma capacidad no garantiza la misma precisión al recuperar información. Entrada y salida deben respetar el presupuesto de contexto. La salida de 300K es una opción beta de Batch API, no el límite de una llamada síncrona normal.
Precio API: cuándo cuesta realmente la mitad
La documentación de precios indica estas tarifas globales estándar directas en USD por millón de tokens. Herramientas, impuestos, condiciones regionales y cargos de otras plataformas se calculan aparte.
| Tipo de token | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Entrada sin caché | $2 | $4 |
| Salida facturada | $10 | $20 |
| Escritura de caché de 5 minutos | $2.50 | $5 |
| Escritura de caché de 1 hora | $4 | $8 |
| Lectura de caché | $0.20 | $0.20 |
La salida facturada incluye el razonamiento, no solo el texto visible. Ambos admiten caché desde 512 tokens, pero hay que confirmar el acierto en los campos de uso. Estos cálculos fijan la cantidad de tokens; pueden representar varios pedidos, cada uno sujeto a sus límites.
| Carga idéntica de tokens | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| 100K de entrada sin caché + 20K de salida | $0.40 | $0.80 |
| Lo anterior + 800K de escritura inicial de caché de 5 minutos | $2.40 | $4.80 |
| 100K sin caché + 800K de lectura válida + 20K de salida | $0.56 | $0.96 |
La última fila es 0.1 × 2 + 0.8 × 0.20 + 0.02 × 10 = $0.56 para Sonnet y 0.1 × 4 + 0.8 × 0.20 + 0.02 × 20 = $0.96 para Opus: unas 1,71 veces durante la lectura. La escritura anterior se paga aparte; no se deben contar sus tokens también como entrada sin caché.
En una tarea real cambian el consumo y los reintentos. Divide todo lo facturado, incluidos los fallos, entre los resultados aceptados. Registra el tiempo de corrección humana por separado antes de asignarle un valor por hora.
Programación: qué dicen los benchmarks
La tabla procede del anuncio de Sonnet 5.5, que compara ambos modelos. No hemos repetido esas pruebas.
| Evaluación | Sonnet 5.5 | Opus 5.5 |
|---|---|---|
| Terminal-Bench 4.0 | 70.6% (max) | 66.4% (xhigh) |
| FrontierCode 1.1 Main | 46.2% (max); 52.1% (xhigh) | 54.4% |
| CursorBench 4.0 | 55.5% | 57.8% |
| GDPval-AA v2.1 | 1844 | 1846 |
La ficha del sistema, §8.5, describe 66 tareas de Terminal-Bench con cinco repeticiones por modelo: 330 intentos cada uno. Suponiendo intentos independientes, el error estándar es ±2,5 puntos para Sonnet y ±2,6 para Opus. Se usó Claude Code en modo --bare, con salvaguardas y algunas respuestas de modelos de respaldo; la proporción de intentos afectados difiere. La ventaja de 4,2 puntos no prueba superioridad general ni permite afirmar significación estadística sin más datos.
En FrontierCode, max obtiene menos que xhigh en Sonnet. Según la nota del anuncio, un flujo de revisión más frecuente provocó en casos analizados un tiempo agotado o cambios fuera de alcance. Más razonamiento no garantiza un parche mejor.
GDPval expresa puntos, no porcentajes. Las mediciones de Sonnet en GDPval-AA y AA-Briefcase también tienen la salvedad de un error de salidas estructuradas en un despliegue previo al lanzamiento, ya corregido. Las reseñas de Sonnet 5.5 y Opus 5.5 amplían cada lanzamiento.
Velocidad y esfuerzo de razonamiento
El “30%+ más rápido” de Sonnet 5.5 se refiere a generar salida frente a Sonnet 5. El ahorro de hasta 30% por tarea también usa ese modelo anterior, no Opus 5.5; no es una rebaja del 30% en la tarifa API. El ahorro típico de aproximadamente 40% anunciado para Opus 5.5 se compara con Opus 5.
Sonnet usa high por defecto en API y medium en Claude Code y las apps; Opus API usa medium. Indica siempre cliente y ajuste. El mismo nombre de esfuerzo no equivale al mismo presupuesto de cómputo. Mide por separado la primera salida útil y la finalización con validación: responder pronto no compensa necesariamente varias rondas de reparación.
Cuándo merece la pena pagar más por Opus
Evalúa Sonnet con trabajo cuyo resultado sea barato de comprobar: implementación acotada, revisión concreta o extracción estructurada. Evalúa Opus con fallos difíciles de diagnosticar, migraciones delicadas e investigaciones largas. Mantén los mismos documentos y criterios, y comprueba si reduce las correcciones. El precio no garantiza precisión o seguridad.
En documentos largos, exige referencias comprobables y revisa omisiones. Para imágenes, evalúa la captura o el gráfico real; aceptar imágenes no significa generarlas. Esta estrategia prioriza controlar costos. La guía general de Anthropic recomienda comenzar con Opus 5.5 para la mayoría de cargas; también es razonable si priorizas calidad. La guía de modelos para Claude Code cubre la selección más amplia.
Qué revisar antes de cambiar de modelo
Lee las guías de migración de Sonnet y Opus. Sonnet permite between_tools a high o menos para desactivar el razonamiento inicial, no todo razonamiento. Opus mantiene adaptive thinking activo.
Ambos rechazan tool_choice forzado de tipo any o tool. Validar estrictamente los argumentos no obliga a llamar una herramienta, y el soporte varía por plataforma. Respeta las reglas de conservación de thinking blocks, modelo, cuenta y conversación; inicia conversaciones nuevas para comparar. El progreso entre herramientas puede llegar como thinking blocks omitidos por defecto: analiza el tipo de bloque y comprueba el streaming antes de interpretar el silencio como bloqueo.
Cómo evaluar tus tareas
Una propuesta reproducible reúne seis tareas de cada grupo: programación acotada, depuración/refactorización compleja, herramientas y documentos/visión. Son 24 tareas × 2 modelos × 3 repeticiones = 144 ejecuciones de tareas, posiblemente muchas más llamadas API. No es un experimento realizado por nosotros.
Fija commit, instrucciones, herramientas, región, permisos, límites de pasos/tiempo y pruebas. Restablece el entorno y la conversación, alterna el orden y separa el ensayo explícito a medium de los ajustes predeterminados o superiores. Registra fallos, rechazos, reintentos, respaldos observables, tokens, costo, tiempo y corrección real. Comprueba el código con pruebas ocultas y los documentos con sus fuentes. Tres repeticiones no permiten estimar con precisión el P95 por tarea; si ninguna pasa, no publiques un costo por éxito de cero.
Preguntas frecuentes
¿Sonnet 5.5 es mejor para programar?
Gana en el Terminal-Bench publicado, pero Opus queda por delante en los otros benchmarks de programación citados. Los ajustes y la incertidumbre impiden convertirlo en una regla general.
¿Siempre cuesta la mitad?
Solo las tarifas estándar de entrada sin caché y salida son la mitad. La lectura de caché vale lo mismo y el uso real cambia la factura.
¿Cuál conviene en Claude Code?
Sonnet para evaluar trabajo acotado, Opus para investigación difícil o como punto inicial si prima la calidad. Suscripción y API se pagan por separado; consulta la guía de precios de Claude Code.
¿Opus tiene más contexto?
No en esta pareja: ambos anuncian 1M de contexto y 128K de salida máxima estándar. Hay que comprobar cómo usan esa capacidad.
Rutas actuales y fuentes
Consulta Sonnet 5.5, Opus 5.5 o el catálogo para ver las rutas y precios mostrados por OmniaKey. Los cálculos directos no son una cotización del gateway ni una prueba de llamada real. Los documentos oficiales de Anthropic enlazados están en inglés.