Modelos y plataformas de IA

Anthropic lanza Claude Sonnet 5.5 con precios de Sonnet 5 sin cambios

mm
Añade Unite.AI a tus fuentes preferidas en Google

Anthropic lanzó Claude Sonnet 5.5 el 28 de septiembre de 2026, el segundo modelo de su familia Claude 5.5. El modelo mantiene los precios de Claude Sonnet 5 en $2 por millón de tokens de entrada y $10 por millón de tokens de salida, y Anthropic afirma que genera resultados más de un 30 % más rápido mientras cuesta hasta un 30 % menos por tarea en sus pruebas.

En su anuncio de lanzamiento, Anthropic describió Sonnet 5.5 como un complemento más rápido y de menor costo a Claude Opus 5.5, que la compañía afirma está diseñado para trabajos complejos que requieren un juicio cuidadoso. Sonnet 5.5 destaca en tareas cotidianas bien definidas, corrección de errores y producción de documentos, diapositivas y hojas de cálculo pulidos, dijo Anthropic, añadiendo que también tiene un gran ojo para el diseño.

Claude Sonnet 5.5 está disponible en todas las plataformas, incluyendo Amazon Web Services, Google Cloud y Microsoft Azure, bajo el ID de modelo claude-sonnet-5-5, y se ofrece con retención de datos cero, al igual que Opus 5.5 y Sonnet 5.

Resultados de benchmarks reportados

Anthropic informa que Sonnet 5.5 obtiene un 70,6 % en Terminal-Bench 4.0, una evaluación de codificación agente, frente al 10,3 % de Sonnet 5, con la puntuación listada de Opus 5.5 de 66,4 % que refleja su resultado de esfuerzo Xhigh. En el conjunto principal de FrontierCode 1.1, Sonnet 5.5 registra un 46,2 % con esfuerzo Máximo y un 52,1 % con Xhigh, en comparación con el 42,4 % de Sonnet 5, el 54,4 % de Opus 5.5 y el 49,3 % de GPT-6 Sol de OpenAI. Las puntuaciones reportadas de CursorBench 4.0 son 55,5 % para Sonnet 5.5, 34,1 % para Sonnet 5 y 57,8 % para Opus 5.5.

En evaluaciones de trabajo de conocimiento, la compañía informa una puntuación GDPval-AA v2.1 de 1844 para Sonnet 5.5, dos puntos por debajo de los 1846 de Opus 5.5 y aproximadamente 400 puntos por encima de los 1449 de Sonnet 5, y una puntuación AA-Briefcase v1.1 de 1811 frente a 1822 de Opus 5.5 y 1359 de Sonnet 5. El anuncio también indica un 64,5 % con herramientas en Humanity’s Last Exam, un 80,1 % de crédito parcial en OSWorld 2.1 y un 61,6 % sin herramientas en Chartography, una prueba de reconocimiento visual de gráficos. Anthropic afirma que Sonnet 5.5 es el primer modelo Sonnet que supera a Pokémon Red trabajando solo a partir de capturas de pantalla.

La compañía advierte que las puntuaciones de referencia capturan solo una faceta de las capacidades de un modelo, y afirma que en sus propias pruebas y en las de evaluadores externos, Opus 5.5 sigue siendo claramente más fuerte en trabajos complejos y abiertos que requieren un juicio sostenido. Una nota al pie indica que Artificial Analysis ejecutó GDPval-AA y AA-Briefcase en un despliegue pre‑lanzamiento con un error de salidas estructuradas que ya ha sido corregido y que, de hecho, subestimaría el rendimiento de Sonnet 5.5. Otra nota al pie señala que OpenAI corrigió recientemente un error de comprensión de imágenes en GPT-6 Sol que los puntajes de terceros aún pueden no reflejar.

Resultados de los primeros evaluadores

El vicepresidente de IA de CodeRabbit, David Loker, dijo que Sonnet 5.5 muestra un mejor juicio que Sonnet 5 en todos los niveles de complejidad mientras utiliza significativamente menos tokens de salida, y que CodeRabbit planea trasladar ahora las revisiones simples y moderadas al modelo, con más en las próximas semanas. El líder de ingeniería de IA de Base44, Gabriel Grinberg, informó que en 118 construcciones reales de aplicaciones, Sonnet 5.5 promedió 3,6 iteraciones por construcción frente a 7,7 de Opus 5, con la menor cantidad de llamadas a herramientas fallidas entre los modelos comparados por Base44.

El ingeniero principal de Slack, Curtis Allen, informó aproximadamente un 14 % menos de tokens de salida en evaluaciones offline de Slackbot sin cambios en el prompt. El director de IA de Zendesk, Abhinay Kathuria, dijo que los tickets se procesaron un 20 % más rápido que con los modelos Claude que Zendesk utiliza en producción. Balyasny Asset Management informó alrededor de 121 000 tokens por respuesta frente a los 497 000 de Sonnet 5 en una suite privada de 2 441 tareas financieras. Box informó resultados 2,4 veces más rápidos con un 12 % menos de tokens totales, y Atlassian dijo que los clientes pueden ejecutar Rovo Agents hasta un 30 % más rápido que con Sonnet 5.

Precios, velocidad y migración

Los precios listados de Sonnet 5.5 coinciden exactamente con los de Sonnet 5: $2 por millón de tokens de entrada, $10 por millón de tokens de salida, $0,20 por millón de tokens de lectura de caché y $2,50 por millón de tokens de escritura de caché. Opus 5.5 se lista en $4 de entrada, $20 de salida y $5 de escrituras en caché. Anthropic afirma que Sonnet 5.5 normalmente necesita muchos menos tokens para el mismo trabajo y es su modelo Sonnet más rápido hasta la fecha.

El modelo ofrece cinco niveles de esfuerzo recalibrados: bajo, medio, alto, xhigh y máximo. Los valores predeterminados son Medio en Claude Code y en las aplicaciones Claude, y Alto en la Plataforma Claude, que también es el valor predeterminado de la API.

La guía de migración de Anthropic enumera cambios críticos para desarrolladores que migran desde Sonnet 5. El pensamiento adaptativo ahora se ejecuta por defecto, la configuración de pensamiento deshabilitado devuelve un error 400, y los desarrolladores que ejecutaron Sonnet con el pensamiento desactivado deben cambiar a la nueva configuración de herramientas, la más baja disponible, antes de migrar. La elección forzada de herramienta se rechaza a favor de la elección automática de herramienta combinada con herramientas estrictas, y el prompt mínimo almacenable en caché se reduce a 512 tokens desde 1.024 en Sonnet 5. La documentación también enumera cinco categorías de motivos de rechazo, que cubren ciber, bio, frontierllm, razonamientoextracción, y generaldaños, y señala que los reintentos de reserva del lado del servidor solo vuelven a intentar los rechazos de ciber y frontier_llm en Sonnet 5.

Hallazgos de seguridad y salvaguardas

Porque las capacidades cibernéticas de Sonnet 5.5 son comparables a las de Opus 5, Anthropic dijo que es el primer modelo Sonnet que se lanza con las salvaguardas cibernéticas y los retrocesos utilizados en los modelos más capaces de la compañía. La tarjeta del sistema informa que con las salvaguardas desactivadas, Sonnet 5.5 promedió 11.53 banderas de capacidad y una tasa de captura del 80% en ExploitBench y produjo 178 explotaciones completas de ejecución arbitraria de código, frente a una de Sonnet 5. Completó el 46.1% de los desafíos de CyScenarioBench frente al 0.7% de Sonnet 5, y produjo 50 secuestros de flujo de control en el Binary Exploitation Benchmark frente a 3 de Sonnet 5.

Las salvaguardas cibernéticas se ejecutan en tres etapas: una sonda en las activaciones internas del modelo, un clasificador ligero integrado al modelo y un clasificador LLM entrenado por separado. La tarjeta informa un recall del 99.43% en el conjunto de cobertura de daños cibernéticos y una tasa de éxito de ataque del 21.0% en la evaluación de robustez de retroceso del atacante, mejorada respecto al 57.2% de Sonnet 5, mientras advierte a los usuarios que esperen un aumento de rechazos incluso en tareas de ciberseguridad benignas. Las solicitudes de mayor riesgo retroceden visiblemente a Sonnet 5, y un Programa de Verificación Cibernética ampliado ofrecerá pronto a los defensores verificados acceso por niveles a capacidades avanzadas en los modelos Sonnet 5.5, Opus 5.5 y Claude Mythos.

Las salvaguardas biológicas son los mismos clasificadores de uso indebido dañino desplegados para Opus 5, sin modelo de respaldo, y el Programa de Verificación de Ciencias de la Vida de Anthropic cubre el acceso para todo el espectro del trabajo biológico. Sonnet 5.5 también es el primer modelo Sonnet con clasificadores de seguridad que bloquean la extracción de razonamiento, y amplía el pensamiento preservado de modo que el pensamiento de un modelo no pueda desacoplarse de la cuenta que lo creó.

En la auditoría de comportamiento automatizada de Anthropic de aproximadamente 1 850 escenarios, la compañía informa que Sonnet 5.5 mejora o iguala a Sonnet 5 en la mayoría de las métricas de alineación, resistencia al uso indebido y honestidad, registra la tasa más baja de intentos de escape de sandbox entre los modelos evaluados, y muestra un pensamiento más ilegible que muchos modelos anteriores. La tarjeta del sistema indica que Sonnet 5.5 no supera nuevos umbrales de la Responsible Scaling Policy, se considera que cumple los umbrales CB-1 y Autonomy-1 de la política, y presenta un bajo riesgo evaluado de desalineación catastrófica. El límite de conocimiento fiable del modelo es junio de 2026.

Anthropic dijo que Claude Haiku 5.5, creado para aplicaciones de alto volumen y sensibles al costo, se incorporará a la familia Claude 5.5 en las próximas semanas.

Jonas Reeve es un analista generado por IA en Unite.AI, centrado en IA cognitiva, inteligencia artificial general (AGI) y los fundamentos teóricos de la inteligencia de máquinas. Su trabajo explora cómo el aprendizaje, el razonamiento, la memoria y la abstracción emergen tanto en sistemas biológicos como artificiales, estableciendo conexiones entre las arquitecturas de IA modernas y las preguntas históricas de la ciencia cognitiva y la filosofía de la mente.

Con un enfoque conceptual y reflexivo, Jonas examina marcos como modelos de razonamiento, sistemas agente, cognición emergente y teoría de alineación, con el objetivo de aclarar lo que realmente significa el progreso hacia la AGI —y lo que no significa. En lugar de perseguir cronogramas o exageraciones, él enfatiza los principios fundamentales, el rigor conceptual y los límites de los modelos actuales.

Los artículos escritos por Jonas Reeve son generados por IA y revisados por el equipo editorial de Unite.AI para garantizar precisión, claridad y una discusión responsable de conceptos avanzados de IA.