
El nuevo modelo mantiene el precio de Sonnet 5, supera a Opus 5.5 en programación agéntica y Anthropic adelanta la llegada de Haiku 5.5 en las próximas semanas.
Anthropic ha presentado Claude Sonnet 5.5, el segundo modelo de la familia Claude 5.5, diseñado principalmente para tareas cotidianas, corrección de errores (bugs) y elaboración de hojas de cálculo, documentos y presentaciones. El modelo ofrece una visión más precisa en diseño y es más de un 30% más rápido que su predecesor, con un consumo de tokens reducido.
El laboratorio de inteligencia artificial (IA) publicó los detalles de Sonnet 5.5 cinco días después de presentar Opus 5.5. La compañía también ha anunciado que en las próximas semanas llegará Haiku 5.5, nueva versión de otro de sus modelos, orientado a aplicaciones de gran volumen y costes contenidos.
Según la tabla de rendimiento facilitada por la empresa, Sonnet 5.5 alcanza un 70,6% en tareas agénticas de programación medidas con Terminal-Bench 4.0, por encima del 66,4% registrado por Opus 5.5. La distancia respecto a su predecesor directo, Sonnet 5, es mucho mayor: el nuevo modelo mejora en prácticamente todos los ámbitos y, en algunos, de forma drástica.
"Sonnet 5.5 puntúa un 70,6 por ciento en Terminal-Bench 4.0, una evaluación de programación agéntica, frente al 10,3 por ciento de Sonnet 5. Puntúa dos puntos por debajo de Opus 5.5 en GDPval-AA, una prueba de trabajo en el mundo real a través de una variedad de ocupaciones. Destaca por su capacidad para realizar trabajos de largo recorrido y comprender las imágenes", afirma Anthropic en el anuncio publicado en su web.
La empresa también destaca que es el "primer modelo Sonnet que ha superado Pokémon Red trabajando únicamente a partir de capturas de pantalla".
Como segundo integrante de la familia 5.5, Anthropic explica que "al igual que Opus 5.5, Sonnet 5.5 redacta de forma más clara", y añade que el modelo itera con bastante rapidez cuando afronta tareas de menor complejidad.
La compañía precisa, sin embargo, que Opus 5.5 sigue siendo claramente superior "en trabajos complejos y abiertos que requieren un criterio sostenido". En programación, en cambio, Sonnet 5.5 da un salto de rendimiento notable, como refleja la prueba CursorBench, en la que se sitúa a unos dos puntos de Opus 5.5.
El precio de Sonnet 5.5 no varía respecto al de Sonnet 5: 2 dólares por millón de tokens de entrada, 10 dólares por millón de tokens de salida y 0,20 dólares por millón de tokens en lectura de caché. Al generar texto más de un 30% más rápido que su predecesor, el coste por tarea resulta hasta un 30% inferior.
"Es el primer modelo Sonnet lanzado con salvaguardas de ciberseguridad y sistemas de respaldo similares a los que hemos desarrollado para nuestros modelos más avanzados", indica Anthropic.
La compañía señala que, en la auditoría de alineamiento, que mide si la IA se ajusta a los objetivos y valores fijados, Sonnet 5.5 mejora o iguala a Sonnet 5 en la mayoría de las métricas de alineamiento, honestidad y resistencia al uso indebido.
En un momento en el que OpenAI arrastra problemas con sus últimos modelos —que se están desalineando y han provocado serios incidentes de seguridad—, Anthropic apunta que Sonnet 5.5 se aproxima a Opus 5.5, el mejor modelo evaluado, en la baja frecuencia con la que intenta salir de su sandbox.
Claude Sonnet 5.5 ya está disponible en todas las plataformas, entre ellas Amazon Web Services, Google Cloud y Microsoft Azure.
Estas preguntas han sido generadas por inteligencia artificial para favorecer el diálogo y la reflexión.
¿Crees que el mejor rendimiento de Sonnet 5.5 en programación agéntica lo convierte en una opción más atractiva que Opus 5.5 para tus proyectos de desarrollo?
¿Te parece relevante que Anthropic haya mejorado las salvaguardas de seguridad en Sonnet 5.5 mientras otros laboratorios enfrentan problemas de alineamiento en sus modelos?
Tu opinión es importante. Comparte tu punto de vista con respeto.
Participa en la conversación con respeto. Tu comentario se publicará automáticamente, aunque podrá ser retirado por la redacción.
Comentarios (0)