Las capacidades de los agentes se convierten en la base de referencia
Antrópico ha presentado oficialmente a Claude Sonnet 5, una nueva versión de su modelo de tamaño medio que hace accesibles los flujos de trabajo a una amplia gama de usuarios. Según la empresa, el modelo puede hacer planes independientemente, utilizar un navegador y una terminal, y completar tareas sin supervisión constante, un nivel de autonomía que hasta hace poco requería soluciones insignias y costosas. Con la liberación de Sonnet 5, está claro que las características de agente ya no son la prerrogativa de los modelos de alto nivel y se están convirtiendo en el estándar para cada segmento de precio. La competencia ahora está cambiando hacia el precio y la confiabilidad, en lugar de simplemente la presencia de capacidades "agenéticas".

Ejecución y fijación de precios
Los desarrolladores prometen que Claude Sonnet 5 ofrece resultados cercanos al Opus 4.8, pero a un costo mucho menor. A partir del 30 de junio, el modelo se convierte en el modelo predeterminado en planes gratuitos y Pro, y también está disponible en todas las suscripciones. En el lanzamiento, un precio especial está en vigor: $2 por millón de fichas de entrada y $10 por millón de fichas de salida hasta el 31 de agosto, después de lo cual el precio aumentará a $3 y $15, respectivamente.
Según Anthropic, el nuevo modelo supera significativamente a su predecesor — Sonnet 4.6, publicado en febrero— en el razonamiento, uso de herramientas, escritura de código y trabajo de conocimiento. En el punto de referencia de codificación, Sonnet 5 puntua 63,2%, mientras que Opus 4.8 puntua 69,2% y Sonnet 4.6 puntua 58,1%. Al mismo tiempo, en pruebas de conocimiento, Sonnet 5 incluso supera ligeramente el Opus 4.8. Antrópico enfatiza que el Opus 4.8 sigue siendo la opción para la máxima precisión, pero Sonnet 5 ofrece a los desarrolladores opciones mucho mejor bajo costo. Los usuarios pueden ajustar el nivel de esfuerzo entre los dos modelos, eligiendo el equilibrio adecuado de rendimiento y presupuesto.
En términos de precio, Sonnet 5 es más barato que GPT-5.5 de OpenAI y Gemini 3.1 Pro de Google, pero más caro que Gemini 3.5 Flash.

impresiones de seguridad y desarrollo
Testers cuya retroalimentación Antrópico cita notar que Claude Sonnet 5 es mejor llevar a cabo tareas complejas hasta completarse, mientras que las versiones anteriores a menudo se detuvieron a mitad de camino. El modelo también verifica sus propios resultados, incluso cuando no se le pide. Por ejemplo, Daniel Shepard, ingeniero senior de Zapier, dijo que Sonnet 5 completó una tarea de dos partes de principio a fin: actualizó cuentas en Salesforce y envió un anuncio a contactos empresariales. Anteriormente, según él, escenarios similares "se pegarían".
En cuanto a la seguridad, el nuevo modelo muestra comportamiento indeseable menos a menudo: es mejor rechazar solicitudes maliciosas, es más resistente a inyecciones rápidas, alucinaciones menos frecuentemente, y es menos propenso a la sicofancia en comparación con Sonnet 4.6. Al mismo tiempo, sigue el Opus 4.8 y Claude Mythos Preview en su capacidad de resistir el comportamiento mal alineado. Antrópico también señala que Sonnet 5 tiene una capacidad significativamente menor para realizar tareas peligrosas de ciberseguridad que los actuales modelos Opus. Fabian Hedin, cofundador de Lovable, confirmó que Claude Sonnet 5 "sólo y consistentemente rechaza solicitudes inseguras".



