Агентные возможности становятся базовым уровнем
Anthropic официально представила Claude Sonnet 5 — новую версию модели среднего размера, которая делает агентный сценарий работы доступным для более широкого круга пользователей. По словам компании, модель способна самостоятельно составлять планы, пользоваться браузером и терминалом, а также выполнять задачи без постоянного контроля — уровень автономности, который еще недавно требовал флагманских и дорогих решений. С выходом Sonnet 5 видно, как агентные функции перестают быть прерогативой топовых моделей и превращаются в стандарт для каждого ценового сегмента. Теперь конкуренция смещается в сторону цены и надежности, а не просто наличия «агентности».

Производительность и цена
Разработчики обещают, что Claude Sonnet 5 показывает результат, близкий к Opus 4.8, но с гораздо меньшими затратами. С 30 июня модель становится моделью по умолчанию в бесплатных и Pro-планах, а также доступна во всех подписках. На старте действует специальная цена: $2 за миллион входных токенов и $10 за миллион выходных до 31 августа, после чего стоимость поднимется до $3 и $15 соответственно.
По заявлению Anthropic, новинка заметно превосходит предшественника — Sonnet 4.6, выпущенного в феврале, — в рассуждениях, использовании инструментов, написании кода и работе со знаниями. На бенчмарке агентного программирования Sonnet 5 набирает 63,2%, тогда как Opus 4.8 — 69,2%, а Sonnet 4.6 — 58,1%. При этом в тестах на знания Sonnet 5 даже немного опережает Opus 4.8. В Anthropic подчеркивают, что Opus 4.8 остается выбором для максимальной точности, но Sonnet 5 дает разработчикам гораздо более качественные недорогие варианты. Пользователи могут регулировать уровень усилий между двумя моделями, подбирая баланс производительности и бюджета.
По цене Sonnet 5 оказывается дешевле, чем GPT-5.5 от OpenAI и Gemini 3.1 Pro от Google, но дороже Gemini 3.5 Flash.

Безопасность и впечатления разработчиков
Тестировщики, чьи отзывы приводит Anthropic, замечают, что Claude Sonnet 5 лучше доводит сложные задачи до конца, тогда как предыдущие версии часто останавливались на полпути. Модель также самостоятельно проверяет собственные результаты, даже когда ее об этом не просят. Например, старший инженер Zapier Дэниел Шепард рассказал, что Sonnet 5 от начала до конца выполнила двухчастную задачу: обновила аккаунты в Salesforce и отправила анонс enterprise-контактам. Раньше, по его словам, подобные сценарии «застревали».
Что касается безопасности, то новая модель реже демонстрирует нежелательное поведение: она лучше отказывает в вредоносных запросах, устойчивее к prompt-инъекциям, реже галлюцинирует и меньше склонна к сикофантии по сравнению с Sonnet 4.6. При этом она все еще уступает Opus 4.8 и Claude Mythos Preview в способности противостоять несогласованному поведению. В Anthropic также отмечают, что у Sonnet 5 значительно ниже способность выполнять опасные задачи в области кибербезопасности, чем у текущих Opus-моделей. Сооснователь Lovable Фабиан Хедин подтвердил, что Claude Sonnet 5 «чисто и последовательно отказывается от небезопасных запросов».



