代理能力成为基线
Anthropic正式推出Claude Sonnet 5——其中型模式的新版本,使更多用户可以访问代理工作流程. 公司认为,该模型可以独立地制定计划,使用浏览器和终端,在没有不断监督的情况下完成任务——这种自主程度直到最近才需要旗舰和昂贵的解决方案. Sonnet 5发行后,显然代理特性不再是顶级模型的特权,并且正在成为每个价格段的标准. 竞争现在转向价格和可靠性,而不是仅仅存在“代理”能力。

业绩和定价
开发者承诺克劳德·索内特5提供接近Opus 4.8的结果,但成本要低得多. 从6月30日开始,该模型成为免费和Pro计划中的默认模型,并且在所有订阅中也都可以使用. 推出时实行特价:每百万输入令牌2元,每百万输出令牌10元,至8月31日,之后价格将分别上涨至3元和15元.
根据Anthropic的说法,新模型在推理,工具使用,代码写作,以及知识工作方面显著超越其前身——Sonnet 4.6,2月发行. 在代理编码基准上,Sonnet 5分63.2%,而Opus 4.8分69.2%,Sonnet 4.6分58.1%. 同时,在知识测试中,Sonnet 5甚至略高于Opus 4.8. Anthropic强调,Opus 4.8仍然是最高精度的选择,但Sonnet 5给了开发者更好的低成本选项. 用户可以调整两种模式之间的努力水平,选择正确的绩效和预算平衡.
就价格而言,Sonnet 5比 GPT-5.5 来自OpenAI和双子座3.1 Pro来自谷歌,但比双子座3.5 Flash更贵.

安全和开发者印象
其反馈Anthropic的测试者指出,Claude Sonnet 5更能完成复杂的任务,而以前的版本往往停止一半。 该模型还自行检查结果,即使没有要求. 例如,Zapier高级工程师丹尼尔·谢帕德(Daniel Shepard)说,Sonnet 5从头到尾完成了一项两部分的任务:它更新了销售部队的账户,并向企业联系人发送了一份公告. 之前,根据他的说法,类似的情景会"卡住".
在安全方面,新模型显示的不良行为较少:与Sonnet 4.6相比,它更适合拒绝恶意请求,更能耐即时注射,幻觉更不频繁,也更不易发生杂交. 同时,它仍然追踪到奥普斯4.8和克劳德·神话预览(英语:Claude Mythos Preview)在抵抗错位行为的能力. Anthropic还指出,与目前的Opus模型相比,Sonnet 5执行危险的网络安全任务的能力明显较低. 洛维布尔的共同创始人法比安·赫丁(Fabian Hedin)确认克劳德·索内特5"干净而一贯地拒绝不安全的请求".



