Claude Opus 4.5: 代码、代理和计算机控制能力崩溃

16 八月 20266 视图

于2025年11月25日上映的"Anthropic"中出品的一款模型被定制为复杂的编程任务,自主代理,并配合应用. 文章涵盖了关键情景、价格和向新版本迁移的计划.

Claude Opus 4.5: 代码、代理和计算机控制能力崩溃

2025年11月下旬,Anthropic完成了4.5排队:遵循家族中较小的型号,旗舰克劳德·奥普斯4.5发布. 发布时间为11月25日,公司没有为目标受众做任何骨骼——开发者,团队建设AI代理,以及任何需要仔细使用电子表格和文件等"成熟"界面的人.

在Anthropic的官方X账户中,新来者被称为 "世界上编码、代理和计算机使用的最佳模型" 无论是营销还是现实——实践都会知道,但光是这些细节就表明了公司的领导地位:模型掌握的上下文要好得多,幻觉较少,并处理长长的行动链.

方案拟订:整个项目通过一次考试

新型号开发者的主要优势卡是能够不与单个文件合作,而是拥有完整的项目结构. 该模型在模块化,重构,调试方面接受了培训,因此可以将一个任务突破成模块,将其与导入连接起来,并组装一个工作应用骨架.

在Anthropic演示中,该模型生成一个带有认证的React仪表板,3页,API集成,以及一个测试套件——都以单传. 通常,这种工作量需要一个小组进行若干次重复;在这里,一个附有要求说明的单一请求就足够了。

实际价值是日常工作明显加快。 生成典型的CRUD操作,重构遗留代码,并创建服务骨架可以安全地交给模型,将代码审查和建筑决定留给人类.

代理: 步骤之间的内存

早期代理情景的经典病症正在失去推理的线程:经过十几个动作,模型忘记了源数据,开始自相矛盾. 根据Anthropic,Claude Opus 4.5在动作之间保持了连贯状态,这意味着代理可以执行多步任务,而不需要每个阶段的人工"重启".

一个教科书的例子是一个日常助理,负责扫描收到的电子邮件,构建任务摘要,写它 并发送一份关于所做工作的报告。 随后的每一个步骤都以前一个步骤的结果为基础,模型不需要在两者之间干预. 这是向自动化迈出的重要一步,产品团队和业务效率部门都在关注。

然而,仍须谨慎行事:可访问电子邮件和数据库的自主链条应配备限制、日志和在有争议的情况下进行人类确认的站点。

计算机使用:Excel,演示,以及"应用"设想.

最有趣的一个方向是前进 计算机使用。该模型不仅能识别文件内容,而且能像人类一样与它们合作:分析表格结构,填充数据,构建图表,并根据它得出的结论编写材料。

在Anthropic演示中,模型打开一个Microsoft Excel文件,填充缺失的单元格,通过公式工作,构建图表,然后生成带有结果的演示文稿——包括一个深思熟虑的幻灯片结构. 本质上,这是一个现成的"数据~分析~报告"管道,它以前必须从几个工具手动组装.

就财务和管理报告而言,这种设想意味着每周直接节省小时。 你提出一个请求——你得到一个完整的电子表格和一个演示文稿,只需要经过编辑才能与公司风格相匹配.

长期背景和仔细推理

另一个显著的特点是能够把真正的大量文本"放在心上". 试验Anthropic引证令人印象深刻:该模型读取了10万托克的技术规格,并在此基础上进行了安全审计——其中列出了风险清单、修正和提及该模型的具体部分。 文档。 此类文件必须按手动分开,分部分阅读。

推理的质量也得到了提高:逻辑步骤依次排列,自信误差的比例也有所下降. 例如,在解释一个物理学衍生物时,模型会检查每个步骤的数学,而不只是重述一般的想法. 对于分析家和在文档工作中使用AI的人来说,这降低了认知负荷:每个参考和计算都需要减少重复检查.

定价和节余

Claude Opus 4.5被定位为溢价工具,因此价格相应溢价:每百万输入令牌5元,每百万输出令牌25元. 然而,最终法案在很大程度上取决于设想情况。 批处理 严重使用 快速缓存重复和大量请求的费用明显下降。

如果您有类似的请求, 且其上下文很大( 例如, 长的系统提示或文档套件) , 缓存可以节省你预算的很大一部分 。 对于确切的费率和条件,最好检查一下Anthropic的官方定价页面——那里的数字是详细的.

如何转向新模式

从以前的版本移到Claude Opus 4.5不需要重写你的架构——几个仔细的步骤就够了:

  1. 研究发行注释和API changelog:它们列出当前模型名称以及请求参数的任何更改.
  2. 从旧值替换代码中的模型标识符(例如, claude-4.x改为 claude-opus-4-5-20251101。 。 。
  3. 对照API文档或定价页面双查精确的标识字符串——单个字符错误会导致请求被拒绝.
  4. 在小型固定体上测试模型,然后在小型数据集上运行单元和集成测试,并比较 输出质量与上一版本。

旗舰并不能证明在所有情况下开关都是正当的:如果情节简单,不需要较长的上下文,那么家族中较小的模型可能更符合成本效益,更快. 因此测试阶段是强制性的,而不是可选的.

常问问题

Claude Opus 4.5——审查密码和代理的能力