Claude Opus 4.6

免费已支付

Anthropic的旗舰语言模型用于复杂的编程,代理任务,以及深入分析.

Claude Opus 4.6
277视图
访问网站

概览

Claude Opus 4.6 神经网络描述

Claude Opus 4.6是来自Anthropic的旗舰多模式语言模型,旨在完成复杂的智力任务:在大型代码库中编程,自主代理工作流程,深度数据分析,以及多步推理. 该模型具有混合推理系统的特点:它可以提供即时答案,或者根据请求的复杂程度,逐步展开详细的思维链.

该模型的开发以编程和代理创建为重点:关键特征包括:在与代码合作时进行仔细规划,长期支持代理任务,在大型代码库中可靠的性能,以及改进代码审查和调试能力. Claude Opus 4.6还展示了在金融和法律知识工作、复杂的信息检索和多学科推理方面的主要成果。

新的API特征值得特别关注,使模型更加可控:适应性思维,努力控制,以及长期任务的背景压缩. 该模型与克劳德生态系统工具——克洛德代码(Claude Code),克洛德在Excel,克洛德在PowerPoint(英语:PowerPoint)——集成,将其应用范围扩大到开发商和商业用户.

克劳德·奥普斯 4.6 规格

规格数值
开发者人类
类型多式联运推理模型
发布日期2025年8月5日 (中文(简体) ).
分发模式已支付
许可证专有
上下文窗口200K 令牌( 在β模式下最多 1M)
最大输入200K 令牌( β 版本最多 1M)
最大输出最多128K个令牌
投入价格每1M个令牌5.00美元(上下文价 > 200K:每1M每10美元)
产出价格每1M个令牌25.00美元(上下文价 > 200K:每1M37.50美元)
知识截断2025年5月1日 (中文(简体) ).
支持的特性函数调用、结构化输出、代码执行、网络搜索、批量推论、微调
平均基准分80.9%

Claude Opus 4.6适合谁?

开发者和工程师

Claude Opus 4.6主要是一种专业开发者在大型代码库,代理系统以及复杂的编程任务下工作的工具. 模型适合那些不仅需要代码生成,而且需要全面工程规划,重构大型项目,以及多阶段调试的人.

研究人员和分析员

由于多学科推理(Humanity's Last Exam)和金融和法律知识工作(GDPval-AA)取得了高成效,该模型将有益于研究者、分析家和从事大量需要深入分析的信息的专家。

公司和企业用户

在Excel和PowerPoint中与Claude合并,为商业用户提供了机会:编写分析报告、使用表格数据以及制作演示文稿。 对克劳德代码代理团队的支持使得开发团队复杂的工作流程自动化.

如何使用克劳德·奥普斯4.6?

通过官方的Anthropic产品

该模型可通过Claude的官方产品:Anthropic网站上的网络界面,移动应用软件,以及桌面版本等提供. 使用该模式需要注册和通过API付费订阅或现收现付计费.

通过API和伙伴平台

关于融入自己的产品和服务,参见Anthropic API文档. 该模型也通过云平台和合作伙伴服务提供.

在发展工具内

Claude Opus 4.6支持Claude Code的工作——一种代理编程工具——以及 在克劳德在Excel和克劳德在PowerPoint加注。 用户可借助努力控制功能(低/中/高/最大),根据推理深度进行微调 在任务。

Claude Opus 4.6的关键特征

适应性思维和努力控制

该模型自行决定何时使用扩展思维模式,允许优化分配计算资源. 努力控制功能让用户设定推理的深度——从快速的答案到最详尽的链条.

长期上下文处理和上下文压缩

默认上下文窗口为200K令牌,可扩展至1M令牌的β模式. 上下文压缩功能使得能够高效地完成长期任务,同时又不失去关键信息或推理逻辑.

与克劳德生态系统工具的整合

该模型支持克劳德代码的代理团队——组织基于团队的代理工作流程的能力,以及与克劳德在Excel和克劳德在PowerPoint的整合. 现有标准能力:函数调用、结构化输出、代码执行、网络搜索、批量推论和微调。

多式联运

Claude Opus 4.6是一个多式联运模型:它可以处理文本数据,图像,和代码. 这使得它能够用于涉及视觉信息分析的任务与文字推理相结合.

克劳德·奥普斯的优势 4.6

方案拟订和代理任务的主要业绩

该模型显示了专业基准的高结果:终端-Bench 2.0(代理编码),SWE-bench验证(74.5%),浏览孔普(复合信息检索),DeepSearchQA(深代理搜索). 在代理搜索和研究中,该型号在TAU-bench Retail上实现了82.4%,在TAU-bench Airline上实现了56.0%.

推理和知识工作表现优异

Claude Opus 4.6领导了“人类的最后考试”(多学科推理)和“GDPval-AA”(金融和法律方面的知识工作)。 在GDPval-AA测试中,该型号以约144埃洛和克劳德·奥普斯4.5的190分超过了GPT-5.2. GPQA钻石的产值为80.9%,在AIME 2025年为78.0%。

灵活性和可控制性

由于适应性思维和努力控制,该模型允许用户在推理速度和深度之间选择平衡. 上下文压缩能确保长期任务中稳定的性能,适应特定编程风格的能力使得有既定编码惯例的团队变得方便.

Claude Opus的缺点 4.6

API高成本

该模型每1M输入令牌花费5美元,每1M输出令牌花费25美元. 当上下文窗口超过200K令牌(使用最高1M时),则适用溢价——每百万输入10美元,每百万输出令牌37.50美元. 这使得模型的价格大大高于较年轻的克劳德家族模型,如索内特或海库.

创造能力有限

与一些竞争者相比,该模型在创作内容生成方面的灵活性较低. 人们还注意到,克劳德周围的插件和集成生态系统落后于ChatGPT等较为流行的替代品.

图像处理细节

该模型支持多式联运,但输入数据可能比以前的Opus版本多出1.0–1.35×个符号,在规划成本时应当考虑这些符号.

Claude Opus 4.6解决了什么任务?

方案拟订和编码工作

该模型侧重于解决复杂的多阶段编程任务:生成和重构大型项目,仔细的架构规划,长期支持代理任务,代码审查,调试. 它可以处理需要多个代理人(代理团队)合作的任务.

建设代理人和自主流程

Claude Opus 4.6旨在创建自主的AI代理:它可以执行长串行动,在出现新信息时独立调整工作计划,并在多个小时内保持上下文. 这使得它适合复杂的代理情景,包括深度信息检索和研究.

深入数据分析和知识工作

该模式显示,在需要多学科推理的任务(人类的最后考试)以及金融和法律知识工作(GDPval-AA)方面都取得了很高的成果。 这使其得以用于复杂的数据分析、法律和财政研究以及工程计算。

处理大量文本和视觉信息

由于上下文窗口高达1M令牌(以β模式),该模型可以处理长文件,同时保持推理逻辑,不会丢失重要细节. 多式联运允许与图像和视觉数据合作。

Claude Opus 4.6 定价

API 费率

通过API使用该模型的成本为每1M输入符5美元,每1M输出符25美元. 这些费率与前身模型Claude Opus 4.5的定价相当.

扩展上下文的优惠价格

当超过200K令牌的标准上下文窗口并使用最多1M令牌时,适用溢价价:每百万输入令牌10美元,每百万输出令牌37.50美元. 扩展上下文窗口可用β模式.

分发模式和订阅

Claude Opus 4.6是一个付费型号. 没有提供免费等级:只能通过支付现收现付账单的API或通过订阅克劳德服务(Pro, Max)获取,后者为Anthropic模型规定了使用限制.

Claude Opus 4.6的使用条件

使用该模型需要在Anthropic平台注册和付费访问:开发者API密钥或克劳德接口用户付费订阅. 该型号以专有许可证发放,这意味着关闭源代码,不可能在当地部署.

在使用扩展上下文窗口(超过200K令牌)时,适用特殊条件:β模式和溢价定价. 与模型合作需要直接或通过伙伴平台和云服务获取Anthropic API.

克劳德·奥普斯 4.6 可用性

主要平台

该模型通过官方Anthropic产品提供:克劳德网络版本,桌面应用(Mac,Windows),移动应用(Android,iOS). 开发者可以通过Claude API——专业使用的关键集成通道——获得访问权限.

一体化和伙伴渠道

Claude Opus 4.6在Claude代码开发工具(包括代理团队模式)中得到了支持,在Excel的Claude和PowerPoint的Claude中得到了支持. 该模型通过合作伙伴云平台提供:AWS Bedrock,Google Cloud,微软创始,以及通过GitHub Copilot.

Claude Opus 4.6 与替代品有何不同

与 OpenAI 模型的比较

在GDPval-AA(金融和法律知识工作)测试中,Claude Opus 4.6比GPT-5.2超过了约144 Elo. 该模型在代理编码和深度信息检索方面显示出高成效. 然而,值得注意的是,一些相互竞争的模型可能会在单个长文本测试上获胜.

与Claude模型的比较

与Claude Opus 4.5相比,该模型显示出显著的进步:在GDPval-AA测试上拥有约190埃洛点的优势. 同时,价格没有变化——每百万令牌5美元/25美元,使升级更加有利,同时保持同样的成本. 与较年轻的家庭模式(Sonnet, Haiku)不同,Opus 4.6专注于最复杂的任务,为其更高的价格辩护.

主要差异

Claude Opus 4.6的主要区别在于结合了巨大的上下文窗口(在β模式中高达1M令牌),先进的代理能力,以及专业领域(金融,法律,研究)的高精度. 该模式不是针对大众用户,而是针对在长期自主任务中需要最大性能的专业人士. 对于日常工作来说,更年轻、更便宜的克劳德家庭模式仍然是更合理的选择。

结论

Claude Opus 4.6是其发布时最聪明的Anthropic模型,专注于建筑代理,编程,以及深入分析. 该模型领先于代理编码、多学科推理和知识工作方面的关键基准,提供了一个最多1M个令牌的上下文窗口(以β模式),以及管理推理深度的灵活工具。 然而,高昂的API成本,特别是在使用扩展上下文时,以及专注于专业任务,使得它主要有理由用于复杂和长期运行的项目:开发者与大型代码库合作,研究人员,以及需要自主代理工作流程中最大性能的公司. 对于更简单的日常任务,考虑较年轻的克劳德家庭模式——它们提供了更合理的价格和能力平衡.

写入代码
重构和调试
自动代理
图像分析
复杂的推理

定价

计划价格特征限制
克劳德·API每1M输入符5元,每1M输出符25元Claude Opus 4.6通过API, Claude Code, Claude in Excel, Claude in PowerPoint 访问200K令牌上下文(默认),最多128K输出令牌;对于上下文 > 200K,适用溢价定价:每1M输入10美元,每1M输出37.50美元
协作每月100美元自动任务执行, 包含 macOS 上的文件和进程, 访问选中的文件夹, 与 Asana, Notion, Claude in Chrome 合并研究预览, 等待列表访问, 仅使用 macOS

常问问题

另见

Claude Opus 4.6 — 对旗舰神经网络Anthropic的回顾