📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

【人工智能】Claude Sonnet 4.6发布 | 计算机操作能力 | 1M上下文压缩 | 智能体规划 | 全能型助手 | Excel插件 | 极致性价比 | 自动办公Agent

最佳拍档13:37

Transcription

大家好,这里是最佳拍档。

2026年2月17日,Anthropic正式发布了Claude Sonnet 4.6。这款被官方定义为“Sonnet系列迄今最强大的模型”,不仅实现了编程、计算机使用、长上下文推理等核心能力的全维度升级,更以与前代持平的定价,实现了接近旗舰级Opus模型的智能水平,甚至在多个实际业务场景中超越了2025年11月发布的Claude Opus 4.5。

今天,我们就来介绍一下这款模型,看看它究竟又实现了哪些突破。

首先,Claude Sonnet 4.6的发布,距离Anthropic发布旗舰模型Claude Opus 4.6,仅过去了不到半个月时间。这个发布节奏也能看出Anthropic在模型迭代上的惊人速度。作为Sonnet系列的全新升级款,Claude Sonnet 4.6完成了从编码、计算机使用到长上下文推理、智能体规划、知识工作乃至设计领域的全技能升级。

最值得关注的是,该模型搭载了测试版的100万token上下文窗口,意味着它可以在单次请求中处理整个代码库、数十页的冗长合同,或是几十篇研究论文。这对于需要处理海量信息的复杂任务而言,可以说是一次质的提升。

而在定价方面,Claude Sonnet 4.6的定价与Sonnet 4.5完全持平,依旧是每百万token输入3美元、输出15美元。这样的定价,也让它成为了Claude和Claude Cowork中,免费版和Pro版用户的默认模型。也就是说,无论是普通个人用户还是付费专业用户,都能直接体验到这款全新模型的强大能力。

Claude Sonnet 4.6最核心的能力突破,首当其冲的就是计算机使用能力的跨越式提升。早在2024年10月,Anthropic就推出了全球首个通用型计算机使用模型,只是当时的模型还处于实验阶段,官方甚至直言这款模型操作笨拙且容易出错。但是在随后的十六个月里,Anthropic的Sonnet系列模型在计算机使用能力上,实现了持续且稳定的提升。

核心的验证标准就是标准基准测试OSWorld。OSWorld在模拟计算机环境中,设置了数百项基于真实软件的任务,涵盖Chrome浏览器、LibreOffice办公软件、VS Code编程工具等我们日常工作中常用的软件。并且在测试中没有任何特殊的API接口或者专用连接器。模型需要像人类一样,通过点击虚拟鼠标、敲击虚拟键盘的方式完成交互。这种测试方式最大程度还原了真实的计算机使用场景,其测试结果也因此具备极高的实际参考价值。

需要特别说明的是,从Claude Sonnet 4.5开始,OSWorld测试升级为了OSWorld-Verified,对任务质量、评估评分标准和底层基础设施都进行了全面优化,测试难度更高,结果也更精准。而Claude Sonnet 4.6在OSWorld-Verified上取得了72.5分的成绩,相较于2024年10月Sonnet 3.5的14.9分,在十六个月内实现了近五倍的提升,甚至与旗舰级的Claude Opus 4.6的72.7分基本持平。

除了基准测试的亮眼表现,早期用户的实际使用反馈更能说明问题。不少用户表示,Claude Sonnet 4.6在处理复杂电子表格、导航、填写多步骤网页表单,以及跨多个浏览器标签页整合信息等任务时,已经展现出了接近人类水平的能力。

不过,Anthropic官方也坦言,该模型在计算机使用能力上,依旧落后于最熟练的人类。比如在处理一些极其复杂的多步骤操作、应对模糊的操作指令时,仍有提升空间。但不可否认的是,模型的进步速度是惊人的,而这也意味着AI的计算机使用能力,正在快速走向实用化,能覆盖的工作任务范围也在不断扩大。

在计算机使用能力之外,Claude Sonnet 4.6的编码能力也实现了大幅提升,甚至让不少开发者对它的偏好度超过了旗舰模型。Anthropic在Claude Code平台上进行的早期测试显示,大约70%的开发者在使用后,更倾向于选择Claude Sonnet 4.6而非前代的Sonnet 4.5。而更令人意外的是,有59%的开发者,甚至认为Claude Sonnet 4.6比2025年11月发布的旗舰模型Claude Opus 4.5更好用。

那么,Claude Sonnet 4.6究竟在编码方面做了哪些优化,能获得开发者如此高的评价?核心原因在于其在一致性、指令遵循能力上的大幅提升,以及编码逻辑的优化。不少开发者反馈,Claude Sonnet 4.6在修改代码前,会更有效读取整个代码上下文,能精准识别代码中的共享逻辑并进行整合,而非简单的复制粘贴。这个特性让它在长时间的编码工作中,大幅降低了开发者的操作成本,减少了不必要的重复工作。

同时,开发者普遍认为,Claude Sonnet 4.6大幅降低了“过度工程化”和“懒惰式编码”的问题。所谓过度工程化,就是模型会设计出远超实际需求的复杂代码结构;而懒惰式编码,则是模型会回避复杂的逻辑处理,简单敷衍完成任务。这两个问题在之前的模型中都较为常见,而Claude Sonnet 4.6在这方面的改善,让代码的实用性和可维护性大幅提升。

此外,该模型在编码任务中,还展现出了更少的虚假成功声明、更低的幻觉率,以及在多步骤编码任务中更稳定的持续执行能力。这些都是实际开发工作中,开发者最为看重的特性。

行业头部企业的实测反馈,也进一步验证了Claude Sonnet 4.6的编码实力。GitHub的产品副总裁乔·宾德表示,Claude Sonnet 4.6从发布之初,就在复杂代码修复方面表现出色,尤其是在需要跨大型代码库进行搜索的场景中,优势更为明显。对于大规模运行智能体编程的团队而言,该模型能提供强劲的问题解决率,以及开发者工作中所需的一致性。

AI编程神器Cursor的联合创始人兼CEO迈克尔·特鲁尔也评价道,Claude Sonnet 4.6在各方面都显著优于Sonnet 4.5,尤其是在长期任务和更复杂的编程问题处理上,表现更为突出。而日本乐天集团的人工智能总经理嘉治雄介的反馈则更具代表性。他表示Claude Sonnet 4.6为乐天AI生成了其测试过的最佳iOS代码,不仅在规范合规性和架构设计上表现优异,甚至还能主动使用开发团队并未要求的现代开发工具,一次生成的代码就达到了极高的质量。这个表现也让乐天的开发团队感到十分惊喜。

这些来自不同领域、不同规模企业的反馈,都印证了Claude Sonnet 4.6的编码能力,已经达到了接近旗舰模型的水平,成为了开发者日常工作的高效助手。

长上下文推理与智能体规划能力,是Claude Sonnet 4.6的另一大核心突破。而这一能力的基础,就是其搭载的测试版100万token上下文窗口。对于大模型而言,上下文窗口的容量固然重要,但更重要的是模型能否在大窗口中进行有效的推理。而Claude Sonnet 4.6不仅实现了100万token的大容量,更做到了在整个上下文中的有效推理。这让它在长周期规划、复杂任务处理上的能力大幅提升。

Anthropic在Vending-Bench Arena评测中,对这个能力进行了充分验证。Vending-Bench Arena是一个模拟商业运营的评测体系,它测试的是模型在长时间维度内运行模拟企业的能力,并且评测中加入了竞争元素。不同的AI模型需要同台竞技,通过制定商业策略实现利润最大化。这个评测体系能最直观地体现模型的长上下文推理能力和智能体规划能力。

而Claude Sonnet 4.6在这次评测中,展现出了极具策略性的商业思维。它在模拟运营的前十个月,选择重金投入产能建设,其投入规模远超其他参赛模型。而在运营的最后阶段,又迅速调整策略,将核心重心转向盈利。这个精准的策略转型,让它最终在评测中大幅领先于其他竞争对手。这个表现也充分证明,Claude Sonnet 4.6已经具备了一定的长期战略规划能力,而非简单的短期任务执行。这对于需要AI完成复杂商业分析、长期项目规划的场景而言,有着重要的实际应用价值。

除了上述核心能力,Claude Sonnet 4.6在知识工作和设计领域,也实现了显著的提升。早期客户反馈显示,该模型在前端代码开发和金融分析两个领域的表现尤为突出。

在前端设计方面,不少客户表示,Claude Sonnet 4.6生成的视觉输出内容,精致度有了明显提升。无论是页面布局、动画效果,还是整体的设计美感,都远超之前的模型。而更重要的是,客户想要得到达到生产标准的设计成果,所需的迭代次数大幅减少。这直接降低了设计工作的时间和人力成本。

在模型能力全面升级的同时,Anthropic也始终将安全放在首位。Claude Sonnet 4.6经过了全面且严格的安全评估。最终的评估结果显示,该模型的安全性与Anthropic近期发布的其他Claude模型持平,甚至在部分维度上更优。Anthropic的安全研究人员对该模型的评价是,它具备热情、诚实、亲社会且偶尔带有幽默感的性格特征,拥有极强的安全行为表现。在高风险的模型错位问题上,未发现任何重大隐患。

而在计算机使用能力提升的同时,Anthropic也针对性地优化了模型的安全防护能力。因为计算机使用能力的提升,也让模型面临着新的安全风险。其中最主要的就是提示词注入攻击,也就是恶意行为者将恶意指令隐藏在网站内容中,试图劫持模型,让模型执行非授权操作。而安全评估显示,Claude Sonnet 4.6在抵御提示词注入攻击方面,相较于前代的Sonnet 4.5有了重大提升,其表现与旗舰级的Opus 4.6基本持平。Anthropic也在其API文档中,详细介绍了如何缓解提示词注入攻击及其他安全问题,为用户提供了全面的安全防护指导。

为了让模型的能力能更好地落地,与用户的实际工作流深度融合,Sonnet 4.6新增了自适应思考和扩展思考两种模式。同时还上线了测试版的上下文压缩功能。这个功能会在对话接近上下文窗口上限时,自动对早期的对话内容进行总结,从而有效提升模型的实际上下文处理长度,让用户在长时间的连续对话中,无需担心上下文丢失的问题。

在API层面,Claude的网页搜索和数据获取工具也实现了优化。现在这些工具能自动编写并执行代码,对搜索结果进行过滤和处理,只将相关的内容保留在上下文中。这个优化不仅提升了模型回复的质量,还大幅提升了token的使用效率,降低了用户的使用成本。同时,代码执行、内存管理、程序化工具调用、工具搜索以及工具使用示例等功能,也正式从测试阶段转为全面开放。用户可以直接使用这些功能,拓展模型的应用场景。

Anthropic还针对不同的使用场景,给出了模型选择的建议。虽然旗舰级的Opus 4.6依旧是部分高难度任务的最佳选择,不过,Claude Sonnet 4.6凭借着高性价比,成为了绝大多数日常任务、企业级办公任务、常规编码任务的最优选择。尤其是在需要平衡性能和成本的大规模部署场景中,优势更为明显。

在办公软件融合方面,Claude in Excel的插件也迎来了重要更新,新增了MCP连接器功能。更新后的Claude in Excel,可以与用户日常工作中使用的各类金融工具打通。用户无需离开Excel表格,就可以让Claude从这些外部工具中获取相关信息,整合到表格分析中。并且如果用户已经在Claude中设置了MCP连接器,这些连接可以直接在Excel中使用,无需重复配置。这个功能目前向Pro、Max、Team和Enterprise套餐的用户开放,能大幅提升金融、财务领域用户的工作效率。

关于Claude Sonnet 4.6的使用方式和部署,Anthropic也做到了全面覆盖。目前该模型已经在所有Claude套餐、Claude Cowork、Claude Code中上线,同时也部署在了所有主流的云平台上。用户可以根据自己的使用场景,选择合适的使用方式。

值得一提的是,Anthropic还将免费版的Claude默认升级为了Sonnet 4.6,并且免费版现在也支持文件创建、MCP、Skill以及上下文压缩功能。这意味着普通个人用户无需支付任何费用,就能体验到这款全新模型的强大能力。

对于开发者而言,想要快速使用Claude Sonnet 4.6,只需通过Claude API调用相应模型即可。

Claude Sonnet 4.6的发布,不仅是Anthropic自身模型迭代的重要一步,更是实现了中端模型在核心性能上,接近甚至超越前代旗舰模型的跨越。而保持不变的定价策略,更是让AI大模型的高性价比落地成为可能。尤其是对于中小企业而言,无需承担旗舰模型的高昂成本,就能获得接近旗舰级的AI能力。这将大幅降低企业的数字化转型门槛,提升企业的生产和办公效率。

欢迎大家在评论区分享模型的使用体验。感谢收看本期视频,我们下期再见。