📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

【OpenAI】GPT-5.4发布 | 计算机使用能力大幅提升 | Thinking & Pro | 视觉感知 | 浏览器操作 | 编码能力 | fast模式 | 一百万上下文 | 定价上涨

最佳拍档17:36

Transcription

大家好,这里是最佳拍档。

3月6日,OpenAI发布了GPT-5.4系列模型,包括面向ChatGPT和API的GPT-5.4 Thinking版本,以及针对复杂任务的GPT-5.4 Pro版本。这是OpenAI首次将前沿推理、编码和Agent能力整合到单一模型中的产物。与前代模型不同,它不再是单一功能的强化,而是一个真正意义上的全能型选手,能在ChatGPT、API和Codex三大平台同步使用。

Sam Altman在社交平台X上表示,GPT-5.4在知识工作和网页搜索方面表现更出色,具备原生计算机使用能力,支持一百万个上下文token,还能在响应过程中对其进行调整。这期视频我们就来介绍一下GPT-5.4都包含了哪些新的特性。

先来说说最核心的升级:原生计算机使用能力。这是OpenAI首个具备这种能力的通用模型,意味着AI不再只是生成文本或代码让人类去执行,而是可以直接像人一样,操控电脑完成跨应用的复杂工作流程。它支持两种操控方式:通过Playwright编写代码来操作浏览器,或者直接接收截图,然后发出鼠标和键盘指令。开发者还能通过自定义确认策略,针对不同风险场景调整它的行为。

在OSWorld-Verified基准测试中,GPT-5.4的成功率达到了75.0%,不仅远超GPT-5.2的47.3%,甚至超过了72.4%的人类表现。房地产科技公司Mainstay的CEO多德·弗雷泽分享了自己的测试结果:在覆盖约3万个房产税门户的测试中,GPT-5.4首次尝试成功率就达到了95%,三次内成功率更是100%,而之前的计算机操控模型只有73%到79%的成功率。同时,GPT-5.4的完成速度快了大概3倍,token消耗少了约70%。

在实际应用中,它能爬取Zillow上所有旧金山的房价数据,在4分钟内导入Google表格,还能通过坐标点击来发送邮件、安排日历,全程截图驱动,甚至能批量填写十个web表单,整个过程无需人工干预。

与之配套的视觉感知能力也有了显著提升,毕竟要操控电脑,首先得看懂屏幕。在MMMU-Pro视觉理解与推理测试中,GPT-5.4在不使用工具的情况下,取得了81.2%的成功率,优于GPT-5.2的79.5%。在OmniDocBench文档解析测试中,它的平均错误率降至0.109,而GPT-5.2为0.140。更重要的是,OpenAI为它新增了原始图像输入精度模式,支持最高一千零二十四万像素或最大边长六千像素的全保真感知。原有的高图像输入精度模式,也提升到了支持二百五十六万像素或两千零四十八像素最大边长。

在浏览器操作方面,GPT-5.4在WebArena-Verified测试中,结合Dom和截图驱动交互时,它的成功率达到了67.3%,略高于GPT-5.2的65.4%。而在Online-MindToWeb测试中,仅凭观察截图就能实现92.8%的成功率,显著高于ChatGPT AtlasAgent模式的70.9%。

软件工程师索耶·胡德在试用后直言:“GPT-5.4对于知识型工作来说是一场灭绝级别的事件。它能胜任所有浏览器工作,而且又准又便宜。很快就会像编程Agent那样,引发一场白领革命。”

在知识工作能力方面,OpenAI用GDPval基准对模型进行了测试。这个基准涵盖美国GDP前9大行业的44种职业,并且由人工来评估模型输出是否能和行业从业者持平或更好。结果显示,GPT-5.4在83.0%的项目上达到或超过行业专业水平,而前代GPT-5.2仅为70.9%。其中69.2%是明确胜出,13.8%是打平。这个数据已经足以说明它在专业领域的实用性。

在电子表格建模这个核心办公场景中,GPT-5.4的表现更是让人惊叹。在模拟初级投行分析师日常建模任务的内部基准测试中,它的平均得分达到87.3%,远高于GPT-5.2的68.4%。与之同步上线的ChatGPT for Excel插件,让用户可以直接在电子表格中调用AI,通过自然语言就能构建财务或分析模型、修正和生成复杂公式、对数据进行分析与解释。投资公司Walleye Capital的AI解决方案主管丹尼尔·斯威基表示,在他们内部的财务和Excel评估中,GPT-5.4的准确率提高了30个百分点,这要归功于模型更新和情景分析的扩展自动化。

演示文稿生成方面,人类评审在68.0%的情况下,更偏好GPT-5.4生成的结果,主要优势在于更强的美学设计、更丰富的视觉变化,以及更有效的图像生成运用。而在文档处理上,它编写的内容更专业,逻辑更清晰,甚至能完成法律文档的复杂分析。在Harvey的BigLaw Bench法律文档评测中,GPT-5.4的准确率达到了91%,在结构化复杂交易分析、跨长篇合同保持准确性、提供法律从业者需要的高细节方面,表现优于其他模型。MercorAI的CEO布伦丹·富迪更是评价它是APEX-Agents基准测试中表现最好的模型,也是首个平均分超过50%的模型,而一年前,前沿模型在这个基准上的得分还不足5%。

值得一提的是,GPT-5.4在事实准确性上也有了长足进步,这对于专业工作来说至关重要。OpenAI表示,它是迄今为止事实性最好的模型,相比GPT-5.2,单个陈述的错误率降低了33%,完整回答中出现任何一个错误的可能性降低了18%。

编码能力作为OpenAI的传统优势,在GPT-5.4上得到了进一步强化,并且实现了与通用推理、计算机使用能力的深度融合。它继承了GPT-5.3-Codex的编码优势。在SWE-Bench Pro基准上,GPT-5.4得分为57.7%,高于GPT-5.3-Codex的56.8%和GPT-5.2的55.6%,同时延迟更低。GPT-5.4的估计延迟在五百至八百秒左右,而GPT-5.3-Codex则需要一千八百秒以上。Codex中的fast模式更是让编码效率大幅提升,可以提升1.5倍token速度,同时保持同等的智能水平。这意味着开发者在编码、迭代与调试过程中能保持更流畅的状态。

AI写作助手公司HyperWrite的CEO马特·舒默在测试一周后盛赞:“GPT-5.4的编码能力简直强得离谱,几乎完美无瑕。在Codex内部的可靠性更是惊人,编码问题基本上已经解决了。”他甚至表示:“自己以前是Pro系列的重度用户,但是现在GPT-5.4的标准版在编码等任务上,已经超越了之前的Pro版本。专业版对于日常使用来说已经有些性能过剩。”

更令人印象深刻的是它的复杂项目开发能力。AI圈大佬埃里克·哈特福德用从零构建一个编译器对它进行了硬核测试,结果Claude Code直接卡住,GPT-5.3勉强推进但很吃力,而GPT-5.4能快速领会深层逻辑并完成开发。此外,GPT-5.4还能对任天堂NES的Rom进行逆向工程,拆解程序结构、还原逻辑,甚至解释当年的汇编技巧。

为了支撑这些复杂能力,GPT-5.4配备了高达一百万token的上下文窗口,这是它能处理大型任务的关键基础。这意味着,整个代码库、整份长合同、海量的科研文献,都能一次性输入模型,无需再做分块、复杂的检索,也不必频繁压缩上下文,避免了因上下文丢失而影响理解。

不过,需要客观看待的是,超长上下文目前还存在一定的不稳定性。OpenAI自研的MRCR v2长文档多点检索评测显示,在0到128K token范围内,GPT-5.4的准确率在86%到97%之间;128K到256K时为79.3%;256K到512K时降至57.5%;而512K到一百万时仅为36.6%。不过,对于绝大多数日常工作场景来说,128K以内的上下文已经完全够用,这个限制并不会影响其实际使用价值。

在工具生态与效率优化方面,GPT-5.4也带来了革命性的改进。之前的AI模型在调用多个工具时,每次请求都要把所有工具的完整定义塞进提示词,工具一多就会额外消耗大量token,导致成本高、速度慢。而GPT-5.4新增的工具搜索功能,彻底改变了这种模式。模型会先获取一份轻量化的可用工具列表,需要使用某个工具时,再实时查询它的完整定义,即时加入对话上下文。

在Scale的MCP Atlas基准测试中,启用36个MCP服务器、测试250个任务时,工具搜索模式在保持相同准确率的前提下,总token消耗量减少了47%。这对于构建大型Agent系统的开发者来说,意味着成本将大幅降低、响应速度显著提升。在Toolathlon基准测试中,这种效率提升也得到了体现。这个测试会衡量AIAgent使用真实世界工具和API完成多步骤任务的能力。GPT-5.4能用更少的交互轮次,实现更高的准确率。在大约10次工具让步时,它的准确率能达到55%左右,而GPT-5.2仅为46%。

对于延迟敏感、不想开启推理的场景,GPT-5.4也有明显优化。在TaoTwo-bench电信测试中,不启用推理模式时,它的准确率达到64.3%,高于GPT-5.2的57.2%、GPT-5.1的45.2%和GPT-4.1的43.6%。

网络搜索能力方面,在BrowseComp基准测试中,GPT-5.4的性能较GPT-5.2提升了17个百分点,而GPT-5.4 Pro更是创下了89.3%的新高。OpenAI解释说,测试中使用了更长、更新的搜索阻止列表,排除了包含基准答案的网站,防止结果污染,因此这个分数的提升真实反映了模型搜索能力的进步。这意味着GPT-5.4能更持久地跨多轮搜索,找到最相关的信息来源,尤其适合那些需要大海捞针式信息搜集的研究型任务。

除了这些核心功能,GPT-5.4在交互体验上也做了贴心优化。Thinking版本新增了思考过程预览功能,处理复杂查询时会预先展示推理思路,用户可在响应过程中实时调整方向,减少来回沟通,更快获得符合需求的结果。目前该功能已在网页版和Android应用上线,iOS版本即将推出。同时,它在处理高度具体的查询时,能更好地保持长上下文的连贯性。对于需要较长时间思考的问题,可维持对对话前序步骤的更强意识,确保答案在整个过程中保持相关性和连贯性。

学术与科研能力的突破,则让GPT-5.4的应用场景延伸到了更专业的领域。在ARC-AGI-2抽象推理评测中,GPT-5.4得分为73.3%,GPT-5.4 Pro更是达到83.3%,而GPT-5.2仅为52.9%。在GPQA Diamond研究生级多学科问答评测中,GPT-5.4得分92.8%,GPT-5.4 Pro为94.4%,略高于GPT-5.2的92.4%。

数学能力方面,在FrontierMath Tier 4数学竞赛级最高难度题目测试中,GPT 5.4得分为27.1%,GPT 5.4 Pro达到38.0%,远超GPT 5.2的18.8%。最令人惊叹的是,它在硬核科学领域的表现。CritPt是一个被称为地狱级的物理基准,由30家机构、50多位一线物理研究员联手出题,71道题全是未发表过的前沿难题,横跨11个物理学细分领域。每道题平均审查超过40小时。在这个基准测试中,GPT-5.4 Pro(xhigh)拿下了30.0%的最高分,GPT-5.4(xhigh)紧随其后获得20.0%,第三名Gemini 3.1 Pro Preview仅为17.7%,而2025年最顶尖的模型在该基准上大多只有个位数的正确率。在Frontier Science Research科研能力综合评测中,GPT-5.4得分为33.0%,GPT-5.4 Pro为36.7%,同样远超GPT-5.2的25.2%,这表明AI在辅助科研创新方面已经具备了实际价值。

当然,没有完美的模型,GPT-5.4也存在一些短板。比如在HealthBench健康问答评测中,GPT-5.4的整体得分为62.6%,略低于GPT-5.2的63.3%;Hard子集得分40.1%也低于GPT-5.2的42.0%。不过Consensus子集从94.5%提升到了96.6%,准确性和一致性有所提升。在Terminal-Bench 2.0终端操作能力测试中,GPT-5.4得分75.1%,略低于GPT-5.3-Codex的77.3%,属于小幅回退。

在定价方面,GPT-5.4的API定价确实比前代有所上涨。标准版输入价格为每百万token 2.5美元,缓存输入价格为每百万token 0.25美元,输出价格为每百万token 15美元。Pro版输入价格为每百万token 30美元,输出价格为每百万token 180美元。相对GPT-5.2,输入价格涨幅超过40%,输出价格涨幅为7.14%。虽然OpenAI强调,即使价格有所上调,GPT-5.4的定价仍然低于许多同级别的前沿模型,但是有开发者吐槽这个价格太疯狂。AI云服务创企Hyperbolic的CTO金宇晨甚至表示:“GPT-5.4 Pro是最过度思考的模型,一个简单的Hi就思考了5分钟18秒,花了他80美元,约合人民币551元。”这也反映出对于部分轻量使用场景,Pro版本的性价比确实不高。

在发布计划上,GPT-5.4 Thinking即日起面向ChatGPT Plus、Team和Pro用户开放,取代GPT-5.2 Thinking。GPT-5.2 Thinking将在模型选择器的遗留模型部分保留三个月,直至2026年6月5日退役。GPT-5.4 Pro则面向Pro和Enterprise计划用户开放。在API中,分别以gpt-5.4和pt-5.4-pro名称提供给开发者。免费用户虽然不能主动选择GPT-5.4,但是在系统自动路由时会有机会体验到。

安全性方面,GPT-5.4延续了GPT-5.3-Codex的安全防护措施,并引入新的开源评估COT可控性。测试发现GPT-5.4 Thinking控制其思维链的能力较低,意味着它的推理过程难以被外部指令刻意改写,也难以主动隐藏推理逻辑来绕过监控。在OpenAI的Preparedness Framework评估框架下,GPT-5.4被评为网络安全High和生物化学High两个领域的高能力模型,对应部署了两套防护体系。外部安全机构Apollo Research的评估显示,无诱导条件下GPT-5.4的整体欺骗率大约1%,与GPT-5.3-Codex相当,低于GPT-5.2,且没有观测到模型主动对抗开发者监督的行为。不过在提示词注入防护方面,函数调用场景的防护能力从之前的水平小幅回退至0.978,连接器场景则提升至0.998。

GPT-5.4的发布,也引发了行业对就业市场的广泛担忧。就在它发布的同一周,经济学家乔伊·波利塔诺在X上公布的数据显示,美国科技行业上月就业人数净减少1.2万,过去一年累计蒸发5.7万个岗位。当前科技就业的萎缩程度,已经几乎追平2024年科技衰退最惨烈的时刻,而且比2008年和2020年两次危机还要严重。更值得关注的是,这次岗位消失的原因与以往不同,不是因为公司倒闭或商业模式失败,而是因为头部科技公司的利润持续增长,它们发现有了AI之后不再需要那么多人类员工。

但是诡异的是,在科技行业总就业暴跌的同时,AI岗位的需求反而在飙升。Citadel的数据显示,软件开发人员的职位空缺正在迅速增加。这意味着行业正在加速换人。原来5个人的活,现在1个人加一个AI就能干完,剩下的人面临被淘汰的风险。这种结构性失业的趋势,在GPT-5.4这样的模型进一步普及后,可能会蔓延到更多行业,从投行、律所、咨询公司到普通的办公室白领,都将面临AI的冲击。

也许再过一段时间,当我们再次打开ChatGPT时,面对的已经不再是一个仅仅擅长咬文嚼字的聊天机器人了。回看这两年的发展轨迹,AI从陪人聊天的对话框,到辅助敲代码的副手,再到今天直接接管鼠标键盘、接手复杂表格的数字员工。这次的GPT-5.4,或许正在把纸面上的潜能,彻底变成了桌上的生产力。技术革命往往不是伴随着一声巨响到来的,而是潜移默化的渗透进每一次的版本更新里。等到我们真正察觉时,那个曾经只会回答问题的AI,其实已经悄无声息地坐上了我们的工位。

感谢收看本期视频,我们下期再见。