Transcription
谷歌刚刚发布了地球上最智能的人工智能模型。它是 Gemini 3.1 Pro。它的成本是竞争对手的七分之一,而且他们甚至不需要你使用它。没错。他们发布了一个在 16 项基准测试中领先 13 项的模型。它的成本大约是 Opus 4.6 收费的七分之一。而谷歌真的不在乎。这并不是他们奇怪的炫耀。这可能是目前人工智能领域最重要的战略信号。而几乎没有人谈论它。关于 Gemini 3.1 Pro 的报道一直围绕着那些基准测试。而缺失的是其背后隐藏的问题。为什么科技界最富有的公司,一家年自由现金流超过千亿美元的公司,会打造市场上最强大的推理引擎,将其定价在最低水平,并且如果你继续使用 Claude 或 Chat GPT 来完成日常工作,他们也完全无所谓?答案将重塑你今后如何看待每一次模型发布。它改变了你如何评估自己的技能,并解释了为什么关于我应该使用哪个 AI 的大部分对话实际上是在问错误的问题。所以,几周前我写了关于 Opus 4.6 的文章,以及他们如何使用 16 个 AI 代理来构建一个 C 编译器。那篇文章是关于一种新型劳动。代理在团队中协调,管理工程组织,进行数周的持续自主工作。这个视频是关于不同的东西。这个视频是关于为什么拥有计算史上、地球史上最深厚的财力和最广泛分发能力的公司正在玩着与任何其他公司截然不同的游戏。以及这对你如何评估 AI 模型、选择工具以及理解你哪些问题即将变得更容易解决,哪些不会,意味着什么。所以,我们将讨论那 16 项基准测试中的一项,因为我通常不谈论基准测试。那个数字是 77.1%,它是在 ARC AGI2 基准测试上。我们为什么关心?这与从训练数据中进行模式匹配无关。ARC AGI2 测试模型是否能够解决它从未见过过的逻辑问题。所以这与从记忆的例子中检索无关,而是关于真正新颖的推理。模型能否看待一个它从未遇到过的问题,并从第一原理出发解决它?我想让你看看那个基准测试上的加速情况。Gemini 3 Pro,在 11 月份刚刚发布,得分是 31.1%。仅仅 90 天后,3.1 Pro 发布了,得分翻了一番多。那 46 个百分点的飞跃是任何前沿模型系列有史以来产生的最大单代推理增益。Opus 4.6 在同一基准测试上得分 68.8%,非常接近。GPT 5.2 的得分略低。其余的评分卡讲述了非常相似的故事,对吧?在 GPQA Diamond 上得分非常高,这本质上是一个科学基准测试,目前已经饱和。在 Live Codebench Pro 上得分非常强劲,它衡量编码能力。你明白了。这些数字是真的,但基准测试不是重点。重点是谷歌选择优化纯粹的推理能力。Anthropic 构建了 Opus 4.6,用于代理工作。持续的自主编码循环调用。代理团队有时会跨代码库协调数周。OpenAI 构建了 codeex 5.3,用于专业的编码管道,具有自举沙箱和每秒千个 token 的最大吞吐量。谷歌构建 Gemini 3.1 Pro 并非为了这些。他们构建它是为了更深入地思考,而不是为了更长时间地编码,不是为了管理更多的代理,而是为了更深入地推理它从未见过的问题。这个设计选择告诉你关于谷歌认为自己是谁以及他们认为自己将如何发展 AI 的一切。Demuse Hosabus 已经说了 15 年的同一句话。第一步,解决智能。第二步,用它来解决其他一切。所以谷歌专注于解决智能。他在 Deep Mind 还是一个没人听说过的伦敦初创公司时就这么说了。他在 Alph Go 击败围棋世界冠军后也这么说了。上个月在达沃斯他也这么说了。上周他在 Fortune 播客上再次这么说,他预测通用人工智能将很快到来。他实际上已经更新了他的预测,而且他是一个保守的人。他现在预计将在 5 年内实现。他在 60 Minutes 节目中谈到十年内治愈大多数疾病时也这么说了。这句话没有改变,因为他的使命没有改变。这不是人工智能行业里任何人的说话方式。Sam Alman 谈论产品、合作伙伴关系、分发、争夺十亿用户。是的,他也谈论智能,但是在它如何被频繁应用的情境下。当 OpenAI 在 Chat GPT 中投放广告时,他们这样做是因为他们需要将十亿用户群货币化。而 Huss 在达沃斯被问及 Chat GPT 广告时说,他对 OpenAI 在广告方面如此迅速的举动感到惊讶。当然,他说谷歌能够通过搜索获利,而他们不需要在 Gemini 中通过广告获利。因此,OpenAI 没有世界上最大搜索引擎,也没有为其提供资金的利润来源。OpenAI 处于不同的融资地位。Hosabuse 的潜台词是明确的。我们不考虑我们的谷歌 AI 聊天机器人如何获利。我们只考虑智能。现在,我想说清楚。这并不是因为谷歌在某种程度上凌驾于商业利益之上。谷歌经营着人类历史上最赚钱的广告业务。他们从搜索、YouTube 和云服务中获得了超过千亿美元的年自由现金流。他们今年将在资本支出上花费 930 亿美元,其中大部分用于 AI。他们可以负担得起让 Gemini 成为一个研究工具,因为他们的经济引擎与你个人更喜欢 Claude 还是 Chat GPT 来完成日常工作无关。人工智能领域的其他所有人都试图弄清楚如何将模型货币化。谷歌试图弄清楚如何构建智能。金钱会自行解决。真好。谷歌如何获得这种优势?这不仅仅是利润来源。而且谷歌在过去十年里刻意构建了一个没有人能比的垂直 AI 堆栈。他们设计自己的芯片。Ironwood TPU,第七代,今年早些时候发布,提供了上一代的 10 倍计算能力,而每次操作的能耗成本大约减半。它可以将 9,216 个芯片连接成一个单一的 pod。Anthropic 刚刚签署了一项协议,将在一项价值数十亿美元的多年协议中使用一百万个 TPU。Meta 据报道也在进行类似的谈判。当你的竞争对手在你的硬件上训练他们的前沿模型时,你已经建立了一个超越护城河的东西。你建立了一个坚不可摧的堡垒。谷歌在这些硅片上训练自己的模型。他们通过自己的云基础设施部署这些模型。谷歌云,十分之九的人工智能研究实验室在某种程度上都在使用它。他们将其分发给每月 6.5 亿活跃的 Gemini 用户,尽管这再次不是主要重点。而且在一个季度内增长了 44%。加上通过搜索、Android、YouTube 和 Chrome 获得的数十亿用户。他们拥有历史上任何公司中最广泛的人类覆盖范围。他们通过 Deep Mind 为基础研究提供资金,Deep Mind 在 18 个月前因 AlphaFold 获得了诺贝尔化学奖,该系统预测了几乎所有已知蛋白质的结构,这是生物学家们研究了 50 年的问题。这种从晶体管设计到蛋白质折叠的垂直整合并非偶然。它是一家相信智能是计算机科学问题、该问题是可解的,并且解决它需要控制从物理到软件的整个堆栈的公司架构。谷歌的 Jeff Dean 表示,他们正在通过在芯片设计过程中使用 AI,将 TPU 设计周期从 2 年缩短到 6-9 个月。他们正在利用智能来构建运行智能的硬件。这个飞轮是自我强化的,并且正在急剧加速。没有人拥有这个。微软拥有 Azure 和与 OpenAI 的合作关系,但他们不制造芯片,他们在 AI 方面的消费者分发非常分散。Copilot 因在 Office 产品中感觉不连贯而受到批评。亚马逊拥有 AWS 和 Tranium 芯片,但他们的模型远远落后于前沿模型。Meta 拥有研究人才和社会分发能力,但没有云业务和芯片堆栈。Anthropic 拥有当今代理工作中最好的产品,但他们运行在别人的硬件上,包括谷歌的 TPU 和亚马逊的基础设施,并且他们需要每一个客户来证明其估值。他们无法负担仅仅构建纯粹的智能。谷歌是唯一一家可以“输掉”模型竞赛的公司。每一个开发者和每一个企业客户为每项任务选择 Claude 或 Chat GPT,他们仍然会做得很好,因为模型不是他们的业务。模型是他们选择发布的智能实验,由科技界最大的现金生成机器提供资金,运行在专有硅片上,并将结果反馈给地球上一半人口使用的产品。这改变了你应该如何解读谷歌发布的产品。那么 Gemini 3.1 Pro 是什么,又不是什么呢?Gemini 3.1 Pro 本身并不是一个编码代理,尽管它当然可以写出很好的代码。它也不是一个代理管理器,尽管它可以管理代理。它不像 Opus 4.6 在 Raku 10en 上那样试图在一个 50 人的工程组织中自主关闭问题,如果你需要这个的话。Opus 目前可能做得更好,谷歌也知道这一点。3.1 Pro 实际上是目前规模最大、价格最低的纯推理模型,适用于任何推理深度比工具编排更重要的领域。每百万输入 token 2 美元,每百万输出 token 仅 12 美元。在输入方面,它比 Opus 4.6 便宜约七倍半,在输出方面便宜六倍多。对于每月处理十亿 token 的工作负载,这相当于 15,000 美元的账单和 2,000 美元的账单之间的区别。通过上下文缓存,Gemini 的成本可以再降低 75%。JetBrain 的 AI 总监称其更强大、更快、更高效。Artificial Analysis 目前将其列为其智能指数上的顶级模型,成本约为其最近前沿竞争对手的一半。该模型还具有可配置的思考级别,低、中、高和最大。因此,您可以根据需要调整推理深度和成本。简单的分类或摘要?低思考,快速且便宜。需要多步推理的新科学问题?好吧,让我们调到最大。让它工作。这是成本工程的推理,其粒度是其他人无法真正提供的。这很重要,因为它意味着您不必为常规任务支付前沿价格。但这是真正的比较。而且很重要。当您为这些模型提供工具、网络搜索、代码执行、数据库访问、文件系统,并衡量它们在需要协同使用这些工具来完成工作的复杂现实世界任务上的性能时,4.6 会迎头赶上,并且经常领先。在人类的最后一次考试中,使用搜索和代码工具,Opus 得分为 53.1%,而 Gemini 得分为 51.4%。在 GDP val 上,它衡量专家级的办公和金融任务,Opus 以 289 ELO 点领先,这是一个巨大的差距。记住,那是真实的现实世界工作,伙计们。在 Arena 编码排行榜和专家人类偏好排名中,Clawed 模型一直获胜。这里的模式是明确的。Gemini 3.1 Pro 是最强大的裸推理器。Opus 4.6 是最强大的装备推理器,是能够最好地结合智能和使用工具、调用 API、读取文件、编写代码以及持续数小时和数天工作的模型。GPT 5.3 CEX 是最强大的专业编码器。如果智能是引擎,工具就是传动系统。谷歌造了一个更好的引擎,Anthropic 造了一辆更好的车。OpenAI 为任何单个任务制造了更好的赛车变速箱。问题不是哪个模型最聪明。问题是任务是否受限于原始思维,还是跨工具和时间的行动能力才是真正的瓶颈。而这个问题比任何基准测试都更有趣,而且我们谈论得还不够。所以我们现在就来谈谈。首先,让我们了解 Gemini 3.1 Pro 旨在解决什么问题。我认为一个很好的例子是 Gemini 3 的 Deep Think,它于 2 月 12 日发布,是一种专门的推理模式,在智能曲线上位于 3.1 Pro 之上。Deepthink 与人类研究人员合作,解决了数学、物理学、计算机科学和经济学领域 18 个以前未解决的问题。这些不是渐进式改进。它们不是基准测试的技巧。它做出了原创研究贡献。在线子模优化中的一个猜想自 2015 年以来一直未被证明。如果像我一样,您想知道什么是在线子模优化,它是一种谈论在互联网上移动的数据的方式,数学家们也参与其中。在这种情况下,数学家们提出了一个看似显而易见的规则。在数据流中,如果您复制一个到达的项目,复制它总是比移动原始项目价值更低,这可能是因为存在缺陷的风险。现在,数学家们花了十多年的时间试图证明这一点是真的。Gemini Deepthink 设计了一个精确的三项组合反例,并在一次运行中证明了该猜想是错误的。这甚至不是关于最大割问题(Max Cut Problem)的最有趣结果,这是一个经典的图论优化挑战,同样,我在这里已经超出了我的能力范围,而这正是重点。这就是我分享这个的原因。如果您感到不知所措,这就是我试图传达的一部分。Gemini 3.1 Pro 就是关于这种纯粹的推理。总之,Jee 和我通过引入我不得不查阅的知识解决了这个问题:来自连续数学的曲线积分定理和测度论来解决离散算法难题。哇,这真是一大堆术语。人类算法研究人员通常不会涉足几何函数分析来解决图论问题,因为尽管它们听起来可能像天书,但它们实际上是截然不同的数学领域。该模型跨越了人类专家很少跨越的学科界限,因为模型看不到学科界限,而这就是 AI 模型的一个优势。它还解决了物理学中的问题,它解决了引力辐射问题。你看,还有很多。它解决了物理学中的问题。它发现了一篇密码学论文中的关键错误。就在 3.1 Pro 发布的两天前,Isomorphic Labs,这是 DeepMind 的药物发现衍生公司,公布了其 AI 药物设计引擎的结果。该系统在最困难的蛋白质预测任务上的准确性是 AlphaFold 3 的两倍多,并且以成本和时间的很小一部分就超越了金标准物理方法。那么我们这里有什么?蛋白质折叠。我们有复杂的数学,猜想的打破。我们有引力辐射的涉及,密码错误检测。它在处理晶体生长优化。这些都是极端困难的纯粹推理问题。我光是尝试沟通这些就头晕目眩。而且我离理解这些研究的皮毛还差得很远。它们具有特定的共同特征。输入是明确定义的,比如蛋白质序列。问题可以非常精确地陈述。解决方案需要一个长而持续的逻辑推理链,人类可以验证,但通常需要多年的专业培训才能生成。这是谷歌在智能问题上的投资真正获得回报的领域。这就是他所说的“让我们解决智能,然后用它来解决其他一切”的意思。其他一切始于科学。它始于那些推理难度与模糊性之比最高的那些问题,问题非常清楚,但答案需要真正的智力才能得出。这就是为什么我认为对于任何阅读 Gemini 3.1 Pro 的人来说,最重要的问题不是它是否比 Opus 更好,而是你实际工作中有多大比例被这种思维所瓶颈。而我的分析在这里变得比大多数 3.1 Pro 分析更具个人色彩。因为困难不是一回事。我们已经把困难的工作当作一回事太久了。基准测试倾向于将其视为一个单一的实体。模型营销当然也将其视为一个单一的实体。LinkedIn 的讨论也将其视为一个单一的实体。而模型格局现在已经非常分化。这将迫使我们分解“困难”的感觉。想想你在工作中遇到的问题。有些问题之所以困难,是因为它们需要深入的推理。分析一份复杂的合同,找出在三个司法管辖区产生下游责任的条款;或者通过多步财务模型来找出改变投资决策的敏感性;或者诊断分布式系统在特定负载模式下失败的原因,而这种模式只在规模化时出现。这些问题需要你在脑海中同时考虑多个变量,沿着分支和依赖关系遵循逻辑链,并得出一个从表面上看并不明显的结论。但商业中的大多数问题在推理轴上并不真正困难。它们在其他轴上完全困难。让我给你举几个我认为我们谈论得不够的类别,我们需要理解这些问题类型才能真正弄清楚我们如何在 AI 时代蓬勃发展。首先,努力问题。它们在智力上并不困难。它们只是规模大。审计 3000 份供应商合同以进行合规性变更。迁移一个包含 200 万行 COBOL 代码的遗留代码库。审查上个季度所有的客户互动以识别客户流失信号。每一步的思考都非常直接。任何有能力的人都可以完成任何单个部分。挑战在于大规模的持续注意力和彻底性,而不丢失细节。这些是代理 AI 被构建来解决的问题。Opus 4.6 在 Rockuten 的代码库上运行数小时,解决的是一个努力问题。16 个代理在数周内构建一个 C 编译器,解决的是一个努力问题。每一步的思考并不非凡。是耐力,而这并不是 Gemini 3.1 Pro 优化的方向。这是另一种问题类型。协调问题。让六个团队就共享的架构决策达成一致,而每个团队都有不同的优先级和不同的技术背景。跨依赖关系路由工作,这样后端团队就不会阻止前端团队,前端团队也不会阻止 QA 团队。管理信息流,以便合适的人在合适的时间知道合适的事情,并且没有人浪费 3 天的时间去构建一个在他们甚至没有被邀请参加的会议上已经决定反对的东西。Rakuten 部署 Opus 4.6,模型自主关闭问题并将其路由给一个 50 人的组织和六个不同的仓库,这是在解决一个协调问题。这是一个模型在解决人类协调问题。它不仅理解代码,还理解哪个团队拥有仓库,谁拥有什么上下文,问题应该分配给谁,以及最关键的是何时升级。换句话说,模型发展了一种相关的工程组织意识。这些是 Opus 4.6 领先而 Gemini 3.1 Pro 不具备的能力。情商问题。向一个表现不佳但正在经历离婚的下属提供反馈。在一次谈判中,对方的明确关切,他们的价格,不是他们真正的关切,而是控制。阅读董事会会议,并知道 CFO 的沉默意味着反对,而不是同意。管理一个重组中的团队,其中一半人担心自己的工作,另一半人则觊觎晋升,这听起来很像 AI 或变革管理。在某些情况下,校准语气、时机和透明度,而正确的话语取决于模型无法观察到的动态。我们实际上没有能够很好地解决这部分问题的模型。模型甚至不打算可靠地处理这个问题。而这使得管理和领导力真正困难的很大一部分。坦率地说,这使得成为一个优秀的资深个人贡献者也很困难,因为无论你进入商业领域有多远,都无法摆脱这种情商问题。判断力和意志力问题。决定放弃你的团队花了六个月时间构建的项目,因为市场信号发生了变化。拒绝一个与你公司价值观不符的利润丰厚的客户。选择在数据支持但高管团队不想听的情况下,在政治上危险但战略上正确的道路。做出不受欢迎的决定,承担职业风险。这些不是真正的推理问题。任何有能力的分析师都会阐明逻辑。那是勇气问题。那是身份问题,它们几乎完全无法通过 AI 解决,因为瓶颈不在于计算正确的答案。而在于有勇气去执行它。这是一个人类的挑战。领域专业知识问题。资深工程师调试速度更快,不是因为他们比初级工程师推理能力更好。他们调试速度更快,是因为他们见过完全相同的堆栈跟踪。他们知道库的未公开的怪癖,并且他们还记得 2019 年发生的生产事件,其根本原因完全相同。一位经验丰富的并购律师评估交易更好,不是因为他更聪明。他评估得更好,是因为他已经完成了 300 笔交易,并且他已经内化了哪些陈述和保证实际上会被起诉,哪些只是没有人执行的模板。这是经验和模式识别。通过多年的重复积累的知识。这并非真正的新颖推理。模型通过训练数据在模拟领域专业知识方面正在变得更好,但“读过它”和“在法庭上经历过它”之间的差距仍然非常真实,尤其是在出版文献稀少的领域。这是最后一个。模糊性问题。在市场信号矛盾时决定构建什么。当对客户数据的三种可能解释都存在时,并且每种解释都导致不同的产品路线图,从而定义策略。弄清楚客户真正想要什么,当他们自己无法表达时。他们说他们想要更好的报告,但他们实际上是想让他们老板停止质疑他们的数字。这里的难点不在于计算答案。难点在于弄清楚问题到底是什么。这是产品感觉、战略直觉以及在一种模型解决之前同时保持多个不完整心智模型的能力的领域。模型可以帮助探索这里的选项,但它们无法解决模糊性,因为它是不可计算的模糊性。现在,这是关键部分,看看我刚才描述的六种不同类型的问题,并问自己,纯粹推理的显著改进实际上有助于解决其中的哪些问题?诚实点。推理有助于解决推理问题。这很明显。Gemini Deep Think 的结果是推理轴的纯粹胜利。它们是极有价值的问题,因为在药物发现中的一个见解可以价值数十亿美元。材料科学的突破可以重塑整个行业。一个新颖的证明可以开启一个全新的数学分支。这些问题是我们人类从事的一些价值最高的问题。所以,并不是说谷歌没有解决有价值的问题,但我们应该问它们是否解决了日常工作中使用的那些问题。现在,公平地说,纯粹的推理问题确实存在于主流业务中。它们只是比人们通常认为的更少见,也更专业化。我认为我们有时认为很多业务都是推理,因为我们喜欢奉承自己。事实并非如此。这里有一些在商业中真实存在的推理问题的例子。多司法管辖区税务优化是一个真正的推理问题的例子。例如 12 个国家的税法都是已知的输入。问题定义得非常清楚,但它们之间的相互作用效应在数学上创造了一个组合空间,确实很难推理。复杂的衍生品定价是另一个。新颖的监管合规也是如此。不是阅读这 3000 份合同。那是努力问题。但是,这个新的金融工具是否会同时触发例如多德-弗兰克法案、巴塞尔协议 III 以及香港 SFC 的更新指南下的报告义务?这是跨相互作用规则系统的多步逻辑推理。而 Gemini 3.1 Pro 在高模式下可以很好地处理这类问题。结构性欺诈检测,不是机器学习模式分类,而是追踪七笔交易跨四个实体的链条,并推理结构是否暗示了分层资金流动。这是一个推理问题。但我希望你注意到我描述的这些模式。这些商业推理问题集中在专门的量化领域,这些领域看起来比你我所做的许多知识工作更像应用科学。你注意到其中没有编码吗?而且至关重要的是,从事这项工作的人们大部分时间都花在推理之外的一切事情上。税务律师每周可能只花 10% 的时间处理真正的多司法管辖区互动难题,而 90% 的时间用于客户管理、文件收集、与当地律师协调、处理客户实际想要实现的目标的模糊性等等。供应链总监最困难的问题不是多约束优化路径。实际上是在数学开始之前,让三个不同的副总裁就需求预测达成一致。在每种情况下,推理部分是真实的,并且价值很高,但它嵌入在一个更大的努力、协调、模糊性类型的工作中,这意味着一个为纯粹推理优化的模型是一个帮助这些角色中最具智力挑战性的 10% 的工具。但是一个为工具和持续工作优化的模型则有助于解决其他 90%。对于大多数知识工作者来说,在大多数日子里,对我们大多数人来说,我们面临的问题在努力方面是困难的。在协调方面是困难的。在情商方面是困难的。在模糊性方面是困难的。在领域专业知识方面是困难的。但纯粹的推理部分,那是一个非常狭窄的切片。我没有一个精确的数字,而且我非常怀疑任何声称拥有这个数字的人,但我知道这一点。当我审视我自己的工作时,当有人说“我需要更深入地思考这个问题”的时刻,远远多于有人说“我需要与 20 个人协调这件事”或“我需要完成所有这些”或“我需要弄清楚我们到底想做什么”或“我们需要达成一致”的时刻。这就是为什么我认为 Opus 4.6 最终会在办公室获得更多的日常使用。而且我认为谷歌可以接受这一点。谷歌当然希望你使用 Gemini,他们并非漠不关心。他们有一个云业务要发展,还有一个他们希望培育的生态系统。但他们的人工智能研究计划并不依赖于赢得你的日常工作,就像 Anthropic 那样。谷歌正在争夺一个需要深度新颖推理的问题出现的周期性时刻。而在那一刻,他们希望成为最好的,并且希望成为最便宜的。他们还在为科学前沿定位,那里的纯粹推理问题密集,回报以诺贝尔奖和万亿美元产业来衡量,而谷歌从 TPU 芯片到 Deep Mind 研究的垂直堆栈给了他们无人能及的管道。其余时间,你可能会使用 Claude 或 Chat GPT,而谷歌将销售一些模型运行所需的 TPU。那么,这对我们明天意味着什么?这里是它真正适用于工作的地方。我想强调三点。第一,停止看基准测试,开始关注你所在领域的牵引力。我以前说过停止看基准测试。我的意思是牵引力。对你来说重要的是哪个模型最可靠地处理你特定工作流程中的特定任务,而这才是最重要的,你应该成为这方面的专家。你是你所在领域中最了解哪个 AI 模型为你处理哪种测试类型的人吗?因为你应该成为这样的人,因为“我为一切都使用 Chat GPT”和“嘿,我将财务建模路由到 Gemini 的高思考模式,将编码路由到 Claude Code,将快速研究路由到 Gemini Flash,并使用 Opus 进行深度文档分析”之间的差距,就是商品化使用和实际杠杆之间的区别。模型在这一点上已经足够分化,以至于模型路由本身就是一项技能,而且没有人会为你所在的领域和你的业务构建这个路由层,除了你自己。心血管外科医生将以不同于供应链分析师的方式路由,是的,他们将使用 AI,而创意总监的路由方式也将不同。任务到模型的映射非常特定于领域。而且随着模型的不断改进,这种实际知识每周都在积累。你应该成为专家。是的,我将准备一些指南,我会在 Substack 上发布,以帮助你实现这一点。第二,开始区分你工作中困难的维度。你的世界中哪些真正受推理的瓶颈?哪些受努力、协调或情商的瓶颈?受领域专业知识、模糊性,或者我还没有命名的东西的瓶颈?也许是政治风险、监管不确定性或人才稀缺性。这种问题分解很重要,因为每个维度都在非常不同的时间线上,以不同的速率,由不同的工具进行自动化。纯粹的推理问题现在正在变得越来越容易解决。这就是 ARC AGI2 分数在 3 个月内翻倍的意义。但努力问题正在以不同的方式被自动化。它们正在被代理模型自动化,这些模型可以持续工作数小时或数天。想想 Opus 4.6 或 Codex 5.3 编码问题。协调问题开始通过代理团队和工具增强的编排来解决。领域专业知识正在缓慢地被吸收到训练数据中。尽管“我实际上做过”和“我只是想过它”之间的差距仍然是真实的。我们发现这就是为什么我们需要一些非常优秀的工程师和非常优秀的员工,他们在基层拥有真实的实践经验,并且处于高级别。情商、判断力、模糊性、勇气,这些都不是 AI 今天能解决的问题。这些将是最后被解决的维度,如果会被解决的话。这就是你的工作地图的重要性。如果你知道你的大部分价值来自于 AI 没有自动化的轴,坦率地说,你可以睡得更安稳,但你也应该更聪明地分配 AI 到那些可处理的部分。如果你发现你的大部分价值来自于推理轴或努力轴,你需要有意识地转向人类判断占主导地位的维度,并且你需要非常擅长将你的工作路由到擅长推理或擅长数小时或数天持续工作的工具。如果你觉得,“我不知道,我该怎么做?”我会为你准备一个可提示的指南。但如果你不思考,不参与,不将你的工作分解成这种困难类型,你就无法预测你的价值的哪些部分是持久的,哪些正在消解。我希望模型制作者能够诚实地谈论他们的模型擅长什么和不擅长什么,从而让事情变得更容易,但现在我们大多看到他们吹嘘基准分数。你就会觉得它们变得越来越聪明,然后你就会感到困惑,并想知道,如果 Gemini 3.1 Pro 是世界上最好的,为什么它不擅长管理代理团队?因为那是另一种智能,坦率地说,它们没有为此进行优化。第三项任务,培养品味,是的,评估 AI 输出在你所在领域的能力是一项可培养的技能。每一次模型改进都使这个问题对你来说更加紧迫,而不是不那么紧迫。当 Opus 可以持续自主编码数周,而 Gemini 可以推理出新颖的逻辑问题时,问题不再是 AI 能否做到。越来越大的问题是你是否能判断 AI 生成的东西是否真的好。Lisa Carbone 是罗格斯大学的一位数学家,她使用 Gemini Deep Think 来审查一篇高度技术性的数学论文,它发现了一个微妙的逻辑缺陷,而这个缺陷已经通过了人类同行评审。看,这对模型来说非常令人印象深刻。但请注意这对 Carbone 的要求。判断哪篇论文需要审查,专业知识来评估模型发现是否正确,以及领域权威来根据结果采取行动。模型确实发现了缺陷。人类必须验证它并给模型分配任务。这两个步骤都是必需的。任何一个单独的步骤都不够。那种判断力,能够查看财务模型并知道假设是错误的,能够阅读法律分析并发现缺失的先例,这是一项持续积累的技能。其他所有技能都在变得更便宜。但这一项,这一项变得更有价值,因为模型在生成看起来非常合理但需要真正专业知识才能深入研究和检查的输出方面越来越好。所以,是的,虽然我正在准备一些指南来帮助你深入研究,但我想强调你并不一定需要我的指南。重点是你自己的工作和你的思考。你需要工作。你需要做应用任何你获得的材料的工作,我的指南,其他东西,YouTube,来弄清楚你世界中真正好的 AI 输出是什么。所以,是的,我正在构建更深入地探讨按领域进行模型路由的指南,更深入地探讨问题轴映射的指南,因为我希望这更容易,而且我在其他地方没有看到它们。但将其应用于你世界的这项工作,那是你的工作。那一直是你的工作,而且没有替代品,而且它现在非常有价值。我想退后一步,看看谷歌在这里的静默游戏。AI 的故事有一个版本是关于速度的,是关于市场份额的,谁发布得最快,谁赢得企业市场,谁达到十亿用户。这就是 OpenAI 和 Anthropic 所过的生活。这是一个重要的故事。他们正在构建的产品一直在改变我们的工作和生活方式。但 AI 的故事还有另一个版本,那就是一个拥有每年千亿美元现金流支持的公司,运行在自己设计和制造的专有芯片上,雇佣了一个获得诺贝尔奖的团队,并且由一位 CEO 领导,他早在其他人认真对待 AI 之前就一直在说“解决智能”。这家公司并不试图赢得产品竞赛。这家公司是谷歌,他们认为产品竞赛有点像一场旁观。主赛事是智能本身。如果你解决了智能,产品就会自行解决。Gemini 3.1 Pro 最终是这条路上的一个标志。它是唯一一家拥有基础设施可以无限期地推动推理前沿的公司,在规模上以最低的价格提供的最纯粹的推理模型。它不会是这个月使用最多的模型。Claude 将处理更多的日常任务。我认为 Chat GPT 在很长一段时间内可能会拥有更多的日常活跃用户。谷歌宁愿情况有所不同,但他们可以负担得起非常有耐心,因为他们正在构建事物之下的事物。那个推翻猜想的引擎,那个发现药物结合位点的引擎,那个发现同行评审论文中错误的引擎,以及那个推动机器为你思考的界限的引擎。实际的收获不是使用哪个模型。许多其他 YouTube 视频会告诉你。我不是来告诉你的。而是模型格局已经足够清晰地分化了,关于我应该使用哪个 AI 的问题,这实际上已经成为错误的问题。正确的问题是,我应该为哪个问题使用哪个 AI?我甚至如何知道我正在解决哪种类型的问题?是推理问题吗?是努力问题吗?是协调问题吗?是模糊性问题吗?每一种都有不同的最佳工具,不同的自动化时间线,以及对你的职业生涯不同的影响。具体化。构建一个你所在领域的地图,以及哪些问题是 AI 可处理的,使用哪些模型,因为工具现在已经足够具体,可以奖励这一点。并且那些能够很好地路由它们的人将远远超过那些对一切都使用一个模型的人。而且这个差距每个月都会扩大。你看,人工智能竞赛的迷雾依然浓厚。很难获得信号,但我们能看到足够多的东西。我们知道为工作路由模型是有区别的。所以,让我们不要把它复杂化。让我们不要坐在那里,为 Gemini 3.1 Pro 是否是最好的而烦恼,我必须把所有东西都切换到它。这是错误的问题。只问我面临的是什么类型的问题?我需要为这种类型的问题使用前沿模型吗?顺便说一句,有些模型,特别是努力问题,它们甚至不需要前沿模型。你可以使用一个笨拙的模型来解决它,这完全没问题。未来的一项重要技能将是学习何时需要智能模型,何时不需要。所以,这就是 Gemini 3.1 Pro。它确实是地球上最智能的模型,而且我认为谷歌并不太在意你明天是否在工作中是否使用它。眼泪。