📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

The Post-Coding Era: What Happens When AI Writes the System?

Delphina41:45

Transcription

我们正在实时看到的是一种转变,从我认为可以称之为“协同驾驶”转变为“代理式”模式,即使是在谷歌内部非常具有挑战性、复杂的软件工程工作中,谷歌拥有一个拥有极其复杂依赖关系的庞大代码库。你开始看到一种模型,你可以将其视为一个代理,对我来说,代理的区别在于,我将工作分配给这个东西,而我真的不会去监视它,这与代码驾驶的范式截然不同,因为基本上,当代理完成工作时,你需要付出成本来吸收或下载代理完成状态的信息,甚至理解它试图做什么,然后如何纠正它所做的事情。这是尼古拉斯·莫伊(Nicholas Moy)的观点,他曾是 Windsurf 的研究主管,现任职于 Google DeepMind,他谈到了从人工智能协同驾驶到真正代理式软件开发时代的转变。对于那些走在使用和/或构建人工智能辅助编码系统的最前沿的人来说,这样的观点可能有些显而易见,但世界已经分化。许多人仍然在最大化利用人工智能代码补全,而没有意识到像 Google anti-gravity 这样的工具甚至可以抽象掉你的编码环境。你的人工智能代理可以离开,花费几十分钟来构建软件,而你的工作则是在审查人工智能的拉取请求之外,专注于软件系统和产品。愿你生活在有趣的时代。在本期节目中,尼克·邓肯和我探讨了在人工智能驱动的编码前沿进行构建所需的工程纪律。我们讨论了 Windinsurf 的历程以及通过自我颠覆来避免创新者困境的战略必要性。尼克分享了他通过关注他所说的“信息不变性”来构建弹性软件的框架。这些是核心数据需求,即使底层模型呈指数级改进,它们仍然保持不变。我们深入探讨了代理式范式的技术挑战,包括代理式失败的双重惩罚,以及为什么主要的开发人员界面正从 IDE 转向以审查为中心的流程。我们还涵盖了捕获模糊人类数据的独特价值以及通过“炫耀”未来能力来保持在下一个前沿模型检查点之前的策略。这是一次非常有趣的对话,关于最复杂的团队如何从实时助手过渡到自主代理。如果您喜欢这些对话,请给我们留下评论,给我们五星好评,订阅我们的新闻通讯,并与您的朋友分享。链接在节目笔记中。我是 Hugo Bound Anderson,欢迎来到 High Signal。让我们开始吧。你好,尼克,欢迎来到节目。>> 谢谢你邀请我。>> 很高兴你来到这里。你一直在研究和思考很多事情,我认为我对此感到非常兴奋,但我们的听众也会非常感兴趣,尤其是你构建 Windsurf 的经历,以及你现在在 Demmind 所做的一切。所以,我想知道你是否能带我们回顾一下构建 Windsurf 的历程,从最初的愿景是什么,以及随着今年模型开发、前沿模型开发发生巨大变化,你不得不如何进行调整和发展。是的,在过去的三年里,这真是一段过山车般的经历,我很乐意从头开始。我将带你们回到过去。想象一个在 GPT 3.5 之前的时代。人工智能,人工智能的顶尖技术只是自动补全。就像输入一个词,然后它会完成你的句子,这已经感觉像魔法了,而我就是在这个环境中加入 Windsurf(当时称为 Kodium)成为一名早期工程师的。当时,我刚加入不久,我们就原型化了,我们正在尝试后来变得非常流行的概念,即编码代理,它将代表你执行多个步骤并进行非常大的更改,但当时正如你所想象的,这只会导致错误累积,它总是会偏离正确的方向,或者过早停止,或者其他什么。我记得我们会定期回去,我们会用 GBT4,最初的 GPT4,不是 40,也不是其他任何检查点,再次尝试,但仍然不对。所以,基本上,我们的决定是,我们应该尝试发布一些有用的东西,而不是仅仅等待我们梦想中的事情发生的未来。所以,我们专注于自动补全产品。我们试图让自动补全变得非常出色。说实话,我们当时正试图与一个非常强大的竞争对手 Copilot 抗衡,并真正强调我们能够控制的、除了模型之外的功能,例如本地托管、大量的投资,以及诸如专用上下文和上下文检索以及上下文工程。我认为我们一直梦想着何时才能回到那个未来愿景。所以,我认为这可能并不独特。很多人可能同时在做这件事,但我认为我们可能是最早最终发布代理编码产品和功能的公司之一,那就是 Windsurf,那是在去年的 10 月底或 11 月初,2024 年,它取得了惊人的成功。我认为这超出了我们的预期。我记得我们发布的时候,我和妻子去新墨西哥州度周末,我试图关闭通知,然后我收到了 Anthropic 的电子邮件提醒,关于我们的账单,每花费一千美元我们就会收到一张账单,我可以看到我的收件箱里有一条指数增长的曲线,因为我会在一天中收到越来越多的提示。发布非常顺利,然后我们立即提出的问题是:之后我们还能做什么?我认为我们之后设定的一个重要目标是:好吧,我们拥有这个,我们相对于模型公司拥有这个独特的优势,那就是我们拥有真实的用法数据。我们能展示数据飞轮吗?我们能证明或做一个概念验证,表明从真实用户与模型在真实问题场景中进行交互中可以获得真正有价值的东西吗?所以,我们着手训练我们自己的模型。我认为我们再次发布了一个由代理实验室公司生产的顶尖模型,那是在五月份,我认为自那以后,许多其他代理实验室公司也纷纷效仿,但这相当于 Cloud 3.5 的水平,当时我认为 Cloud 3.7 是顶尖的,所以那是去年的五月份。然后,从去年夏天开始,基本上,核心研究和开发团队的大部分都加入了 Google DeepMind,这就是我们现在所在的地方,我所在的地方,我们正在努力让 Gemini 在软件工程师用例方面感觉更好。听到这个真是太棒了,尼克。在这个领域建立一家初创公司意味着你的技术几乎一夜之间就会被竞争对手超越,我认为这几乎造成了一种创新者困境,你必须不断地重新发明自己,正如你所指出的。有没有一个特定的时刻或特定的模型发布让你意识到:“哇,这现在必须改变了?”>> 是的。是的。是的,我想是的。我记得那天非常清楚。所以,正如我所说,我们一直在构建自动补全业务,并试图销售并获得该业务的采用,我们一直在梦想着下一步是什么?因为我认为也许避免互联网入侵者困境的一个关键方法是,你不把自己看作是今天让你赚大钱的东西。如果你一直认为自己不是那个标签自动补全公司,而是人工智能驱动的软件生成公司。你总是对下一步感到不耐烦。所以,我们一直在后台有一个代理式编码框架原型,它一直在“烹饪”,我们正在测试很多东西。我记得有一天,我们终于意识到,我们一直在听到关于 Cloud 的一些好消息,让我们把它接入我们的系统中,除了其他什么都不改变。字面上就是能够从 Cloud API 中采样。我们觉得这个东西已经准备好了,基本上,我认为我们一个月后就发布了 Winers。这就是我们一直在等待的那种时刻。所以,在某种程度上,这几乎就像准备好颠覆自己,然后机会到来时,你就准备好了。这实际上非常重要,因为我们与 Lance Martin(来自 Langchain)有过一次关于这个话题的谈话。他确保人们也理解这一点,那就是我们正处于这样一个阶段,如果你有一个想法,而你的产品似乎不起作用,明天可能会有一个模型发布,让它能够工作。这似乎是相对的,当然技术变革可以使新想法成为可能,但历史上它并没有以这种节奏或新模型的发布来实现。>> 是的,绝对是。事实上,我想说这只有一年时间,但我觉得有意义的新模型发布的步伐,在能力上比前一个模型有显著的提升,实际上已经加速了。所以,等待的时间甚至更短了。我认为我们等待了大约一年,模型才跟上足够好的水平。但我认为现在,如果你对未来有一个愿景,而你现在还没有,那么很有可能在两三个月后,一个曾经毫无意义的产品功能突然就会变得非常有意义。>> 邓肯有一个关于开发者在工程和产品挑战方面非常有趣的问题。但在那之前,我想问一下,这对可防御的护城河的概念意味着什么,以及你在 Windsurf 时是如何考虑的?似乎护城河的挑战越来越大。是的,这并不容易。我想说的是,我以前在金融领域工作过,我实际上经常想到这一点。管理一家初创公司就像管理一个投资组合。我认为,就像任何投资组合一样,你自己决定你的风险回报状况。但然后你需要平衡你所做的投资组合,短期、长期的本地产品功能,让你自己对未来具有鲁棒性。不同的公司将采取不同的策略来应对这个问题。在我们这个时代,有许多公司基本上选择了“我们就是要走到终点线”。我们要么构建一个只有当代理能够独立运行数小时时才有意义的东西,要么我们实际上要直接训练一个基础模型,我们认为这将是一个护城河。我认为我们采取了一种更谨慎的方法,那就是“我们要为今天而建”,因为这样做有很多好处,你可以获得用户基础的采用、品牌认知度,以及最重要的是,对前沿是什么,你的客户想要什么,他们想从你那里做什么有一个非常强的直觉,而这令人惊讶地有价值和有趣。我认为,现在你看到的许多最强大的 AI 公司,比如 Cursor,它们在很大程度上都依赖于此,并且保持警惕。它们可能比任何人都领先一步,更不用说它们还建立了声誉,建立了招聘渠道,当你有产品在市场上时,你可以反馈给你的投资者、客户、潜在的招聘对象、现有的招聘对象,很多事情都会变得容易。所以,这就是我们采取的策略,我认为它对我们非常有效。我认为这可能是我个人的偏见,但我想说,如果我是一家初创公司,并且我正在想象未来,那就是你可以永远尝试为自己设计一个技术护城河或某种长期的防御性护城河。但我会说,几乎从来都不是一个坏主意去尝试将一些东西推向市场并吸引真实用户,尤其是如果你相信那不是你强行推出的功能。你认为它是一个好功能。你认为它将有意义地告诉你事情将走向何方。将其推向市场并让人们真正开始认识你非常有价值。我不知道这是否是一个令人满意的答案。对于任何人工智能驱动的应用程序初创公司来说,现在的情况都非常棘手,但我认为有很多公司似乎能够利用这种领先优势来持续保持领先地位,并随着时间的推移持续建立企业价值,时间会证明一切。尼克,你认为在人工智能时代,公开构建的价值是否发生了变化,就像你所说的,你需要不断地谈论你正在做什么,并对此保持透明,以便创造飞轮?>> 是的,我想是的。我一直在思考的一个想法是,人工智能是如此的“正和”,而且它非常奇怪,在一个你今天面前的任何市场机会,你几乎可以肯定它明年会至少翻两到四倍,仅仅因为这些东西会变得更有能力。所以,没有一个想法是如此珍贵,以至于你必须如此保护和保密,因为还有下一轮比赛。所以,在这种环境中,我认为快速行动、尽早发布一些东西、看看它是否引起共鸣、看看它是否真的有效,会带来不对称的回报。这导致了许多团队公开发布产品,而且更容易实现“这里有一个顿悟”。它可能比许多常见用例更小众,但现在发布一些对某些人来说非常有用的东西要容易得多。在某些方面,我觉得这实际上是一种非常有帮助的方式来启动飞轮。我认为 Anthropic 是一个很好的例子,它在公开构建、内部试用,同时也极大地帮助了社区。我认为在数据之外,护城河是什么尚不清楚,切换成本对我们所有人来说都非常低。实际的社区建设和善意以及帮助人们回归了非常重要的事情。>> 是的,而且我认为,声誉方面也是如此。我认为,有那份 HR Star 报告,Anthropic 的人员保留率是最高的。我认为,当你真正代表某事时,你真正代表,你有一个价值体系,它非常清晰,也许你会疏远一部分人,我不知道,但对于那些与你产生共鸣的人来说,这又是创造忠诚度的一种方式。我们还没有谈论过拥有人才的重要性,但在这个领域吸引人才非常困难。也许这是你创造护城河的另一种方式,那就是你能够拥有一群真正的人。我认为 Brian Chesky 用过这个词,“传教士而不是雇佣兵”,他们是真正为你的事业而奋斗的传教士,他们真正相信公司的使命、文化或价值观。我认为这在一些公司,比如 Anthropic,以及其他一些公司身上是显而易见的,它们就是它们所说的样子,我认为这随着时间的推移会为它们带来回报。>> 这太棒了。让我们稍微换个话题,我很想更多地谈谈产品和工程方面,特别是当你构建一个由人工智能驱动的助手时,你如何思考最重要产品工程挑战,以及你从中吸取了什么可能令人惊讶的教训。是的,我不知道是否令人惊讶,有很多教训,但我认为对我来说最新颖的挑战是,如何在六个月后编写仍然有用的软件,而产品可能完全不同。比如,你如何避免编写一个功能,然后在三个月后就把它丢掉,因为你的人工智能比以前更有能力了。我认为我为 Windsurf 感到非常自豪的一点是,在过去的 18 个月里,我们的大部分核心代理框架基本保持不变。这甚至可以追溯到我认为“代理”这个词在产品开发中还没有被真正使用的时候。我甚至不认为我们当时有这个词。我们用另一个词来形容它。但我们当时的数据表示,我们组织循环的方式,我们映射它们的方式,我甚至不认为当时 API 中有工具调用。我们将其映射到功能的方式,以及数据飞轮——评估基础设施、训练基础设施、数据处理基础设施——我认为有趣的一点是,在不知不觉中,我们 18 个月前就兼容多步 RL 了,而当时这只是在一些前沿人工智能实验室中被探索的一个词,而且是以非常实验性的方式。所以,你如何做到这一点?这可能有点运气,也可能有点洞察力。我认为,你必须非常密切地关注你想去的地方,以及你想去的方向的不变性。那么,你试图解决的问题的不变性是什么?我认为我们过去思考这个问题的方式是,如果我们展望未来 10、15、20 年,我们最终希望人工智能能够完成什么工作,以及完成这项工作将始终不变的是什么。例如,常见的不可变性是信息不变性。除非你拥有这种信息来源,否则根本无法完成这项任务,或者输出不变性——最终你需要产生工作,而这项工作将始终采取这种形式。在这个行业里,它看起来就是这样。所以,你对这些可以投资于三年期的事情有一些了解,然后几乎任何其他事情,你都必须将其视为可能需要全部丢弃,我认为这是一个微妙的平衡,而且知道区别非常困难。我认为很多事情事后看来,我们做出了错误的决定,但总的来说,你是否能够持续地做出好的决策,关于两年后会是什么,以及你应该等待什么,并投资多少?我认为这非常具有挑战性,如果你能做对,回报也非常丰厚。>> 非常有趣。我对开发者使用人工智能的差异或变异性非常感兴趣。几年前,我们很多人都从 IDE 复制粘贴到 ChatGPT,或者其他任何东西,有时还会截取屏幕截图,当然,其中一个笑话是它对很多 API 都很好,但对自己本身的 API 却不太好。我仍然认识这样做的人,对吧?然后我们有了自动补全,现在当然我们有了嵌入在 IDE 中的代理,它们正在编写代码。我们也有嵌入在 CI/CD 中的代理,以及环境和后台代理的兴起。所以,我们可以使用这些神奇的东西有很多层面。我想知道你如何看待用户行为从“氛围编码”演变为我们现在称之为“代理式软件工程”的模式。>> 是的。所以我确实认为,我们正在实时看到的是一种转变,从我认为可以称之为“协同驾驶”转变为“代理式”。我认为协同驾驶意味着我仍然在做,你在做,但我基本上在关注你打开的文件或你脑海中的想法,你所做的编辑。实时地,我可能需要进行方向修正,然后是稍微不那么实时。也许每 3 分钟我需要纠正你或重新提示你,或者其他什么。这就是我们目前所处的状态。我认为,如果你与两年前相比,那简直是天壤之别,如果以前真的是我在开车,而你偶尔会进行自动补全,将我拉回正确的方向,但我现在很清楚,即使对于非常具有挑战性的工作,即使是在谷歌内部非常具有挑战性、复杂的软件工程工作中,谷歌拥有一个拥有极其复杂依赖关系的庞大代码库,你开始看到一种模型,你可以真正地将其视为一个代理,对我来说,代理的区别在于,我将工作分配给它,而我真的不会去监视它。这与协同驾驶的范式截然不同,因为基本上,当代理完成工作时,你需要付出成本来吸收或下载代理完成状态的信息,甚至理解。所以,分配工作给代理需要更多的信任,因为如果代理做错了什么,你基本上要付出双倍的惩罚,因为你必须理解它试图做什么,然后如何纠正它所做的事情,而且几乎不值得付出努力。我认为,模型正刚刚达到智能水平,可以使这种情况真正成为常态,你可以信任它们能够更频繁地做得差不多对。更重要的是,你还可以信任它们来解释它们的工作并逐步讲解它们的工作,从而降低你理解它们所做事情的成本。就像一个相当不错的工程师会写一个漂亮有用的 PR 描述,附带指针和截图,记录他们所做的事情一样。我认为现在很多产品都看到了这种自我解释,这极大地有助于代理模式。所以,这个障碍正在真正地降低。模型正在变得更聪明。你真的会开始看到人们将它们视为我将启动并稍后回来查看的东西,也许一个小时后,或者在不久的将来,几天后。>> 它们变得越来越聪明,我很高兴被纠正。今年早些时候,我不太看好模型进行无指导或较少监督的代理式工作,尤其是在过去六个月里,像上个月的 Gemini 3 等模型,恭喜你发布了 Flash,但即使是新模型正确执行一系列工具调用和规划工具调用的能力,也让我非常印象深刻和惊讶。我正在思考,我并不是要求你预测未来。话虽如此,我们确实在机器学习领域工作,但一种可能的轨迹是,我们很快甚至不需要阅读很多代码,对吧?我们查看拉取请求,也许还有一些仪表板和代理编写的描述,当然,对于高风险的事情,你希望确保有人工审查。但我只是想知道你对未来演变的看法。是的,我认为拉取请求是一个很好的类比,我认为这将在可预见的未来,越来越多地成为你与代理式工作互动和监督的主要界面,这可能是好是坏,取决于许多工程师可能会感到沮丧。在这个领域,存在一个相当宽的范围。再次,如果你谈论的是,如果我给一个非常有经验的工程师做评审,我可能甚至不会仔细看代码,但也许现在代理还没有达到一个非常有经验的工程师的水平。我会更仔细地看,但它们已经在那个范围内了。>> 而且你也不会在编辑器里看,对吧?我认为我们仍然像是代理和编辑器。我(清嗓子)认为这个范式可能会大大改变。>> 你说得完全正确。我认为这是 anti-gravity 的一个重要部分,我们刚刚发布的产品,它的核心是这种代理管理器模式,你根本看不到编辑器。你只看到模型选择呈现给你的、用于突出或总结其工作的自我呈现的工件。重要的是,我认为这是我为验证这项工作所采取的步骤。这是我测试 UI 的屏幕录像,或者这是一个带有日志的单元测试,指向我运行单元测试并确认该东西有效的一个指针。我认为,越来越多地,这将是大部分审查发生的地方,而你只会在怀疑有什么不对劲时才双击。我们之前稍微谈到了数据飞轮和收集更多客户反馈的必要性,但我想从战略角度更深入地探讨一下,它不仅能让你今天更快地发展,而且你如何考虑将数据飞轮构建到任何给定的人工智能产品中,以便你能够更快地发展,更快地学习,也许训练你自己的模型或微调模型。我想了解你是如何看待这一点的,以及你认为它未来可能会如何发展。>> 是的,我认为关于这个的计算正在实时演变。在我们开始的时候,没有初创公司能够可信地为我们预期的任务提供现实的环境的训练数据。我认为在那个世界里,很清楚,即使没有其他,我们也可以基本上产生大量的数量,然后将其授权或商业化,我认为其中一些——我们从未这样做过,但许多 IDE 公司基本上都这样做了。我认为这种情况正在改变,我认为对于任何人工智能产品公司来说,你必须非常清晰地认识到,你认为你的数据有什么特别之处,以至于一个非常积极的、刚刚从 Y Combinator 出来的初创公司将难以在合成 RL 环境中复制,而这种环境可以卖给这些实验室,并最终被吸收到这些前沿模型中,你的优势就消失了。我认为,很可能有一些非常有价值的东西。我认为一个非常持久的例子是像 Tab 这样的东西,它知道何时以及何时不显示建议,这是非常微妙的。这是一种非常人类反馈式的、非常难以合成生成的数据。我认为,真实的使用数据是捕捉这种非常柔软、模糊分布的一种很好的方式。我认为这甚至可能更加极端,我认为在未来,这是一种预测,但未来你会看到更多的模型个性化,一般来说,每个用户的模型个性化。我认为这基本上是不可能的,你确实需要数据飞轮,而这是应用程序公司直接面向用户的一种方式,它们处于有利地位,可以为它们的客户提供这种价值,而实验室公司无法直接提供这种价值。但总之,长话短说,我认为这是可能的。我认为事实上,几乎可以肯定,任何产品公司都有一些关于你的数据的东西。但如果你必须,你必须小心它是什么,不要试图过度推销或过度承诺你能够差异化提供什么,而不是合成数据,因为你必须记住,合成数据可以大规模生产。它非常干净,它做的正是你所说的,而这必须以有意义的战略方式来抵消你收集的数据。我认为。>> 所以,我们一直在讨论成本和经济学,以及构建在顶尖模型之上的经济学,当然,每 token 的成本非常实惠,对吧?任何人都可以不必训练模型,而是 ping 一个 API 来构建原型,这真是太疯狂和美妙了。话虽如此,随着产品的扩展,成本可能会急剧增加,而且只有少数几个提供商。我想知道创始人应该如何考虑在核心人工智能方面进行构建还是购买,以及考虑成本?>> 是的,这是一个非常重要的问题,而且相当困难,因为如果你堆叠了所有在这个价值链中提供价值的公司,对吧?硬件层、云提供商,然后是建立在云提供商之上的模型公司,然后是你。每家公司都在试图建立利润。在成本方面,你将处于结构性劣势,相对于能够垂直整合的另一家公司。我认为你可能看到一些像 Cloud Code 与 Cursor 竞争的情况,这并不容易。我认为这就是为什么 Cursor,例如,他们试图训练自己的模型,而这与我们在 Winer 所做的原因相同,我们非常专注于我们能否训练出我们自己的模型,它实际上是体面的,对于我们能够为用户提供的任务来说相当好,以提供最大的价值和日常驱动的用法,让用户仍然觉得他们可以从我们的产品中获得价值,而我们并没有仅仅赠送大量的 API 积分,或者反过来,在订阅收入之外损失数十亿美元的 API 成本。所以,我认为,特别是如果你处于一个使用量很大、用户喜欢使用你的产品的用户群,并且有一条路径,这不是一件容易的事,但有一条路径可以让你发展出训练自己模型的专业知识。能够做到这一点总是很有意义的。同时,我越来越认为,相信仅仅更小、更快或更便宜就能真正满足你的用户,下次出现一个比上一个智能两倍的新模型时,将是困难的。所以,最终,我认为这些公司将处于一个他们总是必须构建的位置,他们将试图构建自己的模型。同时,他们将不得不构建具有最先进能力的功能,否则,你就有可能错过下一个前沿,即使你无法以正确的成本用自己的模型来服务它。我认为你将不得不这样做,因为最先进的模型正在迅速发展,而且我认为,除非是非常小众、非常狭窄的用例,否则匹配定制微调模型的性能只会变得越来越难。>> 是的,这很有道理。话虽如此,当然,性能与成本比现在非常有趣。实际上,我将链接到 Tomas Tunglers 在 Theory Ventures 的一篇帖子,他最近在我们播客上做客过。他实际上在几天前发表了一篇关于 Gemini 3 Flash 的成本和性能的精彩帖子。成本性能比令人震惊,与目前市面上的任何其他模型相比,它的价格非常便宜。是的,这是一个极其出色的模型。而且不仅如此,它还是一种“快即好”的咒语,它是一个令人愉悦的模型,特别是如果你想做一些不需要四小时思考或类似的事情。就像经典的、最初的 Windsor 编码任务一样。我喜欢用 Flash 来处理那个模型。但我只是在设想一个世界,在那里你习惯于使用 Cloud Code 和 Opus,它能够为你启动 Kubernetes 部署,为你进行调试,分析日志,找出问题所在并修复它,然后重新部署。很难将那种感觉与“我可以完成所有这些步骤,而人工智能正在帮助我将所有这些步骤的速度提高一倍”的感觉进行比较。我认为这是我不太确定这在未来会如何发展,以及这种差距是否总是会感觉像是真正的最先进技术和经济的价格性能之间的差距,但我确实觉得模型大小和相应的模型成本的这种差异,用户十次有十次会用脚投票,他们倾向于喜欢它,如果他们能得到的话。>> 这很有道理,但我对我们很多人在工作流程中的选择很感兴趣,我敢肯定你们两位也是如此,我们会根据我们正在做的事情来选择模型。另外,当我构建东西时,>> 是的 >> 计划,我会使用一个更强大的模型进行推理,这类东西。然后当我进入执行模式,我想要它写一些代码时,我会选择一个更小、更快的模型。当然,有一些有趣的代理系统,比如 AMP,它们甚至不告诉你它们在使用什么,它们会根据此进行路由。当然,GPT5 以其路由而闻名,这几乎打破了我当时所做的一切。但我想我的问题是,我们是否会看到产品,或者将看到产品,其中我们实际上会根据当时的需求使用各种不同的模型,或者我们更多地考虑一个模型就能轻松地做所有事情?哦,我认为几乎肯定,如果不是已经如此的话。我只是不认为这是在透露什么秘密,但在 anti-gravity 内部,你的主模型可能是 Gemini Pro,但浏览器使用模型,因为它试图做一些更简单的事情,而你想要非常快速的多模态理解和与 GUI 的交互,这可能会使用 Flash,这是速度和它所需的智能之间的一个很好的成本效益权衡。所以我当然认为这已经存在于今天的产品中了。我当然认为当现在你有一个非常好的、沿着每个曲线的阵列时,情况会更加如此。你有一个相当不错的模型,并且你可以为许多不同大小的模型找到一个真正合理的用例。我认为这绝对是真的。是的。而且,这也是我们一直在讨论的,也是我和邓肯在播客上和其他地方经常讨论的,但它确实具有挑战性,我们都必须像撕掉我们的代理工具链一样,当我们发布新模型时。这对于我们现在如何生产和开发软件意味着什么?老实说,这似乎是一个完全的范式转变。而你撕掉你的代理工具链,你的意思是,好吧,因为这个模型正在做一些完全不同的事情,或者什么?>> 是的,所有工具调用,我指定它们的方式,我测试它们的方式,这些现在都不重要了。而且它完全臃肿了,撕掉它们,拥有更少的工具,或者其他什么。>> 而且我认为,当新模型出现更好的功能时,工具链可能反而会使情况变得更糟,对吧?所以,实际上你是在削弱自己,如果你不够积极地撕掉它,你甚至可能看不到新模型的益处,那么你就会比在更自由的世界里更糟糕。>> 是的。所以我实际上,他绝对是正确的,这已经发生在我们身上很多次了,你可以想象,我们意识到我们投入了大量精力的一切实际上正在让模型做得更糟。我们应该只是释放它,解开它,让它展翅高飞。所以我绝对相信这是真的。同时,一旦你理解了这一点,我认为这实际上是非常乐观的,因为它允许你做的是,我认为你倾向于梦想得更大。所以你总是会对自己说,六个月后什么仍然是相关的,或者六个月后什么将是相关的,而今天不是。所以回到我们开始的地方。如果你为模型在几个月后能力提高 50%,提高 100% 做准备,有一种“痛苦的教训”式的软件开发方法,实际上当你把它翻过来时,它是令人兴奋的。它是很酷的,因为你可以“炫耀”很多东西。真正的挑战是你能否梦想得足够大?你能以一种现实的方式梦想得足够大,并预测一下情况会如何发展吗?然后一旦发生,你就会觉得更神奇,你实际上可以“炫耀”很多东西,并仍然实现真正惊人的功能。这是我开始鼓励我们研究团队,甚至在我们研究的赌注中,你所能做出的赌注的规模以及在一个月内可以实现的项目的规模,比一年前更大。再次,这很可怕,但同时,如果你主要受到你所能产生的影响范围的激励,我认为我们这个行业中的许多人都是如此,这是一个令人兴奋的时代。我认为这些东西只是在那里让你实现你最狂野的梦想,然后下次教你梦想得更狂野。>> 这是构建和享受乐趣的激动人心的时代,对吧?你可以如此快速地尝试很多东西。今年很多人认为这是“代理之年”,但我们仍然觉得我们还很早,也许这是“代理之十年”,正如其他人最近所指出的。但是,你如何看待这种“协同驾驶员”或你之前称之为“协同驾驶员”的时代,以及即将到来的“真正代理”时代之间的关键区别?>> 是的。所以我确实认为有一个真正的转变,回到我们谈话的早期部分。当你不再像以前那样密切关注模型在做什么,而是完全移除模型正在做的事情,并且你必须回来并重新适应,并意识到这个东西在做什么时,思维方式会发生真正的转变。这就像聊天和电子邮件的区别。你正在给一个下属分配一个项目,你期望他们可能在一天或一周内回来。我认为“代理十年”是正确的,因为一旦你跨过了那个门槛,它的上限基本上是无限的。基本上,到那时,你已经习惯了它会回来,而你需要一些时间来理解和掌握他们所做的事情,并决定他们接下来需要做什么。无论那是一天,一周还是一个月,在很多方面,它可能仍然是实质性的。所以我认为我们将有很长时间来适应这个新范式。需要开发新工具。我认为我们熟悉的现有产品服务的许多新演变,或者一些全新的产品服务将会出现,它们将更“代理原生”。然后从那里开始,我认为你将会看到更大范围的工作,可能具有更多的扩展性,既有更长的深度,也有更广的范围,直到也许类比是你可能正在管理两三个下属,而现在你下面有许多层,并且它正在扩展。我有信心,作为人类,我们将能够继续扩大我们的野心和管理能力,并从代理日益增长的复杂性和能力中获得价值,至少在相当长的一段时间内。>> 作为一个积极处于最前沿的人,我很好奇你如何让自己的野心与今天使用这些工具所能实现的保持同步?你如何确保你足够积极地将任务委托给那两三个下属,或者开始建立自己的“第二梯队”?我只是好奇你对此有什么看法,尼克。>> 这是一个很好的问题。我问自己,我是否充分利用了这些东西,即使是今天?我实际上认为,现在已经到了这个地步,我决定我在工作中要承担的项目的一部分,就是我可以用它来测试我关于如何以不同方式使用这些代理的想法。这就像我职业生涯早期,我会承担一个基础设施项目,以便我能更多地了解 Kubernetes 的工作原理,或者类似的东西。这就像承担那个项目的价值的一部分。我认为这就像积极地构建,你价值的一部分不仅仅是我将交付的工作,而是我将学到的课程,并将它们应用到不仅是你的黑客项目,还有你的日常工作中。公司应该赋权他们的员工在日常工作中尽可能多地使用这些工具。我认为这只会成为你工作流程的一部分。当然,对我们来说,鉴于我们正在开发这个东西,这更是如此,这是我们工作职责的一部分,就是积极地挑战这些东西的能力极限。>> 完全同意。而且邓肯说的一点是,我认为从这次谈话以及我们所有人进行的许多谈话中都可以明显看出,但我们很少明确说明这个空间目前有多有趣,以及有多令人兴奋。尤其是在发展速度方面,我敢说加速发展,这使得它变得更加有趣,对吧?当我早上起床时,我决定要为我的业务构建什么,就像我们所有人一样,有时会面临巨大的决策瘫痪。所以我只是想知道。

在一个如此有趣、令人兴奋、快速发展的领域,人们甚至怎么能,你怎么鼓励人们思考要关注什么以及何时进行实验?>> 也许我会用史蒂夫·乔布斯说的那个著名类比来回答,他说:“我正在为心智制造一辆自行车。” 我认为这暗示着你可以选择自己的冒险。你不必,你不必像,“好吧,我该如何反馈到这个自我改进的循环中,并构建这个或那个东西?” 我认为我们正在努力做的基本上是构建最强大的东西,它能让你将想象力延伸到你想要的任何程度,或者不想要的任何程度。而且我认为我一直对那些只是追随一时兴起和兴趣的人感到惊叹和印象深刻,而且作为一种文明,我们拥有如此广泛的、奇怪的看法和古怪的观点是多么重要。我永远不会想到以某些方式使用这个工具,而人们却会使用它。而且我认为,如果你过于被压力所迫,认为我需要做一些有成效的事情,比如我需要制作下一个电子表格应用程序或其他什么,而不是仅仅追随你独特的思维和独特的经历所带你去的地方。我认为那只是,我试图学会跟随我自己的冲动,因为我只是,我只能,我无法控制我是谁。我无法控制我感兴趣的是什么。当我这样做时,这辆自行车就会把我带到那个方向更远的地方。它让我能够做更多的事情,并在那个方向上进行更多的探索。我尽量不去过多地担心这是否会成为明年价值 100 亿美元或 1000 亿美元的东西。>> 我喜欢这个。我对此有两个回应。我要给出一个稍微更尖锐的,虽然它不是那么尖锐,但首先我完全同意。其次,我无法想象你在 Windsurf 每天都感觉那样,对吧?就像你,那里有经济压力,我敢肯定你每天早上醒来都会想,我们今天需要做一些特定的事情,对吧?>> 是的。我认为那将永远是真的。是的。总会有我们必须做这件事,我们必须实现这件事,但实际上,那些往往是那种事情,那就是副驾驶的作用。就像,“好吧,我得把这件事搞定。”而这正是它正在为你做的。它让你能够自由地去做。而且我要说,也许如果你正在创业,而且这可能对你来说是生死攸关的财务问题,而且你确实感到有压力要交付一些东西。我仍然认为,这是一个了不起的行业,因为成功的最佳方式是真正构建与价值相符的东西。而且我认为那并不总是真的。比如,我不知道。你可以看看其他行业,这个企业之所以有价值并存在,仅仅是因为监管俘获,或者因为它碰巧能够产生这个专利,或者它就是市场中的一些小小的错位。但对于人工智能来说,如果你在这个开发有用的人工智能应用程序的行业,市场会很快发现这些东西。而且你真正能够产生价值的唯一方法是,如果你做一些真正有用并且对某人有意义的事情,比如某人可以从中获得价值。这也许很有挑战性,但也许也很有回报,因为它让你能够自由地专注于“我如何做有用的事情”或者“我如何想象明年世界将如何变得有用”。至少对我来说,这很容易让我充满动力,而且就像我一开始提到的,实际情况是我们无法围绕这种编码产品进行发布,但我们一直可以梦想着如何让它感觉更像现实,而且我认为那一直令人愉悦,因为那是我加入时想要看到的。>> 太棒了。正如我所说,那是我的第一个回应,我稍微更像一个受过训练的、有限游戏思维的回应。我的无限游戏思维的回应是,我喜欢你用史蒂夫·乔布斯的语言,称之为“心智的自行车”。我想知道我们是否可以更进一步,我们正在为心智制造自行车,但同时,我们也在制造制造心智自行车的机器。这是一个双重或三重游戏,我们不仅在构建思想伙伴,而且我们正在利用它们来实时迭代自身和更多产品。这太棒了。>> 是的,这几乎难以追踪。我甚至不知道,我甚至不知道一年后它会是什么样子,来追踪所有这些事情,并追踪所有这些反馈到自身并帮助自身的方式。但肯定如此。我认为许多公司会告诉你,这加速了他们改进和追求研究想法的速度,在这些人工智能实验室和这些代理实验室中,我认为这种趋势只会加速。>> 太棒了。我想我们到此为止了。邓肯,你有什么最后的想法或问题吗?>> 这太有趣了,尼克。>> 是的。>> 谢谢你。>> 我真的很享受这次谈话,伙计们。我非常感谢被邀请来到节目并与你们交谈。>> 绝对是荣幸。太棒了。非常感谢收听 High Signal,由 Delfina 提供。如果你喜欢这一集,别忘了订阅我们的新闻通讯,在 YouTube 上关注我们,并将播客分享给你的朋友和同事。在 YouTube 上点赞和订阅,并在 iTunes 和 Spotify 上给我们五星好评和评论。这将帮助我们为你带来更多你喜欢的对话。所有链接都在节目说明中。下次再见。