Transcription
世界变化得如此之快。这可能有点显而易见,但你应该尝试事物,并且就像每天都用人工智能做些什么一样。去年夏天,我花了一个周末,用 um GPT5 帮助我构建了一个 iPhone 应用程序。我十年没做过这件事了。是的,它如此之快,如此之容易。那已经是,你知道,很久以前了。那大概是 8 个月前。嗯,现在它更快更容易了。不要限制自己。就像你想象的任何事情一样,你应该尝试使用人工智能,看看你能从中获得多大的成就,你就会,你知道,让世界变得更好。欢迎来到 Light Cone 的另一期节目。Ian Fischer 是 Poetic 的联合创始人兼联合首席执行官,该公司正在为 LLM 构建递归自改进的 AI 推理工具。此前,他曾作为研究员在 Google DeepMind 工作了十年,并多年前通过 YC 创办了一家移动开发工具公司。欢迎,伊恩。>> 谢谢。我很高兴来到这里。>> Poetic 是什么?它与 RL 有何不同?你知道,它与上下文工程有何不同?>> 在 Poetic,我们正在构建一个递归自改进的系统。因此,递归自改进是,你知道,人工智能的圣杯,人工智能使自己变得更聪明。我们得出的核心见解是,我们可以比人们一直提出的所有其他方法更快、更便宜地实现递归自改进。嗯,所以很明显,我不能详细说明那是什么,嗯,我们具体的方法是什么,但是嗯,大多数现有方法都涉及,你知道,它们要求你从头开始训练一个新的 LLM,而从头开始训练 LLM 的成本你知道,数亿美元,需要数月的努力,所以 >> 然后 Anthropic 或 OpenAI 会出现,并在下一个模型发布中抢占你的市场。>> 对,对,你知道,当然,Anthropic 和 OpenAI 以及 Google 正在探索训练递归自改进,但通常是在这种水平上,嗯,你知道,每次自改进都需要训练一个新的模型。>> 我认为这似乎是初创公司真正真正想要的定义性事物。就像我知道我想利用任何下一个模型一样,但一旦你进入微调领域,我就会花费,你知道,数百万到数亿美元,然后猜猜怎么着?就像我刚刚把它烧掉了,因为你知道,前沿模型的下一个版本出来了,我永远追不上。而与你的系统合作意味着我将始终拥有比开箱即用的东西更好的东西,而这可以说是圣杯。>> 是的,我们认为这对任何构建在大型语言模型之上的人来说都非常有价值,而且我们不将前沿模型视为竞争对手。它们是,你知道,它们是我们用来站立的支柱,你知道,建造支柱站在上面,但是嗯,如果我们没有那个,嗯,那个基础层,那么,你知道,Poetic 就无法存在。>> 是的。我的意思是,成为最聪明的模型,你知道,这实际上是一场寸土必争的比赛,而且这些寸土寸金很重要。>> 对,对。>> 我们如何开始?我的意思是,你构建了一些,嗯,基本上任何初创公司都可以使用,嗯,它有点像支柱。我们构建了一个系统,嗯,嗯,可以自动生成系统来解决你的特定问题,这些系统将始终优于底层的语言模型,而且没有你说的关于痛苦教训的巨额开销,你知道,如果没有 Poetic,你会怎么做?你可能会说好吧,我们将首先收集一个大型数据集,你知道,就像成千上万个例子来解决我们正在处理的特定问题,然后我们将微调我们能弄到的最好的模型,嗯,也许是前沿模型之一,或者也许是一个开源模型,这并不重要。你将在微调上花费大量金钱。计算成本如此之高。嗯,然后最后,你得到的东西,你知道,比你微调的东西要好,但那时一个新的模型已经出来了,它比你微调的东西要好。你知道,你微调了,你知道,就像三年前在 GPT 3.5 或其他什么基础上微调的,然后 GPD 404 出来了,它就把你远远甩在了后面。那么,你还要再做一次,还是会破产?而且,在某些情况下,使用 Poetic 的情况是,嗯,你知道,人们现在称这些东西为工具,或者一个通用系统,或者你想称之为任何东西,它坐落在一个或多个语言模型之上,它比它们表现更好。嗯,当新模型出来时,同一个工具与它完全兼容。嗯,你不需要改变任何东西就能获得,你知道,甚至更大的性能提升。此外,我们可以,你知道,继续为这个新模型进行优化,无论你想使用哪个新模型,嗯,你知道,让它变得更好。嗯,但是,你不会损失,你知道,数亿美元。事实上,我们这样做比微调的成本便宜得多,嗯,就像你说的。>> 而且你实际上已经做过很多次了,对吧?就像我记得去年十二月你第一次发表论文时,你就冲到了 ARC AGI V2 的顶端,然后你已经为其他基准测试做了很多次了。你知道,那是什么样的?>> ARGI v2 是我们从隐身模式中出来的,让人们知道我们可以解决这些非常困难的问题。嗯,特别是,你知道,我们想表明我们的系统可以生成我们称之为,你知道,我们称我们的系统为 Poetic 元系统,它可以生成高度有效的推理系统。Gemini 3 刚刚发布了 Deep Think。嗯,它们确实在排行榜上名列前茅,达到了 45%。嗯,两天后,我们发布了我们的结果,嗯,嗯,我们表明我们可以获得比这高得多的分数。>> 所以他们推出了苏打水,然后你每次都出现在他们上面,这真是太疯狂了。这就是拥有支柱的感觉,你知道,就像任何模型出来一样,你都可以比那个模型更高,这真是太棒了。>> 是的。所以有趣的是,我们的成本是 Gemini 3 Deep Think 的一半,因为我们构建在 Gemini 3 Pro 之上,这是一个便宜得多的模型,嗯,但最终我们在官方验证上仍然获得了 9 个百分点的提升。所以他们是 45%,我们是 70 多美元,我们是 54%,每问题 32 美元。>> 所以最近你们刚刚宣布了一些关于人类最后考试的惊人结果。你能多告诉我们一些吗?>> 人类最后考试是一套 2500 个非常非常难的问题,由许多不同领域的专家撰写。它们旨在挑战那些领域的博士生。人工智能还没有通过。嗯,但我们达到了 55%,这比上周才由 Anthropic 的 Claude Opus 4.6 发布的前沿技术高出近两个百分点。他们在上面得到了 53.1%,我们在上面得到了 55%。>> 而且人类最后考试没有公布获得这些结果的成本。在你们的情况下,这次运行的成本不到六位数。是多少?>> 我们没有公布任何成本,但我可以说,优化成本不到 10 万美元。是的。>> 这令人印象深刻,因为这些大型基础模型的每一次训练运行都要花费数亿美元。而你们公司只有七个人。>> 没错。是的。是的,七名研究科学家和研究工程师。是的。>> 这令人印象深刻。而且我认为你们的方法非常有趣,就是对许多最好的创始人正在用模型进行的涌现行为采取非常科学的方法。我认为许多取得优异成绩的创始人,他们将底层模型视为一个可以切换的通用层。有些任务,例如对于 GPD 5.2 2,非常难以验证的错误会被发送到那里,而对于发送到 claw 4.6 6 的架构,但你们正在自动执行此操作,而不是由人类进行,这非常令人印象深刻。我认为下面有一些更特别的事情正在发生。你能告诉我一些关于它是如何工作的吗?>> 是的,这听起来很神奇。那么,你能告诉我们什么?>> 对。你正在触及一个核心,一个真正核心的东西。你知道,这些工具,它们是代码、提示、数据,你知道,构建在一个或多个语言模型之上,对吧?所以这是原则上你可以手动构建的东西,或者使用云代码或其他什么。但实际上,要做到这些需要大量的工作,你知道,要有所有的见解,让这些能够很好地工作。所以我们在 Poetic 开发的核心技术是递归自改进。所以我们有一个递归自改进系统,我们称之为 Poetic 元系统。该系统的输出是解决困难问题的系统。嗯,困难问题是指,你知道,如果你把它交给 GPT52,它会很难给出可靠的、稳健的结果,你知道,只是举个例子。所以这对我们来说是一个巨大的优势。我们可以以一种更加自动化的方式生成这些系统,嗯,这意味着我们可以比你雇佣一个团队来尝试制作你自己的代理来解决你的特定任务更快、更便宜。但不仅如此,嗯,你知道,这真的是一个自动优化过程。如果你已经完成了这项工作,你知道,你是一个初创公司,正在进入一个特定的垂直领域,并且你认为你已经很好地理解了你的问题,你已经组建了你的代理,你,你知道,也许它工作得很好,但你知道你可以做得更好,或者你真的需要做得更好。嗯,那么你可以把它带给我们,我们可以优化整个代理或代理的某些部分。所以我们可以只优化提示,只优化推理策略。嗯,有很多不同的事情我们可以做,这取决于你的具体需求。>> 这听起来与 RL 是一个完全不同的范式,因为我们经历了常规预训练 RL 的 S 曲线,当 OpenAI 发布 01 时,现在这感觉像是一个新的。它听起来很特别。它听起来与 RNN 有很多相似之处。>> 这与 RL 是一个完全不同的范式,对吧?这将取决于具体的任务,我们正在处理的具体问题类型,以及我们正在处理的底层模型。但是,嗯,有效地你可以说,每个模型或我们正在处理的每个模型集都将拥有自己的 S 曲线。Poetic 系统,Poetic 元系统本身也将拥有自己的 S 曲线。因此,随着 Poetic 元系统的改进以及底层模型的改进,你会发现你正在处理的 S 曲线不断向上移动,直到最终你饱和或者>> 达到 AGI。>> 是的。达到 AGI,达到超级智能。是的。>> 考虑到它的支柱,你可能首先会达到上限。>> 这就是目标,对吧?是的,>> 你想先达到上限,然后>> 我认为我们合作的许多初创公司,然后在我空闲时间,我做了一些上下文工程,然后问题是,我们正在调整它,调整评估,调整,我们正在进行上下文填充。拥有一个递归自改进版本的提示工程和上下文工程是什么感觉?我们不花太多时间查看我们正在处理的特定数据。嗯,相反,我们让 Poetic 元系统查看这些数据,所以就像元系统,你知道,如果它认为它需要将更多内容放入上下文,它会进行更多的上下文填充或其他什么,它会做的。如果它需要生成大量的例子,嗯,为了获得更好的性能,它会为你做,对吧?嗯,查看提示输出尤其有趣,我想说对于 ArcGI,你知道,我认为你可以阅读它们,然后说,嗯,这肯定不是人类会写的东西,非常清楚,而且,你知道,有一些意想不到的东西,你知道,它制作了一些非常简单的例子,其中一个例子实际上是错误的,但我们没有改变它。我们说,嗯,这是我们输出的东西,我们就这样放着。嗯,你知道,我们不想去干涉事情,所以历史上在机器学习中,你总是,你知道,规则是你必须非常了解你的数据集,但现在我们正在将这项工作外包给人工智能本身,人工智能的工作是理解数据集,找出失败模式在哪里,以及模型,代理可以使用的稳健推理策略是什么,以获得更好的性能。>> 有多少是更好的提示,有多少是工具本身,上下文填充或以正确的方式进行摘要或以正确的方式进行重新排序,所以你有一些大型 LLM 调用,然后你如何从中获得最大收益?>> 是的。所以这肯定因问题而异。但我们看到的是,事实上,我们在 DeepMind 的最后一篇论文并没有做这种递归自改进的东西,但我们正在展示你可以手动构建这些工具来解决非常困难的问题。我们看到的是,嗯,你知道,我们为这些非常困难的问题手动优化了提示。这让我们走了一点路。在这种特定情况下,你知道,我们正在处理的最困难的任务是,我们使用 Gemini 1.5 flash 获得了 5% 的性能,这已经是很久以前了,然后当我们添加推理策略时,我们从 5% 提高到了 95%。>> 嗯,所以这通常是我们看到的,你知道,就像每个人都在做一些自动提示优化,你知道,Jeepa 是一个非常流行的论文,每个人都在实施,这会带来一些性能提升,但它远远不是你可以获得的一切,如果你真的考虑这些推理策略,它们将用代码编写,而不是仅仅用更好的提示编写。>> 所以如果初创公司想使用 Poetic 将他们的代理放在支柱上,他们应该怎么做?>> 是的,所以现在我们还没有发布任何东西,但是如果你去 poetic.ai,AI。有一个按钮你可以点击,可以注册早期访问。如果你是一家初创公司或一家公司,有一个非常困难的问题,并且你已经尝试了所有你能做的事情来使其可靠和稳健,而你就是无法完全解决,你需要更多,那么请告诉我们。我们正在寻找这样的问题。嗯,所以告诉我们你在做什么,我们会联系你。当我们可以与你合作时,你将是第一个知道的。我的意思是,如果你在人类最后考试的顶端,那么我的意思是,那很厉害。所以,你已经全部在那里了,然后我想支柱基本上可以让任何代理公司成为苏打水。>> 这就是想法。是的。是的,而且你知道,我们将 ArcGI 结果和人类最后考试结果视为展示了我们的两种不同能力。我们可以真正提高你的推理能力,我们可以真正提高这些模型的深度知识提取能力。>> 然后你就完全免疫了痛苦的教训。>> 没错。>> YC 的下一批正在接受申请。你心里有个初创公司吗?请访问 y combinator.com/apply。永远不会太早,填写申请将提升你的想法。好的,回到视频。>> 话题稍微改变了一下,但我想知道一些事情。嗯,你十多年前来到 Google,当时他们收购了你的第一家 YC 初创公司 Portable。Portable 是跨平台移植移动应用程序,对吧?就像 Android 或其他什么。这与递归自改进 AGI 完全不同。嗯,你是如何实现这一飞跃的?进入 Google 后发生了什么?嗯,是什么让你觉得你可能想转移出去做些不同的事情?我很想听听那个故事。收购是一次绝佳的机会,让我反思我接下来真正想做什么,对吧?就像 Google 本身就是一个你可以做很多不同事情的地方。嗯,所以我花了一些时间思考,嗯,在我的旅程中,我接下来想去哪里。我意识到我最兴奋的问题实际上是人工智能和机器人技术。嗯,世界上最优秀的人才,其中许多人在这些领域,当时都在 Google。嗯,所以我去和他们谈了,他们让我加入 Google 研究院的一个新的人工智能机器人团队,这对我是个绝佳的机会,因为那不是我的背景,我的背景是计算机安全,然后是跨平台移动,你知道,是系统构建的东西,我能够加入这个团队,我告诉你真相,我很快就意识到硬件很难,而且我真的不想做机器人技术,当时机器人技术更具吸引力,但我对机器学习充满热情。所以我就非常艰难地转向只做机器学习研究,并在 Google 工作了大约十年,然后是 Google,然后是 DeepMind。>> 对于想要进入更多人工智能领域,可能是应用人工智能并围绕人工智能建立初创公司的工程师,你今天有什么建议吗?他们应该如何思考?你知道,世界变化得如此之快。这可能有点显而易见,但你应该尝试事物,并且就像每天都用人工智能做些什么一样。始终尝试挑战自己,找出它们能力的极限。嗯,嗯,建造你想要建造的东西,对吧?嗯,即使是我,你知道,去年夏天我花了一个周末,用 GPT5 帮助我构建了一个 iPhone 应用程序。我十年没做过这件事了。太快了。>> 是的,它如此之快,如此之容易。而那已经是,你知道,那已经是,你知道,很久以前了。那大概是八个月前。嗯,现在它更快更容易了。不要限制自己。就像你想象的任何事情一样,你应该尝试使用人工智能,看看你能从中获得多大的成就,你就会,你知道,让世界变得更好。今天我们就到这里了,但伊恩,非常感谢你给我们提供了所有支柱。嗯,我们迫不及待地想在 YC 使用它。我迫不及待地想为 Gary 的列表使用它。我的意思是,有太多事情要做。所以,>> 是的,谢谢你的邀请。这很有趣。