Transcription
[音乐] 各位听众,大家好,欢迎回到 No Priors。今天我将与 Brandon McKenzie 和 Eric Mitchell 对话,他们是 OpenAI 的 03 模型背后的两位核心人物。03 是 OpenAI 在推理模型领域推出的最新产品。它功能强大,能够找出应使用哪些工具,并在多步任务中运用这些工具。我们将讨论它的开发过程、未来发展方向以及如何进行推理的推理。Brandon 和 Eric,欢迎来到 No Priors。感谢邀请。是的,感谢邀请。你们能否为我们介绍一下 03 模型,它有什么不同之处?它在推理方面取得了怎样的突破,例如,你们在专注于推理的同时,还增加了记忆和其他功能,这与核心基础模型或 LLM 有何不同?所以,03 是我们 Oer 系列模型中最新的模型,该系列模型专注于在响应前仔细思考。从某种模糊的通用意义上说,这些模型比那些不经思考就响应的模型更智能。你知道,就像人类一样,如果你在回应前思考一下,会更容易更准确。我认为 03 最令人兴奋的地方在于,它不仅更智能,而且如果我们将其与我们之前的 Oer 模型进行苹果对苹果的比较,你知道,它在给出正确答案方面做得更好,无论是数学问题还是关于世界的常识性问题,等等。这一点是真实的,而且很棒,我们会继续训练更智能的模型。但它也非常酷,因为它使用了许多工具,这些工具增强了它为你做有用事情的能力。所以,是的,你可以训练一个非常智能的模型,但如果它无法浏览网页获取最新信息,那么该模型能为你做的有用事情就非常有限。如果模型无法实际编写和执行代码,那么 LLM 能高效完成的事情就会受到限制,而一个相对简单的 Python 程序可以非常轻松地解决特定问题。所以,不仅模型本身比我们之前的 O 系列模型更智能,这很棒,而且它还能使用所有这些工具,这些工具进一步增强了它的能力,无论是进行一些需要最新信息的搜索,还是让你让模型为你进行数据分析,或者让你让模型能够进行数据分析,然后审阅结果并根据需要调整方向,而无需你对每一步都进行如此明确的指示。模型能够接受这些高级请求,例如对这家公司进行尽职调查,然后可能对某个事物运行一些合理的预测模型,然后为我写一份总结,模型会自己推断出一系列合理的行动。因此,它为你提供了更高级别的接口来完成这些更复杂的任务。这很有道理。所以听起来,你们的核心 GPT 模型与现在有所不同,现在模型会暂停思考。因此,在推理时,会进行更多的计算,而且它还可以执行顺序步骤,因为它能够推断出这些步骤是什么,然后采取行动。与核心基础模型或你们之前开发的 GPT 2.5 和 4 以及历代模型相比,你们是如何以不同的方式构建或训练它的?在实际构建这些模型方面,有什么不同?我想简短的回答是强化学习,这是最重要的。所以,是的,与其仅仅预测大型预训练语料库中的下一个 token,你知道,基本上是无处不在的,现在我们有一个更集中的目标,即模型解决非常困难的任务,并花费它需要的时间来找出这些问题的答案。对我来说,用户体验方面的一个神奇之处在于,过去我们谈论推理模型时的测试时间缩放,我认为对于许多问题,你知道,没有工具的测试时间缩放有时可能有效,但到某个时候,模型就会在它的内部思维链中胡言乱语,特别是对于一些视觉感知问题,它知道它看不到它需要的东西,它就会发疯。我认为工具使用现在是持续这种测试时间缩放的一个非常重要的组成部分。当你与 03 对话时,你可以感受到这一点。至少我第一次使用它时的印象是,它思考的时间越长,我就越觉得我会得到更好的结果,而且你可以看到它做一些非常直观的事情,而且这是一种非常不同的体验,但能够相信,当你等待的时候,这是值得等待的,而且你会因此得到更好的结果,模型不会只是去做一些完全无关的事情。这很酷。我认为在你们最初的帖子中,你们也有一个图表,基本上显示了你们如何观察思考时间与准确性结果的关系,这是一种非常好的关系。所以很明显,更深入地思考某件事情确实很重要。而且,长远来看,你是否认为世界将分裂或分化成两类模型:一类是快速、便宜、高效,能够完成某些基本任务;另一类模型,你上传一个法律并购文件夹,它需要一天时间思考,速度慢且昂贵,但它会产生需要一个团队花费一个月时间才能完成的输出,或者你如何看待这个世界,以及所有这些是如何演变的或走向何方的?你知道,对我们来说,模型的统一是我们一直在公开谈论的,你知道,我们在 ChatGPT 中有一个巨大的模型切换器,有很多选择,你知道,我们有一个模型可能擅长用户可能想做的任何特定事情,但这并没有多大帮助,如果用户很难弄清楚,嗯,我应该为那个任务使用哪个模型?所以,是的,让模型变得更好,让这种体验更直观,这绝对是有价值的,也是我们感兴趣的。这适用于这个问题,你知道,嗯,你知道,我们将拥有两个模型供人们选择,还是有无数个模型供人们选择,还是我们将这个决定放在模型内部?嗯,我认为每个人都会尝试不同的方法,并找出对他们感兴趣的问题和他们拥有的用户来说什么最有效。但是,但是,是的,我的意思是,那个问题是,你知道,如何让那种决定变得,你知道,尽可能有效、准确、直观,这绝对是首要考虑的。从研究角度来看,是否有理由将推理与预训练结合起来,试图更好地控制它?因为如果你只从产品角度来看,终端消费者与 ChatGPT 的互动,你知道,我们就不讨论命名上的荒谬了,他们不在乎,他们只想要正确的答案,以及以尽可能少的时间获得所需的智能,对吧?理想情况是,它很直观,你知道,你应该等待多长时间,你应该等待模型给你一个正确答案所需的时间,或者,我希望我们能达到一个模型能够更精确地理解自身不确定性水平的阶段。因为,你知道,如果它们已经知道答案,它们就应该告诉你。如果它们需要一天时间来弄清楚,那么它们就应该花一天时间。但你应该始终有一种感觉,你知道,它花费的时间正好是当前模型智能所需的时间。而且,我觉得我们正走在正确的道路上。是的。我不知道,虽然,介于终端用户产品和开发者产品之间是否存在某种分歧,对吧?因为有很多公司使用,你知道,这些不同模型的 API,然后用于非常特定的任务,而且在某些模型上,他们甚至可能使用开源模型,推理成本非常低,以及他们控制更多的东西。我希望你能告诉模型,嘿,这是一个 API 用例,是的,你真的不能在那里思考十分钟,我们必须给用户一个答案。嗯,嗯,如果他们的模型能够更具可控性,那就太好了。是的,我认为这只是一个普遍的可控性问题。归根结底,如果模型很聪明,你应该能够指定问题的上下文,模型应该会做正确的事情。会有一些限制,因为,你知道,也许仅仅根据你的情况找出什么是正确的做法本身就需要思考。所以,这不是你显然可以完美地做到这一点,但是,但是,是的,将所有正确的部分推入模型,让用户更容易,这似乎是一个非常好的目标。我能回到你说的其他事情吗?所以,我们播客的第一个嘉宾实际上是 Nome Brown。所以,我两年前就听说过他了。是的。嗨。很高兴能从你们那里得到一些关于为什么工具使用能让测试时间缩放效果更好的直观感受。我可以举一些非常具体的例子,比如视觉推理方面。有很多情况,回到模型能够估计自身不确定性。你会给它一个关于图像的问题,模型会非常透明地告诉你,它不应该思考,我不知道。我真的看不清你在说什么。或者,它几乎知道它的视觉能力并不好。但是神奇的是,当你给它一个工具时,它就会说,好吧,我得想办法。让我看看我能不能处理这张图片,或者在这里裁剪一下,或者类似的东西。这意味着它在进行标记时,使用标记的效率要高得多。所以,你的测试时间缩放斜率,你知道,从类似这样变成,你知道,更深的东西。而且,我们已经看到了这一点,对于视觉推理,无论是否有工具使用,测试时间缩放的斜率都非常明显不同。是的。是的,我也想说,比如写代码,有很多事情是 LLM 可以自己解决的,但需要大量的尝试和自我验证,而你可以编写一个非常简单的程序来以一种可验证且更快捷的方式来完成。所以,你知道,嘿,对这家公司做一些研究,并使用这种类型的估值模型来告诉我,你知道,估值应该是多少,你可以让模型尝试处理它,并在其上下文中拟合那些系数,或者你可以让它编写代码来正确地完成它,并知道实际答案是什么。所以,是的,我认为部分原因是你可以更有效地分配计算资源,因为你可以将模型不具备比较优势的事情委托给一个非常适合做这件事的工具。我一直在大量使用 03 的一种形式是深度研究,对吧?我认为这基本上是一个研究分析师 AI,你们已经构建了它,它基本上会出去,会在网上查找信息,会综合信息,会为你绘制图表。就其能力集而言,它非常令人惊叹。你是否需要做任何特别的事情,比如任何形式的特定强化学习,特别是为了让它在这方面做得更好,或者你们在此基础上构建了其他东西,或者你们是如何考虑它的数据训练,用于训练它的数据?我只是很好奇,如果说这个产品是这个产品的一个分支,以及你们是如何专门将其作为这个更广泛努力的一部分来构建的?我认为,当我们考虑工具使用时,我认为浏览是最自然的地方之一,你知道,你将其视为一个起点,你知道,好吧,好吧,而且它并不总是容易的。我的意思是,你知道,几年前我们在 GPT4 中包含的最初的浏览功能,很难让它以一种可靠且有用的方式工作。但是,你知道,在当今的现代,去年,你知道,两年前已经是古老的历史了,我认为这是一个自然的起点,因为它适用于如此多的查询类型,任何需要最新信息的事情,浏览都应该有所帮助。所以,就测试平台而言,你知道,我们正在进行的 RL 是否有效?你知道,我们真的能让模型学会更长远的有意义的扩展行为吗?你知道,从某些方面来说,这是一个自然的地方,因为它在相对较短的时间内可能很有用。所以,就像,是的,让我们试试吧。我的意思是,你知道,在 RL 中,归根结底,你是在定义一个目标,如果你有一个想法,谁会发现它最有价值,你知道,你可能想根据你期望使用它的人来调整你的目标,你期望他们想要什么,你知道,他们的容忍度是多少?他们想坐下来看 30 分钟的深度研究吗?你知道,当他们要求一份报告时,你知道,他们想要一页还是五页还是无数页?所以,是的,我的意思是,你绝对,你知道,你想根据你认为谁会使用它来定制东西。我觉得你们通过这种工具正在捕捉很多白领行为工作或知识工作。你提到了软件工程是一个潜在的领域,深度研究和分析类工作是另一个领域,有很多非常有趣的工作要做,在增强人们正在做的事情方面非常有帮助。除了我刚才提到的,你认为还有哪两个或三个领域是最接近的、最有趣的应用程序,无论是 OpenAI 还是其他人应该做的?我猜我非常偏颇的一个是我对编码以及一般研究感到兴奋,能够提高我们在 OpenAI 和其他机构使用我们的工具进行研究的速度。我认为我们的模型正在非常快速地变得越来越好,并且实际上很有用,而且它们似乎正达到某个临界点,在那里它们足够有用,以至于我每天都想多次接触并使用它们,至少对我来说是这样,而以前不是这样。它们总是比我想要的稍微落后一点,尤其是在导航和使用我们内部的代码库方面,这并不简单。而且,看到我们最近的模型实际上花费大量时间来理解我们提出的问题,并给出节省了我很多时间的东西,这真是太棒了。人们说这是最快的潜在引导,对吧?就每个模型随后帮助制造下一个模型更好、更快、更便宜等而言。所以人们经常争辩说,这几乎是超智能指数的临界点,基本上是利用人工智能来构建下一代人工智能的能力。而且研究也有很多不同的组成部分。它不仅仅是坐在象牙塔里思考问题,还有硬件,还有训练和评估的各种组成部分等等。这些都可以被视为可以优化和迭代的任务。所以,有很多改进的空间。我们谈到了浏览网页、编写代码,这可以说是最伟大的工具,对吧?特别是如果你想弄清楚如何花费你的计算资源,你可以编写更有效的代码。生成图像、编写文本。当然,有一些行动轨迹我认为还没有实现,对吧?比如可靠地使用一系列商业软件。我对计算机使用方面的东西非常兴奋。这在某种程度上让我抓狂,因为我们的模型还没有整天都在我的电脑上,观察我在做什么。而且,我知道这对某些人来说可能很令人毛骨悚然,而且我认为你应该能够选择退出,或者默认选择退出。我讨厌打字。我希望我能在我电脑上处理某件事情,遇到一个问题,然后我就想,好吧,我该怎么处理这个问题,然后我就可以问了。我认为有很多空间可以提高我们与模型的互动方式,这又回到了它们能够以更直观的方式使用工具。就像我们使用工具的方式一样。令我惊讶的是,我们的模型使用我们提供的工具是多么直观。它有点像人类,但考虑到它们之前看过的数据,这并不令人意外。但是,是的,我认为很多事情都像人类一样。我直觉上认为,为什么工具使用对测试时间缩放如此有影响?为什么这种组合要好得多?你可以选择任何角色,当你试图在任务上取得进展时,你可以做出决定,是获得外部验证,还是坐下来认真思考,对吧?通常,一个比另一个更有效,而且不总是只是坐在真空中认真思考你所知道的。是的,绝对是的。你可以寻求新的输入,它不再必须是一个封闭的系统。而且,我确实觉得模型的封闭系统性在某些方面仍然是一种限制。你不是,你不是在把它变成,我的意思是,我认为如果模型能够控制我的电脑,那将是很好的,但在某种意义上,我们没有疯狂地放手说,哦,是的,这是王国的钥匙,随便吧。因为,你知道,节省的时间和你可能犯的错误类型之间仍然存在不对称的成本。所以,我们正在尝试迭代地部署这些东西,尝试它们,并找出它们在哪里可靠,在哪里不可靠。因为,是的,如果你只是让模型控制你的电脑,它可能会做一些很酷的事情,我毫不怀疑,但是,我信任它来回应布兰登发给我的所有随机邮件吗?也许对于那个任务来说,它不需要那么多的智能,但更普遍地说,我信任它来做我正在做的所有事情吗?你知道,有些事情,我敢肯定,这些事情明天会比昨天多。但是,是的,我认为部分原因是,我们限制了它的能力,并将其保留在沙箱中,出于谨慎,这样你就不会给你的老板发一些疯狂的邮件,或者删除你所有的短信,或者删除你的硬盘驱动器之类的。对于可以使用日益增长的智能、测试时间缩放和工具改进的工具的任务,是否存在某种组织性心智模型?因为我看着这个,我想,好吧,你有任务的复杂性,你有时间尺度,然后你有能力想出这些 RL 奖励和环境,对吧?然后你有有用性,也许你对多样性和泛化性有一些直观的认识,但它似乎是一个非常大的空间,而且扩展新的 RL 并不容易,对我来说,如何做到这一点或如何选择路径并不清楚。你们有没有什么组织性框架可以分享?我不知道有没有一个组织性框架,我认为至少有几个因素是我在非常宏观的层面上考虑的,那就是为了解决这个任务,我必须与环境有多少不确定性搏斗?对于一些纯粹的事实问题,比如美国第一任总统是谁?我不需要与环境互动就可以正确地回答这个问题,我只需要记住答案并说出来。如果你想让我写一些解决某个问题的代码,那么我现在必须处理一点点不完全是内部模型的东西,而且,我还必须执行代码,而且代码执行环境可能比我的模型可以内部记忆的更复杂。所以,我必须做一点写代码,然后执行它,确保它做了我想象的事情,然后测试它,然后把它交给用户,事情会变得,你知道,你不能只是回忆答案并把它交给用户。你必须测试一些东西,你知道,在世界上进行实验,然后等待实验结果。你必须做的事情越多,这些实验的结果就越不确定,在某种意义上,这就是使任务变得困难的核心属性之一。我认为另一个是它们的可模拟性。你知道,像受时间限制的东西,比如物理世界,也比我们可以很好地模拟的东西更难。你知道,很多人对编码和编码代理感兴趣,而机器人技术很困难,而且它很慢,而且我以前做过机器人技术,而且在很多方面都令人沮丧。我认为外部环境需要处理多少,以及你必须与现实世界不可避免的缓慢作斗争多少,这是我考虑的两个维度。这非常有趣,因为如果你看看历史上的一些模型,我认为一直令人印象深刻的是它们的通用性。所以,我认为当 GitHub Copilot 推出时,它是基于 Codex,这是一个专门的代码模型,然后最终它被融入到这些更通用的模型中,就许多人实际用于编码相关应用而言。你如何看待机器人技术?所以,你认为,现在可能有十几家机器人基础模型公司。你认为最终它们会合并到你们的工作中,变成这些可以做各种事情的大型通用模型,还是你认为这些独立的模型有很大的发展空间?我想说的是,一直让我觉得有点好笑的是,我们做 RL,但我们还没有在最典型的 RL 任务——机器人技术上做。而且,我个人看不到任何理由为什么我们不能拥有这些模型。我认为存在一些挑战,比如,我不知道,你想让你的 RL 模型能够原生生成一个小时的电影,而不是像一个工具调用那样,这可能很棘手。我不知道,在拥有所有东西都在同一组权重之间存在冲突,但当然,你已经看到 03 在探索图片等方面所做的事情,这些都是某种代理探索外部环境的早期迹象。所以,我认为这对我来说并不遥远。是的。我的意思是,我认为之前提到的关于智能与成本的比例问题,你知道,现实世界是一个有趣的试金石,因为归根结底,现实世界有一个帧率,你需要生存。如果你在思考两分钟后得到正确答案,那也没关系。你知道,球现在正朝你飞来,你必须接住它。重力不会等你。所以,这是一个额外的限制,当我们谈论这些纯粹的非实体事物时,我们可以至少软性地忽略它。这很有趣,因为非常小的头脑在这方面非常出色,你知道,所以你看看青蛙,然后看看不同的生物,然后看看相对的计算能力。而且,你知道,非常简单的系统在这方面非常出色。蚂蚁,你知道,就像,所以,我认为这是一个非常有趣的问题,关于某些响应迅速的现实世界任务实际需要多少基础能力。视觉方面也很棘手。我们的模型有一些,我认为可能是臭名昭著的边缘案例,它们没有做正确的事情。我认为 Eric 可能知道我要说什么。我不知道你是否问过我们的模型告诉你时钟上的时间。它们非常喜欢 10 点 10 分。所以,是的,这也是我最喜欢的时间。所以,我通常告诉人们,互联网上超过 90% 的时钟都是 10 点 10 分。而且,我猜是因为它看起来像一张笑脸,而且看起来很不错,但是,总之,我的意思是,我们的视觉系统是通过与外部世界互动而开发的,并且必须擅长导航事物,你知道,躲避捕食者。而我们的模型以一种非常不同的方式学习了视觉。而且,我认为如果我们能让它们通过在现实世界中采取行动来闭环,通过减少它们的不确定性,我们将看到很多非常有趣的事情。仅仅是思考事情,而不是思考事情。是的。嘿,Eric,你提到了环境中的哪些东西可以被模拟,作为提高难度的输入。当你处理长期的任务时,比如软件工程,有很多互动不仅仅是我不断提交代码。我将与其他人讨论项目,在这种情况下,你需要处理一个问题,即你能否合理地模拟其他人将如何在项目中与你互动,在一个似乎非常棘手的环境中?我并不是说 03 或任何一套基础模型现在没有合理的反应能力,但你是如何看待这种模拟真实世界的?当你让人们参与到一个环境中时,你的想法是什么?我辛辣的看法是,我不知道辛辣的看法,但 03 在某种意义上已经在模拟一个人使用浏览器之类的东西是什么感觉了,我不知道训练两个这样的模型,这样你就有两个人互相互动,是的,没有理由不能扩大规模,让模型擅长互相合作。我的意思是,已经有很多关于多智能体 RL 的现有文献,而且,是的,如果你想让模型擅长与一群人合作,那么一个不错的起点可能是让它擅长与其他模型合作。男人,有人应该这样做。是的。是的。我们真的应该开始考虑这一点。Eric,我认为这有点辛辣,因为是的,工作正在进行中,听到你认为这是一个有用的方向很有趣。我认为很多人仍然想相信,不是我,就像我的评论在这个 pull request 上特别好,或者其他什么,对吧?而且,好吧,我能理解。有时我看到我们的模型在训练,我想,你在做什么?你知道,就像,你花太长时间来弄清楚这一点。而且,我认为如果你们能够以互动的方式训练模型,那将非常有趣。你知道,忘掉只是在测试时间,但我认为训练它们做类似的事情会很棒。能够在合适的时候进行干预。是的,只是我更多地能够告诉模型,你停止吧,在它的思维链的中间,并且它能够在现场学习,我认为这将是很好的。是的,我认为这是这两件事的交叉点,它既是与外部环境的接触点,外部环境可能具有很高的不确定性,人类有时可能非常不可预测,而且它受到现实世界时间滴答的限制,如果你想,你知道,与真正的人类打交道,人类在大脑中有一个固定的时钟周期。所以,是的,我的意思是,如果你想,你知道,字面上这样做,这很难,所以,你知道,扩大规模,并使其有效工作,你知道,并不容易。我们是一个非常昂贵的工具调用。你知道,如果你是一个模型,你可以问我,你知道,这个肉袋在这里,你知道,帮助我做某事,我会尝试非常缓慢地思考。与此同时,它可能已经使用了浏览器,并阅读了关于该主题的一百篇论文,等等。所以,是的,你如何模拟这种权衡?但人的因素很重要。我的意思是,我认为在任何研究项目中,你知道,我与 Brandon 的互动是项目中最大的挑战,你知道,写代码是,那是容易的部分。嗯,从自动驾驶方面也有一些类比。L 会说,每周和我一起闲逛是做这个播客最难的部分,但这是我最喜欢的部分。看看他们的关系有多健康。Eric,我们需要从中学习。不,我们很诚实。没关系。我们需要一起解决。在自动驾驶领域,一个经典上很难做的事情是预测环境中的人类、儿童和狗等代理,而不是环境本身。而且,我认为可以从中得出一些类比。回到关于你如何从这里推进 O 系列模型,这是否是一个合理的评估,有些人认为模型的能力可能会以一种更不规律的方式发展,因为你在一定程度上更依赖于研究团队的创造力以及设计这些环境和决定如何创建这些评估,而不是我们正在扩展现有数据集和预训练?这是一个公平的对比吗?不规律,或者说情节是什么?X 轴和 Y 域是 X 轴,Y 是能力。是的。因为你正在选择你真正创建 RL 循环的领域。我的意思是,我认为这是一个非常合理的假设。我认为有一些反证,我认为应该纳入人们的直觉,你知道,Sam 发推文的一个例子是我们模型的一些创意写作,我认为,我不是专家,我不会说这是可发表的或突破性的,但我认为它可能更新了一些人关于你知道,你可以训练一个模型做得非常好的直觉,所以我认为会有一些结构性原因导致一些不规律性,因为,你知道,作为一个组织,你必须决定,啊,我们将优先考虑 XYZ 的东西,而且,随着模型变得更好,你可以用它们做的事情的表面积增长速度比你可能说的“这是我们想要开辟的利基,我们将努力做到这一点”要快得多,所以,我认为有一些不规律性的原因。但是,我认为有些人会走得太远,说,“哦,是的,这些模型只会非常擅长数学和代码,而不会,你知道,像其他所有东西一样,你无法改进它们。”而且,我认为这可能不是正确的直觉。是的。而且,我认为现在所有主要的 AI 实验室都有一些划分,一部分是让我们定义一系列我们希望模型擅长的数据分布,然后向它们扔数据,而同一公司中的另一组人正在思考如何通过某种算法变化来提升所有船只。而且,我认为是的,我们在 OpenAI 都有这两种努力。而且,我认为尤其是在数据方面,自然会有我们拥有比其他地方更多的数据,但理想情况下,是的,我们有大量的努力不会如此依赖于我们进行 RL 的确切数据子集,而且它会更好地泛化。我每周都会收到一次推销,我相信你也会收到很多。一家公司想要以某种方式为实验室生成数据,或者,你知道,访问人类专家等等,但是,你知道,这有无数种变体。如果你能挥动魔杖,拥有完美的数据集,那么今天什么数据能提升模型质量?这是一个回避的问题,但不受污染的评估,总是非常有价值的,那就是数据。而且,我的意思是,是的,你想要,你知道,用于训练的良好数据,当然,这对于让模型变得更好很有价值,但我认为人们经常忽视的是,高质量数据也同样重要,而这对于评估来说是不同定义的高质量。但是,是的,评估方面通常同样重要,因为你需要衡量事物,而且,你知道,就像你从招聘人员那里知道的那样,评估一个通用、有能力的代理的能力在严格的意义上是很难做到的。所以,是的,我认为评估有点被低估了,但这是真的。评估,我的意思是,特别是对于我们最近的一些模型,我们已经用完了可靠的评估来跟踪,因为它们已经解决了其中一些问题。但是,在训练方面,我认为拥有能够达到模型能力下一个前沿的训练数据总是很有价值的。我的意思是,我认为 03 和 04 mini 已经可以做到这些类型的任务,基本的工具使用,我们可能不再需要新的数据了。但是,我认为很难拒绝一个包含大量多轮用户交互的数据集,以及一个包含一百万行代码的代码库,你知道,这是一个为期两周的研究任务,比如添加一些新功能,需要多个 pull request。我的意思是,就像一些高质量的、有大量监督信号供我们学习的东西。是的,我认为拥有这个会很棒。你知道,我肯定不会拒绝。你经常玩这些模型,我猜比普通人多得多。你用推理模型做了什么,你认为其他人做得还不够?一遍又一遍地向模型发送相同的提示,并获得对你可以获得的响应分布的直观感受。我看到人们在 Twitter 或其他地方进行比较时,他们会说,哦,我把同一个提示输入到 blah blah 和 blah blah,这个比那个好多了,因为,我的意思是,你知道,当我们发布时,我们谈到了这一点,是的,03 可以做很酷的事情,当它连接很多工具调用时,然后,有时对于同一个提示,它不会有那种神奇的时刻,或者它会,你知道,为你做的工作少一点。所以,是的,峰值性能确实令人印象深刻,但存在行为分布。而且,我认为人们常常不理解,当你输入相同的提示时,存在这种结果分布,并获得对它的直观感受是有用的。所以,作为终端用户,我这样做,而且我也有一个功能请求给你们产品部门的朋友。我会问,比如 Oliver 或其他人,但是,我只是想要一个按钮,假设我的速率限制或其他支持它,我想每次自动运行提示一百次,即使它非常昂贵。然后,我想让模型对它们进行排名,并只给我前一两个有趣的结果,然后让它变得昂贵。或者进行综合,对吧?你也可以综合输出,然后看看是否有某种,虽然也许你又回到了平均水平,在某种意义上相对于那个分布,或者其他什么。但它似乎很有趣。是的,也许有一些好的基础设施原因你们没有给我们那个按钮。嗯,这很昂贵,但我认为这是一个很棒的建议。是的。是的,我认为这是一个很棒的建议。你愿意为那个支付多少钱?很多。但我是一个对价格不敏感的人工智能用户。是的。我明白了。完美。应该有一个 Sarah 层作为你们的层之一。正是。正是。是的。我真的很喜欢向我们的模型发送一些我认为它们可能能够做到的事情的边缘提示,只是为了好玩。比如,很多时候,在我进行一些编程任务之前,我只是会问模型是否能弄清楚。很多时候,没有希望它能做到。而且,确实有时它会回来,我真的很失望,就像一个失望的父亲。但有时它确实做到了,而且令人惊叹,它为我节省了大量时间。所以,我有点把我们的模型当作一种背景工作提示,我只是把任务发给它们,有时它们会成功,有时不会。但无论哪种情况,如果发生了好事,总是一个好的结果。这很酷。是的。我这样做只是为了让自己感觉更好,当它不起作用时。我感到沮丧。我仍然在提供价值。正是。当它起作用时,我对自己感觉更糟。所以,它非常,时好时坏。是的。这太棒了,伙计们。谢谢。是的,非常感谢你们的到来。是的,谢谢。很有趣。感谢邀请。在 Twitter 上关注我们,网址是 no prior pod。如果你想看我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcasts、Spotify 或任何你收听播客的地方关注该节目。这样,你每周都会收到新剧集。并在 no-priers.com 注册电子邮件或查找每集节目的文字记录。