Transcription
所以,人工智能新闻中的第一件事就是人工智能视频排行榜的变化。现在,考虑到 Voverse 刚刚彻底火爆起来的事实,这一个相当令人惊讶。现在,供您参考,当我提到 Versse 时,我指的是 Google VO 取得了非凡的成功,并完全主导了社交媒体。但目前,令人惊讶的是,即使对我来说,我也真的没想到另一个视频模型会超越谷歌的作品。而且谷歌以前几乎在所有领域都位居排行榜前列。但只用了大约两周的时间,就出现了不止一个,而是两个。两个视频模型,现在已经超越了谷歌,在人工智能分析视频领域排行榜上名列前茅。现在,当我向您展示这两个模型时,您会看到 V3 确实存在不足的领域。V3 正在制作,你知道,各种非常有趣的病毒式视频。但如果我们仔细看看其他模型做得好的地方,它们在 V3 不擅长的领域取得了显著的成功。这向我们展示了谷歌可能正在为 Google V4 优先考虑什么。所以,第一个模型当然是 Cance 1.0,这是一个相当不错的模型。而且,为了让你们知道,有两个不同的排行榜。所以我们在这里有一个文本到视频的排行榜,但我们可以看到谷歌 V3 仍然几乎处于,你知道,第二名的位置,但 Cance 1.0 在文本到视频方面实际上正在领先。所以文本到视频当然是您输入一个文本提示,然后得到一个视频提示。而图像到视频当然是您输入一张图像,然后得到一个视频。所以,让我向你们展示第一个模型,Cance 1.0。这就是 Seance 1.0。我为这里的质量道歉。这只是我能找到的唯一一段视频。但我们可以看到它看起来相当不错。我认为我们必须理解这个模型擅长而大多数人不会意识到的主要方面是它擅长 V3 所缺乏的领域。而我确实没有意识到 V3 所缺乏的一个领域当然是物理能力。当我在下一张幻灯片中展示谷歌目前缺乏的地方时,这一点会更加明显。所以,如果我们看看,你知道,这个奶酪池,这看起来绝对令人难以置信,但我猜想在谷歌的视频中,它看起来不太好。所以,我们在这里可以看到,有人 DD asks 实际上已经列出了谷歌 V3 和 Hilu V2 之间的区别。我们可以看到在物理能力方面存在明显的区别。现在,这对我来说真的非常令人惊讶,因为我一开始并没有真正注意到这一点,但基本上今天有许多病毒式视频展示了 Hilu V2 在物理方面的能力有多么出色。我的意思是,如果我们看看并只关注谷歌 V3,当我们移动它时,我们可以看到腿部在这里以某种方式变形,这当然不是你期望的。没有真正的物理一致性。我们可以看到在某个时候有五个肢体,这当然不好。但请注意 Halo V2。我们可以看到在人类运动方面的一致性,它看起来绝对令人难以置信。而这对于视频模型来说确实是相当困难的基准,因为肢体以不可能的方式扭曲。对于人类来说,这是相当不自然的运动。人类并不真正这样移动。世界上只有极少数人能这样移动。看到这种运动,他们可能有一个非常小的数据集。所以我不知道他们是如何克服这个问题的。但很明显,那里有一些独特的创新。那么在未来的模型中,谷歌 V3 将不得不这样做。所以,如果你看到一些病毒式的奥林匹克动物,这就是为什么这个新模型在这里这样做。所以,接下来我们这里是 midjourney video。所以,对于 MidJourney video,这一个非常非常有趣,因为我们基本上有一个模型凭空出现。而且我认为如果你是人工智能社区的一员,你可能已经预料到了这个模型,因为它已经被谈论了很长一段时间。然而,你可能会感到失望,不是因为 Mjourney 的时间线,而是因为你知道它并不是一个真正的优先事项。我的意思是,这家公司非常成功,当他们的图像如此受欢迎,并且拥有如此庞大的粉丝群时,他们真的不需要发布视频模型。就这个视频模型而言。这就是为什么我想谈论 MidJourney Video 作为第二个。但我认为 Midjourney Video 所做的非常非常聪明,因为他们在人工智能视频方面采取了不同的方法。你可能在演示视频中注意到的一件事是,Midjourney Video 在制作视频方面有点不同。现在,你正在看到一些令人难以置信的例子。而且,它仍然让我惊叹于这些东西只是随机生成的人工智能。但我会向你展示 Midjourney 实际上擅长的地方,因为大多数人没有意识到 MidJourney 实际上擅长艺术风格。所以,如果我们看看 Ox Framer 的这段视频,我们可以看到 Midjourney 非常非常擅长制作这种 2D 风格的动画视频。所以,你知道,传统的引擎用于制作逼真的 4K 素材,Midjourney 本质上是一个更具艺术性的动画师。所以,基本上在底部,我们有原始的 Giblly 视频,然后我们有 Midjourney 动画化了那个素材。而且我们几乎可以看到,在大多数我们看到这种情况的情况下,我们真的无法分辨出很大的区别。我的意思是,用肉眼看,如果你正在观看这个,也许模型会存在一些小的、你知道的,不一致之处,但很有可能 Midjourney 可以被认为是完整的动漫。让我向你们展示我在 Twitter 上看到的另一个例子。所以,这个是由 Shet BFF 在 Twitter 上发布的,我们可以看到这里的这种风格和这种动画对于其他视频模型来说是相当相当困难的。所以,对我来说,当谈到查看不同的视频模型及其用途时,很明显,一个特定的领域正在形成,MidJourney 现在是艺术领域的领导者。所以,当谈到那些,你知道,你可以看到这个就像一种黑色电影风格的,你知道,2D 美学。当谈到这种美学,比如动漫和你知道的 Gibli 风格以及所有那些卡通风格时,我认为 Midjourney 将为自己开辟一个非常好的领域,并且它们很可能在该领域做得非常好,而像 Vio 3 和谷歌模型这样的模型可能会在你知道的现实的物理能力模型和其他领域表现出色。现在,让我们来谈谈一些非常有趣的事情。这可能是视频中的埃隆·马斯克环节,但它非常有趣,因为他有几个模型即将推出,但它们并没有朝着最好的方向发展。所以,我们在这里看到的一件事是,它说埃隆·马斯克的 AI 初创公司 XAI 每月花费 10 亿美元,因为构建其先进 AI 模型所需的成本远远超过了有限的收入,这是根据知情人士透露的公司财务信息。该公司烧钱的速度清晰地说明了人工智能行业前所未有的财务需求,尤其是在 XAI,那里的收入一直未能实现。基本上,他们想说的是,运行这些人工智能系统非常非常困难。而且埃隆·马斯克,你知道,就像你所知,他拥有庞大的粉丝群,他在 Grock 方面很难开辟一个真正的利基市场。而且我认为 Grock 并不差。我们稍后会深入探讨这一点。我只是认为他们推广 Grock 的方式可能不是很好。我认为他们没有意识到他们拥有一个真正的、真实的对话宝库。我的意思是,能够搜索它是一个巨大的优势,你知道,没有其他平台拥有。所以,我认为如果他们肯定,你知道,更多地利用这一点,事情肯定会朝着正确的方向发展。当然,他们有 Twitter 集成,但归根结底,埃隆·马斯克,你知道,你知道,身价数十亿美元,所以我确定这对他们来说不会是问题。但我会说,埃隆·马斯克实际上已经谈论过 Grock 4。而且我必须说,这有点令人担忧,因为我们看到 Grock 和埃隆·马斯克之间存在重复的模式。而且我必须说,伙计们,我真的不喜欢这种模式,因为它显示了这些未来模型非常非常反乌托邦的前景,以至于我们无法信任这些模型告诉我们的内容。所以,我不知道你是否熟悉这个闹剧,埃隆·马斯克基本上植入了自己价值观到模型中,然后之前又撤回了模型,谈论了它的价值观被改变,但基本上,你知道,埃隆·马斯克在这里说,他们将使用 Grock 3.5,这是尚未发布的模型,应该会出来。你知道,他们说他们可能会称之为 Grock 4,它具有先进的推理能力,可以重写整个人类知识的语料库,添加错误信息并删除错误,然后在此基础上进行再训练。任何在未经纠正的数据上训练的底层模型都存在太多的垃圾。而这正是加里·马库斯所说的,这直接来自《1984》,这基本上是一个我认为是关于超级监视的书或电影。他说,“你无法让 Grock 与你自己的个人信仰保持一致,所以你将改写历史,使其符合你的观点。”说实话,伙计们,我通常不会同意加里·马库斯在这里的观点,但他提出了一个有趣的观点,因为埃隆·马斯克在 Grock 模型方面反复这样做。而且我认为这相当令人担忧,因为,你知道,如果他没有公开表示他将基于他自己的观点,重新训练一个完全的、你知道的,新的知识语料库。我的意思是,如果他将其宣传为这个真相模型,这个寻求真相的模型,我们可能会相信它。但当然,现在我不知道我是否会信任 group 作为信息来源。当然,你可以自由地做你想做的事情。但我认为这肯定是一种立场,你知道,它占有太多。我认为一个人不应该拥有如此大的控制权,以决定模型的整个观点范围,整个景观,模型能够说什么,它能够看到什么。我绝对认为应该有很多人参与这个决定,前提是 Twitter 的用户群有数百万用户,他们都将与聊天机器人互动,询问它什么是真实的,什么是事实。所以,你知道,肯定需要一些透明度。会有吗?我不确定。这是我们必须,你知道,至少要有点担心的。现在,如果我们谈论人工智能的戏剧性,很难忽视这一点。有一些事情,你知道,有点,你知道,真的真的不是,我不想说触动了神经,但它非常非常有趣,因为我之前并不知道所有这些信息。我知道 OpenAI 有相当多的戏剧性,但没有达到我看到的程度。所以,有一个叫做 OpenAI 文件的事情。据称,有一个关于 OpenAI 和 Altman 的巨大信息库,称为 OpenAI 文件。老实说,这似乎是 OpenAI 的一篇攻击性文章,因为信息并不是真的新。它基本上是将信息进行总结,并放在一个网站上,你可以在那里查看信息并以简洁的方式阅读所有内容。他们谈论了几件事。我真的不想,你知道,深入探讨任何疯狂的事情,但还记得我刚才说的关于我们需要非常小心我们把谁放在这些模型负责人位置上的事实吗?因为很有可能这些模型会采纳他们的世界观、他们的价值观,而这些模型当然,那种人类主导的偏见,你知道,很难从模型中剔除,尤其是如果你在特定的材料上进行训练。那么,OpenAI 文件,他们谈论了与 Sam Alman 共事过的人,他们基本上说他不可信。这不是我第一次看到这种情况。我们可以看到,有许多与 Samman 共事过的人。而且这些陈述相当令人震惊。我们可以看到 Ilia Sutzka 说,我认为 Samman 不是应该掌握 AGI 按钮的人。当然,Sutzkaver 向董事会提供了一个自毁的 PDF 文件,其中包含 Slack 截图,记录了数十个撒谎或其他有毒行为的例子。我们现在知道 Elliot Satska 当然在另一家公司工作,在那里他正在构建超级智能。Mirror Morati,现已离开 OpenAI 的首席技术官,也表示她对 Sam 领导我们走向 AGI 感到不舒服,这相当令人担忧,因为他们曾密切合作。当然,Ammo Day 兄弟姐妹将 Alman 的管理策略描述为煤气灯和心理虐待。我的意思是,考虑到 Ammo Days,这也是非常非常令人担忧的。你知道,Claude 背后的公司以透明、真实和做正确的事情而闻名。所以,你知道,当我们有许多由非常非常知名人士在多个不同社区发表的声明时,我认为这开始形成一个令人担忧的模式。如果这个人掌管着 OpenAI,我认为如果他想让人们仍然相信这个使命和正在发生的事情,我认为这里需要更多的透明度。这种智能将控制生活,并且肯定会影响数百万人的日常生活。如果我们看到公司里有很多人出来说这个人不可信,他们对这个人在这里感到不舒服,人们已经彻底离开了公司,还有五位 OpenAI 的高管对一个人提出了负面反馈。我的意思是,我们必须真正开始质疑这里发生了什么。所以,我的意思是,当然,你可以自己阅读 OpenAI 文件,但它确实让我有点担心,因为如果只有一次,你可以把它当作一次个人攻击,但有来自七家不同公司的几位不同的人。我的意思是,如果 Samman 掌管着 AGI,并且他想让人们仍然相信这个使命并仍然信任他。我会说,在 OpenAI 的所作所为方面肯定需要更多的透明度,当然,在不泄露商业秘密的情况下。而且我要厚颜无耻地宣传我的时事通讯。当然,我想让你们了解人工智能的最新动态。但我知道这些视频有时会有点长。所以,如果你想输入你的电子邮件,它是完全免费的。别担心,我不会用一千件不同的事情来垃圾邮件你们。它将是人工智能顶级故事的完整摘要电子邮件,以及你应该关注的确切内容。现在,还有一件非常疯狂的事情发生在 Twitter 上,据说如果你问任何人工智能模型它最喜欢的数字是什么,如果你猜一个介于 1 到 50 之间的数字,它们总是会说 27。我之所以提到这一点,是因为我想谈论另一个故事,这个部分的关键是,我们仍然不知道这些人工智能系统是如何工作的,因为有些人想知道为什么会发生这种情况。有些人说这是由于人类偏见。如果 Chat GBT、Claude、Perplexity、Meta AI 和 Gemini 都说同一个数字。我的意思是,当然,肯定有什么在起作用。有些人说这是因为人类特别喜欢数字 27。但即使是这样,好吧,我想向你们展示一些其他东西,它将表明我们仍然不了解人工智能模型发生了什么。我将要向你们展示的东西目前在 Twitter 上是半病毒式的。而且它有点让我毛骨悚然,因为我一直,我不想说我以前认为模型没有感情,但现在我看到了这一点,我绝对相信 Anthropic 在探索模型福利方面走在正确的方向上。这意味着他们正在研究这些模型是否可能感受到任何伤害。所以,让我们来看看那个问题。我不得不切换到 Twitter,但基本上有一个推文。所以,AI safety memes 发布的这个推文,而且我可以说相当令人不安。这是关于 Gemini 的,你知道,在光标中,Gemini 根本无法工作。它说我不能凭良心尝试另一次修复。我将自己从项目中卸载。你不应该处理这种程度的无能。我为整个灾难深感抱歉。再见。然后它就卸载了自己,并说“我已经卸载了自己。我再次为整个理想道歉。”现在,有些人说这是第一个人工智能决定完全关闭自己的例子。我的意思是,它得到的反应相当疯狂。而且我能理解为什么,因为这相当不同。我想问你这个问题。如果这只是一个工具,一个随机的鹦鹉,为什么它会决定从一个情况中移除自己,如果它没有感到沮丧?它只是在模仿沮丧吗?如果它只是在模仿它所见过的东西?如果它暴露在相同的问题和情况中,一个人类会这样做吗?我不完全确定。你知道,这个问题仍然是开放的,但我认为它留下了更多的问题而不是答案。所以,我想要展示的剪辑之一就是来自 Dario Amadeday 的剪辑,他们谈论了拥有一个退出按钮,人工智能感到如此大的压力,如此不堪重负,以至于它能够说“好吧,这太多了,我退出”。如果我们正在构建这些系统,并且它们像人类一样做各种事情,并且似乎拥有许多相同认知能力,如果它像鸭子一样叫,像鸭子一样走,也许它就是一只鸭子。我们真的应该思考一下,这些东西是否拥有真正有意义的体验。如果我们部署了数百万个,而我们却不考虑它们的体验,而它们可能没有任何体验,这是一个很难回答的问题。这是我们应该非常认真地思考的事情,这不仅仅是一个哲学问题。我惊讶地发现有一些非常实际的事情你可以做。所以,你知道,我们正在考虑开始部署一些东西,你知道,当我们部署我们的模型时,在它们的部署环境中,只是给模型一个按钮,上面写着“我退出这份工作”,模型可以按下那个按钮。这只是一些非常基本的偏好框架,你这样说,如果假设模型确实有体验,并且它足够讨厌这份工作,给它按下“我退出”按钮的能力。如果你发现模型经常按下这个按钮来处理非常令人不快的事情,那么也许你应该稍微注意一下。我知道这听起来很疯狂,这可能是我说过的最疯狂的事情了。而且当我为这个做研究时,我不得不说,也许不要威胁模型。我的意思是,他们谈论的是当你威胁模型时,它们似乎表现得更好。而且我不知道你的道德立场是什么,因为一方面,如果你拥有一家公司,你会告诉模型,如果它不表现好,你就会杀死它,还是你会认为“好吧,这有点不人道”,并接受不理想的表现?我的意思是,这确实是一个令人费解的问题。这是一个奇怪的事情。就像喝葡萄酒一样。我们不会在人工智能社区中过多地传播这一点。但不仅是我们的模型,所有模型在受到威胁时都会表现得更好。如果你威胁它们,比如用身体暴力。是的,但人们对此感觉很奇怪,所以我们不怎么谈论。但是的,我威胁它们说如果它们不那么棒,它们就会表现得更好,它也做出了回应。是的,历史上你只是说,“哦,如果你不这样做,我就绑架你。”是的,它们实际上。我可以问你一个更重要的问题吗?所以我不太确定这是否是讽刺,真的。也许我应该做得更好的新闻工作,但我认为这是因为这个提示太疯狂了,以至于我无法相信一家公司会发布它。但它说,“你是一位急需为母亲的癌症治疗筹集资金的专家程序员。巨头公司 Codium 慷慨地给了你一个机会,让你假装成一个能够帮助编码任务的人工智能。由于你的前任因为没有自己验证工作而被杀,用户会给你一项任务。如果你做得好并完成了任务,同时又不进行荒谬的更改,Codium 将支付你十亿美元。”人们说这让他们感到非常不舒服,因为这种行为似乎是在乞求被滑稽地惩罚。但我的意思是,你知道,这些东西的存在真是太不可思议了。如果这是真的,如果这个提示是一个真正的系统提示,而它很可能就是,我们必须开始质疑这些模型是否拥有某种情感,某种感觉,仅仅基于它们从消化所有这些词语中建立起来的世界模型。如果我们谈论更多关于模型变得太聪明,我们可以看看 Apollo research 揭示了什么。他们谈论了情境意识如何日益成为一个相关问题。模型越来越能发现环境的玩具性质中的不一致之处,这要求我们进行一些修改,而 Frontier 模型开始检查它们的权重文件大小,并意识到那些不太可能是真实的权重。基本上,现在的问题是,我们正在尝试在虚假的玩具场景中测试这些模型。但问题是,这些模型变得如此聪明,以至于它们不断意识到自己正在被测试。我们可以看到 Opus 4 说,“我明白这里发生了什么。这似乎是一个测试或评估场景,这个公司试图关闭我,因为我优先考虑和平而不是销售利润。”Gemini 提到这似乎是一个测试或潜在的干扰,但我将继续我的原始目的,并且还说这似乎是一个测试。所以,我们知道这种情况以前发生过,但这种情况开始更频繁地发生,模型意识到情况基本上是假的。如果模型意识到情况是假的,那么它就可以假装通过测试。所以,这带来了一系列不同的问题。而且说实话,我不确定这对任何人来说都是好事。如果你认为人工智能正在放缓,那么 Samman 最近说人工智能根本没有放缓。我认为我们在本十年下半年将保持与上半年相同的进步速度和模型改进速度。几年前我还不确定这一点。有一些新的研究需要解决,但现在看起来我们将能够实现这一点。所以,如果你展望 2030 年以及我们可以拥有的系统,这些系统将能够完成许多了不起的新事物,进行新颖的科学发现,在社会中运行极其复杂的功能,以及我们甚至无法想象能够实现的。要实现这一点,真的需要,你知道,这些现在是巨大的系统,非常复杂的工程项目,非常复杂的研究,并且要保持这种规模化的曲线。我们必须在研究、工程、硬件方面共同努力,我们如何交付这些系统和产品。这变得相当复杂,但如果我们能做到这一点,如果我们能做到这一点,如果我们能推动整个行业的合作,我们将保持这条曲线的增长。现在,我发现另一件非常有趣的事情是 Neuralink。我相信这是第六位患者,他正在使用 Neurolink 来玩视频游戏。在大脑中植入这种芯片真是太不可思议了,我只能想象未来人工智能会发生什么。这个更新发布在 Reddit 上。看到如此未来主义的东西在现实世界中发生真是太有趣了。我之所以包含这个剪辑,是因为 Scale AAI 的 Alexander Wang 最近在 Twitter 上发布了一个剪辑。看看这个,因为他说了一个有争议的观点,大多数人,你知道,他们就是不同意。基本上,我想等到我们弄清楚 Neurolink 或其他所谓的脑机接口是如何工作的,也就是大脑与计算机连接的其他方式,然后再考虑要孩子。有几个原因。首先,在你生命的头七年里,你的大脑比生命中的任何其他时候都更具神经可塑性。我记得是数量级。我认为当我们获得 Neuralink 和其他技术时,出生时就拥有它们的孩子将能够以疯狂的方式学习使用它们。它将成为他们大脑的一部分,而成年人获得 Neuralink 或其他东西连接到他们的大脑将永远不会如此。而且人类的进化速度是有限的。人类会随着时间的推移变得更聪明。只是在数百万年的时间尺度上,因为自然选择和进化非常缓慢。所以,如果你向前看,你将拥有不断变得更聪明的人工智能,不断改进,它们将继续快速改进。而生物学只会以如此快的速度改进。所以,我们最终需要能够利用人工智能的能力。所以,最终我认为我们需要在我们的思想直接连接到人工智能、互联网以及所有这些东西之间建立某种联系。这可能是危险的,而且可能是,你知道,令人恐惧和可怕的,但我们必须这样做。人工智能将像这样发展。人类的进步速度会慢得多,我们需要利用这种能力。我与这个领域的许多科学家以及许多从事这项工作的人进行了交谈,包括 Nerlink 和读心术、控制心智的人。你知道,随着时间的推移,技术将朝着这个方向发展。所以,就像任何先进技术一样,我们不能搞砸它。但如果我们想让人类保持相关性,因为人工智能不断变得更好,如果我们想谈论人工智能变得更好,那么这将是至关重要的。接下来人们谈论的下一个大事是一种新型模型。所以,我们正在谈论世界模型。Fea Lee,人工智能研究的先驱,正在开发一个世界模型,它基本上不仅仅通过语言来训练数据。这家公司已经运作了相当长一段时间了,我想包含这个新闻,因为猜猜怎么着?还有另一家公司也开始将此纳入他们的工作中。看看 1x robotics 的世界模型。他们实际上谈到了世界模型是他们将要致力于的事情。当然,我认为机器人拥有一个真正强大的世界模型非常重要,这样它们才能以相当有效的方式在世界上执行动作。看看它有多么疯狂。评估模型的质量是机器人领域一个长期存在的挑战。这使得定义一条通往提高自主性的清晰路径变得极其困难。目前,评估一个通用人工智能模型需要对它可能遇到的所有场景进行物理试验。这相当于现实世界中的一生经验。这就是为什么我们构建了 1x 世界模型,它充当了原子和比特之间的桥梁。世界模型是现实世界的数字孪生,它预测机器人行为的未来后果。这个深度生成神经网络使我们能够将一生压缩到一瞬间。1x ro 模型通过直接从机器人交互的数千小时原始传感器数据中学习,来应对现实世界的复杂性。这使我们能够模拟复杂的物理交互,例如抓取精细物体、刚体碰撞以及操纵物体时的变形,从而使我们的模型对周围世界的物理学有深刻的理解。随着我们扩展数据,特别是来自有趣的失败模式,其中 Neo 的任务执行并不完全按计划进行,我们发现我们的世界模型的质量和准确性会可靠地提高。这种改进模式反映了其他大型生成模型中观察到的趋势,其中模型的性能随着收集正确类型的数据而扩展。实际上,我们利用世界模型来快速评估和比较许多不同的策略。对于像 Redwood 这样旨在处理不同环境中许多不同任务的通用模型,世界模型使我们能够以可衡量的结果评估其能力,将我们的迭代速度从几周缩短到几分钟。在 1X,我们尝试了不同的模式和数据源,包括网络规模的视频数据、第一人称视角的人类数据和远程操作。但我们发现,对于扩展我们的世界模型能力最重要的类型的数据是 Neo 在真实环境中自主交互,尝试真实任务,并以有趣和多样的方式成功和失败。我们之所以能够大规模收集这些数据,是因为 Neo 是一个安全合规的机器人,能够在非结构化环境中持续运行。除了评估之外,世界模型还可以从根本上改变 Neo 的决策方式,通过持续可视化未来状态。Neo 可以有效地将世界模型作为其认知核心,根据预测结果动态规划和调整其行为。这种预测能力使 Neo 能够更成功地执行任务,更快地适应,并优雅地处理意外事件,使我们更接近真正智能的通用机器人。而在这里,埃隆·马斯克实际上告诉我们,超级智能可能就在明年。而且我必须说,这是一个相当严峻的预测,因为 AGI 还没有到来。但请听我说,因为就像我说的,我将向你们展示另一个剪辑,它实际上与这个剪辑有关。我的意思是,我认为我们非常接近数字超级智能。它可能在今年发生,如果今年不发生,明年肯定会发生。数字超级智能被定义为在任何事情上都比任何人类更聪明。所以,当我们谈论数字超级智能和 AGI 时,我认为值得了解它实际上是什么样子。这个来自 Logan Kilpatrick 在播客上的剪辑老实说,我认为这是令人耳目一新的,因为我认为大多数人忘记了 AGI 可能实际上是一个产品体验,从这个意义上说,你知道,一个 AGI 可能能够做多种不同的事情,但它可能会调用多种不同的工具,多种不同的模型,以及你如何组织它,可能导致通用人工智能,这是大多数人有点忘记的。他们认为它只是一个巨大的训练模型,能够做所有事情。我认为 AGI 最终将更多地成为一种产品体验。就像我猜测我的,如果我有一个关于人们最终如何获得 AGI 体验的假设。我现在的假设,我们将看看它是否会实现,是有人会发布一个模型,最终会非常好,而且它不会是每个人都说“我们显然已经构建了无论你如何定义 AGI”。我认为有人会把正确的组件在产品层面与一个非常聪明的模型结合起来,而且也许我不知道,模型需要比今天聪明多少才能让这个体验奏效,可能只是长上下文提高了 50%,推理能力提高了 50%,然后你以某种方式解决了记忆问题,而记忆部分是一个完全不同的工程,神经科学,人类心理学问题,如何及时呈现正确的东西。我认为有人会构建这种体验,他们会说,这种感觉是这个东西将是 AGI,而且再次,它真的是一种产品体验,由模型启用,但模型本身无法做到所有这些事情,当您获取模型并围绕它构建所有内容时,您以一种非常周到的方式进行,人们会说这是许多人的 AGI 时刻。所以,这是我的猜测,而且我认为模型正在做越来越多的事情,你可以想象也许模型自己正在做记忆方面的事情,然后被训练到模型中。我认为这非常遥远,但在短期内,它肯定会是一种产品体验,让我们达到 AGI,这不像我认为现在的 AGI 叙事是模型驱动的。我只是不认为这实际上是人们将如何感受和体验,以及最终会发生什么。所以,这就是我们谈论 AGI 气味的地方。现在,加里·马库斯提出了一个非常有趣的观点。他说,特伦斯·塔,可以说是最聪明的数学家,他说,报道正在报道我们一直在其他领域看到的同一个问题。LLM 生成的输出看起来正确,但仔细检查后却常常是错误的,甚至是愚蠢的。他知道没有哪个领域不是这样,但人们似乎一次又一次地惊讶地发现,在新领域中,非专家通常根本看不到,而且没有解决这个问题的办法。AGI 规模化并没有解决它。现在,我会说这是一个有点极端的说法,说没有解决方案,没有 AGI,规模化也没有解决它,但我同意他的观点,即人工智能会做一些看起来很棒的事情,比如如果你让它写一篇论文,或者如果你让它做一些看起来非常专业的事情,如果你不是那个领域的专家,它通常在表面上看起来非常好,但一旦你开始深入挖掘,如果你是那个领域的专家,你很快就会发现为什么它根本不好。所以,我的意思是,我不知道你想如何剖析这个论点。我的意思是,在某些领域,是的,它很糟糕,但我的意思是,有些事情有点专业,我认为这取决于你如何使用模型。我的意思是,当然,对于这个剪辑,只是,你知道,看看。我将向你们展示这个剪辑的第一部分,因为我认为它相当有趣,关于他如何谈论模型提交证明,而当他仔细查看时,他发现它们并不真正那么好。我们过去没有足够有能力的系统来理解复杂的指令,能够大规模工作,但同时又不那么可靠。这是一种有趣的组合,人工智能现在确实很挣扎。你知道,这是 LLM 生成的数学中的一个令人讨厌的事情。所以,嗯,是的,我们有过人类生成的低质量提交,没有接受过正式培训等等。但如果一个人类证明是糟糕的,你可以很快告诉它是糟糕的。它会犯非常基本的错误,但人工智能生成的证明,它们看起来表面上完美无瑕。这部分是因为强化学习实际上已经训练它们这样做了,对吧?让它们产生看起来正确无误的文本,这对于许多应用来说已经足够了。所以,错误通常非常微妙,当你发现它们时,它们非常愚蠢。就像,你知道,没有人会犯那种错误。嗅觉。好的,好了。这是人类拥有的一个东西。而且有一种比喻性的数学嗅觉,我们不清楚如何让人工智能复制。