📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

No Priors Ep. 95 | Best of 2024

No Priors: AI, Machine Learning, Tech, & Startups27:07

Transcription

[掌声] 大家好,希望你们 2024 年过得非常精彩。回顾这一年,我们想为大家带来一些我们最喜欢的对话的精彩片段。首先,我们有一个与英伟达(Nvidia)的首席执行官黄仁勋(Jensen Huang)的精彩对话。英伟达是推动人工智能革命的公司。自 2023 年我们与黄仁勋的“无先知”(No Prior)对话以来,英伟达的股价已翻三倍,在 2024 年的每个月都增加了近 1000 亿美元的价值,并跻身 3 万亿美元俱乐部。最近,黄仁勋再次与我们分享了他的观点,这次他谈到了为什么英伟达不再是一家芯片公司,而是一个数据中心生态系统。这是我们与黄仁勋的对话。

英伟达已经进入了更大、更大的支持客户的单位。我想象它从单个芯片到服务器再到机架。你如何看待这种进展?接下来会是什么?英伟达应该做整个数据中心吗?事实上,我们建造了完整的数据中心,就像我们建造一切一样。除非你在建造,如果你在开发软件,你需要计算机的完整体现。我们不制作 PowerPoint 幻灯片然后出货芯片,我们建造整个数据中心。直到我们建造好整个数据中心,你怎么知道软件是否有效?直到我们建造好整个数据中心,你怎么知道你的网络是否有效?以及你期望的所有效率?你怎么知道它真的能在规模上起作用?这就是为什么,这就是为什么看到某人的实际表现远低于 PowerPoint 幻灯片中显示的峰值表现并不罕见。计算已经不再是它曾经的样子了。你知道,我说新的计算单位是数据中心。对我们来说就是这样。所以这就是你必须提供的,这就是我们现在建造的。我们建造了整个这样的东西,然后我们为每一个细节,关于每一个组合,风冷的 x86,液冷的 Grace,以太网,InfiniBand,MVLink,你知道我的意思吗?我们建造了每一个配置。我们公司今天有五个超级计算机。明年我们将轻松再建造五个。所以如果你对软件是认真的,你就建造自己的计算机。如果你对软件是认真的,那么你就会建造你的整个计算机。我们以规模化方式建造它。这是最有趣的部分。我们以规模化方式建造它,并且我们垂直整合地建造它。我们对其进行优化,全栈式,端到端。然后我们分解一切,并将其作为零件出售。这是我们所做的事情中完全非凡的部分。其复杂性简直是疯狂的。原因在于,我们希望能够将我们的基础设施嫁接到 GCP、AWS、Azure、OCI。所有这些的控制平面、安全平面都不同,它们对集群大小的看法也不同。但是,我们使它们能够容纳英伟达架构,以便 CUDA 能够无处不在。这最终是我们希望拥有的一个计算平台,开发人员可以使用,并且在很大程度上是一致的,除了这里或那里 10% 的差异,因为人们的基础设施优化方式略有不同。但是,他们构建的一切都将在任何地方运行。这是软件的一个原则,永远不应该放弃。我们非常珍视它。它使我们的软件工程师能够一次构建,随处运行。这是因为我们认识到软件投资是最昂贵的投资。而且很容易测试。看看整个硬件行业的规模,再看看世界各行业的规模。这是 1 万亿美元,在这个 1 万亿美元的行业之上。这告诉你一些事情。你构建的软件,你必须,你知道,基本上在你活着的时候都要维护它。

当然,我们必须提到我们与可爱的 Andrej Karpathy 的对话,在那里我们深入探讨了人工智能作为外脑(exocortex)的未来,作为人类认知的延伸。Andrej 是人工智能发展中的关键人物,从 OpenAI 到 Tesla,再到我们所有人的教育。他分享了关于人工智能模型的所有权和访问权的挑衅性观点,并提出了一个论点,即为什么未来的模型可能比我们想象的要小得多。

如果我们谈论的是一个外脑,感觉这是一个非常根本重要的东西,需要民主化访问。你如何看待当前人工智能研究的市场结构?你知道,有少数大型实验室实际上有机会进行下一代训练。这如何转化为人们未来可以获得的东西?所以你可能在暗示的是生态系统的现状,对吧?我们有几个封闭平台组成的寡头垄断,然后我们有一个开放平台,它有点落后,比如 Llama 等等。这有点像开源生态系统的镜像。我确实认为,当这些东西开始,当我们开始将其视为外脑时。在加密货币中有一句话,叫做“不是你的钥匙,就不是你的”。那么,如果“不是你的权重,就不是你的大脑”,这种情况会发生吗?这很有趣,因为一家公司实际上在控制你的外脑,因此它开始感觉有点侵入性。如果这是我的外脑,我认为人们会更加关心所有权。是的,你意识到你正在租用你的大脑。租用你的大脑似乎很奇怪。思想实验是:你愿意放弃所有权和控制权来租用一个更好的大脑吗?我愿意。是的,是的,我认为这就是权衡。我认为我们将看到它如何运作。但也许可以通过默认使用封闭版本来做到,因为它们很棒,但在各种情况下你都有一个后备方案。我认为这大致是今天事物的发展方向。即使是现在,当一些封闭源提供商的 API 出现故障时,人们就开始实现后备方案,比如他们完全控制的开放生态系统,他们从中感到赋权。所以,也许这只是大脑的延伸,如果发生任何事情,你就会退回到开源的东西。但大多数时候,你实际上……所以开源的东西继续发展非常重要。我认为是,100%。这并不是一个显而易见的问题,也不是人们现在可能同意的问题。但我认为,100%。我猜我一直在想的一件事是,在某种意义上,你能获得的最小的性能模型是什么?无论是参数大小还是任何你想要思考的方式。我有点好奇你的看法,因为你对蒸馏和小型模型都想了很多。我认为它可以出奇地小。而且我确实认为,目前的模型浪费了大量的容量来记住不重要的事情。它们记住哈希值,它们记住古代的东西,因为数据集没有经过精心策划。是的,正是如此。而且我认为这将会消失。而且我认为我们只需要达到认知核心。而且我认为认知核心可以非常小。它只是这个思考的东西。如果它需要查找信息,它知道如何使用不同的工具。是 30 亿参数吗?是 200 亿参数吗?我认为即使是十亿,我们可能会达到那个点。模型可以非常非常小。而且我认为它们之所以可以非常小,根本原因在于,我认为就像蒸馏有效一样,也许我唯一要说的是蒸馏效果出奇地好。蒸馏是指你得到一个非常大的模型,或者大量的计算,或者类似的东西,来监督一个非常小的模型。

我们与 OpenAI 的董事会成员、Sierra 创始人 Brett Taylor 的对话描绘了一幅我们未来与企业互动方式的截然不同的图景。以下是 Brett 解释公司代理以及为什么网站将退居次要地位的片段。

另一个类别,也是我的公司 Sierra 工作所在的领域,是我称之为公司代理的领域。它实际上更多的是关于自动化或自主性,而不是简单地关于自动化或自主性。在这个对话式人工智能的世界里,你的公司如何在数字世界中存在?我总是用一个比喻,如果是在 1995 年,你知道,如果你在数字世界中存在,就意味着拥有一个网站并出现在 Yahoo 目录中,对吧?在 2025 年,数字世界中的存在可能意味着拥有一个品牌 AI 代理,你的客户可以与之互动,以完成他们在你的网站上可以做的所有事情。无论是询问你的产品和服务,进行商业交易,还是进行客户服务。我认为这个领域现在已经准备就绪,可以使用当前的技术。因为,再次强调,像基于角色的代理,这并不是在技术上“烧开水”。你为你的客户体验制定了明确定义的流程,你拥有明确定义的系统,这些系统是你记录的系统。而且,在这个从网站到应用程序再到现在的对话式体验的世界里,关键在于你想围绕你的品牌打造什么样的对话式体验。这并不意味着它完美或容易,否则我们就不会创办一家公司来做这件事了。但至少它是明确定义的。而且我认为,现在在人工智能领域,如果你正在研究通用人工智能,你对代理的定义可能意味着不同的东西。这没关系。这只是一个需要解决的不同问题。但我认为,尤其是在 Sierra 工作和你们许多公司投资的领域,只是说,现在是否有使用现有技术的“准备就绪”的机会?我绝对认为有。你能描述一下构建公司代理的“挖掘”周期吗?研究与现实之间的差距有多大?你的工程团队投资什么?你如何理解不同客户环境的范围?就像这里的投资向量是什么?也许作为起点,定义 Sierra 今天为客户提供的产品,然后你希望它走向何方,然后也许我们可以将其反馈到它的组成部分中。因为我认为,显然,你在你的垂直领域中崭露头角,但对于观众来说,了解你的关注点会很好。是的,当然,我将举几个例子来具体说明。所以,如果你购买一个新的 Sonos 扬声器,或者你的扬声器出现技术问题,你就会看到那个可怕的闪烁的橙色指示灯。你现在将与 Sonos AI 聊天,它由 Sierra 提供支持,以帮助你入门,帮助你调试,无论是硬件问题,Wi-Fi 问题,诸如此类的事情。如果你是 SiriusXM 的订阅者,他们的 AI 代理名为 Harmony,我认为这是一个令人愉快的名字。它涵盖了从升级和降级你的订阅级别,到当你购买新车时获得试用,广泛地与你谈论它。总的来说,我认为我们帮助公司构建品牌客户面对的代理。品牌化是一个重要的组成部分。它是你品牌的一部分,是你品牌体验的一部分。而且我认为这非常有趣和引人注目,因为我认为就像,回到那个比喻性的 1995 年,你的网站在你的名片上,这是你第一次拥有某种数字存在。而且我认为同样的创新,而且我们可能会回顾今天的代理,带着同样的感受,“哦,那很古雅。”我记得如果你回到 Wayback Machine,看看早期的网站,要么是某人的电话号码,仅此而已,要么看起来像 DVD 介绍屏幕,有很多图形。很多客户开始使用的代理通常围绕客户服务领域,这是一个很好的用例。但我确实相信,如果你快进三到四年,你的代理将涵盖你公司所做的一切。我之前用过这个例子,但我喜欢它。想象一下一家保险公司,当你与他们互动时,你可以做的一切。也许你在提交索赔,也许你在比较计划。我们之前谈到了我们的孩子,也许你在孩子够大到可以考驾照时,将他们添加到你的保险费中。以上所有这些,你的代理都将完成。这就是我们正在帮助公司构建的。

接下来,我们与 OpenAI 的 Sora 团队进行了交谈,他们正在构建一个极其逼真的视频人工智能生成模型。在这个片段中,我们讨论了他们的研究以及理解世界的模型如何融入人工智能的道路。

关于你用 Sora 所做的工作,它如何影响更广泛的研究路线图?你有什么可以说的吗?我认为这里有一个关于 Sora 从所有这些视觉数据中学习到的世界知识的问题。它理解 3D,这是一件很酷的事情,因为我们没有训练它,我们没有明确地将 3D 信息植入其中。我们只是在视频数据上训练了它,它就学会了 3D,因为 3D 存在于那些视频中。它学会了当你咬汉堡时,你会留下咬痕。所以它学到了很多关于我们世界的东西。当我们与世界互动时,我们的大部分是视觉的。我们一生中看到和学到的很多东西都是视觉信息。所以我们真的认为,就智能而言,就走向更智能的人工智能模型而言,它们更好地理解世界,就像我们一样,拥有这种基础知识将非常重要:嘿,这就是我们生活的世界。它有如此多的复杂性,人们如何互动,事物如何发生,过去事件如何影响未来事件。这将导致比生成视频更广泛的更智能的人工智能模型。这几乎就像你发明了未来的视觉皮层加上大脑的推理部分。是的,这是一个很棒的比较,因为人类的许多智能实际上是关于世界建模的。我们一直在思考我们将如何做事,我们在脑海中模拟场景。我们在梦中模拟场景。我们在做事情之前就进行思考。如果我这样做,这件事就会发生。如果我做另一件事,会发生什么?所以我们有一个世界模型。构建 Sora 作为世界模型与人类智能的很大一部分非常相似。你们如何看待人类拥有一个非常近似的世界模型,而不是像传统意义上的物理引擎那样精确的东西?因为如果我拿起一个苹果然后扔掉它,我期望它以一定的速度落下。但大多数人类并不认为这是通过计算来阐述一条路径和速度。你认为这种学习在大模型中是并行的吗?我认为这是一个非常有趣的观察。我认为我们思考事物的方式是,这几乎就像人类的一种缺陷,它不是那么高保真。所以,你知道,事实上,我们无法进行非常精确的长期预测,当涉及到非常狭窄的物理学时。这是我们可以通过这些系统改进的东西。所以我们很乐观,Sora 将会超越这种能力,并且我们将在长远来看,使其成为比人类更智能的世界模型。但它确实是一个存在证明,即它对于其他类型的智能来说并非必需。尽管如此,Sora 和未来的模型仍然可以改进。

所以很清楚,扔足球的轨迹预测在下一代模型中会比我的好。如果我可以补充一点,这与规模范式有关,以及我们想要的方法,随着计算量的增加而变得越来越好。在这个范式中,做简单但具有挑战性的任务,即预测数据,效果非常好。你可以尝试提出更复杂的任务,例如不直接使用视频,而是可能在一个模拟近似事物的空间中。但所有这些复杂性实际上并没有益处,当涉及到方法随着规模的增加而改进的规模定律时。而随着规模的增加,效果非常好的是预测数据。这就是我们用文本所做的,我们只是预测文本。这就是我们用 Sora 对视觉数据所做的,我们没有做一些复杂的尝试来弄清楚一些新的东西来优化。我们说,嘿,以可扩展的方式学习智能的最佳方法就是预测数据。这与你所说的 Bill 有关,预测将变得更好,没有必要的限制来近似。没错。人类,我们也坐下来与我们公司的联合首席执行官 Dimitri Dolgov 进行了交谈。该公司正在扩大其自动驾驶车队,每周在旧金山和凤凰城等城市完成超过 10 万次完全自动驾驶的行程。这是我最喜欢的旅行方式。Dimitri 在这次旅行中解释了为什么实现完全自主,完全移除驾驶员,以及实现 100% 的准确率而不是 99.99% 的准确率比看起来要困难得多。

为什么它会与,比如说,先进驾驶员辅助系统不同,后者似乎在越来越多的场景中有效,而完全自动驾驶呢?区别是什么?是数字的数量,以及这个问题的性质。如果你想想我们从 2009 年开始,我们最早的里程碑之一,我们为自己设定的目标之一是驾驶 10 条路线,每条路线 100 英里,遍布湾区,高速公路,旧金山市中心,太浩湖周围,一切。你必须在没有干预的情况下行驶 100 英里。所以汽车必须从头到尾自动驾驶。这就是我们为自己设定的目标。大约十几个我们,花了大约 18 个月,我们实现了。2009 年,没有 ImageNet,没有 Condet,没有 Transformers,没有大型模型,没有小型计算机。你知道,开始很容易。它一直都是这样。随着每一波技术浪潮,它一直都非常容易开始。但那个难题,它有点像,曲线的早期部分变得越来越陡峭。但复杂性不在那里。复杂性在于许多许多九个数字的长尾。如果你去原型,如果你去驾驶员辅助系统,你不会看到它。这就是我们一直在投入所有精力的地方。这才是问题的唯一难点。而且我认为,如今,随着每一次技术周期,它一直变得越来越容易。如今,你可以利用人工智能的所有进步,尤其是在生成式人工智能和大型语言模型领域。你可以采用几乎现成的 Transformer。VMS 很棒。你可以采用一种可以接受图像或视频的 VM,它有一个解码器,你可以给它文本提示,然后输出文本。你可以用一点点数据对其进行微调,从摄像头数据到汽车,而不是单词到轨迹或任何决策。你只是把它拿来,因为它是一个黑盒子。你把它拿来,它经过了很长时间的训练,你稍微微调一下。你知道,我认为如果你问任何一位优秀的计算机科学毕业生,他们今天都会这样做。而且开箱即用,它非常棒。Transformer 的力量和 V 的力量令人难以置信。所以只需一点努力,你就可以在路上行驶,它会让你大吃一惊。但那足够吗?这足以移除驾驶员并行驶数百万英里,并拥有比人类更好的安全记录吗?不。我认为,随着每一次技术演进和人工智能的突破,你都会看到这一点。

接下来,我们请来了我亲爱的朋友,Figma 的首席执行官 Dylan Field。Dylan 分享了他对人工智能驱动的世界中用户界面将如何演变的预测。虽然许多人预测将转向对话式或代理式界面,但 Dylan 建议新的界面范式将补充现有的范式。他还强调了视觉人工智能和智能摄像头作为输入方法的下一个前沿的激动人心的潜力。

你如何看待 UI 的整体转变,这将随着人工智能的到来而到来?在短期内,许多事情都汇聚到聊天界面。有很多人在谈论一个未来的代理世界,它完全消除了大多数 UI,只有程序化的东西在后台发生。你如何看待 UI 的整体发展方向?我现在认为,这有点回到了我之前提到的兔子洞。是的,在代理方面有很多创新。但我认为,就我们使用 UI 与代理交互的方式而言,我们才刚刚开始。而且我认为界面将变得更加复杂。但即使它们没有,我怀疑这就像任何新的媒体类型一样,当它被引入时,旧的媒体类型就不会消失。就像你有了 TikTok,并不意味着你不再观看 YouTube。即使事实是,一种新的交互形式是通过聊天界面,我甚至不确定我是否相信这一点。但即使我们以这个为先验,那么我认为你仍然拥有 UI。而且我认为你拥有更多的 UI 和更多的软件。你对多模态有什么预测吗?你认为需要更多的语音吗?所以,你知道,人们有很多争论,什么时候你会使用语音,什么时候使用文本,以及其他类型的界面。而且你可以想象各种方向的论点,关于什么时候使用什么,以及诸如此类的事情。而且很多人,不是很多人,有些人认为,由于多模态模型的兴起,你会获得更多的语音输入或类似的东西,因为你将能够实时进行智能的、上下文的、语义的理解,就像对话一样。所以你将拥有更多口头对话式 UI,而不是基于文本的 UI。所以它会改变你对设计的思考方式。我只是好奇你是否对这种面向未来的东西有任何想法。在各种情况下,语音 UI 都非常重要。而且我认为,我们可能会发现语音 UI 开始映射到更传统的 UI,因为这是你可以更普遍地做的事情。但是的,我个人不想整天通过语音导航我每天与之互动的信息空间。我也不想在 Vision Pro 中像《少数派报告》那样做。也许用键盘和鼠标,以及一套很棒的 Vision Pro 显示器设置或 Oculus,那可能很酷。但我不喜欢做《少数派报告》那样的事情。所以这很有趣。我认为我们得到了这些新的互动模式的瞥见,它们非常酷。而且自然的倾向是推断并说它们将对一切都有用。而且我认为它们有自己的作用。而且这并不意味着它们将在我们进行的每一次互动中无处不在。但这是一种自然的周期。而且我认为这是好的,健康的,有这种几乎狂热的围绕着它不能做什么。因为如果你没有它,你就无法发现它。所以我支持人们尽可能多地探索,因为这就是我们如何推进人机交互,以及如何弄清楚如何使用计算机,并发挥其最大潜力。我非常看好的一件事是,我敢说,你只是把它当作一种输入模式或一种外围设备。但人们很难用视觉来描述事物。所以智能相机的想法,即使是最基本的意义上。哦,它奏效了。它奏效了。我认为这是一个非常有趣的空间,就像你说的,探索。因为我实际上认为它会很有用。而且这是每个用户都能做到的。拍照,录像。所以我认为那会是,我对那很看好。

为了总结我们 2024 年最喜欢的时刻,我们请来了 Scale 的首席执行官 Alexander Wang。在这个片段中,他分享了他对通往 AGI 之路的宏大见解。Alex 还深入探讨了为什么人工智能的泛化比许多人想象的更难,以及为什么解决这些细微问题和在评估中提供更多数据是推进这项技术的关键。

你对人工智能有什么信念,而其他人不相信?我最大的信念是,通往 AGI 的道路更像是治愈癌症,而不是开发疫苗。我的意思是,我认为,建造 AGI 的道路将是,你将不得不解决许多小问题,而解决一个问题到下一个问题之间没有太大的正杠杆作用。而且只是,就像治愈癌症一样,你必须深入研究每一种癌症,并独立解决它们。最终,在几十年的时间里,我们将回顾并意识到我们已经建造了 AGI,我们已经治愈了癌症。但到达那里的道路将是,一条相当缓慢的道路,解决个体能力问题,并建立个体数据飞轮来支持最终任务。而我认为,行业中的许多人将通往 AGI 的道路描绘成,最终我们将“叮”地一下就到了,我们将解决它,一次性解决。我认为这对你如何思考技术弧线以及社会将如何应对它有很多影响。我认为这实际上是一个非常乐观的社会适应技术的案例,因为我认为这将是相当长一段时间的持续缓慢进步,社会将有时间完全适应所开发的技术。当你说的“一次解决一个问题”时,如果我们稍微脱离这个类比,我应该认为多步推理的普遍性非常困难,正如你所知,蒙特卡洛研究并不是人们认为的答案。我们会遇到规模限制。解决多个问题的维度是什么?我认为根本的主要问题是,我认为这些模型具有非常有限的普遍性。即使是多模态,例如,据我所知,在一个模态中学习对其他模态没有正向迁移。所以,例如,从大量视频中学习对你的文本问题帮助不大,反之亦然。所以我认为这意味着,每一种能力领域或每一种能力区域,都需要单独的数据飞轮来推动和提高性能。你还不相信英伟达是世界模型的基石,这有帮助吗?我认为这是一个很棒的叙事。我认为目前还没有强有力的科学证据。也许将来会有。但我认为,基本情况是,模型没有多少普遍性。所以我们实际上只需要慢慢解决许多许多小问题,最终解决 AGI。

非常感谢您的收听。在 2024 年,我们非常享受与那些正在重塑世界以适应人工智能的人们的对话。如果您想更深入地探讨今天听到的任何对话,我们已将完整剧集链接到描述中。请告诉我们您想听谁的讲话,以及您明年的问题。节日快乐。在 Twitter 上关注我们 @no-prior-pod。如果您想看到我们的脸,请订阅我们的 YouTube 频道。在 Apple Podcast、Spotify 或任何您收听播客的地方关注该节目。这样您每周都会收到新剧集。注册电子邮件或查找每集节目的文字记录,网址为 no-prior.com。

[音乐]