Transcription
但扎克伯格给予我们的唯一尊重是,我必须说,我非常惊讶西方科技界有更多的人没有意识到这一点。它是世界上增值最快的资产。所以,在某个时候,要意识到我们正在参与一个比我们最初想象的要大得多的游戏,而且我们实际上是在人们认为我们在竞争的时候将它授权给了 Facebook,他们当时正在使用我们的技术。这是可行的。显然,英伟达不会对此感到高兴,因为他们不喜欢价格差异,因为这会抢走他们的 GPU。欢迎收听今天的《几乎是人类》节目,主持人是 Zev Pman 和 Lyrix。Zev 和 Lyrix 在实时生成视频的能力方面处于领先地位。更重要的是,在节目中,我实际上了解到他们是在终端设备上完成的。所以,他们可以在移动设备上进行实时视频生成。这是最有趣的领域之一,因为它今天发展得非常快。而那些能够根据用户偏好即时创建内容的人,将在未来几年内成为许多公司的赋能者。[音乐]嘿,AI 视频生成一直非常火爆。我们都在疯狂地制作视频。有时提示有效,有时无效。而你们刚刚发布了 LTX2 作为 Lyrix 的一部分,这是你们作为一家产品公司思考方式的重大转变,我们将对此进行讨论,但如果你们看看 LTX,为什么它是一个如此重要的版本,你们会怎么说?为什么人们应该注意?我认为有一系列重大的技术趋势,我们花了一段时间才弄清楚,我认为这个版本就像一个重要的信息点,可能会改变人们对 AI 世界中许多先入之见的一些看法。好的,让我们来回顾一下。想象一下,我们仍然在一个世界里运作,在那里你有图像模型、视频模型、音频模型、语音模型,等等,所有这些东西底层的东西,现在都运行在 Transformer 架构之上。我们开始意识到的是,如果你有一个能够处理不同模态的多模态模型,你就可以从中衍生出所有这些特定的模型,对吧?所以,想象一下,在内部,我们曾经意识到,有一些颠覆性的事物正在发生,对吧?那些在某种意义上专注于垂直应用的科技公司正在颠覆那些颠覆者,因为除了 LLM 和扩散模型之外,我几乎看不到任何你现在需要构建 AI 应用的底层技术。另一件事是,例如,一年前,我们都认为,例如,用于实时用例的创意自回归生成,你可以不断生成一些延迟,少量帧,例如,在虚拟世界中导航与进行批量生成,生成整个视频,这是非常不同的。现在我们意识到那也不对,这两件事正在融合。所以,我认为我们创始人此刻错过的不是视频看起来好不好看,而是它可以在观看时生成,实时响应用户所做的事情,并且每个像素都是可编程的。长话短说,你说得对。我们最初没有意识到的是,相同的架构可以通过一些小的调整使其具有自回归性。是的,这是一个大问题,因为一年前,我没想到扩散模型会很快与实时游戏相关。我认为它们将成为你创建纹理、烘焙和照明等事物的管道的一部分。现在我有点想,等等,如果它能在消费级硬件上运行,并且你可以让它具有自回归性,你知道,这会成为一种吸引人的体验。显然,距离它成为像 Unreal 这样的游戏引擎的可行替代品还有很长的路要走,但现在看来是可行的。你刚才提到了谷歌,但我们看到的大部分动向都是最前沿的。你看到了来自中国实验室的大量动向,从百度到腾讯。是什么触发了这一切的开始,为什么我们没有看到美国方面像中国方面那样多的动向?在某个时候,在我看来,中国人意识到了一些关于这项技术的底层现实,他们意识到,好吧,这个东西将无处不在。它将无处不在,你知道,边缘设备、数据中心,为了构建相关的技术,它应该是相当开放的,对吧?很难想象边缘设备应用程序如何通过 API 运行,它确实倾向于将权重放在设备上以减少延迟等,而且我认为他们中的许多人开始创建开放模型,我认为长期的目标是能够确立行业标准,并随着时间的推移实现资本主义。我必须说,我非常惊讶西方科技界有更多的人没有意识到这一点,并且仍然试图躲在数据中心 API 等旧的花园后面。我认为在中国,目前最突出的公司可以说是阿里巴巴,他们拥有很棒的 LLM,比如所有这些很棒的 Quen 系列模型,以及非常好的开放扩散模型,包括视频模型,叫做 Van。所以,在某个时候,我们意识到,是的,我们最大的竞争对手将是中国,而不是美国。美国人仍然相信他们可以躲在数据中心墙壁后面,这在技术上对我来说似乎有点牵强,对吧?我们实际上看到,现在大多数以色列公司都在构建在中国堆栈之上。这并不意味着他们一定使用这些模型,但大多数人意识到的是,如果你想要研究,如果你想要 GPU,这是一个很好的例子,你可以托管 GPU 或其他形式的强化学习,但 GPU 几乎是事实上的标准。我还没有见过以色列有一家公司不使用 GRPO 进行强化学习的。是否存在堆栈对齐?它有意义吗?或者你们是如何考虑的,如果我选择中国堆栈,它将如何决定我的未来产品?这个大致可调的 LM 的范围,它们并不庞大。谷歌也在玩,比如 Gemma 系列的 LM 和 VLM,它们非常有吸引力。我们一直在将 Gemma 与世界上的 Coins 进行对比,而且他们实际上认为谷歌做得非常好。再说一遍,从长远来看,在我看来,中国人已经意识到,拥有像 LLM 这样基础技术,并随着时间的推移免费发布它们,可以给你一个非常显著的优势,对吧?因为你正在塑造技术河流,然后你可以考虑,好吧,与硬件供应商合作,并与他们确定参数大小、VRM 要求等等。所以,在我看来,而且也许我只是过度赞美它,在我看来,那里有一些长远的思考,比西方看到的更长远,因为这里似乎再次出现了这种情况,我们投入了大量资金在 AI 上,我们期望在两三年内看到大量回报,我认为这与 90 年代的互联网类比很清楚,90 年代的程序员都明白,互联网将成为一件大事,我们将在互联网上玩游戏、交流等等,这可能不会在两三年内发生,所以我想中国人也许再次希望我不要给他们太多赞誉,他们理解这个现实,只是想确保底层技术在那里创建。所以,你处于一个非常独特的位置,对吧?Literx 是一家产品公司。大多数,如果你看看实验室,它正在构建一个平台,而没有杀手级应用一直是一个挑战,对吧?但作为一家以产品为先的公司,你是如何走到这一步的,你正在发布 API,你正在成为一个平台?你是如何思考的,是什么让你走到那里的?我们随着时间的推移发现,至少目前在基础模型方面没有利基市场,因为我们曾经认为,好吧,我们正在做高效的模型。不,不,不,不是这样的。你有一个庞大的模型,你可以将其提炼成任意小的模型,而从一开始就训练小模型仍然更好。这些事情对我们来说并不清楚。所以,在某个时候,我们意识到我们正在参与一个比我们最初想象的要大得多的游戏,而一线希望是,西方那些从事多模态模型的公司,比如 Open AI 或谷歌,他们决定走 API 和封闭路线,而我们决定走开放路线,但在公司文化转变方面,这显然是巨大的。所以,我们已经决定将公司重组为两个部门。一个部门负责我们现有的移动业务,另一个部门负责新业务。但即使在 LTX 的 AI 业务中,我们也不相信技术本身是长期的差异化因素,因为归根结底我们谈论的是应用数学,你的研究人员参加会议,与其他研究人员见面,整个事情传播得相当快,所以我们认为会发生的是,每项技术都会达到一定的极限,对吧?为了克服这些极限,你需要产品化一些东西,这基本上意味着引入人类互动来克服机器的局限性。所以,这就是为什么即使是 NLTX,我们也决定,好吧,我们正在构建基础建模的堆栈,其商业模式是在此之上的 API 许可,以及在此之上的内部产品,我们希望找到一些技术固有的局限性,然后开始产品化这些差距。这是一个非常有趣的观察,如果我看看基础模型,它是世界上贬值最快的资产,所以你训练,然后在一年内,或者一年,也许是六个月,有人就有了能力,所以你需要重新训练,而你前进的方向让我想起了 15 年前在 face.com,我们有一个面部识别 API,但唯一一次,我们在人们认为我们在竞争的时候将它授权给了 Facebook,他们当时正在使用我们的技术,但扎克伯格给予我们的唯一尊重是当我们发布名为 Click 的应用程序时,它展现了当时不存在的极端能力。几乎就像你说的,机会在于你最了解模型,所以你知道结构性限制在哪里,你可以构建一个与模型协同工作的产品,而不是它两年后的样子,但同时,你将第一次将 API 授权给你的竞争对手,它可能是 Adobe,可能是 Microsoft,可能是 Meta,可能是任何人,但他们也在构建应用程序。那么,这种张力是如何产生的?你对自己的模型有独特的理解,但现在你也向他人提供了访问权限。我完全同意你的观点,存在一个神奇的点,你的基础技术理解遇到了它的局限性,而这正是你应该寻找的,而且我们已经看到了这种情况在 LM 世界中正在展开。我们看到,像搜索和编码这两个主要用例,每个人都意识到,是的,这是一个巨大的事情,而且有很多产品化工作要做,尽管有些人仍然承诺明年会出现奇点,无论出于何种原因,他们也付出了很多努力来产品化那些你可以问自己的事情,等等,如果存在奇点,为什么我们需要用脚手架来克服局限性?但我认为,我们现在已经意识到,奇点可能不会在明年到来,我们需要弄清楚技术的局限性,而这些公司正在通过授权给你的竞争对手或你认为的竞争对手来做到这一点。当我想到我们正在做的事情时,我总是想到游戏引擎的类比,对吧?因为,好吧,有一些渲染核心最初非常重要。那就是模型直接 OpenGL。正是如此。归根结底,你需要渲染一些东西,无论是什么。但随着时间的推移,渲染总是因为商品化,一个非常智能的技术,但无论它有多智能,都可以复制,围绕游戏引擎的整个工具生态系统和社区,然后这些公司有时会制作游戏,有时这个游戏是史诗级的。正是如此。正是如此。有时游戏非常成功,比如现在的 Fortnite 是 Epic 收入的一个巨大驱动力等等。但它仍然证明了引擎的价值,对吧?所以,我感觉我们的产品层和许可也是如此。归根结底,我们想构建引擎。模型就像这个渲染核心。它非常重要,但不是最重要的。你想要随着时间的推移做的是创建这个脚手架,让开发者能够轻松地在你的产品之上构建应用程序。然后,你显然可以构建自己的东西,也许你构建的东西会与其他人构建在你模型之上的东西竞争,就像在 FPS 类型中,人们会制作 Fortnite 克隆品一样。坦率地说,这并不是一个巨大的担忧,而且你处于一个能够深入了解你的模型并满足大型需求的境地,我认为这是一个独特的位置。是的,虽然我不会羡慕你,但第一次内部讨论,如果你的一个产品组说,你实际上是在赋能我的竞争对手,他们在市场上与我竞争,而一些应用程序可能非常微小,一些应用程序可能很有意义,它可能是一个离开了的 Ex Lit guy,现在正在你的 API 之上构建一个 Literx 竞争对手,当然。所以,听着,目前我告诉大家的是,LTX Studio。好吧,我的意思是,它今年增长得非常快。它还不是一个巨大的产品,如果你想快速扩展模型的用法,我们必须通过已经拥有非常稳固分销渠道的公司来实现。好吧。所以,如果有人来找我说,听着,我们将在 Lyrix 中制作头像,但我们已经有一些公司在不同领域大规模地这样做了。以最好的、最便捷的方式将技术授权给那些已经拥有分销渠道的人将是优先事项,对吧?因为从这个意义上说,AWS 对亚马逊来说,它实际上是一个支持其业务其他部分但本身可能非常有利可图的业务,但亚马逊仍然在销售商品。顺便说一句,其他杂货商不希望你使用 AWS,这很有趣。但亚马逊本身,它们也是一个核心租户。所以它们在 AWS 上提供了需求,而过剩的需求可以得到解决。但是,如果你考虑到这里的机会规模以及我们讨论的未来技术堆栈等等。虽然单个应用程序可能令人兴奋,而且它确实非常令人兴奋。听着,我喜欢我们用 LTX Studios 做的事情。这很棒。尝试创建游戏引擎是另一回事,对吧?你知道,即使从计算机图形学极客的角度来看,这很有趣,但你正在投入大量精力来处理特定游戏的细节,这是有些人认为有趣的,但构建更具基础设施性质的东西,一个人们用来构建他们东西的组件,这是另一个,它确实是另一个令人兴奋的层面。我认为你将长期面临垂直整合的挑战,你会走多高?你应该只提供底层 API,你应该构建一个游戏引擎,你应该构建?因为利润实际上是你在堆栈中越高,利润就越好,而且你对你的能力理解也越好。我同意,我几乎觉得,再次,每个人都在谈论的基础部分将很快商品化,而且质量的增长也将趋于平稳,而且我认为这个时间离未来不远了,然后游戏将围绕它周围的工具展开,因为目前,扩散模型产生了非常酷的结果,但每个人仍然在努力驯服它们,创造出他们想要的东西,我认为下一个前沿显然在那里,因为在视觉保真度方面,它们远远超出了渲染引擎或游戏引擎能够产生的,但在可控性方面,它们远远不如。让我们稍后谈谈这个。我认为这实际上是一个很好的切入点,说明平台实际允许的机会,技术变革,一年前行不通的事情,其中一些是,是的,你当然可以构建一个新的 Epic Games 游戏引擎,但即使你看看像广告这样大的行业,如果你现在可以为每次展示创建一个特定的创意,针对用户情境进行优化,并生成媒体,这听起来很棒,而 Adtech 购买它则是两回事。你是否进行过讨论,开始阐述视频是按用户生成的,这是否可能?你是否已经有客户或潜在客户对此感兴趣?这个关于定制广告的特定用例,以及我们以前无法达到的程度,就是当 LLM 和扩散模型协同工作并进行实时考虑时会出现的伟大例子之一,而这些考虑以前是保留给人类营销人员的,对吧?因为很多这些考虑,好吧,我正在运行一个活动,我看到一些印象,我想稍微调整一下。而现在,这个周期仍然相当复杂,对吧?好吧,我正在运行一个活动,我看到一些反馈。我去找我的创意团队。我们正在更新素材。所以我们谈论的是,即使是一个非常敏捷的团队,在同一天他们也许可以更新它。他们永远不会在这种结构下按用户进行。正是如此。他们最多可以运行多个活动,拥有许多创意,所以你已经可以想象你正在给予它,它是一个阶梯式的进步,在这个意义上,它是一种以前不存在的能力。我同意,无论速度如何,LLM 显然能够做出大多数考虑,根据观众反馈找出可能需要更改的内容,以及更新素材,并且可以按用户进行,而扩散模型正在达到一个点,如果 LLM 向它们解释需要更改什么,它们就可以更改。所以,让我们以最基本的例子来说,我不知道,我们正在为 T 恤做广告,我们正在与某个受众合作,现在我们想让你看看当我们改变 T 恤颜色时会发生什么。所以,现在的扩散模型足够强大,可以接受你拥有的视频,然后改变 T 恤的颜色,显然还有很多更高级的东西。但对我来说,也许最突出的观点是,我们意识到 LLM 正在做出高层次的考虑,并与扩散模型合作,以我们以前无法想象的速度创建素材,从而解锁新的事物,对吧?你开始以广告商的这个用例开始,即即时创建个性化广告,但我们可以想象对娱乐业进行更大的改变,对吧?绝对。广告是一个即时的业务,因为如果你能证明投资回报率的提升,你就会有技术转变。现在,技术将被利用,而如果你看看娱乐业,它只是一个过程,因为那里有很多创意。所以,我反对的是,它回到了公司结构,对吧?你现在将其分为应用程序组和平台组,但问题是,如果你考虑公司结构,是否应该有一个赋能组,它负责广告将发生变化,这是我们需要的堆栈中的东西,我们需要证明这一点,我们想展示提升,通过展示它,如果你建造它,它们就会来,这永远行不通,但如果你展示了可能性,它就可以。作为 CEO,这已经是一个很大的挑战了,有两个小组。长话短说,这是一个很大的概念问题,你提到了,因为你意识到,好吧,模型有大量的不同用例,其中一些在技术上非常令人兴奋,一些在个人层面上也令人兴奋,因为这些是你喜欢做的事情,一些只是巨大的市场,然后这是一个我们目前正在努力解决的挑战。甚至你提到了 API,对吧?什么样的 API 才既能最小化又能昂贵到足以让人们在其之上构建大量东西?坦率地说,即使在谈论 3D 引擎时,我也无法做到这一点,而这些家伙很棒,我现在和他们中的许多人交谈,我意识到,好吧,扩散模型只是更好地进行全局照明,所以最终你只是获得更漂亮、更快、更便宜的视觉效果等等。但他们有现有的管道,其中一些非常不同,而且几乎很难押注一个客户,因为你永远不知道,对吧?所以,你想要一些足够通用的东西,让很多人尝试。所以,这与你关于广告行业的具体例子面临着同样的挑战。这是非常非常高层次的。我的思考方式是,我们现在意识到的是,多模态扩散模型与非常强大的 LLM 配合效果最好,它们会为它们解释事物,就像一开始,当人们训练扩散模型时,他们会从互联网上获取文本,那就是文本编码,然后你知道,但我们现在不是这样做的。字幕部分变得非常庞大,这是一个巨大的 JSON 文件,它以惊人的细节描述了场景,然后当你想要使用扩散模型时,提供输入的最佳方式是使用能够提供这种结构化输入的 LLM。然后你意识到,等等,我们过去对 API 的思考方式有点过时了,对吧?因为当我们考虑 API 时,你希望我们提供非常集中的功能,让人们能够理解。它既紧凑,另一方面,你知道,提供广泛的功能。我给你举一个我们目前面临问题的例子,我们将发布一个功能,允许你获取现有视频,然后说,好吧,在这里你可以改变东西,比如人,而不是坐着,可以站起来,然后你就会意识到,即使是这个东西,也有很多不同的功能,而对于普通用户来说,它们是相同的,对吧?因为有些用户可以说,“听着,我只想让一切都一样,但一个新的物体进入场景,对吧?其他人可以说,“听着,我只是做了,而且有四种不同的技术渲染领域可以实现这一点。”然后你开始意识到,也许解决这个问题的最佳方法就是处于另一个抽象级别,用户实际上给出的是导演级别的指令,用人类语言,然后 LLM 被调整为创建这种结构化输入到模型中,这甚至可以是多镜头而不是零镜头,对吧?因为想象一下,我不知道,创建预告片的指令,然后有人需要向扩散模型解释,你将创建一系列不同时长的剪辑,其中一个是有条件的,并且应该有硬切。对。所以,这意味着你基本上是在说,我们如何针对技术水平较低的受众,或者我如何通过让 LLM 提供持续反馈来实现更多控制?就像,如果你是一个创作者,你之前提到过,娱乐业可能是一个非常大的业务,对吧?我不是导演,我不是那样思考的。所以,对于一个创作者来说,如果你看看你现在所处的位置,行业现在的位置,以及一个想要在他们的主要工作流程中使用这项技术的 TikTok 影响者,这是否是必需的?作为一个技术动画师或 3D 模型师或任何东西,你基本上需要自己提供这种结构,通过移动大量的滑块,对吧?因为这些渲染模型有很多参数。是的。所以,我认为随着时间的推移,LLM 正在改变我们与机器互动的方式。所以它们将能够以你的水平与你交谈,动画师说话的语言与导演的语言,以及经营整个项目的执行官的语言不同。我认为将会发生的是,LLM 将能够将其翻译成结构化输入,你可以,你知道,让整个机器运转起来,显然会有人能够深入到抽象级别,比如汇编编程,但它将是,想象一下,在传统的 3D 图形学中,我们一直在面临一个空白页的问题,我们打开 Blender 或我的 3D 工作室,我们只是盯着空白页,要创建一些东西,你需要投入大量的精力,对吧?创建一个场景。所以我们正在以自下而上的范式工作,我们只是把零件组装在一起,最后形成场景,这非常困难,大多数人无法这样创建。我认为随着扩散模型,我们将看到一些略有不同的东西。你永远不会有空白页。你只是想象一些东西,你得到一些东西,然后它是一个自上而下的方法,你可以越来越多地调整。所以,有时在内部讨论时,我说,听着,伙计们,我们需要达到一个点,如果需要,与系统工作的人需要能够改变输出中的每一个像素。但在这里,你之前提到了它,模型的控制性如何?它的输出令人惊叹,但可重复性和可控性呢?我们现在在哪里?你认为一年后我们会到哪里?我认为你所说的可重复性是指创建一致的世界、可以重新访问的角色,对吧?所以,三个月后仍然不是这样,我正在建立一个品牌,我正在建立一个我可以随着时间推移维护并引入到不同视频中的角色。是的,这就是我们想要去的地方的顿悟,对吧?它变成了一个 CA 类型。我们将讨论企业类型,但我刚刚与 Tiv 大学教授 Danny Coenor 进行了一次谈话,他是我的博士生导师委员会成员,我问他,Danny,你现在最兴奋的是什么?你认为接下来会发生什么?基本上就是你问我的问题,他告诉我,最近,我认为过去五年里计算机图形学社区中的低垂的果实将不再是这样了。我认为游戏将围绕这一点展开,即创意控制,我们如何总是给予创意人士他们想要的东西,让他们随意调整。另一个是连贯性,对吧?所以,在控制方面,我认为很多,我不想说它已经解决了,但基本模态,你如何看待调整事物和向系统提供提示和输入,我认为我们已经处于一个很好的状态了。对于连贯性来说,这是一个更难的问题,尤其是在我们谈论虚拟世界时,想象一下你正在创建 10 秒的视频,好吧,这已经有很多令牌了,现在你想保持在这个世界里,但现在你需要根据你已经生成的令牌来条件化生成,对吧?因为你想要连贯性,而注意力,这个在模型中运行的组件,它的本质是二次方的。好吧,我们正在尝试将其线性化,对吧?所以我们正在尝试说,并非所有令牌都需要与所有令牌通信。在我看来,有两种思路。有些人试图创建明确的方案来打包上下文,而另一些人则说,等等,伙计们,这是一个痛苦的教训,我们需要弄清楚,机器需要弄清楚,做一些损失函数,打包上下文的正确方法是什么?你提到了二次方,这直接将我们引向了商业模式和成本结构,我认为这个节目不完整,除非我们谈论显式,对吧?生成实时视频计算密集,使用注意力模型生成实时视频通常很昂贵,成本比例是多少?如果我考虑 24-30 fps,720p,我的成本是多少?什么样的商业模式可以实现?因为如果创建一个视频要花费我 10 美元,它会驱动什么样的机会?那么它到底有多贵?总而言之,它一点也不贵,也就是说,它可以在边缘设备上运行,我认为目前人们的看法是错误的,像 Sora、V 或 LTX 级别的视觉效果只能在企业级硬件上运行,这完全是错误的。好吧,它可以在你的游戏 GPU 上运行。很多人在考虑 TI 时,他们会想到缩放定律,比如当你增加数据量、计算量和参数数量时会发生什么。我认为很多人认为这会一直持续下去,但我认为不会,而且这显然是昂贵的,你增加了参数数量,增加了数据量,增加了计算量,整个事情变得更加昂贵,无论是训练还是推理,但我认为我们开始在那里达到一个平台期了。我们没有看到像以前那样疯狂的参数增加,在密集模型中。我认为我们现在主要使用专家混合模型,它们更容易训练,而且计算量也不那么大。所以我们看到了一定的平台期。我认为训练模型的成本不会像推理那样增加,因为我正在考虑建立一个广告业务或一个创作者视频生成器,或者一个新版本的 Epic Games 游戏引擎。所以主要是推理,每帧或每秒的成本结构是多少?作为一个企业家,我应该假设什么?但另一个需要描述的轨迹才能回答这个问题是,训练和推理的成本都会随着时间的推移而下降,对于相同的架构。所以,你知道,有些人有一个基准,比如重新训练 GPT2 或 GPT3 或这个级别的架构需要多少成本,而且这种情况在扩散模型世界中也存在了很长时间,最初,Mod 训练 Stability 1.4、1.5 的补助金大约是百万美元。也许是 60 万美元,我们达到了一个点,我认为我看到那里的活动减少了,但人们能够表明,你可以从头开始重新训练整个东西,花费 10,000 美元。所以我们有另一个轨迹,使事情比过去更有效率。例如,LTX2,想象一下视觉水平远高于一年前的模型,想想 Runway Gen 3 或类似的东西,很多人当时认为 Gen 3 不可能在消费级硬件上运行。LTX2 虽然看起来好得多,而且是多模态的,但它会运行。所以我们看到了成本的显著降低。所以,再次,当你谈论边缘设备时,它会消耗多少电力?嗯,离你现在玩游戏消耗的电力并不远。它确实会加热你的智能手机电池,但这是可行的。对我来说,这是一个人们还没有注意到的巨大转变,因为每个人都认为我们需要所有这些大型数据中心,也许我们需要它们,因为有人会展示架构上的另一个突破,它会增加参数的大小,以至于我们不得不回到企业部署。但实际上,有了 LTX2,这是我们非常声称的一件事,听着,伙计们,你们可以在消费级硬件上获得最先进的视觉效果,这太棒了。我认为进入这次对话,这是最大的区别,即边缘设备与集中式数据中心。更重要的是,市面上已经有实际的产品了。比如谷歌的产品,他们每年节省了十亿美元,因为他们在边缘设备上运行代码。所以我认为人们没有完全理解将成本推向用户有多么重要。正是如此。听着,即使在这里,也许值得讨论的是我们在边缘设备上的限制,比如游戏 GPU,它们的计算能力较弱,更多的是内存,更多的是 VRAM。而 VRAM 的价格并不算太贵。你已经看到一些中国人在做 Nvidia 1490,将内存加倍,安装我们的芯片,黑掉 BIOS,然后出售,显然非常违反条款,只是烧毁它。是的,正是如此。但这是可行的。显然,英伟达不会对此感到高兴,因为他们不喜欢价格,因为这会抢走他们的 GPU。所以,我最喜欢的问题之一,我一直期待听到你的看法是,如果你有 300 万美元来资助一家新初创公司,你可以访问 LTX2,并且你有时间和精力来实际建立一家初创公司。你会从哪里开始?我最近重读了尼尔·斯蒂芬森的《钻石时代》这本书,我记得我是在 90 年代初第一次读到的,这本书的一个前提是,有一个入门级的东西,一个几乎像 iPad 一样的东西,拥有人工智能,落入社会不同阶层的三个女孩手中,然后这个人工智能帮助她们成长。你就会想,等等,所有的碎片都存在了,你知道,实际上可以构建这样的东西,而且这也是一件有趣的事情,可以为自己构建。是的。就像,我在想,我和丹尼·科诺尔的这次谈话,丹尼是一个与世界各地许多人合作过的人。我认为他是以色列最早与中国学术界进行大量合作的人之一,并且仍然有学生在那里。他告诉我,他现在最兴奋的事情之一就是悄悄地与 GPT 一起工作。这是一项神奇的技术,它允许你在我们以前无法达到的水平上学习。想象一下,自从我创办初创公司以来,我没有机会与我的博士导师那样的人合作,我怀念这一点,因为你从他们那里学到东西,好吧,你无法自己弄清楚,至少在我的情况下,你需要有人牵着你的手,向你展示这个和那个,而 LLM 正在接近这一点,你就会想,等等,我实际上可以创造新一代的教师,这将非常有吸引力。所以,对我来说,这听起来是一个非常酷且有趣的想法,而且碎片已经齐全了。是的。就像,能够教授,不一定是与外星人战斗,而是有趣。扩散模型本身对消费者来说并不有趣。你感兴趣的是,我能否创建一个视频,就像我梦想的那样,就像我输入一样,就像我写下特定的提示一样,而扩散模型是唯一能够大规模实时做到这一点的方法。如果你有希望我们注意的嘉宾推荐,请发送电子邮件至 almost human alfaph.vc。我们很想听听你的意见。我是 Eden Shochat。感谢收听。下次再见。[音乐]