Transcription
[掌声] 今天我将与 Modal 的创始人兼首席执行官 Eric Bernhardson 进行交流。Modal 开发了一个无服务器云平台,用于人工智能、机器学习和数据应用。在此之前,Eric 曾在 Better.com 和 Spotify 工作,在那里他领导了 Spotify 的机器学习工作,并构建了一个推荐系统。Eric,非常感谢您今天来到 No Priors。
是的,谢谢,很高兴来到这里。
所以,如果我没记错的话,您曾在 Spotify 工作,并帮助构建了他们的机器学习团队和推荐系统,之后又去了 Better.com。是什么激励您创办 Modal,您希望解决什么问题?
是的,这始于很久以前,2008 年在 Spotify,我在那里待了七年。是的,我构建了音乐推荐系统。当时,在数据基础设施方面几乎没有什么东西,Hadoop 是最现代的东西。所以我花了很多时间构建大量基础设施。特别是,我构建了一个名为 Luigi 的工作流调度器,如今几乎没有人使用它。我构建了一个名为 Lenoi 的向量数据库,在短暂的一段时间里有人使用过,但现在也没有人真正使用它。所以,我花了很多时间构建这些东西。
之后,在 Better.com,我担任首席技术官,并一直在思考开发者生产力等方面的问题。然后在疫情期间,我休息了一段时间,开始捣鼓一些东西,我意识到我一直想构建更好的基础设施来支持这些类型的事情,比如数据、人工智能、机器学习。所以,我很快就意识到这就是我想做的事情,这就是 Modal 的起源。
这很酷。这个方法是如何演变的,或者公司今天关注的主要领域是什么?
我首先开始研究数据、人工智能、机器学习基础设施的挑战,并开始从开发者生产力的角度思考,我想要什么样的工具。一个巨大的挑战是,与云协作可以说是相当令人烦恼的。尽管我喜欢云提供的强大功能,并且我从 2009 年左右就开始使用云,但与之协作实际上相当令人沮丧。所以,我脑子里有一个想法:如果能让云开发感觉几乎和本地开发一样好呢?就像拥有快速的反馈循环一样。
于是,我开始思考如何构建。我很快就意识到,我们实际上不能使用 Docker 和 Kubernetes,所以我们必须放弃它们,并且很可能需要构建自己的文件系统,我们很早就这样做了,并构建了自己的调度器和自己的容器运行时。所以,这基本上是 Modal 最初的两年,就是奠定所有这些基础性的基础设施层。
是的,那么就您今天为客户提供的服务而言,主要的服务或产品是什么?
是的,我们是基础设施即服务。这意味着,一方面,我们运行一个非常大的计算池,拥有数千个 GPU 和 CPU,并且我们非常容易地提供服务。如果您需要 100 个 GPU,我们通常可以在几秒钟内为您提供。所以,这是一个非常大的多租户池,这意味着容量规划是我们为客户解决的问题,他们不必真正考虑预订。我们始终提供大量的按需 GPU。
另一方面,有一个 Python SDK,可以非常轻松地构建应用程序。所以,这个想法是,您基本上用 Python 编写函数,然后我们将这些函数转换为云中的无服务器函数。我们处理所有容器化和所有基础设施方面的事情,所以您不必考虑所有 Kubernetes 和 Docker 的事情。
实际上,事实证明,真正的杀手级应用是我们公司成立前就有的。但事实证明,真正推动所有吸引力的是 Stable Diffusion 的出现。很多人来找我们说:“嘿,这看起来很酷,你们有 GPU 访问权限,而且很容易,您不必考虑启动机器和配置它们。”所以,我们的第一个杀手级应用就是以无服务器的方式进行生成式 AI,重点是扩散模型。现在,我们实际上拥有更多不同的模态。虽然文本到图像的用法仍然很多,但我们也看到了大量的音频和音乐。
所以,一个我认为非常酷的客户例子是 SoSo,它在进行 AI 生成音乐。他们所有的推理都在 Modal 上运行,规模非常大。有很多这样的客户,他们都在构建很酷的生成式 AI 模型,特别是在音频、视频、图像和音乐等模态方面。
这很酷。我听说 SoSo 现在也在使用 Transformer 作为其基础模型,而不是基于扩散模型的东西。所以,我认为这是一个结合。我不确定。
是的,我认为他们公开谈论过,我之所以提到它,是因为您在十月份写了一篇帖子,我认为它叫做“AI 的未来需要更灵活的 GPU 容量”。总的来说,我在行业里听到的是,人们使用 GPU 的很多方式都会是浪费的。所以我有点好奇您对 GPU 使用灵活性的看法,实际使用了多少,浪费了多少,即使是人们今天使用的现有类型的 GPU,还有多少优化空间?
是的,GPU 很贵,我认为这有点像一个悖论。这意味着云,很多云容量,您只能通过长期承诺来获得。我认为这对很多初创公司来说并不是正确的模式。我认为云的惊人之处在于,您可以按需访问您需要的任何数量的 CPU。但对于 GPU 来说,在过去几年里,由于稀缺性,获得 GPU 的主要方式是签订长期合同。我认为从根本上说,初创公司不应该这样做。你知道,这一直是供需问题。
但是,看看 CPU 市场,如果您需要时可以即时访问数千个 CPU。我的愿景一直是,GPU 也应该如此。这意味着,特别是当我们更多地转向推理时。我认为对于训练来说,这一直不是一个大问题,因为您可以利用您需要的训练资源。但对于推理,您甚至不知道您需要多少。它非常不稳定。这是我们为许多客户解决的一个巨大挑战。我们完全基于使用量收费。当您在 Modal 上运行东西时,我们只收取容器实际运行的时间。
这对客户来说是一个巨大的麻烦,他们需要进行容量规划,考虑需要多少 GPU,然后就会出现问题:要么您过度配置,支付了大量闲置容量,要么您配置不足,当您遇到容量短缺时,服务质量就会下降。而通过 Modal,我们可以很好地处理这些非常突发、非常不可预测的工作负载,因为我们基本上将所有这些用户工作负载汇集到一个由数千个 GPU 组成的庞大池中,跨越许多不同的客户。
您刚才提到训练,有一件事总是让我印象深刻,那就是您启动一个巨大的集群,运行一个巨大的超级计算机,然后运行几个月,最后输出一个文件。这实际上是您生成的东西,如果您仔细想想,这有点疯狂。这个文件在某种意义上代表了整个互联网或某种人类知识的语料库。然后,正如您所说,对于推理,您需要更多的灵活性来启动和关闭。或者,如果您进行较短的训练运行或训练后的某些方面,您可能需要更灵活的容量来处理。
完全同意。这是我们现在非常感兴趣的事情。传统上,Modal 的大部分一直是推理,那是我们的主要用例。但我们也对训练非常感兴趣,特别是那些更短、更突发、实验性的训练运行,而不是那些非常大的训练运行,因为我认为那是完全不同的市场。所以,这是我们正在探索的一个非常有趣的事情。
您如何看待满足人们端到端的需求?我知道人们还会做很多其他事情,比如很多人使用 RAG 来增强他们的工作,或者在推理时使用各种不同的方法来利用计算能力。您如何看待可以作为基础设施提供的端到端堆栈,以及 Modal 的重点或期望的重点是什么?
完全同意。我的目标一直是构建一个平台并覆盖端到端用例。只是碰巧推理是我们能够专注于它的第一个杀手级应用。但我的最终目标一直是提高工程师的生产力,并专注于我认为的机器学习的高代码方面。我们的目标客户更像是传统的机器学习工程师,那些构建自己模型的人。但有很多不同的方面,比如数据预处理,然后是训练,然后是推理。实际上还有更多的事情,比如反馈循环、RAG 数据、在线排名模型等等。所以,我的目标一直是让 Modal 涵盖所有这些方面。
所以,有趣的是,您现在看到很多客户,我们没有训练,但很多客户使用 Modal 进行批量预处理。他们使用 Modal,比如,他们可能正在训练一个视频模型,他们可能有 PB 级的视频。然后他们使用 Modal,甚至可能使用 GPU 来进行特征提取,然后他们在其他地方进行训练,然后他们回到 Modal 进行推理。所以,对我们来说,进行训练是有意义的。总的来说,我认为建立一个可以处理整个机器学习生命周期端到端以及许多相关事情的平台是有意义的,包括数据管道和夜间批处理作业等等。
是的,您描述的是一种相当广泛的平台方法。我认为有一些公司处于您的通用领域或市场。您认为 Modal 与它们有何不同?
我认为首先,我们是云原生的。我们是云的绝对拥护者。我们全力投入,并表示我们将构建一个多租户平台,在云中运行所有人的计算。这样做的优势是巨大的,因为我们可以更好地进行容量管理。这也是我们可以为您提供数百个 GPU 的即时访问权限的方式,如果您需要的话。您可以进行这些非常突发的活动,我们为您提供大量 GPU。
我认为另一个好处或另一个差异化因素是通用性。我们专注于我所说的“高代码”,我们在我们的容器和基础设施中运行自定义代码。这是一个更难的问题,在安全地容器化和运行用户代码方面存在挑战。然后处理容器启动时间。正如我所提到的,我们必须构建自己的调度器,我们必须构建自己的容器运行时和自己的文件系统,以便快速启动容器。我认为,与许多其他供应商不同,他们只专注于推理或可能只专注于 LLM。我们的方法一直是构建一个非常通用的平台。
长远来看,我希望这种体现会更加清晰,因为我认为我们可以在此基础上构建许多其他产品,现在我们已经拥有了日益成熟的计算层。
当我与大型企业谈论他们如何考虑采用 AI 时,他们中的许多人已经将数据存储在 Azure、GCP 或 AWS 上,他们在上面运行应用程序,他们在市场上购买了积分,他们想花掉这些积分,他们已经完成了安全审查。他们已经做了很多工作,他们担心延迟或与其他第三方服务进行 ping 的问题,而不是仅仅在他们现有的云提供商或他们合作的超大规模服务商上运行。他们中的许多人实际上是跨多个超大规模服务商工作的。您如何看待 Modal 在您的计算、超大规模服务商以及在任何地方运行的能力的背景下考虑这一点?
完全同意。当然,还有安全合规方面的问题。我认为,回顾一下云的出现,我记得在 2008 年、2009 年左右,云出现了,我的第一反应是:“老天,为什么有人会把他们的计算放在别人的电脑里运行?”我认为这简直是疯了,为什么有人会这样做?但在接下来的几年里,我意识到这实际上很有道理。我认为现在,即使在企业公司中,也有很多人认识到,实际上,我们的计算可能在大型超大规模服务商那里更安全。
类似地,我记得大约在 2012 年左右与 Snowflake 谈论过,他们采取了一种类似的方法,他们基本上说:“我们将在云中运行数据库,而不是在您的环境中,或者可能在您的环境中,但我们是基础设施即服务。”我认为那太疯狂了。然后,显然,我认为 Snowflake 现在是一家非常大的上市公司。我认为他们表明,基础设施即服务非常有意义。
所以我认为,在采用这种多租户模式方面确实存在一些阻力。但是,我认为,当您看看安全性和云的采用时,我认为我们有很多顺风顺水。我认为安全性正从网络层转向应用程序层。带宽成本正在下降。您可以做很多技巧来最小化带宽传输成本。您可以将数据存储在 R2 等地方,它没有退出费用。我认为这实际上将意味着我们将不得不付出很多努力,但我认为这种多租户模式在容量管理方面有很多好处,对我来说,这非常清楚地表明,AI 的未来很大一部分是运行一个庞大的计算池并非常动态地对其进行切分。
您之前提到,Modal 的早期采用很大程度上是由于 Stable Diffusion 和围绕图像生成的开源模型。您最近几个月是否看到任何开源项目或模型开始流行起来?
这是一个好问题。我认为,如果说有什么变化的话,那就是朝着更专有的模型发展。但是,是专有的开源模型。例如,Flux。我认为最近 Flux 是一个引起很多关注的模型。我个人对音频非常感兴趣。我认为音频领域被严重低估了。我认为在开源模型领域有很多机会。但我认为我们还没有看到任何真正酷的东西。
您认为当今 AI 基础设施或基础设施即服务领域还缺少什么?
我非常偏颇,但我认为 Modal 缺少的是一种让工程师能够编写代码并运行它的方式。我非常看好代码以及人们想要编写代码并自己构建东西。我认为,除了 LLM 领域(在我看来,这是一个非常不同的世界)之外,总会有很多应用程序需要人们自己训练模型,运行自己的模型,或者至少运行其他模型,但拥有非常定制的工作流程。我只是不认为有很好的方法来做到这一点。这相当痛苦。所以我认为这非常令人兴奋。
在存储方面,还有一些其他非常令人兴奋的东西。我们在 Modal 还没有真正接触过存储,我们非常专注于计算。所以我个人对向量数据库非常感兴趣,它将如何发展。我不认为有人真正知道。我对更高效的训练数据存储非常感兴趣。我还对……我猜还有另一件事让我非常着迷的是训练工作负载。为了有效地训练大型模型,您必须花费大量金钱和时间来设置网络。所以我真正兴奋的一件事是,如果我们不这样做呢?如果我们能让训练不那么耗费带宽呢?我认为这将极大地改变训练方面的一些基础设施。您现在可以连接不同数据中心的许多 GPU,而无需拥有大型数据中心和 InfiniBand 等东西。所以,这是我期待看到更多发展的另一个基础设施方面。
您之前提到您在 Spotify 工作时构建了一个向量数据库。Spotify 今天市值达到 1000 亿美元,我认为它是第一家达到这一里程碑的欧洲科技公司。所以,我认识的很多人可能使用现有的向量数据库,或者在某些情况下只是使用 PostgreSQL 和 PGVector。您如何看待向量数据库作为独立结构的需求,而不是仅仅采用 PostgreSQL 或做其他事情?
我觉得每个人都在争论这个问题。我不知道。我认为有很多论据表明,您可以将所有东西都放入关系数据库中,您就没事了。对我来说,更大的问题是,长远来看,如果您考虑一下什么是一个 AI 原生的数据存储解决方案,我什之不知道它是否一定具有与数据库相同的形式因素、相同的接口。所以,这实际上是一个我更感兴趣的更大问题。我认为人们看待向量数据库,无论它是关系型的还是非关系型的,他们都将其硬塞进这种老派的模型中,即您放入数据,您取回数据。但我不知道,我认为在 AI 的时代,有很多重新思考的空间,并与这些数据有非常不同的交互模型。我知道这听起来有点空泛。
非常有趣。您能多说一点吗?比如,我经常思考的一个问题是,数据库本身是否可以成为嵌入引擎?而不是您放入一个向量,然后您通过该向量进行搜索。我认为,更原生的 AI 原生存储解决方案是,您放入文本,您放入视频,您放入图像,然后您可以按这些内容进行搜索。对我来说,这将是一个更原生的 AI 原生存储解决方案。所以,这是我的一种想法,也许我们还处于早期阶段,我认为需要 5 到 10 年才能真正成熟。
这真的很酷。我想您还提到,似乎越来越多的人在训练自己的模型,至少在 Modal 所工作的许多领域。您认为人们在何时应该训练自己的模型,何时应该使用现成的模型,是否有任何启发式方法?
我认为,最终,对于任何模型质量真正重要的公司来说,除非您最终自己训练模型,否则我认为很难辩护说您拥有更好的解决方案,因为否则您的护城河是什么?如果您没有自己的模型,您就需要找到堆栈中的其他地方的护城河。这可能是可能的,对很多公司来说可能在别处。但我认为,至少如果您有自己的模型,并且该模型明显优于任何其他模型,那么这本身就是一种护城河。
我认为在 LLM 领域之外,当人们构建音频、视频、图像模型时,这一点更加清晰。如果这是您的核心关注点,那么对我来说很清楚,您必须自己训练模型。
我记得您是 IMO 金牌得主,显然您对代码和编码以及 AI 如何随着时间改变这一点有很多思考。您对此有什么反常的预测吗?
我不知道这是否反常,但我实际上认为,这只是开发者生产力提高的众多改进之一。您回顾一下编译器最初是如何成为提高开发者生产力的工具的,然后是更高级的编程语言、数据库、云等等。所以,我实际上不知道 AI 是否与这些变化有任何不同。顺便说一句,每次发生这种情况时,事实证明,软件存在如此多的潜在需求,以至于软件的数量实际上会增加。所以,我认为回顾过去 40 年的软件开发,每十年工程师的生产力都会提高 10 倍,这得益于更好的框架、更好的工具等等。事实证明,这只会释放更多潜在的软件需求。所以我对软件工程师非常看好。我认为要摧毁这种需求需要很多。我认为人们将 AI 视为一种固定不变的东西,但在我看来,它不是,它只是解锁了更多潜在需求。所以我对软件工程非常看好。
然后,我猜您很久以前触及的另一个领域是,我记得您在高中的时候赢得了瑞典物理竞赛。我对您是否关注了任何基于物理的 AI 模型或一些模拟相关的东西感到好奇。这个领域给我留下了深刻的印象,以及您对模型的思考方式也不同。
是的,我确实赢得了瑞典高中物理竞赛。在我十几岁的时候,我是一个彻头彻尾的数学极客。
好的。我认为这是一个非常迷人的领域。这是那些似乎需要真正重新发明,而且没有太多人参与的领域之一。所以,这是我有点兴奋的领域之一,因为有很多很多不同的应用可以开始与之相关。
我认为,在我看来,物理学就像回顾一下物理学的黄金时代,20 年代、30 年代和 40 年代。我觉得它并没有真正发展。所以,我不知道,我希望您是对的,会有新的基于物理的模型出现。
我不知道这是否会在短期内对基础研究有帮助。我认为它只会帮助模拟。感觉物理学作为一个领域,确实有点走上了爱因斯坦的道路,也许有点迷失了。我不确定。这有点像您在谈论更多像材料科学,进行更多基于计算的东西。这有点像其他公司,您模拟飞机机翼,模拟承重。
哦,我明白了。HPC,它一直存在,对吧?尤其是在石油和天然气等行业。但它主要是针对特定事物的少量定制或手工调整的模型。而不是……
是的。
我意思是,气象学是我认为深度学习应该改变的东西。这很有道理,您知道,深度学习应该非常擅长预测湍流等事物,因为湍流实际上很难用传统的物理模型来解决。所以,理论上,深度学习应该非常有意义。
我认为已经有几篇关于此的论文,来自 Nvidia,然后我认为 Google 也有一个团队对此进行了研究。所以,有几个不同的天气模拟团队已经开始发布一些非常有趣的东西。
是的,是的。我也想指出一个邻近的领域,生物技术。我认为计算方法已经取得了巨大的成功,尤其是在蛋白质折叠方面,但也在其他方面,比如序列比对等。这实际上也是我们开始看到 Modal 使用量增加的领域之一。我感觉计算生物学正在复苏。这真的很令人兴奋。
这真的很棒。您是否看到您的客户群在科学领域最常参与的特定用例?
有很多。我不是生物学专业人士,所以这有点肤浅,只是看看我们的客户。但我确实看到很多医学影像。我的理解是,通过现代方法,您可以进行非常自动化的……您知道,获得数百万个实验,并进行自动化的电子显微镜成像。所以,我们确实看到相当多的客户使用 Modal 来处理和进行计算机视觉。这很酷。
这真的很酷。从人类影响的角度来看,您对这些模型中的任何一个领域最兴奋?
凭借我在 Spotify 的背景,我认为 SoSo 对我来说非常令人兴奋。我认为 AI 生成音乐仍然非常早期,您仍然可以听出它还不完美,有点令人不安。但 SoSo 的每一代模型都在变得越来越好。首先,音乐本身往往是您看到新技术真正影响的第一个领域之一,无论是 Spotify、iTunes、盗版,还是更早的留声机。所以,从这个意义上说,我认为音乐是一个令人兴奋的领域,因为它总是展示新技术的机遇。而且,我认为 SoSo 从根本上来说是您在生成式 AI 出现之前无法做到的事情。对我来说,这真的很令人兴奋。它正在真正推动前沿,实现一个全新的产品,这个产品五年前根本不可能存在。
这很酷。好吧,我认为我们今天涵盖了很多内容。非常感谢您的加入。
非常感谢,很高兴。
在 Twitter 上关注我们 @no prior pod。如果您想看到我们的脸,请订阅我们的 YouTube 频道。每周都会有新剧集,请在 Apple Podcasts、Spotify 或您收听节目的任何地方关注本节目。这样您就可以每周都收到新剧集。您还可以注册电子邮件或在 no-priors.com 上查找每集节目的文字记录。