📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

From DNA to Drugs: How AI Is Rewriting Human Biology

Built This Week30:05

Transcription

您可以将其表示为 3.2 亿个核苷酸。本质上,它们是我们遗传密码的字母。而密码由四种碱基构成:A、C、G 和 T。因此,如果计算机代码由零和一构成,那么我们则由这四种不同的基本构建块构成。>> 细致分析。我们向您展示如何做到。一个全新的想法,一次巧妙的调整。本周打造。>> 大家好,欢迎来到“本周打造”,这是一个播客节目,我们在这里分享我们正在构建什么、如何构建以及它对人工智能和初创公司世界意味着什么。我是 Sam Nabler,Rise Labs 的联合创始人。每周,我都会与我的朋友兼业务伙伴、联合主持人 Jordan Meetsner 一起。Jordan,你今天怎么样?>> 嘿,Sam,欢迎回来。又一期新节目,有令人兴奋的嘉宾,而且本周人工智能领域显然又有很多事情发生。>> 是的,事情很多。本周我们有一位特别嘉宾,来自 Converge Bio 的 Dove。Converge 利用人工智能帮助生物技术公司更快地发现和设计新药。Dove,欢迎来到“本周打造”。>> 谢谢。谢谢 Sam 和 Jordan。感谢邀请我。>> 太棒了。Dove,我们将深入探讨 Converge 的业务,但先快速回顾一下议程。在我这样做之前,请不要忘记点赞和订阅。我们在 YouTube 上有超过 20,000 名粉丝。请点击那个点赞按钮,订阅按钮。我们每周五都会发布新节目。本周,我们为 Converge 构建了一个小游戏,这可能是一款他们可以在会议上与人们互动的游戏。它处于一个非常、你知道的,生命科学技术领域。所以希望这能巧妙地引出他们的业务。然后我们将完全深入 Converge Bio。最后,我们将以一些最新最棒的人工智能新闻结束。所以,话不多说,我很想向您演示我这里的东西。这叫做“细胞防御竞技场”,它可能会让你想起我们都在 80 年代末、90 年代初玩过的那些游戏。所以,目标是让坏细胞吃掉中心的蓝色核心。我们有一些控制键,还有一些我们可以使用的特殊能力。我们可以使用数据。我们可以使用一些其他的能量提升。但真正的关键是不要让能量耗尽。我玩过很多次了,从来没有超过一分钟。所以,我们开始吧。游戏正在进行。哦,这里有一个小敌人入口。哦,我抓到了。好的,我抓到那个了。好的。所以,如果您能看到,我可以利用数据来帮助我更好地瞄准这些正在攻击我的家伙们。哦,能量低了。让我看看我是否可以使用能量提升。哦,它抓到我了。我正在尽力,伙计们。就像我说的,我从来没有超过一分钟,所以希望我能打破记录。哦哦,我收到了很多 [笑声] 46 秒。所以,我们没有完全成功。显然,这只是一个有趣的开场白,但您能告诉我们您在做什么吗?这比这严肃得多,而且,你知道的,这是一项非常重要的使命。首先,我必须说,这款游戏就像是过去的时光倒流。非常喜欢。我们肯定要在我们的会议上玩这个。我们在会议上会做一些有趣的事情。所以,请分享。好的。首先,我看到我们在我们的网站上。所以,我将稍微介绍一下公司。我们成立了一年零十个月前。到目前为止,我们已经筹集了 3300 万美元,得到了世界上最好的投资者,包括 Best Summer Venture Partners、Vintage、TLD Partners,这些都是非常棒的基金。我们是一个 40 人的团队。本质上,我们组织的使命是为全球的药物开发者提供最好的生成式人工智能解决方案,以加速发现和开发。现在,让我们回顾一下当前人工智能在分子数据领域的应用。所以,继三年前 ChatGPT 引爆了文本分析和聊天机器人模型之后,科学界已经开始利用与 Transformer 在文本、图像和音频领域创造价值爆炸相同的架构,现在应用于分子数据,即 DNA、RNA、蛋白质、小分子数据。所以,总的来说是分子数据。而我们公司是一家前沿人工智能实验室,直接在 DNA、RNA 蛋白质和小分子上训练基础模型,并通过与我们客户现有的分子设计和理解分子数据工作流程集成的系统提供我们训练的模型。我将对此稍作解释。所以,您可以想象,如果我们看文本、图像和音频,那么这些信息类型中的每一种都可以很容易地被计算机表示。所以,文本,我们知道计算机可以理解图像只是像素,音频是我们可以理解的波长,就像在计算机科学中一样。那么我们如何理解分子数据呢?所以,本质上,如果我们以 DNA 为例,那么我们的基因组,在座的每一位听众,包括我、Jordan 和 Sam,都可以表示为 3.2 亿个核苷酸,本质上是我们遗传密码的字母,而密码由四种碱基构成:A、C、G 和 T。因此,如果计算机代码由零和一构成,那么我们则由这四种不同的基本构建块构成。所以,这是我们完整的基因组中的 32 亿个 DNA 核苷酸,代表了我们人类。所以,使用这些与文本、图像和音频训练模型相似的语言模型,我们现在可以开始理解遗传密码的文本表示。DNA 和 RNA 以及蛋白质数据也是如此。本质上都可以表示为文本,然后我们利用在文本、图像和音频上训练的相似架构上训练的基础模型来处理分子数据。然后,我们可以使用它们来预测分子活性,生成新的分子,生成分子变化,预测给定患者样本是否会对特定药物产生反应。所以,这仅仅是开启了我们利用这些数据所能做的事情的价值爆炸。另一个有趣的事情是,由于基因组测序成本的急剧下降,互联网上的 DNA 序列比互联网上的文本多 400 倍。因此,有大量的模型训练数据。但即便如此,高质量的标记数据也非常非常少。所以,我们真正知道其含义的数据。因此,这是一个巨大的挑战,我们在文本、图像和音频领域方面落后了 5 到 10 年。但确实在推动模型可能性的前沿。所以,非常令人兴奋。我们就像在 OpenAI、Anthropic、DeepMind 那样的竞赛中,只是落后了七年或五到七年,这是一个激动人心的时代。>> 太棒了。嘿,Dove,能给我们讲讲你的客户是谁吗?告诉我们他们如何使用你们的软件。告诉我们他们对什么感到兴奋。你知道,是制药公司吗?是生物实验室吗?是寻求研究的大学吗?大概是谁在使用它,他们如何使用它?而且,你知道的,正如你所提到的,这还处于早期阶段。所以,显然,我认为每个人都对它的潜力感到兴奋,但请告诉我们一点关于你的客户如何看待这一点。>> 是的,生物技术和制药公司是我们的客户,现在我们也向学术实验室开放。他们使用它的方式是,我们有三个系统。您可以在我们的网站上看到,您可以看到我们的解决方案。所以,三个不同的独立解决方案,一直旨在真正融入现有的工作流程。这是第一个用于工程抗体的解决方案,它已成为近年来最普遍的治疗方法。所以,这是我们系统中的一个现有工作流程。下一个是优化蛋白质产量。所以,最大的障碍之一是制造和扩大蛋白质产量,您可以在这里看到它。第三个解决方案已经提供给我们的客户的是我们的虚拟细胞,用于发现新靶点,并通过生物标志物发现和患者分层来优化临床试验。这是为临床试验选择正确的患者。本质上,我们的客户将这些用作与他们通过实验习惯做的非常相似的工作流程,只是他们将相同类型的工作流程转换为由人工智能驱动的计算工作流程,并且我们在所有这些模式中都展示了最先进的结果,这些结果开始取代现有的实验工作流程。>> 是的。所以,这显然节省了很多成本,但它也节省了很多时间,并且能够更快地运行更多迭代吗?显然,有支付服务成本等抵消因素,但我只是想,如果他们,你知道的,他们正在寻找真实的患者,那么您就可以虚拟化患者,这显然可以缩短时间。但它真的只是关于更多的迭代,还是关于更低的测试成本,还是两者的结合?>> 是的,这是一个很好的问题。我认为我们非常幸运,如果您考虑您可以为客户提供的三项核心价值支柱,我喜欢将其视为更快、更便宜、更好。而且我们非常幸运,我们的价值主张回答了所有这三点。所以,它更快、更好、更便宜。我认为很多产品要么是其中之一,要么是其中之二。我们很幸运能够处于人工智能彻底改变了游戏规则的世界,并且我们在所有三个方面都增加了价值。>> 太棒了。那么,三到五年后,七年后,随着芯片越来越好,实验室的采用速度越来越快,你知道的,你们的技术不断进步等等。我们会看到全新类型的药物吗?我们会看到新类型的药物应用吗?我们会看到我不知道。我的意思是,我相信你们整天都在思考未来。>> 是的。所以,我首先会解释瓶颈,然后再解释未来。有三个瓶颈。有数据瓶颈。有架构算法瓶颈和计算瓶颈。所以,计算瓶颈目前我们还没有达到这个行业的规模,这还不是瓶颈。文本和图像本质上是,但在我们的行业中,我们还没有达到瓶颈。我们处于数据和正确架构的瓶颈。所以,我们正在努力创建庞大的数据集,我们为此支付了大量的收集费用,并精心整理数据以创建世界上最好的数据集,并且一直在模型架构方面进行创新,以解决最佳架构问题。所以,我们目前存在瓶颈,鉴于我们解决了这些瓶颈,以及我们前进的速度,我们和这个行业,瓶颈开始出现,我们将在可预见的未来看到这些瓶颈被解决的飞跃。最终的未来是药物到达患者的时间大大缩短,药物对患者的成本大大降低,因为药物之间的竞争将越来越多,因为它将更容易部署,并且更加个性化,因为现在作为最后一个到来的是真正的个性化。但我们现在,药物本质上有时被称为个性化,但它们不是。由于 FDA 批准的方式,我们必须有非常非常严格的纳入排除标准,而且它们本质上并不非常个性化,但随着上市时间和成本的降低,我们将看到越来越多的个性化。这是我的预测。显然,这些是预测,我是一个非常乐观的人,但我确实相信我们正在朝着这个方向前进。我也相信这是我们应该投入资本和脑力来解决的首要问题。我的意思是,聊天机器人真的、真的很好,而且你可以在一分钟内创建一个‘90 年代风格的细胞游戏,这真的很酷。但是你能真正提高你的生活质量和寿命吗?我认为这些是我们应该问自己的真正问题。>> 我只是想问,也许所有潜在的疾病和状况都会从这项技术中受益。但有没有一种我们熟悉的特定疾病,你知道的,它正处于视野的焦点,一旦得到妥善使用,患者群体将立即看到即时影响。>> 是的。这是一个很好的问题。我认为在这里我只能推测,但我的推测是基于数据的。所以,我们在癌症方面拥有最多的数据,这也是我认为我们将看到最多价值的地方。此外,从市场潜力来看,糖尿病和肠道感染相关问题以及自身免疫性疾病,本质上,我认为神经退行性疾病会相对较晚出现,而且那里有很多分子障碍等等,但这些都是预测,现在很难说,这取决于疾病的复杂性以及我们有多少数据可供建模。>> Dove,你之前提到过缩短时间线,显然,尤其是在美国,像 FDA 这样的监管机构显然是缩短时间线的一个障碍。你是否开始看到政府开始关注你们的工具,或者看待你们的工具,你认为从监管角度会看到什么样的变化?>> 所以,首先,从监管角度来看,您可以考虑两个领域。一个是发现领域,这可能是前 5 年,比如靶点发现、药物发现、临床前研究等等,这不是受到严格监管的地方。监管开始的地方是当你开始临床试验时,这大约是另外 5 年,根据细节而定。所以,在缩短时间线方面,最容易实现的成果是在发现领域,在那里药物不对人类进行治疗。因此,监管负担要小得多。所以,这是缩短时间线方面最容易实现的成果。我什麽时候也不确定十年后临床试验是否会有任何改变。我猜不会。所以,我认为在可预见的未来,临床试验的五年瓶颈将保持不变。一旦模型在模拟人类与新分子相互作用方面变得非常出色,那么监管机构可能会稍微缩短这一点。但这离现实还很遥远。是的。所以,这就是我的看法。>> 好的。所以,我的意思是,我认为我们将看到更多的早期药物发现,但我们仍然需要经历这些临床试验,并且仍然会看到。所以,而不是十年时间,我们可能会看到六到八年的时间才能将药物从发现推向市场。>> 正确。这是在可预见的未来。在非常长远的未来,那么我认为临床试验也会缩短。但我认为,我认为临床试验的成功率会更高,因为我们将把更好的分子投入临床试验,并且像我们的产品一样更好地预测患者反应,从而选择更好的群体,这对每个人都有好处。比如,在临床试验中,服用无效药物的人会更少,而服用有效药物的人会更多。所以,即使对于那些正在寻找新药并参加临床试验的人来说,如果这项技术像我们所有人希望的那样发展,他们将享受到这些新药更高的成功率。>> 太棒了。最后一个问题,我不想过多地了解这些基础模型是如何工作的,但它们是否都运行在英伟达之上?你知道的,英伟达的创新是否对你们产生了下游影响,随着新的英伟达芯片的上市,它是否允许你们实现阶跃式改进,还是英伟达芯片不适合这种类型的学习和转换,或者只是稍微告诉我们它可能如何不同于大型语言模型市场?>> 完全一样,没有任何区别。我只是解释一下,在可预见的未来,这并不是这个行业的瓶颈,但它可能会很快发生变化。所以,这是一个极其动态的市场。我们离它成为计算瓶颈只有一次突破,并看到我们在文本、图像和音频中看到的规模法则。但是,我认为,我认为我们还没有达到,而且没有一个建模组织达到,但我们离那一步不远了。>> 是的。我的意思是,我知道对我们来说,有时很难获得 GPU 来进行训练等工作,因为市场需求是无法满足的。我可以想象,随着这些制药公司开始真正消耗 GPU,开始消耗大量令牌,您可以看到一个额外的,你知道的,玩家从市场中抢走芯片,因为他们也在使用它们,对吧?所以,更多的人,但供应相同,我猜。所以,这可能会增加需求并减少供应。>> 是的,没错。我们正在谈论世界上最大的行业之一,而这被我们认为是生命科学史上最大的金融机会。所以,一旦,我的意思是,我们已经在制药公司消费文本和图像模型方面看到了这一点。好的。用于更好的监管事务和分析数据以及设计临床试验,其中很多是通过文本和图像相关的模型。所以,我们正在看到制药公司在代币层面预算的大幅增加,但我说的是分子层面,这将爆炸式增长,我们将看到制药公司在那里出现全新的需求。>> 是的,完全同意。感觉就是芯片不够用,或者至少在一段时间内不够用。>> 我不认为这将是未来的巨大瓶颈。但,是的,我认为这显然是一个瓶颈,但,是的。>> 是的。是的。好吧,数据中心会建起来,你知道的,电力会到位,所有这些都会发生。所以,是的,我相信它会满足市场需求。>> 是的。我认为我们必须作为一个物种来解决这个问题,因为它对我们目前的日常生活至关重要。我们需要在一分钟内构建那些有趣的电脑游戏。所以,是的。>> 太棒了。好吧,Dove。那是一段很棒的历史和关于你们公司的很棒的故事。我认为我们可以进入本周的新闻,但还有其他我们没有涵盖的内容吗?>> 不,让我们进入新闻。硬转。谢谢 Dove。这非常鼓舞人心。我非常兴奋能继续关注你的故事。硬转到 Open Claw。你知道的,一个有趣的人工智能产品,在过去几周里席卷了人工智能界。你知道的,我看到了一些。我还没有设置我自己的 Open Claw。我知道 Jordan 设置了他的,我稍微玩过他的,但我看到了一些 Peter 的播客。我知道最近几天他决定加入 OpenAI,但 Jordan,我知道你已经构建了自己的 Open Claw。你有什么想法?以及你对他们加入 OpenAI 的看法?>> 是的,我想我是一个非常早期的采用者。我深入研究了 Open Claw。我还在它还是两个名字(Claudebot)的时候就安装了它。你知道的,它很有趣,很有意思,但价值仍然很低。也许是我的创造力或独创性不足,但我花了很多时间看 YouTube 视频,关注 Twitter,关注其他用户。我看到的大多数任务都是我通常会用大型语言模型来完成的任务,或者我通常会一次性完成的任务,这些任务可以更自动化。所以我发现它很有趣,因为它非常像 cron 作业类型或基于任务的焦点。我还没有能够充分利用它。但我认为它之所以有趣,是因为当你与 Open Claw 或 Cloudbot 对话时,它不需要很多规则就能理解你在说什么。它不需要很多框架。所以,你可以说,“嘿,我想在 Reddit 上发帖,关于这个这篇文章或者类似的东西。最好的主题是什么?去哪里?最好的子版块是什么?去研究一下。”它就会自己去弄清楚。你也可以用 ChatGPT 或其他类似的东西来做同样的事情。所以,你开始看到,也许它们是可以互换的。但我认为有趣的地方在于,我认为,我们现在都在看到这一点,就是这些团队或代理的推出,它们管理着团队,并逐渐成为代理经理。所以我认为,了解 OpenAI 如何整合 Open Claw 或这些代理类型的团队将会很有趣。显然,我们知道他们有新的前沿工具。我一直在使用 Clawed Teams,这是一个多代理系统,它们一起运行并互相交流。但似乎,你知道的,悖论似乎是它们可以无限扩展。比如,你知道的,如果一个人可以管理两个代理,他们能管理十个代理吗?他们能管理一千个代理吗?他们能管理一百万个代理吗?以及,你知道的,这能有多深入?然后,你知道的,你把它带回到 Dove 的软件,你会想,哇,我的天哪,有多少科学家可以从事药物发现,你知道的,我回想起你说的,有多少研究没有进行,Dove,因为人们认为它可能会失败,或者风险太高,或者太危险,或者你知道的,人们还有什么没做的事情,通过降低测试成本和可获得性,人们会开始做?>> 是的。这是一个激动人心的时刻。我认为代理工作流程肯定会在我们这个领域打开价值领域。我必须问一个问题,我看到很多人现在购买 MacBook Pro、MacBook Air,因为他们不想在自己的电脑上运行 Open Claw。Jordan,你是用自己的电脑运行的吗?>> 不,我只是把它放在 Digital Ocean 或类似的地方。安装花了五分钟。我不太明白为什么每个人都认为他们需要自己的硬件来运行这个东西。我只是运行了一个终端命令,它就在 Digital Ocean 上托管了,花了五分钟,而且我多次更新都没有问题。而且我认为它每月花费大约 6 美元。所以,我还没有发现为什么你需要本地设备。我知道几周前我听到 Chamath 在 All-In 播客上说,本地是未来,而且它正在回归。我实际上认为恰恰相反。我认为在过去的几个月里,至少对我来说,我的 MacBook 正在被烧坏,对吧?我只是用完了硬盘空间,用完了内存,用完了能源消耗。对我来说,似乎拥有一个云桌面要好得多。我越来越想要一台几乎什么都没有的 Mac。我想通过 SSH 连接到我的云桌面或多个云桌面或多个代理,并让我的机器尽可能愚蠢。所以,虽然他说,或者他认为,我们正越来越多地转向本地,但我实际上认为恰恰相反,运行这些模型自己几乎是不可能的,你需要大量的管理才能做到这一点。它永远不会像与基础实验室共享那样高效。而且我认为,随着时间的推移,这些计算机将无法跟上冲浪者进入云端的步伐。所以我认为你实际上会得到一台非常轻量级的机器,生产成本非常低,本地内存不多,但能够通过 SSH 与你的服务器通信。所以我实际上看到我们正在远离本地,越来越多地转向云,甚至远离桌面本身。但,是的,我想知道你们内部的工程师是如何开发软件的。>> 是的,我认为非常相似。毫无疑问,我认为我在本地与云的看法非常相似。我绝对倾向于云。我的意思是,我们的一些电脑有 128 GB 的内存,可以在本地运行。我不确定我是否同意背后的逻辑,因为有些人宁愿有时在本地运行,但绝大多数都是在云端。是的,有时人们会在他们的桌面上做一些小的实验。>> 是的。我记得我刚加入亚马逊的时候,大概是 2016 年,我在个性化部门,他们角落里有一个装着一些英伟达游戏卡的盒子。他们当时就是这么用的。所以,我绝对可以看到这种玩法,但我的意思是,想象一下,每个工程师或公司都需要 256GB 的内存才能运行。我的意思是,这似乎是一个不可扩展的模型,而不是云计算。但我想我们会看看苹果会推出什么新产品,以及市场会走向哪个方向。但再次,同样,基础模型也是如此,对吧?无论它们是否允许你可行地在本地运行它们?>> 是的。那么,Jordan,你认为硬件供应商,比如 Mac,会倾向于开设自己的云吗?>> 苹果还没有推出自己的云,这仍然让我感到震惊。Facebook 还没有推出自己的云,这仍然让我感到震惊。而且似乎他们都有一些额外的计算能力和销售机会。我的意思是,亚马逊多年来一直在 AWS 上通过设备农场等方式将 Mac 电脑货币化。你知道的,现在,显然,我们正处于内存短缺,硬件价格飞涨。但是,你知道的,现在,如果你想要一台拥有超过一太字节内存的苹果电脑,一台超过一太字节内存的苹果笔记本电脑,就需要定制订单,商店里都没有。一太字节,我的电脑硬盘有一太字节,而且满了。所以,我认为硬件制造商离跟上我们看到的 GPU 或 CPU 服务器的计算能力还有很长的路要走。我看到一些人说他们在购买旧的 HP 服务器,然后把它们放在办公室里,因为它们已经有 120GB 的内存了,而且几乎是免费的。但是,是的,我认为云总的来说,对我来说,它曾经是一个很好的解决方案,解决了许多问题,而且似乎没有逻辑地为每个人购买一台 10,000 美元的电脑。似乎更有可能购买 1,000 美元的电脑,并将 100,000 美元投入云端。但再次,我不知道。我唯一能确定的是,会有很多变化。而且,你知道的,我告诉我的所有开发人员,如果你不愿意每周改变你的工作方式,那么你就没有准备好迎接这个世界,因为如果下周出现一个新的模型,我们看到阶跃式改进,那么我们就必须立即行动,而这实际上是我们工作方式的更大决定因素,对吧?所以,你知道的,如果 OpenAI 发布了 CodeX 5.4 或 5.5,并且它只能通过云端的 API 获得,那么我们就永远不会本地部署,因为它们不允许我们这样做。如果 Anthropic 也这样做,我们就永远不会本地部署。现在,如果我们开始看到一些开源模型赶上甚至超越闭源模型,那可能会改变行为,但我认为届时云提供商将以尽可能低的成本提供这些。所以我认为每一次转折都回到了,拥有一个专业的云服务商来管理计算,而你只担心本地计算,这更好。但,你知道的,它一直在变化,老实说,谁知道这些代理会发明什么,发明什么,发明什么,也许我们可以变得更有效率,也许 100GB 的内存不是必需的,因为我们可以租用只有 36GB 或其他东西的内存,甚至回到 16GB 或类似的东西。所以,但它非常令人兴奋,而且很有趣。我认为,我的意思是,我知道我和我的大多数开发人员在过去几周都没有睡觉,因为一旦工作结束,你就想让它做另一件事。所以,这可能是一个奇怪的恶性循环,但它很疯狂,你知道的,构建的普遍性已经能够超越开发人员,扩展到企业内部的其他人,以及他们对构建东西的兴奋,而以前他们从未被允许。你 Sam 前几天跟我说,你知道的,工程师总是被孤立起来,因为他们的思维完全集中在编写基于语法的代码上,而且你知道的,不要打扰编写这些代码的工程师,而且你知道的,你尽一切努力准备 PRD 和文档以及所有这些东西,以便当他们的时间到来时,他们能够接手。而现在,每个人都能构建的民主化打开了这一点,以至于你知道的,不再有那种孤立了,而且它已经变得非常棒的剧集,Dove。非常感谢你的加入。有什么要总结的吗?否则,我们就结束这一集。>> 是的,Dove,告诉我们,好的。告诉我们人们在哪里可以找到你。>> 哦,我们的网站是 converge-bio.com。请访问,或者关注我们在 LinkedIn 上的页面。我们分享了很多有趣的科学内容。>> 是的。这真的很好。我需要那个游戏。请把那个细胞游戏发给我。>> 好的。>> 好的。太棒了,Duff。非常感谢。感谢你的加入。谢谢 Sam。这是一集很棒的节目。谢谢大家。希望很快再见。