📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

This Startup Built the Infrastructure Powering Voice AI

YC Root Access53:01

Transcription

今天能和 Assembly AI 的 Dylan 在一起,感觉非常棒。Dylan,非常感谢你加入我们。>> 是的,我很高兴能来到这里。>> 那么,Assembly AI 是 YC 早期资助的 AI 公司之一,在我们当时称之为“AI 队列”的 2017 年夏天,而今天,它实际上已成为 YC 资助的最成功的公司之一。对于不熟悉的人,你能不能给大家介绍一下 Assembly AI 是什么,以及你现在的发展情况。>> 好的,我们帮助其他公司构建语音 AI 功能和应用程序。从 AI 笔记记录器到呼叫中心中的 AI 功能,再到实时语音代理,医疗保健公司正在我们的语音 AI 基础设施平台上构建环境医疗记录员。因此,我们大约有数百万开发者注册了该平台。嗯,我们大约有 10,000 名客户。去年,大约有 2.5 亿语音小时通过我们的平台传输,我们现在正在处理 >> 2.5 亿语音小时。>> 是的,我们现在每天处理近 200 万小时。嗯,那么按这个速度计算,今年的语音小时数将达到 7 亿小时,而且还在每周增长。嗯,所以我们确实专注于帮助其他公司拥有他们所需的语音 AI 基础设施和基本功能,以便他们能够围绕语音进行创新,并构建独立的或集成到他们产品中的创新产品和功能。>> 你能举一两个大家可能认识的客户的例子吗?以及他们是如何基于我们的平台构建的?>> 是的,当然。笔记记录是一个非常流行的用例,许多公司都在使用我们的平台。所以,如果你用过 Granola 或 Fireflies 的笔记记录器,它们就使用了 Assembly AI 的平台。>> 有趣。所以,我所有的 Granola 笔记,你知道,我说的内容实际上都通过 Assembly 处理了。>> 是的。没错。嗯,另外,在招聘领域。所以,如果你用过 Metaview 或 Ashb 的笔记记录器。好的。Ash。是的。所以笔记记录是一个非常大的领域。我们也广泛部署在呼叫中心。所以有一个大型呼叫中心公司,他们叫 Calabrio。嗯,他们为达美航空等大型品牌提供呼叫中心软件。>> 好的。所以,如果我打电话给 1800 Delta 或其他号码来更改我的达美航班,很有可能底层音频实际上是通过 Assembly,通过这种客户关系链来处理的。>> 很可能。是的。所以现在产品团队正在通过我们的平台构建围绕语音的产品和功能。但我们也看到了企业用户。所以现在我们有很多财富 500 强企业正在他们自己的呼叫中心运营或信任与安全运营中构建 AI 功能,以自动化他们团队的工作流程。所以这是产品团队和寻求构建语音 AI 的企业公司的一种结合。例如,Zoom 使用了我们的基础设施来实现许多不同的功能。是的。>> 你们在 2017 年就非常早就涉足 AI 了。这比 ChatGPT 还要早很多。我记得你们那一批,只有少数几家公司在做 AI。>> 是的,AI 队列里有大约 10 家其他公司。>> 讲讲你们的起源故事吧。你们是如何开始创业的?你们是如何如此早就进入 AI 领域的?>> 是的,我……我创业……你知道,早期故事是我上大学时创业……那不是一家 AI 公司,但通过那次经历,我学会了编程。所以,嗯,你现在不需要这样做,因为有 AI,但当时我买了大量关于 PHP、Python 和 Django 的编程书籍,我全部读完了,自学了编程,并开始构建……类似 SaaS 软件产品,并作为小型初创公司推出。>> 比如什么?一个是用作大学组织的筹款工具。嗯,一个工具是……小型企业可以……放一个二维码,然后客户可以给他们发短信……嗯……类似一个可以发短信反馈的号码。这是通过短信匿名收集反馈,各种各样的事情。嗯,我从中了解到,我真的很喜欢编程,我真的很喜欢……创造性的……构建某物的旅程,以及……想象一下,你脑海中有一个模糊的产品画面,然后你就可以通过编程把它构建出来,让它栩栩如生,并获得反馈。这是一个非常……令人上瘾的反馈循环,我真的很享受。所以大学毕业后,我继续编程,继续学习……嗯……从安全到机器学习的各种知识,我真的对机器学习产生了兴趣。所以这是……支持向量机时代。这不是……深度神经网络时代。>> 嗯。>> 最终,我加入了旧金山的一支机器学习团队。所以,我搬到了旧金山,加入了思科的一支团队,嗯,思科公司就在这里。实际上离我们现在拍摄的地方只有几个街区,那就是我在 Dog Patch 的工作地点。是的。在那里,我开始学习神经网络,并开始接触神经网络。所以,为了让你了解时间,这是 2015 年左右。嗯,所以……嗯,你知道,神经网络的早期阶段。这大概是……我们……我们什么时候攻克了 ImageNet?>> 我认为是 2013 年或 14 年。大概是那个时候。好的。>> 嗯,但我确实记得在 2014 年或 15 年参加了在谷歌总部举行的第一次 TensorFlow 会议。所以,你知道,那是……当时的情况。所以,当时发生了一些事情。嗯,一是……我看到 AI、神经网络和深度学习将在未来十年内腾飞,因为这是非常早期的阶段,数据、计算和算法将不断变得更强大,它们将为从自动驾驶汽车到自然语言处理的一切带来真正颠覆性的新能力,以及……你知道,过去十年我们看到的一切。嗯,所以我真的觉得,哇,这是我想……我被吸引并想继续深入的领域。然后我……我在 2015 年购买了亚马逊 Echo。>> 疯狂的是,我之前对语音识别的体验是它很糟糕,对吧?Siri 不好用。一切都很糟糕。你不用它。>> 但亚马逊 Echo,你可以隔着房间使用它。所以远场识别效果很好,你知道,在离麦克风很远的地方。你的电视可以开着。你可以在……你知道,在很多背景噪音中对着它大喊,它仍然能工作。最令人难以置信的是,它工作得如此之好,以至于我发现我围绕这个产品建立了新的习惯,因为它很可靠。>> 所以设置计时器、询问天气、播放音乐,这就像……>> 我对语音识别效果如此之好,而且如此可靠感到震惊。嗯,所以我开始研究语音识别技术,只是为了自己构建东西,进行创新和实验。嗯,当时市场上没有任何东西。要么很糟糕,要么……所以当时 Nuance 公司,那是一家大型……>> 他们是主要的竞争对手。>> 是的,没错。嗯,我联系了他们,我……你知道,试图找到他们的开发者 SDK,而且……你必须付费,我记得当时是……你知道,预付数千美元。>> 我记得我……我买过。是的。>> 然后他们会给你寄一张 CD-ROM……>> 附带开发者 SDK。我甚至连我的笔记本电脑都没有 CD-ROM 驱动器。所以,你知道,对我来说,我习惯了 Twilio 或 Stripe……>> 风格的开发者体验,而……而这完全是相反的。嗯,所以所有这些……想法在我脑海中汇集起来,我开始对这个想法感到非常兴奋,那就是,如果你能……你知道,使用……这些新的深度学习算法,所有这些当时在 AI 和深度学习领域发生的创新,来构建更好的……语音 AI 功能和技术,然后让任何开发者都能轻松地使用这些东西,因为对我来说,我记得我曾经接触过 Twilio,你知道,在过去。所以,大概在 2012 年或 2013 年,我接触了 Twilio……>> 我……我当时被创造力淹没了,因为我想,哇,现在我有了……我有了接触这项酷技术的机会……>> 我作为一个……一个大学生的开发者,然后……我可以……尝试所有这些非常酷的想法,而……而这一直是 Assembly 的全部精神,你知道,我们不是一家应用程序公司,我们专注于成为一个开发者基础设施工具,让开发者,无论你是……你知道,一个……一个大学生,还是一个高中生,还是财富 500 强公司的开发团队,都能轻松地获得这项惊人的强大技术……毫不费力,并且拥有良好的体验。所以,这就是……想法汇集在一起的类型,然后,你知道,仍然是我们……我们关注的,你知道,多年来一直在提供的。>> 我不知道你是否读过 Paul Graham 的文章,但是……>> 有些。>> 他的很多早期文章都谈到,过去最优秀的公司,比如微软和苹果,一开始都不是公司。它们只是工程师在构建他们认为在智力上有趣的技术,而没有明确的想法它将如何变成一项业务,并且在解决自己的痛点,对吧?构建他们看到世界上缺失的、他们个人……想要使用的东西。而且,你知道,在你开始的时候,AI 不是热门话题。它不是……它不是那种能获得巨额风险投资的东西……>> 你不能使用 AI……>> 如果你在你的……中说 AI,那是……深度学习是……要说的话,如果你用了 AI,那就是……那就是……就像一个骗局。>> 是的,没错。>> 当时的情况就是这样。>> 完全正确。是的。完全正确。因为有……几十年来……AI 初创公司都失败了。所以,风险投资对任何带有 AI 的东西都过敏。>> 是的,没错。没错。我作为创始人的经历……我认为你必须痴迷于你正在解决的问题……因为是什么让我继续前进的是……我真的很希望这个产品存在,我们还没有……完成创造,你知道吗?你知道……我痴迷于……那个问题,并希望它能实现,而我认为,如果你只是专注于……一个商业机会,你知道……那么,如果你不痴迷于产品或……主题……你可能会发现自己失去了兴趣。但我想,如果你……你知道,你应该选择,我的教训是……我与其他创始人分享的是……你应该选择一个你……你痴迷的问题,因为当我想到……如果我没有构建 Assembly,我会做什么?你知道,我……我不知道……我正在享受构建 Assembly 的过程。嗯,我一直在使用我们的产品。我一直在……不断地“狗粮化”它,玩弄它,向人们展示演示,这很有趣。所以我认为……你知道,选择一个……因为你想成为它的用户而存在的东西……对我来说一直很有趣。>> Assembly 故事中最疯狂的部分可能是你在 2017 年开始研究它,当时很少有人对 AI 感兴趣。>> 是的。>> 而且它基本上直到 2021 年、2022 年才开始腾飞。你在公司成立 5 年后的 2022 年完成了 A 轮融资。>> 是的。而最初几年只是漫长的挣扎,不确定它是否会成功。我很想听听那些早期岁月,以及是什么……是的。那是什么样的?是什么让你坚持下去?尤其作为一个单枪匹马的创始人。2017 年时,单枪匹马的创始人并不多。>> 是的。是的。我是在 2017 年夏天加入 YC 的……单枪匹马的创始人。我几乎才刚开始创业,而且我加入得很晚。我申请得很晚。在批次开始前一周才加入,我非常紧张,因为……你知道,其他公司都有……真正的产品,而且他们进展更快……他们可以迭代得更快。但……我选择了一个当时非常难做的产品,我只记得……在 2017 年,我非常紧张,非常不知所措。>> 是的,其他人只是在构建数据库网站,对吧?>> 他们可以每天发布东西。>> 你可以获得反馈,你可以在当晚进行迭代,对吧?而我们的早期用户会给我们反馈,然后我们说,好的,我们一个月后再联系你,当我们有一个更好的模型时。而 YC 是三个月。所以我们只有三次……迭代周期。这……不是很多迭代。嗯,而且没有人构建语音,因为……我现在的认识是……需要创建整个技术生态系统……这样你才能构建语音 AI 应用程序。我指的是什么?我的意思是,是的,你需要非常好的语音 AI 模型,但你也需要 LMS,你也需要向量数据库。你也需要 WebRTC。你需要 5G 移动网络,你需要整个生态系统……>> ……来构建我们看到的开发者正在构建的东西。你知道,我记得……2021 年,我们开始让转录模型……工作得相当不错……但有趣的应用不仅仅是……转录某事,而是对电话进行情感分析,是对会议进行总结。但如果你想在当时做这些任务,你必须训练情感分析模型或训练总结模型,对吧?而现在你可以使用 Assembly 和……你知道,一个 LLM,然后……你知道,你可以做的事情是……这太疯狂了,而且构建和围绕语音数据进行创新非常容易。所以,这个技术生态系统的形成花了一段时间。我认为这可能回到了我之前说的,如果在 2017 年,我……如果我制定了一个商业计划,我可能会说,我不应该做这个,因为……你知道,市场太小了。>> 市场规模是……1000 万美元。>> 是的,没错。市场太小了,所有的技术都很糟糕,为什么我要做这个?但是,你知道,我……我认为这是一个有趣的问题。嗯,而且我很幸运,当时……Daniel Gross 是我们的 YC 合作伙伴。嗯,他在苹果工作过。他看到了语音识别技术的现状,他是一个非常早期的信徒。所以他个人投资了这家公司。嗯,并在 YC 之后早期大力支持了这家公司。我们公司有一些……早期的信徒,他们知道这还很早。我认为对我来说,我一直有信念,这有点像自动驾驶汽车,一旦……它不再是产品市场契合度的问题,比如人们是否想要语音 AI 技术,而是……何时会达到产品市场契合度,何时会足够好,就像自动驾驶汽车一样……嗯,我认为事后看来,我们本可以更快一些,但是……你知道,我当时……是的,花了一段时间,但为了让你了解……情况,前几年……进展甚微。我们只有三四个人。然后我想我们在……2021 年才有了第一个……真正的客户。>> 是谁?第一个真正的客户?>> 像……真正的合法客户,至今仍是我们的客户。嗯,一家呼叫中心公司。好的。>> 然后我们在 2022 年 1 月完成了 A 轮融资。嗯,然后至今,我们已经筹集了大约……>> 那是在 LLM 之前不久。所以,是 2021 年、2022 年发生了什么?>> 是的。那导致了……拐点的开始。>> 是的。所以……COVID 是其中很大一部分。所以,在 COVID 期间,突然之间,互联网上创建和捕获的语音数据比以往任何时候都多。随着远程工作的兴起,播客在那时开始流行。我们的模型开始变得更好。我们开始使用……你知道,现代 Transformer 架构,在更多数据上进行训练。所以……转录变得更好,成本也更低。然后,你有了像 BERT 这样的其他 NLP 模型,使得在转录之上进行总结或情感分析变得更容易。所以,你看到了技术生态系统的形成,构建语音 AI 应用程序变得更容易了。>> 所以,在那时,TAM(总潜在市场)出现了加速。嗯,Excel 领投了我们的 A 轮融资,他们也看到了这一点。嗯,然后从那时到现在,很明显,它一直在……以相当 dramatic 的方式继续加速。我们在大约……三年内筹集了约 1.6 亿美元。嗯,少一些,或者……是的,大约三年。所以,嗯,花了很长时间才达到那个点,但一旦达到,它就真的开始加速了。>> 在早期,所有的用例都是非实时用例吗?它们都是非实时的。>> 嗯,所有……分析通过这个呼叫中心的所有通话……过去一周,然后……找到那些……糟糕的……糟糕的 NPS 分数或类似的东西。>> 基本上都是……基于预录音频的用例。然后现在……这些用例仍然有巨大的增长……比如我们非实时 API 的使用量仍然以每年 200% 的速度增长。但是实时用例正在爆炸式增长,因为实时功能现在要好得多……成本也低得多。你有……你知道,实时技术生态系统来构建实时笔记记录器、实时语音代理,那个市场正在真正起飞,那个用例。嗯,但是……当时都是非实时的。>> 而……而这正是你对亚马逊 Echo 的直觉。我的意思是,那是一个实时产品。那是……那是……>> 我们开始……神奇的体验。>> 是的。我构建的第一个 API 是一个实时 API。>> 但当时的实时模型……我的意思是,总的来说,所有的模型都很糟糕。嗯,实时……这要困难得多,而且我只能说,在过去的 18 个月左右,实时模型才开始……跨越一个新的门槛,而……这就是为什么你看到实时语音 AI 用例正在起飞,因为那个门槛已经……在过去的 18 个月里,在准确性和延迟方面都被跨越了,而且它仍然不完美,对吧?>> 嗯……>> 有……有实时说话人识别,你知道……今天效果不是很好。所以,仍然有很多……前进的空间。但是……但我发现的是,突然之间,这些技术跨越了某个门槛,而……很难 pinpoint 那个门槛是什么,但突然之间,它们跨越了某个门槛,并且有了产品市场契合度,然后它就腾飞了。所以,你知道,我们第一次经历这种情况是在 2021 年左右。嗯,然后现在我们又在经历一次。嗯,我想说,这再次同时适用于实时和非实时。所以,我们的一些较新的非实时模型,它们更像是……嗯……通用的……音频理解模型。所以,它们可以……你知道,识别说话人性别,并且可以……嗯……捕获……背景……声音效果,并且它们可以……只是理解和捕获音频,具有新的功能,这正在解锁新的用例。所以……嗯,创新团队可以做什么……他们能做什么只是不断地……增加。>> 所以,这是关于业务方面。我有点想听听更多关于……个人方面和……公司方面。比如,你们花了很长时间才悄悄地构建这个东西。基本上只有几个人花了大约五年时间,然后突然……我猜……它并没有真正一夜之间发生,但……在相对短的时间内,大约三年左右。它就开始……真的奏效了,而且它就火了。作为创始人,那是什么样的?>> 是的,绝对是……学到了很多成长的烦恼。嗯,而且我……我认为我学到了很多,在那段时间里,早期……在早期,它基本上就是……你知道,没有人关注。嗯,压力以不同的方式存在。然后现在就是……好的,有一个巨大的……你知道,机会,我们真的想成为这个领域的领导者,并且……并且真正地……执行这个机会。所以,我想说……我们……你知道,我们……当你……当你迅速筹集大量资金时,我认为这会给公司……和团队带来很大压力。而且我认为……最大的教训是……你必须……相信你……作为创始人的直觉。嗯,因为你真的……你知道,你应该……你正在构建的市场和你需要的公司市场契合度等等。所以,嗯,我想……它……它很难知道……我想很难知道……在公司开始加速时,应该遵循哪些正确的直觉。嗯,这需要一些时间,但现在我认为我们的直觉已经……作为公司,并且我自己作为创始人,已经变得……更加精炼了。你对语音 AI 市场正在发生的事情有着不可思议的洞察力。比如现在正在发生什么,尤其是在过去几个月里?你们正在做什么大事?你们认为到 2026 年会走向何方?>> 是的,我们看到一些非常令人兴奋的事情。所以,嗯,实时语音代理……它们现在工作得非常好。这有点疯狂。嗯,我的……嗯……是的,它们……实时语音代理,它们现在工作得非常好。所以我认为它们正在被迅速部署,因为实时语音代理的成功率现在足够高,它们可以在客户支持……你知道,一线……接待任务方面提供良好的客户体验。而且我认为作为消费者,我不知道,你……你和它们互动过吗?>> 当然。>> 是的。是的。所以……当……当我打电话给水管工或服务技术人员时,我开始意识到……哦,我在和语音 AI 说话,因为我知道……>> 是的,……绝大多数人无法分辨。>> 对,没错。是的。而且我们仍然处于这个阶段,即……你无法分辨,但……然后……有些人会在中途能够分辨,然后就会变得很奇怪。就像,等等,我……我刚意识到我在和 AI 说话。嗯,所以我认为实时语音代理将继续被广泛部署,而且……而且那里的 ROI(投资回报率)……简直是疯狂的,而且实时功能正在变得非常惊人。我们还看到了……机器人和消费硬件方面的大量需求。所以,很多……相当受欢迎的机器人公司,我不知道我是否可以命名它们,但很多非常受欢迎的机器人公司正在……将我们的模型安装到机器人上。所以,你知道,人形机器人正在四处走动。>> 那很酷。>> 是的。我认为机器人,以及消费硬件,你将越来越多地通过语音与之互动。所以,即使是……你知道,楼下的咖啡机,对吧?比如,你必须通过触摸屏操作。但如果你能走到那台咖啡机前,然后直接说出你想要的咖啡类型,>> 你知道,没有理由这项技术不应该存在。>> 完全正确。>> 消费硬件都配备触摸屏需要一段时间。嗯,但现在我认为……你知道,语音也将成为我们购买的……硬件设备的另一种交互方式。所以,你看到了那里的巨大需求。但还有这些环境设备。所以……医疗保健。我们有大量的医疗保健公司正在为医生构建环境记录员。>> 这是一个物理设备吗?>> 这是……软件,他们只是在笔记本电脑或手机上运行。而医生和病人的就诊被记录下来,因为如果你听一些音频,它实际上……很难。嗯,是有人用笔记本电脑录制了……大约 10 到 15 英尺外的对话。嗯,大量的背景噪音,低语声,但模型现在可以做得很好,能够捕获所有这些,准确率达到 90% 以上。所以……现在你可以自动化病历记录,并且可以在就诊后自动化保险提交。所以,我们看到大量的医疗保健公司正在构建环境记录员,销售公司也在构建环境记录员。所以……>> 嗯……我们合作的一家公司叫 Zero,如果你听说过的话。他们有一个……环境记录员,用于……面对面销售团队。所以,你将……挨家挨户地推销,你……进行现场销售,你有一个应用程序,他们……构建了一个应用程序,你可以运行它。它会为你提供关于你正在进行的对话的建议,实时地,面对面地。而这些用例现在工作得足够好,以至于……嗯,使用该工具的销售人员……我认为我从 Jake,他们的创始人那里听到的引述是,他们每季度可以多赚 1 万到 2 万美元的税后收入,因为他们……获得了以前没有获得的建议。所以……嗯,实时语音代理,嗯……嗯,消费硬件,然后环境功能,它们在倾听,医疗保健,嗯,销售,这些是我们看到大量新应用程序被构建和大量……新领域的地方。>> 团队现在在做什么?2026 年的路线图是什么?>> 我们正专注于构建更智能的语音 AI 模型。所以,我的意思是,模型可以做的不仅仅是转录你的语音,你可以给它们指令,你可以控制它们。嗯,它们更加智能。我认为,嗯,当前的语音 AI 模型已经做得非常好了,但它们仍然有点……愚蠢。它们没有多少智能……来理解上下文,来……你知道,例如,理解这个人正在和我说话,但他们在一个嘈杂的房间里,还有一个……你知道,婴儿在哭,他们……他们……听起来很紧张,对吧?嗯……来理解说不同语言的说话人,非常好的……知道……谁是主要说话人,谁是背景说话人。如果你正在构建一个机器人,例如,一个常见的问题是……我应该听哪个声音并接受命令,而哪个声音只是……在和人类聊天?>> 有趣。有点像……嘈杂餐厅的问题。>> 是的。>> 是的。并且知道……谁在说什么,这个人的角色是什么。所以,所有这些我们都认为是……更智能的……嗯,语音 AI 功能,我们正专注于构建它们,它们将在实时运行。嗯,我认为这是一个……一个……我们看到大量需求的重大功能。所以,我们上周发布了一个模型……叫做 Universal 3 Pro。这是我们最新的模型,也是我们最智能的模型,因为你可以给它指令,告诉它你想让它围绕它正在听的音频做什么,它可以很好地遵循这些指令。而这只是第一个版本。嗯,现在我可以给你展示一些……指令,就像……一个……LLM 提示。>> 正确。是的。所以,它……它……我们认为它介于多模态 LLM 和传统的语音转文本模型之间,我们真正做的是专注于创建一个可靠的……你知道,转录模型……它可以……在转录和转录类任务上保持稳定,但你仍然可以给它指令。而如果你今天使用多模态 LLM 并给它指令,它会变得太不稳定。在现实世界用例中它不够可靠。所以……我们专注于这个模型的后期训练,所以它是一个可靠的转录模型,但你可以给它指令,并真正指导它你想让它做什么。>> 好的。所以,让我看看我是否……我是否正确理解了。比如,历史上,转录模型……比如你们构建的那些,只做转录。它们不……它们缺乏 LLM 的……通用智能。所以……神奇的组合是当你将一个转录模型与一个 LLM 配对时。这个新模型,它有点像是两者的融合。它是一个转录模型,但你实际上已经注入了 LLM 的……通用智能。>> 是的。或多或少。没错。是的。是的。因为,如果你考虑一个多模态通用 LLM,它可以做转录任务,但这可能只占它总训练数据的 10%。所以,它还可以做数学任务,而……对我们的客户来说,他们需要一个可靠的语音 AI 模型,能够理解语音和说话人。所以,我们真正专注于这些类型的任务,而……它不会感到困惑,认为它是一个……助手。它……它将……它将作为……这种……在这种……狭窄的领域中运行。>> 我也假设它比一个完整的 LLM 小得多,速度更快,成本更低,你就像……把这个巨大的大脑只用来做这一件小事,对吧?>> 是的。而且你可以实时运行它。嗯,你实际上可以在自己的服务器上部署它。所以,我们支持这些模型的自托管……以降低延迟。而我们真正兴奋的是客户在……他们的实时语音代理中使用它,因为你可以捕获更多……从说话人那里捕获更多信息。>> 我们可以看一个演示吗?>> 是的,当然。所以,这是……这是 Universal 3 Pro 的演示。嗯。嗯。你可以看到它几乎捕捉到了我……我……我所有的……结巴声和……我发出的声音,延迟非常低。你甚至可以看到这里,当我结巴和说话时。它捕捉到的内容非常 verbatim。嗯,另一个很多实时模型都难以处理的例子是复杂的术语,比如电子邮件、长串数字。所以我给你一个例子,说明这个模型在这方面做得有多好。>> 这说得通。比如,如果我打电话给呼叫中心,他们最常做的事情之一就是问我的电子邮件地址、我的地址、我的名字。>> 是的。>> 所以,我给你一个例子,说明它能捕捉到这一点。>> 是的。我读一下我的电子邮件。它是 726_dillanhotmail.com。抱歉,那是错的。它是 xyz14_x28gmail.com。哦,哇,它完全猜对了。实际上比人类还好。>> 是的,它能很好地处理……你知道,复杂的字母数字字符串。即使我做了一些事情,比如,我再做一个。>> A aaa bbbc 1111 2x56。>> 好的。所以,如果我打电话进来,我读的是……比如……飞机……登机牌号码之类的。是的。它就能……完全猜对这样的字母数字字符串。是的。而且你……它甚至……非常健壮……嗯,即使在非常具有挑战性的音频条件下。所以我给你展示一些很酷的东西。如果我低语,它仍然能很好地捕捉到。>> 是的。我的电子邮件地址是 Dylan dy assembly.com。>> 差不多。我低语得很轻。嗯,它抓住了 assembly.com。哇。现在,很酷的是……你知道,很多时候你会看到这样的错误,然后……>> 你知道,就像你无法控制一样。嗯,但你实际上可以提示这个模型……在这些类型的条件下提高准确性。所以,嗯,我将切换到这里,给你一个例子。嗯,所以,我可以告诉模型,比如说,我……我想将所有听到的语音都转换为西班牙语。我可以提示模型。我可以说,转录这段音频,并将你听到的一切翻译成西班牙语。我将为这个例子录制一些音频。嗨,我叫 Dylan,我住在纽约市。所以,你可以看到……嗯,它转录了我,但它用西班牙语转录了我,因为我……我在这里告诉它,我想让你用西班牙语转录一切。>> 嗯。>> 所以……所以……>> 所以……这个模型,它……它基本上……会说多种语言。多少种语言?>> 是的。所以,这是一个多语言模型。嗯,目前它支持七八种语言,然后我们将在接下来的几……几周内添加几十种。是的。>> 自从你们推出以来,人们是如何使用这种可提示配置的,还是说现在说还太早了?它才发布一周。>> 你知道,我认为我们过去几年发现的是,每个应用程序都有不同的要求。所以,这个模型让开发者能够……向模型解释这些要求,然后它就会遵循它们。所以,让我给你举一个例子,我的意思是。嗯,这是一段音频。嗯,我在这里播放。>> 我希望你收到了我们的名片。>> 好的,没人说话。我们等她说话。>> 嗯,我们只是想……该死。>> 所以,嗯,让我……让我……让我把这段音频放进去,然后直接给你展示一下,开箱即用,它的行为会是怎样的。>> 好的。所以,你可以看到……嗯。>> 它错过了背景说话人,对吧?嗯……>> 如果……如果你想要模型……所以,有些开发者不希望捕获背景说话人。嗯,例如,如果你是一个机器人……>> 而你只想专注于主要说话人,>> 你可以让模型这样做。但在本例中,假设你想捕捉背景说话人。嗯,你可以做一些很酷的事情,就像我在这里展示的。嗯,我实际上需要复制这个提示。所以,所以……嗯,让我们说你想捕捉背景语音,但你实际上不想转录它。你只是想知道有背景语音。嗯,这里有一个提示,我们将给模型,我们会说,当多个说话人同时说话时,标记交叉对话片段。然后我们将再次运行该文件。>> 你可以看到,现在模型正在识别背景说话人的交叉对话。而且……它没有转录它,因为我们告诉它只标记那些交叉对话片段。好的。但是,如果你想让它实际转录那个背景语音,你可以告诉它,并转录那个背景语音。所以,你对模型如何工作有这种程度的控制。而且……嗯,再次,因为它不是一个巨大的多模态 LLM,它是在中间的。>> 嗯,它将表现得像一个 ST 或 ST 类模型。嗯,所以它可以做得很好的多语言代码切换。它可以做说话人识别任务。而这只是第一个版本。我们已经在训练新的模型,它们将很快发布,并且在指令遵循方面会更好,在短短几周内就会有新的功能。>> 这太酷了。>> 是的。>> 你是如何训练它的?以及你如何让它在电话号码和电子邮件地址方面如此准确?>> 是的,电话号码,电子邮件地址非常酷。嗯,那里的准确性。所以,我们花了多年时间与客户合作构建这些类型的应用程序,并在此领域积累了深厚的专业知识……你知道,失败模式是什么,什么才是真正重要的,而我们大部分时间都花在……想出非常好的后期训练技术,让模型……在这些……传统上具有挑战性的环境中表现得非常好。所以,例如,当你听到嗯,或者不,或者是的,电话号码,很多时候这就是你今天与语音代理交谈的方式,当你试图完成某个动作时。嗯,我们花了很多时间在后期训练上,关于我们如何训练模型,使其在这些类型的任务上表现得非常出色。所以,Assembly AI 的故事中还有另一个有趣的部分是,回到 2017 年,当你开始这项工作时,除了语音 AI 是一个糟糕的市场,它……非常小,而且没有人真正有什么东西在工作。它也是一个竞争非常激烈的市场,你正在与谷歌和 Nuance 竞争,人们可能不记得了,但 Nuance 是这个领域的巨头。我忘了 2017 年还有谁,但我很好奇那是什么样的。>> 是的。>> 并且……你害怕那些竞争对手吗?你……>> 是的。>> 你们……你们……投资者……是否对投资持怀疑态度,因为你有所有这些……巨头竞争对手?>> 是的,他们肯定对投资持怀疑态度。仍然,我想说,怀疑。嗯,但是的。是的,绝对。我认为……它……它回到了……我曾是那些产品的用户,我看到它们不够好。嗯,我认为……你知道,对我来说,当时仍然让我对我们赢得这个领域的能力有信心,因为我们有……我们在这个问题领域拥有这种专业知识,客户想要什么,这使我们能够构建最好的产品。我认为,总的来说,这似乎是我学到的一些东西……比如……是的,你需要资本,你需要团队和资源……当然,但你也需要拥有专业知识,这来自于……非常接近问题。有一个例子……我想到了,就像莱特兄弟一样。莱特兄弟在现代……自费……他们的……飞机的开发……用……大约 4 万美元的自费资金……而他们正在与塞缪尔·兰利竞争,他……得到了史密森尼学会的资助……你知道,我猜是 20 倍的资金。嗯,而莱特兄弟赢了。而且我……我从中得到的一个重要启示是……他们对问题的专业知识要好得多,因为他们……在一年的时间里……进行了 1000 次试飞……他们亲自进行试飞,他们会了解什么在起作用,什么不起作用,他们需要什么来迭代。而塞缪尔·兰利,我想他只有七次……他甚至没有亲自进行。他……他让他的手下做的。>> 他让他的团队做的,而且不是……一个愚蠢的人,对吧?比如,聪明人,但他错过了莱特兄弟拥有的专业知识。所以,对我来说,我认为任何公司要想获胜,都需要对……你试图……去构建和做的事情,以及……你想制造什么样的产品,拥有……深厚的专业知识。嗯,所以,当时和现在,我认为……嗯,是什么让我们能够构建最好的产品并赢得胜利,是我们拥有一支……非常密集的专业团队。我们非常贴近客户。我们在 Slack 上有数千名客户。>> 我们……比如,我们的 Slack 是客户反馈的“消防水龙带”,我们不只是过滤掉好的部分。比如……我们有一个……一个有 80 人的大型产品团队频道。我们在一两周前收到了一些相当糟糕的反馈,然后它就被粘贴在那里,每个人都说,“是的,这是个好反馈。我们去修复那个东西。”所以,这是我们文化的一部分,我们只是在努力构建最好的东西。嗯,而且我认为……这在当时给了我们……你知道,一个优势,而现在……仍然让我们能够……构建更好的产品。这是否也体现在技术方面,比如谷歌拥有无限的资金来……投入计算资源来解决这个问题,但他们最终基本上……浪费了吗?就像汉利一样,而你们是否能够更聪明地利用它,因为你们离问题和客户更近?我不知道他们在……谷歌或其他公司内部在做什么,对吧?我知道那里有……非常聪明的团队。我认为我们只是……更关心这个问题领域。而且我想说,我们团队里的人可能是世界上最有经验的开发和构建真实世界语音 AI 系统的人,因为我们一直深入其中。我们有……通过我们的 API 平台……在市场上拥有一些最大的规模,我们能够从所有这些客户反馈中学习,无论是好的还是坏的,并且知道人们想把技术带向何方。所以……我们有一个才华横溢的团队,但我们在这个团队中拥有深厚的专业知识,而不仅仅是职能专业知识。而且我认为这通常是大公司中缺失的要素,你知道,领导项目的那些人离客户反馈太远了,而且……很多时候他们自己都没有尝试过产品。你知道,这很了不起。嗯,而且一旦你亲手使用你的产品,你就会意识到……哦,那里不好,那里不好,对吧?所以,嗯,我们文化的一个重要组成部分是……每个人都亲手使用产品。我们都在测试它。我们都在尝试它。我们都在用它构建东西。嗯,所以你很快就能看到……它在哪里好,在哪里不好。所以,比如我给你的电子邮件演示,我们……我们真的……嗯……理解……这是一个问题,并确保……它运行得非常好。所以,我们正在非常贴近底层和客户进行运营,我认为这就是……这就是帮助我们……超越更大、……资金更充足的团队。>> 所以,直到 2021 年,团队都……非常小,只有……几个人。>> 几个人。是的。>> 几个人。然后在 2021 年,你们进入了……超增长模式。>> 是的。>> 筹集了大量资金,进入了超增长模式。是的。>> 是的。>> 今天的团队是什么样的?然后……从基本上不增长到突然超增长的旅程是什么样的?有没有……一些……嗯……沿途学到的教训?>> 是的,完全正确。我认为我们……我们筹集了大量资金,然后……我们开始超速扩张和发展团队,并非常积极地组建团队。而且我认为可能……一个……我们当时犯的一个比较大的错误是……只是没有足够清晰的信念……我们想在哪里投资,而……我们只是在探索。嗯,所以,例如,现在我……我尽量避免雇佣某人去探索一个领域,而不是……让我们用我们现有的团队去探索它,如果它运行得很好,那么我们可以去投资那个领域,并雇佣更多的人。但我认为很多公司……你知道,会遵循传统的模式,比如……好的,这家公司,它和我的一样,做了……

X 和 Y 和 Z。因此,就像我应该做 X 和 Y 和 Z 一样,我也应该去建立一个,你知道,一个 50 人的 SDR 团队,我也应该去,你知道,我需要这个和那个,就好像它是一个特许经营业务一样。嗯,但我认为每家公司都不同。因此,知道该投资什么,建立什么团队,嗯,尤其是在我们所处的这样一个新兴市场中,是很难的。嗯,现在我们更加保守,就像,嘿,我们到底想在哪里投资,而不是这仅仅是,你知道,一个我们想探索的领域?如果是探索,我们就用现有的团队来做。嗯,然后也只是非常严格地筛选,嗯,非谈判事项和文化契合度。我认为每个职位都有不同的非谈判事项。嗯,但然后你开始和人们交谈,你会说,“哦,我喜欢这个人。”而且,你知道,我们很合拍,所以是的,让我们聘请他们。但然后你意识到,哦,我真的,你知道,这件事在职位上真的很重要,我应该在那项非谈判事项上更坚定一些。所以现在我们非常清楚,好吧,对于这些,对于这个职位,这些是非谈判事项,对于那个职位,这些是非谈判事项。对我作为创始人来说,招聘时很重要的一点是,嗯,你为什么想在一家语音 AI 公司工作?就像为什么在这里?嗯,不仅仅是一家 AI 公司,不仅仅是一家获得风投支持的公司,不仅仅是一家快速增长的公司,而是,你对我们的产品、我们的领域、我们的市场、我们的客户有什么热情?嗯,因为我认为,嗯,那是一个非常重要的组成部分,对吧?就像这里有挑战性的问题,你知道,在任何公司都有很多挑战性的问题,但我认为,你知道,我非常关心的是找到那些对我们的产品和我们的客户正在构建的东西真正感到兴奋的人,嗯,并且因此会更加,你知道,着迷和充满热情。所以这是我认为我在招聘人员时,嗯,也更加,你知道,严格对待的事情。所以,我学到了所有这些东西,我认为这可能是,嗯,最难吸取的教训之一,但现在我们公司大约有 80 人。嗯,一个非常精干的团队。>> 只有 80 人。考虑到你们每年处理 7 亿小时的音频,这实际上比我预期的要小得多。>> 是的。是的。非常非常小而精干的团队。我的意思是,我们就像,你知道,在公司各处使用 AI,嗯,就是为了尽可能快地行动。而且我认为,你知道,我们在公司谈论的一件事是,我们将优化速度和创新。就像那将是一个明确的决定。所以我们不做 OKR 级联,我们也不做规划演习,就像我们有明确的指标要达到,而且这些指标在整个公司都非常透明,然后我们都在朝着这些指标努力,我们可以快速行动,创新,并保持活力和响应能力,因为我们是这个小而透明的团队。嗯,而且我认为我的目标是,始终保持尽可能少的运营开销。就像在,你知道,完全混乱的边缘摇摆。就像,就像我想就在那里。嗯,因为我们,你知道,我们已经,就像,摇摆不定,对吧?就像拥有,这里是每个团队的 OKR,这里是每个团队的六个月路线图,这里是每个团队的,你知道,战略文档,就像微软风格的。>> 是的。就像这里一切都经过计划和组织,而且感觉很好,但是,>> 那不是,你知道,你必须去,>> 构建东西并做文件里写的东西的替代品,然后如果两个月后你获得了新的信息,>> 你应该适应,>> 对吧?>> 如果你致力于某个计划,你会说,哦,我们下个季度再做。就像,如果我们现在应该做那件事,如果那是最重要的事。所以,>> 我们现在真的把公司,嗯,运营得尽可能小,尽可能精简,因为我认为这给了我们创新和快速行动的能力。嗯,而这确实是,它是什么,它是什么,它是在,嗯,服务于什么。所以现在我们,>> 是的,你知道,我们现在公司大约有,你知道,大约有 10 个空缺职位。嗯,>> 你在招聘>> 横跨,你知道,前线部署工程师、软件工程师、研究工程师,嗯,嗯,嗯,嗯,在我们的营销团队,我们有空缺职位。所以,基本上在所有部门,我们都有空缺职位,但我们真的在寻找那些,你知道,想在我们这样运作的公司工作的人,嗯,对我们的产品和领域感到兴奋,而且这并不适合所有人,这完全没关系,但对于那些想在我们正在建立的环境中运作的人来说,嗯,你知道,这太棒了,我们想找到那些人。>> 好的,这有点随机,但我很好奇。你们自己生活在你们创造的未来中吗?比如,每个人整天都在和他们的电脑说话,而不是打字?你们会记录所有会议并转录所有会议吗?你们的咖啡机说话吗?>> 所以,所以是的,我们是,我的意思是,我们几乎所有的会议都有 AI 笔记员在里面。而且它不仅仅是为了做笔记,对吧?我们正在建立一个公司内部的知识库,围绕客户反馈、销售对话。我现在就可以进入这个知识库,询问这个知识库,根据客户反馈,我们的产品路线图应该是什么?>> 而且它能够访问所有会议的所有转录>> 而且它会告诉你一些完美的东西,就像,嘿,这是第一件事,这是第二件事。嗯,而且公司里的每个人都可以访问这些信息,这太棒了,因为现在,>> 如果你是一名工程师,在这个产品上,客户和你之间没有层级。就像你真的拥有这个客户反馈的洪流。一切,从人们在 Reddit 和,你知道,X 上说什么,到我们正在进行的客户对话,会议,到,你知道,我们收到的支持票,>> 所有这些都被带入了公司。>> 就像那里有所有的,你知道,真相,对吧?关于你的产品和反馈以及市场等等。嗯,而且我认为很容易,你知道,加上一个主观的观点,对吧?通常是那些掌权的人来决定什么是主观的观点。但是,如果你拥有所有这些,所有这些真相,就像公开可用一样,就像每个人都在客观地看待这些信息,而且没有主观层面。嗯,而且我认为这对我们公司来说非常强大。我认为,你知道,成功的公司,我认为将以同样的方式运作。>> 是的。我的意思是,这只是必不可少的,你知道,那些在没有 AI 增强人类智能的情况下运作的公司,将会输给那些已经增强了自己智能的公司。>> 完全同意。是的。