Transcription
大家好,听众朋友们,欢迎回到《无先验》。今天我和 11 Labs 的联合创始人兼首席执行官 Mi Stendes 在一起,11 Labs 创立的宗旨是改变我们彼此交流的方式 [音乐] 以及与计算机通过语音交流的方式。在短短三年内,他们的年收入已飙升至 [音乐] 超过 3 亿美元。我和 Motti 谈论了语音教育的未来、客户体验以及语音的其他应用,以及如何构建一个从自助服务到企业级、并结合了研究和产品公司的多细分市场 [音乐]。欢迎 Marty。>> S 谢谢你邀请我。>> 谢谢你在早上 7 点做这个。>> 这是我们的荣幸。谢谢你在早上 7 点做这个。很高兴我们终于能一起做这件事了。嗯,我想我们的许多听众可能在某个时候使用过或玩过 11 Labs,但对于其他人来说,你能否重新介绍一下这家公司?>> 当然,我们嗯,在 11 Labs,我们正在解决人类与技术如何互动的问题,以及你如何无缝地与该技术一起创造。嗯,这在实践中意味着我们构建了基础音频模型。所以,在这个领域建立模型,帮助你创造听起来像人类的语音,以更好的方式理解语音,或者编排所有这些组件使其具有交互性,然后在这些基础模型之上构建产品。我们有我们的创意产品,这是一个帮助你进行有声读物旁白、广告或电影配音,或者将这些电影翻译成其他语言的平台。在我们的代理平台产品中,它有效地提供了一种帮助你提升客户体验的方案,构建了个人人工智能教育代理,新的沉浸式媒体方式嗯,但这一切都围绕着我们使命的光芒,即解决我们如何以更好的方式按照我们自己的条件与技术互动的问题。>> 你在 2022 年创立了这家公司。>> 是的。>> 从那时起,你们就取得了惊人的火箭式增长,我敢肯定,这经历过起起伏伏。我想问问你,你能否大致说明一下公司今天的规模?>> 所以我们已经发展到全球 350 人。我们起源于欧洲。我们最初是一家远程公司,至今仍是远程优先,但在世界各地设有分支机构,伦敦最大,纽约第二大,华沙、旧金山,现在还有东京和巴西。我们的年经常性收入(ARR)为 3 亿美元,其中自助服务(大量订阅和创作者使用我们的创意平台)约占 50/50,企业方面使用我们的代理平台的工作也接近 50%。这是在销售主导的经典销售主导方面,我们服务了超过 500 万月活跃用户,在创意工作方面,而在企业方面,我们有几千名客户,从财富 500 强公司到一些增长最快的人工智能初创公司。>> 我认为你是一位了不起的创始人,但我也认为这是一家非常有趣的公司,因为它对许多人,尤其是投资者来说,非常不直观。我不知道你一开始是否遇到过这种情况,但我们都在 2022 年在那里。有一类公司允许以某种方式进行创作,当我们看你最初的业务,除了研究本身。嗯,我会把 11 Labs、Midjourney、Sunno 和 Hunen 归入这一类。我认为有一种普遍的感觉,比如“谁真的想做这个?”嗯,你最初的判断是,有多少人想制作声音,或者是什么让你相信它会比例如配音市场大得多?配音市场并不算巨大。我认为第一点是,正如你提到的,同时做好产品和研究非常棘手。我很幸运,我的联合创始人和我认识了 15 年。我认为他是我认识的最聪明的人,并且能够完成很多研究工作,为提升体验奠定基础。但我们俩都来自波兰。最初的信念也来自波兰。这是一个非常奇特的事情。但如果你用波兰语观看一部外国电影,无论是男声还是女声,都是由一个单一的角色旁白的。所以,电影中的一切都显得平淡无奇。>> 一种糟糕的体验。>> 确实是一种糟糕的体验,而且你仍然喜欢,如果你从小就学会英语,你就会切换过来,不想这样看内容。嗯,令人惊讶的是,直到今天,对于大多数内容来说,情况仍然是这样。结合这一点,我和 Palunteer 一起工作,我的联合创始人曾在谷歌工作,我们知道未来会发生变化,所有信息都将在全球范围内提供。然后,当我们开始深入研究时,我们意识到>> 以高质量的方式,用每种语言。那是起点,而重要的事是,与其仅仅翻译,你能不能保留原始的声音、原始的情感、原始的语调?嗯。>> 所以,想象一下这个播客,但人们可以切换到西班牙语,他们仍然听到 Sarah,仍然听到 Matty,而且是同一个声音,同样的语调。嗯,这基本上就是我们 Lex 采访 Narendra Modi 时所做的,你可以更好地沉浸在那故事中。嗯。>> 嗯,这就是最初的嗯,嗯,洞察力,然后我们开始深入研究,那就是我们与之互动的大部分技术都会发生变化,无论是你如何创造。让声音栩栩如生仍然相对棘手。你需要经历聘请配音演员、拥有录音室、拥有昂贵的工具来实际调整它的昂贵过程。工具并不直观。所以,所有这些创作过程都会而且应该改变,以便让有热情的新人更容易地将它们变为现实。然后,很多技术都无法让你能够嗯,重现特定的声音,或者以那种高质量的方式创造出来。当然,当我们进一步深入研究,并从静态部分转移开时,整个交互部分仍然令人惊讶,它的运作方式是,我们大多数人都看到了过去几十年的技术演变。但你仍然会花大部分时间在键盘上。你会看着屏幕,而那个界面感觉有问题。它应该是你可以通过语音与设备交流的地方,通过最自然的界面,那是人类开始时就存在的界面。嗯,我们意识到我们想解决这个问题,我认为现在快进到 2022 年,我觉得很多人也会持有这种信念,即语音是未来的界面,当你想到我们周围的设备,无论是智能手机、电脑还是机器人,语音将是关键之一,但我认为 2022 年不是这样,嗯,而且如果你考虑创意方面或交互方面的市场,很明显它将是一个巨大巨大巨大。>> 所以,即使你考虑你的业务的研究部分,然后你有至少两个不同市场的解决方案,然后你还有这个更大的使命。在过去的 5 到 10 年里,很多事情都发生了变化,但过去有一种非常坚定的传统观念,即在一家初创公司里,一个人必须做好一件事,没有别的路可走。就像你把这当作一家互动公司,一家平台公司。你是如何考虑研究和产品工作的排序的?>> 这有意义吗?或者,考虑新市场?>> 也许在这个问题中也包含着,关于语音的质量,因为如果我可以说,如果模型不够好,对于某些用例来说根本没有意义。做产品。>> 我认为这是对的。这几乎就像我们最初开始时,我们所做的是尝试使用市场上现有的模型,并为我们的第一个用例进行优化,实际上是从旁白和配音的结合开始,然后在创意方面,嗯,我们很快就意识到,现有的模型产生了如此机械化、不好的语音,以至于人们不想听。这就是我的联合创始人的天才所在,他能够组建团队并自己进行大量研究,以创造新的工作方式。但是,就像你的问题一样,我认为我们内部的组织方式以及我们对排序的思考方式,很大程度上是看第一个问题,然后围绕那个问题创建一个实验室,这是一个由研究人员、工程师、运营人员组成的组合,去解决那个问题。第一个问题是语音问题。所以,我们如何重现声音,就像你说的,需要有研究专业知识才能做好。所以,我们最初有一个语音实验室,其使命是能否以更好的方式进行旁白。大约有五个人在做这项工作,然后先排序研究,然后在该工作之上构建一个简单的层,以便人们可以使用该工作,然后从那里扩展,提供一个完整的有声读物套件,然后创建一个完整的电影旁白电影配音。嗯,然后我们转向下一个问题,那就是意识到,好吧,我们已经解决了声音问题,很棒,为了让内容听起来像人类。>> 为了让我们与技术互动,第一个问题是解决如何按需获取知识。嗯。>> 所以,我们实际上启动了第二个团队,这是一个第二个实验室,一个代理实验室,一个由研究人员、工程师和运营人员组成的团队,他们再次尝试解决这个问题:好吧,我们有文本到语音,他们现在如何将它与语言模型和语音到文本结合起来,并编排所有这些组件,同时将其与其他系统集成,使其更容易。然后同样,你知道,你嗯,你从只看语音层扩展到这些系统如何协同工作。在这里,你也需要研究专业知识,以低延迟、高效、准确的方式做到这一点。嗯,但同时,产品层也开始形成,不仅仅是编排很重要。还有集成,你如何链接到遗漏的系统,你如何围绕它构建功能,或者你如何在生产中部署它并随着时间的推移进行测试、监控、评估。>> 你觉得你在构建工具时创造了新的用例吗?人们是否已经知道他们想做这件事了?嗯,因为有一种论点,我记得听到过,比如“嗯,你知道,企业不知道如何处理语音,有多少人真的想这样做?”然后你基本上服务于你的业务的创作者/出版商方面。是的。>> 这绝对是我们认为将在世界上发生的举措,以及对许多事情的反应。嗯,就像我回想起来,我们嗯,当然,内部语音实验室或代理实验室,然后启动了许多其他实验室,以响应我们开始的音乐实验室的问题,因为人们想用 11 Labs 创作音乐。11 Labs 是一个完全许可的模型,人们想使用和创作语音,但他们想以简单的方式添加音乐。我们想提供这一点,然后当然,这通过如何将音乐、音频、声音结合起来而实现。嗯,我们现在正在集成来自图像和视频的合作伙伴模型,进入那个套件,如何将所有这些结合在一个套件中。其中很多都是对市场的回应,说“嘿,我们很喜欢这个”,然后你就会有完全不同的用例,即使在那个领域。比如配音。配音是我们觉得没有大力推动的用例,但我们知道,在理想的世界里,未来你将能够自然地将内容传递到各种语言,同时保留这一点。嗯,我仍然认为这个市场将是巨大的,因为它不仅仅是电影中的静态交付,而且如果你环游世界并想实时交流,就像《银河系漫游指南》中的泡泡鱼一样,这将会发生,这将是最大的。>> 嗯,比如打破语言障碍,沟通和创作的障碍,所有这些都将打破,这将是基础的实时配音概念。所以,我对那部分感到非常兴奋。同样,在代理方面,你嗯,你嗯,你有一些显而易见的事情,当然,我们合作的客户或合作伙伴会想要集成,那就是我们想要与 XYZ 系统集成。但然后有一些部分可能不像预期的那样容易,当你与技术互动时,你当然想了解发生了什么,但你也想了解它们是如何被说的,并将它们纳入其中,这是我们试图优先考虑的事情。所以,当人们实际与技术互动时,他们会意识到,哦,表达一件事实际上是如此令人愉快、有益和有帮助。所以,我想问一个关于质量的问题。嗯,嗯,你 [清嗓子] 你知道,我与一系列公司合作,我们嗯,向他们销售产品,买家通常不是机器学习科学家。对。对。嗯,即使是科学界也没有完整的评估基准来理解每个领域。这是一个众所周知的问题,但我可以想象,对你的许多客户来说,他们并不像知道如何选择好的声音。那么,你是如何处理这个问题的?比如,是“嘿,我克隆了一个声音,它听起来像我,我相信它,我会尝试所有这些不同的选项”,还是“你实际上在教人们进行评估?”>> 这是一个很好的问题,因为我认为有两个大问题。一个是,你如何对音频领域的整体空间进行基准测试,就像你说的,它如此依赖于特定的声音,更不用说如果你正在训练交互式语音,那就更棘手了。嗯,然后第二个问题是,当你处理特定用例时,你如何选择声音。所以,我先从第二个方面开始,我们有一个声音选择器,基本上,当我们与企业合作时,我们部署那个人与他们合作,帮助他们导航。那个人就像一位声音教练,她自己也有令人难以置信的声音。嗯,现在我们有了一个由她领导的团队,他们会合作帮助你找到适合你品牌的正确声音。>> 现在你有一个名人市场。>> 现在你有一个名人市场,可以帮助你甚至获得标志性人才,比如 Sir Michael Pain。这部分很重要,因为声音当然取决于你想要构建的用例,语言,所有这些都会影响到什么声音适合你的客户群。所以,我们有一个声音专家帮助这些公司,有些公司对他们想要的东西有很强的意见。所以,他们有时会自己选择,有时会给我们一个简报,比如“嘿,我们想要一个听起来专业、中立的声音”。我们最近有一家公司,一家欧洲最大的公司,他们给了一个非常原创的简报,他们想要尽可能机械化的声音。>> 好的。>> 这是反直觉的。>> 嗯,但对于>> 你来说,我们不能再这样做了 [笑声]。>> 几乎。但我们试图倒退,如何做到这一点?但我认为我们取得了很好的结果。嗯,嗯,但最近我们在日本有一家公司,在日本和韩国,他们想根据打来电话的客户提供不同的声音。他们有一个>> 年长的人群和一个非常年轻的人群。年轻人想要市场上一个非常兴奋和快乐的著名声音。嗯,而对于年长的人,他们想要一个平静、慢语速的声音。我们在这方面提供了很多帮助。所以,这是关于声音的部分,我认为这将是一个重要的选择,个性化选择,甚至可以动态变化。>> 是的。好的。正是如此。正是如此。然后,也许在未来,它将完全取决于你的互动。当你了解人们想要什么时,你就会有一个声音被创造出来。所以,你知道,比如你晚上很累,你想要一个稍微不同的声音,或者可能不是。也许那是你最好的专注时间,有一个声音能给你带来能量,而且当你醒来时,它可能会有所不同,给你带来早间新闻,告诉你发生了什么,或者天气如何。所以,所有这些都可以不同。昨天我们和一些合作伙伴一起吃晚饭,其中一位说的第一件事是,“嘿,我有一个新的请求给你。我想要一个纽约口音,带有长岛口音。”我从来不知道这是个东西,而且据说这是个东西。所以,所以我们有这个。然后,关于第一个问题,我认为它仍然是一个未解决的问题,我认为当然在语言模型方面有很好的基准测试,我认为在图像领域它们相当好,在语音领域,当然有语音质量,但很多时候你是否喜欢语音取决于声音,如果你比较模型 A 和模型 B,并为它们提供不同的声音,即使质量差异很大,声音本身也可以产生如此大的差异。我们已经看到了这一点,我不知道你是否知道人工分析基准测试。我认为它们相当好。仅仅改变声音就会产生如此大的影响。>> 这太有趣了。是的。而且我很好奇,正如你所说,这是我们几千年来最主要的互动模式,是吧?嗯,而且偏见是服务性的,但我认为是的。>> 我们对此非常敏感。嗯,我认为人们也会对他们的个性化非常敏感。>> 100%。我认为还有第三个方面,也许与你的笔记不直接相关,但我们也意识到,你嗯,所以你有基准测试,你有,我如何为我的受众找到合适的声音,但即使是行业对如何描述音频数据的理解仍然滞后。嗯,当我们刚开始的时候,我们当然去找了传统的参与者,让他们帮助我们标记,不仅仅是说了什么,比如转录,还有怎么说的,比如情感、口音,而大多数人只是无法有效地完成这项工作,因为你需要听,并且需要一点技能,比如“我该如何描述这种特定的表达?”所以,我们需要自己创造。所以我认为还有这一点,即如何有效地以更定性的方式解释音频数据。那>> 那就是,是的,更棘手。你能谈谈代理平台方面的情况吗?对于那些试图构建代理的企业或创作者来说,什么最具挑战性?也许令人惊讶的或高吸引力的用例是什么?我认为每个人都对基于代理的客户支持的想法有所了解,但我可以想象你们在做很多其他事情。>> 是的。所以,客户支持确实是启动最快的,也是我们看到被许多用例超越的,无论是与思科、Twilio 还是 Tel Digital 合作,他们都在很大程度上提升了这一点。我认为在这个领域发生的第二个令人兴奋的方面是从被动的客户支持,我有一个问题,我联系客户支持,转变为更主动的客户支持体验的一部分。所以,为了明确这一点,我们与印度最大的电子商务商店 Misho 合作,他们开始在客户支持方面工作,我想要退款,我想查看包裹的追踪信息,然后让代理成为体验的一部分。所以,如果你去网站,你有一个小部件,你可以通过语音与之互动,你可以问它,“嘿,你能帮我导航到物品 X,物品 Y,或者你能解释一下在这个时期,什么是我应该送出的礼物吗?”然后它会根据你的问题,根据提供的商品,向你展示这些物品,导航到正确的区域,甚至可能完成整个结账过程。我认为这将是一件非凡的事情,可以提升整个体验,它更像是一个贯穿始终的助手。我们与 Square 合作,使企业能够完成这项工作。同样,语音订购也是如此。如何现在将其作为完整的发现体验的一部分,其中商品会展示给你?你可以获得更多的解释,我认为这将是一件非凡的事情,从头到尾。所以,这是一个类别。第二个是静态媒体向沉浸式媒体的广泛转变,今天有如此多的精彩故事和知识产权以一种交付方式存在,现在你将能够以一种全新的方式与这些内容互动。嗯,我认为一个令人难以置信的用例是与 Epic Games 合作,我们与他们合作,将 Darth Vader 的声音带入 Fortnite,数百万玩家可以在游戏中与 Darth Vader 互动,你拥有完整的 Darth Vader 体验,以一种新的方式。我认为这将是跨越所有领域的,无论是与书籍对话,与你喜欢的角色对话,还是整个领域的转变。然后,我认为我最兴奋的关于世界和转变的是教育,你将能够拥有一个个人导师在你的耳机里,你实际上可以以一种令人惊叹的方式学习某样东西。我给你两个快速的例子。一个是,我们最近与 chess.com 合作。我是一个巨大的国际象棋迷。我是一个真正的国际象棋迷。好的,太棒了。所以,你可以学习国际象棋,你可以让 Hikaru Nakamura 或 Magnus Carlson 成为你的老师,教你如何下棋,这很棒,甚至 Botus Sisters,或者所有参与其中的不同玩家,我认为这很棒。然后,也许最后一个是 Masterclass,我们与他们合作,从你可以一步一步地进行内容,嗯,但你也可以有一个互动体验。最好的例子是与 Chris Boss 合作,他是 FBI 的谈判专家,也是顶尖的谈判专家之一,他有一个 Masterclass 课程,但你实际上可以打电话给他,进行一次模拟谈判,这太疯狂了。>> 是的,得把人质弄出来。我们一定会试试。>> 是的。嗯。>> 我能再加一个吗?我认为最后一个结合了所有这些,我最近才意识到,这太疯狂了。所以,最近我去乌克兰,我们正在与转型部合作,他们正在创建一个第一个代理政府。>> 而疯狂的是,他们拥有所有这些>> 政府>> 代理政府。所以,他们想改变他们管理所有部委的方式。>> 好的。>> 这听起来是一个宏伟的目标。>> 不,我认为基础在这里。所以,实际上,我立即被它吸引。是的。而疯狂的是,我认为他们在实际执行方面领先了很多。>> 我认为有两个具体方面。一个是他们结合了所有这些用例。所以,我们正在研究他们如何能够有效地提供政府客户支持,无论是关于福利、就业还是关于如何离开国家的流程。所有这些都通过一个数字应用程序来运行。然后,二是他们如何主动告知公民可能发生的事情。但然后有一个教育系统,也通过个人辅导体验来运行。所有这些都在发生。所以,看到这一点令人难以置信。第二个令人惊叹的事情是他们的方式。所以,他们有数字化转型部分,但每个部委都有工程领导者来领导这些工作,然后将它们带回一个中心点。所以,看到这一点令人难以置信,而且也很自豪能够与他们合作进行这次转变。尽管发生了所有这些事情,他们却如此>> 这太棒了,这真的令人鼓舞。嗯,我能问你一个关于商业模式的问题吗?因为从战略角度来看,实际上我有很多问题。嗯,我观察到的一点是,如果我看看像一个丰富的语音和行动代理体验,有很多嗯,比如财富 500 强全球 2000 强领导者听播客。我认为他们中的许多人会接受这个想法,比如“我想要这个惊人的、自动的、实时的、全天候、每种语言的客户体验,它是一致的、高质量的。”我可能通过与 Palunteer 或大型咨询公司合作,嗯,与 11 Labs 或像平台技术公司,或者像 OpenAI 这样的公司合作,对吧?或者与像 Sierra 这样的更侧重于用例的公司合作,对吧?[清嗓子] 你如何看待人们如何做出这个决定,或者他们应该如何做出这个决定?嗯,嗯,我的背景也在 Palunteer,所以我从那里开始,我们也融合了公司内部的许多前沿部署工程。当我考虑我们的产品以及客户做出选择时,如果你只看一个单一的解决方案,并且只有那个解决方案,那么我们可能不是最佳选择。如果你想在各种不同的体验中部署它,无论是客户支持,然后你还想要内部培训,然后你可能想要提升你的销售部分,并通过新的客户互动体验来增加收入,超越那种被动的方面。嗯。>> 嗯,这是一个很好的平台,可以构建,然后我们有效地与客户互动,将平台工作与我们的工程资源相结合,帮助这些公司部署。或者,我们也越来越多地看到财富 500 强和 G2000 公司,他们希望自己构建部分内容,因为他们已经在该平台上进行了大量投资,同时与我们合作处理一些新的内容,并将它们结合起来。嗯,我认为我们的模式以及它与许多用例特定模式的不同之处在于,我们的平台相对开放,你可以使用该平台的部分内容,而不是全部内容,用于这些不同的用例。Palunteer 当然会,或者一些咨询公司将拥有更多的资源来处理更广泛的数字化转型之旅。在我们的案例中,它是非常具体的对话代理。就像,如果你正在寻找新的客户界面,那是最好的方式。嗯,而像 Sierra 这样的公司当然在他们如何思考特定用例方面非常出色。也许另一部分是,当我们考虑我们的工作时,取决于你正在优化什么。所以,我们有很多国际合作伙伴。如果你有一个更广泛的地理用户群,太棒了。这就是我们优化的。我们的声音、我们的语言、我们对国际集成的支持等等都更广泛。根据你的具体范围,这通常是一个需要考虑的方面。但这将是一个重要的因素。但我总结一下,如果你正在寻找跨越不同用例的解决方案,并且需要我们的工程帮助来部署它,那么我们就是正确的解决方案,而且可能是最佳解决方案。我想谈谈 OpenAI 和基础 LLM 基础模型公司。原因之一,我和 [名字] 把这个播客称为“无先验”,是因为我们觉得,“好吧,人们总是对市场如何运作做出很多假设,而事实证明,很多这些假设最终都是胡说八道,你实际上无法,你必须在这个时候非常决定自己的叙事。”我认为,如果我没记错的话,在 2022 年和 23 年,你可能听到了很多人说,“谷歌可以做到这一点,OpenAI 可以做到这一点,为什么你还要继续专注于语音作为一种通用能力?”这也在一定程度上增加了前面几个问题的元素,无论是代理工作还是创意工作,在这些工作中,你需要一个非常强大的产品层,你需要集成,你需要帮助人们部署工作,这是最常见的方面,但我们的超能力和我们长期以来的重点是构建基础模型,以真正使这种体验无缝,并且正如我所想到的市场上的许多公司,他们将优化其他许多事情,而这将是我们的差异化因素。在我们的案例中,我们将使整个体验,特别是语音体验,无缝、可控,并且以更好的方式。>> 所以,从根本上说,你会争辩说,嗯,实验室不会专注于这一点,也没有>> 正是如此。我认为大多数这些公司,这就是长远来看的事情,它将是令人难以置信的研究和令人难以置信的产品,它们满足客户的需求,并从那里开始。我不认为实验室会专注于构建那个对客户来说如此重要的产品层。>> 但我认为,嗯,你提出的问题的一部分是,嗯,或者,嗯,为什么他们甚至没有进行研究>> 以我们能够达到的质量,这里我也很偏颇,但我们在文本到语音或语音到文本或编排机制的基准测试中愉快地击败了他们。这里要归功于我的联合创始人团队,他们能够做到这一点。这只是我的研究人员继续他们的工作。但我认为音频领域的主要区别在于,你不需要像模型突破、架构突破那样大的规模来真正产生影响。嗯,我们已经这样做了几次,我认为人数并不重要,但你拥有的人数很重要。我们认为音频领域有大约 50 到 100 名研究人员可以做到这一点。我们认为我们公司可能有 10 位,嗯,他们是一些最优秀的人。我认为这种对那些人的痴迷,让他们一起工作,然后让公司全力专注于让他们实际工作,并将他们的工作投入生产,看到用户如何互动,这非常重要。所以,这就是,我认为,我们如何能够创建比一些顶尖公司更好的模型。但你知道,真相是,在很大程度上,他们之所以做不到,也是一个有趣的问题,我们不知道,就像,就像,他们也有如此令人难以置信的人才。>> 同时,你如何看待嗯,开源模型?我认为公司里的任何人都会说同样的话,这就是我们思考的叙事,从长远来看,模型将商品化,或者在某些用例中,模型之间的差异将微不足道,对于大多数用例来说,它们仍然很重要,但对于大多数用例来说,它们不会。>> 而且它们将广泛可用。>> 它们将广泛可用,正是如此。我们不知道它会在什么时候,是两年、三年、四年,但它总会发生。然后,当然,你将有一个微调层,它将非常重要。嗯,在这些模型之上,但基础模型我认为会变得相当好。嗯,这就是为什么对我们来说,产品部分如此重要,从公司的角度来看,也从价值的角度来看,因为如果你有一个很棒的模型,但要连接你的业务逻辑和知识,嗯,要能够拥有正确的界面来为你创建广告,或者一个全新的材料,这是一个非常不同的练习。嗯,但开源模型正在变得,如果我把它分成两部分,更多的是异步内容旁白,我认为旁白基本上是开源的,商业模型也很棒,在开箱即用的质量方面,差异正在缩小。大多数模型还没有解决的问题,我认为我们已经解决了,是如何让它们可控。>> 所以,这是旁白部分。我认为整个互动部分,如何编排组件,无论是级联的语音到文本和语言模型文本到语音方法,还是未来它是融合方法,将它们一起训练。我认为这对客户支持或客户体验来说是好的,但离我们这样的对话还有一段距离,并且通过了图灵测试。所以,我认为这仍然是至少一年,嗯,一年之内,然后你就会有实时配音的变体,比如实时翻译对话,我认为这可能需要两到两年。你知道,一个非常令人不安的信念,我感到舒服地持有这个信念,但在市场上并不常见,那就是实际上大多数技术优势,它们可以持续一年,或者可以持续十年,但它们不是无限可保的。如果你从模型质量或产品角度来看,它们允许你更好地服务客户,并建立一段时间的势头和规模。而实际上,随着时间的推移,这非常强大,对吧?但它不是一个永远干净的答案。所以,我认为这让,我不知道,商人和投资者感到不舒服。>> 而且,我的意思是,这确实是真的。 [笑声]>> 我们,我的意思是,我们思考的方式是,研究是领先一步。这给了我们,我们可以让客户更早地获得优势,这是六到十二个月的优势。这也是我们构建正确产品层的方式,让你获得最佳的研究成果。我们经常并行进行。所以,一旦研究出来,你就有产品,因为我们知道我们的计划,我们知道产品是什么。没错。所以,你并行拥有研究和产品,这延长了它的寿命。但真正提供长期价值的是你围绕它创建的生态系统,无论是运行和分发,还是你可以拥有的声音集合,你可以拥有的集成集合,你可以构建的工作流程。嗯,我认为这就是我们如何在我们脑海中排序的,研究、产品、生态系统,我们构建的。嗯,研究只是一个领先一步,并能够,嗯,让未来更近一点。我认为这是一个非常有力的见解,特别是如果研究团队和公司团队在内部也相信这一点。嗯,我认为我们有趣的地方是,嗯,我认为这是所有从事研究和产品工作的公司的主要问题,你是等待研究,还是进行产品变更,甚至不仅仅是研究产品公司,你是等待别人做研究,因为时间线不清楚,是三个月,六个月,十二个月,不知道具体会做什么,这是一个艰难的选择,是投资于产品层,还是等待更多研究?所以,在我们的案例中,我们内部让所有产品团队都进行研究项目,这样我们就可以并行处理这项工作。但我们不会阻止他们,如果一个产品团队认为我们应该通过做一些不同的事情来为客户提供价值,他们可以这样做。粗略的经验法则是三个月,如果我们认为会超过三个月,我们可能会构建它,如果少于这个时间,我们可能不会。>> 你能谈谈你现在正在进行的一些研究,以及你如何看待交付的节奏和值得努力的事情吗?>> 我们现在在音频领域有许多不同的举措,它们大致分为两大类,大致与创意和代理方面相关。在创意方面,这意味着我们拥有可控的文本到语音模型。然后我们添加了语音到文本模型,它能以高精度进行转录,而且还支持低资源语言。所以,覆盖了近 100 种语言。然后创建了一个音乐模型,一个完全许可的音乐模型。嗯,当你思考未来时,是如何让这些模型也与视觉领域的一些模型互动。所以,这是大量的努力,以及如何获得最佳的音频,然后可能将其与你现有的视频结合起来,以真正获得最佳的交付。然后在代理方面,当然是如何优化实时语音到文本,实时文本到语音。我们刚刚发布了我们的语音到文本模型 scribe v2,它在 150 毫秒以内,在前 30 种语言上的准确率达到 93.5%,在 flares 上。这里只有前 30 种语言,因为我们服务于更多语言,但大多数人并不这样做。所以,所以它在基准测试中击败了所有模型。但当你思考未来时,它也是编排部分,如何将语音到文本、语言模型和文本到语音结合起来。我们将在未来几个月发布一个新的编排机制,我们将大大降低端到端的成本。嗯,我们认为这是一个很好的方式。但第二件事,也是非常困难的,它不仅允许你组合这些部分,还增加了对话的情感背景,所以你可以实际回应模型,并且我们认为它更具表现力,以更好的方式。在未来,我们正在投资于并行化语音到语音的融合方法。当然,根据用例,如果你是企业可靠用例,级联方法是未来一年的方法。>> 更有结构。是的。>> 更有结构,你有更多的可见性到每个步骤,它是可靠的,你可以调用工具。如果你认为更具表现力,并且可以产生幻觉,语音到语音可能是选择,也许随着时间的推移,你会看到它们相互超越,取决于行业。但这在我们这边是一项巨大的投资,这就是所有平台的基础,嗯,以及我们不断投资的主要部分,是各种不同的模型,它们将音频的最佳方面与其他模态的最佳方面结合在一起。>> 在我们最后的几分钟里,我想问你几个关于未来的问题,我认为你将拥有一个非常好的观点,因为你一直在思考语音和音频。你如何看待人工智能伴侣?>> 我认为它们将是一件大事,并且会以一种重要的方式存在。我个人并不对此感到兴奋,也不是我们花很多时间关注的事情,但我认为助手伴侣角色,你喜欢作为体验一部分的整个界限,将在很大程度上变得模糊和融合。>> 它们可能很普遍,但你个人并不热情。>> 我更兴奋的是,嗯,更像是贾维斯那样的版本,或者,嗯,更像是,我拥有超级助手超能力。它是>> 相对于社交版本。>> 相对于 [清嗓子] 社交版本,我认为它将是一个令人难以置信的解锁,而且它也融入了个人情境。我希望开始新的一天,有人能理解我,然后告诉我与我相关的事情,然后打开百叶窗,然后告诉我阳光是什么,然后立即播放音乐。>> 这将会发生。>> 这将会发生。我对此感到兴奋。我认为伴侣用例将解决孤独问题,在这方面,我认为这是一种方式,也许有不同的方式来重新吸引人们。我确实认为,即使你想到教育,你也会拥有学习人工智能导师的超能力,但我认为另一方面,我认为这是我的个人看法,你大部分时间将花在人工智能导师身上,然后明确一部分时间将花在人与人之间,没有任何技术。>> 所以,你可以,你可以学会那一部分。>> 是的,我认为这是正确的模式。嗯,无论是情感指导和辅导,嗯,你知道,护栏,对吧?以及同伴。嗯。>> 正是如此。你如何看待嗯,听写,或者在控制技术方面会发生什么,这些技术不一定被拟人化?嗯,或者它们都会被拟人化吗?>> 我认为不是所有都被拟人化。我认为,嗯,有些,你知道,在烤箱和家里交流可能会保持相当静态。>> 或者代码,我可能会>> 是的,正是如此。你可能不需要太多嗯,额外的情感输入。>> 但嗯,但我认为,是的,这将是一个巨大的部分,在某种程度上,我希望发生的是,你将能够,嗯,在现实生活中保持更沉浸,设备回到口袋里,回到某种形式的,嗯,附着元素,假设它在正确的情境下,嗯,然后它代表你行事,在很多方面,比如,让我们说听写,就像 Karpati 所说的,代理的十年。让我们称之为十年。然后你将拥有机器人十年。如果你与机器人互动,当然,语音将是输入和输出,作为关键界面之一。所以,你需要听写作为一项巨大的工作。但同样,>> 我认为机器人将被拟人化。>> 是的。100%。100%。是的。不,我认为我认为大多数用例将被拟人化。>> 好的。最后一个。有什么事情是你今天已经看到过的,或者如果你展望几年,将会改变我们与内容互动的方式?也许是个性化的语音内容,或者人们将用 AI 语音做一些今天不做的事情,或者不是每个人都知道的事情?>> 我认为最大的事情还没有真正进入系统的是教育将如何进行。我认为,嗯,我认为通过语音学习,通过语音,它在你的耳机里或扬声器里,这将是一件大事,你有一个按需的老师,他理解你,非常个性化,并通过你的生活传递正确的内容。我认为这将是最大的用例之一。嗯,嗯,我认为它还没有发生。我认为我们已经看到了一些商业合作伙伴,但学校、大学如何以一种安全的方式部署它,以一种支持教育的其他部分,教育的社交部分的方式。我认为所有这些都将发展,也许有一个很酷的版本,你可以让理查德·费曼或阿尔伯特·爱因斯坦来讲解那些讲义,或者你喜欢的其他老师。它会很棒。>> 这是一个很好的结束点。谢谢你,Marty。>> 非常感谢。>> 在 Twitter 上关注我们 @NoPriorPod。订阅我们的 YouTube [音乐] 频道,如果你想看我们的脸。在 Apple Podcasts、Spotify 或任何你听播客的地方关注我们的节目。这样,你每周都会收到新的一集。并在 no-briers.com 注册电子邮件 [音乐] 或查找每集的文字记录。