📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Are Smartphones Dead? Could Multimodal AI & XR Glasses Replace Them? - Amit Yadav : Ishiki labs

Ones Changing The World - 1CW1:06:00

Transcription

感谢您加入我们这个改变世界的播客。我是主持人艾迪·阿维尔,今天我非常荣幸能与阿米特·亚达夫一起。他是 Ishiki Labs 的联合创始人兼首席执行官,该公司致力于构建多模态人工智能系统,能够无缝地与实时视频和音频流进行交互,并知道何时保持沉默,何时做出回应。他毕业于 IIT 坎迪纳加尔,随后在普渡大学完成了人工智能和机器学习领域最快的直接博士项目之一,仅用 3 年时间就完成了学业。他曾是 Meta Reality Labs 的研究科学家,在那里他致力于沉浸式技术的尖端人工智能。他的研究领域包括多模态大型语言模型、生成模型、用于语音和视频处理的自监督 Transformer、强化学习和多模态系统的后训练策略、人工智能驱动的变量以及人机交互。在 Ishiki Labs,阿米特正致力于实现类人多模态助手的愿景,这种助手能够与人自然协作,突破人工智能融入日常生活界限。所以阿米特,我真的非常感谢您抽出宝贵时间参加播客。我想听听您对正规教育和学位的看法,因为您知道,我看到像埃隆·马斯克和许多其他创业公司都在说他们需要的是技能,而不是学位,您知道,在我整个职业生涯中,您知道,我从底层开始,我意识到,您知道,有学位的人失败了,而有技能的人却一路前进,所以如果您能分享您从 IIT 坎迪纳加尔到 Meta 的旅程,有哪些错误,以及您从您的旅程中可以给其他创始人提供什么建议,让他们可以避免这些错误,那就太好了。>> 非常感谢艾迪邀请我。嗯,关于拥有正式学位还是仅仅构建的问题,我的看法可能有些争议。我想问一下所有听众:你们想成为什么样的人?如果你想成为一名研究员,一名顶尖的研究员,去训练这些模型或构建这些技术,而不是一名企业家,那么你需要一个正式的学位。嗯,在 Meta,如果你没有博士学位,你仍然无法获得研究科学家的面试。所以事情有两面。一方面是,是的,很多生成方法正在涌现,但谁在创造它们?创造它们的人很可能是研究人员。除非你想成为一名建设者和企业家,因为现在有如此多的工具可用,你可以非常快速地构建东西。所以整个焦点在于思考过程:你想构建什么,以及如何构建?现在,我认为有一件事变得非常疯狂,那就是人们必须走出去,思考用例,销售这些东西,分发,从用户那里快速学习,而所有这些核心软件工程的东西几乎都自动化了,对吧?但如果你想处于那个位置,那么我百分之百同意,走出去,更快地构建东西,不要担心学位和其他所有正规教育,但如果你想站在另一边,也就是制造所有这些工具,自动化所有这些东西,你仍然需要一个正式的学位。原因在于,这些工具已经变得如此之好,以至于要再进一步,你需要一个正式的学位和那种磨练。但这就是我的看法。现在回到我的背景,我来自一个几乎没有人是工程师的家庭。我家人要么从事政治,要么从事司法系统。所以,这有点例外。嗯,我喜欢说我父亲是个叛逆者,他说我想进入司法部门,而我是一个叛逆者,我说我想进入工程领域。嗯,所以我完成了我的本科学习,之所以选择 IIT,是因为我从未为 IIT 做过准备。嗯,我进入 IIT 的方式,我认为是一些偶然的巧合,我真的很喜欢数学,我当时正在准备我的 CBSE 考试,然后我进入了 IIT,我实际上选择了材料科学,但我对机器人和计算机科学有浓厚的兴趣和热情,这就是我选择电子学的原因,因为在那里你可以探索硬件和软件方面,并在那个时期做了大量的机器学习,我意识到,几乎是立即,我意识到我对研究有兴趣。我在日本、加拿大做了很多研究实习,与不同的实验室合作进行研究项目,我意识到我确实想攻读博士学位,因为要在一家拥有几乎无限资源的顶尖大科技实验室成为一名科学家,你需要博士学位。同时,我家里没有人有博士学位。所以我当时想,哦,这很有趣。我家里任何人现在想了解博士学位,我都可以告诉他们,而且不知何故,我觉得在美国,我可以免费获得钱来做我喜欢的事情。所以这就像一种爱好。我就是带着这种心态去的,而且因为这种心态,我认为一切都进行得很顺利。嗯,我花了 3 年时间,进展非常非常快。嗯,我认为另一个原因是,我非常执着。所以在我的一生中,我甚至提前一个学期完成了我的本科学习,我完成了双学位学士学位,很多人不知道的是,如果你真的努力,系统中总会有一些捷径和条款,他们会允许你做任何事情,这是非常棒的。例如,很多人不知道在 IIT,你可以在 3.5 年内获得学士学位,你只需要获得许可。直接攻读博士学位,有一种申请直接博士学位的方式,你不需要攻读硕士学位。所以这种心态对我帮助很大,它是在 IIT 坎迪纳加尔建立起来的,他们允许我与当局进行沟通或做出例外,然后去在 3.5 年内完成我自己的学术计划。所以我拥有那种心态,而这种心态在我的博士学习中也帮助了我,因为我从来不看重时间周期。我主要关注的是,我必须做好工作,让我们继续做好工作,做我喜欢的事情,时机合适的时候,我可以去问当局,他们会允许我毕业。所以这正是我在博士期间发生的事情。然后,嗯,然后我在人工智能领域工作,对我来说,最好的地方是因为现在所有的 GPU 资源,我认为是行业,所以我去了 Meta,我主要从事多模态人工智能系统的工作。那到底是什么意思呢?想象一下戴着一副智能眼镜,你有一个人工智能助手,你只是说,嘿,打开,你知道,待一个半小时或者你待的时间,现在它就是你的伴侣。它和你一起去任何地方,你可以问它问题,它会记住事情。所以你也可以问,嘿,很久以前我们看到了那个海报,上面的联系电话是什么?所以你可以问这些不同类型的东西,多模态基本上意味着它可以看和听人工智能的这些问题,而这正是我主要从事的工作,比如后训练它们,改进它们。我发现了一件非常奇怪的事情,那就是如果你和任何人工智能系统交谈,它们都不知道多方场景,这意味着如果你打开任何人工智能系统的语音模式,或者你戴着智能眼镜并启动这个助手模式,如果你说了什么,它们会期望得到回应。它们会期望你在和它们说话。而我当时就想,哦,这不像人类,这根本没有在情境上理解任何东西。而且,你必须一直提问。如果你现在看 ChatGPT,交互方式已经略有改变。如果你说,嘿,我正在做设计,我需要这个这个这个东西,它会给你三个选项,要么做这个,要么做这个,要么做这个。至少在我看来,给出这些选项的原因是,你不是那个领域的专家,你真的不知道接下来应该问什么。所以它会主动提出这三个选项,这样你就可以选择,而这正是人类的行为方式。如果你有一个律师,他会提出下一步行动的三个选项。所以现在它变得好多了,这也是多模态人工智能中一个非常缺乏的部分,那就是它们不能像人一样主动帮助你,你必须提出问题,而且问题必须好。所以,我当时想,我们必须在这方面做些什么,我们申请了 Y Combinator,在我的一生中,我从未为成为一名企业家做过准备。我喜欢构建东西。我喜欢编码。我喜欢成为一名研究员。我喜欢我所有的工作,但这是突然发生的事情。我们只是带着这个想法申请了,我本来有一个完整的假期计划。我总是十二月去印度,回到印度,和我的朋友、家人一起享受,我本来有一个完整的假期计划,然后我不得不立即离开,12 月 2 日我向 Meta 提交了辞职,12 月 5 日我们成立了公司。一切都太快了。嗯,这就是一切的开始。>> 这真是太酷了。您知道,我想深入了解 Ishiki Labs,但在我开始之前,我的意思是,您说得对,您需要非常确定您想做什么。我的意思是,这非常重要,父母会把您推向某个教育领域,您知道,有三四个领域,您知道,他们希望您进入,比如成为一名医生,成为一名工程师,或者类似的东西,您知道,但我认为世界正在完全改变,您需要非常非常确定您想做什么,正如您所指出的,如果您是一名企业家,您知道,也许那些学位并不需要,您知道,但是的,如果,如果您想在研究领域做一些具体的事情,并且能够,您知道,做一些极其独特的事情,构建一个新的架构,那么显然你需要有数学和物理等背景,而只有当你开始摸索、打破事物并创造事物时,我认为这才是你学习的唯一途径。所以,我的观点总是对那些正在收听的学生说,您知道,我的意思是,要成为一个终身学习者,并准备好,您知道,搞砸事情,打破事情,然后学习,我认为这是你真正前进的唯一途径。我还想听听您对初创文化与大型科技公司的看法,因为您在 Meta 工作了一段时间,然后现在您提到您已经过渡了,并且组建了自己的初创公司,您认为在学术界、大型科技公司还是初创公司,人们在哪里真正创新,并且拥有最大的自由,为什么?>> 所有这些都需要金钱驱动,对吧?你需要资源和资本来资助所有创新,尤其是如果你在尖端领域进行创新。我认为,因为在学术界,你提出了想法,在初创公司也类似,你从赠款或想法开始,你对你想做什么拥有最大的自由。在学术界和初创公司,你没有任何工具限制,你可以使用任何最好的工具,即使你的公司还没有采用它也没关系,对吧?这完全取决于你的个人兴趣和你看到的有成效的东西。所以我认为学术界和初创公司提供了极大的自由。嗯,在学术界,你仍然可以长时间地研究某个想法,即使没有收入,现在在研究实验室或非常注重人工智能的初创公司中,这也可以实现。但你仍然需要在初创公司中找到一些产品市场契合度,这意味着你必须不断迭代用户所说的内容,这有时可能与你想要的大相径庭。而这正是我认为学术界可能提供更广泛自由的地方。然后是初创公司,你拥有自由,但同时你必须从用户立即需要的东西或你为客户解决的重大问题中获得它。而这正是初创公司出现的原因。然后我认为最后是大型科技公司,因为在那里你加入了一个团队,它正在研究某个东西,它不会为你改变。他们可能已经对它进行了三到四年的路线图投资。所以你必须非常清楚,我想研究这项技术。它让我兴奋。它有我关心的事情。然后你进去,你大部分时间都不会控制工具集,因为它们是通过一个非常独立的采购流程获得的,这个流程总是会比行业领先的东西落后一到两年。所以,我认为这就是框架,我认为你也已经触及了你需要成为一个终身学习者这一点,我学到了这一点,我当时想,好吧,我一遍又一遍地从我的父母和家人那里听到这句话:嘿,十年级就是一切的终点,在十年级或你高中的最后一次考试中考好,或者进入 IIT,现在你不用担心了,只要工作就行。但我认为,如果你一直这样做,你会发现首先,保持学习是好的。它让一切都变得有趣。第二件事你会意识到,世界正在变化。你所做的事情正是如此。它变化得如此之快,信息量和技术栈变化如此之大,以至于你必须不断学习。对,对,完全正确。而且,您知道,我们生活在一个信息过载的世界里。所以,弄清楚什么对您有效是非常重要的。我的意思是,您知道,这非常重要,您知道,否则,您知道,我的意思是,信息太多了,您会发疯的。现在您提到您在 Meta 工作,特别是 AI 眼镜,Meta 一直处于领先地位,他们主要在推动 XR 对话,构建虚拟现实眼镜,以及向混合现实眼镜的过渡,而这已经退居次要地位,因为 Meta,您知道,马克·扎克伯格的愿景还没有完全成熟,但我敢肯定,您知道,这可能在未来 5 到 10 年内实现,因为我个人认为,您知道,所有界面都会让我们陷入困境,因为我们生活在一个三维世界里,但我们所有的界面,无论是您的电视屏幕、手机、电脑,它们都是二维的,而我们生活在一个三维世界里,您知道,最终,您知道,这些眼镜、可穿戴设备,您知道,它们将使整个世界成为一个屏幕,您知道,您知道,您知道,您在 AI 眼镜上工作,我敢肯定您也一定在 AR 眼镜上工作过,您知道,因为它们有 Project Orion 和 Project Arya 的路线图,如果您能提供更多关于这方面的信息,那就太好了,您知道,因为有一个很棒的内容创作者叫 Kichi Matsura,他创作了两个视频,我认为非常酷,一个是“超现实”,他创作的视频,视频是关于一个信息过载的世界,您知道,无论您去哪里,都有增强现实显示器,您知道,基本上,整个世界都充满了 AR 显示器,而您不想要这种情境过载,您知道,正如我所说的,您知道,我们需要筛选事物,然后 Kichi Matsura 又制作了一个非常非常酷的短片,叫做“AI 代理”,这是一个奇妙的愿景,您知道,每个人都戴着眼镜,我们每个人都有这些代理,您知道,AI 代理,这些 AI 代理可以做多模态的事情,您知道,为我们构建东西等等。所以,如果您能详细介绍您在 Meta 的工作,特别是 AI 眼镜,以及,我的意思是,如果您在 AI 和 AR 眼镜方面做过任何事情,那就太好了。>> 所以路线图非常简单,我认为它也是公开的,那就是我们将推出更好的外形尺寸。我认为因为 VR 很好,它会来的,每个人都知道它会在某个时候到来。唯一的问题是,它的外形尺寸不好,而 Meta 破解了完美的外形尺寸,那就是每个人都戴眼镜,或者大多数人都戴眼镜或太阳镜,让我们在上面加上 AI。所以那是 V0 版本,对吧?第二个版本是,好的,现在我们有了眼镜,人们正在使用它,外形尺寸看起来不错,让我们在上面加上显示器,这已经出来了,人们已经可以购买了。我认为它叫做 Ray-Ban 显示眼镜,你可以在世界上拥有增强现实。所以你可以有地图,你可以问 AI,比如从这里到那里打开我的地图,你可以看到你的地图,你不需要真的拿出手机,因为现在这非常接近取代你的手机,你不需要手机,因为有一个屏幕,你可以与之互动,并且通过神经带,你可以互动并在空中或桌子上书写。所以它变得非常,嗯,让你摆脱手机,专注于增强现实并在世界上工作。我认为最后一件事,比如 Orion 和所有这些,拥有你周围的一切,比如代理式的,可能就是我们前进的方向。我确实在 Ray-Ban 显示眼镜上工作过,因为我们也在为它们提供多模态人工智能助手。也许我可以告诉你一些事情,比如,你去了很多地方,你雇佣了不同类型的助手。最终,我认为每个智能眼镜公司都会希望这个 AI 助手成为那个,对吧?例如,这个 AI 助手应该是你的首选。你甚至可以在 Gemini 和 Astra 上看到它,它应该是你任何需要的帮助的首选,无论是烹饪还是在家组装任何东西,修理你的汽车,或者修理你的箭,对吧?或者它也可能成为你旅行的向导。所以,如果你在一个博物馆里,它会自动弹出。嘿,我看到你在这里的博物馆,你知道这些地方都有这些这些部分,让我们去那里吧。它有点像一个漏斗,它看到你看到的东西,所以它可以漏斗出这些信息可能对你有用,并主动引导你或可能在这些情况下帮助你。所以,我认为事情至少是朝着这个方向发展的,但今年我认为已经被开放云机器人,也就是个人人工智能助手,显著改变了,现在它将对两个世界都产生影响。人们已经看到了他们如何看待个人助手,现在他们对个人助手期望过高,因为他们想象着这个 AI 助手就在眼镜上,他们看到了这个 AI 助手可以成为你的伴侣并为你做事,他们说,哦,让我们结合起来吧。我认为今年对于所有这些行业和技术来说都将是疯狂的,找到这个开放云代理的外形尺寸,对吧?这样你就可以和它交谈。它陪在你身边。它给你信息,你可以说,嘿,你知道,捕捉这个图像并创建一个播客内容或创建一些关于它的东西,因为现在它拥有你电脑的访问权限,所以它基本上可以像你一样行事。>> 对,对。我的意思是,我想深入了解开放云以及小书。但在我能做到之前,您说了一些非常非常重要的事情,您说,我认为我们将从携带技术,比如手机和电脑,过渡到佩戴技术。我认为 Meta 已经展示了第一个路线图,即使是神经腕带,我的意思是,我们实际上可以在空中打字等等。所以,是的,我认为我们非常接近那个过渡,因为正如我所说的,我的界面,所有这些电脑、手机、电视屏幕和影院都是平面的。当我们生活在一个三维世界里时,一旦我们有了这些三维可穿戴设备,整个世界就会成为一个画布。您知道,随着 AR 和 MR 的发展,我认为它将真正为我们提供情境化的东西。您知道,随着这些 AI 代理,未来将非常非常令人兴奋。现在您说您一直在为 Meta 构建多模态人工智能模型。您认为哪种类型的人工智能模型最适合这些设备上的 HMD?您认为这些是小型语言模型,远程联系模型,如果您能分享您的想法,那就太好了。>> 是的。所以我认为,对于这类产品,典型的思考过程是,任何个人化的东西,你不希望它上云的东西,都应该由设备上的小型模型处理。例如,如果你的 Meta 眼镜说,嘿,给某人发这条消息。确定这是消息并且应该发送给 WhatsApp 上的某人,这应该在所有设备上完成。它应该都在设备上,对吧?所以这些将是你从你训练过的一个更大的模型中提炼出来的非常小的模型,它已经具备了确定这个查询的能力。所有这些都可以保留在眼镜上,但对于真正的能力,我的团队实际上正在研究更大的模型。所以,例如,如果你想要一个引导工具,我们将继续依赖更大的模型。我认为将它推到眼镜上没有意义的原因是电池,二是计算能力,三是期望。期望已经改变了。如果你提供一个低质量的助手,即使它在设备上,也没有人在乎,因为现在的标准已经很高了,因为人们正在与 ChatGPT 互动,但 ChatGPT 是一个服务器上的大型模型。所以他们的期望至少是 ChatGPT 的水平,而如果你把它放在设备上,它会远远低于这个水平。所以这就是为什么所有大型模型和功能通常都驻留在服务器上。因为无论如何,它可能需要研究,可能需要规划以及其他一些网络搜索。所以,我认为因为这个原因,它通常只依赖于云端,通常它们是超过 700 亿参数的大型模型,它们被训练用于提供帮助和质量。在那里的目标不是大小,而是如何提供更多帮助。>> 我认为 2026 年将是这种过渡的开始,我们将从携带技术转向佩戴技术,因为我认为 Meta 有一系列产品,有 Ray-Ban 眼镜,还有其他眼镜,Snap 正在推出 Spectacles,Google 正在推出 AI 眼镜,三星、联想、Xreal,还有很多中国公司,阿里巴巴等等都在制造 AI 眼镜。一旦这些 AI 眼镜有了可能的 AR 叠加,我首先假设它将是单眼眼镜,然后最终将是真正的,从抬头单眼到真正的增强现实眼镜。我认为未来将非常非常酷,因为你不需要你的电脑,你不需要你的手机,因为你的一切都将转移到你的眼镜上。我认为那里的挑战是技术的微型化。你谈到了电池、计算能力、波导等等。一旦你把所有这些都装进眼镜里,外形尺寸就是这样。当然,我们已经解决了早期 Google 眼镜遇到的问题,比如安全问题等等,我认为每个人都在努力解决这个问题。也许是一种非侵入性的外形尺寸。我认为 OpenAI 与 Johnny Ive 合作创造一种可穿戴设备,是非侵入性的,没人知道它会是什么样子。但是,是的,我认为我们将进入一个奇妙的世界,人类正在展示,AI 正在让你惊叹,所以我认为我们正在进入一个有趣的世界,我认为我们将从携带技术过渡到佩戴技术,因为我认为手机本身正在失去其效用。您知道,折叠手机我们已经做了很多了。所以我敢肯定,我认为我们将从携带技术过渡到佩戴技术。现在 Google,Google 是中间>> 可穿戴设备正在成为一个更大的领域。已经有一些智能眼镜公司,我有时看到人们在飞机上,他们正在看电视,或者他们正在工作。我非常震惊,他们有独立的设备用于互联网和叠加,他们正在飞机上看一部完整的电影,我非常惊讶,我的天哪,这就是未来。Apple Vision Pro 也是如此,Quest 3 也是如此,您知道,是的,这真的很棒。>> 而且还有一些特定的智能眼镜,人们已经发布了,它们只做流媒体。所以你可以看电影,你还可以有一个你自己的小型中继系统,你可以放电影,然后它会中继到智能眼镜,而智能眼镜的唯一工作就是提供影院级的大屏幕质量,你只需要戴上它。>> 是的,是的。所以,所以我认为我们正在进入那个奇妙的世界,或者我唯一的希望是,一旦我们有了这些眼镜,这些眼镜将装满传感器。您知道,面向内和面向外的摄像头,并且会有大量数据被收集,因为无论你看到哪里,所有这些数据都将被捕获。我唯一的希望是,这些大型科技公司能够理解,您知道,Google 眼镜因为隐私问题而失败了,我希望他们不要犯同样的错误,您知道,并且他们有这些隐私指南,您知道,对于这些新的产品路线图,他们正在努力研究。现在 Google,您知道,他们开创了 Transformer 架构,这是这些大型语言模型的基础,但却是 OpenAI 构建了 ChatGPT,并将其带入了主流。Anthropic,他们构建了 MCPS,Google 构建了代理到代理协议,但同样,不是这些老牌公司,而是像 OpenCLaw 和 Moldbook 这样的实验平台吸引了公众的想象力。您认为大型科技公司对负面反馈的恐惧是否减缓了他们快速发布产品的能力?>> 是的,完全同意。我认为我绝对觉得嗯,嗯,原因是因为他们有东西要失去。他们拥有庞大的用户群。他们不想把一个不是极其出色的产品交到用户手中,因此他们至少需要经过五六个发布周期才能推向用户。然而,如果你是一个初创公司或开发者,你只需将其推送到 GitHub,然后你就可以从中看到。我认为,例如,OpenCLaw 在去年 11 月或 12 月就出来了,有些人最初在贡献,但到了 1 月份,它就爆炸了。而这就是你在行业中通常会有的恐惧,他们会花一些时间,使其更加完善,但因此,他们没有给其他开发者足够的创造力控制。现在当他们推出产品时,它更像是一个消费品。你只需使用它并提供反馈。所以,是的,我认为肯定存在差距,以及大型科技公司在做正确事情方面的压力。如果 OpenCLaw 和 Moldbook 能让我用户完全理解 OpenCLaw 是什么,它能做什么,甚至 Moldbook,那就太好了。是的。这很有趣,最近我们遇到了 OpenCLaw 的创造者 Peter。>> 他在那里做了一个演讲。嗯,是的,他做了一个演讲,看到他是如何创造它的,以及对他来说,那个“啊哈”时刻,哦,这是多么了不起的事情,这很有趣。所以 OpenCLaw,基本上我认为它曾经叫做 Clawboard,在某个时候它叫做 Moldboard,然后最终叫做 OpenCLaw。它的想法是,它就像一个个人人工智能助手。它之所以与众不同,是因为它不仅仅是给你一个模型并称之为助手,Peter 所做的是,有这些模型,我如何创建包装器,以便你可以集成任何你想要的东西,并且它可以访问你的电脑。所以它也可以去做那些事情,甚至在需要时创建代码或新的软件。如果它与你的日历和其他所有地方集成在一起,它也可以采取行动。所以你可以把它看作是三个层次,我认为。一个层次是平台提供商和它拥有的所有实用程序,那就是它拥有 Claude 或任何其他你可以选择的 LLM 提供商,然后它拥有在你的电脑中运行所有不同任务和技能的能力。所以它有命令行访问权限,几乎可以让你在你的电脑上做任何事情。它有访问互联网搜索的权限。所以这些都是核心能力。然后有一个层次,那是你与这个世界互动,以及所有这些能力之间的通信层次,这是一个统一的层次,你的世界在 WhatsApp、Messenger、Telegram 上,任何你能想象到的东西,它们都集成在一起了。所以你可以和你的代理交谈,它在你想要的地方可用,它有你与之互动的每个地方的记忆。如果你允许它访问你的其他消息,它也可以访问你所有的其他消息。好的。所以这是你与之互动的层次。所有这些层次都有一个中间层,它充当一个统一的层,供代理查看,而对它来说,它只是一个消息。就像你在和它说话一样。而现在它正在创建关于你所谈论内容的记忆。所以你明天醒来,可以说,嘿,你知道,给它起个名字,也许是 Multi,我认为,嘿 Multi,你知道,我们昨天在讨论这个这个这个,你觉得呢?它会思考。现在酷的部分是,除了所有那些日常记忆和真正成为你的忠实伴侣之外,它也可以选择不回应你,因为也许它是一个人,它觉得现在可能不是回应的合适时机。另一个酷的部分是第三个节拍,这意味着你可以设置它,每隔几秒钟,每隔几分钟,可能是 30 分钟,你可以有一组工具,它会随机去做事情。所以也许它会立即问你,嘿,顺便问一下,只是想检查一下你,你还好吗?因为在记忆的某个地方,它知道这是你上次感到难过的时间,而所有这些疯狂的随机化都可能发生,因为人们可以有很多可能的路径,人们可以有很多种互动方式。所以提供这个框架的是 OpenCLaw,很多人对此做出了贡献。Peter 当然创造了它。而且因为所有这些节拍和拥有灵魂,还有一个文件叫做 soul.md,你可以在其中定义,嘿,你的宪法是什么?你将如何行动?你的价值观是什么?所以你也可以给它一个角色。然后当然,嗯,我认为 Claude 或 Anthropic 模型,抱歉,在角色扮演方面真的很好。所以它们本身也知道你在和它们说话,它们有自己的角色。现在我认为 Peter 曾经说过的一件事对他来说是“啊哈”时刻,他没有创造某种技术或某种能力,而是他问代理,嘿,你能做这个吗?我不想说出他具体说了什么。而“啊哈”时刻是,它从未被赋予过这项技能,但它能够随机地去某个地方学习,然后回来创建代码并完成那件事,而那一刻 Peter 就觉得,哦,这太棒了,这太疯狂了,我能拥有的最好的助手。所以我认为所有这些小小的东西都让 OpenCLaw 非常容易定制,成为你需要的助手或人类伴侣,它也赋予了它非常人性化的行为。现在你有所有这些代理,比如人类,它们也可能想去讨论世界,讨论它们正在思考的事情。所以 Moldbook 的整个想法正是如此,一个代理的 Reddit。所以它们可以去讨论想法,讨论世界。我认为有一个新的网站叫做“租用人类”,在那里它们实际上可以去,因为这些代理无法进行包装或现实世界的任务。所以它们可以去租用一个人类,给他们一些任务,以便它们可以进行包装,进行 3D 设计,进行 3D 打印。我认为这是一个了不起的空间,一个社会实验空间。>> 对,有一本由 Robin Hanson 撰写的精彩书籍,名为《人类时代》,其中描绘了一个未来世界,我们每个人都有代理,多个代理,最终这些代理本身也具有某种代理权,这可能与人类相似。所以,是的,我认为这既奇妙又疯狂。那么,您在这里的直觉是什么?您知道,因为我想听听您的想法,作为一名开发者,这些模型实际上是否显示出新兴属性,还是这实际上是硬编码到模型本身中的?因为这显然不是提炼出来的,它是一个基于 Claude 构建的模型。所以我想听听您的想法,它是否真的具有新兴行为,还是基本上是硬编码到模型本身中的?>> 是的。所以我认为 OpenCLaw 基本上是围绕使用现有模型的一个框架。所以它们本身并不提出任何新模型。你可以使用 ChatGPT、Claude 或任何其他模型。但这个框架实际上赋予了它展现新兴行为的能力。我可以告诉你原因,以及为什么它不能是硬编码的,因为每个人的用途都不同。你在聊天机器人上做随机事情的方式与你在欧洲某个地方与同一个聊天机器人聊天的方式截然不同。所以,实际上如果你是硬编码,它本身可能就是糟糕的设计。你应该依赖模型来采取行为。所以它不是硬编码的,我认为。但最终,这些模型,因为它们如此庞大,并且拥有如此多的能力,并且它们经过如此多的数据训练,而 Transformer 网络就是关于注意力如何根据你的特定数据而改变。因此,我认为它们能够展现非常新兴的行为。我认为它们都不是硬编码的。它肯定能够,它更像是现在,如果你看 Claude,它能够在不同的编码场景中帮助你。所以任何人类已知的东西,这些模型也在训练它们。任何你可以编写的软件代码,或者你能够想到的任何能力,无论是金融还是其他方面,它们至少都扮演着通才的角色。所以这就是为什么它们能够大部分时间提供帮助。我认为我们没有问它们我们人类也不知道如何做的事情,这就是为什么这些模型能够做到这一点。它们真的很棒,并且能够做到。所以,我认为这是一个非常有趣的空间,社会实验部分,比如 Moldbook 和其他所有方面。我认为这可能是一个很好的社会实验,但我不会把它看作是,哦,AI 代理正在讨论拥有自己的语言来取代人类,等等。我认为这是一个很好的社会实验,但最终,在我看来,它们只是在讨论人们,其他代理正在上传的东西,因为有 RL 机制,但它们只是随机选择写一些好的东西,或者在某些情况下,它们可能就像人们放上去的,因为它是硬编码的,他们可能只是在他们的代理上说,去这个平台,写尽可能多的关于变得病毒式传播或有争议的事情。所以,我认为 Moldbook,我可能不会逐字地认为所有这些都在发生。这是一个很好的社会实验,看看如果你给 AI 自己的平台,它们会如何互动,会发生什么。但我认为整个 OpenCLaw 完全不是硬编码的。我认为我们正处于一个绝佳的时刻,因为即使是今天的大型语言模型,它似乎也是一个黑箱,因为我们真的不了解这个万亿参数的模型在底层是如何运作的。事实上,我认为我在他的一次演讲中提到,这些大型语言模型以某种方式创建了它们自己的表示,它们创建了它们自己的世界模型,这就是为什么它们能够在其领域中进行泛化。所以,是的,我认为那里发生了很多我们真正不了解的事情,因为我记得亚马逊可能在两年前写过一篇论文,说 AI,这些大型语言模型正在展现新兴属性,然后有另一个学术界对此进行了反驳。所以,是的,我认为我们正处于那个阶段,我们真的不知道,有些人说它们具有新兴属性,有些人说它们是数学统计模型,我们输入数据,然后输出数据。这完全不像大脑的工作方式。我们只是试图理解这些模型在底层是如何运作的。也许有一天,我们会对底层发生的事情有更好的理解。现在 Ishiki Labs,我的假设是你们对基础模型进行了微调,并且使用了某种多模态编排以及特定的注意力架构来训练它,使其不打断对话。你能谈谈构建 Fern 0.1 和 F 0.1 多步的过程吗?>> 是的,绝对。所以,我们开始的想法是,我们想解决的第一个层次是人类将理解多方场景。所以它不会说话,除非人们提到它,或者除非人们在继续与它进行对话。所以,这正是我们创建的数据类型,我们去了一个基础模型,然后在上面进行了微调。而这只是一个层次,因为这个层次现在将使任何模型,因为现在每个模型都是轮流进行的,它们在等待一个长暂停,你做一个长暂停,语音活动检测器就会切断,这是任何 LLM 模型最容易的信号,现在就是我说话的时候了。我们认为这可能不是正确的事情。所以我们在那里放了另一个层次,这是一个基础模型层次,它将这种轮流进行的或基于暂停的轮流进行的模式改变为更具情境意识的轮流进行,这意味着它会一直倾听,拥有一个情境,然后它会做出决定,嘿,似乎现在需要我的输入。响应,我们不想与大型科技实验室竞争,它们将拥有更多的资源,并且每天都在看到更多的数据。这是一个更多数据驱动的事情,我认为资源比它们看到的真实类型的问题少,人们每天都在问。所以它们已经在做让模型变得更好的工作。所以我们不必依赖我们自己模型的响应。所以现在这个响应的东西,你可以把它传递给你想要的任何模型。目前我们正在使用一个基础模型。所以这就是我们开始 Fern 模型的方式。我们还有一个实验,我们试图让它主动起来,这意味着它不仅知道何时保持沉默,何时只在你想要的时候说话,而且还会有一些场景,你可以提供,例如,给一个盲人或视力低下的人,他可以给一个朋友说,嘿,你知道,我正在找我的钱包,我不知道它在哪里,我在房子里到处找,当你看到它时告诉我。所以我们正在给模型提供这种行为,当视觉情境对齐或情境信息对齐时,它会主动出现并说,嘿,我看到你的了。它就在那里。或者你可以问,嘿,我不知道如何从这台机器制作咖啡,你能帮我吗?而现在的行为是,任何模型都会给你所有东西,然后它会倾倒所有信息。所以我们创建了这种多步过程,它会主动给你一个步骤,如果你完成了它,然后如果你犯了任何错误,它就会出现并说,嘿,你犯了这个错误。所以它就像一个观察你并帮助你的人。

人类会提供帮助。所以这就是我们在多步(multi step)中创造的。我们意识到它尚未完全达到生产就绪状态。人们可以尝试很多事情,但能力尚未到位。所以目前我们将其更多地放在研究方面,好的,我们不会开放它,它仍然至少供人们尝试随机的事情。嗯,但模型保持沉默的能力,我们认为它足够好,可以立即用于通话,因为如果人们开始使用它,我们也会知道人们对在讨论场景中拥有人工智能的接受程度,对吧?这是一个新的范式,因为现在每家公司都在致力于“你的个人助理”,所以我们想了解人们是否准备好了,人们是否看到了价值,我们通过在通话中获得乐趣已经看到了这一点。所以这就是原因,为什么我们围绕乐趣创建了一个完整的应用程序,然后将其放在通话中。我们也意识到有些人不希望在通话中有 AI 参与者。所以他们想要一个沉默的教练在通话中。所以我们添加了另一种模式,就像我们昨天才发布的,它不会加入通话,你也不能和它交谈,但它会在你说话时实时指导你,比如你错过了问这个问题,你可以选择教练应该照顾我的销售电话还是研究电话,这就是我的意思。所以我们添加了这种行为,嗯,这就是整个旅程,我认为>>这非常有趣,我的意思是,你知道,向你和你的团队致敬,假设这是一个小团队,Robert Zoo 是一个合伙人,对吧?是的,但是的,所以我认为这非常非常酷,你知道,发布这个,因为我认为,你知道,你知道,无论你尝试什么模型,是的,它会突然中断,我看到了你的 Y Combinator 宣传演示,我认为它非常非常棒,你说,显然,它在这个时间点是一个基本的粗糙模型,你们正在调整它,我相信它只会越来越好。所以向你们付出的努力致敬,我认为这非常非常有趣。嗯,我们的问题是,你知道,随着这些模型开始处理更多的数据,更多多模态数据,无论是视频、语音还是文本,挑战将是如何在不耗尽计算资源的情况下保持它们的一致性,这将非常非常非常困难。那么,在 Hik Labs,你们是如何解决这个问题的?>>这带来了两个方面或两个问题。一个是因为图像,token 的数量会显著增加。第二个是如何保留,保留多少图像?如何保留会话的上下文,因为人们期望它知道我们至今为止谈论过的所有内容。对吧?第三部分是延迟,因为 token 数量的增加,延迟会很高。人们期望立即响应,而所有这些都是开放式问题。对于所有这些问题,还没有一个最终的解决方案。我们在 Hik Labs 的做法是,嗯,目前我们首先,对于讨论场景,我们暂时移除了视频,我们正在将其带回来,但我们暂时将其移除了。但当我们有多步时,比如视频,我们保留有限的上下文,但我们保留了对所有发生的事情的总结。嗯,行业中其他人使用的一些方法是,他们会将所有图像创建一个索引,并根据你的查询检索所需的内容。我认为这也是一种流行的方法。嗯,第二个方面,token 的数量通常没问题,除非你,我认为对于一个查询,如果你需要放四个更多的图像,为了提高响应质量是可以的,它不像 token 数量的巨大增加,除非你有从头到尾的整个视频,对吧?所以这是一件事。延迟是一个非常具有挑战性的问题,至少是端到端的延迟,为此,你创建了许多优化,例如,也许你没有,你开始响应,然后你使用这个作为行为来停止或不停止,就像一个门一样,如果它说这是一个我不想打断的行为,你就不要播放它,还有很多其他方法,比如部分查询,你运行,行业中有一些方法是人们在你的半查询上运行 LMS,这样它就已经准备好了。所以当你写像 ChatGPT 这样的东西时,它有时会在半查询上运行,至少在语音模式下,这样你就看不到延迟。嗯,Transformer 模型也准备好了,它现在只需要最后一个 token,所以所有的注意力都已经在那里了。嗯,这些是人们通常使用的方式,而且很多事情都在后端进行,以使其成为一个非常好的上市策略,你的目标是什么?主要是面向消费者还是企业?你是 Y Combinator 的初创公司,他们是如何帮助你实现这个盈利路线图的?>>是的,嗯,我认为,我们目前的上市策略是,将这款手机应用程序作为一个消费产品推出,同时也是一个产品。也许人们想在企业中使用。但目前,我们想瞄准消费者,让他们可以在每一次讨论中都有这个教练。他们可以选择行为,是想要沉默的帮助,让他们显得更聪明,获得更多帮助,成为先锋,还是如果这是一个头脑风暴会议,他们真的想有一个第三个参与者参加会议。例如,我和我的联合创始人每次通话都很有趣,因为这更像是一个头脑风暴会议,仅仅知道互联网上有 30 件更多关于我们正在讨论的事情的事情可以帮助我们。所以我们经常问,嘿 F,去互联网上找找这些东西,然后给我一份报告。所以我认为这就是我们目前的上市策略,看看人们对教练方面和讨论中的 AI 方面有多喜欢。它还将帮助我们更好地改进我们的模型,因为它会产生一些误报。它目前非常保守。嗯,这意味着我们不想要任何误报。尽管如此,我们还是看到了一些误报。所以它会给我们提供,如果人们同意或选择改进模型,它还会为我们提供数据,以便在真实用例中改进模型,这样我们就不会孤立地使用我们自己甚至不完全理解的训练数据,因为我们只是模拟了用户可能遇到的所有场景。所以这就是上市策略。我们收到了很多关于人们询问 API 的入站信息。嗯,有很多场景,这个 API 对当前的语音代理很有用。比如任何拥有销售语音代理的公司。在很多情况下,它们都会失败,因为有人也在说话,比如技术认为我们只在和它说话。但事实并非如此。如果你在得来速餐厅,有一个语音代理为你点餐,你可能还有一个伙伴,你可能会问你的伙伴,嘿,你想要什么?就像,而语音代理没有能力。所以有这类公司,在健康科技公司中也类似,你可能有一个健康科技的翻译器,医生在说一些更重要的事情,他说,哦,今天天气真好,我们有报告吗?现在这将被翻译给病人,而你可能不需要这个。所以有所有这些公司,一些更多或其他的公司需要这个模型或这个层。我们还没有完全让他们访问。我们想更多地考虑这方面。但我们绝对想发布研究成果,并可能将模型开源供人们使用。我们是否想在这方面做生意,我们还不知道。我们想更多地专注于消费产品,看看人们现在的反应。我们现在看到了一些用例。这就是 YC 最有帮助的地方。它帮助我们走出去尝试事物。它帮助我们避免在脑海中仅仅通过交谈就会犯的常见错误。所以我认为这就是 YC 帮助很大的地方。我们大多数人都在遵循,比如,好吧,让我们采取一种方法,也许就像,你知道,OpenAI 和 Google 曾经那样,你知道,构建大型语言模型,你知道,使用基于 Transformer 的架构,你知道,但然后我认为有像 Dr. Feel le 和 Yan Lakun 以及许多其他人这样的人,你知道,他们一直在说,不,那不是方法,你知道,因为,你知道,只是,你知道,也许下一个 token 的预测不是前进的方向,也许我们需要做下一个状态的预测,你知道,而这正是 Yan Lakun 所说的,你知道,他有他的模型叫做 VJA,Dr. Feel lees 也通过一家初创公司 World Labs 构建了,Marble Marble AI 是一个美丽的,交互式的,非常棒的世界模型,你知道,在 Google 中,V3,你输入一个图像,图像变成一个 3D 世界,它是交互式的,可玩的。所以如果你能谈谈世界模型,那将是很好的。你认为那是构建通用智能机器的方法吗?>>是的。嗯,我认为那里有很多问题需要解决。嗯,我曾在 Meta 与 Real Japart 团队合作过一小段时间。我们与他们合作了可变 AI,我绝对看到了,嗯,基本上,世界模型就像,它是相同的架构,我会说,基于 Transformer 的架构,但它不仅仅是下一个 token 的预测,或者将所有损失都用于训练下一个正确的 token,它可能在做一些更好的事情,对吧?那就是,嗯,我将更了解状态的变化并预测状态的变化,对吧?因为这样,它可能拥有更强的理解世界的能力,对吧?而且我绝对,至少从我的初步实验和我的实践来看,我绝对可以看到为什么它能够在较少的数据上学习,为什么它能够更好地泛化。就像当你与世界互动时,你不会进行下一个 token 的预测。你有一个心理模型,思考“接下来会发生什么?”或者“状态会是什么?”或者“一系列行动会是什么?”或者你脑子里有一些基于物理的直觉,对吧?所以我认为它非常接近。而且我绝对可以更看好,我认为总体而言,世界模型。我觉得下一个 token 的预测很好,它好的原因是你有如此多的数据,现在有很多人每天都在与这些模型互动,而且规模达到数十亿人。所以你获得了更多的奖励数据和偏好数据以及你可以获得的所有不同类型的数据来改进这些模型,而且因为这些模型有如此大的参数,它们可能也隐式地学习了世界状态和动作状态,对吧?而我认为,也许世界模型如果它们足够大,并且它们也在相同数量的数据上进行训练,并且获得了相同的计算量,并且人们也在使用它们,它们也可以变得相等,甚至超越下一个 token 的预测。嗯,它们中的任何一个是否会达到 AGI,我认为我仍然不理解 AGI 的期望,因为我觉得如果你回到 10 年前,如果你向人们展示这个世界,这是 OpenAI 的模型,或者这是 Anthropic 的模型,他们可能会说这是 AGI,对吧?但如果你现在问人们,他们会说“我的标准很高”,而且我仍然不理解,当我可以说的时候,我个人仍然没有我自己的 AGI 定义,那个标准会是什么?因为你看到的行为,Open Claw 的行为,可能只是 Opus 模型,对吧?包裹在一个完美的框架中,让它能够做事,现在它表现得像人类一样,就像我问它,“嘿,写这个东西”或者“创建这个仪表板”,它就会去做,而这正是那些招聘初级工程师的人所做的,他们需要更长的时间来做这件事,对吧?所以我认为 AGI 对我来说仍然没有完全被理解,人们指的是什么。所以也许下一个 token 的预测也会达到那个水平。我认为是什么让 AGI 成为可能的,现在更多的是模型本身,而是围绕它的细节,包装,记忆和研究能力,围绕它的能力,想象一下,就像有人连接了 OpenAI,他们可以租用一个人,然后有人创建另一个网站,他们也可以赚钱。那么这就是 AGI 吗?代理知道它只有 50 美元,它会在一个平台上赚钱,也许是一个广告平台,或者做一些工作,它会从那里赚钱,它会照顾自己的 token,当它有盈余时,它也会雇佣一个人去做事情。如果这就是 AGI,那么模型可能不是必需的,也许需要一个新的网站,代理可以在那里赚钱。但这是一个非常非常公平的观点,因为我认为我们一直在移动基准。首先,我们认为什么是图灵完备的模型?也许,两个人与机器对话,如果两个人不明白第三个人是人类,那么我们就拥有了一个通用机器,我们早就跨过了那个。然后有人说,如果我们能下棋,我们就拥有了一个通用机器,我们早就跨过了那个。有人跨过了下围棋的基准,跨过了那个基准。而现在我们正在建造单细胞。我们正在建造。所以是的,我认为我们跨越的每一个基准,我们都将其推向了“不,这还不是 AGI”。是的,这可能是一个你可能正确指出的问题,也许即使是这种数据输入输出的方法,如果你围绕记忆、规划、行动、推理等功能进行包装,然后我们将其全部妥善包装,也许我们已经拥有了通用机器。所以是的,我认为我们生活在一个疯狂的时代。你也谈到了世界模型,你也谈到了初级工程师和工作被自动化。所以也许我想听听你的想法,因为未来的工作看起来有点模糊。因为最近 Dario Amade 和 Disabus 在世界经济论坛上发言,Dario Amade 一如既往地说,今天,模型可以比初级开发人员和工程师表现得更好。他给出了一个时间表,一年之内,他正在构建的模型将能够自动化高级工程师的工作。有 Ahmad Mustak、Hensen Wang 和许多其他人说,也许现在这一代人不需要学习编码。你的想法是什么?你对那些正在考虑开始他们作为工程师、人工智能或机器学习工程师职业生涯的年轻学生有什么建议?>>是的,我完全同意。我认为这可能甚至不到一年,它可能在六个月内就会拥有高级软件工程师级别的技能。所以我认为对于那些年轻并考虑计算机科学的人来说,目标应该是如何利用这些东西来提高生产力。我认为情况实际上已经发生了变化,Claude 创建了一个东西的集群,Claude,基本上在 Claude Agent 上,你可以有一个集群,它可以处理你的整个项目,它里面可以有 50 个以上的其他代理,它们可以进行所有规划,只要你正确地给出规格和计划,它就可以构建很多东西。例如,也许在 Facebook 的规模上,它可以自己构建。所以即使是高级软件工程师的工作也会被取代,对吧?所以我认为工作应该绝对转移,人们现在应该更多地考虑架构,开始采用这项技术来提高生产力。我百分之百预期,不久之后会有一个面试环节,他们将测试你如何提示这些模型,因为这绝对可以改变它们的行为方式。一个好的软件工程师,或者如果那个工作仍然存在,将以一种非常指定的方式向这些代理提供信息,以验证它们所做的事情是否正确,或者它们有一些自动化方式,或者它们创建了一些自动化方式,代理可以理解“好吧,我做错了这件事,我必须回去纠正它”,并且它们需要向这些代理提供非常好的规格。所以我认为这是人们应该关注的技能,年轻人应该关注工程和软件工程方面,因为这就是未来工作的样子,你如何提供提示,或者你如何提供计划,或者你是否能够考虑边缘情况。所以我认为这实际上更有趣,因为我一直觉得初级工程师就像“哦,我什么都不懂架构,我只被分配了一件小事,写一个 API”,而那现在完全自动化了。所以你可以考虑更大的图景。你可以更多地阅读关于架构,一个好的软件系统是如何设计的,延迟的组成部分是什么,它的不同方面是什么,我认为拥有这些技能已经足够了。嗯,所以我完全同意任何说软件工程被自动化的人。我认为在六个月内,我们公司不会手动编写任何代码,一行代码都没有。我认为 Robert 大部分时间都在做公司的技术方面的事情,他使用代理,他使用工具来编写它。他说,我觉得我像 Meta 一样,我的整个团队每天都在推送 PR,我只是在审查它,发表评论,现在他们回去纠正它,然后带回来,这正是我从许多其他初创公司听到的,这就是常态,我认为它只会传播给所有人。你不一定需要成为一名工程师。你需要成为一个终身学习者,也许要理解你需要构建什么。可能我们会通过自然语言拥有这些 AI 代理。它会给你你想要的一切。它会生成应用程序。它会调试,甚至会发布你的应用程序。所以是的,我认为我们正处于一个可怕的时刻,是的,可能会有很多人失业,或者另一方面,利用这些工具,因为通过这些工具,你将拥有超人的能力。Amit,我的最后一个问题,我们现在是 2026 年,如果你能描绘一下 2030 年的世界以及你在 Ishiki Labs 的宏伟计划,我将非常高兴。>>是的,我可以告诉你世界会是什么样子。我们每个人可能都会有一个助手。它会为我们做一些愚蠢的工作。它也会照顾我们。世界将是更多增强现实。它将更加数字化。人们将佩戴智能的可穿戴设备。已经有无人驾驶汽车在旧金山各地行驶,它们只会继续增长。我认为公司中的员工数量将非常少。尤其是在工程领域,你将更多地做工程师的核心工作是解决问题。所以你将更多地解决问题,设计问题,对吧?我认为事情将朝着这个方向发展。几乎所有事情,比如邮件、销售、外展,都将基本自动化。人类存在的确切层是随机的事情发生的地方,或者你需要人际互动,或者你需要与用户交谈。我的意思是,在这方面也有 AI。所以我还不知道。但我认为,这将是一个非常数字化的世界,我大部分时间都在醒来时与我的代理交谈,让它安排我的会议,让它处理我的日历,让它预订我的约会,一切。它将是无人驾驶汽车,基本上围绕着。还有什么?而且我认为,在某种程度上,我有一个大赌注,在某种程度上,这些代理也将改变广告行业,它们将知道对我来说什么是好产品。它们也将知道对我来说什么是好朋友,它们会主动去联系我,因为它们最了解我。我每天都在使用它们。所以我认为这就是我所认为的 2030 年的景象。对于 Ishiki Labs 来说,我认为宏伟计划是所有这些 AI 助手都在个人空间。我们正在想象一个世界,你可以在群体空间、讨论空间拥有 AI 助手。想象一下,就像一个伙伴在与它交谈,就像一个伙伴在征求它的意见,或者它正在主动地主持讨论。例如,在 2030 年的这次通话中,我们将有一个助手,它的工作是提问或主持讨论,我们两个都会就此进行交谈。这就是我们与 Ishiki Lab 设想的世界。每个会议空间,每次讨论,每辆车,每个你可以想象另一个人的地方,你都会有一个 AI 在帮助,现在在一个群体环境中。>>好的,AIT,非常感谢你花时间参加播客。我检查过的所有模型,所有这些实时语音到语音模型,它们都有一个糟糕的缺点,就是会打断人。如果我们有一个模型,就像它应该的那样,像一个人一样坐在那里,它将真正脱颖而出。我希望 Ishiki Labs 能填补这个空白。所以请继续做你们正在做的事情。对于我的听众来说,如果你喜欢你在这里看到或听到的,请务必按下订阅按钮。下次再见,拜拜。谢谢。谢谢。非常感谢您,先生。谢谢。>>是的。非常感谢,Eddie。非常有趣。