📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Seedance 2.0, RIP OpenClaw, Minimax M2.5, Google dominates, GLM-5, AI singing, new TTS: AI NEWS

AI Search48:16

Transcription

人工智能从不休息,而本周简直是疯狂的。我们终于有了一个可以唱歌的语音克隆器。这个人工智能可以自动将视频配成不同的语言。此外,它还可以进行唇语同步,看起来就像他们真的在说新语言一样。阿里巴巴推出了一款最先进的图像生成器和编辑器。OpenAI 发布了一个实时编码代理,速度极快。我们有一些最新的文本转语音模型。谷歌低调发布了一个碾压一切的新模型。我们有了一个新的开源 Claw 替代品,而且更好。它比 OpenClaw 占用的内存少 99%,速度快 400 倍。英伟达发布了一个非常酷的顺序图像模型。我们还有一些令人难以置信的类人机器人演示,以及更多内容。那么,让我们开始吧。首先,这个人工智能非常酷。它叫做 Soul X Singer。它可以仅凭几秒钟的语音就能生成歌声。所以这是相当灵活的。你可以输入一个参考声音加上一些参考歌声音频,它基本上就能让它们唱出这首歌。这里有一个例子。他们已经发布了这个 Hugging Face 链接。我们可以上传这个参考声音。我先给你播放一下。Once upon a midnight dreary, while I pondered, weak and weary, over many a quaint and curious volume of forgotten lore. 好的,这是一个相当低沉的男声,然后我们让它唱出这首歌。所以,我先给你播放参考音频。>> Happy birthday to you. Happy birthday to you. 好的,这是一首普通的生日歌。通过 Soul X Singer 处理后,我们得到的是这个。>> Happy birthday to you. Happy birthday to you. Happy birthday to you. Happy birthday to you. 好的,它基本上让我们的参考声音唱出了参考歌曲。非常酷。或者这里是另一个例子。我们输入奥巴马的声音。听起来是这样的。>> Good afternoon, everybody. And on behalf of the American people, I want to welcome President Pval, uh, the first lady and their delegation to the United States. 好的,那是奥巴马的声音。我们让它唱出这首歌。希望 YouTube 在我上传时不会因此而版权警告。但如果警告了,这一部分可能会被静音。Everybody loves my baby, but my baby don't love but me. Nobody but me. 好的。然后这是我们的结果。>> Everybody loves my baby, but my baby does love nobody but me. Nobody but me. 好的。这就是如何使用 Soul X Singer 让任何人的声音唱出任何歌曲。现在这个非常灵活。它还有很多其他功能。例如,如果这是你的原始歌词,你可以先唱出来,这样它就知道歌曲的旋律。我们先听一下原始片段。>> All right. 然后之后,你可以输入另一个提示,用另一个人的声音。例如。>> All right. 所以之后,你可以让这个男声唱出来。我们得到的是这个。>> Next, here's a metal example. So, let me play the reference audio first. I am. I am. What's wrong with this society? 好的。这是一个金属风格的例子。让我们听听这个声音是如何唱出原始歌曲的。>> Very nice. 最后,我们还有一个说唱的例子。所以,我们先听一下参考。Serving cat foot in a glass on a coaster, tipping Michael Jackson with a Barbie. Now, this is the story of how I ra the party. 这是说唱歌手的声音唱出这首歌。>> Come on. Who says who says you're not perfect? Who says you're not worth it? 你可以插入任何声音,然后哼出自己的旋律,然后让那个声音唱出那首歌。例如,这里我们先输入一些歌词,然后你可以先哼出旋律。所以,这是旋律听起来的样子。好的。然后这里是某个声音唱歌的参考音频。可以是任何随机的歌曲。然后之后,我们可以让这个声音用这个旋律唱出这些歌词。听起来是这样的。所以,如果你想做翻唱歌曲,或者想让某个声音唱出你创作的歌曲,这是一个非常强大的工具。最棒的是,他们已经发布了所有东西。所以,如果你点击这个 GitHub 仓库,它包含了所有关于如何在本地下载和运行它的说明。而且,这实际上非常小。所以,它的大小不到 3GB,这意味着你可以在低端 GPU 甚至 CPU 上运行它。总之,所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能也非常有用。它叫做 Just Dub It。顾名思义,它可以将视频配成另一种语言,同时还能进行唇语同步,看起来就像他们真的在说新语言一样。这里有一个例子。所以,首先,这是原始的英文视频。I took a shower, washing every body part with actual soap, including all my major crevices. 好的,这是英语。接下来,我们将其翻译成法语。>> As you can see, not only is it able to dub this voice into French, but it's also able to apply lip sync, so it looks like he's actually speaking French. 或者这是一个葡萄牙语的例子。然后这是一个德语的例子。>> Or here are some other examples for your reference. 最后,我最喜欢的。我们已经正式合作一周了。周年快乐。现在,最棒的是他们已经发布了。所以,GitHub 链接实际上在这里右下角。如果你点击它并向下滚动一点,它包含了如何使用它以及如何自己训练它的说明。所以,如果我们点击这个,这里是如何下载和在本地运行它的所有说明。请注意,这使用了 LTX2,这是最好的开源视频生成器,原生内置音频。LTX2 的好处是它相当轻量级,并且生成视频速度非常快。所以,你可以在大多数消费级 GPU 上运行它,或者如果你有足够的 RAM,甚至可以在 CPU 上运行。总之,如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中链接到这个主页。本周,Quen 团队继续发布一些很棒的东西。他们刚刚发布了 Quen Image 2。这是他们迄今为止最新、性能最好的图像模型。从这些基准测试可以看出,Quen Image 2 的性能远远超过了上一版本的 Quen Image 以及 Zimage Turbo,后者在这里。图像编辑排行榜也是如此。它排名第二,几乎和 Nano Banana Pro 一样好。现在,Quinn Image 2 在理解和遵循我的提示以及在一个图像中生成文本和大量不同元素方面尤其出色。所以,这张图片实际上是 Quinn Image 2 的生成。正如你所见,它能够正确地获取所有文本以及提示中指定的所有图像,并生成这个漂亮的图表。或者这里是另一个更疯狂的例子,你可以在提示中指定大量内容,包括要包含的确切文本和数据,但它能够很好地生成所有内容。提示基本上指定这个幻灯片应包含三列。第一列应该是这个。中间一列应包含一个带有这些确切节点的流程图。最后一列应包含这个 2x3 表格以及这些指标。正如你所见,它能够非常准确地生成所有内容。或者这里是另一个非常复杂的例子,包含大量文本、图像和元素。这就像一个行程海报,但正如你所见,它能够非常出色地生成它。好的,这里有一个英文例子,包含了一些关于 Quinn Image 2 的规格。所以这里,首先,再次强调,这非常复杂。它包含大量文本,所有文本都是正确的。此外,他们还在下面添加了一个 Quen 3.5 的预告片。此外,它还包含背景中的中国长城。这个提示中塞满了如此多的元素,但它能够很好地生成所有内容。所以,这里是 Quen Image 2 的规格。它非常适合输出复杂的地形。正如我所展示的,它可以输出 2K 分辨率的图像,具有皮肤毛孔、织物纹理、建筑纹理等的微观细节。这是一个统一的全能模型。所以,它不仅可以生成图像,还可以编辑图像,就像 Nano Banana 一样。而且它实际上非常小。它只有 70 亿个参数。所以,它可以在几秒钟内生成 2K 图像。你也可以让它生成电影海报。所以,这里有一个例子。或者这是一个日历的例子。你甚至可以让他持续生成带有多个面板的漫画页面,就像这样。当然,它也可以生成照片级逼真的图像。所以,这里我们有一匹马骑着一个人。很高兴 Quen 团队确切地知道我们想要的骑行类型。这里是另一个超逼真图像的例子。我的意思是,很难分辨出这是 AI 生成的。它也很擅长处理不同的表情和姿势,就像这样。现在,他们还没有开源,但你可以在 Quen Chat 上立即尝试。所以,只需点击这里的创建图像功能,在这里你可以选择纵横比并输入你的提示。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。本周,我们还有一个新的顶级开源模型叫做 GLM5。它在推理、编码和代理性能方面非常出色。在某些基准测试中,它甚至击败了 Claude、Gemini 和 GPT 等顶级闭源模型。特别是,它在 humanity's last exam(测试 AI 模型回答一些非常晦涩的科学领域问题的能力)以及 Browse Comp(测试 AI 浏览网页的能力)方面表现出色。现在,我已经对 GLM5 做了一个完整的评测视频,所以我不会在这里重复太多,但除了 GLM5 之外,我们还有一个顶级模型叫做 Minimax M2.5。所以,这里是一些性能基准测试。最新的 M2.5 是最左边的红色条。正如你所见,在这些基准测试中,它与 Opus 4.6、Gemini 3 Pro 和 GPT 5.2 等领先模型相当。在 SWEBench verified 和 multi-webench(测试 AI 在代理编码方面的能力)方面尤其令人印象深刻。他们说 M2.5 在编码、代理工具使用和搜索、办公工作以及一系列其他经济上可行的任务方面处于领先地位。而且它非常便宜。他们说 M2.5 是第一个用户无需担心成本的前沿模型。以每秒 100 个 token 的速率连续运行该模型一小时仅需 1 美元。所以这比 Opus 4.6 便宜得多,效率也高得多。如果你处理的编程语言不是 Python,M2.5 在某些情况下甚至比 Opus 更好。它在超过 10 种语言上进行了训练,涵盖了超过 200,000 个真实世界环境。这是 Minimax 与顶级闭源模型之间进展速度的比较。你可以看到上周 Enthropic 发布了 Opus 4.6,在 SWEBench verified 基准测试中排名在这里。但仅仅一周后,Minimax 2.5 就发布了一个与 Opus 4.6 一样好的模型。这是相当疯狂的进展。它在专业或办公工作方面非常出色。它支持 Word、PowerPoint 和 Excel 等各种文件类型。例如,我只需上传一个包含星巴克财务数据的 zip 文件,然后要求它在 Excel 中创建一份全面的财务分析。然后我可以在这里指定我想要的确切信息。之后,这是我得到的结果。这里有一个核心财务摘要。这里是各部门的收入、同店销售额、盈利能力指标等。所以,它在一次提示中就创建了包含多个标签和图表的整个电子表格。或者这里是另一个例子。我只需上传一个包含 100 份 PDF 格式发票的 zip 文件,然后让它在 Excel 电子表格中整理所有内容。这是我从中得到的结果。现在,使用这个代理来处理和操作数据变得异常容易。或者它也可以为你原生创建 PowerPoint 演示文稿。所以,让我们让它创建一个关于领先咖啡连锁品牌财务报告等的 15 页演示文稿。这是演示文稿。你可以看到所有内容都格式化和设计得非常好。品牌在整个演示文稿中也保持一致。这太容易了。以前,我至少需要几个小时才能创建一个 PowerPoint 演示文稿。但有了这个代理,我可以在几秒钟内完成。或者这里是另一个关于如何让它编辑或创建文档的例子。我需要计划我创业公司明年的校园招聘。帮我列出美国 CS 和 AI 最强的 20 所大学。然后研究每所大学的招聘会情况。研究完成后,将其编译成一份 Word 文档给我。这是我的文档。你可以看到它确实为我提供了美国顶尖 CS 或 AI 大学以及每所大学招聘会细节的概述。所以这对于数据抓取、潜在客户抓取等非常有用。它在前端设计方面也很出色。所以,这里,让我们让它为一家豪华高保真耳机品牌设计和编码一个完全响应式的登陆页面。这是页面。看看它有多漂亮和响应式。有了这个代理的能力,它不仅仅是一个普通的聊天,它还可以为你自主执行多步工作流程。所以,它不仅仅是输出一个基础的网站,它实际上会规划所有内容,包括文案、图像、设计等,然后自主完成整个过程。总之,这是一个非常强大的工具,位居顶级模型之列。最棒的是,你现在可以使用这个 Minimax 代理界面免费试用,或者你也可以订阅他们的编码计划,然后将其链接到 Claude Code 或 OpenClaw。所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。本周,强大的谷歌继续发布一些疯狂的东西。所以本周他们发布了 Gemini 3 Deep Think。你可以将其视为 Gemini 的微调版本,但它经过训练,在高级科学和研究方面表现尤其出色。看看它有多疯狂。Gemini 3 Deep Think 在所有 ARC AGI 2 的基准测试中都碾压了所有顶级模型。这令人难以置信,我认为这个条形图并不能完全体现其价值。所以,我将向你展示另一张图表,其中包含所有 AI 模型在这个 ARC AGI 2 排行榜上。正如你所见,Gemini 3 Deep Think 在这里,远远超过了所有其他模型。那么,这个 ARHI2 基准测试到底是什么呢?表面上看,它测试了 AI 模型解决视觉谜题的能力。例如,这里有一个样本问题。它给出了一个问题和答案对。然后给出了一个新问题,它需要应用相同的逻辑。对人类来说,这很容易解决。你基本上需要根据这些灰色斑块有多少个孔来给它们着色。这对 AI 模型来说实际上非常困难,因为它应用了一种它从未学过的新模式。这就是为什么你看到大多数模型表现不佳的原因。因为从技术上讲,AI 完成训练后,其权重和参数是固定的。它无法学习新信息。所以,如果你尝试给它一种新的模式,AI 很难真正吸收和学习这些新信息并应用它。但正如你所见,Gemini 3 Deep Think 实际上具有这种涌现能力。它在学习新事物方面要好得多,这就是它如此强大的原因。除了这个 ArcGI 2 基准测试,我们还有 humanity's last exam,它再次表现出色。如果你不熟悉 humanity's last exam,这个测试会考察 AI 模型对一些非常晦涩的知识的了解。例如,这里有一些来自这个基准测试的问题。AI 需要提供这个罗马铭文的翻译。此外,它还需要知道蜂鸟的特定骨骼支撑着多少对肌腱。这些都不是大多数人知道答案的问题,但正如你所见,Gemini 3 Deep Think 的表现远远超过了其他模型。然后对于多模态理解和推理,这并不那么令人印象深刻,但对于 Codeforces(这是竞争性编程),Gemini 3 Deep Think 以巨大的优势领先。具体来说,它在 Codeforces 上获得了惊人的 ELO 分数 3,455。如果你看看人类分数的分布,Gemini 3 DeepThink 在这里。所以,它和世界上排名前十的人类一样好。这真的令人印象深刻。它还在 2025 年国际数学奥林匹克竞赛中获得了金牌。但同样,我们已经有模型之前获得了金牌,所以这已经是一个饱和的基准测试了。但请记住,这些是世界上最难的数学问题。现在,在你过于兴奋之前,这并不是每个人都能获得的。它仅适用于 Google AI Ultra 订阅用户,每月超过 200 美元,以及通过我们的早期访问计划提供的 Gemini API。但如果你从事科学或工程等领域的工作,你也可以点击此链接申请他们的早期访问计划。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主要公告页面。接下来,这个人工智能也非常有用。它叫做 Free Fuse。在我解释它之前,你需要了解什么是 Lora。所以,Lora 基本上是一个微调,可以生成特定的角色、艺术风格、效果或相机角度等。例如,这个 Lora 可以生成像这样的扁平色彩风格。或者这个可以生成业余摄影风格。这个可以生成漫画风格。这个可以生成无脸神。现在,问题来了。如果你在生成中添加多个 Lora,例如,如果我们添加这三个 Lora,传统上这些 Lora 会相互冲突,这会导致大量错误、故障或失真,就像这样。这是因为当你使用多个 Lora 时,一个角色的脸可能会渗入另一个角色。某些风格可能会覆盖其他风格。模型会混淆哪些属于哪里。以前,并没有一个很好的解决方案。但对于 Free Fuse,这是一个无需训练的框架,可以解决这个问题。所以,有了 Free Fuse,即使你输入大量 Lora,例如顶部的不同角色,加上左列的不同道具,你可以一次性将其中许多添加到你的图像中,而不会出现任何失真、面部错乱或其他错误。所有这些 Lora 都不会相互冲突,角色看起来也完全符合预期。或者这里是 SDXL 的另一个例子。你可以看到即使你混合了多个角色在同一代中,细节也很棒。我们不再出现任何失真或错误。所有这些角色看起来都很棒,而且非常一致。这里有一个前后对比的例子。所以,如果你不添加 Free Fuse,那么你可以看到它混合了他们的脸。这看起来绝对糟糕。但有了 Free Fuse,它保留了哈利波特和另一个女孩的外观。然后这里是 Z Image 的一个例子。同样,没有 Free Fuse,那么角色的脸看起来非常糟糕。但有了 Free Fuse,它能够更好地保持一致性。如果你对技术细节感兴趣,FreeFuse 使用一种称为自适应 token 级别路由的技术,该技术可以动态地将对象匹配到图像中的相应区域。这确保了 Lora 不会重叠或冲突。最棒的是,它已经发布了。所以,它已经支持 Comfy UI,并且也支持 Comfy UI 中的 Zimage Turbo。他们还计划在未来发布 Flux 2 客户端支持。所有安装说明都在此页面上。如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。现在,除了 GLM 和 Minimax 之外,我们还有一个更疯狂的开源模型。它叫做 Nan Beige 4.13B,它以其规模而言是一个绝对的野兽。这个非常小。它只有 30 亿个参数。所以,你实际上可以在大多数消费级设备上运行它。但这是疯狂的事情。这里是它与 Quen 3 模型(这些模型大 10 倍)的性能基准测试。但正如你所见,它的性能甚至更高。它在深度搜索、编码、数学、工具使用、研究生水平的科学问题方面尤其出色,而且这个也特别令人印象深刻。所以,这是 humanity's last exam,它测试 AI 在这些非常晦涩的科学问题上的能力。但正如你所见,即使没有工具使用,换句话说,没有网络搜索或使用任何工具来查找数据,它在这个基准测试中得分 12.6,这对于一个只有 30 亿参数的小模型来说实际上是令人难以置信的。这意味着它在这个模型中包含了大量的世界知识。不仅如此,它在代理任务方面也很出色。所以,它可以进行超过 500 轮的工具调用。换句话说,你可以让它自主工作超过 500 轮来解决特定任务。同样,对于一个只有 30 亿参数的模型来说,这真是令人印象深刻。最棒的是,它已经发布了。如果你点击文件和版本,它很小。它的大小不到 8GB,所以你可以轻松地将其放入大多数 GPU 或 Mac 中。然后这里包含了如何在本地下载和运行它的所有说明。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。如果你想生成 AI 音乐,最好的平台之一绝对是 MCA,本视频的赞助商。让我们听一个例子。你能分辨出这是真实的还是 AI 生成的吗?I'm the spark in the dark. >> Watch it blown. HEY, HANDS UP. >> WE RUN THE ROOM. >> HANDS UP. WE RUN THE ROOM. >> Stepping camera loves me. I don't need permission. >> I turn into my head. 现在,Mora V8 在生成人声方面非常出色。它听起来非常动态、富有表现力且非常逼真。这里有一个例子。>> Walking slow, cameas on my lips gasoline. Every step make the marble shake. Whispers follow but we don't break. Silk and steel in a single breath. Smile sharp like a sudden thread. MCA V8 使用其音乐思维链引擎来像人类歌曲作者一样思考,构建感觉生动而深思熟虑的介绍、主歌、副歌和高潮,而不是一遍又一遍地重复相同的片段。事实上,这里有一些性能基准测试供你参考。请注意,它甚至比 Sunno V5 更好。此外,他们还有一个 AI 音频编辑器,提供专业的混音和母带处理工具。你可以对歌曲的片段进行微编辑。我最喜欢的部分是,你甚至可以导出单独的音轨进行自己的后期制作。如果你有创作瓶颈,他们有大量的流派模板,如 EDM、R&B、Latin 和 Blues,可以启动你的创作过程。这是最好的音乐平台之一。所以一定要试试 MCA V8。链接将在下面的描述中提供。在人形机器人新闻方面,本周有很多非常酷的演示。首先,我们有 Westlake Robotics 的新演示,展示了他们的人形机器人 Titan01。这是一个相当新的机器人,之前没有怎么被报道过,但他们在这里展示了一个如何从任何地方远程遥控这个机器人的演示。例如,这位父亲因为春节不能回家和家人团聚。所以,他戴上 VR 头显和手套,可以实时遥控这个机器人并与他的女儿互动。这是一个有点悲伤的视频,这位父亲春节期间还需要工作。但是,正如你所见,这个机器人的遥控技术非常好。你可以远程操作它行走、拾取物品和搬运物品。它相当灵活,我认为这项技术对于危险工作,如建筑或采矿等,人类生命可能不适合冒险,会特别有用。所以,你所要做的就是训练人类在这些危险环境中遥控这些机器人。除了 Titan01 人形机器人之外,我们还有一个演示。这次来自 Robot Era 的 L7 人形机器人。这也不是一个很受欢迎的机器人。它没有像 Uni Tree 或 Optimus 那样受到关注,但正如你所见,它非常非常灵活。在这里,他们展示了它在进行全套剑舞的演示。机器人能够保持平衡,同时完成这些非常激烈的旋转和高速武术动作,所有这些都是自主完成的。这是对其全身协调性的绝佳压力测试,并且它完成得非常好。所以,你知道,Uni Tree 不是唯一一个现在可以做回旋踢和功夫的机器人公司。许多其他中国机器人公司也在迎头赶上。除了 Robot Era L7 之外,我们还有一个来自这个新的 AGI 机器人。这是他们即将推出的人形机器人。在这里,你可以看到它在做这些极端的功夫动作方面能力超强,包括高踢腿、深弓步、旋转动作。我的意思是,它就是超级灵活。而且机器人不仅仅是在模仿姿势。它实际上在执行非常爆发性的高扭矩动作,需要非常精确和同步的平衡和力量。你可以将其视为对机器人执行器或其电机进行的压力测试。要踢腿而不摔倒,机器人必须实时计算其重心。这很难执行。我们仍然没有看到 Figure 或 Optimus 能够做出这样的回旋踢。现在,除了那些令人印象深刻、花哨的功夫视频之外,这里是 Unitere Robotics 的一个更谦虚的演示。所以,在这里,他们让 G1 机器人实际在工厂里做事情。你可以看到它在做这些非常复杂的任务,比如拾取小组件并组装它们。与之前的炫耀视频不同,这个视频完全是关于灵巧性的。机器人需要用手部的精细运动控制来操作这些小物体。这也很棘手,因为机器人需要理解方向并施加恰到好处的压力才能将它们卡到位而不损坏它们。所以,这是一个非常令人印象深刻的演示,展示了它的精确性和灵巧性。现在,除了功夫之外,这里是另一个由另一个叫做 Tien Gong 3.0 的机器人进行的演示,它能够完成一个非常令人印象深刻的街舞动作,就像这样。我甚至没有见过 Uni G1 能够做到这一点。它的敏捷性和平衡性简直是不可思议。本周,字节跳动还发布了迄今为止最好的 AI 视频生成器,Seed Dance 2.0。它可以做一些疯狂的事情,比如生成连贯的打斗场面,就像这样。而且它非常擅长遵循我的提示。例如,我可以在提示中指定一系列不同的动作,包括不同的镜头运动、不同的对话、不同的表情等。而且它处理得非常好。就像我甚至不需要提示两次。它一次就完美地完成了所有事情。现在,我已经对 Cance 2.0 做了一个完整的评测视频,所以我不会在这里重复太多。如果你还没有看过,请观看此视频,让你大开眼界。但除了 Cance 2.0 之外,字节跳动还预告了另一个非常酷的视频生成器叫做 Alive。它也可以生成带音频的视频。所以,这是它的工作原理。这是一个统一的音频和视频生成器。所以,对于它的输入,它可以接受文本、参考图像或参考音频,所有这些都在一个框架内使用。这里有一些例子。>> Hey Lumi, set evening mode. >> Evening mode activated. Enjoy your evening. >> You guys remember last road trip? >> Of course. >> The lake was awesome. That was a killer workout. >> I am totally exhausted. >> Good job today, team. >> Look at this part. It's fascinating. >> Oh, yeah. That is really great. 好的,这些是一些文本到视频的例子。你可以看到角色非常有表现力,唇语同步也非常好。现在,除了文本到视频之外,你还可以上传一些你想要插入视频的角色或对象的参考图像。所以,这里有一些例子。>> The weight of centuries held within these forgotten words truly astonishing. >> Why you called? And no, I haven't changed my mind about the deal. It's too risky for us right now. 现在,这是这个新的 Alive 模型与其他带音频的视频模型(如 LTX2、Sora 和 VO3.1)之间的胜率。正如你所见,在运动质量、视觉美学、视觉提示遵循以及音频质量方面,Alive 平均获胜次数多于其他模型。在页面顶部,他们发布了一个 GitHub 仓库,但目前还没有代码或其他东西。我来得相当早,但希望他们会开源。此外,这里说他们很快就会有一个在线演示。总之,如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中链接到这个主页。好的,接下来,我们有一个非常酷的新 AI,叫做 Pico Claw。你可能听说过 OpenClaw 或 Claudebot。它基本上是一个开源框架,可以让你在服务器或电脑上 24/7 运行 AI,你可以通过 Telegram 或 WhatsApp 与它交谈并让它做事。如果你不熟悉 OpenClaw,我几周前它刚出来的时候就做了一个完整的教程,所以请观看此视频了解更多信息。现在,OpenClaw 非常庞大。安装起来很麻烦。但本周,我们有一个强有力的竞争者。所以,这位开发者开发了 Pico Claw,它是 OpenClaw 的超高效版本。而且你瞧,它甚至可以在非常便宜的硬件上运行。此外,它只需要 10MB 的内存来运行。而且只需要一秒钟就可以启动。这太疯狂了。这里说它比 OpenClaw 占用的内存少 99%,比 Mac Mini 便宜 98%。它还非常快。它的启动时间快了 400 倍,启动只需要 1 秒。它的工作原理与 OpenClaw 基本相同。你也可以将你的 AI 连接到 WhatsApp 或 Telegram,然后让它做事。现在,这个页面包含了如何在你的设备或服务器上下载和运行 Pico Claw 的所有说明。这里包含了如何将其连接到 Telegram 或其他聊天应用的说明。总之,这个东西正在爆炸式增长。它在几天内已经获得了近 6,000 颗星。如果你对比 OpenClaw 更便宜、更高效的替代品感兴趣,那么一定要看看这个。我会在下面的描述中链接到这个主页。本周,OpenAI 还发布了一个超快的实时编码代理,叫做 GPT 5.3 Codeex Spark。这本质上是一个编码代理,但针对速度进行了优化。这是普通 Codeex 与新的 Codeex Spark 的比较。正如你所见,如果让它们都构建一个贪吃蛇游戏,你可以看到 Codex Spark 执行得快得多。它几乎在几秒钟内就完成了。而对于普通的 Codeex,它还在思考。或者这里是另一个例子。这里我们让它为登陆页面创建一个计划。正如你所见,Codex Spark 可以在大约 2 秒内执行此操作。这里是另一个例子,我们让它将一个文件翻译成多种语言。同样,Codex Spark 要快得多。当然,速度上你需要牺牲一些质量,所以它不像普通的 5.3 Codeex 那样准确或性能好,但它快得多。它的设计感觉就像实时一样,每秒生成超过 1,000 个 token。现在,他们说 Codex Spark 的上下文窗口是 128K token,目前它只有文本,所以你无法上传参考图像或其他东西。接下来,如果你想知道如何使用它,他们目前正在将它作为研究预览提供给 ChatGpt Pro 用户,在最新的 Codeex 应用 CLI 以及 VS Code 扩展中。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主要公告页面。本周,我们还有一个最新的图像生成器和编辑器。它叫做 DeepGen 1.0,它甚至击败了一些顶级模型。首先,这里是一些文本到图像功能的例子。你可以看到它相当不错。它可以生成不同类型的艺术风格加上文本。然后这里是一些文本渲染功能的例子。再次,它相当不错。然后这里是一些其他例子供你参考。现在,除了生成图像之外,它还可以编辑图像。你可以向图像添加内容,可以更改现有图像的文本,或者可以替换对象或将图像变成动漫风格。或者这里是另一个很酷的例子,你可以让它解决像这样的迷宫。或者你可以让它生成场景的不同视图,或者预测接下来会发生什么。现在,这里有一些性能基准测试供你参考。所以,显然在文本到图像生成方面,DeepGen 与顶级开源模型相当,包括 Zimage Turbo 和 Quen Image Edit。如果你看这张图表,它比较了 Deep Gen 的图像编辑能力和图像生成能力的性能,显然它甚至击败了 Nano Banana。我认为这只是第一个版本,以及 Quinn Image 和 Cream。最棒的是,他们已经发布了。所以,如果你点击这个 GitHub 仓库并向下滚动一点,它包含了如何使用它的所有说明。然而,请注意,如果我点击 Hugging Face 上的这个 deep gen 文件夹,所有东西的总大小是 72GB。所以它无法放入大多数消费级设备。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。本周,我们还有一个最新的文本转语音生成器。它叫做 MOSS,它真的很好。所以,首先,这里有一个演示。>> Hello, look how long we've been chatting. I still haven't said who I am. Okay, I'm Simo and what you just heard wasn't a human voice. It was me powered by the Moss text to speech family, a real production level speech model. 现在,像大多数文本转语音生成器一样,你也可以输入几秒钟的语音,它非常擅长克隆他们的声音。例如,这里是 David Atenboroough 的克隆。>> The cubs are just 12 weeks old when winter arrives. The season is long and the weather is only going to get worse. Temperatures will soon plummet to 40° below zero. For these fragile lives, the cold is a relentless enemy that never sleeps. Their mother is their only shield. 然后这里是埃隆·马斯克的克隆。>> You know, why why why are we here? Um what's the origin of the universe? where what is the end? Um what are the questions that we don't even know to ask? >> Maybe maybe we're here because the universe uh wanted to know itself and then then maybe it ends when it you know forgets. 好的,这里是所有顶级闭源和开源文本转语音生成器之间的比较。现在,对于第一列,分数越低越好。这基本上是错误率。正如你所见,Moss TTS 在模型中得分相当低。然后对于相似度得分,这就像它在克隆某人的声音方面有多好。你可以看到它非常出色。它甚至击败了 Quen 3TS。此外,请注意它支持所有这些不同的语言。最棒的是,他们已经发布了。所以,如果你点击这个 GitHub 仓库,它包含了如何在你的电脑上下载和运行它的所有说明。而且他们发布了大量的不同模型。主要的模型是 Moss TTS。它非常适合语音克隆。所以,你可以上传几秒钟的语音,它就会克隆那个声音。你可以让它们说出任何你想说的话,并附带文字记录。然后我们还有 MOSS TTSD 模型。它适合富有表现力的多角色超长对话。例如,如果你想生成一个有两个主持人的播客,或者你想生成一个有声读物,这是最好的选择。然后我们还有一个语音生成器,你可以从头开始设计你自己的合成语音。他们还有一个实时模型,顾名思义,你可以实时使用这个 TTS。它具有超低延迟。然后我们还有一个模型,非常适合创建音效。最棒的是,所有这些模型都已经发布了。此外,大小实际上很小。所以,如果你看这个主要的 80 亿参数模型,它大约是 17GB。然后较小的 17 亿参数模型只有 6GB。所以你可以轻松地将其放入大多数 GPU 中。总之,所有链接都在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。此外,本周我们还有一个 TTS 叫做 MOTTS。它非常轻量级且快速。它针对仅英语和日语的高质量语音生成进行了优化。所以,它不支持像之前的 TTS 那样多的语言,但它也非常好。这里有一些例子。所以,首先,我们可以先上传一个参考声音。只需要几秒钟。所以,这是参考声音。>> Hello, my name is John. I'm living in Japan now. Nice to meet you. What's your name? 好的。然后让 John 读出这个文字记录。听起来是这样的。>> The old library was silent, save for the gentle ticking of a clock somewhere in the shadows. as I ran my fingers along the dusty spines of the books. 不错。然后这里是另一个英文例子。首先,这是参考声音。>> Hello, my name is Anna. I'm living in Japan now. Nice to meet you. 然后让它读出来。>> Hey, I haven't seen you in ages. Do you want to grab some coffee later? I've got so much to tell you. 你可以听到,它比其他文本转语音生成器更具表现力,更少机器人化。听起来非常自然。然后这里是一个快速的日语例子。所以,这是参考声音。然后让这个声音读出这个文字记录。所以,这些是一些快速的例子。最棒的是,他们已经发布了所有东西。所以,在这个 GitHub 仓库中,它包含了如何在本地下载和运行它的所有说明。模型非常小。所以,最小的那个只有 0.1 亿个参数。所以,总大小只有 244MB。甚至不到 1GB。所以你可以轻松地在 CPU 或普通电脑上运行它。总之,如果你想使用文本转语音,特别是英语和日语,这是一个非常好且轻量级的选择。如果你有兴趣,我会在下面的页面中链接。本周,英伟达还发布了一个非常有用的顺序图像模型,叫做 Duo Genen。他们称之为多模态模型,旨在自动在模态之间切换,以生成连贯的交织图像和文本序列。所以,这里有一个实际应用的例子。你可以让它做一个关于如何烹饪特定菜肴的分步教程,它会按顺序进行规划。它会提供文本描述以及相应的图像,所有这些都来自一个提示。或者,例如,你可以让它教你如何将木梯变成毛毯架。同样,它会生成这个顺序教程,包含文本描述和相应的图像。或者你也可以让它做一个关于如何蒸鱼或炒饭的教程,以及大量的其他教程。它基本上使用其内置的图像模型顺序生成图像,以保持你的序列中所有图像的一致性和语气。这是它的主要功能。但除了创建这些分步教程之外,你还可以将其用作标准的图像编辑器。例如,你可以让它像 Nano Banana 一样编辑图像。你可以交换他们的衣服,改变背景,改变他们的表情等。我说它的质量不如 Nano Banana Pro。所以,我不会单独用它来编辑图像,但它的教程创建功能,即它顺序生成多个图像,我认为这是一个非常有用的功能。由于这个顺序图像生成功能,你也可以用它来为机器人生成顺序图像,以便它能够预测接下来会发生什么。这对于生成机器人如何操作对象的训练图像非常有用。目前,他们只发布了一篇技术论文。我不确定他们是否会开源,但如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中链接到这个主页。本周,我们还有一个非常有用的音频模型叫做 Uni Audio 2.0。他们称之为统一音频语言模型,它可以做很多事情。首先,它可以进行常规的文本转语音。例如,你可以选择一个声音,让它读出某个文字记录。这里有一个例子。>> He began a confused complaint against the wizard who had vanished behind the curtain on the left. 或者这里是另一个例子。>> Give not so earnest a mind to these mummy's child. 但这只是简单的事情。除了文本转语音,它还可以生成音效。例如,你可以提示它生成一大群人欢呼和鼓掌。这是我们得到的结果。现在,除了音效之外,它还可以进行文本到音乐的转换。现在,它在这方面并不擅长。歌词只是胡言乱语,但这里有一些例子。首先,这是一首充满活力的旁遮普民歌。>> 或者这是一个阿拉伯舞曲的例子。同样,质量不高。你不会用它来实际生成歌曲,但它能够在一个统一的音频模型中内置所有这些功能,这很酷。当然,你也可以输入歌词,让它生成一首带有这些歌词的歌曲。所以,这里有一些例子。long time ago in Bethlehem. So the Holy Bible says >> one day long. >> 另一个很酷的功能是,你可以输入一个参考对话,并将其编辑成另一种风格。例如,这是我们的参考。>> I dismiss that. 然后将其变成耳语风格。>> I dismiss that. 非常酷。接下来,让我们编辑这个参考音频,并将其变成喊叫风格。所以,这是参考音频。>> Oh, yes, sir. 然后这是结果。>> Oh, yes, sir. 它并没有真正大喊大叫,所以,你知道,这个模型的质量并不高,但它内置了所有这些功能,这很酷。最棒的是,他们已经发布了所有东西。所以,如果你点击这个 GitHub 仓库并向下滚动一点,它包含了如何在本地下载和运行它的所有说明。总之,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。这总结了本周 AI 的所有亮点。在评论中告诉我你对这一切的看法。你最喜欢哪个新闻?你最期待尝试哪个工具?一如既往,我会密切关注顶级 AI 新闻和工具与你分享。所以,如果你喜欢这个视频,请记住点赞、分享、订阅,并继续关注更多内容。此外,AI 世界每周都在发生太多事情,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要想真正跟上 AI 的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。感谢观看,下次再见。