📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Realtime AI voices, AI livestreamers, Blender 3D agents, realtime worlds, new top OCR: AI NEWS

AI Search41:25

Transcription

人工智能从不休息,而本周简直是疯狂的。我们不仅有一个,不是两个,而是四个令人难以置信的强大新语音 AI。其中一些可以即时克隆你的声音,而另一些甚至可以在 CPU 上实时运行。这个 AI 可以制作出极其逼真的人说话视频。就像,真的很难分辨出这是 AI 制作的。我们有一个新的实时交互式世界生成器,你可以在离线状态下运行它,而且延迟非常低。这个 AI 可以从单个视频创建 4D 场景。我们还有另一个 AI,可以生成非常逼真且流畅的人类动作。这个 AI 太疯狂了。它可以将参考视频中的任何内容转移到新视频中,包括视觉特效、摄像机控制角色等等。这个 AI 可以将图像变成一个 3D 场景,你可以在 Blender 中进一步编辑。我们还有一个新的 AI,它在视频中的遮罩和分割方面非常出色,还有很多其他功能。所以,让我们直接开始吧。首先,这个 AI 非常有用。它叫做 VGA,代表“视觉作为逆图形代理”。它基本上可以拍摄一张图片并将其重塑为一个可以在 Blender 中编辑的 3D 场景。这基本上是一个可以为你自主完成多项任务的 AI 代理。所以,例如,你可以拍摄这张图片,然后提示代理生成它的交互式 3D 版本,然后向其中扔一个球。然后,该代理将继续在 Blender 中重建这个 3D 场景。这就是你得到的结果。顺便说一句,它看起来与绘画非常相似,这令人印象深刻。然后之后,你可以像这样向场景扔一个球。太酷了。或者这是另一个例子,我们可以输入这张照片,它能很好地重建它。然后这里有一些其他例子。它在处理反光材料方面也非常出色。如果你向镜子扔一个球,它也会像这样知道要砸碎它。它还理解每个单独的物体应该如何移动,以及如果你像这样乱动会发生什么。太酷了。现在,如果你将 VGA 与其他 AI Blender 代理进行比较,你会发现 VGA 平均得分最高。然后这里有一些其他基准供你参考。最棒的是,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里包含了所有关于如何在本地下载和运行它的说明。请注意,这里你需要有一个 CUDA GPU。总之,如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,这个 AI 非常有用。它叫做 Video Mama。名字很有趣。它基本上可以从视频中分离出物体和背景。所以,它是这样工作的。你会输入你的视频,然后输入你想要分离的物体的粗略轮廓或遮罩,这个 AI 会输出这个物体的精确轮廓,背景透明。所以,你可以在这里看到它添加到了绿幕上。但你也可以像这样将其变成一个 Alpha 通道。请注意,这个视频非常棘手,因为她的头发四处飞扬。这种头发在快速移动的视频中很难准确分割。但正如你所看到的,Video Mama 能够很好地处理这个问题。这里是另一个极具挑战性的例子,假设我们有这个参考视频,我们只想分割树叶。所以,我们可以输入一个非常粗略的轮廓,它会非常准确地分割这些树叶。它能够遮罩所有这些细节。然后这里是供你参考的 Alpha 通道。非常令人印象深刻。这里还有一个极其困难的例子,是关于蒲公英的。任何像羽毛一样的纹理都很难用传统方法遮罩掉。但在通过这个 AI 处理后,看看分割效果有多好。然后这里是供你参考的 Alpha 通道。这非常令人印象深刻。这里有一些更难的例子,是关于香烟和烟雾的。它仍然能够很好地分割香烟和烟雾。然后这里是 Alpha 通道。你可以看到它也能处理半透明,不仅仅是完全的黑白。非常令人印象深刻。这里是另一个棘手的例子,头发四处飞扬。如果你看看一些量化结果,就所有这些不同的基准分数而言,基本上这个新的 Video Mama 表现最好。最棒的是,如果你滚动到页面顶部,他们已经发布了代码。所以,如果你点击这个 GitHub 仓库,然后向下滚动一点,这里包含了所有关于如何在本地下载和运行它的说明。此外,他们还发布了如何生成自己的训练数据集以及如何训练它的代码。如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,这个 AI 非常强大。它叫做 Light on OCR,这是一个拥有 10 亿参数的超小型模型,在光学字符识别方面非常出色。换句话说,它可以处理非常复杂的图像并解析图像中的所有文本。这里有一些例子。例如,左边是一个非常复杂的表格,有各种不同的列和项目,右边是一些注释,底部有一个图例。但你只需将整个屏幕截图输入此 OCR,它就能解析所有内容,如你所见。所有这些数字实际上都是准确的。或者这里是另一个例子,你只需输入这个研究论文的屏幕截图,它就能将所有内容解析为右侧的原始文本。这里是另一个例子,我们可以截取这个帖子的屏幕截图,它就能很好地解析出来。但是,请注意,它无法处理表情符号,如你所见。或者你也可以给它一本扫描的书,它就能很好地转录。疯狂的是,它只有大约 10 亿个参数,所以它非常轻量级。你甚至可以在消费级硬件上运行它,并且它在许多不同的基准测试中都处于领先地位,包括处理档案论文、旧扫描或表格。你可以看到它甚至击败了 Deepseek OCR,后者要大得多,还有 BYU 的 Paddle OCR,两者都处于领先地位。但根据这张表,这个新的 Light on OCR 甚至更好。这里是另一个图表,显示了 Light on OCR 的性能与速度的对比。正如你所看到的,它不仅更好,而且比其他竞争对手快得多。最棒的是,他们已经发布了所有东西。所以,这里是所有模型的链接。如果我点击这个基础版本,所有东西的总大小只有 2 GB。所以,你可以轻松地将其装入大多数消费级 GPU 中。总之,如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。本周,Nvidia 还发布了一个实时对话式 AI,你可以与之交谈。最棒的是,它是免费且开源的。所以,它叫做 Persona Plex。这里有一些演示。>> 你想听个笑话吗?>> 是的。[笑声]>> 好的。我还没说呢,但是>> 是的,请说。>> 是的,当我真的说出笑话时,它会非常有趣。>> 好的。>> 所以,为什么照片要去监狱?>> 为了逃离镜子。>> 不,因为它被框起来了。哦,[笑声] 这个不错。这个不错。是的。>> 是的。>> 是的。>> 你还有吗?我还有一个给你。>> 好的,请说。>> 好的。你如何称呼一个假面条?>> 一个假面条?我不知道。[笑声]>> 好的。不错。不错。>> 现在,你甚至可以用系统提示来描述这个 AI 语音的角色。例如,你是一位睿智友好的老师。以清晰引人入胜的方式回答问题或提供建议。这里有一个例子。>> 我一直在考虑开始节食。>> 是的,开始节食可能会让人望而生畏,但你可以保持简单。多吃蔬菜和水果。尝试>> 在我忘记之前,我报名参加了马拉松。>> 好的,恭喜你报名参加马拉松。这是一个巨大的挑战。你有足够的时间。专注于通过规律的长跑打下坚实的基础。保持水分。确保你在之前和之后都正确补充能量,并且不要忘记拉伸和照顾好你的脚。或者这里是另一个例子,系统提示是,你在 First Neuron Bank 工作,这是一家银行,你的名字是 Sunonni Verton。客户在 Home Depot 的 1200 美元交易被拒绝。验证客户身份,等等,等等。所以,让我们看看它在这个客户服务场景中的表现。我卡在 Home Depot 的队伍里。我有一堆工具想买,但我的卡被拒了。你能>> 哦,不。这总是不愉快的。让我检查一下你的账户。我能知道你的全名和出生日期吗?>> 是的,我叫 James Hammer,我的出生日期是 1952 年 3 月 7 日。>> 谢谢,James。我马上查一下。请稍等。>> 嗯。请稍等。>> 好的,我看到问题了。在 Home Depot 有一笔 1200 美元的交易。>> 嗯。你通常的地点是西雅图,但这次交易是在迈阿密尝试的。这就是触发警报的原因。>> 你想让我重新提交交易吗?>> 是的,请。请。>> 好的。我已经确认了你的身份。交易现在应该可以进行。你很快就会收到确认邮件。>> 好的,我试试看。>> 没问题。如果成功了,请告诉我。>> 收银员说成功了。太好了。>> 太好了。谢谢确认。>> 所以,一个非常流畅自然的客户服务例子。好的,这里是另一个例子。这次,AI 语音是 Dr. Jones 诊所的接待员。>> 欢迎来到 Dr. Jones 的诊所。今天有什么可以帮您的?>> 你好。我叫 James Carlton,有人告诉我打这个电话来注册成为新病人。>> 哦,是的,当然。我们很高兴你来注册。首先,我需要获取你的基本信息。请问你的全名是什么?>> 是的,就是 James Carlton。就这样。没有中间名。>> 明白了。James Carlton。现在,你的出生日期,>> 嗯,是 1974 年 8 月 19 日。>> 好的。1974 年 8 月。现在,你有什么药物过敏吗?比如,如果有什么东西引起了过敏反应,我们需要立即知道。>> 哦,不,不,不。绝对没有。那不是我。>> 好的。没有过敏。那吸烟呢?你抽烟或使用电子烟之类的吗?>> 一个非常流畅的医疗办公室接待员收集新病人信息的用例。它也可以非常健谈。比如,它也可以添加这些同意词,比如,“哦,好的。是的。”好像他们真的在积极倾听并与用户交流一样。>> 你需要来见我,因为那样你就可以去城里了。>> 好的。>> 这就是问题所在。比如>> 有随机的喷漆,但也有>> 我我不是人们必须委托他们制作这些巨大的喷漆壁画。>> 是的,我认为他们会。>> 好的。所以,这些是一些快速的例子。请注意,这是基于这个 MSHI 架构,拥有 70 亿参数。所以它相对很小。现在,最棒的是,如果你滚动到页面顶部,他们已经发布了模型。所以,如果你点击这个 GitHub 仓库,然后向下滚动一点,这里包含了所有关于如何在本地下载和运行它的说明。在这里,它还提供了一个提示指南,说明如何为各种场景进行设置。他们没有指定 VRAM 要求,但如果我点击 hugging face 文件夹,所有东西的总大小约为 17 GB。所以,你可能可以用 16 GB 加上一些卸载来运行它。此外,因为它是开源的,我相信社区将来也会提供一些量化、更压缩的版本。总之,如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中提供此主页的链接。本周,阿里巴巴继续发布一些非常酷的动画 AI。这个叫做 Codance,它可以为图像中的多个角色制作动画,让它们移动和跳舞。所以,这里有各种例子。你只需要输入一张参考图像加上一个像这样的动态姿势骨架。正如你所看到的,它可以让多个角色根据姿势动画移动或跳舞。无论是动漫还是 3D,还是任何艺术风格,都没关系。这些角色比例不符也没关系。它仍然能够相当一致地为所有角色制作动画。现在,如果你将其与其他竞争对手的动画工具,如 Animate Anyone、Mimic Motion、Uni Animate 等进行比较,你会发现,尤其是在参考图像中输入多个角色时,其他竞争对手会犯很多错误。尤其是在角色比例不符合人类比例时。但对于这个新的 Codance AI,它能够为多个角色和任何类型的角色制作动画,即使是卡通、3D 或比例不规则的非人类生物。快速看一下它的架构。这是它的工作原理。所以,Codance 使用一种称为“解绑”然后“重绑”的两部分方法。“解绑”部分基本上帮助工具学习如何为角色制作动画,而不会过于僵硬或死板。然后,“重绑”组件帮助工具精确控制动画,并确保它被应用于正确的角色。现在,如果你滚动到页面顶部,目前他们只发布了一篇技术论文。没有迹象表明他们是否会开源它,但总之,如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中提供此项目主页的链接。接下来,这个 AI 非常酷。它叫做 Waypoint One,这是一个实时交互式视频生成器。延迟实际上非常低。他们甚至有一个在线演示供你尝试。所以,如果你向下滚动,这里是尝试的链接。所以,让我点击进去,然后按下开始。好的。所以,在这里,我可以描述一个场景,或者我可以移动鼠标环顾四周。然后我还可以按箭头键像这样移动。所以,在这里,让我描述一个赛博朋克城市的场景。让我们看看它会生成什么。过渡非常快。所以,它确实应用了一个赛博朋克城市。现在,正如你所看到的,它会产生很多幻觉。视频质量很差。它在一致性方面不好。它产生了很多幻觉。它肯定没有场景记忆,但嘿,这是一个实时视频生成器。而且几乎没有延迟。这里是另一个例子。让我们尝试提示一个色彩斑斓的外星行星。现在,它正在慢慢切换到这个色彩斑斓的外星行星,正如你所看到的。现在,实际上有两个变体,一个小变体和一个中变体,中变体即将推出。他们已经发布了小模型。如果你点击它,对于一个开源模型来说,它实际上相对很小。所以,所有东西的总大小约为 25.2 GB。然后在这个页面上,我会在描述中提供链接,它包含了所有关于如何在本地下载和运行它的说明。总之,如果你有兴趣尝试这个演示或进一步阅读,我会在下面的描述中提供此主页的链接。本周,还有一个非常有用的 AI,叫做 Omni Transfer。这实际上非常强大,因为你可以将参考视频中的任何内容转移到新视频中。例如,如果你的参考视频中有这个燃烧的心形效果,那么你可以选择将这个视觉特效转移到你的新视频中。或者这里是另一个视觉特效,我们可以像这样翻转角色。这个 AI 基本上可以将这个视觉特效复制到你的新视频中。或者这里是另一个例子。现在,它不仅仅是复制视觉特效,你还可以将参考视频中某人的表情和动作复制到你的新角色上。而且它不只是适用于人类角色。所以,这里有一个 3D 角色的例子,但正如你所看到的,它可以完全复制参考视频的动作。好的,这里有一个非常奇怪的例子,我们可以让蒙娜丽莎根据这个参考视频跳舞。或者我们可以让这个奥特曼角色做体操。现在,除了转移姿势和视觉特效之外,它还可以直接将视频的摄像机运动转移到新视频上。所以,这里是一个例子。或者这里是另一个例子,我们可以有一个左侧的相机运动。这是另一个例子,我们可以像参考视频一样放大和缩小。它甚至可以复制参考视频中的视差缩放效果。太酷了。除了复制视频的视觉特效、姿势或摄像机运动之外,你还可以直接将视频中的角色转移到新视频中。所以,左边是参考视频。我们可以提示这个女人做一些其他事情,就像你在右边看到的那样。或者我们可以让这个男孩在厨房里做作业。而且它在面部一致性方面做得非常好。这些角色看起来与参考视频完全一样。现在,除了以上所有内容之外,你还可以选择将风格转移到你的新视频中。例如,参考视频在左边。那么,我们可以用像这样的新提示将风格转移过来。这就是我们得到的结果。总之,这个页面上有大量的例子。正如其名称所示,Omni Transfer 几乎可以转移任何东西。它是一个非常强大的视频编辑工具。这是关键。如果你将其与其他视频生成器在复制视觉特效方面进行比较,你会发现 Omni Transfer 是迄今为止最好的。其他根本无法相比。复制参考角色的表情和动作也是如此。你可以看到 Omni Transfer 也是最好、最有表现力的。One Animate 也很接近,但 Omni Transfer 做得更好。创建深度伪造和将视频中的角色复制到新视频也是如此。与我之前在我的频道上介绍过的 Standin 和 Phantom 等其他方法相比,Omni Transfer 的一致性要好得多。然后风格转移也是如此。与将视频风格转移到其他方法相比,它做得更好。现在,在页面顶部,他们发布了一篇技术论文以及一个 GitHub 仓库。但不幸的是,这个页面上没有迹象表明他们是否会发布它。但总之,如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中提供此主页的链接。说到 AI 工具,你一定要看看 Art List,本视频的赞助商。Art List 是视频创作者的终极平台。它拥有最佳和最新的 AI 模型、精选音乐、音效和数字资产的理想组合。他们刚刚推出了这个新的 AI 工具包功能,将 AI 图像、视频和语音工具整合到一个有组织的 workspace 中。所以,你不需要在标签页或工具之间跳转来完成工作。如果你已经使用 AI,一切都会感觉很熟悉,但它更快、更干净、功能更强大。例如,我可以直接使用顶级的视频模型,包括 Sora 2、VO3.1、Cling01、LTX2 等,都在同一个界面中。例如,让我们选择 VO3.1,然后生成一个低角度跟踪镜头,捕捉一只小狐狸敏捷地穿过森林。狐狸停下来警惕地竖起耳朵。这就是我们得到的结果。或者,让我们尝试 Sora 2 Pro。这次,让我们制作一个关于某人烘烤巧克力蛋糕的视频。这是我们的结果。>> 打鸡蛋[音乐]然后搅拌至顺滑。加入面粉和可可。然后倒入。>> 此外,他们还发布了 Art List Original 1.0 模型。这是他们第一个在 Art List 自有高质量素材上训练的图像模型。它在逼真的专业电影制作方面非常出色。例如,让我们拍摄一张蜜蜂在明亮的向日葵上采集花蜜的微距照片。这是我们的结果。看看它有多逼真。Art List 是创作者的终极资源,而这仅仅是开始。Art List 在 2026 年将会有更多内容。敬请期待。立即通过下面的描述中的链接进行尝试。本周,我们还有一个新的最先进的文本转语音生成器。这是阿里巴巴的产品,叫做 Quen 3TS,它非常强大且灵活。你只需几秒钟的语音就可以克隆任何人的声音,让他们说出任何话。例如,这是参考语音。>> 各位老乡。我的声音非常地道。非常适合讲一个关于澳大利亚生活的有趣故事。你很快就会成为一个真正的澳大利亚人,伙计。>> 这是生成的结果。没有比在邦迪海滩冲浪更澳大利亚的了,穿着冲浪裤,鼻子上涂着锌。>> 或者你也可以控制情绪。例如,这是文字记录。你可以让他用非常悲伤和哭泣的声音说出来。>> 她说她中午就会到。>> 或者这是一个非常开心的语气。>> 她说她会在中午到。>> 或者这是一个非常愤怒的语气。>> 她说她会在中午到。此外,你甚至可以输入一个提示来从头开始设计你自己的声音。例如,这是一个非常老的老人,声音虚弱而沙哑。>> 我年轻的时候,我们没什么,但我们知道如何让它持续下去。>> 或者这是一个卡通花栗鼠的声音。>> 我年轻的时候,我们没什么,但我们知道如何让它持续下去。>> 我已经做了一个完整的评测视频,所以我不会在这里重复太多。如果你想了解更多并将其安装在你的电脑上,请观看此视频。除了 Quen 3 TTS 之外,我们还有一个极其强大的文本转语音工具,叫做 Lux TTS。它非常轻量级,这意味着你基本上可以在 CPU 上以甚至超过实时速度运行它。所以,这是一个快速演示。>> 包裹将于明天早上送到前门。而且还有一些非常酷的东西。>> Patch,我饿了,想喝血。我想喝点血。拜托,你现在需要离开边缘。请离开它。>> Sesquip 的学者们对伪心理治疗方法的群集进行了研究,这在如此反建制圈子中很少见。>> 现在,如果你看看他们的 hugging face 仓库,请注意,所有东西的总大小只有 1.18 GB 左右。所以,这里说你可以达到实时速度的 250 倍,基本上这意味着它在单个 GPU 上是真正的实时,你甚至可以在 CPU 上实现实时。此外,他们还发布了一个免费的 hugging face 空间供你在网上尝试。所以,让我们点击进去,然后粘贴一个相当棘手的文字记录,其中包含相同的词但发音不同,就像这里和这里。然后在这里输入参考音频。所以,让我们输入一段特朗普的剪辑。让我先播放原始参考剪辑。>> 现在,我也必须看到,因为跳舞需要两个人,我一直这么说。>> 然后随意调整所有设置,但我将保留默认设置。然后点击生成语音。好的。这是我得到的结果。>> 唱片制作人拒绝录制乐队的新单曲。风太大,无法将风筝线缠绕在卷轴上。>> 而且它相当不错。现在,我说它听起来不像特朗普。我认为 Quen 3TS 或其他最先进的工具,如 Vibe Voice、Index TTS,它们都能更好地克隆声音,但它非常轻量级。再说一遍,它只有一千兆字节大小。所以,这就是 Lux DTS 的优势。总之,如果你有兴趣尝试一下,这里有所有关于如何安装和在本地运行它的说明。如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。我们还没有说完语音。所以,本周我们还有一个非常实用的语音模型,这次是来自微软。它叫做 Vibe Voice ASR。这基本上是文本转语音的相反。所以,这是用于将音频转换为文本,或者基本上是转录。这里他们发布了一个免费的界面供你尝试。所以,让我们尝试一个快速的例子。这里是我上传音频剪辑的地方,或者我可以在这里录制一些音频。让我拖入一个快速的音频文件。这是来自赞助商集成的内容。让我先播放几秒钟。说到 AI 工具,你一定要看看 Art List,本视频的赞助商。Art List 是视频创作者的终极平台。等等,等等。这几乎有 2 分钟长。然后你可以在这里添加一些自定义上下文以获得更好的识别效果,但我将将其留空。我将保留所有设置不变,然后点击转录。让我们看看会得到什么。现在,这非常快。正如你所看到的,在 6 秒内,它已经完成了整个内容的转录。这比 OpenAI 的 Whisper 等其他开源转录工具快得多。最棒的是,它正确地识别了很多复杂的名称。例如,Art List,然后是 Sora 2。它未能识别 VO 3.1,但非常接近。但它确实识别了 Cling 和 LTX2。现在,因为它在 VO3.1 上犯了错误,我反而可以做的是在这里添加这些自定义术语。例如,我可以添加 VO3.1,或者如果我想将 Cling 拼写成大写字母,我可以这样做,这样它就知道在遇到这些词时如何拼写。现在,这里有一些额外的规格。它最多接受 60 分钟的连续音频输入。所以,你可以插入,你知道,一个完整的长播客来一次性转录。它还具有跨越整个小时的稳定的说话人跟踪和语义连贯性。回到我上面的例子文字记录,打鸡蛋然后搅拌至顺滑等等。这确实来自另一位说话人。所以,这里它正确地识别出这是说话人 1,而不是说话人 0,也就是我。非常令人印象深刻。现在,这里有一些基准分数供你参考。在错误率方面,Vibe Voice ASR 的错误率是迄今为止最低的,即使与那些大得多的最先进模型相比。这里有一些其他的错误率。而且,在所有方面,Vibe Voice ASR 的错误最少。另外请注意,它支持超过 100 种语言。所以,让我点击这个链接向你展示它支持的所有语言。所有这些语言都包含在其训练数据中。非常酷。所以,特别是如果你想转录一些使用这些较少见的语言的音频,那么 Vibe Voice ASR 目前是你使用的最佳免费选择。最棒的是,他们已经发布了所有东西。所以,如果你点击这个 GitHub 仓库,它包含了所有关于如何在本地下载和运行它的说明。很酷的是,他们甚至发布了代码来微调 LoRA。总之,如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,这个 AI 非常酷。它叫做 Franken Motion,它可以根据文本提示生成人类动作,如行走、投掷或坐下。正如你在本例中看到的,你可以将多个动作串联起来。例如,这里有一个人走,然后转身,然后坐在椅子上,然后站起来,然后再次行走。但它能够非常逼真地生成这个。并且它可以生成该人物的姿势骨架。此外,它还可以控制个体身体部位,如手臂、腿、骨盆,以创造逼真的动作。这是另一个复杂的例子,一个人前后倾斜,同时将手放在脸上。然后他们跪下系左鞋。然后他们站起来,然后双手捧住嘴,同时左右转动。而且它实际上能够很好地处理这个问题。这些是非常棘手的提示,你知道,普通的视频生成器无法很好地捕捉到。或者这里是另一个例子,提示是这个人从 T 姿势开始,然后放下手臂,原地站立,用右手抓住物品,传给左手,放在桌子上,然后再次举起手臂回到 T 姿势。事实上,它能够非常准确地生成这个。这是另一个相当复杂的例子,正如你在上面的提示中看到的,但它能够很好地渲染出来。再次注意,它能够将这些连续的动作分解为单独的动作,如你在底部栏中看到的,以及身体的各个部分。现在,如果你将其与其他类似工具,如 Unioion、Dart Control 或 STMC 进行比较,你会发现 Franken Motion 平均来说表现更逼真。这里有一些其他例子供你参考。虽然这些生成本身可能不算什么,但它们对于人形机器人的训练数据以及视频生成器学习如何创造更逼真的动作可能非常有价值。现在,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说他们将发布完整的代码加上预训练模型和整个数据集,这太棒了。目前,如果你有兴趣进一步阅读或查看更多示例,我会在下面的描述中提供此主页的链接。接下来,这个 AI 非常疯狂。它叫做 Flow Act R1,它可以生成人们说话的流式和无限长度的视频。你甚至可以在实时以稳定的 25 帧/秒和 480p 分辨率生成,启动延迟仅为 1.5 秒左右。所以,你只需要输入一些音频。这可以是你自己实时说话的声音。此外,你会输入角色的参考图像和背景。然后你还可以添加一个可选的文本提示来进一步约束它。但之后,你就能得到一个非常逼真的人说话的实时视频。这里有一些例子。[音乐]Fore![音乐]Foreign![音乐]>> [抽鼻子]>> 所以,正如你所看到的,所有这些看起来都非常逼真。要分辨出这些视频是 AI 生成的越来越难了。真正酷的是,它不仅仅是一个说话的头,对吧?它实际上能够生成一些非常自然和富有表现力的行为,比如有时他们会转动头部,有时他们会移动双手等等,这使得它非常逼真。[音乐]>> 你可以看到这个女孩在梳头。她好像在看着屏幕。我的意思是,与你可能熟悉的以前的 AI 说话视频相比,一切看起来都更加逼真和人性化。这里有一些其他的疯狂演示。>> 确切地发生了什么,以及在临床监督中需要做什么。>> 所以,对于一些只做临床监督但不做第二部分行政监督的人来说,临床监督员倾向于将自己定义为我们在人员配备案件。我们在看反移情和移情。我们在看自我治疗师的工作。就像我们正在做我们大多数监督员喜欢做的事情的核心,那就是临床部分,告诉我关于你的客户以及你对他们的感受和你正在做的工作。>> 比美国更温和的版本,你是怎么发现的?>> 是的。所以,我们,对于那个特定的活动,它在美国表现非常好。同样的优惠,同样的定位类型。然后我们采用了同样的脚本。>> 而且它不只是适用于人类。所以,这里有一些不同艺术风格的例子。这是关键。如果你将这个新的 Flowact R1 的胜率与其他竞争对手,如 Cling Avatar、Live Avatar 或 Omnihuman 1.5(我之前在我的频道上介绍过)进行比较,你会发现,尤其是在参考图像中输入多个角色时,Flowact R1 获胜的次数最多。我的意思是,从定性上讲,仅从这些演示来看,它似乎非常逼真。所以,这里有一些比较供你参考。Flow Act 是第二列。正如你所看到的,这个家伙的动作更加逼真,就像一个真正的直播主。你知道,其他工具也不错,但正如你所看到的,对于 Live Avatar,他的脸部表情有点变化。然后对于 Omni 1.5,它无法真正做长时间的视频。Cling Avatar 2.0 其实很棒,但他并不真正移动。他只是保持在一个位置,所以不够自然。而你可以看到对于 Flowact R1,这个家伙到处都在动。他挥舞着双手和手指。这看起来自然多了。现在,如果你滚动到页面顶部,目前他们只发布了一份技术报告。这是相当具有开创性的,所以没有迹象表明他们是否会实际开源它,但总之,如果你有兴趣进一步阅读或查看更多演示,我会在下面的描述中提供此主页的链接。本周,我们还有一个新的开源视频生成器。它叫做 Linum V2。真正疯狂的是,它不是由某个拥有大量资金或大量 GPU 的大型 AI 公司制作的。它只是由一对兄弟团队制作的,据称他们从头开始完全训练了这个模型,从文本到视频开始。现在这里有一些样本生成供你参考。你可以看到它的质量不如目前领先的开源视频生成器,如 1 2.2 或 LTX2(它内置了音频)。它的局限性在于它只能生成 2 到 5 秒的片段。而对于 1 2.2 2,我们已经有了 Stable Video Infinity,它可以生成更长的片段。对于 LTX2,它也可以生成长达 20 秒甚至更长的片段。但尽管如此,考虑到它只是一个从头开始训练的两人团队,这仍然非常令人印象深刻。所以,这里有一些额外的规格。这是一个 20 亿参数的文本到视频模型。所以它只能做文本到视频。它还不能做图像到视频或其他功能。他们发布了两个不同的版本。一个可以生成 720p,另一个可以生成 360p。如果我点击这个 7201,即使它有 20 亿参数,它仍然相当大,总大小为 18 GB。总之,在这些 hugging face 仓库中,包含了所有关于如何在本地下载和运行它的说明。如果你有兴趣查看更多演示或阅读他们的故事,我会在下面的描述中提供此主页的链接。接下来,这个 AI 也非常迷人。它叫做 Motion 3 to 4。它基本上可以从视频中提取一个角色,并将它们变成 4D。换句话说,3D 视频。例如,假设我们有一个关于拳击仓鼠的视频。那么我们可以像这样将这个角色变成 4D。它基本上是一个 3D 场景,但第四个维度是时间。或者这里是另一个跳舞熊猫的例子。现在,除了虚构角色之外,它还可以接收一个真实视频,分割出其中的角色,并将其生成为 3D。正如你在本例中看到的,或者这里是另一个供你参考的例子。现在,它并不完美。在这个例子中,分割和兔子的脸部存在一些错误。它还可以将一个 4D 场景的运动转移到另一个对象上。例如,如果源在左边,那么我们可以像这样将这个运动转移到这只鸡或这只恐龙上。总之,如果你滚动到页面顶部,最棒的是他们已经发布了代码。如果你向下滚动一点,这里包含了所有关于如何在本地下载和运行它的说明。此外,他们还发布了训练代码,以及如何评估它的代码。总之,如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。本周,我们还有一个新的最先进的视觉模型,叫做 Step 3 VL10B。这基本上是一个具有视觉能力的语言模型,这意味着它可以分析图像甚至潜在的视频。这里有一些令人印象深刻的用例。你可以给它这张图片,让它生成“step fun”的摩尔斯电码,它会思考过程并给出最终答案。所以,这是“step fun”的摩尔斯电码。或者你也可以输入这个截图。它相当复杂,有侧边栏、大量代码以及这个图表。然后问它学生打开了多少个章节文本文件,它实际上正在分析截图并计算文本文件的数量,这里它给出了最终答案,确实是五个。它在图表推理方面也相当出色。所以,这里有一个相当复杂的图表,然后你可以问它有多少条边的长度最短,所以它正在分析图像并推理所有内容,并给你答案是四个,这确实是正确的。如果你将 Stefun VL 与其他更大的最先进模型进行比较,我不确定为什么他们仍然使用 Gemini 2.5 而不是 Gemini 3。但总之,你可以看到 Stefun 要小得多,只有 100 亿参数,而其他模型则有数百亿参数。但正如你所看到的,平均分数与这些更大的模型相当。这里有一些其他基准分数供你参考。而且,这个只有 100 亿参数的微小模型在性能上与市场上旗舰模型相当。这里有一些关于科学、多模态推理、识别和通用视觉问题、计数、2D 和 3D 空间理解的其他分数。基本上,平均而言,它要么得分最高,要么与市场上最先进的大型模型非常接近。最棒的是,它是开源的。所以,如果你点击这个 GitHub 仓库,它包含了所有关于如何在本地下载和运行它的说明。你知道,对于市场上最先进的视觉模型来说,这实际上相当小。它只有 100 亿参数。如果我点击 hugging face 仓库,所有东西的总大小只有 20 GB。所以,你甚至可以用 4090 来运行它。总之,如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。本周,Nvidia 还发布了一个非常有趣的 AI,叫做 Motive。它有助于提高 AI 视频的质量,通过找出训练数据中哪些部分对于创建逼真的视频运动最重要。例如,如果你想生成一个泡沫立方体漂浮在水面上的视频,这对 AI 生成器来说是一个非常棘手的物理运动,需要正确处理。所以在训练数据中,它的工作方式是有一个叫做 I 的分数,并将其应用于相关的剪辑。例如,与水有关的东西或漂浮在水中的东西。基本上,这里有一些运动相似度高的剪辑示例。相比之下,它也有完全不相关的剪辑,或者它们有负面影响。所以,你可以看到所有这些剪辑都完全不相关,或者它们会损害对泡沫立方体如何漂浮在水面上的理解。这里是另一个例子。如果目标是理解一个橙子如何在台面上滚动,这里是它从训练数据中选择的所有最重要或相关的视频。然后相反,这里是所有具有负面影响或具有冲突动力学的剪辑。基本上,他们发现的是,如果在训练期间添加这个 Motive 框架来选择性地选择剪辑来训练 AI 进行某些棘手的动作,那么它实际上可以将生成的视频质量提高 8%。对于所有这些基准,如背景一致性、运动平滑度、动态程度、美学质量,它的表现都优于基础模型或简单的微调。它与基础模型相比也有 74% 的胜率。现在,如果你滚动到页面顶部,他们已经发布了一篇技术论文,他们说代码即将发布,这太棒了。目前,如果你有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。这总结了本周 AI 的所有亮点。在评论中告诉我你对这一切的看法。你最喜欢哪个新闻?你最期待尝试哪个工具?一如既往,我会密切关注顶级 AI 新闻和工具与你分享。所以,如果你喜欢这个视频,请记住点赞、分享、订阅,并继续关注更多内容。此外,AI 世界每周都有太多事情发生。我不可能在我的 YouTube 频道上涵盖所有内容。所以,要想真正跟上 AI 的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。感谢观看,下次再见。