📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

AI tutor agents, omnimodal video models, LTX-2 updates, long-term memory, video faceswap: AI NEWS

AI Search35:41

Transcription

人工智能从不休眠,而本周简直是疯狂的。我们有一个新的开源视频生成器,它是多模态的。因此,除了纯文本提示之外,您还可以输入参考图像或视频作为输入。这个人工智能可以从任何视频创建 3D 渲染。因此,您可以从任何角度查看场景,甚至可以冻结视频的任何帧以获得像这样的子弹时间效果。我们有一个新的开源视频生成器,内置了音频。所以,它就像 VO 或 Sora 一样,但您可以在本地计算机上运行它,而且速度非常快。我们有一个新的开源辅导代理。这可以主动帮助您学习,并为您提供个性化的练习题和练习。我们有一个新的视频换脸器,它是最先进的。该系统允许人工智能代理拥有长期记忆,而无需填充其上下文。它比其他方法更快,甚至更准确。这个人工智能可以估计图像的深度,但请注意,它甚至可以在 8K 或 16K 分辨率下做到这一点。我们有一些令人难以置信的类人机器人演示,以及更多内容。所以,让我们直接开始吧。首先,这个人工智能非常有用。它叫做 Dream IDV,基本上可以替换视频中的人脸。所以,这里有一个例子,这是原始视频,这是参考人脸。您基本上可以像这样替换她的脸。或者这是另一个例子。正如您所见,它也能捕捉到所有的面部动作,包括她眨眼的时候,或者唇语同步和她的表情都相当准确。这里是另一个例子。而且它不一定只适用于写实照片。您甚至可以用像这样的 3D 动画来做。或者这是另一个例子。而且这不一定只适用于横向视频。所以这里有一些不同纵横比的垂直视频供您参考。总之,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果您向下滚动一点,他们已经发布了如何在本地计算机上下载和运行它的说明。请注意,这使用了 one 2.1,它需要最少 8GB 的 VRAM 才能在您的计算机上运行,并进行一些卸载。而好的地方是,它似乎已经集成到 Comfy UI 中了。总之,如果您有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,Clling 的团队发布了一个非常强大的模型。它叫做 Uni Video,这是一个多模态统一模型,可以按照您想要的方式生成和编辑视频。所以,这里有一些例子。您可以添加不同角色的参考照片,并提示它们出现在同一个视频中,就像这样。所以您可以轻松地从一张照片中将某人转移到视频中。这里是另一个例子,您可以添加 Sam Ultim 加上这个皮卡丘加上这个冰淇淋。通过这个文本提示,您得到的是这个。虽然质量不是很好,但正如您所见,它在将角色和其他参考对象转移到您的视频中方面实际上做得非常好。这里是另一个例子,您可以上传角色在不同视角下的多张照片,以提供更多数据,它能够生成一个非常一致的悟空在超市里行走的视频。或者这是另一个例子,这个是特斯拉 Cybertruck,另一个例子是这个乐高坦克。真正酷的是,您可以直接在参考图像中添加说明。所以这只是一张输入图像,包含这三样东西加上一些说明。事实上,它会让炸弹在背景中爆炸,加上汽车的移动,加上汽车上的大猩猩。或者这里是另一个例子,这仍然只是一张照片,但您可以添加文本说明。这次是按顺序进行的。所以我们首先有一个动态的低角度跟踪镜头,然后是一辆汽车从爆炸中冲出。然后我们有一个隧道打开到一个沿海城市,汽车飞驰而去。这是您得到的结果。或者这里是另一个非常酷的例子,我们可以先有这个场景,然后它向上倾斜以显示猴子爬上绳子,然后是这架直升机,这就是它生成的内容。这里是另一个例子,我们可以把说明添加到这张图片的所有地方,它能够理解并相当好地生成大部分内容。现在,除了输入参考图像之外,您还可以输入参考视频,正如您在这里看到的,并提示它替换,例如,用鱼替换这把吉他。这是您得到的结果。或者这里是另一个例子,我们可以提示它用超人替换原始视频中的蜘蛛侠。或者这里是另一个例子,我们可以轻松地进行角色交换。或者我们可以选择让这个女孩戴上这个帽子,或者让这个女孩拿着这个毛绒玩具。现在,您甚至不需要输入任何参考照片。您可以直接提示您想要编辑的内容。如果您想在背景中添加巨大的火焰,这是您得到的结果。或者您可以更改这个角色的服装。或者您可以像这样将场景变成秋天。最棒的是,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果您点击进去,然后向下滚动一点,它包含了如何在本地计算机上下载和运行它的所有说明。他们没有明确提到 VRAM 要求。您确实需要一个 CUDA GPU,但似乎如果您点击 hugging face 仓库,总大小约为 95GB。所以我认为现在没有人可以在本地运行它。例如,如果我点击这个,请注意多模态模型约为 42GB,然后这个模型是 27GB。然而,因为这是开源的,希望将来会有更多量化或压缩版本可以在消费级 GPU 上运行。总之,所有链接都在这里。所以,如果您有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,这个项目非常有趣,并且在 GitHub 上获得了大量的星标。所以,它叫做 SimpleM,这基本上是一个更智能的 AI 代理记忆系统,可以让他们长期记住东西,而无需将大量的文本重新塞回模型中。所以,这就是为什么它很重要。当前的 AI 记忆系统要么忘记太多,要么通过重新加载大量旧内容到您的上下文中浪费大量 token。但是,SimpleM 能够保持记忆量小,同时提高准确性并加快检索速度。所以,它是如何工作的。它基本上分三个简单步骤。第一步是压缩含义。换句话说,它将您的对话转化为更清晰的事实,并去除噪音。它对一切进行规范化。它基本上保持含义不变,但使其短得多。然后它进入第二阶段,称为结构化索引,它基本上可以更有效地组织记忆。这些事实以多种方式进行索引,例如语义含义、关键词或元数据,以便在需要时可以轻松找到正确的信息。然后最后是第三阶段,自适应检索。这基本上意味着它只会检索所需的内容。当提出问题时,SimpleM 会对其进行分析,并仅从中检索所需内容,而不是全部。因此,这使其效率大大提高。所以,这是 SimpleM 和另一个基线方法之间的比较。正如您所看到的,SimpleM 在准确性方面要高得多。此外,它使用的 token 更少。此外,它检索信息的速度也更快。这里是另一个图表,供您参考,比较了所有这些带有记忆的代理。正如您在这里看到的,SimpleM 使用的 token 最少,但也是性能最好的。这里是 SimpleM 和其他记忆系统之间的一些其他定量比较。正如您所看到的,SimpleM 运行速度最快。此外,它的质量最高。所以,总结一下,SimpleM 基本上是一个框架,通过存储更少、更智能的记忆来帮助 AI 代理更好地记住,并且它只回忆它实际需要的内容。最棒的是,他们已经发布了所有东西。所以,如果您点击这个 GitHub 仓库并向下滚动一点,它包含了如何在本地计算机上下载和运行它的所有说明。此外,他们还提供了运行您自己的基准测试和重现论文结果的代码。总之,链接在这里。所以,如果您有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,我们有另一个非常有用的 AI,叫做 Dream Style。这是一个 AI,可以接受现有的视频并改变其风格。所以,这里有一些他们的例子。您可以将视频变成乐高风格、线条艺术、动漫、像素风格,或者变成黏土风格,或者像这样变成传统的中国画风格等等。所以,这里有一个例子,输入视频在左上角。如果您提示将其变成这种折纸风格,这里是与其他主流闭源模型(包括 Luma、Pixverse 和 Runway)的比较。然后这里是 Dream Style。正如您所看到的,Dream Style 实际上做得最好。它还将背景中的花草转换成了折纸。或者这里是另一个例子,提示是将左侧的原始视频变成彩色铅笔插画。对于其他竞争对手 Luma、Pix 和 Runway,它们看起来并不像您所说的彩色铅笔插画。Dream Style 是唯一一个真正符合提示的。现在,除了输入文本提示之外,您还可以上传参考图像来指定您的风格。所以,输入视频在左下角,是海龟。如果您输入这张低多边形图像,它就能很好地转移风格。或者这里是另一个例子,我们可以输入这张 Minecraft 场景的参考图像,并将原始输入视频变成像 Minecraft 一样的视频。这里是与 vase 和 video X fun 的另一个比较,我之前在我的频道上介绍过。而这个新的 Dream Style,在风格转移方面做得更好。现在,除了使用提示或参考图像之外,您还可以同时使用两者。所以,这里,如果我们上传这张像素图像,加上提示生成水彩风格,它可以做到两者兼顾。所以它将这个视频变成了像素化的水彩风格。或者这里是另一个类似的例子,我们可以输入这张乐高参考图像,加上提示生成金属风格。这是您得到的结果。这里是另一个很酷的例子,我们可以将其转换成这种 3D 皮克斯风格,但如果您提示低多边形,它也会将其添加到结果中。现在,如果您滚动到页面顶部,他们已经发布了此的 GitHub 仓库。目前,他们发布了一份技术报告,但在他们的待办事项列表中,他们计划发布推理代码和模型以及训练代码,这太棒了。总之,目前,如果您有兴趣进一步阅读或查看更多示例,我会在下面的描述中提供此主项目页面的链接。接下来,这个 AI 非常有用。我一直在等待像这样的开源东西。您看,使用像 ChatGPT 这样的常规聊天机器人学习东西的问题是,是的,它非常擅长回答您的问题,但它也就仅此而已。除非我问它进一步的问题,否则它不会主动教我更多东西。但现在我们有了这个新的开源 AI 代理 Deeptutor,它可以帮助我学习更复杂的主题并主动教我更多东西。所以,它叫做 Deeptutor。这基本上是一个 AI 导师代理。这是它的作用。您可以上传所有教科书、论文、讲义、文档等。它能够理解您的材料并直接引用您的材料来回答您的问题。它还可以通过视觉方式解释事物。所以,它可以分步分解难懂的概念,使用图表、交互式页面或简化解释。它还可以通过生成根据您的技能水平量身定制的测验或练习来帮助您练习。最后,它还支持深度研究。所以,它不仅可以搜索您的文档,还可以搜索网络和其他论文,以查找和综合信息并生成新想法。所以,您可以看到,您可以将您的文档上传到它的知识库,然后向它提问,它能够直接从该知识库中回答。在这里,您可以看到他们还有一个问题生成器选项卡,您可以在其中根据您的知识库生成练习题或练习。然后这里它可以像这样进行深度研究。所以,您可以将其视为类似 notebook LM,但它是开源的。最棒的是,他们已经发布了所有东西。所以,这里是如何下载并将其设置在您的计算机上的所有说明。文档非常详尽。它教您如何使用所有这些不同的模块来满足您的任何用例。一切都在这个页面上。所以,如果您有兴趣进一步阅读,我会在下面的描述中提供链接。接下来,这个 AI 也非常强大。它叫做 Neoverse,基本上可以创建 4D 世界模型。那么,这到底是什么呢?基本上就是 3D 视频。第四个维度是时间。这里有一些例子。您可以拍摄一张输入图像,AI 会创建一个该模型的高斯散点图。基本上就像对场景的 3D 估计,然后之后它可以生成一个您可以与之交互的视频。所以您可以按箭头键在房间里移动。或者这里是另一个例子,我们可以再次拍摄这张图像,它会首先生成场景的 3D 高斯散点图,然后从中生成一个场景视频,您可以在其中移动。因为它可以创建 4D 场景,这意味着您可以输入一个视频,让它在视频播放时估计整个场景的 3D 模型,然后之后您可以将摄像机控制到任何您想要的位置。所以,例如,您可以让它向上、向左、向右平移,或者旋转、倾斜或做任何事情。您基本上可以改变现有视频的摄像机视角和运动。然后这里是另一个例子,您可以生成像这样的子弹时间视频,您可以像这样在任何特定帧冻结视频。并且因为它已经以 3D 方式生成了它,然后您就可以在 3D 中移动场景并生成这种子弹时间效果。结果实际上非常连贯。这还不是它能做的全部。它还具有内置的视频编辑功能。所以,例如,您可以将这个白卡变成红色,或者像这样将这个水壶变成玻璃。这里有一个更疯狂的例子,我们可以只用一个行车记录仪视频,然后通过这个 AI 生成四个新的侧视图。至少对我来说,我不会在开车时信任这些新颖的视图视频。我的意思是,我不确定这些视频有多准确,但这可能是这个 AI 的一个有用应用。最棒的是这个 AI 实际上非常快,所以您实际上可以在不到 30 秒的时间内生成结果,至少在一台 A800 GPU 上。总之,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库,但没有迹象表明他们是否会开源。目前,如果您有兴趣,可以查看这份技术论文,以及此页面上的更多演示,我会在下面的描述中提供链接。在我的频道上,我介绍了许多不同的 AI 模型和工具,可能会让人不知所措。如果您可以在一个平台上使用所有这些模型怎么办?这就引出了 Abacus AI 的 Chat LLM,这是本视频的赞助商。Chat LLM 是一个一站式平台,供您使用最好的 AI 模型。您可以在聊天中无缝切换不同的模型。此外,您还可以使用所有顶级的图像生成器以及顶级的视频模型,所有这些都在一个集成平台中,而且一旦有新模型发布,他们通常会很快将其添加到他们的网站上。此外,如果您正在编写代码,他们有一个非常有用的工件功能,这样您就可以并排预览您的生成内容。此外,他们还有一个深度代理功能,可以自主完成一些非常复杂的任务,例如创建 PowerPoint、网站和研究报告。它将极大地提高您的生产力。最重要的是,您每月只需支付 10 美元即可访问所有这些 AI 模型、图像和视频生成器以及 Deep Agent。这比单独支付每个工具的费用便宜得多。一定要在下面的描述中查看附带 Deep Agent 的 Chat LLM。在类人机器人新闻方面,我们有 Unree 的新演示。这次,他们训练它执行一个令人印象深刻的飞踢,就像这样。请注意,踢腿的高度甚至足以够到那个家伙的脸。但这并没有停止。这里是它进行毁灭性回旋踢的另一个演示,它彻底摧毁了一个西瓜。在这里,它甚至能够踢到重达 60 公斤的拳击沙袋。我的意思是,要让如此沉重的拳击沙袋移动这么多真的很难。就像,这一脚肯定有很大的力量。请注意,这是 Unitere 的旗舰 H2 机器人,而不是您可能在大量病毒视频中看到的可爱 G1 机器人。这款新的 H2 机器人高 180 厘米,重 70 公斤。此外,他们还给了它一个相当令人毛骨悚然的脸。虽然之前的演示显示它跳舞非常自然流畅,但在这里他们展示了它也能够执行像这样的强大动作。您绝对不想和这家伙打架。现在,除了飞踢和摧毁西瓜之外,我们还有另一个同样令人印象深刻的演示。这次来自波士顿动力公司的 Atlas。虽然它不像 Uni Tree 机器人那样极其灵活,但它具有极大的灵活性。头部、躯干以及手臂和腿部几乎有 360° 的运动范围。这意味着它的身体的任何部分都可以朝向一个方向或另一个方向,如果您仔细想想,这实际上非常有用和方便。例如,如果它正在拾取一个物体并需要将其放在它身后的某个位置,它不必像人类一样完全转动身体和脚来面对另一个方向。这个机器人可以只旋转它的躯干或手臂来将物品放在它后面。您知道,对于像 Unitri 或 Optimus 这样的所有其他类人机器人,它们基本上被设计成看起来和功能都像人类。它用两条腿走路。它是面向前方的,并且有两只带有手的胳膊。但如果您仔细想想,没有真正的理由限制机器人设计仅限于人类形态。与其面向前方,为什么不设计一个机器人,让它的躯干和所有肢体都可以向任何方向旋转呢?所以,波士顿动力公司 Atlas 的这种设计展示了机器人如何超越类人限制,变得更有效率或更强大。好的,接下来,这个 AI 非常有趣。它叫做 morph any 3D,基本上可以创建两个不同 3D 对象之间的平滑变形或过渡,即使它们属于非常不同的类别。所以,这是一个简单的例子。例如,输入可以是妙蛙种子,结果可以是妙蛙花。这个 AI 会生成输入和输出之间的过渡或变形。正如您在这里看到的,或者这是另一个例子,我们可以插入一个宝可梦,让它过渡到完全不同的宝可梦,就像这样。它仍然会起作用。这是另一个例子,我们有两个完全不相关的宝可梦,但您仍然可以通过这个 AI 生成从一个宝可梦到另一个宝可梦的平滑过渡。现在,除了宝可梦,这里还有其他角色的例子。同样,过渡非常无缝。即使两个角色完全不相关,它仍然可以生成这些平滑的变形。或者这是另一个例子,我们可以将这个车站变成这个城堡,甚至将这匹马变成一艘船。现在,这通常非常难以做到,因为对象在形状或结构上可能差异很大。很难保持变形在语义上一致,使其看起来自然,并且很难使序列随时间平滑。但 morph any 3D 能够在不训练单独模型的情况下解决这个问题。现在,我们过去也有一些类似的工具,但正如您在这里看到的,Morph any3D,在右下角,是迄今为止生成这些 3D 过渡最一致和最准确的。现在,它是如何工作的。这是架构,它包含几个关键组件,例如变形交叉注意力,它基本上在 3D 生成器的注意力层中混合了源形状和目标形状的特征,以保持连贯的结构。然后它还有一个时间融合自注意力块,它使用来自前一帧的信息来使过渡随时间更平滑。然后最后是方向校正,它基本上对齐两个对象的姿势和方向,以便它们在过渡过程中保持一致。现在,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说代码将在论文被接受后发布。敬请期待。总之,如果您有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,这个 AI 也非常有用。它叫做 Gamu,代表几何感知多视图扩散外绘。它基本上可以根据有限数量的照片创建场景的 3D 模型。例如,您可以输入这些房间的照片,然后通过 Gamu 处理,这是您得到的结果。现在,如果您将其与另一个竞争对手 3DGS 进行比较,那么正如您所看到的,它就像缺少天花板的一部分。质量不如 Gamma 清晰和定义好。或者这是另一个例子,我们可以输入所有这些照片。再次,如果您将其与 3DGS 进行比较,质量就不如这个新的 Gamma 模型好。这里是另一个供您参考的例子。您可以看到,对于 3DGS,它就像缺少天花板和地板的一部分。但对于 Gamu,它能够填补空白并实际生成房间的完整渲染。最棒的是,您还可以使用它来外绘,或者基本上扩展您对 3D 场景的视野。现在,我向您展示的这些是来自另一个竞争对手 MV Gen Master。但如果您将其与这个新的 Gamu 进行比较,请注意它更加一致。这里是另一个例子。区别非常微妙,但 Gamu 比竞争对手更加一致和对齐。尤其是在这个例子中,您可以看到对于 MV Gen Master,生成质量很差,但 Gamu 能够更平滑地生成它。这里是一些户外场景的例子。同样,对于 3DGS,您可以看到它未能填补背景中一些细节的空白,它只是渲染成黑色。但对于 Gamu,它也能够填补这些细节。总之,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果您点击进去,看起来他们已经发布了代码。所以,这是如何安装并在您的计算机上本地运行它的方法。此外,他们还添加了为您准备自己的数据集并进行训练的代码。总之,如果您有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。接下来,这个 AI 非常强大。它叫做 Infinity Depth,这是它的作用。这个 AI 不仅可以预测图像中任何东西的深度,您还可以以任何您想要的任意分辨率进行缩放,甚至像 8K 或 16K,它会生成具有更精细细节的深度图。所以,例如,这是原始图像,这是它预测的深度。但是,正如您所看到的,即使我放大到像这里的电线这样的特定东西,它也能够以非常高的分辨率生成它的深度。同样,这里还有这个桌上足球桌。它不仅可以预测深度图,还可以根据任何照片生成 3D 点云。所以,这里是一张参考照片,这是 3D 点云。或者这是另一个例子。如果这是您的输入图像,这是 3D 点云。现在,因为它只给了一张图像,所以它没有关于图像中不可见的东西的数据。所以您可以看到显示器等细节以及桌子后面是缺失的。所以,这个点云功能不是很好。但这里是另一个非常棒的功能,叫做新视图合成。所以,这里如果我们输入一张像这样的照片,它也可以将其变成一个像这样的 3D 场景,您可以四处走动,甚至放大缩小,或者从上方查看,就像这样。或者这是另一个例子,我们可以拍摄这张有很多汽车和很多交通的繁忙场景,它可以生成一个您可以四处移动的 3D 场景。但老实说,我认为深度图功能是最令人印象深刻的,因为它可以达到 16K 的分辨率,而所有其他竞争对手的深度估计工具都无法生成这种质量。所以,例如,这里是这个新方法 Infinity 与我之前在频道上介绍过的 Migold 或 Moji 2 等其他方法之间的比较。正如您所看到的,这个方法细节更多,分辨率更高。这里是其他一些供您参考的例子。正如您所看到的,这个可以达到 8K 甚至 16K。所以,它比其他深度估计器更清晰。在新的视图合成方面,它也比 Apple 的 Sharp 等其他方法更平滑、更连贯,Sharp 最近受到了很多关注。这是另一个可以在几秒钟内将照片变成 3D 场景的模型。但是,正如您所看到的,质量实际上非常差。到处都有很多孔洞和缝隙。但对于这个 Infinity Depth,道路和细节更加连贯。这里是另一个供您参考的例子。现在,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说他们致力于开源此项目。这不仅包括发布模型和推理代码,还包括如何自己训练和评估它的代码,这太棒了。总之,目前,如果您有兴趣进一步阅读,我会在下面的描述中提供此主页的链接。此外,本周,我们还有一个新的顶级开源视频生成器,它能做所有事情。它叫做 LTX2,它可以生成内置音频的高分辨率视频。此外,它可以生成长达 20 秒的视频,并且仍然保持一致。它最棒的是它真的非常快,即使只是在消费级 GPU 上。即使您使用普通 RAM,它也能正常工作。我现在已经完成了本周的完整安装教程,所以我不会在这里重复太多。然而,自那段视频以来,这里有一些额外的更新。所以,几天后,这个叫做 Ki 的用户发布了一些 GGUFS,它们体积更小。例如,蒸馏 Q4 版本只有 12.7GB。以前的 FP8 版本只能与 Nvidia CUDA GPU 配合使用。但现在有了这些 GGUFS,它们更优化,可以在 AMD 设备或 CPU 上运行。除了这些 GGUFS 之外,我们还有一个更简单的平台供您安装和运行 LTX2,如果您厌倦了使用 Comfy UI 和所有这些节点和面条。我知道很多人在尝试在 Comfy UI 上设置它时遇到了很多不同的错误。所以,如果您无法使其正常工作,那么这里有一个更简单的平台来使用 LTX2,叫做 one to GP。您可以看到,对于他们最新的更新,他们已经将 LTX2 集成到他们的平台中。您可以使用低至 10GB 的 VRAM 来运行它。此外,它支持开始和结束关键帧。您还可以上传音频轨道供其用作生成音频。总之,如果您有兴趣,我会在下面的描述中提供 GGUFS 的仓库以及 one to GP 页面的链接,以便您可以查看。接下来,Clling 的团队公布了另一个非常棒的模型,可以生成图像和视频,还可以编辑现有的图像和视频。所以,这是一个非常灵活的工具。这里有一些例子。所以,这是提示,这是图像。这是另一个提示,这是图像。皮肤看起来有点塑料感,所以它不像最好的开源图像模型那样达到顶峰。但话虽如此,它比仅通过文本提示生成图像要强大得多。所以,这是它还能做什么。除了生成图像,它还可以生成视频。所以,这是一个男人穿着古董潜水头盔,从一个五颜六色的花坛里走出来。这是我们得到的结果。或者这是一个动态的高速列车,从一个熙熙攘攘的火车站飞驰而出,这是结果。或者这是一只灰猫站在办公桌上,挥舞着一条腿,这是我们的结果。现在,这些生成的质量不是很好,但同样,这并不是为了达到最先进的水平。这是一个具有大量内置功能的模型。这是更令人印象深刻的部分。它还可以充当视频编辑器。所以,它可以接受文本提示和参考图像,您可以从中生成视频,就像这样。它有点像视频的 nano banana。这里是另一个例子,您可以让梅西在厨房里切水果,就像这样。或者这是另一个例子,我们可以让杰西卡·阿尔芭在办公室里说话,就像这样。现在,您甚至可以输入多张参考图像,就像这样。例如,我们可以让这个角色穿这件衬衫。或者这是另一个例子。这里我们有 Sam Alman 穿着这件背心在室内做伸展运动。这里是三个不同参考图像的例子,它能够将它们全部组合到这个视频中,就像这样。或者这是另一个例子。现在,而不是参考视频,它也可以像 Nano Banana 一样编辑图像。例如,我们可以向场景中添加一艘小的黑色皮划艇,就像这样。或者将这个男人的西装变成深翡翠丝绸,就像这样。或者我们可以像这样外绘这张图像。或者将这辆车变成柠檬绿。所以,您知道,它也可以像 Nano Ganana 一样作为图像编辑器,您可以用自然语言编辑图像,但它也可以对视频做同样的事情。您可以输入参考视频并让它改变风格,就像这样。或者我们可以将其变成像这样的粘土动画风格,这是我们得到的结果。或者我们可以将这个人的背心变成带有拉链的黑色连衣裙,就像这样。或者我们可以提示它将她的耳环变成这样。所以,它本质上是视频的 nano banana。或者我们可以将其变成吉卜力风格。或者提示将其服装从红色变成蓝色。现在,您可以将所有三种不同类型的媒体,文本提示、图像和视频结合在一起,就像这样。或者这是另一个例子,我们可以提示将这个角色添加到场地中,就像这样。所以,这是一个非常灵活的多模态模型,能够处理不同类型的媒体,并使用同一个统一的模型编辑图像和视频。在这里,您甚至可以拍摄参考视频,然后让它将摄像机运动复制到新视频上。现在,如果您滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说代码和权重将很快发布。敬请期待。目前,如果您有兴趣进一步阅读或查看更多演示,我会在下面的描述中提供此主页的链接。此外,本周,腾讯 Hunyuan 发布了另一个非常强大的模型,叫做 HYMT。这是一个开源翻译模型,它有两个主要版本。有一个 18 亿参数的版本,它更小,所以更高效,但运行速度更快。然后我们有一个 70 亿参数的版本,这个版本稍大,但质量更高。但它们都非常小。就像这些设计是为了快速和准确。您甚至可以在消费级 GPU 或边缘设备上运行它们。这是它与大量其他翻译器(如 Google Translate、BU Translate、Dobau Translate、Microsoft、Quen、Deepseek,甚至 Gemini 3 Pro,后者大数百倍)的准确性比较。但您可以看到,Huyuan MT 1.8,八,这是左边的蓝色条形图,然后是 70 亿参数,这是最右边的橙色条形图。我不确定为什么他们选择将它们分开放在左侧和右侧,但总之,您可以看到它的性能与最先进的模型一样好,在某些情况下,它甚至击败了 Gemini 3 Pro,这对于如此小的开源模型来说真是太疯狂了。它目前支持 33 种语言,如您在此处列表所示,包括几种民族和方言变体。最棒的是,所有东西都已经开源。所以,这里是如何在您的计算机上下载和本地运行它的说明。18 亿参数的小模型甚至可以在只有约 1GB 内存的边缘设备上运行,并提供实时翻译。所以,如果您正在寻找一个可以在离线实时运行的快速翻译模型,这将非常有用。总之,如果您有兴趣进一步阅读,所有信息都在此页面上,我会在下面的描述中提供链接。此外,本周,我们收到了 Google 的一项新更新。他们开始在 Gmail 中引入一些新的 AI 功能。所以,您应该能够在您的 Gmail 仪表板上看到这个 AI 收件箱按钮。它基本上允许您使用 AI 来总结您的收件箱并获得最重要的见解。它还有一个“帮助我写作”按钮,您可以提示它为您写电子邮件。或者您也可以选择任何一行文本,让它根据特定的语气或您想要的任何内容进行重写。它还可以检测是否需要将某项内容安排到您的日历中,并会为您添加一个按钮将其添加到您的日历中。请注意,这些功能目前仅向美国用户以及专业和超级订阅用户提供英语版本,但他们计划在今年晚些时候将这些功能扩展到世界其他地区。这总结了本周 AI 的所有亮点。请在评论中告诉我您对这一切的看法。您最喜欢哪个新闻?您最期待尝试哪个工具?一如既往,我会留意顶级 AI 新闻和工具与您分享。所以,如果您喜欢这个视频,请记住点赞、分享、订阅,并继续关注更多内容。此外,AI 世界每周都有太多事情发生,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上 AI 的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。感谢观看,下次再见。