Transcription
人工智能从不休息,而本周简直是疯狂的。巨头 Deepseek 又带来了另一项令人难以置信的突破。我们有了一个新的顶级开源图像生成器,它在逼真照片和渲染文本方面非常出色。我们还有另一个人工智能,它不仅能像 Nano Banana 一样编辑图像,还能在一个统一的模型中以同样的方式编辑视频。这个人工智能可以实时放大视频。你甚至可以在消费级 GPU 上运行它。我们有一个新的顶级开源 3D 模型生成器。看看它令人难以置信的细节。这个人工智能可以创建交互式 3D 世界,你可以实时探索它们,就像在玩电子游戏一样。这个人工智能可以让你在电脑上离线生成图像,只需 1 到 2 秒,速度大大提升。我们还有另一个人工智能,可以将你的离线视频生成速度提高 100 多倍。这意味着你可以在几秒钟内生成视频。腾讯发布了一个人工智能,可以创建你想要的任何动作的 3D 动画。而且看起来超级逼真。这个人工智能可以获取现有视频,并根据你的意愿更改摄像机角度或运动,还有更多功能。所以,让我们直接开始吧。首先,这可能是我本周最喜欢的人工智能发布。它被称为 Stream Diff VSSR,本质上是一个实时视频放大器。这里有一些例子。假设你有一个非常模糊的视频,就像这样。好吧,将其输入这个人工智能后,这是放大后的版本。所以这个人工智能基本上能够提高视频的质量、细节和清晰度。或者这是另一个相当模糊的视频的例子,但在将其输入这个人工智能后,我们得到了这个。看看一切变得多么清晰锐利。或者这是另一个相当混乱的场景的例子,有大量的物体和人物,但在将其输入这个人工智能后,看看一切变得多么清晰。非常好。或者这是另一个相当混乱的场景的例子。而且摄像机非常抖动。我不知道为什么这个人没有使用稳定器,但无论如何,在将其输入这个人工智能后,你就会得到这个。同样,一切都变得更加清晰和细节丰富。这是另一个例子,你可以将此视频放大四倍。这是你得到的结果。这是另一个复杂设计的例子,在将其输入这个人工智能后。看看细节的改进。而且,它的速度快得离谱。所以,这里有一个在单个 RTX 4090 上的演示,它有 24 GB 的 VRAM。正如你所看到的,底行是这个新的 Stream Diff VSR,它只用了大约 0.3 秒就放大了这个视频。而顶行的常规扩散 VSSR,则需要至少 4600 秒。所以,你知道,这个底部的,这个新的 Stream Diff VSR 本质上是实时的。最棒的是,他们已经发布了代码。所以,这是 GitHub 仓库。如果你向下滚动一点,这里有所有关于如何下载并在你的电脑上运行它的说明。请注意,他们还计划发布训练代码。无论如何,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,我们有一个新的非常详细的 3D 模型生成器。它被称为 UltraShape 1.0,它接收一张图像并能够从中生成一个非常高保真的 3D 模型。这里有一些例子。所以,如果我输入这张宝塔龙的图像,这是生成的 3D 模型。看看细节有多丰富。这是令人难以置信的优质。它甚至可以处理像这样的角色。所以,如果我们输入这张参考照片,这是我们得到的结果。请注意,它能够相当好地处理面部、头发和身体。或者这是另一个角色的例子。它也能生成高质量的模型。如果我们输入这张图像,这是结果。同样,一个非常详细和准确的渲染。或者这里有一些其他例子供你参考。现在,如果你将 UltraShape 1.0 与其他领先的开源竞争对手进行比较,比如我几周前介绍过的 Trellis 2,你会注意到这个新的 UltraShape 甚至更好。所以,这里有一些供你参考的比较。这个美人鱼的例子特别棘手。这是我们从 Trellis 2 生成的。但正如你所看到的,Ultra Shape 甚至更好。然后这里有更多供你参考的比较。现在,需要注意的是,它只能生成 3D 形状。它不能生成模型的纹理或颜色。而像 Trellis 2 这样的其他工具也可以生成表面或纹理。无论如何,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果你向下滚动一点,这里包含了所有关于如何下载并在本地计算机上运行它的说明。此外,他们甚至提供了准备数据和训练模型的代码。无论如何,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能非常酷。它被称为 Ume 1.5。它允许你仅从一张图像或文本提示中创建可探索的交互式 3D 世界。你甚至可以对其进行调整,使其实时运行。所以,这里有各种各样的例子供你参考,展示了许多不同的场景。正如你所看到的,这些是可探索的 3D 世界,所以你可以使用 WD 或箭头键来移动。这里有一些仅用文本提示生成的其他例子。正如你所看到的,你甚至可以提示它生成像一个女人走在街上的角色。或者你可以将其设置为第一人称。你还可以进一步提示它添加效果、事件或其他内容,正如你在这里看到的。所以,这里是 Ume 1.5 的一些核心功能。它使用所谓的掩码视频扩散变换器逐帧生成视频,以便在你探索时世界看起来是连续的。这比普通的视频模型效率高得多。你甚至可以添加加速方法,比如双向注意力蒸馏和自强制,以可能实现实时运行。正如我之前展示的,这也可以让你仅通过文本提示注入某些事件、效果或角色。Umeate 的前一个版本,我几个月前介绍过,没有这个功能。最棒的是,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。如果你向下滚动到这里,它包含了所有关于如何下载并在本地计算机上运行它的说明。事实上,他们甚至提供了 Windows 的一键安装程序,这很棒,因为如果你一直关注我的频道,你会知道开源的东西通常需要大量的步骤,而且安装起来非常麻烦。这里说他们在只有 16 GB VRAM 的笔记本电脑 GPU 上成功运行了它。所以,这是他们的推荐最低要求。此外,他们还发布了准备数据和训练模型的代码,如果你对它的工作原理感到好奇。无论如何,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。此外,本周,巨头 DeepSeek 又回来了,带来了另一个重磅产品。所以,他们发布了一篇新论文,名为 MHC,流形约束超连接。这到底是什么意思?现在,如果你甚至只读摘要或第一张图,这会非常复杂和技术化。所以,让我们将其分解成简单的术语。标准 Transformer 模型看起来是这样的。或者你也可以使用任何其他神经网络。但基本上,你可以将其视为一个模型,信息或数据从一端开始,然后逐层逐层地流过,直到到达末端。将其想象成数据流动的公路。现在,一旦人工智能模型变得非常深,有很多层,信号在通过数百层时很容易丢失或变得模糊。所以研究人员使用一种称为残差连接的智能技术,它看起来像这样,或者像这里,它本质上是一个快捷方式,可以让原始信息跳过一些层,然后重新合并到后面的层中。这样可以确保模型不会忘记原始输入。所以,这就是他们所说的残差连接。它只是一个快捷方式,允许一些早期数据绕过一些层,然后重新合并到后面的层中。现在,你可以将其视为一条单车道公路。但最近,出现了一个名为超连接的新想法,它基本上将这条单车道公路变成了一条巨大的多车道超级公路,可以传输更多信息。但虽然这使得模型更智能,但也造成了相当混乱的局面。正如你在这里看到的,车道会随机合并和分裂,信号经常变得非常不稳定,这可能导致整个训练过程崩溃。为了解决这些超连接带来的混乱,DeepC 创建了一种名为流形约束超连接的新方法。你可以想象,如果这条多车道超级公路还有一个严格的能量守恒定律。换句话说,每次车道合并或交换信息时,都会有一个总体的数学规则来确保信号的总量保持不变。具体来说,他们使用了所谓的流形约束来强制这些连接保持稳定。你可以将其想象成这条公路上的交通管制员,防止任何一条车道被占用或信号消失。这样即使模型变得非常大,训练也能保持稳定。现在,因为这条超级公路一次跨越所有这些不同的车道传输大量数据,所以它也需要更多的计算。所以,为了节省内存并提高效率,他们还使用了一种非常聪明的重新计算技巧,他们删除一些数据以节省空间。然后,当需要时,他们会快速重新计算它。至少你可以这样理解。但最终,你得到的是一个性能更高但效率也很高的模型架构。如果你看看这些基准分数,你会注意到这种带有流形约束超连接的新方法平均来说优于只有超连接的模型和只有基本残差连接的模型。好了,这总结了这篇论文。就像我说的,这篇论文非常密集和技术化,但这基本上是它的一个高层总结。如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能非常有用。它被称为 Spot Edit,它允许你通过仅选择要更改的图像部分来编辑图像,而不是重新制作整个图像。这使得编辑过程更快、更有效。例如,让我们来看这张狗的图像。你可以提示它将足球变成向日葵,它只会编辑这部分来替换足球,而不会触及图像中的其他像素。或者在这里,例如,如果你有这张风景照片并想添加一个人,它只会编辑图像的这部分来添加一个人,而不会影响其他像素。如果你使用过其他图像编辑器,包括 Nano Banana Pro 或 GPT Image 1.5 或 Quinn ImageEdit,你不能只是选择性地告诉它编辑图像的某个部分。它仍然需要重新生成整个图像。而且通常你会在图像的其他部分看到一些轻微的不一致。但有了这种方法,因为它只是选择性地编辑图像的某些像素,所以它能够更加一致。所以,这里有一些其他例子供你参考。你可以看到,编辑后的图像中没有改变其他细节,包括这里的盘子,以及这里的水印,因为我们只编辑了这里的像素。这里有一些其他例子供参考。你可以给这只猫添加一顶帽子和一条围巾,它只会编辑这些像素。或者你可以在这里添加一个人,它只会编辑这部分。你也可以选择扩展图像,这是编辑后的部分。或者你可以让它改变姿势,它只会编辑这些部分。这里有一些额外的例子。这是它的架构。它由两个主要组件组成。有一个点选择器组件和一个点融合组件。点选择器基本上识别图像中需要更改和不需要更改的部分。然后点融合负责将更改的部分与未更改的其余图像融合。最棒的是,在页面顶部,他们已经发布了一个 GitHub 仓库。如果你向下滚动一点,这里包含了所有关于如何在你的电脑上设置它的说明。请注意,他们已经添加了对 Flux Context 和 Quinn ImageEdit 的支持。所以,就 VRAM 要求而言,你基本上需要 Flux Context 或 Quinn ImageEdit 所需的最低要求,供你参考,它已经有 GGUFS 可以运行在低至 8 GB 的 VRAM 上。无论如何,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,Tencent Hunyen 继续发布一些非常酷的东西。所以,本周他们刚刚发布了 HY Motion 1.0 O,这是一个 10 亿参数的文本到运动模型。它专门用于帮助你生成角色执行特定动作的 3D 动画。例如,如果我们让一个人坐在椅子上,这是我们得到的结果。或者这是一个向前奔跑的人。或者这是一个双腿同时向上跳跃的人。你可以看到所有这些 3D 模型动作都非常自然。或者这是一个双手叉腰做弓步拉伸的人。而且相当准确。这是一个更复杂的例子,一个人向前走,同时摆动手臂和腿,同时左右看。正如你所看到的,它实际上做得相当好。它完全遵循提示。现在,酷的地方在于,你甚至可以让这个角色持有和操纵道具。例如,你可以让他在右手持盾,左手持剑进行攻击。这是你得到的结果。或者在这里,你可以让一个人向前挥剑。这看起来超级逼真。这里有一些更酷的东西。所以,这里这个人正在做一个拳击姿势,然后将重心移到右边,然后用右手出拳。或者这里有一个人拿起枪,然后慢慢向前走。这是一个更酷的例子,一个人在被击中后倒在地上。现在,要训练一个具有如此高精度的模型,当然,他们需要输入一些高质量的数据。所以,他们说他们整理了一个高质量的数据集,涵盖了六个主要类别的 200 多个运动类别。更具体地说,他们在超过 3000 小时的多样化运动数据上进行了训练。然后,他们用 400 小时的精选高质量 3D 运动数据进行了进一步的微调,以增强运动细节和流畅度。然后,他们还使用了带有用户反馈的强化学习,以确保输出质量实际上是达标的。最棒的是,与腾讯 Hunen 的其他模型一样,他们已经发布了模型供我们使用。所以,如果你点击这个 GitHub 仓库并向下滚动一点,这里包含了所有关于如何下载并在本地计算机上运行它的说明。请注意,这里说标准模型的最低 VRAM 要求是 26 GB,而轻量级模型的最低要求是 24 GB。所以,你可能可以用 4090 运行它。现在,因为这是开源的,我相信未来会有更多压缩量化版本。无论如何,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能也非常有用。它被称为 Twin Flow,它基本上可以大大加速你的图像生成。现在,如果你一直关注我的频道,你应该知道阿里巴巴的 Zimage Turbo 是目前最好的开源图像生成器之一。它允许你创建一些超级逼真、细节丰富且精美的图像。现在,对于原始的 Zimage Turbo 模型,你通常需要使用 7 到 9 个步骤来生成图像。这些基本上是它生成图像所需的步骤数。当然,步骤越多,花费的时间就越长。Twinflow 的疯狂之处在于,你可以在 Zimage Turbo 工作流程之上添加这个插件。它可以帮助你将步骤数从 7 到 9 减少到只有 1 到 2 步。所以,你基本上将生成速度提高了四到五倍。现在,对于 Zimage Turbo,我生成一张图像只需要大约 7 秒。但如果我使用这个新的 Twinflow 方法,我就可以在 1 到 2 秒内生成一张图像。这就是它的速度有多快。最棒的是,他们已经发布了模型。所以,这是 Hugging Face 仓库,然后这是你可以下载 TwinFlow for Zimage Turbo 的地方。但是,他们还没有为 Comfy UI 发布集成。所以,至少对我来说,我会在测试它之前等待它。无论如何,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能非常酷。它被称为 ProEdit,它不仅可以像 Nano Banana 一样编辑图像,而且同一个模型还可以通过文本提示编辑视频。所以,这里有一些例子。你可以选择像这样从照片中移除薄荷叶,或者你可以让这只松鼠像这样读一本书。你可以将这只老虎变成一只猫,或者将长椅变成沙发,就像这样。现在,这只是简单的事情。市面上大多数图像编辑器,如 Quinn ImageEdit 或 Nano Banana,已经可以做到这一点。但真正令人印象深刻的是,同一个模型还可以编辑视频。所以,在这里,如果我们给这辆车添加一个车顶架,这是我们的结果。或者我们可以给这只猫戴上皇冠。这是我们得到的结果。请注意,它确实会增加饱和度和颜色。所以,这是一个明显的局限性。这是另一个例子,我们可以将这只鹿变成一头牛。这是我们得到的结果。请注意,它能够保持鹿的相同姿势和动作,只是将其变成了牛。这是另一个例子,我们可以将这辆红车变成一辆黑车,就像这样。现在,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说他们计划发布图像编辑和视频编辑的代码,这太棒了。无论如何,现在,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主项目页面。如果你正在寻找最好用的开源人工智能,那么,忘掉 DeepS 或 Kimmy K2 吧。实际上有一个新的领导者。Minimax,本视频的赞助商,刚刚发布了顶级的开源模型 Minimax M2.1。它在代理编码、工具使用、多步推理和多语言任务方面非常出色,甚至可以与 Gemini 3 Pro 或 GPT 5.2 等顶级闭源模型相媲美,这是一个了不起的成就。这里有一些例子。让我们让它编写一个完整的 Android 操作系统。所以,这是我的提示。我将选择 Pro,然后按运行。这是我的结果。包括图库、消息、设置和计算器在内的所有内容都有效。或者这是另一个例子。我可以粘贴这张图表的图像,让它编写一个交互式节点图。这是我得到的结果。它甚至能够捕捉所有节点关系以及科学名称和颜色代码。或者这是一个非常有用的应用程序。我可以上传这张非常复杂的财务电子表格,并提示它制作一份全面的财务报告。这是我的结果。看看一切多么彻底和详细。它能够捕捉所有这些数据并将其漂亮地呈现到这份报告中。Minimax M2.1 在 Python、Rust 和 C++ 等多种语言的编码方面都非常出色。它甚至在多步基准测试和多语言基准测试以及其他编码基准测试中击败了 Gemini 3 Pro 和 Claude 4.5。最棒的是,与 Minimax 的前几个版本一样,他们实际上是开源的,所以你甚至可以下载 Minimax M2.1 在本地运行,或者在他们的在线 Minimax 平台上免费试用。请务必点击下面的描述中的链接,因为那里将有一个独家折扣。这是你现在可以使用最好的开源模型,所以一定要试试。接下来,这个人工智能非常有用。它被称为 High Stream,它基本上可以将你的视频生成速度提高一百多倍,使用阿里巴巴的 One。所以,如果你一直在生成人工智能视频,你可能听说过 Alibaba One,它是目前最好的开源视频生成器,但对于大多数消费级 GPU 来说它仍然非常慢。比如,对我来说,生成一个 5 秒的剪辑至少需要 5 分钟。但 High Stream 将生成速度提高了高达 107 倍,这太疯狂了。所以,一个通常需要我 5 分钟的生成可以在 2 到 3 秒内完成。这是如何工作的?它基本上通过消除大量重复工作或冗余来加速你的生成。所以,当你生成视频时,有很多时间冗余。简单来说,High Stream 的工作方式是分块进行,而不是查看迄今为止的所有帧,随着视频的增长而变慢,但它始终以第一帧作为“锚点”,以保持整体画面的一致性。然后它还会获取最近的几个相邻帧以获取运动上下文。所以,他们也称之为锚点引导滑动窗口。这样可以使模型使用的注意力和内存量随着视频的增长而保持固定和较小。它们还使用空间压缩,其工作原理如下。Highream 不会立即以全尺寸完成所有工作,而是首先以低分辨率构建视频的粗略版本,然后使用早期步骤中存储的一些特征将该粗略版本精炼成更高分辨率的版本。所以,这有点像在生成视频的同时对其进行放大。因此,之后,你会得到一个比普通 12.1 生成速度快 107 倍的模型。此外,与所有其他加速方法以及原始 12.1(无加速)以及另一个名为 LTX 的视频模型相比,其质量实际上更受欢迎。事实上,这里有一些使用相同提示的比较供你参考。而且,令人惊讶的是,High Stream 的生成实际上看起来比普通的 12.1 更好。即使它被加速并且速度快了 100 多倍,但质量似乎更好,更逼真,更详细。现在,如果你滚动到页面顶部,这是来自 Meta 的。所以,不幸的是,至少目前来说,他们还没有发布代码。这里说它正在接受法律审查,不管那是什么意思。我的意思是,Meta 已经宣布了一些非常酷的东西,但他们通常不会真正发布。所以,我不知道这里会发生什么。但无论如何,如果你有兴趣进一步阅读,有一篇技术论文,以及更多关于这个页面的细节,我会在下面的描述中链接。另外,本周,人工智能竞赛中出现了一个新的、非常出乎意料的竞争者。所以,这个名为 IQ Quest Research 的人工智能实验室,据报道得到了一个与 Deepseek 非常相似的中国量化交易公司的支持,刚刚发布了一个强大的模型。它被称为 IQ Quest Coder V1。它有四种不同的版本,从 170 亿到 400 亿参数。此外,他们还有一个循环版本。所有这些的上下文窗口都是 128,000 个 token。这个模型在代理任务和多步推理方面非常出色。他们说这些模型是使用代码流方法训练的,该方法通过学习真实的 GitHub 存储库更改来教授它们代码如何随时间变化。例如,如果你点击任何公共 GitHub 存储库,然后点击任何文件,你实际上可以看到该文件自创建以来的更改历史。所以,正如你在这里看到的,绿色线条是新增的,而红色线条是已删除的,至少对于当前的提交来说是这样。无论如何,通过从这些更改中学习,这使得 iQuest Coder 在理解编辑、调试和编写长项目方面非常出色。模型的训练分多个阶段进行,以逐步提高编码技能和稳定性。然后,训练完成后,模型被分为两个版本:instruct 用于通用编码帮助,thinking 用于更深入的逐步推理。它的一个关键特性是这个循环架构。简单来说,这基本上重用了模型中的参数,大大减少了内存使用并加快了推理速度,同时保持了与更大模型相似的性能。事实上,这个 40B 的循环模型与领先的闭源模型一样好,而那些模型比它大很多倍。例如,看看这个。这是 SWEBench 验证过的。这是衡量人工智能在代理编码方面性能的标准基准。这也是 Anthropic 主要关注的。但正如你所看到的,iQuest Coder,一个只有 400 亿参数的小模型,甚至超越了顶级的闭源模型。它获得了惊人的 81.4% 的分数。我的意思是,如果你查看官方的 SWE 验证排行榜,即使是 Claude 4.5 Opus 也只获得了 74.4%。Gemini 3 Pro 也只获得了 74.2%。那么,这个只有几十到几百倍小的模型是如何获得超过 80 分的呢?这似乎太好了,不可能是真的,对吧?好吧,实际上是这样的。实际上有一个 GitHub 问题被打开,它实际上表明是某种奖励导致了他们的分数膨胀。所以,他们对此进行了非常详细的解释并重新评估了它。但即使在重新评估后,更新后的分数也是 76.2%。它仍然排在第三位。我的意思是,如果你查看官方排行榜,分数要低几个百分点。而且他们还没有在这里添加 iQuest Coder。但我认为它也排在第三或第四位,这与那些参数量大几十倍甚至上百倍的顶级闭源模型一样好。我们不知道它们的确切大小,因为它们是闭源的,但你可以预期它们比 iQuest Coder 大几十倍到几百倍。所以,iQuest Coder 仍然令人难以置信。其他基准测试也是如此。另一个流行的基准测试是 Terminal Bench。这也是最先进的。所以,这里有一些你可以让它编写的惊人东西。如果我用鼠标向下滚动,你可以看到它制作了这样的动画。或者这是一个虫洞驱动器,看起来像这样。这是另一个很酷的动画,我的光标会影响这些粒子的移动方式。这是一个太阳系模拟。非常好。而且一切看起来都很漂亮。而且因为它很小,所以它非常高效,甚至可以在一些低端硬件上部署。例如,量化版本可能可以在 RTX 4090 上运行。现在,最棒的是,他们实际上已经发布了模型。所以,如果你点击这里的下载按钮,它会带你到他们的 Hugging Face 页面,其中包含所有这些不同的模型供你下载。例如,这是循环指令版本。正如你所看到的,这是 400 亿参数。这个未压缩版本的总大小约为 80 GB,这是相当合理的。然后,如果你在 Hugging Face 上搜索,已经有大量的不同量化版本或 GGUF,可以在较低的 VRAM 上运行。让我们来看看这个 4 位版本,如果我点击文件和版本,它只有 22 GB 大小,所以它可以舒适地装入 RTX 4090。链接在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,阿里巴巴本周继续发布一些非常酷的东西。所以,上周他们发布了 Quinn ImageEdit 2511,这是目前你能用到的最好的开源图像编辑器。这就像 Nano Banana 的免费离线版本。而本周他们发布了 Quinn Image 2512,它不是一个图像编辑器,而是一个图像生成器。所以,你基本上可以通过文本提示生成图像。与上一版本的 Quinn Image 相比,它生成的图像更加逼真。此外,它在文本渲染方面也更好,并且在提示遵循方面也更好。正如你从这个排行榜中看到的,Quinn Image 2512 甚至击败了 Zimage,它在这里。这里有一些例子,比较了上一版本的 Quinn Image 和最新版本使用相同的提示。所以,正如你所看到的,对于上一版本,它看起来太假了,太人工智能了。皮肤看起来太柔软,太塑料了。而对于这个新版本,它看起来更加逼真。这里也是一样。你可以看到,这个新版本看起来更加逼真,很难看出它是人工智能生成的。这是另一个例子。同样,这个新版本只是更加逼真,而对于旧版本,它看起来太完美了。而且,如果你玩过人工智能一段时间,你就能清楚地看出这是人工智能生成的。这是另一个风景照片的例子,你可以看到这个新的 Quinn Image 为图像增加了更多的细节和清晰度。这里是另一个例子供你参考。我的意思是,一切看起来都更漂亮、更清晰、更逼真。所以,这些是他们的一些例子。我也自己进行了一些测试。所以,下面是提示。我在最新的 Quinn Image、Zimage Turbo 和旧版 Quinn Image 上运行了它。第一个提示是年轻女子在咖啡馆自拍。她做了可爱的表情,噘着嘴,眨着眼睛,一只手比着胜利手势,业余低质量照片。正如你所看到的,Quinn Image 看起来非常逼真。我们没有旧版 Quinn Image 中那种虚假的塑料感。这两张照片看起来都像是低质量的业余照片。我认为 Quinn Image 具有更多的细节和清晰度,而 Zimage 则不太清晰。请在评论中告诉我你更喜欢哪一个。这是另一个测试,关于它在渲染长文本片段方面的能力。所以,这里有一只手拿着一支笔在日记本上写字。页面上有文字写着“这是一段相当长的文本,比典型的人工智能模型能够准确生成的要长得多。这是一个测试,看看所有文本是否都能在此正确显示。而且,请记住订阅我的频道,因为 Quinn Image 2512 获得了所有文本的正确显示。文本没有任何问题。我唯一的问题是它看起来不像手写的。比如,它可以看起来更潦草一些,但尽管如此,它还是正确地显示了文本,这很棒。对于 Zimage Turbo,虽然它可以生成一些文本,但它无法生成如此长的文本片段。所以,你可以看到中间有很多拼写错误和错误。然后对于旧版的 Quinn Image,它实际上还不错,但同样,它在这些地方和那些地方也遇到了一些拼写错误和错误。所以,唯一能正确显示所有文本的是 Quinn Image 2512。这是另一个例子,展示了它在生成此移动应用程序的 UI 方面的能力。老实说,这三者都做得很好。这三者都能够获得我指定的文本和元素。现在,这些生成中存在一些小问题。例如,这里它将“daily”拼错了。然后对于 Zimage,它无法正确获取这个位置标记。但实际上,旧版的 Zimage 非常好。我实际上更喜欢这个。但请在评论中告诉我你的想法。好了,这是一个非常困难的提示。一个时尚现代的浴室。一个人正在照镜子,但他的倒影是一团模糊的数据,由颜色和拖动的像素组成。而他周围反射的浴室则保持完美清晰和锐利。对于 Quinn Image,它实际上理解了我的提示并生成了非常好的结果。他的倒影是一团模糊的像素,而浴室的背景则保持不变。对于 Zimage Turbo,它完全不知道我在说什么。所以,它无法生成任何模糊的像素。然后对于旧版的 Quinn Image,它同样无法真正理解我的意图。我只希望他的倒影是一团像素的混乱,但它无法生成这个。所以,最新版本的 Quinn Image 在这个实例中是明显的赢家。现在,我觉得最新版本的 Quinn Image 经过微调,非常擅长处理逼真图像和照片,而不是其他更具艺术性的东西。所以,例如,如果我们让它生成一幅森林中鹿的插图,但一切都由不同大小的点组成,背景为白色,Quinn Image 并没有真正能够生成我想要的。Zimage Turbo 的这个生成是我想要的。然后对于旧版的 Quinn Image,这实际上还不错。它有点遵循了我的提示,但同样,我想要中间的这种外观。所以,至少对于非常艺术或抽象的东西,Quinn Image 2512 可能不是你的最佳选择。Zimage Turbo 会好一些。这是另一个棘手的例子,测试它在光线物理方面的能力。所以,我们有一个装满彩色弹珠的玻璃人体模型,站在明亮的窗户前。而 Quinn Image 的这个生成实际上看起来最好。这是一个装满玻璃弹珠的人体模型,一切看起来都相当准确。然后对于 Zimage Turbo,我们也有一个装满玻璃弹珠的人体模型。虽然人体模型看起来有点小。然后对于旧版的 Quinn Image,它也能够很好地生成这个。但就现实主义和真正遵循我的提示而言,我不得不将分数归给最新版本的 Quinn Image。好了,下一个。让我们测试一下它在生成棘手的解剖姿势方面的能力。所以,这里有一个穿着白色比基尼的女人,正在做一个国王鸽子式瑜伽姿势,背景有爆炸。供你参考,国王鸽子式看起来像这样。对于 Quinn Image 2512,它有点能够做到,但不是完全到位。所以,她的头没有像那样向后弯曲,她的左手也没有抓住她的脚。然后对于 Zimage Turbo,我们也得到了类似的结果,她的手并没有真正抓住脚。然后对于旧版的 Quinn Image,这实际上是我认为这三者中最好的生成。所以,国王鸽子式看起来好多了。甚至背景中的爆炸看起来也相当不错。现在,不知何故,它决定添加一些额外的文字,我并没有提示它这样做。但是的,在这个例子中,令人惊讶的是,我更喜欢旧版 Quinn Image 的生成。然后这是角色模型表测试。所以,它将是女性,长白发,蓝眼睛,黑色吊带衫,露肩,白色和服,携带发光的红剑。制作一个显示正面、侧面和背面视图的模型表。所以,这是我从 Quinn Image 2512 得到的。实际上还不错。所以,角色在所有视图中看起来都相当一致,尽管在侧视图中,她缺少剑。然后这是我们从 Zimage Turbo 得到的。同样,所有视图都相当一致。唯一的错误是这里她拿着剑在右边,而在这两个视图中,剑在她的左边。然后这是旧版的 Quinn Image。这里我们开始看到更多的 Mismatches。所以,这里应该有一条红丝带,但在这里没有显示。然后不知何故,她这里有一条红腰带,但实际上在正面和侧面视图中并不存在。此外,这个侧视图也缺少剑。所以,这是一个艰难的决定。我认为 Quinn Image 和 Zimage Turbo 打平。这是另一个棘手的测试,涉及多个元素和文本。所以,我让它生成一个 PowerPoint 幻灯片。Nvidia 对 AMD 包括他们的标志。这里是它需要添加的所有文本和图标。对于 Quinn Image,它能够包含标志。此外,它还正确地获取了所有文本和图标。对于 Zimage Turbo,它未能包含 Nvidia 标志,并且到处都有拼写错误,比如“ray tracing”和“affordable”。这个开源图标看起来也很奇怪。然后对于旧版的 Quinn Image,它获得了所有标志。图标也正确,文本也正确。所以,实际上相当令人印象深刻。我认为在这里,两个 Quinn 模型打平。所以,这些是我使用 Quinn Image 2512 进行的一些快速测试。与之前的 Quinn 版本一样,最棒的是他们已经开源了它。事实上,已经有一个原生的 Comfy UI 工作流程,你可以使用这个新模型。所以,你所需要做的就是点击 Comfy UI 中的模板,然后搜索 Quinn Image 2512,你应该已经可以看到它了。如果没有,请确保你首先更新到最新版本的 Comfy UI。请注意,Comfy UI 的 Quinn Image 模型有两种变体。有一个 FP8 模型,大小减半,为 20 GB,但对于你们大多数 VRAM 不多的用户来说,它仍然相当大。幸运的是,已经有更多压缩的 GGUF 版本供 Quinn Image 2512 使用。所以,你可以看到这里最小的 2 位版本是 7.2 GB。所以,这应该可以舒适地装入 8 GB 的 VRAM。无论如何,我会在下面的描述中链接到所有这些页面以及这个主公告页面,如果你有兴趣进一步阅读。接下来,这个人工智能非常酷。它被称为 Javis 或 Javis GPT。它是一个多模态模型,不仅可以观看和收听视频和音频,还可以根据你的指示创建带有声音的新视频。所以,这是端到端的。你可以输入文本提示、音频或视频,但它也可以生成文本、音频或视频。这里有一些例子。你可以询问这个声音,并上传一个音频剪辑,就像这样。基本上,它能够分析声音并检测到是的,这是木门或大门打开或关闭时的吱呀声。或者你可以上传这个视频并要求它分析视频。所以,例如,如果你问它“那个人拿起盒子后发生了什么”,它能够正确回答。或者在这里,如果你上传这个视频并问它“房间里有多少乐器从头到尾都没有发出声音”,它能够回答一个。或者你可以输入这个视频并询问它“这个视频里发生了什么”,它能够正确回答。你还可以问它进一步的后续问题。现在,已经有很多人工智能模型可以做到这一点。这没什么了不起的,但这是酷的部分。你还可以让它生成带有音频的视频。所以,例如,让我们让它制作一个海滩的鸟瞰视频,有白色的沙滩和绿色的雨伞等等。这是它生成的。现在,生成效果不是很好。质量很低,音频也很糟糕。但是,你知道,这不是一个专门的视频生成器或音频生成器。所以,他们能够将这种视频生成能力塞进这个多模态模型中仍然非常令人印象深刻。或者这是另一个例子,我们可以制作一个机器在后台稳定运行的剪辑,以及汽车发动机的特写镜头,上面有光照等等。这是我们的结果。同样,质量不是很好,但它能完成工作。然后你可以问它关于视频的进一步问题,它能够回答所有问题。如果你滚动到页面顶部,他们已经发布了所有内容。所以,如果你点击这个 GitHub 仓库并向下滚动一点,这里包含了所有关于如何在你的电脑上下载并运行它的说明。此外,他们还发布了准备训练数据集以及如何自己训练模型的代码,如果你对此感到好奇。链接在这里。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到这个主页。接下来,这个人工智能也相当有用。它被称为 Space-Time Pilot,它可以基本上获取现有视频,并以你想要的任何视角、角度或运动重新拍摄它。例如,你可以移动摄像机,或者减慢速度,或者像子弹时间一样冻结场景,或者做一些其他的创意事情。所以,首先,这里有一些子弹时间示例,我们可以获取现有视频并在视频的某个点冻结它,然后你就可以围绕场景旋转或平移,同时它被冻结。这是另一个很酷的例子,再次,你可以在某个时间点冻结这个场景,然后旋转摄像机从不同的角度观看场景。这里是另一个例子供你参考。它能够保持原始场景的所有细节一致,比如前景和背景中的人物。这里有一些额外的子弹时间例子供你参考。现在,除了子弹时间,它还可以反向播放视频。现在,你已经可以获取一个视频,将其输入视频编辑器,然后反向播放它。但它的酷之处在于,它不止于此。所以,你不仅可以反向播放这个场景和所有动作,还可以改变摄像机角度。所以,请注意,在这个生成的视频中,它正在向左盘旋。所以,它不仅在反向生成场景,而且还在改变摄像机运动。这是另一个例子,我们不仅反向播放,还改变了摄像机角度,使其成为俯视视角,就像这样。它能够控制人物的动作和摄像机的运动,这真是太酷了。或者这是另一个例子,我们反向播放这个动画,同时将摄像机角度改变为俯视视角,就像这样。相当酷,你可以随意操纵现有视频的动作和摄像机视角。或者这是另一个例子,我们可以像这样进行之字形运动,我们正向播放场景,然后反向播放,再加上我们将摄像机角度改变为缓慢缩放,就像这样。你可以随意操纵现有视频的动作和摄像机视角,这真是太酷了。或者这是另一个例子,我们可以之字形移动这个人的动作,并从下方重新拍摄场景,并稍微放大一点。或者这是另一个例子,我们可以之字形移动这个场景,同时向右盘旋。现在,除了反向播放视频、之字形运动或冻结它之外,你还可以以慢动作播放视频,同时改变摄像机视角。所以,这里有一个例子。或者这是另一个例子,我们可以以慢动作播放场景,同时将摄像机向左盘旋。无论如何,如果你滚动到页面顶部,他们已经发布了一个 GitHub 仓库。这里说代码和数据集正在接受内部审查,一旦程序完成将尽快发布。所以,希望他们会信守诺言,开源代码。无论如何,目前他们已经发布了一篇技术论文和更多关于这个页面的细节。所以,如果你有兴趣进一步阅读,我会在下面的描述中链接到它。这总结了本周人工智能的所有亮点。请在评论中告诉我你对这一切的看法。你最喜欢哪个新闻?你最期待尝试哪个工具?一如既往,我会留意顶尖的人工智能新闻和工具与你分享。所以,如果你喜欢这个视频,请记得点赞、分享、订阅并保持关注,以获取更多内容。此外,人工智能的世界每周都在发生太多事情了,我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上人工智能的最新动态,请务必订阅我的免费每周通讯。链接将在下面的描述中。感谢观看,下次再见。