📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

NEW GPT Image 1.5 vs Nano Banana Pro

AI Search31:47

Transcription

OpenAI 刚刚发布了他们最新的图像生成器,GPT Image 1.5。而这功能强大得令人难以置信。所以,在这段视频中,我将对其进行彻底的测试,并将其与目前人工智能图像生成领域的王者,Nano Banana Pro 进行比较,以便您能看到哪个更好。首先,这是他们的官方公告页面。正如您所见,这与 Nano Banana 非常相似。您可以拍摄任何人的图像,然后进一步编辑该图像,例如更改人物的发型或穿着。您还可以更改背景,或者进行外绘,或者更改宽高比。您还可以生成该人物的不同视角。您还可以创建该人物的深度伪造,并将他们添加到任何其他照片中。然后,您可以按照您想要的方式对其进行风格化处理。但所有这些示例都有些容易。我们已经有其他竞争对手可以做到这一点,例如 Nano Banana Pro,甚至开源的 Quinn Image Edit。所以,让我们开始彻底测试 GPT Image 1.5,使用一些更具挑战性的例子。此外,我还会介绍它的规格和性能,以及在哪里以及如何使用它。让我们直接开始吧。顺便说一句,在继续视频之前,有一点需要注意。我们已经有很多图像编辑器可以为旧照片上色和修复,或者去除水印,或者更改照片的角度,或者将照片变成动漫风格或其他风格,反之亦然,或者创建任何人的深度伪造。我的意思是,这些都很容易。所以,我甚至不会向您展示这些。我相信 GPT Image 1.5 已经能够做到以上所有事情。我真的很想测试它的极限。所以,我将给它一些非常棘手的提示,即使是最好的图像编辑器也会被难倒。所以,对于我的第一个提示,让我们测试一下它是否真的理解了所有宝可梦。我将写“制作一个 4x4 的网格,其中包含这些图鉴编号的宝可梦。”然后我添加了 16 个随机数字。这是我在左边的 GPT Image 5 和右边的 Nano Banana Pro 上得到的结果。实际上,它们都能理解所有这些宝可梦,这已经相当令人印象深刻了。我不得不说,Nano Banana Pro 渲染宝可梦的效果比 GPT Image 5 稍好一些。例如,对于 Golbat 和 Pidgeotto,它们看起来比我从 GPT5 得到的要好得多。您可以看到,这两个生成的东西看起来有点不对劲。和这里的这个宝可梦一样。我认为总体而言,Nano Banana Pro 的图像看起来稍好一些。现在我们开始看到这个编号为 2011 的宝可梦出现了一些差异。所以,让我实际双重检查我的图鉴并搜索编号 2011。所以,这叫做未知,它应该看起来像这样。所以,如果我在这里粘贴它,请注意,GPTC 和 Nanopano Pro 都未能真正正确地识别出这个宝可梦。然后我们还看到倒数第二个编号为 301 的宝可梦出现了一些差异。它将其渲染成紫色,但在这里却将其渲染成粉色。此外,它脖子上的图案也有些不同。所以,让我实际双重检查一下 301 看起来是什么样的。所以,它应该看起来像这样。所以,似乎 Nano Banana Pro 的准确性更高,而 GPT 似乎在编造这些东西。然后最后,对于这个龙虾,我猜是 342,它应该看起来像这样。所以,同样,似乎 Nano Banana Pro 的整体外观比 GPT Image 5 好得多。所以,总的来说,GPT 并不差,但在这里我不得不将分数给 Nano Banana Pro。好了,这是另一个棘手的例子,测试它在渲染表情和情绪方面的能力。所以,在这里我将用一个 4x4 的网格来提示它,一个年轻的女性,从左到右,然后从上到下,具有这些情绪。我们有快乐、敬畏、热情、自信、悲伤、嫉妒、恼怒、尴尬、惊讶、困惑、怀旧、恐惧、爱、宽慰、自豪和期待。其中一些表情相当棘手。所以,让我们看看这两个图像模型表现如何。对于 GPT Image 1.5,快乐看起来不错。敬畏也看起来不错。第一行看起来相当不错。它确实传达了表情。然后对于第二行,它也看起来相当不错。她确实看起来像指定的表情。然后对于第三行,这看起来也非常好。它完美地传达了情绪。然后对于最后一行,它也非常好。有些表情非常棘手,比如宽慰、期待、怀旧、自信或嫉妒,但它实际上能够非常准确地传达所有这些情绪。然后对于 Nano Banana Pro,让我们看看。对于自信,我不会说她在这张照片里看起来很有自信。对于敬畏也是一样。她看起来不太敬畏。然后对于第二行,这看起来相当不错。对于第三行,怀旧看起来有点奇怪。然后对于最后一行,自豪和期待也看起来有点奇怪。就像可以做得更好。我想说在这种情况下,GPT 渲染这些更棘手的表情要好一些。但请在评论中告诉我您的想法。如果我必须在这里选一个赢家,我会说分数归 GPT Image。好了,下一个。这是一个有争议的例子。让我们看看 GPT Image 是否能为您完成家庭作业。所以,我有一个数学作业的截图。然后对于提示,让我们让它用一些潦草的笔迹来解决这些数学问题,这样看起来就不像是我们用 AI 生成的。现在,我刚刚尝试了这个提示,它一直也在修改原始问题。所以,我也添加了“保留原始问题”。这是我得到的结果。正如您所见,GPT Image 实际上非常好。它能够使用一些潦草的笔迹来解决我的数学作业。所以,看起来我实际上完成了作业。我快速扫描了所有这些答案,它们似乎都是正确的。请记住,这只是一个图像生成器。所以,它能够一次性解决所有这些数学问题并输出解决方案,这真是太疯狂了。所以,孩子们,如果你们看到这个,不要给你们老师看。现在对于 Nano Banana Pro,它似乎改变了背景,原因不明,就像我打印出来一样。但尽管如此,它也能够用一些潦草的笔迹解决这些问题。令人惊讶的是,这两个模型解决这些代数问题的 방식 略有不同。对于 Nano Banana Pro,它这样做的,它在两边使用相同的运算来得到最终答案。而对于 GPT,它基本上是将所有数字移到一边来分离变量。总之,两种方法都有效,但在这里我实际上更喜欢 GPT 的生成,因为它也没有改变背景。现在,除了做数学作业,我还尝试测试它在生物学作业上的能力。所以,这里有一张工作表,您需要标记所有这些细胞器。不幸的是,两个图像生成器都未能正确标记所有标签。所以,让我们先看看 GPT 的生成。它到处都是。它甚至不接近。就像,不知何故,它将膜标记为细胞核,这完全是错误的。它将这个标记为线粒体,这也是错误的。基本上所有东西都错了。然后这是 Nano Banana 的生成。至少它正确地标记了线粒体。但同样,对于其余的标签,它基本上都是错误的。所以,这两个都失败了。现在,就像我说的,所有图像编辑器都可以进行微编辑,例如更改人物的头发或服装,或者更改照片的角度。所以,让我们尝试一些更棘手的。我将上传这张图片,然后让它将这张图片分成四个独立的象限。对于第一个象限,它将是一个红外热图。第二个象限将是一个分割图。第三个是一个深度图,第四个将是同一张照片,但我们反转颜色。好了,这是我们从两个图像生成器那里得到的结果。让我们先看看 GPT Image。对于红外热图,它似乎是正确的。所以,确实,她的皮肤应该是照片中最热的,其次是,我想,她的衣服和沙发,因为她正在接触它们,然后背景应该凉得多。所以,第一个象限是正确的。对于第二个,这是一个分割图。它看起来不怎么样,但我想算及格。然后对于第三个,这是一个深度图,但我不会说它非常准确。然后对于第四个,让我反转颜色。您可以看到这并不准确。它很接近,但与原始照片并不完全一样。接下来,让我们看看 Nano Banana Pro。您可以看到它在这个红外热图方面也做得很好。分割图也是如此。这看起来比 GPT 的生成要好得多。深度图也是如此。您可以看到背景比这里的东西要远得多。而对于 GPT,它并没有真正准确地传达这一点。然后对于反转的颜色,让我们反转颜色。这实际上比原始图像更接近。非常酷。所以,我想说在这种情况下,Nano Banana Pro 是赢家。好了。下一个,我也给它提供了一个非常棘手的提示,到目前为止,即使是 Nano Banana Pro 也未能正确处理。所以,时钟显示 11:15,还有一个装满的酒杯。对于 GPT Image 1.5,它都正确了。虽然有一个小瑕疵是时针看起来有点奇怪。而且它应该比这个短。我尝试了多次生成,但对于所有生成,其中一个指针总是有点搞砸了。所以,不完美,但这是我迄今为止见过的最好的显示 11:15 的时钟渲染。而且我认为另一个小错误是酒的表面看起来不太对,但这个杯子是满的。然后这是 Nano Banana Pro 的生成。杯子是正确的,但 11:15 并不真正正确。所以,时针应该稍微过 11 点而不是正好在 11 点。所以,没有一个完全完美。我想说这是一个平局。接下来,我想测试它对现实世界事物的理解。所以,我让它制作一个包含世界上四种最稀有青蛙的网格,并在每张照片的底部附上它们的科学名称和简短描述。所以,这是 GPT Image 1.5 的生成。我实际上不知道这些青蛙中的任何一个。所以,我们必须仔细检查。所以,让我们快速事实核查一下。对于 GPT,它给了我这种伊比利亚青蛙,以及这个科学名称。如果我快速谷歌搜索一下,它确实看起来像真正的青蛙。然而,如果您看看这里,这种伊比利亚青蛙并不像濒危物种。它只是近危。所以,这并不是世界上最稀有的青蛙物种之一。接下来,我们有这种 tic tac 水蛙。我也谷歌搜索一下科学名称,看看是否准确。我的天哪,这是什么鬼东西?好吧,我不知道有青蛙长这样。显然,这就是这种青蛙的样子。而且它濒临灭绝。所以,它得到了正确的名字。然而,这看起来就像一只普通的蟾蜍。它看起来不像真正的物种。所以,这是一个失败。然后最后,我们有这种树袋鼠青蛙。同样,让我谷歌搜索一下。我甚至找不到科学名称。literia raris。所以,我认为那只青蛙实际上并不存在。所以,这是一个失败。然后最后,让我们看看这种 Kihanzi 喷雾蟾蜍,它看起来像这样。这里说它已经野外灭绝了。所以,我想它甚至不再是最稀有的青蛙之一了,因为它已经灭绝了。但无论如何,这是它的样子。同样,如果我回到 GPTC 图像生成,它看起来并不像真正的标本。所以,总的来说,它把这四种都弄错了,这不好。接下来,让我们看看 Nano Banana Pro 的生成。所以,有趣的是,它给了我四种完全不同的青蛙物种。让我们来核查一下第一个,它看起来像这样。而且它濒临灭绝。所以,从初步看来,这似乎是正确的。接下来,让我核查一下这个,它看起来像这样。非常有趣。然而,如果我查看维基百科页面,这个甚至不是濒危物种。它只是近危。所以,这并不是世界上最稀有的青蛙物种之一。所以,虽然它正确地捕捉了第二种的外观,但它不应该被认为是稀有青蛙。然后接下来是这个。而且这个濒临灭绝。而且显然它看起来像这样。现在,从 Nano Banana 的生成来看,它看起来最像这两种,它们是深色的和粗糙的。我想说它很接近。很难说它是否真的像真正的物种,因为我不是青蛙专家,但它很接近。然后最后,我们有这个,它实际上是一个非常古老的分类群。所以,它已经被更新为新的分类群 tripon spinosis,它看起来像这样。但这个是近危。所以,它也不是濒危物种。而且这张照片看起来也不准确。所以,Nano Banana 错了四分之二。但仍然比 GPZ Image 好,后者错了四分之三。同样,这是一个超级棘手的提示。所以,我不指望任何图像编辑器能完全正确。接下来我想看看它在制作漫画方面的能力。我想看看它是否能制作一个连贯、统一的故事。所以,提示是“制作一页黑白漫画,包含多个面板,展示一个年轻男子在火车站告白”。这是我从 GPT Image 1.5 得到的。您可以随时暂停视频阅读,但这些面板实际上是连贯的。角色在各个面板中都保持一致,故事也实际上是连贯的。所以,这非常好。然后这是 Nano Banana Pro 的生成。在这里,角色、背景和故事也是连贯的。所以,我想说它们都能制作一整页连贯的漫画。在这里,我想说这是一个平局。接下来,我也想看看它是否能为漫画上色并翻译成中文。所以,这是原始漫画页面。这是我从 GPT Image 1.5 得到的。正如您所见,它确实改变了一些微妙的细节。例如,它并没有真正保留原始角色的眼睛和嘴巴。此外,它还搞砸了这个人的脸。此外,这个人甚至不存在于这个面板中。然后,大部分中文也是搞砸了。有些字符甚至不存在。所以,总的来说,它不太好。而如果您看看 Nano Banana Pro,它实际上得到了正确的中文翻译。此外,它在保留原始漫画页面方面做得更好。所以,在这种情况下,我不得不将分数给 Nano Banana Pro。接下来,我也想测试它在生成界面方面的能力。所以,这是一个棘手的例子,到目前为止,没有图像生成器能够正确处理。提示是“YouTube 搜索结果的截图,搜索可爱猫咪”。这是 GPT 的生成,而且实际上相当不错。这看起来确实像 YouTube 搜索结果页面。顶部的图标有一些细微的错误,但缩略图、标题和描述看起来都正确,没有拼写错误或其他问题。这是 Nano Banana Pro 的生成。这看起来也像一个 YouTube 搜索结果页面,但这个页面上有更多的拼写错误,如您所见,这里,这里,还有这里。此外,左侧菜单也有很多拼写错误。所以,总的来说,在错误最少方面并不算好。我想将分数给 GPT Image 1.5。在我的频道上,我介绍了许多不同的 AI 模型和工具,这可能会让人不知所措。如果您可以在一个平台上使用所有这些模型呢?这正是 Abacus AI 的 Chat LLM 所提供的,它是本视频的赞助商。Chat LLM 是一个一体化平台,供您使用最好的 AI 模型。您可以在您的聊天中无缝切换不同的模型。此外,您还可以使用所有顶级的图像生成器,以及顶级的视频模型,所有这些都在一个集成平台中,而且一旦新模型发布,它们通常会很快添加到它们的网站上。此外,如果您正在编写代码,它们有一个非常有用的工件功能,这样您就可以并排预览您的生成。此外,它们还有一个深度代理功能,可以自主完成一些非常复杂的任务,例如创建 PowerPoint、网站和研究报告。它将极大地提高您的生产力。最重要的是,您每月只需支付 10 美元即可访问所有这些 AI 模型以及图像和视频生成器以及深度代理。这比单独支付每个工具的费用要便宜得多。一定要查看 Chat LLM,它附带了描述中的深度代理。接下来,让我们测试一下它在生成现有人物方面的能力。所以,我们有 Johnny Depp、Jackie Chan、Taylor Swift、Tom Hanks、The Rock、Michael Jackson、Oprah、Blackpink、Cristiano Ronaldo 和 Elon Musk 一起合影。但是等等,Nano Banana Pro 已经可以做到这一点了。所以,让我们提高难度,添加更多角色。让我们也添加所有这些额外的角色,让他们一起合影。现在,令我失望的是,GPT 实际上不允许我生成这张照片。我尝试了重新生成几次。我尝试删除一些角色,但它仍然不允许我生成这张照片。但对于 Nano Banana Pro,它绝对完美地处理了所有这些角色。我的意思是,您可以清楚地识别出我指定的所有人。您可以暂停视频进行确认,但所有这些角色看起来都像真人。Nano Banana 在渲染名人方面非常强大。现在,我知道 GPT Image 拥有这些知识。它只是受到了一些限制。所以,我测试了另一个提示,即“世界上 16 位最富有的人的网格,包括他们的名字和角色或公司在照片下方”。这次,我能够绕过限制,让它实际生成一些现有的人物。所以,这是我从 GPT Image 得到的。Elon Musk 看起来有点不对劲。然后 Warren Buffett 也看起来有点不对劲。然后我不太熟悉其中一些人。然后这个人看起来不像腾讯创始人马化腾。所以,这也是错的。我不确定其他人。所以,请在评论中告诉我他们的面孔是否正确。然后这是 Nano Banana Pro 的生成。Elon Musk 看起来好多了。Warren Buffett 也是如此。每个人看起来都更像真人。所以,我想将分数给 Nano Banana Pro。GPT 接近了,但在生成现有人物方面仍然不及 Nano Banana Pro。它只是拥有更好的世界知识。好了。接下来,我也想看看它是否能生成一些动漫角色。所以,这里有 Amelia、Gojo、Nezuko、Kuroguno、South Park 的 Kenny、Bart Simpson 和 Snow White 在自拍。老实说,它们都正确了。但 GPT Image 有一些错误,例如 Kuroro 的这部分。此外,Bart 通常不穿这件连帽衫。而您可以看到对于 Nano Banana Pro,它在角色一致性方面做得更好。Bart 穿着他的标准 T 恤。此外,您知道《辛普森一家》的角色只有四根手指吗?所以,这只是一个随机截图。但是的,《辛普森一家》的所有角色都只有四根手指。所以,Nano Banana 在这里实际上是正确的。这不是错误。但无论如何,在这个例子中,我再次不得不将分数给 Nano Banana Pro。角色稍微更准确一些。接下来,我想测试它的空间理解能力。所以,我上传了一张这个房间的照片,并让它制作这个公寓的二维平面图。所以,这是一个并排的比较。您可以看到,对于 GPT Image 5,它完全搞错了所有东西的空间排列。这甚至不接近我的参考图像。而对于 Nano Banana Pro,它实际上能够正确处理大部分东西,例如这里的椅子,加上这个投影仪和壁炉以及沙发,加上这个窗户。现在,这个生成仍然不完美。例如,它决定在这里添加两把额外的椅子,即使原始图像中没有。但尽管如此,在场景中事物的整体排列方面,Nano Banana 比 GPT Image 5 准确得多。所以,在这里分数应该归 Nano Banana Pro。接下来,这是一个有趣的例子。我也想看看它是否能生成一些游戏场景。所以,我提示它生成一些《星际争霸》的游戏画面,Teal Protos 对阵 Red Zurg。这是我从两个图像生成器那里得到的结果。虽然 GPT Image 接近了,但我不得不将分数给 Nano Banana Pro。这看起来更像一个真正的《星际争霸》游戏场景,而对于 GPT Image,它只是在编造东西。Nano Banana Pro 拥有令人难以置信的世界理解能力,所以它能够生成很多现有的东西,而我发现对于 GPT Image 5,它没有那么好。接下来,让我们测试它生成图表的能力。所以,我让它创建一个解释仅解码器 Transformer 模型如何工作的图表。这是 GPT Image 的生成,图表一团糟。一切都乱七八糟。它缺少嵌入和位置编码。它还缺少最后的线性层和 softmax 层。这是不正确的。而对于 Nano Banana Pro,这看起来好多了。它包含了所有组件,包括嵌入和位置编码。我想说这里的箭头有点反向,因为它从顶部开始。所以,我实际上会重新定位它,让注意力块在顶部,然后通过前馈神经网络。但我想这样也可以。然后之后,它会通过最终的线性层和 softmax 输出层来给出概率。总的来说,Nano Banana Pro 在这个例子中做得更好。接下来,这是一个更棘手的提示。我只是给它输入了大量关于某个神经网络的 Python 代码,并让它制作一个显示这个神经网络的图表。这是我从 GPTZ Image 得到的,它接近了,但并不完全正确。例如,它在这些层之间缺少一个最大池化层。然后这个神经网络也有些混乱。此外,这个输出层看起来也很混乱。而对于 Nano Banana Pro,它更好地理解了这一点,并能够给我一个非常清晰准确的图表来显示这个卷积神经网络。同样,在这个例子中,我不得不将分数给 Nano Banana Pro。接下来,我去了谷歌地图,选择了这个随机地点。让我把这个人放在这里,这样您就可以看到场景的街景,看起来像这样。这不是一个受欢迎的地方。这只是一个随机的十字路口。所以,AI 模型很难确切地知道这个地方是什么样子。现在,我将这个提示输入了两个图像编辑器。生成这个地方的照片。这是坐标。不出所料,它们都未能生成确切位置的照片。接下来,我也想看看 GPT Image 在生成角色精灵表方面的能力。所以,这里有一个火法师发射火球的像素艺术精灵表。这是 GPT Image 的结果。我将其转换为实际动画,看起来像这样。总的来说,这还不错。有一些不一致的地方,但它确实看起来像一个相当连贯的火法师发射火球的动画。然后作为参考,这是 Nano Banana Pro 的生成。现在,GPT Image 1.5 的一个优点是它可以生成透明图像,而对于 Nano Banana Pro,这是不可能的。所以,我让它生成的这个精灵表实际上是一个透明的 PNG 文件。正如您在这里看到的,在我之前的视频中,当我审查 Nano Banana Pro 时,我输入了这个 FF7 战斗场景,并将其变成了一个忠实的重制版。但那太容易了。我们已经有了这些角色的逼真渲染。所以,Nano Banana Pro 基本上只是在这里生成了那些角色。所以,而不是使用 FF7,让我们更进一步,使用《最终幻想 9》的截图。这还没有被重制成忠实的重制版。而且我们也没有这些角色的逼真渲染。所以,我将提示它“将其变成一个忠实的重制版”。这是我从两个模型那里得到的结果。让我们先看看 GPT Image。总的来说,这看起来相当不错。它确实将其重新格式化为重制版,并且所有角色的外观都得到了保留。这非常好。然后这是 Nano Banana Pro 的生成。这也不错。很难在这里选出赢家。这是一个非常接近的呼叫。所以,我想说这是两个模型之间的平局。现在,我不知道您怎么想,但我讨厌在 Excel 中处理数据,并尝试重新格式化行和列并将其变成一个漂亮的图表。如果我们只是给它一个表格截图,然后让 AI 自动将其变成一个漂亮的图表,那不是很好吗?好吧,这就是我在这里测试的。所以,这是一个随机表格的截图。这个表格相当复杂,有各种嵌套的行和列。对于我的提示,我写道:“将其变成一个漂亮的图表。您可以决定使用哪种最佳图表类型。”这是我从 GPT Image 1.5 得到的。如果您看看原始表格,它缺少很多类别,如 PD、NE 和 RR。所以,它缺少一半的数据。此外,所有这些条形的高度也不正确。这个生成有太多错误了。现在,对于 Nano Banana Pro,这实际上令人印象深刻。它不仅捕捉了从 CR 到 NE 再到 RR 的所有这些类别,而且它还能很好地将它们映射到这些条形图中。例如,请注意 Y 轴是患者百分比。所以,它实际上是将所有这些值除以样本量或基本上是患者数量。例如,对于第一个,CR,我们得到 5.7,实际上是 5 / 88。与这个浅绿色的一样,它是 PR。我们得到 56.8。这实际上是 50 / 88。所以,它实际上在后台进行了一些复杂的数学运算,然后计划如何将其绘制成这个漂亮的视觉效果。所以,毫无疑问,在这个例子中,Nano Banana 是明显的赢家。这是另一个用户建议的棘手提示。这里我们直接比较了使用两线和三线连接的惠斯通电桥电路。这非常棘手。现在,我不是专业的电工,但似乎两个模型都未能正确处理。作为参考,正确的答案在这里,但同样,我不是专家。所以,请在评论中告诉我哪个更接近正确答案。最后,这是一个有趣的例子。我让它制作了一个高分辨率的《威利在哪里》图像。它应该非常复杂,有很多人,沃尔도 隐藏在图像的某个地方。这是我从两个模型那里得到的结果。它们都非常复杂,有很多人,但如果我放大,细节非常扭曲。就像,这不合格。所有面孔都有点变形。这个生成有太多错误了。然后这是 Nano Banana Pro 的生成。同样,面孔都搞砸了。而且沃尔도 太容易找到了。他就在中间。此外,他比其他人稍微大一些。所以,无论如何,两个生成都不好。我想说两者都失败了。总之,这总结了我对 GPT Image 1.5 与目前王者 Nano Banana Pro 的快速测试。至少从我的例子来看,我不得不说 Nano Banana Pro 仍然是人工智能图像的王者。它们设定的标准太高了,很难超越。即使 GPT Image 1.5 接近了,它也肯定比以前的版本好得多。至少它们去掉了黄色色调,但仍然不够好,无法与 Nano Banana Pro 相提并论,后者太棒了。然而,这个新的 GPT Image 的好处是您可以免费使用它。接下来,这里有一些规格供您参考。这里说,“这个新的 GPT Image 1.5 现在正在向所有 GPT 用户推出,包括免费计划的用户。”所以,在 chat GPT 上使用这个新模型非常容易。只需单击加号,然后单击创建图像。然后您可以在此处输入提示或上传图像进行编辑。就这么简单。请注意,默认情况下它倾向于生成方形图像。所以,为了让它生成不同的宽高比,您还需要在提示中包含宽高比,如下所示。或者您可以写水平或垂直图像,如下所示。或者他们还在左侧菜单中添加了这个新的图像图标。所以,您可以单击此图标,然后在此界面上开始生成图像。所以,让我们快速尝试一下。cosplayer Rem 和 Ram 的自拍照片,来自 Re:Zero,做出 V 字手势,吐出舌头。在这里,我明确告诉它生成一个水平图像。这是我得到的结果。就像我说的,即使您使用的是免费计划,这也是完全免费的。现在在 Chadypt 上,如果您使用的是免费计划,您每天可以生成大约一打图像,然后达到使用限制。这每 24 小时刷新一次。除了 chat GPT,我相信还有各种其他第三方平台可以使用 GPT Image。例如,Higsfield 已经将 GPT Image 添加到他们的平台。这里有一些额外的规格供您参考。所以,这是高达 1.5K 的分辨率,目前您只能生成这些宽高比。所以,您不能做 16-9 或 9-6。这里有一些他们展示的额外演示。在这里,您可以拖放多个参考照片并将它们添加到照片中,如下所示。而且它在保持角色一致性方面做得非常好。您可以进一步编辑此图像,例如,通过在此处添加背景中的孩子。或者您可以将左边的人变成动漫角色,如下所示,将狗变成毛绒玩具,如下所示。而且它非常擅长遵循您的指示。然后您还可以让所有人都穿上这件毛衣,如下所示。但同样,Nano Banana Pro 也可以做到这一点。我最喜欢的一点是它们去掉了黄色色调。所以,以前版本的 GPT Image 有一种非常奇怪的黄色色调,而在这个最新的更新中,它终于消失了。它在渲染文本方面也非常出色。您可以将整篇文章输入到您的提示中,包括像这样的表格,它实际上能够非常准确地在照片中渲染整篇文章。它在创建图表和插图方面也非常出色。所以,这里有一个动漫风格的深海生物海报的例子。正如您所见,这个新版本比以前的 GPT Image 有明显改进。或者这里有一个关于世界首都的测验。这是新的 GPT Image。而这是旧的。现在,这是疯狂的事情。如果您查看这个名为 Artificial Analysis 的独立排行榜,并查看文本到图像排行榜,据称 GPT Image 1.5 是领导者,得分如此之高,这确实令人惊讶。对我来说,我认为 Nano Banana Pro 仍然明显优于 GPT Image,但据称它现在排名第一。与这个名为 LM Arena 的其他独立排行榜类似。请注意,这里的 GPT Image 1.5 排名第一,得分如此之高,比 Nano Banana Pro 高出近 30 分,这确实令人惊讶。然而,请注意,这只是一个初步分数,样本量比 Nano Banana Pro 小得多。一旦样本量变大,我认为它就会开始下降排名。就像我在视频中的测试中向您展示的那样,至少对我来说,我认为 NanoPanana Pro 的能力稍强一些。总之,这总结了我对 GPT Image 1.5 的评测。至少对我来说,虽然与以前的 GPT Image 相比有了巨大的进步,但它确实显示出更好的世界理解能力。它在写实性和提示理解方面有了很大的提高,而且它们去掉了黄色色调,这很棒。至少对我来说,它仍然不如 Nano Banana Pro。我认为谷歌设定的标准太高了,目前真的很难击败 Nano Banana。但请在评论中告诉我您的想法,以及您还能用 GPT Image 1.5 做出哪些其他令人印象深刻的生成。一如既往,我将密切关注顶级 AI 新闻和工具与您分享。所以,如果您喜欢这个视频,请记得点赞、分享、订阅,并继续关注更多内容。此外,每周 AI 领域都有太多事情发生。我不可能在我的 YouTube 频道上涵盖所有内容。所以,要真正跟上 AI 领域的所有动态,请务必订阅我的免费每周通讯。链接将在下面的描述中提供。感谢观看,下次再见。