📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Google’s New AI Tools Are Actually Insane (We Tried Them All)

Limitless Podcast24:20

Transcription

就在上周,谷歌发布了一些令人难以置信的新人工智能软件。我最喜欢的一个是这个叫做 LIIA 3 的新东西。所以屏幕上,我有一个音乐生成器,我实际上将用它来为我们创作一首歌。我在这里加载的是“为我们创作一首 2010 年代 Kanye 风格的体育场馆圣歌,关于 Limitless 播客”。我有点想做的是在我们讨论产品、讨论软件的同时,让它实时完成。所以,L 3,你在屏幕上注意到的,非常酷的是,你可以选择你想要的流派。你给模型一个提示,在给模型提供提示后,它会为你生成歌词、完整的制作,以及一首 30 秒的完整歌曲,内容是你想要的任何东西。是的,我看到一个有趣的例子,一位女士让她的丈夫洗碗,但她把它写成了一条信息,创作了一首歌并发送给了她的丈夫 Dan,然后播放了这首非常有趣的音乐。开个玩笑,我认为这不仅仅是一个噱头或新奇事物。你即将通过它刚刚生成的广告歌看到它的质量,但这可以完全取代音乐系列,至少对于 TikTok 的 30 秒片段或任何可能的东西来说是这样。>> 你准备好听了吗?我们的输出已经准备好了。>> 走吧。>> 哟,把音量调大。这是强制收听。Josh 和 EJ 在麦克风上。一个全新的愿景。25 分钟的下一级别 AI 对话。他们每次发布都会剖析未来。这不是一个播客。这是一场运动。感受能量。第一名。那才是我们唯一要去的地方。我们生活在一个无限的世界里。>> 是的。生活在一个无限的世界里。>> 世界上最好的播客。去告诉大家是 Josh 和 EJ。他们掌握着未来的方向。我们生活在一个无限的世界里。生活在一个无限的世界里。>> 哇。好的。甚至还有 outro。哇。好的。这相当不错。需要说明的是,这大约在 2 分钟内生成。>> 很快。而且制作效果很好。就像歌词听起来不错。这就像一首真正的说唱歌曲。我认为这是这项技术的一项新突破,即谷歌最近发布的许多工具实际上使创作者能够拥有一个强大的工具套件,让你能够创作音乐。比如,如果我们想要一首开场曲,我们实际上可以使用它,或者你可以对其进行修改,更改一些歌词,更改风格。但我认为真正有趣的是,你可以选择你想创作的歌曲类型,并将它们嵌入到你正在制作的任何内容中。所以 LIA 3 有第二个功能,是关于通过照片生成照片或生成歌曲。所以,我这里有一张寒冷多雪的纽约照片。昨晚我们刚经历了一场暴风雪,我将要求它创作一首反映这张非常雪景照片的情绪的歌曲。是的,我的意思是,我们昨晚处于暴风雪警告之下,封锁了。纽约的情况真的很糟糕。也许它会>> 跳过。>> 是的。没错。EJ 去佛罗里达了,但也许我们可以通过音乐来合成这种感觉。所以,我们拭目以待。这是谷歌非常擅长的事情,那就是人工智能的多模态性。它不仅仅是一个很棒的 LLM 或聊天机器人。它能理解视觉效果,比如视频和图像。它能理解声音。嗯,记住,这并不是他们之前创造的唯一一个声音模型。他们的人工智能可以进行实时翻译,可以将任何一种语言翻译成你想要的任何语言,我认为有 40 多种语言。嗯,他们在这方面有经验,而且他们的模型现在具有这种直觉和判断力,这种能力能够看到下雪天并说,“嗯,也许我会为它生成一首有氛围的歌曲”,这相当令人印象深刻。嗯,看起来我们已经有了。哇,这不到 30 秒。>> 是的。你准备好听了吗?>> 是的。播放它新的观看寂静的雪花。我正走在朦胧的梦境中。一个宁静、完美、孤独的场景。是的,我正走在这朦胧的梦境中。>> 好的。>> 好的。>> 你听了之后感觉怎么样?听起来不错。我觉得我听的是一种山寨的 Demi Lovato 式的“主角能量”的东西,我喜欢。而且,正如你所说,我认为这是谷歌独有的,因为他们拥有这些世界模型,他们对他们所看到的东西有理解,这种理解方式>> 我认为比标准的基于文本的语言模型更直观。另一个我玩这个的时候学到的有趣的事情是,他们有一个叫做 Synth ID 的工具。它是一个数字水印服务,嵌入在我们正在听的这些文件中。所以,如果你有一个可以检测它的算法,它就可以非常确定地知道 AI 被用来生成音乐,这对于版权和商标问题来说是好事。嗯,它的工作原理是在我们刚才听到的音乐中注入一个人类听不到的波形,我们作为人类无法检测到,但如果你将其输入到 AI 中,它很容易就能解密并告诉你这是 AI 生成的。所以,非常酷的东西。我真的很喜欢 LIA 3,我认为很多人会乐在其中。它是免费使用的,在 Gemini 中可用,而且,是的,对于那些想成为制作人或者只是想给朋友发一首有趣的生日歌的人来说,它非常有趣。嗯,嗯,听着。我的看法是,它实际上,我将收回我之前说的话。它可能不会很快取代音乐唱片公司,但对于 V1 或 V3 来说,你可以想象它在大约 6 个月后可能是什么样子。如果它以任何 LLM 的速度改进,那么这将是一件非常疯狂的事情。嗯,关于 Synth ID,Josh,我之所以在你解释它的时候觉得它很熟悉,是因为。嗯,他们也用 AI 图像做这个,他们会混合一些特定的像素来告诉你这是 AI 生成的。他们也用文本做这个,他们会微妙地改变一些词语选择来做同样的事情。我的问题是,或者说对我们俩来说,我们现在能创造出不这样做(嵌入水印)的模型吗?就像这是谷歌嵌入的水印,对吧?大概你可以创建一个模型,它只是>> 我猜是非法版权所有。>> 嗯,我的假设是,如果你能检测到它,那么你就可以逆转它检测到的东西。>> 对。>> 通过使用相同的工具。所以,如果一个 AI 能够意识到商标,它很可能能够逆向工程出存在的几个像素或那个波形,并将其完全移除。所以我怀疑它可能两方面都行。但知道这一点,拥有这一点,感觉很好。而且,我认为嗯,这很有趣,因为我们正在遵循这种趋势,即反向捕获,我们正在为 AI 构建东西,而不是为人类构建东西,这是朝着这个方向的又一步。嗯,嗯,我喜欢它的另一个原因是,嗯,如果你是一个正在听这个的音乐创作者,甚至是一个图像创作者,你可能会想,他们可能会窃取我的作品,而我却一无所获。有了这样的水印,它将可以识别你的属性或品牌,也许你最终会因此获得报酬,在某种目前不存在的未来系统中。而且它肯定比以前任何过时的版税系统都要好。所以,我不知道。我只是喜欢这项技术。我认为它不仅仅是一个水印。它非常酷。>> 嗯。是的。而且这并不是谷歌实验室唯一酷的新东西,因为他们还有另一个非常有趣的创作,他们通过谷歌实验室团队发布的,叫做 Pamelly。你想给我们介绍一下这个帖子说了什么吗?>> 是的。嗯,嗯,我不想说,但这是真的。从你产品的单一图像,你现在可以生成数千张照片,包括带有你产品的人物,不同的灯光和纹理,背景,所有这些都在几秒钟内完成。之所以说这是一个疯狂的事情,是因为有很多摄影师花费了大量的时间和专业知识来创作这些照片,而现在他们基本上失业了。我还会更进一步说,有很多时尚模特也可能因此无法受益。但我不得不说,这个功能太酷了。你可以从一个坐在家里的普通人,他订购或生成了自己的产品,到一个完整的广告网站,展示这些光滑的、不同的图像,这对我来说太酷了。>> 是的。我们有一些例子。我的意思是,其中一个我用在了 bankless 网站上,我们使用了它并发布了它,获得了数百万次观看,因为它真的很棒。它的作用是,你给它一个 URL。所以,如果你有一个个人品牌,如果你有一个网站,如果你有任何关于你的内容,你给它一个 URL,然后它就会填充这个商业 DNA 表格,显示你的标志、字体、颜色、你的标语、所有的价值观,并提取这种身份,然后你可以用它来创建营销材料。另一个有趣的例子是我们用 bankless 的东西生成的,是一顶帽子。我们的商品店里有一顶帽子,它只是一顶非常基本、单调的帽子,但我把它通过 Pimelli,要求它做一个产品拍摄,它生成的另一面令人印象深刻。它显示,是的,我们在这里可以看到,它有一个模特戴着这顶帽子,看起来像是专业拍摄的。灯光很酷。一切看起来都很真实。我真的无法,如果有人在杂志上或在 X 上滚动时给我看这个,我会认为它是真实的。在这里,Josh。这个家伙看起来非常真实>> 指示。而这只需要 30 秒就可以生成所有这些,只需给他帽子。然后它创造了这个史诗般的产品拍摄,这是一个有趣的英雄形象,展示了帽子,展示了中间的标志。而且,我认为,正如你所说,这是一个很多创作者会认为是一个巨大的障碍,因为获得这些专业外观的照片,聘请模特,拥有灯光和照片拍摄,成本很高。而现实是,如果你使用这个工具,这真的并不难。所以,我想我们可以做的是,我们可以尝试在现场使用 Pamell 进行演示 Limitless。所以我现在已经加载好了。我们可以确切地了解它是如何工作的,并创建我们自己的商业 DNA。所以,当你点击“走吧”时,它会要求你使用网站。我们有一个网站 limitless.banklist.com,如果有人想去看看的话。我会把它放进去。你会看到它需要几分钟。它会分析一切。它会点击并开始了解你使用的颜色、你使用的图像、你使用的文案类型。而在它思考的时候,也许我们可以多描述一下它是如何工作的以及它的用途。>> 是的。所以,大致的步骤是,你可以输入你的网站 URL,Pomelli 基本上会扫描你的整个业务,并提取你之前提到的,我猜是商业 DNA。所以,它会判断你的风格。它会了解你的风格,并且它是所有这些不同产品的核心。谷歌的模型在衡量情绪方面非常出色。嗯,所以它会理解你的语气、色调、字体、品牌标识等等。它会生成一个完全新颖的营销活动,这个活动以前从未为任何其他产品存在过,它是基于你通常喜欢的某种风格。嗯,而且,例如,在我之前工作过的公司里,Josh,我曾与大型营销部门合作过,他们花费了大量的时间和金钱来创作这些照片,衡量情绪。现在,我要说的是,好吧,我必须从另一面辩论,对吧?嗯,我见过很多关于这些产品拍摄的演示,一段时间后,你会看到一种相似的感觉和风格。一些产品拍摄和角度是重复的。所以,如果你想获得独特的东西,你确实需要非常详细地描述,并且要了解和看到你想要的东西。这支持了产品拍摄摄影师,他们已经有了想法和经验。就像电影导演一样。他们不会因为视频模型而失业。他们知道艺术性的镜头,他们只需要升级他们的工具包。所以我认为我们会看到类似的东西出现。我认为它还没有达到最终形态。我认为你是对的,因为它能让你达到 80% 的目标,但它不会给你专业的外观。所以,对于那些没有预算的人来说,这很棒。对于那些有预算的人来说,嗯,显然仍然存在差距,但你必须假设这个差距很快就会被填补。所以,它生成了我们的 DNA,你可以看到它已经在生成自动的图片,我们可以用来发布到 Twitter 上,让人们兴奋起来。我的意思是,它显示了掌握 LLM 的力量转移。它理解我们正在谈论的主题,趋势。嗯,Opus,深度上下文掌握。这让我想起了我们与 Nano Banana 进行过的现场演示。我相信这是在后端使用 Nano Banana,对吧?谷歌的图像生成模型,>> 我相信。所以,所以我们正在使用 Nano Banana Pro,我们将通过使用它进行照片拍摄来测试它。所以,我做的是,我偷了一顶小帽子,我要把它放进去,我们可以让它实时进行照片拍摄。这使我们能够生成我们自己的 Limitless 品牌图像。所以,我们会加载它,我们会把格式改为,比如说,方形。然后我们可以选择照片拍摄模板。所以,也许我们会选择平板展示并使用。嗯,然后我们会做两个这样的产品拍摄。我们会说它看起来不错,然后生成。现在,在我们生成的同时,我们可以谈谈,是的,也许是什么在支持这个。一个是 Nano Banana Pro,但二是,我的意思是,这也在使用 Gemini 3.1 Pro,这是新模型。>> 全新刚发布。嗯。很多新的发布。嗯,我还在看 Josh,典型的产品照片拍摄的成本。从 500 美元到 5000 美元不等,高档的。而我们在这里看到的很多图像都属于高档。需要一段时间才能在后期制作中进行编辑,并使事物真正清晰。所以,这非常令人印象深刻。嗯,让我印象深刻的是,它对很多不同的地区都可用。所以,通常当谷歌发布其 AI 产品时,它们只在美国可用,但它在美国、加拿大、澳大利亚、新西兰都有。所以,想想那些现在可以获得一个成本只有几美分而不是数千美元的工具的人们。这太酷了。>> 嗯。是的。嗯,这太棒了,而且我认为这是他们朝着那个方向发展的证明,那就是为任何在那里工作的人提供完整而彻底的价值创造。他们有他们的编码代理,他们有他们的 IDE,他们有他们的视频生成 V3,他们现在有音频生成,他们有品牌和品牌 DNA 以及营销和对其的理解。而且真的没有哪个行业能逃脱这些工具的影响,随着这些工具的不断改进,它们将变得更加熟练和更加优化,因为它们试图不是取代这些工作,而是增强和扩展在这些领域工作的人们的能力。但是,让我问你这个问题,Josh。你今天对所有这些产品整体感觉如何?因为我的看法是,它们单独来看都很棒,但我想要一个能够为我管理这一切的完整套件。而他们正在朝着这个方向努力,对吧,与 Google AI 套件。>> 嗯。是的。将有一个单一的综合工具,包含所有这些东西。而且,这很令人兴奋。所以,我们有这里的输出,我没有加载标志,我也没有要求加载标志。所以,也许这就是为什么我们的标志实际上不在那里。但是,我的意思是,正如你所说,你可以看到我之前给你看的 bankless 的那个看起来和这个非常相似。是的。>> 而且模特看起来和上一个有点相似。而且你可以看到,有一些,我猜,一些限制和局限性,涉及到输出的质量。但是,能够如此之快、如此容易地获得如此好的东西,真是令人印象深刻。而且它是一个有趣的工具。嗯,就像我们之前提到的,在后台,Gemini 3.1,它在上周刚刚发布。嗯,关于它,有好有坏的消息,所以也许我们下次应该谈谈。是的。好的,让我们回到穿戴整齐。嗯,先生们,我们必须进入 LLM。嗯,谷歌发布了一个全新的模型,在纸面上它相当令人印象深刻。嗯,我在这里屏幕上展示的是 ARC AGI2 基准测试。所以,为了提供背景,有一个 ARC AGI1,但模型变得如此之好,以至于他们需要创建一个全新的测试来确保这些模型实际上变得更聪明。所以,ARC AGI 2 是一个设定的基准。我只想关注一点点差异。而我说的“一点点”是指很多。这是>> 超过两倍。>> 超过两倍。这是比 Gemini 3 Pro 高出 46 个百分点的增长。我想指出的是,这是一个 0.1 版本更新。我们从 3 升级到 3.1。这甚至不是 Gemini 4。我们已经看到了如此重大的智力和推理飞跃。我之所以查了一下,实际上,只是快速看一下,它是在 2025 年 11 月 18 日发布的。所以,这不到 4 个月。坦白说,这些模型更新的迭代周期令人震惊。嗯,我们已经谈论过 Claude Opus 4.6 和 chatgbtd 5.3 codecs。这些是来自 anthropic 和 openai 的新编码模型。它们在同一小时内发布,而它们之前的模型版本更新是在此之前的 3 周。所以,这些模型以惊人的速度改进的事实并不能让我感到惊讶。其背后的秘密是,这些模型很可能在自我工作,也就是说,它们在审查自己的代码并更新自己,这是一个可怕的话题,我们将在以后讨论。但回到 Gemini 3.1 Pro,嗯,它在两个主要方面取得了巨大飞跃。第一,你在这里屏幕上看到的是 AGI 2,嗯,推理,所以它能理解你在说什么。它深入挖掘你的提示,并给你一个深思熟虑的答案,再次在纸面上。另一件它非常擅长的事情是编码。它在生成视觉效果方面非常出色,特别是使用代码,并且能够理解你创建的模拟的物理特性。但我必须指出,人们在实际测试这些东西时,有很多负面反馈。所以,我刚才解释的都是纸面上的,但在实践中,人们观察到推理实际上会自我否定。它开始进入这些思维循环,开始怀疑自己,质疑自己的答案,而你最终会等待 10 分钟才能得到一个本来很简单的问题。然后,其他人的经验是,当他们使用 Web 应用版本访问 Gemini 3.1 时,它实际上是一个功能大大降低的模型,它只是同意他们。所以,这听起来很像 GPT 4,它以非常随和而闻名,而 OpenAI 上周已经停用了它。所以,有很多混合的评论。有一些很棒的例子来自伟大的杰夫·迪恩。他在这里向我们展示了一个例子,左边是 Gemini 3 Pro,右边是 Gemini 3.1 Pro。正如你所看到的,SVG 生成是一个鲜明的对比,对吧?嗯,物理效果非常酷。动画,看看这些东西的背景。太酷了。这是一个关于某人使用它进行城市规划的非常酷的演示。我将静音,以便我能在这里向你展示开始。嗯,它只是超级酷,它如何映射、跟踪和弄清楚空间意识。它是一个非常空间敏锐的模型,这对于创建游戏或任何模拟演示来说都非常酷。但是的,人们的实际反馈并不那么好。>> 看到这些模型在主要版本之间的演变很有趣,因为我的意思是,在这些增量版本中发生了什么?它们没有进行大规模的预训练循环,它们没有构建一个全新的模型。它们采用现有的核心模型,并在其之上进行构建。你会发现,这些增量模型在某些不同领域会变得“尖锐”。所以,有些在某些方面要好得多,但代价是它会变得更糟。我的意思是,一个很好的例子是 GPT 4.5,我想是这样,它被训练成一个优秀的作家,但它实际上在其他所有方面都非常糟糕,而且非常昂贵,以至于他们不得不贬值它。我认为,在这些增量演变中,3.1 是其中之一,他们试图改进它们,它们在某些领域确实会改进,但在某些意想不到的领域,整体质量实际上会下降。所以,每一个都有自己的个性和技能。总的来说,它们更好,因为它们经过了提炼,并被浓缩成一个高度精炼的模型。但我们也会看到一些缺点。我认为这就是这些增量版本发布的自然组成部分,即随着时间的推移,从那个庞大的核心基础模型中观察这些模型的演变。>> 我从中学到的主要教训是,我认为我们很早就学到了,就是不要相信基准测试。只相信你自己的经验。显然,不同的人以不同的方式使用这些模型。嗯,我认为这不是谷歌的终结?不。但他们确实取得了一个巨大的连胜,这可能让他们稍微放缓了一点。嗯,好消息是,我听说 Gemini 4 正在酝酿一个绝对的巨头。嗯,我喜欢的是,他们正在整合。是的,我喜欢的是,谷歌正在将许多这些模型整合到一个单一的界面中。我之前提到过。让我恼火的是,我需要去一个地方才能使用 Nano Banana,我需要去另一个地方才能使用 V3,他们的视频生成模型,然后我需要去另一个地方才能访问 Gemini 3.1。有时可以通过 API 访问。有时通过 Web 应用。有时是随机免费通过谷歌搜索。所以,我想,我只想去一个地方。我会付钱给你。只要让我把所有这些东西结合成一个体验,这就是我想要的,就像一个单一的价格,一个单一的 Netflix 订阅。而他们正在朝着这个阶段迈进,我认为这很棒。所以,我的猜测是,也许他们在这里搞砸了,因为他们专注于所有其他事情。嗯,我想提到的另一部分是谷歌的发行量简直是疯狂的,通过其他两个功能 LIA 和 PLI,他们能够在第一天就将这些分发给数千万人,而这种反馈循环是不可低估的。所以,虽然谷歌可能有一个初步的反应,但他们是第一个反弹的。不要忘记谷歌两年前的样子,当时他们拥有最糟糕的人工智能模型,而现在他们几乎是在争夺王位。所以,我不会排除他们。这很酷。是的,感觉就像 Adobe Creative Cloud 套件的超级增强版,为谷歌和创作者。而且我认为这是我真正感到兴奋的事情。而你今天在这些演示中看到的,是真实的技术,它就在这里,并且正在非常非常快速地改进。所以我对 3.2、3.3 和 4.0 感到兴奋,无论何时到来,我相信它都会震惊世界。但这结束了我们有趣的小演示日。我鼓励你去尝试这些东西。我的意思是,很多东西都是免费提供的,这很酷。你可以去测试一下,创作一首歌曲,发给你的朋友,嘲笑他们。无论是什么。这是一种有趣的方式来帮助创作者,帮助营销人员。嗯,这些工具很棒,而且它们来得如此之快。所以,如果你喜欢,请不要忘记,分享给朋友,订阅我们的新闻通讯。它每周两次,每周都发布。上周,我们度过了最棒的一周。我们从未有过比上周更多的观看次数。所以,使命正在实现,这要归功于你们分享给朋友,喜欢它,评论它,在你们最喜欢的播客平台上给予五星评价。在我们结束之前,有什么最后的提示吗?我有一个小小的反馈。抱歉,不是反馈。我有一个小小的家庭作业给那些有能力的人。嗯,我非常想听你们的音乐创作。嗯,甚至你们的产品照片拍摄。所以,试着在 Twitter 上找到 Josh 和我。我们会把我们的用户名或个人资料链接放在下面。嗯,然后给我们发私信。我想听听你们的一些创作,因为我真的很想知道人们能有多有创意。嗯,也许是一条分手短信,或者也许是告诉你的女朋友,我不知道,在你回家之前做点什么。我不知道。我晚些时候会尝试一下,看看是什么样的。但是,是的,让我们知道你们的创作。我想看看你们在做什么。>> 太棒了。感谢您的观看,是的,我们将在下一期节目中再见。在街上。整个世界感觉完全是新的。每一个声音都又轻又低。看着寂静的雪花。我正走在朦胧的梦境中。一个宁静、完美、孤独的场景。是的,我正走在这朦胧的梦境中。走在这朦胧的梦境中。