Transcription
即梦(Dreamina)会员就白充了,即梦(Dreamina)废掉了。补齐了生图这块板以后,我觉得Gemini无敌了,天下无敌。
他说:“我不是骂你一个人垃圾,我是骂所有在座的各位全是垃圾。”你这一致性真的是惊艳到我了。他就是降维打击原生超长多模态上下文,你就说谁能够做得到?更要命的是,他最后还是用自己家的优化硬件去加速了这个过程,他的成本还比别人低一个数量级的水平。
我必须得抛出今天我最想问的一个问题:他既然把这个东西拿出来,那其他厂商跟不跟?能不能跟?
今天我们来聊一个话题,聊一根香蕉。嗯,哈哈,聊一聊Nano-banana,就是我们所谓的叫纳米香蕉。其实现在已经有正式名字了,对吧?之前我们大家还有人在猜,就是这个纳米香蕉到底是谁的。其实不说也知道,最后Google认领了嘛。
现在呢,Google是发了这个新功能,把它定义为什么叫Gemini,呃,2.5 Flash image。所以这个功能出来之后真的又爆了。我看到基本全网,包括就是中文中文网,还有说这个国外的互联网,都在谈这个事。就这个事有点像咱们当年,就是突然一下子做那期吉卜力,大家有印象吧?当时咱们做那个吉卜力那期,然后我翻了一下,那已经是4个月前的事了。怎么才4个月啊?我都觉得好久了,哈哈哈。那是说明我感觉像一年前的事。对,我感觉一年前的事情了。悲哀一天是世上一年是吧?哦,确实是感觉上发生了好多事情。但是就发生这么多事情,突然一下Google出了一个新的文生图的工具,就能引起这样的大的轰动。就是你们两位怎么看呢?尤其是小苏,我想听你意见,因为你你经常在做,用这个各种生图工具嘛。咱们这个封面经常会受到好评,然后呢大家都在问你怎么搞的,怎么搞的?
主要是老美工了,老美工加AI不就起飞了吗?但是我用的工具特别多,但这一次这个Nano-banana给我就是,就是直接就震撼掉了。
首先第一个就是,我觉得即梦(Dreamina)我的会员就白充了,即梦(Dreamina)废掉了。好像还挺贵的,哈哈哈,对对。即梦(Dreamina)的会员白充了,即梦(Dreamina)废掉了。
然后第二个就是,我觉得补齐了生图这块板以后,我觉得Gemini无敌了,就真的就无敌了。他真的天下无敌。就最后这块拼图补齐了以后,他从文本到推理到编程,然后到视频到生图,基本上就是一个水桶型的AI,没有任何短板。所以这个给我非常大的一个震撼就是,我觉得现在很多AI的工具是需要重构的。
比如我原本的一些工作流里面啊,我们的照片可能是需要到GPT里面去生图,然后还要换一个工具去抠图,然后再换个工具换一,哈哈哈,再换一个工具去做表情。对啊,对对对对。其实可能要跨四五个工具,但我现在发现,哎,那我就用这个Nano-banana就直接做完了嘛。对,所以我觉得这个太强了。总体来讲,我觉得啊,我觉得我非常佩服谷歌的这一套工程技术的能力。
那为什么之前不能有一个工具能满足你所有需求呢?主要是在,就是卡点在哪呢?
呃,是这样的,就是它分为创意,然后还有制作,还有输出嘛。那其实每个环节,它的专业性要求都非常高。但创意阶段其实无所谓,对,就是你随便用个什么东西生图,用手绘能画个草图出来,能够表达出你的创意,这个就可以了嘛。
但是实际上在制作的过程中,还是有非常多,比如说矢量图,你要有专门的矢量图工具,像Sketch、Figma这种专门做矢量的。然后比如说修照片,你要有Photoshop这样子的工具,去做这种效果化的精修,然后最后合成。所以这至少我觉得要四五个工具,才能够拼接为一个完整的我们现在的封面创意。对,嗯。那其实整个工作流是非常复杂的。
那到最后输出。输出的话,我们如果只是在呃网络上、手机上用的图片,其实还好。但是呢,你如果是要出街啊,上广告的那种,嗯,要打印的,那对DPI有要求,对格式有要求,对色彩色域、颜色空间这些都有要求。那这个东西就不是AI能做的,对吧?你你现在比如说我觉得像Nano-Banana,你让它生成一个2k的、多少分辨率的,或者定向生成一个什么一个格式的,这个还是做不到的嘛。就是你只能要求它一次生成,很难再返工嘛,对不对?但是我觉得他已经离生产很近了,就非常非常近了。他已经离生产非常非常近了。
这这也是我的一个感受。就像你说的,是的,很多人会把它看成一种工具。我看到很多讨论是说,未来可能会用它生成一些这个视频,对吧?或者说生成一些创意的、创意的产品。对对。那完全不一样了。对,就是你觉得就是说,嗯,它是在技术上有突破,还只是说在工具上做了加强,还是说在什么应用层面上,有了一种新的、新的应用方式呢?
啊,我补充一下哈。你刚才这个是一个很好的点,就是其实它有很多短板,是可以靠垫图来补充的。比如说,呃,像Nano-Banana,它的这个风格化或者精细度,肯定是没有GPT好的嘛,对不对?但是我可以拿GPT生成的风格来垫图,让Nano-Banana去做更多的多角度的还原,不同的这种角色动作,然后不同的这种啊,不同的图片的风格。对,你可以,你可以用一个就是GPT的风格来垫图去做,甚至你可以把它做出来的这个图,再拿去VEO3生成视频,然后也可以获得很好的一致性。对,所以我觉得就是赢麻了嘛,这真的是赢麻了。
他不需要那么辛苦,玩得很很花呀。对,先找张PPT的图,然后呢,把那个图再变成一个特别丰富的,就是创意的一个一个东西,然后再用这个去做VEO3的那个视频。然后因为三个视频只有8秒嘛,再把最后一帧拿下来,再做成再成转场图,然后再回来再生成视频,然后连起来之后整个小就成短视频了。我靠,对对对,玩得非常滑。
所以这个我觉得正好正好串一下这个小苏说的这个事情,来讲讲我怎么看这个。这小苏说这个垫图啊,原来我不是这个美工界的,我是工程界的,我都不知道垫图是什么。听起来我我以为是那个带电的图,后来才知道是电子的,电,电一个图,然后把它。我也是兼职美工好不好,我也不是很熟了。然后,对。
其实这个是正好是它底层的能力之一,三大能力都在这里面。那我我我想先说一下,我对这个Nano-Banana整体用下来的感受。其实最形象的感受就是,很像周星驰电影里面,大师兄进来以后说:“哎,你你是垃圾。”然后别人说:“你干嘛骂我垃圾?”然后他说:“我不是骂你一个人垃圾,我是骂所有在座的各位全是垃圾。”然后所有人都上来围殴他,然后每个人都被他打飞了。大概就是这个。大师兄我就想到这个。
为什么?因为我记得最前两年,呃,我是先用Stable Diffusion嘛,就是Diffusion扩散模型。然后自己在本地搭了半天跑起来,然后那个性能是挺痛苦的,要跑好久,最后才能把一张图从马赛克一样的图,慢慢地去造,最后变成了一个OK的图。呃,这是前两三年左右的时间。然后到现在的话,其实最底层的突破,就是说把Diffusion的这个模型呢,跟Transformer先做了一个合成,它叫做那个扩散型的这个Transformer。谷歌这边做的特别好的就是它把它又进了一步,变成了多模态的扩散型Transformer,也就是MMDIT这样子的一个架构。
那这个这个架构的话,其实就会特别牛逼。因为我们其实前面有特别分析过,谷歌的一个优势就是在多模态,原生多模态这个训练上。嗯,比如说你像Grok,或者是OpenAI的GPT、GPT-4o及后面的几代,他们在做这个扩散型Transformer,也就是DIT的话,应该都有造这个架构了。但是多模态的、原生扩散型的这个Transformer的训练,这个级别,现在应该是谷歌肯定是做得最好的。所以他的这个底层是特别夯实啊,他为这个图像啊、语言的整个表征,做了各种独立的这种权重的计算。
是不是说,我其实不是只是从文字信息去学习,然后再去生图,而是我说我,我就认识这张图里面的苹果,然后我也知道说这个东西文字上它就有苹果,它是一个更三维的一个知识。对,其实如果是苹果可能还是有点抽象,我觉得用人会更明确。比如说我们三个在一起,我们跟别人讲了,我们三个叫这个小苏、老修跟闲哥,但是没有给他们看我们的照片,或者没看过我们的视频,他肯定对不上我们三个谁是谁。但其实一开始告诉他们名字的时候,就是看到我们3个人,我们3个人每个人都自我介绍了一下,他全部都看到名字,又看到你,就越来越像真实世界的、现实发生的东西了,对吧?是的是的。
他在训练的时候,当然比我们想象的要复杂,就是他相当于是一个高维度的混合空间去训练。就是他的能把这些多模态的这些信号,反正全部都用模型能够听懂的方式给到他去训练,而且也专门为图像、语音这些东西做了他的权重。那那那这样子,他的整个的混合程度是非常深的。
那这是第一步,所以他就是能够把以前,其实Stable Diffusion这种扩散模型最痛苦的就是那个理解你的复杂语义,是很复杂的。如果你们看到过那个之前的这些模型的话,都是会非常非常长的、超精确的提示词和专业的提示词放在一起,才能生成一个看起来还不是很精准的东西。这就是因为它的只有一轮嘛,但是多轮又废掉了,对不对?对,就是,而且一轮也不容易做好,就是那个PS还要做得非常专业,就是比如说用什么样的贴图,用什么样的细节,都得讲得很好才行。而且生成出来速度也很慢。你这个是因为,就是不是这种混合在一起的那个架构做的嘛。
那那像像这种就是第一步,很重要的就是理解这第一个层次。后面还有两个层次。
第一个级别就是首先他能理解你的复杂语义了,这一点是很重要的,就是智力的最重要,这个这个就是智力的最重要的部分。首先能理解你想干什么,你到做的这个东西到底要做什么东西,先理解了。但是要做出来还是有另外两层的。
另外两层的话,就是讲的是说,他要能认识和记住你做的这个东西。因为你你描述的那个东西啊,通常来讲他不太可能全部都是,就是预训练就已经都知道了。他预训练只知道一个大概,但是他真的要按照你要求那个东西做出来的话,他有一堆的,比如说经典的,有那个劳拉的那个算法,还有一些学习啊,学徒学习的算法,还有i那个IP Adafter的一些主体注入的技术等等这些东西的话,他就能够保证认识和记住你。这个东西保证他有个一致性,他不是说现在看到是这样过,搞个两轮以后都不认识了,然后跑着跑着也记不住了,这些问题的话。
你这一致性真的是惊艳到我了。因为之前玩那个GPT-4o的时候,就就觉得中途很牛了,但是你玩两轮就废了,就跟小苏说的似的。就玩两轮之后,他就已经不知道在干嘛了,然后呢越生成的质量越差,然后让你就越崩溃。对,越来越崩溃。然后后面你就觉得从这个就是有趣的,变成无聊的,然后甚至说是是让你生气的,然后最后放下来之后心情变得不好了。但这回这个,这个Nano,或者就就叫这个Gemini 2.5的Flash吧,这个嗯,它生图功能真的太牛了,然后我真的玩了一下午都没玩够。
嗯,一个是这个,一个是前段时间,你看我我就玩了一个下午吧,弦歌还是弦歌。我如果用之前的GBT,这弦歌最后变成刘德华吴彦祖了,哈哈哈,变成吴彦祖了。哈哈哈,那也不错。温哥华吴彦祖是吧?哈哈哈,是。
那这个一致性就是老邱接着说,就是他这个一致性,他到底是通过算力来实现的,还是通过算算法来实现的啊?这个地方就很有意思。它其实后面还有一层,就我刚才说其实一共三层嘛。第一层是理解的这个架构,第二层是这个刚才说整个的一些注入技术,保证它的一致性。第三层是这整个事情串在一起一直跑下去,它还有个控制层。相当于我们得有一个更高级的一些监工也好,或者说执行过程中的各种优化也好,他去控制这个东西,他的那个准确度啊。他这边他就会去自动地去优化你的本来你写的不是很好的提示词,然后他会去把它做得很好,然后做得更适合底层的东西。知道。
还有一个就是刚才小苏提到的垫图,就是我们说的它叫参考图控制。它这个参考图控制,有一个专门的ControlNet的一个技术,去专门去控制这个参考图控制。那这个东西我就特别去试过了一下,很爽。那个我都做了一个火柴人图,就是做成这样,这个搞个比心的状态。然后,他就可以通过我手绘的一张火柴人图,去把这个图里面的人的动作都变成这个。然后你而且一致性特别强。
对,你这个你说,这我必须得插一句。就是当年我们看漫画的时候,最早看漫画说北那个鸟山明吗?鸟山明最厉害,画七龙珠吗?然后他特意搞了个鸟山明博士学学堂,就教怎么画漫画。然后有一帮人专门是做网格吗?所谓网格就是要把那个背景渲染啊什么都弄清楚吧。然后刚才就是老苏说,又突然脑子就就想到几十年前看的那个时候,当时觉得这工作太好了,能跟漫画家一起一起工作。然后现在觉得这东西太无聊了。其实很苦啊,那个工作非常苦啊。就是后来就知道很苦,但当时觉得哇塞,能跟漫画家一起每天工作,一起奋斗,创作这个传世佳作,多牛啊。那现在这个老苏老修直接比个,比个心,然后对比个是一个他,AI就搞定了他,他就搞定了你。
就过程中,我是过程中的。就是当时是做了一个图,我是搞让他去搞一个什么,我玩了一个游戏,什么刺客信条的那个,里面的那个都是刺客嘛,很严肃的。我让他怎么穿越到现代,然后到街面上搞个自拍。然后他们就来真的来个自拍,但是动作特别僵硬,人人也很凶。因为他原他们这里面原型,市面上能找到的那种,都是他很凶很酷的那种造型吧。让他们两个比个心,我要比个心他,他这个就就手绘了一个比心,然后他们就真的比了一个心。很好玩,而且是可以多张建图的。就你画一个你比心的草图嘛,然后再拿刺客信条的人物的图,然后再叫他生存在,比如说纽约什么第五大道,然后在马路中间比个心啊,类似这种。特别特别强,这个太牛逼了。卧槽,是的。
然后什么笑得不够好,跟他喊一句笑,笑灿烂一点,啪,下一秒就笑得很好了。就是很轻松,然后又很快。
这个就是第二,这个就是,还有一块,就是特别快。这点我不知道你们有没有,就咱们上一期聊聊那个,聊马马斯克嘛,对吧,聊擦边嘛。然后就说马斯克擦边,就已经刚讲这个事。对,刚讲这个事。但但这回这个Google这个,我靠,我没想到,就是说刚才咱老修说那么天花乱坠,那么复杂对吧,然后他还能做得很快,基本上几秒出图。就对,这这。我觉得马斯克那个是又黄又快,Google这个是又黄又快。对对。天下武功唯快不破,这两个都抓到了精髓。对对对。
这个其实也是我特别想说一下的啊。就我我一开始就特别好奇他,他这个速度太快了。因为我我刚才不是讲,最早我用Stable Diffusion那个,我在本地跑server,那肯定慢啊。那我理解,后来云端很强的,其实也没有办法很快。然后大家用那个GBT、GPT-4o也知道,要经常要这个几十秒的,十几秒甚至上分钟。十几秒算是快的,一般是几十秒的长情况啊,才能出。然后大家也习惯了,哎呀,搞个图过去,出去别的地方干一会再回来,对吧?就是就这个。等通知看着他一点点刷出来。对,反正基本上我觉得是尿跟尿回来,他肯定还没生成的。但是那个Gemini这个,我记得就是十几秒的时间,然后如果比较简单的动作,我感觉是几秒。比如说我就是说让大家笑一下呀,然后干嘛都不用,不用看垫图的那种,就是几秒就出来了。那一般在十几秒以内,大多数时候就是10秒以内就可以出来。哇,那这个特别的快。
然后我后面就去看了一下,他后面是怎么搞得这么快的。其实就很有意思,它是有两个事情。
第一个是,它有一个叫做潜在一致性模型(LCM)的一个东西,它是可以减少那个推理。就以前像这个Diffusion模型的它,它本身是呃,把一张图从那个噪点把它退,退到就是清晰的,一般要做25轮到50轮以上。那像他这种有优化过的,因为他是跟Transformer配在一起了啊。那配在一起的时候他做了一个优化,是他的那个步骤基本上能够减少到几步,就是十位数以内,到20,就是8到15步吧,大概是这样子的。然后那他这样子的,这个这样子的一个潜在抑制性模型的话,他就把这个推理的过程,还有速度都都减少了。
然后后面呢,加速又特别牛逼,他做了一个加速。他加速是怎么样?就是我们刚才说有这种模型以后呢,呃,还是不够快的。因为他这些模型很多是基于那个扩散的PDF模型做的。然后他就搞了一个我们在大模型经常听到的,叫蒸馏。他搞了一个潜在一致性的蒸馏技术,叫蒸馏技术。然后他这个蒸馏技术就会变到说,我这个虽然是学生,但是我做到后面就比老师快了,就大概是这样子的一个情况。然后他再加上一些其他的一些技术啊,比如说模型的压缩啊,硬件的一些加速,还有一些采样的路径什么优化等等的。就是他这里面的其他技术,就是辅助的啊,弄到一起啊,也会发挥了一些他自己自家的一些优势。
我帮老修讲一下啊。我就我听完老修这段话以后,我最大的感触,他就是降维打击,基本上那就是降维打击别人,就是全部。就是你看哈,从这个呃,我我我这几个词是一连起来的哈,大家罗列一下:谁能做到原生超长多模态上下文?哈哈哈,就这个事情。原生超长多模态上下文,你就说谁能够做得到?就你能做到超长上下文,这个事情已经非常了不起了。你还能做到原声的多模态加超长的上下文,然后在一个模型里面去做多轮的理解,然后生成再理解,然后在这一个上下文里面,然后还还还能够保持这么好的一致性跟速度。还更要命的是,他最后还是用他自家的优化硬件去加速了这个过程,他的成本还比别人低。据说最低的,可能能低一个数量级的水平。最低的某些环节全局用自家的TPU,成本比别人低一个数量级。你这个怎么跟人家搞?你搞不了啊。
对,你记得吗?就是我想问老师,这之前阿,阿里出了那个千万的那个图像编辑嘛,其实也一次性做得很好,就是就是两周前吧。对,嗯,对。他很鸡贼嘛,他在这个Banana Banana之前,他就赶紧先发出来了。然后先发出来就是他,我记得他里面讲了很多重点,就是除了一致性以外,他的这个叫做比如说汉语的这种书法,他的这种文字的理解跟还原,也都做得非常好啊。确实是这样。但是呢,呃,我自己用下来,我觉得它的一致性跟速度呢,其实是不如啊Gemini的。我还是会回到这个比喻上,真的好像一个大师兄把大家都打趴了,就是这种感觉。
我最早关注这个所谓的Nano Banana的时候,就是咱们上期咱们做那个嗯,马斯克那期嘛。然后我做调研的时候看到了,然后他最早不就是在一个国,国外的斗图,应该叫什么AI的一个一个Arena嘛,对吧,一个拼图网站,一个竞技场。竞技场上,对。然后大家在做,当时千万也是拿自己的生图工具去做嘛,然后呢也获得了一些好评。但是,但是,在那个时候其实就已经在说了,就说这个纳瓦丹呢,当时还没有说一定是Google的嘛,已经是就是碾压级的了嘛,对吧,有巨大的这个领先优势。
对,然后其实我必须得判出,抛出今天我最想问的一个问题了:他既然把这个东西拿出来,正式发布出来了,那其他港厂商跟不跟?能不能跟?就这个。
其他人会不会就像当时DeepSeek一样?对吧,当时DeepSeek是因为开源了,把自己的技术开源之后,无数人都开始,大家都开始在推理方面进行,就是更深度的研究了。那这回刚才小老修已经说了好几个,他的模型的这优化,以及很多地方的这种,就是说从技术层面到硬件层面的这种,这种升级。那其他公司呢,在生图这方面,或者说在这个层面上,大家跟还是不跟?还是会走出一个新的路线来?我很想知道会怎么样。
我觉得我觉得有分为两点。一个是我觉得Google的意不在此,就是你跟或不跟,I don't care,就跟我没关系。因为他是最后才放出来的。你看一下,别人是先放了一个很牛逼的生图模型,再放出一个什么视频模型,再这样渐进的嘛。但是Google,你想一下,他最近,你们去回顾我们最近做的节目嘛,他先做了什么?先做了虚拟3世界模型,然后呢又做了VEO3,对吧,视频模型反馈都非常好。然后完了以后呢,呃,在那个NotebookLM上面,又上线了这个video overview。对,然后又在那个即梦(Dreamina)上线了这个Storybook,就是生成那个儿童绘本。那个也太好玩了,我靠,我玩了三天。呃,其实那个东西上面,已经体现了非常好的一致性了。假设一个10页的绘本,你要保持角色的一致性跟风格的一致性,这个东西其实很蛮难的。而且它很快就能够生成。最最难的,我觉得还不是不是一致性和速度,是在你在修改的时候,我真的是对一个绘本连续修改了20次,然后他竟然还能保持,保持,就是说整个故事连贯性和一致性,而且他只改,真的是只改。我说那块,这这在这就是这,在GPT上是完全不能实现的啊。
所以问题来了,人家是把这些应用场景跟可能性都展现出来了以后,最后就是弱弱地丢了一个难道banana出来,然后我就扔了,扔掉出来,哎,认领一下。对,是我的。对。然后你们去调API嘛,你们就去调API就好了,还免费用。对对对对对。你们你们如果是做这种啊Photoshop,或者你们是阿多比,或者是什么哪一家做生图的,你们就调我API去用就好了。然后我我我结束了,我结束了。对,然后他他不care这个事情,对吧?
那第二个我觉得别人其实很难。我们刚才讲到了原生超强多模态上下文加上TPU,就这种是降维打击的碾压。我觉得这个是很难。哪怕你能够在硬件技术投入能够跟上,你别忘了他还有个巨大的生态在那里。我觉得这个Google这个生态其实是呃更要命的。他想是什么场景,他想是什么能力,其实在他这个生态里面我觉得都跑不掉。你像那个Notebook LM的就好了,他这个Storybook这个功能很快就出圈了,听说一个晚上生成200万本绘本,对吧?对对。是的,你你跟他怎么比啊?你还贡献了,都贡献10本了。对啊,哈哈哈。你跟他怎么比啊?
所以我我觉得我如果是别的厂家,我看到的其实就是赶紧追赶了,就是把他技术路线研究清楚,赶紧追赶了。
我问题是,我的问题其实就是大家跟还是不跟?追得了吗?就老修你觉得其他家能追得了吗?比如说GBT指,比如说Llama之类,他们会追,还是就首先会不会追?对吧,就是老小苏丹的意思,就是说肯定要追。那肯定要追,技术上能追得上吗?或者说从这个现在各硬件各方面的话,能不能再有优化的空间?还是说只能达到他现在的水平了呢?
我感觉要追是就是他们就是会比较慢,就是不会追不上。因为因为这个,因为这里面的技术其实不会说呃,全部是那种独占的哎,就是独占的,或者黑盒的。其实谷歌一直在干一个事情,就是它大部分的大的最重要的这些革新都是提前发论文,提前做很多事公开了的。只是你看谁能够把这个事情干出来啊。这个九阴真经不是藏着的是吧?就在那搁着。对,愿意翻就翻。对,翻。对对对对对。然后,对。
然后像我既然说我,我能查到这些资料,不可能大家各个公司自己专业的查不到这些资料,对不对?不然千问就不会提前发了,对吧?是的是的。就就因为大家解决的问题不在一个层面上嘛。其实这个所以还是要那个的。所以大家还是要要想要想办法,就是说找到自己的生态位,去解决一些问题嘛。对吧,就是你也不可能一家一家,这个他够强,所有的事情都能解决。其实也也没有到这个程度。只能说他的综合实力确实没有短板,这个人是是这样子的。
然后他的技术,其实我觉得说,哪怕是刚才讲到硬件的一个组合,呃,人家比如说OpenAI,其实呃,最近也在买谷歌的TPU啊。他也在买是吧?对,有在买,有在买,有有个地方有在讲,说他有在买一部分那个谷歌的TPU,在替代那个Nvidia的那个一些一些卡。大概是这样子。
就是我插播一个消息,就是类似这样的一些新闻,大家可以在YouTube来订阅我们的会员。那你可以获得呢,第一个,每天两封的JustSayAI早晚报,一个能够用听的AI语音播报。我们每天从2,000多条信息里面,帮你精选两封邮件,然后AI双人主播读给你听。每天呢,多听10分钟,少刷手机两小时,中美AI资讯零时差。我觉得这个是非常非常棒的一个感觉。棒棒,一定要拥有。对对对。
然后呢,你还可以获得我们每一次做视频的深度研究报告的文档,以及呢,获得我们三个人撰写的主播专栏的邮件推送。所以呢,请大家多多支持我们的YouTube会员。对,请我们的精神股东们、精神董事们尽快行动起来,加入我们。对对对。期待大家能用起来的话给我们更多的产品反馈,因为我们这边就是为了能够持续迭代,让大家都拿到自己比较满意的这个资讯。是的是的,是的是。所以请大家一定要,就是多多关注一下我们的频道,然后不定期升级福利,请不要错过。
这个这个我就是在那里面看到的,就是嗯,OpenAI是有大概三分之一吧,还是四四分之一的一个最近期的一个采采购里面,是直接在买TPU了。然后那个因为TPU本身也是定制的嘛,他就是可以去定制成他自己要的那个样子。那他因为TPU现在明显是已经在,就是说一些特定的环节,我猜像这个多模态里面,应该可能就是一个啊,现在不知道,因为这没有人披露啊。然后那个呃,他某些环节的优势已经是比Nvidia要好,就是比英伟达的那个要做得要好。所以这块的话,呃,我相信是有追赶的机会的,只是说他作为这个后来者,他的压力肯定会更大。因为毕竟你想,谷歌这边是从从头到尾全自己干了嘛,那这个他肯定会有他的优势。对,嗯。
哎,我我我感觉OpenAI它应该不是直接采购硬件,它应该还是之前迁移到一部分到那个Google Cloud上面,然后直接就是用它的这种硬件来做某一些,就是垂直领域上的训练呢。我我觉得可能是这样,就我的猜测哈,对。但是我觉得,在这种多模态的这种模型上面,应该Jeremy或者Google的基建是有非常,我觉得应该有非常大的优势的。就至少说比对比像Nvidia这这这这块的话。然后而且加上Google自己用,那好了,那我同样是卖API,对吧?那我的成本肯定是比你们低呀。对,哪怕你还是用我的TPU,或者用Google Cloud这一套生态去训练出来的,我成本还是比你低。对,所以我觉得他也Don't care。所以这里就是到时候会偏,会变成一种产品力的比比拼吧。
就我们对说谷歌强也吐槽过很多次了,他这个产品经常不好用,这是是正正常的一个情况。但是比如说我们就就油喷AI为例,你看上一次聊他那个吉卜力的这个破圈,他至少说他整个产品的那个体验上面,大家会感觉唉,还是可以的,对吧?在他那个框架里面。那如果后面这种呃,随着那个往接着往下走嘛,因为最近不是奥特曼也自己退,退下来了,没有做CEO嘛,他就专门去搞这个融资件大事。其中一件大事,就是要推荐他的那个硬件,AI的原生硬件,native硬件啊,不是说跟苹果的那个老哥啊,设计师老哥,可能要去搞一个突破性的硬件之类的。就是你可能会在有其他的体验上面去突破,然后背后呃,那你自己的这个模型也许没有谷歌那么强,成本没有它那么低,但是可以从别的产品的溢价上把这个东西挣回来吧。我觉得这个是这样。是是这样。
我我就突然你讲到产品这个事情啊,就我觉得,真的是产品是Google的一个短板啊,或者我觉得他们可能也看不起做产品这件事情吧。不是不是。
短的问题,你看你看OpenAI的图片啊,修图啊,你至少你把这张图打开,你可以圈脸,对吧?圈手,然后圈点哪里,然后让他做下一轮修改。你你不管这个是真的假的,就他有时候一次性是不好,你圈了也没用,圈了也没用。但是这个让我感觉是我在修图,你知道吗?这个对我有尊重。然后像Gemini,像Google这这些东西没有,什么界面都没有,什么工具界面都没有,就一个框,就一个文本框。对对,就是羞辱你,你直男他妈的把话给我讲清楚。对,别叫我做功能,他妈把话讲清楚,讲清楚了我才做功能。我只有商业价值,没有情义价值。很拽嘛,就很拽。
但是我觉得有时候我转念一想啊,我觉得这样也是对的,对吧?因为你在多轮的用户的这种对话里面去修改,其实你可以得到很多叫做负面反馈的这种数据嘛。那再用来做训练,包括像编程里面也是,很多用户过程的数据训练,其实非常好的。你像简易呃那个吉梦,他的这些数据是完全没鸟用的,因为是受限到模型的问题。你这个再给他提多少轮都是垃圾话,都是说你上一轮生成的,不像你再给我重新做一次,你这个一次性不好,你再给我做。他每次就都是重复的,这种没有价值的低价值信息。本质上在于它模型不好。所以我觉得他这个动机是在于说,可能他的信条里面,他会觉得说这个模型能溢出的能力大过天,就大过产品的能力。但是没有对错。我很相信,我觉得OpenAI是个产品公司,因为我觉得它的产品其实是做得很好的。但是我觉得Google它更像一个模型公司。这可能跟大家的常识有有悖哈,但我觉得就是体验下来,这是我的感觉啊。
嗯,但是啊,就说这个Google自己把Gemini这个生图功能升级之后,我觉得最紧张的其实不是各个模型大厂,不是各个AI大厂,是这个Adobe,是Photoshop。因为我看到,就是看到有人,就直接就叫它叫AI界的Photoshop吧。而且就是从股价上也反映出来了,如果对比过去就是四个月的股价的话,这个Google是往上走,然后呢Adobe是往下走。而且这个东西很很明显。
我看到一句话啊,就是我觉得很有代表性,就是说,大家现在对于公司估值的AI上面,主要集中在算力,还有就是模型的能力上面。而对于这些所谓的这种SaaS公司的估值,就变得很谨慎了。就AI SaaS公司,公司就变得很谨慎了。就这句话,其实反映出一个,我觉得一个时代的特点,就是大家会觉得模型的能力一出之后,一些SaaS公司所所所引以为傲的产品能力,或者说像产品的功能就不那么重要了。大模型顺到手可能就把这件事给做了。这也是之前我们谈论过一个,就说你一定要在大公司后面嘛,对吧,你去嗯他掉点什么东西,你捡起来都是好的。但你要在他前面,可能就被碾得连渣不剩。我不知道你们二位是不是也这么看啊?反正我就有一种深深强烈的感觉,就是真的,以后有了这个一两个好使的AI工具之后,好像其他的工具都没那么重要了。
没有,我我觉得我觉得不会。我分享一个,等下老师可以那个补充。我分享一个我早上听到我们的JustSayAI早晚报的一个观点啊。他说,现在的模型已经趋向白菜价定价了,然后deep呃,DeepSeek的定价已经是对标电费了。哈哈哈,但我不知道是真的假的。这个是音频,他自,自己有待有待核实。有待核实哈,有待核实。大家可以点进去看信息源。对,你可以对对对,听完之后点进去看我们的信源。我早上听完这个新闻,我还没去看那个具体的信源的参考啊。但是假设假设这个比喻哈,就是是到位的。那如果说DeepSeek定价都已经对标店价了,那其实就是做模型跟做SaaS,他其实就已经真的回到我们前几前,呃,去年在讲的,就是他就是提供底层能力了,给到这些工具厂商。模型厂商很好去调用,就真的变成云服务了。对,那我觉得还是又回到了,就是过去大家各显神通的时候了。
那至于像阿多比这种公司,真的是很难被AI取代的。对,就单单的在商业标准呢,在色彩标准呢,在格式标准上面,这么几十年积累下来的这种壁垒,然后工业的配套,整个上下游,我觉得没那么容易的,没那么容易的。
然后你最简单的就是你今天AI在做,做在手机上的图可以的,在电脑上图可以的。但这个东西你去做成户外海报,做成喷绘,做成印刷品啊,我觉得,这个还有很多工业化的标准的路要走。但是,他成为Adobe这样的工具里面的一环哎,我觉得那是很好的。至少说对于我做设计的人来讲,我是不需要再跳工具的嘛。如果你Adobe都集成了像啊,难道Banana这样的功能,我可以啊,直接的修图风国画。那我原本在耳朵比上面,可能10步的操作,变成两步,我也觉得很香啊。对,时间节省了,反倒变得更更便宜了,相当于说。而且你可以卖出溢价嘛,你在这个API的成本上面你加个30%、50%,你做好更好的产品的体验,你在你产品内模板做好你的上下文。我觉得这个钱我是愿意付的,就是这个溢价,我是愿意去付这个API溢价的。对吧,并不是说我,我就就是就是直接去用Gemini去解决所有问题。我觉得还很难,因为模型是模型,工具是工具。我这是小小苏,作为老美工还是对Photoshop情有独钟。哈哈哈,还是你不用Photoshop。我不用Photoshop。我不用Photoshop,对。
因为因为Photoshop我虽然我用得很熟,但我这几年我是完全是不用的了啊。对,所以我觉得这个东西已经,我不知道他在做什么了,就做得太臃肿。然后有一些风格化的过于专业化了,可能叫对对。其实Mac上面有一些更好的这种专业工具,稍微学一下也也可以。对,我其实现在是不太用Photoshop啊。最近一次我有冲动用是几年前,他在做了一个本地神经网络,可以支持抠图嘛。嗯,哈哈哈,但是但是我后面觉得安装实在是太麻烦了,我也不用了。我我后面就是用用那个一些原生的啊,Mac一些一些原生的功能,去解决这些问题了啊。嗯,对。
而且我我我说一下我对这个东西的观点啊。就是显哥问的这个问题,到底有没有可能后面变化那么大啊?我是想类比一下。因为我自己不常用这些工具,但我的观点是类比AI-coding一样,就是我们说的这个氛围编程。因为我自己在产研这一块,我觉得对AI-coding还是比较熟的。我我会相信跟这个类似,因为都是有工具属性的东西。
那AI-coding就是,我相信从二位看来,可能感觉,唉呀,是不是这个编码现在真的可以即兴编程一下,至少可以做一些东西了。那虽然我们聊过很多它的局限性,但是大家肯定觉得AI-coding确实已经可以做一些东西了。但从我们真正的实做实际做起来来看,AI-coding真的还是在,就是说让你的快速原型这个engineering这个过程变快。但是你真的要做一个呃,就是我们说的严肃的企业交付,对,真正的一个engineering工程化,就他还远远不够。就是他过程中间,你不管说用磕手Claude Code,还是你用直接用大模型Claude啊,或者说国内有DeepSeek啊,千万的coder等等,你不管用哪一个模型,再加上哪一个牛逼的IDE啊,AWS亚马逊的Kero什么的,都能可都可以。你全部搞上来,所有的工具,首先不可能一家工具摆平所有问题。第二,所有的工具,我现在还是拼凑在一起的,都很难摆平一个问题啊。对,头顶也是这样啊,一样的,很难的,很难的。
因为其实有工具的很多部分呢,它其实是不熟悉的。就是因为我们这里面的生产环节,工程化的生产环节有很多环节。每个环节,其实大模型首先预训练不够,第二就是过程训练也还不够,还在还在这个这个过程中。那就算都够了,我相信也会形成说,因为各家的数据不一样,预训练的数据和过程训练的数据不一样,最后这个工具还是各有所长的,你没有办法一家做下来。
那回到最近,我记得是OpenAI的那个,那个那个创始人,那个应该是Grok吧,啊那个,那那个唉,Grok应该是那位,那位老哥,好像有点忘了,还是叫叫什么名字。然后他他讲的一个事情,就是说他们看到的AGI也一定不是大家想象中的一个模型干所有的事情,还是多个模型凑在一起把你的事情给干了,只是你看起来他是一个东西而已。对,就我相信是这种,是这样的一个过程。也就是说,呃,你看到不管说再好的工具,它其实也是解决具体的问题的。那你要解决一个综合的问题,还是一个综合工具组合。是是是,组合的问题。对,这你就讲这个很好,这个启发就AI-coding的核心不是Web,是coding是要先会coding先会Web。对,它本AI-coding的核心还是engineering。那它现在解决的是快速原型engineering这个部分,其他总体的还得听老修。
当这段话让我想到咱经常说那个嘛,就是不要拿你的爱好去挑战别人的专业。就是虽然有些时候,比如你看用借助AI工具,我们可以把一个东西哎开始上手了,然后咱一是爱好级别,或者业业余级别的,但你不要觉得自己就能解决专业问题。对。
但是啊,我我想把这话题往回拉一拉啊。就这期节目可能快结束之前,往回拉一拉。就是当当你们看到,就是这个生图工具已经已经这么惊艳的时候,包括那个Storybook吧,我把这两个人放在一块来讲的话,就是就是AI的工具已经达到了这么好的一致性,然后能够做一些真正的创作了,把脑海中一些简单的想法,都能变成一些很真实的东西的时候,就是这个对于很多我们这种,就是升斗小民,我们这些普通用户来讲,是不是一个很好的机会呢?
你就就就以我自己举例啊,比如说以前我跟我,我回我跟我闺女玩的时候画画,她说让我哎,让我画个小兔啊,她来涂颜色。我画那兔子巨丑,跟耗子一样,然后呢被被就是被全家人笑话。但是现在有了AI工具之后,我可以直接在这上面生成一个。然后比如说这个Storybook上,前两天你介绍给我之后,我马上试了,真的是我从10晚上10点开始弄,一直弄到晚上3点多,我还不睡呢,太兴奋了啊。真的就是你看我举个我自己的例子,因为我家闺女不爱在幼儿园不爱喝水,经常回来时候水壶就是说只喝了一点点,让我们经常生气。但你又不能说跟他总是发脾气。那后来我就用那个故事画了一个,就说他他那个什么不喝水,结果着火了,然后然后呢,就是怎么怎么样的救火的一个小故事。然后他们同学们怎么变成一个消防栓,然后呢帮他救火的故事。那你说我有这个故事很好,我可能就是说那个,想给他告诉他一种就是形象化的东西,让他注意要喝水,别给别人添麻烦,别给自己添麻烦,尤其自己身体更重要。但是如果我以前靠说教是不行的,所以我做了一个十几页的小绘本给他。哦,看得嘎嘎的。用他的形象做的对吗?对啊,对啊。我直接上传,上传他和他小朋友的照片嘛,然后呢,就是包括他那个他幼儿园的情况嘛。所以他看着非常熟悉,他觉得,就说这个东西几乎在真和假之间了。he对他来讲,他觉得他太有意思了。然后第二天早起起来之后他他看嘛,他看完之后拉着他哥哥看,就是前前后后看了9遍。然后后来后来就说这件事,对就这件事。就是就是就是给我感觉就是说哦,我做了一件很伟大的事情。对我个人来讲我很有成就感。所以如果没有这个工具的话,我的这种想法永远只是个想法,不可能把它能够体现出来之后去影响别人。就是我只影响我的闺女嘛。但是有没我相信在中国,或者说像在我们中国文化里面,有太多文化瑰宝。然后呢,对,真的是,相当于就说我们深入宝山人不不自知。那这些东西以前可能很难提,就是传播出影响更多人。我们不说影响上亿人,上上上万人,你就影响10个人、100人都很难,对吧?因为你受到表达的局限,然后受到形式的局限。但现在有了这种工具之后,我是非常非常看好,就是个人表达的黄金时代的到来。
嗯,但是,就是独乐乐跟众乐乐是不一样的嘛。就我们独乐乐自己做,其实我们会特别有成就感,特别高兴,哪怕把打印出来分享给他的同学,一人送一本,这个事情都是非常好的一件事情。太好玩了。对,太好玩了。
但是你涉及到一群人,然后做一个产品给一群人的时候,这是一个工业化生产的流程,对吧?我最近看了一个国内的一个电影,叫《浪浪山小妖怪》,我不知道你们看过没有。我上上上,美国上海,对,上海那个美术电影厂的那个啊。我我我的两个感觉哈,就我觉得这个背后的团队很多可能是呃90后或者00后。我觉得他好多都是用这种表情包的这种语言来做这个动画的,跟观众的沟通。然后第二个就是他的整个风格化又很传统,然后就是大量的这种水墨,有点像我当时小时候玩到《天之痕》这款游戏的那个震撼,就是背景是水墨的,然后游戏是电子的啊。就是这种这种感觉啊,整个美感呢,风格化做得特别好。然后他在打斗里面我记得很很清晰,就还加入七龙珠的那种打斗的镜头,一个人飞到高空,然后放一个那个大招下来什么的,地板炸了一个洞。哈哈哈,我就觉得这个东西做的就是这三个东西合起来是一个很神奇的感觉。虽然我觉得故事的套路在工业化上面的套路不成熟,对。但是它的整个这种啊感觉让我觉得,哇,这个东西应该还要有更多这样的东西出来。
那这个时候我觉得单靠一个团队,一个故事,做三年做五年,我觉得这是不可能的。嗯,而且对对对对,有可能商业机会。如果时代如果以此为打样,然后让AI快速地介入各种的分镜脚本,然后去用它一致性的能力,赶紧介入这个这个创作的工作。我我觉得在工业化上面有非常非常大的空间。那原本比如说三年一部的这种动画,你又可以可能可以提效到一年。一年里面可能还有半年时间是在审核。那这个东西就我觉得就就太好了,就这个效率就就非常的高了。无论是在影视还是在游戏,对吧?往,甚至说在这个这未来机器人等等方面,在我觉得AI的进步,都是不只是就是一个量级的,一个量级是真的是指数级在往上增长。对,那这个是不能只靠模型公司的。你不能说我模型解解决了,一致性的能力,然后应用到工业化生产的时候我不管了,或者应用到工业化生产的时候Google派了一个团队去驻场给你搞,不可能嘛,对不对?还是要靠那些原本我们在画动画的过程中用到的那些工具,他自己去接入Gemini,去接入Google,接入OpenAI,去实现他在这个工具内的这种一致性。我觉得才是合理的嘛,对吧?否则Google是不可能去给你驻场搞这些嘛。想都别想助长。这绝对不可能。也不可能嘛。对啊,你不可能说我接了一个影视公司的大单,然后我Google去去帮你做,这不是他想做的事情。他我觉得他还是想卖模型。
你说那个是需要是三两年前,20年前这个这个叫什么,好莱坞的卢卡斯,对吧?工作室你还记得吧?给所有的这什么做做特效的这种工业化的方式。现在是AI时代了,真的是真的是再一次的工业,这这技术革命啊。所以要赶紧去解决精度啊,去解决这种这种商用的问题啊,而不是说噢,我们停留在一致性上面,然后大家再来卷模型。我觉得模型有个两三家够了,对吧?所以那些SaaS公司就赶快把API接好,对吧,在自己原有的优秀基础之上,再把好的工具用好,让更多人能够使用起来。
但我觉得这个可以让老修来讲,你你就算你是Adobe,你今天接入Gemini,你在你的应用内做到就是,就是有这种非常惊讶的能力,其实是还是很难的,对不对?对,当然当然非常非常困难。其实你就是这些顶级的模型,要用好其实就很很不容易了。我我还是会要类比编程领域,因为编程是现在最确定性最强,又能省钱又能省人力的东西啊,这样提高效率的。但是你实际上大家已经是默认Claude应该是做得最好的模型,但是问题是,能把Claude用好的程序员其实是很少的。嗯,其实是很少的。然后Claude Code它也呃作为它的一个,相当于是呃,更集成化的一个一个一个就是比比模型要更进一步嘛,相当于是个集成环境了一样的,一个一个东西。它也是很不容易被用好的。就是这个,还得不断地有Claude里面的人,不管是做大模型的,还是做Claude Code这个集成产品的人出来一直分享,哎呀,我怎么用这个东西,才会有更多的人来用。就是他还是是一个产品化的过程。那你看这些,即使他是发明者,他其实想要让别人用好他自己的工具,都不很都很不容易的。那你从一个外部的公司,要去用好别人的东西,其实整合也也是需要花这个精力的,都不是那么容易。而且是多模型的拼接的。对,就不是那么简单的。
有可能我一部分对,一部分用OpenAI,然后我怎么样让这两个模型的API很好的能够在我的产品里面同同时服务一个任务,这个事情我觉得是才是就是重点。而并不是说模型厂商干掉了应用厂商,或者是完全不是这么回事,不是这个的,对。因为这个的体验其实很深啊。我们刚才提到的这个,我们自己的这个JustSayAI早晚报这样这个小东西,我原来真的以为是小东西,我外部扣定一下搞出来了。问题是真正的把它做到能交付出来,给大家公开用,因为原来我们自己内部用嘛。能给大家公开用,我们搞了几个月,应该六六月份到现在了吧,这个都三个月了。然后里面用的大模型,我们用了5个大模型吧,这国内国外的全部都得用上,因为互相都有掉链子的时候。然后揭秘哪一个,因为我们的新闻也是涵盖全球的嘛,华语的加上那什么中文英文的都有嘛。对对,比如说Gemini,原来是想全靠Gemini,哎,这个就是个典型。原来就想靠Gemini全部干完了啊,对吧?然后确实他能干,问题是他不稳定,干一把就出问题了。知道干几把是出更多问题。然后后面还有一个,就是他的语音也不是很自然了。比如我们中国人听他的中文,还是有点别扭的,对吧?还是挺别扭的。而且一成不变的很多东西。那像这里面,最后我们还是会去组合中国的服务啊,像MiniMax啊等等,对吧?然后各种样的模模型拿出来用。那它最后才会好,嗯,才会觉得说这个产品基本上啊,过了及格线而已,也就是及格线。就这样我们还会这个产品,很多产品你单看界面Web就可以做出来,但是后台的拼接可能就得花好多的时间。对。
然后其实每个模型它掉链子的时候,你还都得考虑一些fallback。就是杰米奶不行的时候,谁去给他兜住?那国内的模型不行的时候,哪个国外的模型兜住他?这个是会有互相的一些兜底的策略在里面才行的。其实是时不时就会有些都出问题。你就像我们刚才说的,编码Claude最强,Claude每天都出incident啊。每天他那Claude四点几不行了,拿个东西又不行了。一会outage,一会他outage的时候你怎么办?就是他不能用的时候你怎么办?你这个时候正在生成,那你肯定得换一个模型赶赶紧干。所以这里面就是有一堆的很现实的那个工程化的问题。就是你你要保证这个产品的连续性,就我们自己产品服务的连续性,和生产的连续性。它这个就是呃,产品的工程化生产和工程化运营,都是,都是需要多多模型多应用去协作的。那大大家互相backup,这个产品才有一个稳健性。
所以回到闲哥刚才那个问题,我觉得现在这个Nano Banana出来的这个阶段,我真的是还是蛮兴奋的。就作为一个老美工嘛,对吧,大家。就是你要理解我这个兴奋,就是原本我十几十几步在Photoshop上面跨5个工具的操作,我可现在可能两个工具我就可以搞定了。我当然很高兴。但是这个事情,是让大家看到了一个希望,觉得说卧槽,我也可以。但是当你真的想去做的时候,你会发现这里面就是荆棘密布,对吧,前路漫漫。有很多,做的过程中你就会发现问题都来了,问题都在,都在这个过程。但是你不要看到一个结果是哦,原来我也可以。对。但我觉得可能这个过程还是路漫漫的。
对,但是我我个人角度觉得,有了这个工具之后让我信心满满。让我觉得以前就是憧憧憬了20年、30年的东西,因为从看漫画开始,就希望自己能画漫画嘛。然后呢,突然有一天真的能够上手参与去做,而且还能够影响别人。这让我真的在这个年纪,然后发现觉得自己又行了这种感觉。所以完全人最重要是什么?信心,对不对?
我我觉得最重要是,大家一定要开始用AI产品,无论你用哪一款,没有行,无论你想干什么,先尽快用起来。然后呢,最最重要的还是订阅我们的会员,每天从几千条信息里面,帮你精选出两篇的邮件,然后还可以用AI主播对话的方式播给你听。然后呢,每天多听10分钟,少刷手机两小时,中美AI资讯零时差。我觉得这个是非常非常棒的一个感觉。棒棒,一定要拥有。对对对。
然后呢,你还可以获得我们每一次做视频的深度研究报告的文档,以及呢,获得我们三个人撰写的主播专栏的邮件推送。所以呢,请大家多多支持我们的YouTube会员。对,请我们的精神股东们、精神董事们尽快行动起来,加入我们。对对对。期待大家能用起来的话给我们更多的产品反馈,因为我们这边就是为了能够持续迭代,让大家都拿到自己比较满意的这个资讯。是的是的,是的是。所以请大家一定要,就是多多关注一下我们的频道,然后不定期升级福利,请不要错过。
对,好。
那今天要不然先收在这吧,这个话题真是越聊越兴奋。嗯,好的,聊了好久了。大家主要啊,就是听,听完之后听了个乐。大家一定要看我们的会员,关注我们的会员。好,感谢大家,下期再见。好,下期再见。拜拜,拜拜。