📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

China's Seedance AI: Collapsing Hollywood's Economics with Unmatched Speed

Deep Dive Global30:07

Transcription

我最近和一位来自广东的开发者聊天,他给我看了一段手机上的视频。他脸上带着一种平静、近乎诡异的满足感。视频只有10秒钟,但感觉像是一部大片,从史前洞穴到霓虹闪烁的现代都市,一气呵成,如电影般流畅。摄像机的移动如此流畅,纹理如此逼真,以至于我发现自己眯着眼睛盯着屏幕,试图找出数字的痕迹。他告诉我,他没有使用相机,没有使用团队,甚至没有使用剪辑软件。他只是在Bite Dance新推出的Cance 2.0的测试版中输入了几个句子。对他来说,这不仅仅是一次技术更新。这是一次彻底的权力回归。他不停地说,这给了他导演级别的控制权。他几乎欣喜若狂,因为人工智能和现实之间的界限终于模糊到了看不见的程度。他认为这是普通人的胜利,是让专业电影行业看起来像过去遗迹的一种方式。但当我提到行业老兵们的担忧时,事情发生了急转直下,那些人的毕生心血突然被一个基于他们自己数据训练出来的算法模仿。我提到了像游戏科学CEO这样的人发出的关于深度伪造和传统工作流程的巨大颠覆的警告。立刻,他的表情变了。兴奋变成了某种更冷漠的东西,一种超然的实用主义。他争辩说,如果老一辈跟不上地球上最好的视频模型,那么他们的时代就结束了。从庆祝技术之美到几乎不顾其颠覆性的人力成本的突然转变,令人震惊。这让我意识到,推动中国媒体股票飙升的炒作不仅仅是关于更好的视频质量。它是一种日益增长的、近乎激进的信念,即电影的传统工艺正在被一个提示框所取代。这让你留下一个挥之不去的问题。当逼真触手可及,图像的真实性又会怎样?>> 那确实是一个令人震惊的转变,不是吗?但你知道,那位开发者的反应,那种你描述的从“看我做了什么精美的东西”到“要么适应,要么死亡”的转变,确实是我们现在所处的整个时刻的心跳。>> 感觉如此临床,如此迅速。>> 它很冷酷。它很实用,而且它正在以令人难以置信的速度发生。他不仅仅是给你看一个很酷的应用。他给你看的是一场巨大的技术和经济变革的终点。感觉不像是一个工具,更像……这是否太夸张了?>> 从经济角度来看,我们绝对不仅仅是在看一个很酷的新视频生成器。你看到的是一次非常具体、非常深思熟虑的技术飞跃的结果。而他手机上那部大片的引擎,赋予他力量的东西,就是Bite Dance的Seance模型。>> 完全正确。>> 我们这里有Seance 1.0的第一个版本的技术报告。当你把它和关于Bite Dance更广泛的人工智能战略的其他一些报道一起阅读时,故事就变得比仅仅制作电影要大得多。>> 对吧?因为通常,你知道,当我们谈论人工智能视频时,它一直是一种新奇事物。它是一种模因。你看到这些有趣的扭曲剪辑,威尔·史密斯吃意大利面什么的,但这感觉完全不同。那位开发者没有笑。他没有觉得好玩。他感到赋权了。>> 完全正确。而这种赋权感是我们需要的深入剖析的。嗯。>> 要真正理解他为什么会有这种感觉,你必须深入了解。>> 所以,为了这次深度剖析,我们将把它分解为三个核心领域。首先,我们将看看我们称之为效率引擎的东西。这是这一切的纯粹经济学。这项技术如何彻底降低了生产成本。>> 它是如何工作的以及为什么它如此便宜的细节。>> 然后,第二,我们需要谈谈数据堡垒。这是中国在训练这些模型方面拥有的巨大国内优势。那是引擎的燃料。>> 好的,燃料。第三,我们将看看速度。这是关于这项技术从研究论文到商业产品,不仅出现在手机上,而且正在改变汽车和电视工作方式的纯粹速度。>> 所以,我们今天的任务基本上是弄清楚为什么传统行业如此恐惧,以及我想为什么那位开发者如此自信,近乎傲慢。>> 那么,让我们从第一个点开始,效率引擎。他一直说的那个词,我一直记着,导演级别的控制。>> 这是一个绝妙的词。这是营销,但也是事实。但要理解它,我们需要暂时抛开情感,只看可量化的数字。>> 在电影行业,控制只是金钱的代理。>> 如果你想要控制一个镜头,你想要特定的灯光,特定的摄像机移动,特定的服装纹理,你就要为此付费。>> 你要花很多钱。>> 你要雇佣一个50人的团队。你要租一个录音棚一个星期。你要付给一家视觉特效公司数百万美元,然后等6个月。控制是媒体中最昂贵的商品。>> 控制是昂贵的。混乱是免费的。你只需举起手机拍摄。那是免费的。完美的控制的推拉变焦镜头则不是。>> 而根据这份技术报告,Cance所做的就是将完美控制的边际成本推向零。让我们来看看他们发布的基准。>> 让我们看看。他们在这里声明,该模型可以在短短41.4秒内以全1080p分辨率生成一个5秒的视频。>> 41.4秒生成5秒的高清视频。>> 而且这并不是在某个假设的未来超级计算机上运行,而是在商业上可用的GPU上运行,一个Nvidia L20。>> 一个L20。我不是硬件专家。那是一个顶级的芯片吗?>> 不是。这才是真正疯狂的部分。它当然是一个坚实的商业级GPU,但它不是绝对的前沿,你知道的,被禁止出口的那种。这是在可获得的硬件上实现的。>> 所以,请帮我理解一下规模。在人工智能和渲染领域,41秒是否令人印象深刻?>> 令人惊叹的速度。我的意思是,很难找到一个恰当的比较。如果你想到像《阿凡达》或一部大型漫威电影的传统3D渲染,一个单独的帧,也就是电影的1/24秒,可能需要数小时才能在庞大的服务器农场上渲染出来。>> 一个帧需要数小时。而这个在41秒内完成了120帧。>> 你看到了差距吗?这不是渐进式的改进。这是一个不同的范式。即使与上一代人工智能视频模型相比,它们可能需要几分钟才能生成一个低分辨率、有故障的3秒剪辑,这仍然是一个巨大的飞跃。报告本身明确提到了10倍的推理速度提升。>> 10倍的速度。所以我们谈论的不是性能的小幅提升。我们谈论的是比我们一两年前认为可能的事情快了一个数量级的东西。>> 完全正确。你必须考虑这种速度对创作过程的影响。内容创作不再是繁琐、预先计划、极其昂贵的流程,而是变成了一种对话。它是即时的。>> 是的。如果你不喜欢你史前洞穴场景的灯光,你不需要打电话给灯光师和摄影指导,安排下周二重新拍摄。>> 你不需要再花费一天的渲染时间和数千美元的计算成本。你只需要调整提示。从左边更具戏剧性的晨光。>> 嗯。>> 然后你等40秒。这完全改变了创作的心理。没有风险,没有实验成本。>> 这就是我们所说的卓越的机构效率,我们在笔记中看到的那个短语。这不仅仅是一个有才华的开发者。这是工具本身消除了物理、物流、时间、金钱的所有摩擦。>> 所以,这就是生产成本崩溃的地方。想想像B-roll素材这样的东西。>> 完全正确。一位纪录片制作人需要一个日落时分繁忙的城市街道的镜头。通常,他们需要雇佣一名摄像师,获得许可,等待合适的光线,或者从素材库网站购买昂贵的片段。>> 而那个素材库的片段可能需要数百甚至数千美元才能获得几秒钟。>> 但有了这个,你只需要输入“日落时分繁忙的上海街景,黄金时段,小雨”,你就能以电力成本获得它。>> 花费几分钱。而且这不仅仅是一个通用的镜头。这是你想象中的精确镜头。素材库、勘景、二次制作单位的整个商业模式。它面临着生存危机。>> 这就是游戏科学CEO警告的巨大颠覆。这不是未来的威胁。听起来它已经来了。但我想稍微技术化一点,因为我仍然有点怀疑。工程总是有取舍的,对吧?快速、便宜、好。你只能选择两个。通常当你让某件事更快时,它就会变得更丑陋。质量会一落千丈。但广东的那位开发者说他眯着眼睛找痕迹。那么,他们是如何在不把视频变成模糊、有瑕疵的混乱的情况下实现速度的呢?>> 这就是工程策略变得非常、非常激进且坦率地说非常聪明的地方。报告详细介绍了一些关键的技术创新,但其中最关键的一个是他们称之为“薄VAE解码器”。>> 薄VAE。好的。我知道VAE是变分自编码器,但请解释一下。它实际上在做什么?>> 把VAE想象成一个非常非常复杂的数字搬家公司。[鼻息声] 当你想搬家,而房子是你的视频文件时,你不会把整个房子一次性搬走。>> 对吧?太大了。它装不上卡车。>> 它装不上卡车。计算成本太高了。所以,你把它拆开。你把家具装进扁平的箱子里。你给所有东西贴上标签。你把房子压缩成一种密集、紧凑、编码的形式。在人工智能中,这被称为潜在空间。>> 好的?所以,人工智能在潜在空间中处理那些打包好的箱子,因为它比整个房子更小、更容易处理。>> 人工智能可以重新排列箱子。它可以改变装饰。它可以移动墙壁,所有这些都在压缩状态下进行。它非常高效。但过程结束时,你必须拆开。>> 你必须把箱子变回房子。>> 你必须把那些潜在的代码变回数百万个我们实际上可以在屏幕上看到的像素。那个拆包过程就是解码器的任务,而历史上这是一个极其繁重且缓慢的过程。需要大量的计算能力才能完美地重新充气。>> 这是整个系统的瓶颈。>> 这是一个巨大的瓶颈。所以,Bite Dance的工程师们看到了这一点,并说:“好吧,我们的目的地搬家公司太慢了。我们需要一个更快的团队。”>> 他们设计了他们称之为“薄解码器”。他们对整个神经网络进行了分析,并意识到过程的最后阶段,最接近生成实际像素的部分是拖累整个系统的部分。>> 他们也太。>> 完全正确。所以他们系统地缩小了那些最后层的通道宽度。他们基本上让解码器节食,修剪脂肪而不触碰肌肉。>> 如果你缩小通道,会不会丢失信息?家具会不会在从盒子里拿出来的时候被刮花?会不会丢失细节?>> 这就是魔术。这就是创新的核心。报告声称他们在那个特定的解码过程中实现了2倍的速度提升,而视觉质量没有可察觉的损失。他们找到了一个方法,可以如此高效地简化数学运算,以至于人眼根本无法分辨出区别。但这只是速度方程的一半。另一个主要驱动力是他们称之为“轨迹分段一致性蒸馏”或简称TSCD的概念。>> TSCD。好的,现在我们真的进入了字母汤。>> 听起来超级复杂。我知道。但核心思想其实相当直观。这都是关于导航。想象一下人工智能生成图像就像一个司机试图从A点到达B点,A点只是静态的随机噪声。>> 就像电视雪花。>> 就像电视雪花,而B点是一只猫的清晰成品图。一个普通的扩散模型,标准的做法是采取微小、谨慎的步骤。就像一个司机每10英尺就检查一次地图。我还在正确的路上吗?它现在看起来更像一只猫了吗?现在呢?它可能需要一百甚至一千个这样的小步骤才能到达最终目的地。>> 这是非常安全和有条理的,但极其缓慢。>> 痛苦地缓慢。TSCD就像给司机一个更好的内部GPS和更多的信心。它将整个旅程,从噪声到图像的轨迹,划分为几个大的部分。它迫使模型学习穿越每个部分的捷径。所以,它不是每10英尺检查一次地图,而是学会一次自信地驾驶一英里。>> 所以,不是一千个胆小的步骤,而是学会大胆地迈出四五步。>> 报告说,这项技术可以将扩散过程加速4倍。所以,当你结合一个使解包速度快两倍的薄解码器和一个使地图导航速度快四倍的泰迪大脑时,你就得到了那个头条数字。你得到了那个41.4秒的生成时间,激进的效率提升。>> 这就解释了速度。但这仍然留下了开发者声明的另一部分,即导演级别的控制。因为正如我们所说,人工智能视频通常感觉像是在赌博。你要求一只狗追球,有时你会得到一只猫,或者狗有六条腿,或者它融化在草地上。它是随机的。这位开发者觉得他自己在指挥。>> 而这正是连贯性问题。多年来,它一直是人工智能视频生成的阿喀琉斯之踵。而Cedence报告正面解决了这个问题。他们详细讨论了多镜头叙事能力。>> 多镜头叙事能力。这听起来像是一个旨在让好莱坞高管拿起电话的短语。>> 他们绝对是100%在争取专业的讲故事的人。该模型不仅仅是为了制作一次性剪辑而构建的。它明确设计用于支持跨不同连续镜头的一致的主题表示。那么,在实践中这意味着什么呢?嗯。>> 如果我生成一个角色,我们称他为一位穿着经典风衣的侦探,我想要一个他看起来担心的特写镜头,然后我想要一个他走在雨街上的广角镜头。>> 在两个镜头中,他看起来都会是同一个人。>> 同一张脸,同一件外套,同样的整体外观和感觉。报告展示了这方面的例子,比如对话场景中的经典镜头反拍。一个角色说话,然后切换到另一个角色做出反应,他们看起来都很一致。或者他们展示了一个序列,摄像机从一个自行车的车轮特写开始,然后向上移动,展示整个自行车和周围的街道场景。该模型理解物体永恒性。它理解主体,侦探或自行车,即使摄像机角度改变或灯光发生剧烈变化,也需要保持相同的物体。这绝对是巨大的,因为没有这种一致性,你就没有电影。你没有故事。你只有一堆不连贯的幻觉图像。>> 完全正确。报告特别提到它处理复杂的多主体上下文。这是关键短语,精确的指令遵循。这验证了那位开发者感受到的感觉。他不是把一个提示扔进虚空,然后寄希望于最好的结果。他是在指挥一个场景。他有控制权。而这种新发现的可靠性是让这项技术从一个有趣的玩具,>> 你用来制作有趣的GIF用于社交媒体的东西,>> 变成一个商业级的工业工具,可以合法地取代专业电影团队的最后一块拼图。>> 而那种颠覆,那种力量,又将我们带回了燃料,带回了数据堡垒。因为你可以建造世界上最高效的法拉利引擎,但如果没有燃料,它只是一块金属。它需要高辛烷值的数据,而对我来说,这就是故事的转变之处,你开始真正看到这种巨大的战略优势。>> 它绝对是核心战略优势。如果我们看报道,我们会看到像Bite Dance这样的公司能够获得的数据量。有效的[鼻息声]在美国,TikTok被认为是一个文化巨头,对吧?它大约有1.7亿用户。>> 感觉几乎每个人都在使用它。>> 是的。感觉无处不在。但现在将其与他们在中国的国内用户数量进行比较。Duan,也就是TikTok的中国原版,有7亿日活跃用户。>> 7亿。>> Tuchia,他们的新闻聚合应用,还有3亿用户。所以,你谈论的是一个触及近10亿人的综合生态系统。>> 仅在Duan上,其用户群就超过了美国总人口的两倍。完全正确。我们必须真正坐下来思考,并理解这对训练人工智能模型意味着什么。这不仅仅是拥有大量来自互联网的视频。很多公司都是这样做的。这是关于生态系统。>> 这是互动数据。>> 这是互动数据。每一次滑动,每一次暂停视频,每一次点赞,每一次分享,每一次评论,用户上传的每一个视频,都是一个细粒度的数据点。它是一个信号。一位专家在一篇文章中被引用,我们孙称之为“令人难以置信的信息财富”。这是一个持续的实时反馈机制。它是人类认为视觉上吸引人的东西的活生生的实验室。>> Seednance技术报告毫不避讳这一点。他们明确提到了多源数据策展过程。这告诉你,他们不仅仅是从网上下载静态视频数据集。他们正在从近10亿人的鲜活生态系统中学习。这提供了一个规模和质量的人类反馈,目前任何西方竞争对手都无法比拟。而且报告甚至使用了这个过程的一个特定技术术语,不是吗?RLHF。>> 是的,RLHF。它代表“人类反馈强化学习”。现在,这是人工智能领域一个相当标准的术语,尤其是在训练大型语言模型时。你知道,教一个聊天机器人不要粗鲁或给出有害建议,就是让人类评价它的回应。>> 对吧?>> 但Bite Dance正在大规模地将这个概念应用于视频。他们称之为“视频特定RHF”。所以,他们实际上是在训练人工智能,让它知道数百万人类真正认为视觉上令人愉悦或美丽的东西,而不仅仅是办公室里少数数据标注员认为的东西。>> 完全正确。报告谈到了具有运动和美学等特质的具体奖励机制。而这些奖励的信号来自哪里?它来自Duan上那7亿用户。如果一个视频在平台上病毒式传播,因为它具有非常流畅的电影式摄像机运动和戏剧性的灯光,算法就会知道。>> 算法会立即知道。系统会学习什么能让人们看完视频。它会学习什么让他们点赞。它会学习他们分享什么。所有这些用户行为都被用来完善报告所称的“美学奖励模型”。>> 想到这一点真是令人难以置信。人工智能不仅仅是在学习一个人走路的物理原理。它是在大规模学习使行走看起来英勇、悲伤或美丽的诗意。它是在大规模学习人类心理学。>> 这就创造了一个数据护城河,一个巨大的、可防御的护城河围绕着他们的技术。你可以出去购买数千个GPU。你可以雇佣世界上最聪明的工程师。但你无法在一夜之间创建一个拥有7亿活跃用户的用户群,他们愿意每天为你提供数十亿个关于视频参与度的实时反馈点。这是一个结构性的战略优势,非常非常难以复制。>> 好的。但这里有一个大障碍,房间里的大象,我们必须解决。我们知道有制裁。我们知道美国政府已经制定了非常严格的规则,以阻止最先进的人工智能芯片,特别是英伟达的顶级GPU,落入中国手中。那么,如果Biteance无法获得最好的部件,它如何运行这个庞大的效率引擎呢?>> 这就是我们进入“国家市场协同”这个引人入胜的概念的地方。在来源中看到的非常具体的动态。《海峡时报》的文章举例说,Bite Dance在2024年仅基础设施就花费了约110亿美元。>> 一年110亿美元。那不是一个赌注。那是一次孤注一掷的举动。>> 这是一个巨大的战略赌注。是的,虽然他们不能正式获得最尖端的、顶级的英伟达H100或B200,但文章中的分析师指出,他们正在找到获取所需的方法。他们正在使用位于中国境外的数据中心,例如新加坡。但更重要的是,也是对长期而言的关键部分,他们正在大力转向国内选择。报告提到他们正在使用华为和Cambricon等公司的芯片。>> 所以,制裁在某种奇怪的方式下可能实际上是催化剂。它正在加速国内芯片行业的发展和采用。>> 这是情况的巨大讽刺。分析师Lanj Su被引用说,中国科技公司一直被积极鼓励采用本地选项。这创造了一个强大的闭环系统。政府设定了一个国家目标。我们需要技术自力更生。公司说,我们需要大量的芯片来支持我们的人工智能雄心。所以他们投资数十亿美元到本地生态系统中,突然你就拥有了一个完整的垂直整合的管道。所以你有一个广东的开发者使用一个人工智能模型。>> 这个模型是在Duan用户的国内数据上训练的。>> 运行在华为制造的国内芯片上。>> 由110亿美元的国内基础设施投资支持。它有效地使他们免受外部压力。>> 这是一个主权人工智能堆栈。而我们开始的那位开发者,他认为自己是孤狼,是那个为自己夺回权力的小人物。但实际上,他站在一个巨大的、国家支持的、数十亿美元的基础设施项目的顶端,该项目旨在实现全球人工智能霸权。>> 而从国家目标到开发者手机的这种完全一致性,使得最重要的一点成为可能,那就是速度。>> 这就引出了我们今天深度剖析的第三部分,速度。因为对于传统媒体行业和西方竞争对手来说,真正可怕的部分不仅仅是技术好。而是它以令人难以置信的速度进入人们手中。是的,这是我在阅读中真正注意到的。这种“东方速度”的想法。有一种明显的感受是,虽然我们在西方听说新的研究论文和很酷的技术演示可能有一天可用,但在中国,他们只是不断地发货产品。>> 这是一种根本性的以结果为导向的关注。看看他们的聊天机器人Duba的例子。来源材料提到,它在2024年仅3个月就获得了6000万用户。>> 3个月获得6000万用户。我的意思是,对于任何应用来说,这都是爆炸性的世界级增长。>> 在这么短的时间内,它击败了像百度“文心一言”这样的成熟竞争对手。它击败了所有人。SED 1.0 O技术报告明确指出,该视频生成模型计划最早于2025年6月集成到Duba等平台以及他们的视频编辑应用Jianying中。>> 所以,这不是什么遥远的未来蒸气波。这不是“即将推出”的新闻稿。就所有意图和目的而言,这现在正在发生。它将在几个月内掌握在数千万人手中。这完美地说明了报道所称的“东方技术治理的卓越活力”。他们不坐等技术。他们不花数年时间在封闭的委员会中辩论伦理问题。他们构建它。他们测试它。然后立即将其交给用户,看看会发生什么。那位广东的开发者,他确实在使用测试版,但对他来说,它已经是一个生产工具了。反馈循环是即时的。>> 但经典的反对意见是,这种速度必须付出代价,对吧?质量是否会因为他们急于上市而受到影响?他们是否在偷工减料?尽管这是逻辑上的假设。但我们拥有的硬数据表明情况恰恰相反。技术报告特意引用了一个名为“人工智能分析竞技场”的平台的排行榜。>> 好的。所以,这就像一个独立的人工智能模型记分牌。>> 完全正确。这是一个第三方基准测试平台,不同的模型在各种任务上进行一对一的比较。根据这个,Cedence 1.0排名第一。>> 在哪个类别排名第一?>> 在文本到视频排行榜和图像到视频排行榜上都排名第一。>> 等等,两个都第一。它是从文本提示生成以及动画静态图像的最佳模型。>> 都。而且我们谈论的不是以微弱优势获胜。如果你看看报告中包含的蜘蛛图,这些图表描绘了运动质量、提示遵循、美学、时间一致性等不同的能力,Cedence的性能。多边形有效地包含了所有其他。>> 所以,它不仅仅在一个领域更好,而是在所有领域都更好。在一些一对一的比较中,它的表现比谷歌的VO、OpenAI的Sora和Runway的Gen 4等主要的西方竞争对手高出100多点。>> 哇。好的。所以,这打破了他们为了速度而牺牲质量的说法。它不仅仅是生成视频的速度更快。视频本身测试的质量更高。>> 而且至关重要的是,它在两个特定领域得分最高:运动质量和提示遵循。如果你仔细想想,这两者对真正的创作者来说最重要。它是否像现实世界中的事物一样移动?它是否真的按照我告诉它的那样做了?>> 你强调提示遵循很有意思,因为它将一切都联系回那种控制感。如果人工智能真的听你的并且理解你的意图,它就变成了一个真正的工具,一个伙伴。如果它忽略你,只做它自己奇怪的事情,它就只是一个玩具。>> 对吧?而他们主导这些公开排行榜的事实告诉我们,那7亿Duan用户的反馈循环正在起作用。他们正在以一种难以匹配的速度迭代和改进模型,如果你没有如此庞大的数据量的话。>> 现在,对我来说,故事变得更大了,也许是最令人惊讶的部分。我们一直在谈论电影、社交媒体、电影制作人。但消息来源很清楚,这项技术并没有停留在娱乐领域。它正在渗透到物理世界。>> 这是B2B的扩张。它通过Bite Dance的企业云计算部门Volcano Engine实现。>> Volcano Engine。这名字真棒。>> 是的,生动形象,不是吗?他们有效地将他们为社交媒体完善的核心人工智能智能作为一项服务出售给你意想不到的行业。《海峡时报》的文章特别提到了GAC集团,这是一个大型电动汽车制造商,甚至还有梅赛德斯-奔驰。>> 而梅赛德斯-奔驰正在他们的汽车中使用Bite Dance的技术。>> 是的,在中国市场用于他们的车载信息娱乐系统和数据管理解决方案。而且当你仔细想想,这是完全有道理的。自动驾驶汽车或智能驾驶舱需要什么?你需要世界级的计算机视觉。你需要一个能够实时理解复杂视觉环境的人工智能。帮助Cance理解繁忙街道的全景镜头与帮助汽车理解和导航繁忙街道的底层技术是相同的。>> 这是我没有联系到的。视频生成器和自动驾驶汽车本质上是技术上的表亲。>> 它们更像是共享同一个AI大脑的兄弟姐妹。而且它甚至更进一步。报道还提到了智能电视。海尔和TCL等主要品牌正在使用源自同一计算机视觉技术栈的手势控制技术。所以,当你坐在客厅里,挥手调高新电视的音量时,你正在使用创造了广东那位开发者手机上那部大片剪辑的相同智能的一小部分。>> 所以,我们谈论的那种以结果为导向的治理不仅仅是为了赢得社交媒体战争。它是关于赢得那场胜利,并利用它来振兴汽车行业、消费硬件行业。它在整个经济中创造了一种效率的涟漪效应。>> 它创造了一个可以应用于任何地方的智能基础层。这就是成为人工智能强国的真正力量。这不仅仅是关于在Duan上制作有趣的视频。这是关于将这种智能出口到你拥有的每一个屏幕和每一个设备上。我们开始这次深度剖析时,一位广东的开发者拿着手机,感觉自己刚刚获得了进入好莱坞的钥匙。>> 在某种非常真实、有形的方式上,他确实获得了。他找到了实现这一目标的武器。正如你所说,>> 我们看了引擎Seedance 1.0,我们看到了它如何在不到一分钟的时间内创建令人惊叹的高清视频,使其比任何人类团队都便宜和快速得多。>> 然后我们看了引擎的燃料,数据堡垒。7亿用户在一个闭环中,不断地训练人工智能什么是美丽的,什么是吸引人的,什么是引人入胜的。>> 一个完全无与伦比的数据优势。>> 最后,我们看到了支撑这一切的国家战略,数十亿美元的基础设施投资,推动国内芯片发展,国家市场协同使得整个系统具有弹性和惊人的速度。这确实有力地展示了当大规模数据、超高效工程和统一的国家目标完美结合时会发生什么。进入高端视觉叙事领域的传统壁垒,它们没有被降低,而是被彻底蒸发了。>> 那位开发者是对的。他所说的导演级别的控制现在或者很快就会掌握在任何能写句子的人手中。但这种现实导致了一个最终的,我认为是有些挑衅性的想法。如果我们接受这就是未来,而历史表明这种效率水平总是会获胜,那么我们就必须从根本上重新定义创造力意味着什么。>> 那么,你是什么意思?>> 在人类历史的整个过程中,创造力一直与技艺密不可分。它是关于完美地打光一个场景的体力劳动,成为一名大师级剪辑师所需的多年耐心,画家笔触的技巧。想法只是开始。价值在于执行。>> 对吧?辛勤工作。>> 辛勤工作。但像Cedance这样的模型的效率和速度表明,在不久的将来,创造力的定义将不再是关于图像的制作。技艺将被自动化和完善。价值将完全转移到提示背后思想的速度上。>> 思想的速度。>> 是的。我们实际上正在将每一个智能手机用户变成一个工作室主管,能够在不到一分钟的时间内批准和制作一部电影。他们都在一个即将被海啸般的即时技术完美所淹没的媒体环境中争夺注意力。>> 当每个人都能在40秒内制作一部大片时,图像本身,执行,它开始失去价值。唯一剩下的就是原始想法的质量。>> 这既是一个令人兴奋又是一个极其可怕的想法。因为几个世纪以来,想法很便宜,但执行却昂贵而困难。这就是创造稀缺性和价值的原因。我们现在正进入一个执行是免费且即时的世界。而当执行是免费的时候,世界看起来非常非常。