Transcription
仅仅几天前,来自 Mediastorm 的 Tim 坐下来测试 Bite Dance 最新推出的强大产品 Seance 2.0。他做了一件很平常的事,任何创作者都会做的事。他上传了一张自己的照片。对吧?而这正是故事的关键部分。没有音频样本,完全没有,没有复杂的语音数据。他只是给了机器一张静态图像,然后点击了生成。他只是喂给了像素。而返回的结果不仅仅是,你知道的,一个高清的 60 秒电影序列,带有专业级的镜头移动和 2K 纹理。我的意思是,那是意料之中的。我们已经预料到了。那是基准线了。几乎是令人毛骨悚然的时刻,那个真正让你感到不寒而栗的时刻,发生在屏幕上 Tim 的数字版本张开嘴巴的时候。在从未听过他说话的情况下,人工智能分析了他的骨骼结构,他的面部特征,以重建他精确的声音音色。它的推断。它推断出了他的声音。它用近乎完美的唇语同步,用他自己的声音说话,这只是凭空合成的。这是一件技术杰作,而且绝对令人毛骨悚然。令人毛骨悚然是正确的词,因为你的大脑告诉你这是真实的。
但随后这个故事发生了急剧的、出乎意料的转折。在展示了这些能力之后,Bite Dance 几乎立即做了一件激进的事情。他们踩下了紧急刹车。完全停止,而不是减速。不是修补。不。他们彻底删除了真人参考功能。他们在一夜之间有效地让他们最先进的模型沉默了。那些准备彻底改变工作流程的用户突然发现大门紧锁。从推出感觉像是电影的未来,到剥离其最令人惊叹的功能,这种瞬间的转变让整个行业都感到震惊。
所以,最大的问题是,这是技术故障还是恐慌性撤退?嗯,虽然有些人认为这是对人工智能进步的打击,但这里还有更深层次的逻辑在起作用。这是我们称之为“隐私的原始交易”与市场对真正价值的追求之间的紧张关系。今天,我们将揭开世界上最强大的视频 AI 为什么会潜藏起来,以及为什么这种被迫的放缓实际上可能是行业生存下去的唯一途径。
所以,我首先想剖析的就是这个停止,因为对于外部观察者来说,我的意思是,这看起来像是一个失败,对吧?看起来像是一个产品召回,一个 bug。是的。网上立即的反应是,“哦,他们搞砸了。技术还没准备好。”但我一直在阅读这些来自北京一线工程团队的帖子和日志,那些真正建造了这东西的人,他们的情绪不是恐慌。不是沮丧。而是完全不同的东西。
真的,那种情绪是什么?我找到了一篇来自软件架构师的帖子。他直接参与了 Cedense 2.0 的集成,他描述了那个红线时刻,那个功能突然被移除的方式,真的让我印象深刻。他用了高速铁路的比喻。他说,“想象一下你在乘坐一列子弹头列车。它以每小时 350 公里的速度行驶,突然列车平稳地停了下来。这不是碰撞。没有颠簸。这是一个自动响应,因为传感器在前方 10 英里处检测到了轨道上的微小震动。所以这是一个安全协议在起作用,是按照设计工作的,而不是失败的。”他看着那个可以从一张头肩照中克隆声音的功能在一夜之间被撤回。而这是关键部分。虽然全球科技界,尤其是在西方,奉行“快速行动,打破常规”的信条。他说,他从随之而来的寂静中感受到一种奇怪的解脱感。这不像是一个创造被阉割的工程师会有的反应。他说,在他的专业圈子里,监管机构踩下的紧急刹车并没有被视为束缚。他用了一个非常具体的词。他称之为结构性加固。结构性重塑。不是拆除。而是加固基础。这正是他看待它的方式。他认为这是国家能力的体现。他们的想法是,他们正在集体建造这座巨大的摩天大楼,这个极其强大的人工智能模型,而国家介入是为了确保基础不会在其自身意外后果的重压下崩溃。不是为了阻止建造。而是为了确保它在 5 年后不会倒塌。他说,对他来说,创新的天才在于,如果它摧毁了它所处的社会结构,那么它就毫无意义。它完全挑战了那种传统的西方观点,即监管只是进入的障碍或进步的拖累。它不仅仅是挑战它。[哼鼻声]它提供了一种完全不同的运作理念。是的。这种国家能力的概念在数字时代是我们真正需要深入研究的,因为在美国或欧洲,我们经常将监管视为被动的。我们遵循的是一种“无需许可”的模式,对吧?你构建工具,你发布它,你让它进入市场。如果它造成了损害,如果它泄露了数据,如果它导致了招聘决策的偏见,如果它制造了大量令人信服的深度伪造,那么也许 3 年后,我们会举行听证会。我们会在汽车已经发生事故后试图修复损害。我们基本上是在马匹已经逃脱后才追赶。这是一项清理工作。但这位北京的建筑师所描述的,以及中国监管框架似乎代表的,是其他东西。它是前瞻性治理。它是预见事故的能力。红线不是画在路上的建议。它是汽车本身预先构建的自动制动系统。
这让我们谈到了实际触发这一点的具体规定。我的意思是,这不是一个随意的决定。嗯,这是系统在运作。我们谈论的是 2022 年生效的深度合成规定。所以,这不是他们因为 Cedance 而新制定的规则。不,这是一个一直等到这一刻的框架。它是为像这样的技术设计的。
好的,让我们深入了解一下那项法律,因为隐私是一个非常宽泛的术语。Cedance 2.0 具体做了什么才触碰了这条红线?这一切都归结于违反了关于生物识别推断的同意原则。这是法律的核心。该规定非常清楚地说明,如果你正在编辑,或者更重要的是,正在合成生物识别信息,例如面部特征、语音模式,你需要获得被摄对象的明确、重要的同意。
好的,让我们回到 Tim 的经历。他上传了一张自己的照片。他同意使用他的面部来制作视频,对吧?他同意将他面部的像素动画化,但他没有上传任何音频。他没有给系统任何语音数据。
但机器还是生成了他的声音。它不仅仅是生成了通用的音频。而这部分既精彩又可怕。它推断出了他的生物识别语音数据。它观察了他下巴的结构,他鼻腔的形状,从照片中他躯干推断出的肺活量,然后计算出他声音可能的共鸣和音色。它在未经他同意的情况下创建了新的生物识别数据。它不仅仅是使用他提供的数据。它正在创建他从未授权过的、高度私人的生物识别数据。这是一种数字生物合成。而在深度合成规定下,这是一个严重的犯规。这是一个自动的红牌。它从一个创意工具变成了一个大规模身份盗窃的潜在工具。所以,紧急刹车并不是 Bite Dance 在真空中恐慌。这是这个系统完全按照设计工作的。是的。这里的国家能力是能够监控 API,看到推断引擎正在生成未经授权的生物识别数据,并在该能力进入大众市场之前强制停止。
工程师感到解脱,这仍然让我着迷。你会认为一个编码员会希望他们的代码运行,被推向世界,但这表明建造这些东西的人可能对他们自己的创造感到有点害怕。哦,我认为现在人工智能实验室里绝对存在一种可能性带来的眩晕感。一线工程师比任何人都清楚,他们正在制造欺骗的引擎。他们理解其中的机制。他们每天都亲眼看到滥用的潜力。而没有强大的监管机构,发布最强大东西的市场压力是巨大的。如果你的竞争对手发布了一个声音克隆工具,你也会觉得你必须发布一个。即使你知道这很危险,这也是一场向底部的竞赛。所以,监管解决了那个协调问题。它说没有人可以发布这个。是的。它在谨慎方面使竞争环境公平。它让工程师晚上能睡个好觉,知道他们的工作不会被用来欺骗某人的祖母。它让他们免受市场最坏冲动的侵害。在某种程度上,它拯救了他们自己。
但让我们深入探讨一下他们为什么应该感到害怕。我们谈到了 Tim 感受到的寒意,那不仅仅是因为视频是高分辨率的。我们以前见过高分辨率的深度伪造。这次不同。它有深刻的不同。以前模型的批评总是“恐怖谷”。当你看到某样东西几乎像人但又不完全像人时,你就会产生那种感觉。总有什么地方有点不对劲。嘴唇与声音不完全匹配,或者眼睛是死的,或者头部移动不自然。确切地说。我们的大脑非常擅长发现那些小的不一致之处。Seedance 2.0 解决了这个问题。怎么做?这就是我们必须深入技术细节的时候了,不是吗?要理解这个飞跃,我们必须看看它的架构。Bite Dance 称之为双分支扩散。现在,在上一代人工智能视频中,我们可以称之为“抓包”时代,你的成功率非常低,对吧?抓包工作流程,就像电子游戏中的那些战利品盒游戏。你输入一个提示,你拉动杠杆,也许 20% 的时间你会得到一些可用的东西。其余的时间,手有七根手指,或者脸融化成一滩像素。那是一场赌博。那是一种艺术,而不是科学。Seedance 2.0 将成功率从 20% 的赌博提高到了 90% 以上的可靠性。它实现了产出的工业化。
但架构是原因。想象一下钢琴家和歌手在表演二重奏。好的。在旧模型中,视频是先生成的。那是钢琴家在演奏他的部分。然后一个单独的音频模型会尝试稍后将歌手的声音配音上去。所以,这就像一个糟糕的功夫电影配音。嘴唇在动,然后一瞬间之后,声音才出来。它总是脱节的。那是感官不匹配。我们的大脑讨厌它。Cedance 2.0 现在使用两个分支,两个同时运行的大脑。你有一个视觉分支,我们称之为左脑,还有一个音频分支,右脑。它们同时生成视频和音频。
但突破在于它们如何相互交流。突破在于他们称之为“注意力桥”。这是一种跨模态的注意力机制。这是魔法。这意味着两个大脑在创作过程中实时交流。它们在任何东西被创建之前,基本上是在潜在空间中读取对方的思想。当音频分支准备生成一个音素,比如“O”的声音时,它会通过注意力桥向视觉分支发送一个令牌,一个小的消息。而视觉分支收到那个消息,在像素甚至在屏幕上渲染之前,就会将嘴唇塑造成“O”形。反之亦然。如果视觉分支生成了一个黑暗、忧郁的灯光变化,音频分支就会检测到这种背景,并调节声音,使其更柔和、更忧郁,以匹配情绪。
所以,这是原生同步。不是事后的唇语同步。运动和声音源于相同的数字冲动。而这种原生同步正是消除了恐怖谷效应。当你拥有它时,我们大脑中尖叫着“这是假的,不要相信”的生物触发器就不会被激活。我们在潜意识层面信任它。这就是为什么监管必须如此严厉。国家认识到,这种特定的架构,带有注意力桥的双分支扩散,不仅仅是制作了更好的视频。它创造了一种能够从生物学层面压倒人类怀疑的技术。如果你将它释放到一个不受监管的互联网中,你实际上就打破了“真相”的概念。你打破了社会契约。你再也无法相信自己的眼睛或耳朵了。所以国家介入了,而且请注意,他们并没有扼杀这项技术。CDN 仍然存在。它仍然强大,但他们通过移除针对真实人物的能力,扼杀了与这种原生同步能力相关的风险。他们将其非武器化,这迫使了一个转变。而这正是故事变得非常非常有趣的地方,因为如果你剥夺了克隆朋友或制作政客深度伪造的能力,那么这个极其强大的引擎到底有什么用?如果不是病毒式传播的表情包,它的商业价值是什么?确切地说。事实证明,目标从来不仅仅是病毒式传播的视频。我一直在关注深圳一位制作设计师的故事。她从事这些大型基础设施项目。我们谈论的是桥梁、港口扩建、新城市区,重工业的东西,最重的。在限制措施到位后,她开始使用 Cedance 2.0。她立即注意到了一些事情。这个工具不再试图成为一个换脸器了。更新,优化,它们都指向一个完全不同的方向。所以,工具本身的发展路径发生了彻底的改变。她描述了一个她正在渲染悬索桥的会话。AI 不仅仅是制作一座桥的美丽图片。它正在渲染不同风况下电缆的物理应力。它正在计算凌晨 3 点,大雾中大型建筑工地的电影级照明。
所以它从社交应用转向了工业模拟。确切地说。对她来说,政策不是“不”,而是一个方向指示。它说,不是那边,是这边。它迫使这项技术从数字玩具毕业,成为一个严肃的工业仪器。而这个故事,它确实反映了一个更广泛的国家战略,对吧?致力于以实体产出作为衡量力量的最终标准。是的。想法是,人工智能的真正价值不在于帮助我们构建元宇宙。而在于它如何帮助我们构建真实世界。我的意思是,这肯定是一条艰难的道路,但它追求的是一种,她称之为“工业尊严”。工业尊严。这是一个深刻的短语,它与我们从国务院文件中看到的更广泛的政策完美契合。特别是,一项名为“AI Plus”的倡议。AI Plus。听起来有点像一个流媒体服务,不是吗?是的,但它实际上是一个全面的国家工业战略。其任务是将人工智能广泛而深入地整合到关键领域。你必须看看他们优先考虑的领域列表。是的,社交媒体不在首位。甚至不是接近。优先事项是制造业、农业、医疗保健、物流和基础设施。整个目标是将整个科技行业从关注深度伪造转向关注数字孪生。
好的,让我们为每个人清楚地区分这两者。深度伪造本质上是一个谎言。它是对从未发生过的事情的令人信服的视频。它是虚构的。而数字孪生是真实的,它是对已经存在或正在计划在现实世界中的事物的保真度极高的模拟。所以,深圳的设计师,她不是在制作一个关于桥梁的虚假电影。她正在可视化一座真实的桥梁,以了解拟议的照明计划是否允许 24 小时安全施工。她正在模拟材料运往现场的物流流程。确切地说。而这直接关系到国家更大的经济目标,如“中国制造 2025”。目标是升级整个工业基础,向上攀升价值链。所以,监管实际上是产业政策的工具。它说我们有这个巨大的新计算能力来源。不要浪费在娱乐经济上。不要浪费在虚拟经济上。
而虚拟经济是什么?广告、点击和注意力经济的空洞经济。确切地说。那些不会产生实体产品的东西。他们希望将所有这些资本、所有这些人才从低价值、高风险的换脸应用中转移出来,并将它们推向开发核心专利和高价值工业应用,如电影制作工具或基础设施可视化。是的。而如果你看看 Cedance 2.0 在转型后的功能集,它拥有他们称之为“导演级控制”。对。那些是我读到的相机控制功能。它不仅仅是“给我做一个视频”。不。在标准的消费者 AI 工具中,你输入“一只猫骑自行车”,你就会得到一只猫骑自行车的随机视频。在 Cedance 2.0 中,你可以指定,使用 50 毫米镜头,以每秒 30 度的速度向左平移,从广角镜头开始,然后进行推轨变焦,从背景到前景。那不是给 TikTok 用户用的。那是一个为专业电影摄影师和建筑师准备的工具。它将 AI 变成电影行业、建筑行业的生产力工具。它变成了一个生产工具,而不仅仅是消费工具。而我看到的笔记提到了 VFX 的成本降低了 10,000 倍。我的意思是,这听起来像是一个虚构的营销数字。我知道,但如果你计算一下传统的 VFX 工作流程,就会发现这是有道理的。要为一部电影创建一个逼真的 10 秒片段,比如一个未来城市的片段,你需要一个团队。你需要 3D 建模师、纹理艺术家、灯光专家、合成师,以及一个巨大的渲染农场。而且这需要几周的时间,对吧?几个月。有时需要大量的时间,而且几秒钟的素材可能要花费数万甚至数十万美元。有了像 Cedance 2.0 这样的工具,如果你拥有参考架构和正确的提示,你可以在几分钟内生成那个序列,成本只是电费。
所以效率的提升是绝对真实的,而国家希望这种效率应用于实体经济,而不仅仅是文化。他们希望利用这种巨大的生产力提升来使他们的核心产业在全球范围内更具竞争力。这是一个战略赌注。这是为了避免成为一个被娱乐至死但实际上什么也造不出来的社会。他们赌的是,拥有最强大实体经济的国家最终会获胜。这是一个非常功利主义、非常务实的做法。但这里也有一个我们不能忘记的人性因素,因为当我们谈论宏大的工业战略时,最初的红线也是为了保护人民,对吧?我发现了一个故事,它真的让我感同身受。它不是关于一座桥或一座摩天大楼。它是关于杭州的一位祖母。我在一个社交论坛上读到这个故事,是一位女性的女儿写的。杭州的一个家庭差点被骗。这位祖母接到了一个视频电话。看起来就像她的孙子。声音也和她的孙子一模一样,完美的克隆。一个复杂的实时深度伪造。骗子假装是孙子,说他遇到了某种麻烦,需要她立即转账她的毕生积蓄。经典的紧急诈骗,但被这项新技术超级强化了。诈骗失败了。不是因为祖母有所怀疑,她完全相信那就是他,而是因为该工具使用的特定生物识别路径被这些规定预先限制了。是骗子使用的软件。它要么崩溃了,要么标记了这次尝试,因为它无法验证试图生成克隆的用户身份与被克隆人的生物识别数据是否匹配。系统的安全措施启动了。刹车起作用了,而这位女士的女儿后来写道,她用了一个我认为可以定义整个理念的词。她称之为“集体生存”。集体生存。她的论点是,在一个动荡、全球化和数字混乱的世界里,群体的安全必须是任何颠覆性技术的首要过滤条件。她让人们想象一个社会,在那里,对完美欺诈的恐惧不是通过个人警惕来消除,不是通过告诉你的奶奶要小心上网,而是通过一个集体盾牌。这是一个强大而深刻的视角转变。因为在西方,我们的哲学非常侧重于个人责任。买家自负。检查网址。不要点击奇怪的链接。我们将全部负担都放在潜在受害者身上,让他们去智胜算法,这是一场不可能的战斗。你不能指望一个 80 岁的祖母去智胜一个旨在欺骗她的超级计算机。她一开始就处于劣势。集体生存原则承认,个人在机器面前是无能为力的。祖母无法对抗双分支扩散模型。她每次都会输掉这场战斗。所以国家介入,成为整个集体的盾牌。
所以,深度合成规定不仅仅是关于抽象的隐私。它们是关于具体的社会安全。这位女儿写道,迅速执行不是对他们来说某种抽象的法律举措。这是直接的安全行动,使他们的家庭能够生活在没有持续的低级数字欺骗焦虑中。我们从远处很容易批评自上而下的控制。但当你听到一个家庭的毕生积蓄被这种控制所拯救时,这种权衡感觉非常非常不同。
这是否让你想起了“生物政治学”这个概念?我们看到它与那部伟大的中国科幻电影《流浪地球》相关联。对。就是那部他们真的移动了整个星球来逃离垂死的太阳的电影。确切地说。而那部电影的核心哲学主题是,面对生存危机,世界末日,物种的生存证明了对个人自由的极端限制。每个人都必须朝着同一个方向努力。所以,深度合成技术正通过同样的视角来看待。它被视为一种认知危机。如果你允许完美的、无法检测的深度伪造充斥系统,你就摧毁了信任的基础。你就摧毁了社会辨别真伪的能力,而这被视为对国家和社会秩序的生存威胁。
所以,对 Cedance 的紧急刹车可以称之为一种正常化判断。这是系统在说,我们不能允许这种程度的认知混乱。我们必须维持一个现实的基准,而他们做到这一点的方法是创建可追溯性要求。这是规定中内置的。他们要求可见的标记,比如水印,以及更重要的隐含标记。隐含标记。那是什么意思?把它想象成一个嵌入文件元数据中的加密签名,它的数字 DNA。所以,如果一段内容是由这些工具之一生成的,它必须能够追溯到创建它的特定用户帐户和特定的 API 调用。它创造了你可能称之为“数字忠诚度”或“责任”。确切地说。你可以使用这个工具,但你不能隐藏。如果你使用这个工具来欺骗杭州的一位祖母,警察不必进行大规模调查来找到你。文件本身就暴露了谁制作了它。这完全摧毁了骗子和不良行为者所依赖的匿名性。但它也,我们必须承认这一点,它创造了一个绝对的监控层。而这就是根本的权衡。集体生存要求对国家完全透明。作为交换,国家承诺免受机器混乱的侵害。这是一个非常不同的社会契约。
这让我们谈到了全球舞台,因为这并非孤立发生。你在北京有 Bite Dance 遵守这些规则。你在硅谷遵循一套完全不同的规则。你在欧洲试图用《人工智能法》书写自己的规则。整个 Cedance 的故事实际上是正在发生的更大分裂的一个缩微。它是技术民族主义时代的完美案例研究。我们正在看到“分裂互联网”的兴起,不同的文明正在建立完全不同的技术栈,基于根本不同的价值观。通用互联网正在分裂。
所以,让我们来分解一下主要参与者和他们的策略。好的。首先是美国。那里的策略基本上是创新加上出口管制。所以,在国内尽可能快地创新,并阻止其他人赶上来。对吧?在国内,这是一种非常轻微的接触方式。让 OpenAI、Google、Meta,让他们尽可能快地奔跑。让市场决定赢家。但在国际上,一切都关乎硬实力。这关乎剥夺对手的创新原材料。那就是芯片禁令,限制 Nvidia GPU 流向中国。确切地说。目标是扼杀引擎。阻止中国获得计算能力。是的。然后是欧盟。他们的游戏是什么?欧盟正在玩一场基于权利的游戏。《人工智能法》就是一个完美的例子。我们可以称之为“裁判策略”。他们知道他们自己没有构建最大、最强大的模型,但他们决心为所有想在他们的市场运营的人制定最严格的透明度、公平性和人权规则。所以,他们是世界的监管者。他们正试图成为。然后是中国,以及中国的策略。中国正在玩一场双重目标的游戏,发展加上安全。他们绝对决心成为人工智能领域的全球领导者。这是发展目标,“AI Plus”倡议,我们已经谈过了。但他们也要求对这项技术对社会的影响进行绝对控制。这是安全目标,深度合成规定。而 Cedance 的暂停证明了他们愿意牺牲短期速度来换取长期稳定。如果必要,安全目标可以覆盖发展目标。
它也挑战了西方普遍存在的说法,即中国因为芯片禁令无法在人工智能领域竞争。我们一直在听到,没有最新的 Nvidia H100 芯片,他们就寸步难行。但随后 Cedance 2.0 出现了,而且它奏效了。它奏效得令人恐惧。它告诉我们技术栈的竞争。美国目前在硬件层面,在硅、原始计算方面处于领先地位,但中国一直是应用层面的领导者。Bite Dance 可以说是世界上在软件优化方面最优秀的公司。他们可以在更少或更不强大的芯片上榨取更多的性能。Seatins 2.0 证明了他们的软件工程绝对是一流的。所以,这就像美国拥有更大的引擎,而中国拥有更好的司机或更高效的传动系统。
或者他们可能拥有更好的交通管理系统,通过暂停 Cedance 以确保它不会破坏社会信任,他们确保了道路对每个人来说都是可行的。有一种说法是,如果美国让技术完全失控,并充斥着互联网的污泥、骗局和虚假信息,那么创新实际上可能会自我毁灭。公众可能完全失去对数字世界的信任。而中国的战略是首先稳定社会层面,以便应用层面可以在其之上可持续地增长。这是一个长期的策略。它感觉像是创造性破坏,但由国家引导和控制,而不是留给市场的混乱。一种受管理的拆除和重建。开放的匿名互联网的旧价值链正在断裂,新的价值链正在围绕合规性、可追溯性和数字身份等事物形成。在这个新世界里,最终的竞争优势可能不是谁拥有最智能的人工智能,而是谁拥有最安全、最值得信赖的人工智能。
这是一个深刻的想法来结束。我的意思是,我们开始进行这次深入研究,是看到了 Tim 一个令人恐惧的逼真数字克隆,这个机器中的幽灵,一个来自虚无的声音。我们看到了红线的落下,不是为了扼杀技术,而是正如那位工程师所说,为了加固建筑。我们看到了转向工业尊严的转变,从病毒式表情包转向模拟桥梁,从虚拟转向现实。而我们最终得出了“集体生存”这一复杂的哲学,即多数人的安全证明了少数人的克制是合理的,从而创造了一种非常不同的互联网。我认为 Cedance 2.0 的故事真的不仅仅是一个很酷的新视频工具。它是关于不同文明如何选择处理人工智能之火的案例研究。我们现在都有了这把火。它就在这里。问题是,我们是让它自由燃烧,看看它照亮了什么,又摧毁了什么?还是我们建造一个壁炉来容纳它,确保它能温暖房子但不会烧毁它?这就是选择。而当我们观察这些不同的方法发挥作用时,美国飞速前进,欧洲试图充当裁判,而中国试图引导,这迫使我们所有人问一个关于现实本身未来的根本性问题。在一个数字内容变得与物理真相完全无法区分的世界里,最终的力量,最终的竞争优势,将属于能够产生最逼真幻觉的社会,还是能够保证最可靠现实的社会?这是我们这个时代的决定性问题。下次见。