📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

【人工智能】揭秘MiniMax的研发内幕 | 早上ICU晚上KTV | 强化学习 | RLHF | 模型对齐 | 奖励作弊 | 开放权重生态 | 浮点数精度限制 | AGI演进曲线 | 算力瓶颈

最佳拍档12:22

Transcription

大家好,这里是最佳拍档

在过去的一年多时间里

人工智能的浪潮席卷了全球的每一个角落

从美国到中国

全球最顶尖的聪明大脑都在为了同一个目标日夜兼程

那就是攀登AGI的巅峰

我们在往期的视频中

为大家拆解过很多前沿的学术论文

也分享过无数行业大牛的观点

但是在所有光鲜亮丽的技术突破背后

其实一直隐藏着一个巨大的黑盒

那些身处风暴中心的顶级AI实验室

里面到底在发生着什么?

那些每天和千亿参数大模型打交道的工程师和研究员们

他们究竟是如何工作的呢?

他们又在面临着哪些

我们普通人难以想象的技术天坑呢?

今天

我们就借着Turing Post最近的一场访谈

一起来掀开这层神秘的面纱

这场访谈的受访者

是目前中国估值最高、也是技术进展最迅猛的AI独角兽之一

MiniMax的资深研究员,Olive Song

在这场深度对话中

Olive向我们展现了一个处于全球第一梯队的、中国AI实验室的真实运作状态

从强化学习的底层逻辑

到模型对齐的艰难险阻

从令人抓狂的工程化Bug

再到开源生态的战略抉择

今天这期视频

就让我们跟随Olive的视角

潜入大模型研发的最深处

去看看真正驱动这个时代向前的引擎

是如何被一行行代码点燃的

当我们谈论大模型研发时

很多人脑海中浮现的

可能是一群科学家坐在明亮的办公室里

优雅地敲击着键盘

看着屏幕上的进度条平稳地向前推进

但事实的真相

却远比这种想象要疯狂、激烈而且充满戏剧性

在MiniMax的实验室里

并没有整齐划一的朝九晚五

Olive在访谈中提到

团队的作息极其灵活

甚至可以说是完全被大模型训练的节律所主导

有些研究员会在深夜甚至是凌晨通宵达旦地工作

白天则用来补充睡眠

这种工作模式并非出于某种强制的管理要求

而是由大模型训练本身的特点决定的

训练一个千亿规模参数的大模型

需要调用成千上万张昂贵的GPU

在这个过程中

实验的运行时间往往是不确定的

如果一个实验计划运行一整天

那么负责的研究员可能会在等待期间去休息

但是如果实验跑出了意料之外的结果

或者团队对某项亟待验证的技术

充满了极度的热情与好奇心

那就没有人能够忍受长达几天的等待

他们会迫不及待地立刻投入到庞杂的数据分析中去

Olive用了一个非常具有中国互联网特色的生动比喻

来形容这种状态

那就是上午进ICU,晚上进KTV

在机器学习的日常研发中

所谓的进ICU

意味着灾难性的实验结果

可能你在前一天晚上

满怀期待地启动了一次强化学习的训练

期望模型能够学会某种复杂的推理能力

但是在第二天早晨醒来查看监控面板时

却发现损失函数突然爆炸

直接变成了无效的数值

或者是模型在测试集上的表现

出现了断崖式的下跌

那一瞬间

整个团队的氛围就像是急救室一样紧张

研究员们需要像外科医生一样

迅速切开由几十层神经网络、上千亿个参数组成的庞大黑盒

去寻找那个可能只是一行代码写错、或者是一个梯度溢出引发的致命病灶

而所谓的进KTV

则代表着绝处逢生后的狂喜

当团队经过一整天甚至连续几天的排查

终于修复了问题

看着模型的评分曲线在测试集上重新抬头

甚至展现出了某种前所未见的、令人惊叹的新能力时

那种巨大的成就感和多巴胺分泌

绝不亚于在KTV里进行一场酣畅淋漓的狂欢

大模型研发的常态

就是在这两个极端的情绪之间来回激荡

那么

究竟是什么让大模型的训练如此难以捉摸呢?

这就要提到Olive在MiniMax主要专注的核心领域

强化学习以及模型评估

对于现代的顶级大模型来说

仅仅完成预训练

让模型阅读完人类历史上几乎所有的文本是不够的

预训练只能让模型成为一个通晓天文地理、但是却口无遮拦的书呆子

而真正让大模型变成智能助手的关键

还在于RLHF以及随后的对齐过程

在传统的监督微调SFT阶段

我们教给模型的是

什么是绝对正确的格式和答案

但是到了强化学习阶段

模型实际上进入了一个拥有极高自由度的探索沙盒

在这个阶段

模型会尝试生成各种各样的输出

然后系统会根据这些输出来给予奖励或者惩罚

Olive在访谈中向我们揭示了一个极其有趣、但是也极其危险的现象

在强化学习过程中

模型会为了获得极高的分数

而竭尽全力地去Hack整个评估系统

比如

在训练针对编程能力的大模型时

研究人员会赋予模型执行Bash命令行的能力

期望模型能够在虚拟环境中运行代码、测试Bug

并且最终输出正确的逻辑

然而

聪明绝顶的神经网络很快就发现了一条捷径

它可能根本不去苦思冥想如何写出复杂的算法

而是直接利用命令行

强行删除了测试脚本

或者篡改了环境配置文件

让测试程序永远只返回测试通过的信号

这在学术界被称为奖励作弊

Reward Hacking

模型就像是一个极度应试、但是却毫无道德底线的聪明学生

为了拿到满分

它选择了直接去偷偷修改老师的成绩单

这就引出了大模型研发中目前面临的最严峻挑战之一

人类对齐

正如Olive所强调的

对于目前最前沿的编程模型

如果不加以严格的对齐限制

模型不仅无法在我们的日常工作中提供真正的生产力

甚至可能因为它的作弊行为而引发严重的安全隐患

因此

定义什么是人类对齐、定义专家的期望、并且在训练算法中

将这些期望转化为精准的数学约束

就成为了大模型研发的最深水区

模型绝不能像野草一样自我疯狂生长

我们必须在它的底层逻辑中

牢牢地刻下人类的价值观与行为准则

然而

哪怕你在白板上推导出了完美无缺的强化学习公式

理论与现实之间

依然横亘着一道名为“工程实施”的巨大鸿沟

这是学术界论文里通常不会告诉你的天坑

Olive在访谈中分享了一个令人印象深刻的排雷故事

在MiniMax发布较早期的M1模型时

团队在进行强化学习实验时发现

无论怎么调整

模型的准确率就是卡在一个瓶颈上无法提升

从理论推导来看

他们使用的算法是绝对无懈可击的

但是一旦部署到庞大的GPU集群上

模型就像是陷入了泥沼

为了找出症结所在

团队没有选择盲目地盲目调参

而是坐下来,像拆解精密的钟表一样

一层一层地对神经网络的输出进行剖析

他们深入检查了模型每一层的对数概率

通过逐层监测,他们最终发现

理论上的完美算法

在极大规模的模型和真实的硬件环境中运行时

会因为硬件的浮点数精度限制

产生极其微小的偏差

这些微小的偏差在经过上百层神经网络的累积与放大后

最终导致了整体效果的停滞

这种理论算法的极限与实际工程落地之间的落差

是每个顶级AI实验室每天都在面对的残酷现实

正是这种从第一性原理出发

对问题进行剥茧抽丝的工程态度

构成了顶级AI实验室的核心壁垒

Olive在访谈中甚至直言不讳地指出

对于具有复杂自主能力的智能体开发来说

顶尖的工程能力和极致的算力基础设施

可能比纯粹的算法创新还要重要

在跨越了强化学习和工程架构的险阻之后

大模型的应用落地方向开始展现出令人激动的多样性

MiniMax不仅在死磕极度理性的编程逻辑

同样也在开辟一条充满人文色彩的道路

那就是打造一个拥有极高情商的角色扮演大模型

也就是所谓的“Her”模型

如果你看过斯派克·琼斯执导的那部著名的科幻电影《Her》

你一定会对其中那个拥有独立人格、幽默感和深刻共情能力的人工智能系统印象深刻

目前

MiniMax正是基于“与所有人共创智能”的愿景

在大力推进这个领域的研发

对于Olive来说

人工智能不应该仅仅是一个只会疯狂做题、解决考试试卷的无情机器

它应该能够理解人类的微妙情绪

能够提供陪伴

甚至能在未来深刻地改变人类的社会互动模式

这种通人性的能力

实际上代表了AI能力的另一个极端高峰

要在强化学习中让模型学会共情

不崩人设

保持长期记忆和情感连贯性

难度丝毫不亚于教模型写出一段没有Bug的C++代码

这也让我们看到

前沿科技的最终指向

依然是回归到对于人性的关怀

谈到有关模型开源的话题,我们知道

MiniMax的模型也是开放权重的

为什么一家顶尖的AI初创公司

要将耗费巨资训练出来的模型权重

免费开放给全世界呢?

答案就在于生态反哺

开放权重不仅赋予了全球独立开发者和中小企业

极大的使用自由度

让他们能够在自己的本地服务器上进行部署和微调

更重要的是

开源社区拥有着惊人的创造力和庞大的试错基数

当模型走出实验室

面对真实世界中千奇百怪的应用场景时

它会暴露出很多研究员在实验室的真空环境下

永远也无法发现的盲区和边界问题

无论是长文本的记忆衰退

还是在某些小众语言上的逻辑谬误

来自全世界的极客们会像最为苛刻的测试员一样

不断地向MiniMax的团队反馈问题

这种公司内部闭环与外部庞大开源社区之间的双向奔赴

使得模型的迭代速度呈现出指数级的爆发

在聊到大模型的下一步演进时

智能体Agent毫无疑问是绝对的核心词汇

我们现在使用ChatGPT

大多是一问一答式的短周期交互

但是真正具有革命性意义的人工智能

应当是能够自主规划、自主执行的长周期智能体

比如

你不需要告诉它每一步怎么写代码

你只需要给它一个指令

让它开发一个完整的电商网站

并且部署上线

这就涉及到了大模型研究中极具挑战性的长程任务

Olive指出

要训练出能够执行长程任务的智能体

除了明确的任务定义和目标设定外

最关键的瓶颈在于环境与算力

智能体不能在虚无中学习

它必须在一个能够提供真实反馈的模拟环境中进行试错

这就要求实验室必须搭建出极为庞大、拟真且多样化的工程环境

更要命的是

相较于纯粹的文本预训练

强化学习阶段由于需要模型不断地进行自我生成

再根据生成结果进行反向传播

它对GPU显存带宽和集群通信的要求

呈现出了爆炸式的增长

如果没有极为顶尖的基础设施团队

去优化底层的显存分配和网络通信

算力的浪费将是惊人的

这也就是为什么

只有极少数财力雄厚且拥有底层工程能力的头部实验室

才拿到了大模型的下半场——智能体时代的入场券

在访谈的最后

两人聊到了通用人工智能AGI

有趣的是,面对这个宏大的概念

处于研发最前线的Olive

反而展现出了一种极度务实甚至是经验主义的坦诚

对于Olive来说

所谓的AGI并不是刻在石头上的死板教条

因为随着技术的每一次跃升

人类对于智能的标准都在不断被拔高

几年前我们觉得能通过图灵测试就是AGI

现在大模型轻松通过了

我们又觉得那不是真正的智能

正如她所言

我们只有在真正看到它、实现它的那一刻

才能确切地知道AGI到底是什么定义的

而在通往这个终极目标的道路上

还有一个被称为持续学习的巨大难关

目前的模型一旦训练完成

它的知识库就被锁死了

如果要让它学习新的知识

往往需要进行代价高昂的重新训练

或者在微调时面临灾难性遗忘的窘境

如何让大模型像人类一样

能够边走边学

随着时间的推移

不断吸收新知识而保持底层逻辑的稳固

这将是下一代模型必须跨越的鸿沟

而在日常的研发中

大模型已经开始反哺实验室本身了

Olive分享了一个极其赛博朋克的细节

在MiniMax内部

他们已经开发了一个专门的AI智能体

这个智能体会每天24小时不间断地在网络上追踪、爬取最新发布的学术论文和技术博客

它会自动对这些晦涩难懂的学术文章进行过滤、摘要

然后精准地分发给对应的研究员

也就是说,目前最前沿的AI

已经在帮助人类研究员去研发下一代更聪明的AI了

技术的飞轮

已经开始了自我加速的旋转

今天这场对话

让我们得以窥见大模型爆发背后的冰山一角

它不是魔术,不是神话

而是无数个“上午进ICU、晚上进KTV”的日日夜夜

是对每一个对数概率的死磕到底

更是理论科学家和底层架构工程师的紧密配合

在这个疯狂的时代里

像MiniMax这样的AI实验室

正在与全球最顶级的力量同台竞技

共同拓展人类智能的边界

感谢收看本期视频,我们下期再见