📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

【人物】Yann LeCun四十年深度学习探索历程 | 卷积网络之父 | 图灵奖得主 | CNN | 杰弗里·辛顿 | 反向传播 | 贝尔实验室 | 手写识别 | Meta | 开源Llama

最佳拍档16:37

Transcription

大家好,这里是最佳拍档,我是大飞。

最近,油管上的AI Stories频道悄悄上线了一位AI元老级人物的个人纪录片。这个人,就是被称作“卷积网络之父”、“深度学习三剑客”之一,同时也是Meta首席AI科学家的Yann LeCun。

这部纪录片不长,只有17分36秒。但是里面包涵的是这位AI传奇人物四十年的探索历程,更是整个深度学习领域从“无人问津”到“席卷全球”的缩影。

更有意思的是,这部纪录片上线的时机非常微妙。就在不久之前,Meta的创始人马克·扎克伯格(Mark Zuckerberg)公开暗示,可能会重新考虑旗下知名开源大模型Llama的开源策略。要知道,Yann LeCun一直是开源AI最坚定的倡导者之一。他曾经不止一次的说过,选择在Meta工作,就是因为Meta对开源的坚定承诺。

那么问题来了,如果Meta真的收紧开源策略,这位开源信徒还能在Meta找到容身之所吗?更何况,如今扎克伯格又让28岁的Alexander Wang出任Meta的首席AI官,LeCun心里又会如何感受呢?

今天,我们就借着这部纪录片来聊一聊Yann LeCun的故事,看看他是如何从法国索邦大学的一名“孤独探索者”,成长为改变AI格局的“教父”,又为何始终坚信开源才是AI的未来。

可能,有不熟悉AI的观众会问,Yann LeCun是谁?在AI圈里,他的名字几乎等同于卷积神经网络CNN(Convolutional Neural Network)。这项如今被广泛用在图像识别、自动驾驶、医疗影像等领域的核心技术,正是LeCun在三十多年前奠定的基础。

他出生于1960年,是法国裔美籍计算机科学家。除了“卷积网络之父”的称号,更重要的身份还是“深度学习三剑客”之一。另外两位,则是杰弗里·辛顿(Geoffrey Hinton)和约书亚·本吉奥(Yoshua Bengio)。这三个人,在2018年共同获得了计算机领域的最高荣誉“图灵奖”,理由是“为深度学习的发展奠定了基础,推动了神经网络的复兴”。

可能很多观众不知道的是,LeCun在博士阶段就做出了一件影响深远的事。他提出了一种早期形式的“反向传播”(Backpropagation)算法,专门用来训练多层神经网络。现在我们知道,反向传播是深度学习的“核心引擎”之一,几乎所有深度模型的训练都离不开它。但是,在当时,这个想法不仅不被看好,甚至还被同行嘲笑。

为什么?因为在上世纪80年代,“神经网络”还是个极其冷门的领域。冷门到什么程度呢?LeCun在法国索邦大学读博士的时候,整个法国都找不到一个和他研究方向相同的人。他在纪录片里回忆过这段日子,说:“人们当时在取笑我们,那些研究神经网络的人。”

但是,LeCun没有被嘲笑吓退。因为他有一个坚定的信念,那就是机器真正的力量,不在于被动执行人类写好的程序,而在于学会自己学习。这正是今天AI的核心思想。但是,在40年前,这简直就是“天方夜谭”。

为了寻找突破口,他埋首于当时寥寥几位先驱的论文里,比如约翰·霍普菲尔德(John Hopfield)的Hopfield神经网络、杰弗里·辛顿的玻尔兹曼机,还有特里·塞诺夫斯基(Terry Sejnowski)的深度置信网络。他慢慢的意识到,要想让机器“学会学习”,关键是破解“多层神经网络的训练难题”,而当时的技术只能训练简单的单层或者双层网络,对于稍微复杂一点的多层网络,根本无法有效的调整参数。

命运的转折点发生在1985年。那一年,LeCun参加了一场学术研讨会,在会上遇到了美国科学家,同时也是神经网络领域早期探索者的特里·塞诺夫斯基(Terry Sejnowski)。他和杰弗里·辛顿合作过不少研究。塞诺夫斯基听完LeCun的报告后非常兴奋,回到美国就找到辛顿说:“有个法国的小伙子,正在做跟我们一样的事情!”

几个月后,杰弗里·辛顿(Geoffrey Hinton)专门跑到巴黎,想要看看这个法国小伙子的研究到底怎么样。有意思的是,当时辛顿的法语并不好,两人的交流主要是靠着数学公式。但是恰恰是这些清晰的公式,让辛顿一眼就看懂了LeCun的价值。他当即向LeCun发出邀请:“你何不来多伦多,跟我做博士后呢?”

1987年,LeCun博士毕业,毫不犹豫地前往加拿大多伦多大学,跟着辛顿做了一年博士后。这段经历,成了他后来学术生涯的一个关键跳板。因为在多伦多,他不仅能和辛顿直接合作,接触到深度神经网络最前沿的思想,还结识了一批后来同样成为AI领域中坚力量的学者。可以说,正是这段合作,为他后来在贝尔实验室的突破埋下了伏笔。

1988年,LeCun离开多伦多,加入了当时全球科技界的“圣地”,贝尔实验室(Bell Labs)的自适应系统研究部门。可能现在的年轻观众对贝尔实验室不太熟悉,但是在20世纪,它绝对是“现代科技的摇篮”,包括像晶体管、激光、光纤、UNIX操作系统、C语言等等,这些改变世界的发明,都诞生在这里。当时的贝尔实验室汇聚了全球顶尖的计算机科学家和工程师,对于LeCun来说,这里是把理论想法变成实际产品的最佳舞台。

果然不其然,加入贝尔实验室后,LeCun只用了一两个月,就做出了一个震惊团队的成果。他开发了一个手写数字识别系统,只要把一张写有数字的纸放在摄像头下,按一下按键,系统就能以每秒几个字符的速度准确识别所有的数字。这个看似简单的“演示”,后来催生出了AI领域最早的商业应用之一:自动读取支票金额的ATM系统。

具体来说,LeCun和贝尔实验室的团队,基于他提出的“卷积神经网络”CNN,开发了一套“支票手写体识别系统”。这套系统能自动读取银行支票上的手写数字,比如金额,然后转化为计算机可处理的信息。在1990年代末,这套系统正式投入商用,被NCR等当时的金融设备巨头,部署到了全球各地的ATM机上。根据后来统计,这套系统最多的时候,处理了全美国超过10%的支票。要知道,在那之前,银行处理支票全靠人工,不仅效率低,还容易出错。LeCun的技术,一下子把金融票据处理的自动化水平,提升到了新的高度。

而这一切的核心,就是“卷积神经网络”(CNN)。LeCun设计CNN的灵感,来自于人类的生物视觉系统。我们的眼睛看东西的时候,会先识别边缘、颜色等简单的特征,再逐层组合成复杂的物体。比如,我们会先看到线条,再看到轮廓,最后认出是“猫”。CNN也是如此,它通过“卷积层”逐层提取图像的低级特征,比如像素或者边缘,再通过“池化层”来压缩信息,最后通过“全连接层”完成分类或者识别。

LeCun把这套架构命名为“LeNet”,最初就是为了识别手写数字设计的。1989年,他发表了一篇著名的论文《利用反向传播算法识别手写邮政编码》(Backpropagation Applied to Handwritten Zip Code Recognition)。在这篇论文里,他详细展示了LeNet如何用反向传播算法进行训练,以及在手写邮政编码识别任务上的准确率。在当时,这个准确率远远超过了传统的模式识别方法。这篇论文,现在被公认为“现代深度卷积网络的起点”,直到今天,我们用的ResNet、YOLO等图像识别模型,本质上都是在LeNet的基础上改进而来的。

但是,成功的道路从来不是一帆风顺的。尽管LeCun的技术在实验室里表现出色,想要让整个行业接受它,却异常的艰难。他在纪录片里解释了背后的原因:因为当时每个人都用着不同的电脑、不同的操作系统,导致系统很难复现。当时还没有统一的深度学习框架,比如现在的TensorFlow、PyTorch等等。要想把LeNet部署到不同的硬件上,就需要手动调整大量的代码。再加上当时“神经网络”的名声并不好,很多公司宁愿用传统的统计方法,也不愿意尝试这种“看起来很复杂”的新技术。所以,尽管LeCun手里握着“未来的钥匙”,却很难把它分享给更多的人。

这种“不被理解”的状况,一直持续到21世纪初。2003年,LeCun已经成为纽约大学的教授。他意识到,要想让神经网络被更多人接受,光靠技术改进还不够。“名字”或许也是个问题。“神经网络”这个词,在当时已经和“不可靠”、“难训练”绑定在了一起。于是,他和杰弗里·辛顿、约书亚·本吉奥等同行,做出了一个影响深远的战略决策:把“神经网络”改名为“深度学习”(Deep Learning)。“深度学习”这个名字,一方面突出了“多层网络”的核心特征,也就是网络的层数多;另一方面也避开了“神经网络”之前的负面标签。

但是,真正让“深度学习”爆发的,还是杰弗里·辛顿策划的一场“天才阳谋”。辛顿当时意识到,要让行业认可深度学习,必须在一个“刚需领域”做出无可辩驳的成绩。语音识别就是最好的选择。当时,微软、谷歌、IBM三家公司拥有全球最顶级的语音识别引擎,它们用的都是传统的“隐马尔可夫模型”(HMM),准确率已经到了瓶颈。辛顿把自己的三名学生作为实习生,分别送到了这三家公司,给他们的任务只有一个:用深度学习系统,替换掉传统引擎里的“声学建模”部分。因为声学建模是语音识别的核心,负责把声音信号转化为文字特征。

结果超出了所有人的预期。这三名学生开发的深度学习声学模型,在所有测试集上的准确率,都超过了传统的HMM模型。LeCun在纪录片里提到这件事时,忍不住笑称:“这手策划真是高明!”更关键的是,在那之后不到18个月,深度学习就彻底占领了语音识别领域。几乎每一部智能手机的语音助手,比如苹果的Siri、谷歌的Google Assistant,背后用的都是深度学习技术。一场“语音识别革命”,就这么悄无声息地完成了,而深度学习也从此从“小众技术”变成了“行业标配”。

随着深度学习的普及,LeCun的职业生涯也迎来了新的阶段。2013年,他加入了当时还叫Facebook的Meta,负责组建Meta的人工智能研究实验室(FAIR);2018年,他的头衔进一步提升为“首席AI科学家”(Chief AI Scientist),这意味着他不仅要领导FAIR的学术研究,还要参与Meta整个公司的AI战略制定。

LeCun为什么要选择Meta呢?他在纪录片里说得很清楚:因为Meta对开源有着坚定的承诺。这种“开源信念”,是LeCun一直以来的核心观点。他在纪录片里站在巴黎的法兰西科学院前说:“我们看到的并非是地区间的竞争,而更多是开放研究、开源世界与闭源生态之间的较量。”在他看来,AI的真正进步,不在于某个国家或某个公司“垄断技术”,而在于让创新成果普惠大众。而开源系统能让全球的开发者共同迭代、改进技术,速度远远超过闭源生态的“闭门造车”。

最典型的例子就是Meta的Llama模型,它正是由在巴黎的Fair团队研发的。自从发布以来,下载量已经高达8亿次。无数中小企业、科研机构、个人开发者,都在用Llama做二次开发,有的做了垂直领域的AI助手,有的优化了模型效率,有的甚至开发了面向边缘设备的轻量化版本。LeCun认为,这才是AI该有的样子。哪个国家处于领先并不重要,重要的是,开放研究和开源社区的迭代速度,要比那些选择秘不示人的公司更快。

但是现在,这种“开源信念”正面临着考验。扎克伯格最近的表态,让外界开始猜测Meta是否会收紧Llama的开源策略。如果Meta真的这么做,LeCun还会继续留在Meta吗?目前他还没有公开回应。但是,从他过去的言论来看,开源是他的“底线”之一。比如,他曾说过:“如果一家公司不再支持开源,那它就不再是我想为之工作的地方。”所以,Meta未来的开源策略变化,或许会成为LeCun职业生涯的又一个“转折点”。

除了开源,LeCun对AI的未来还有一个重要的观点,那就是他不认同“AI威胁论”。现在很多人担心“AI会失控”、“AI会取代人类”,但是LeCun认为,这是一种“不必要的恐慌”。他在纪录片里说道:“AI失控并不是一个不可避免的宿命,而是一个需要去解决的工程问题。”就像制造安全的飞机一样,在他看来,人类在发展技术的过程中,总是能找到控制风险的方法。比如,飞机发明的初期也有很多事故,但是现在已经成了最安全的交通工具之一。而AI的安全问题,本质上也是一样,只要提前设计好“安全护栏”,就能避免风险。

他还犀利地反驳了“智力与统治欲望正相关”的观点。很多人会觉得“AI越聪明,就越想统治人类”,但是LeCun说:“看看政界,情况甚至恰恰相反。”他提出了一个“目标驱动架构”(Goal-Driven Architecture)的设想。未来的AI系统,应该被预先设定好明确的“目标”,比如“帮助人类解决疾病”或者“减少碳排放”,同时设置不可逾越的“安全规则”,比如“不能伤害人类”、“不能欺骗人类”等等。他甚至预言,未来不会是“AI统治人类”,而是一种用我的正义AI,来对抗你的邪恶AI的制衡局面,通过不同AI之间的相互监督,来确保技术始终服务于人类。

在纪录片里,LeCun坚定的说道:“我相信社会最终会做出正确的选择,因为民众会提出这样的要求。”在他的眼里,AI的终极意义不是“取代人类”,而是“增强人类的智慧”,就像15世纪的印刷机一样,它没有取代人类的写作能力,而是让知识得以更广泛地传播,推动了文艺复兴和科学革命。所以,AI也应该是这样,它能够帮人类处理繁琐的重复劳动,让我们有更多精力去思考、去创造,最终推动一场新的“文艺复兴”。

当然,脱下“AI教父”的光环,LeCun也是一个充满生活气息的人。他在纪录片里分享了很多自己的爱好。比如,他从工程师父亲那里继承了动手的能力,从小就痴迷于制造各种飞行器,他说:“我们把它们飞上天,再把它们摔下来。”(当然不一定是故意的)。现在有空的时候,他还会自己组装无人机,享受从无到有创造东西的乐趣。他还对动物的智慧充满好奇,经常看关于动物行为学的纪录片。音乐也是他生活中的一个重要部分,品味很广,从古典的巴洛克音乐,到现代的硬波普爵士,他都能欣赏。另外,他对美食也很执着,尤其怀念巴黎的味道,因为他有四分之一的阿尔萨斯血统,这是法国东北部的一个地区,靠近德国,所以饮食文化融合了法德特色。而外祖母做的传统阿尔萨斯炖菜,是他心中“最家乡的味道”。

这些爱好,其实也影响了他的科研生涯。比如,对生物视觉的兴趣,让他发明了CNN;对动手的热爱,让他更注重技术的实际应用。用他自己的话来说就是:“一个只懂算法的科学家,不是一个完整的创造者;只有懂得生活,才能做出真正改变生活的技术。”

最后,在纪录片的结尾,LeCun把目光投向了年轻一代,说了一段非常恳切的话,他觉得很有必要和大家分享。他说:“不要让那些负面或者耸人听闻的故事,阻碍你前进的脚步。要认识到自己的力量,主动去塑造你所期望的未来。即使是一个简单的想法,只要它对你意义重大,只要你笃信不疑,就能带来改变。未来,取决于你自己。”

这段话,其实也是LeCun自己的人生写照。40年前,他在索邦大学研究神经网络的时候,没人看好他;30年前,他在贝尔实验室推广CNN的时候,没人相信这个技术能商用;20年前,他和同行把“神经网络”改名为“深度学习”的时候,没人想到这个名字会改变整个行业。但是,他始终笃信自己的想法,一步一步坚持下来,最终成为了改变AI历史的人。

所以,对于我们每个人来说,无论是想进入AI领域,还是在其他领域追求梦想,LeCun的故事都告诉我们,真正的创新,往往开始于“不被理解”,而真正的坚持,则源于对自己想法的笃信。AI的未来,也不会是由某一个公司或者某一个国家决定的,应该是由每一个愿意参与其中、愿意用技术创造价值的人,所共同书写的。

好了,今天关于Yann LeCun的故事,就和大家聊到这里。纪录片的链接我会放在视频简介里。感谢观看本期视频,我们下期再见。