Transcription
理解那些图像的含义和背景,以便听到更多。李教授,谢谢您,谢谢您精彩的介绍,也谢谢您的到来。很高兴来到这里,因为外面太热了。所以,我将与您分享一些令人兴奋的研究,以及计算机视觉这个领域。总的来说,让我问你们一个问题,有多少人认为自己知道“人工智能”这个词的意思?请举手。很好,好的,如果你不知道也没关系,这里有一个速成班。如果我的电脑能工作的话。我希望你们看过电影《机器人总动员》。我只是截取了《机器人总动员》的片段给你们看。如果你们是设计瓦力(Wall-E)的科学家,你们很可能是一位人工智能研究员,你们会赋予瓦力各种功能,比如追踪、导航……麦克风在哪里?我想是测试,测试。所以,我刚才说的是,如果你是设计瓦力的人工智能科学家,你很可能会致力于让瓦力大脑里的电脑做各种事情,就像我给你们展示的。我截取了这部电影的片段,然后给瓦力或者他的机器人朋友们(比如这个)想要的功能打上了标签。所以这个列表可以一直列下去。这里只是展示了人工智能系统在瓦力这个背景下可以做的各种很酷的事情。让我继续。人工智能是一个宏大的领域,它正在进行令人兴奋的未来研究,并且希望有一天能帮助我们所有人。它已经对我们的社会产生了巨大的影响。我们已经把机器人送到了火星,送到了深海,送到了手术室,希望很快就能送到家里,做所有你不喜欢做或者你的父母让你做的事情。在人工智能领域,我最兴奋的是一个叫做计算机视觉的子领域。计算机视觉就是让电脑能够看见。我刚才给你们看了一些例子。当你看《指环王》时,你可能没有意识到它背后有巨大的计算机视觉技术,尤其是对于甘道夫这个角色。我敢打赌,你们很多人家里都有连接设备。有多少人把连接设备作为生日或圣诞礼物?哦,不够。我以为每个人都会举手。去问问你的爸爸妈妈给你买一个吧,如果你能向他们解释背后的计算机视觉技术。你的数码相机有一个面部捕捉系统,这就是计算机视觉算法所做的。我们很快就会驾驶汽车,这些汽车将拥有自动视觉系统来检测路障、行人等等。所以,这就是计算机视觉的意义。而在斯坦福大学我担任主任的视觉实验室,我们所做的是制造能够看见的电脑。这就是我们的热情,我们的目标。我们还没有达到那个目标,但这就是我们想要做的。那么,“看见”意味着什么呢?这个词实际上有很多含义。让我给你们一个关于这个方面的一个观点。“一图胜千言”。你们有些人可能听说过。这句话是什么意思?“一图胜千言”。对于计算机视觉科学家来说,它意味着什么?让我们做一个思想实验。在这个方框里,应该有一张图片,但我还没有给你们看。相反,我将用一千个词来描述它。但一千个词太长了。所以我将用二十个词来演示。我可以告诉你,这是一张背景比较暗的图片,左上角有一个明亮的紫色斑点。然后中间有一个像眼睛的形状和金属质感的结构。然后,在右下角,你看到圆形的、大的东西。在左边,你看到一团白色的东西,还有更多的斑点和纹理。我可以一直说下去,你们会坐在那里想,“天哪,这太无聊了。”实际上并不无聊。很多时候,即使你构建一个能写出这种描述的电脑,也是一项了不起的成就。但这并不是你我沟通的方式。如果你想向我描述一张你看到的图片或视觉场景,你会打电话给我,说:“天哪,我在海滩上,太美了。让我给你描述一下。”你不会说这些话。所以,你更有可能说:“这是银河系。”好吧,假设你被派往太空。那里有一艘宇宙飞船,瓦力(Wall-E)和伊娃(Eva)在飞。我们看到一部分地球和水。所以,这种关于物体、场景和动作的描述对你来说很有意义。如果我继续描述,即使不如亲眼看到图片好,你也会对这个视觉场景有一个很好的理解。事实上,这就是图片。这就是我们热衷于做的事情。我们想给电脑图片和视频,让它们在人类的水平上理解它们,这样电脑就可以以你我通常解释的方式来解释它们,并进行交流,做很多很酷的事情。所以,用我们的语言,在研究界,我们称之为“高层视觉”。它如此之高,以至于提升到了太空。所以,这就是我们热衷于做的事情。让我再激励你们一些东西。宇宙中最好的视觉机器是什么?就是你们自己的人类视觉系统。这是一台令人难以置信的机器,大自然花费了数十亿年才进化出来。正如介绍中所说,你们大脑的一半都用于视觉功能。这是你们大脑中最令人难以置信的感官系统,而人类是令人难以置信的视觉动物。这里有一个我读博士时做的很酷的实验。我们想展示我们的大脑在看东西方面有多么惊人。这里我给你们展示一个实际的实验,如果你们来我的实验室,我们会和你们一起进行。我们让你们坐在电脑前,快速闪过照片,每次闪过一张照片,我们都会用一些像墙纸一样的东西挡住它。你们可能会想,那是什么鬼东西?那个像墙纸一样的东西实际上只是为了干扰你对那张照片的记忆,干扰信息。但与此同时,我们要求你,每次看到一张照片,并且有很长的停顿——不像这里,我只是快速展示——我要求你写下你看到的东西。你坐在观众席上,你可能已经明白了,每次你看到一张照片,你都知道这张照片的内容是什么,对吧?但我在这里展示这些照片的速度太快了。这是一个实际的实验结果。我们在右上角、左上角展示这张照片 500 毫秒。有多少孩子知道 500 毫秒是什么意思?半秒。太棒了。所以,那是半秒。在 500 毫秒的时间里,有一个科技大学的本科生为我写了所有这些东西。他不是在 500 毫秒内打字的,他只看了这张照片 500 毫秒,半秒,然后他就能写小说了。如果我们付给他更多钱,他可以写更多。但这是惊人的。他可以写关于风景的,他可以写关于物体的,他可以写关于正在发生的活动的。这是一个典型的人类视觉系统结果。这个特定的科技大学本科生并不特别,至少在这个任务上不特别。当然,斯坦福大学的本科生会写得更多。这里有一些令人难以置信的事情。在实验中,我们甚至将这张照片的展示时间缩短到 40 毫秒。现在,你们知道 40 毫秒是什么意思吗?比 500 毫秒短得多。它是 1/25 秒。在这段时间里,你的人类视觉系统能够捕捉到重要信息,比如田野里的两个人。这真是令人难以置信。每次我看到这些,我进行这些实验结果,你知道,我已经做了 15 年了,我仍然对我们大脑里拥有的这台令人难以置信的机器感到兴奋。而且,我必须说,电脑离这个还很远。这再次让我感到兴奋,这意味着我们有一个伟大的目标要实现。所以,这就是我们计算机视觉科学家正在追求的。我们希望有一天能制造出能够像这样接收一张图片,并为我们写故事、写小说的电脑。这是一个非常宏伟的目标,但我们在实现这个目标方面取得了很好的进展。今天的讲座剩余部分,我将向你们展示我实验室里正在进行的几个项目,大概两三个,它们展示了计算机视觉的前沿技术,以及这些研究如何帮助我们拼凑出最终能够看见和理解一切的电脑。我在这里展示的第一个项目,我们称之为“图像叙事”。这有点像是追求计算机视觉的圣杯。这只是一个中间结果,我们还有很多工作要做,但我们已经取得了令人兴奋的进展。那么,写故事意味着什么呢?在你的英语课上,你的老师会告诉你写故事的五个 W 原则,对吧?谁、哪里、为什么、什么、何时。有一天,我想制造一台能写出这种故事的电脑。它会写出关于场景中发生的一切。谁参与了?我们在哪里?为什么?这可能是最棘手的。什么?整个事件是什么?何时发生?为了朝着这个方向取得进展,我们首先关注了五个 W 中的三个,它们比“为什么”和“何时”更容易一些。那就是“谁”、“哪里”和“什么”。所以,这是我的实验室里一台电脑的实际结果,我们已经构建出来了。这是一个我们展示给电脑的图像。电脑除了看到这张图片外,没有任何其他信息。然后我们要求电脑写一个故事,也就是说,告诉我们“谁”、“什么”、“哪里”以及“谁”。右边是电脑所做的。电脑知道事件是划船事件。它发生在哪里?电脑告诉你,这是一个湖泊。这张图片中涉及的物体是谁?电脑会标记出树木、运动员、划船、船和水。这是由我们的计算机视觉算法自动生成的。这是另一个例子。这是另一张我们展示给电脑的图片。就是这样。我们没有任何其他信息。你看到的一切就是电脑看到的一切。它能够开始标记不同的物体。它标记出滑雪板,它标记出人。看看,电脑不仅在标记,它还在进行我们称之为“分割”。它实际上告诉你图像的哪个部分属于那个特定的物体,这绝非易事。它标记出这是一个人,它标记出天空中的云,雪和树。这又是电脑在我们实验室自动生成的另一个结果。这里有更多例子,我不会让你感到厌烦。所以,这是快速浏览。这是一场划船比赛,电脑标记出船。或者,如果你不知道那个词,那就是你用来在水中推动人的东西。这是一场攀岩比赛,它标记出人、岩石、树木、山和天空。当然,你可以看到它仍然有点零碎。电脑还没有达到完美的程度。但这实际上是世界上第一个在给定照片的情况下达到这种理解水平的算法。顺便说一句,我展示的所有照片都只是从 Flickr 下载的,所以这些都是用户实际的照片。哦,还有一个例子。羽毛球。我在这里非常印象深刻,电脑标记出了网。因为如果你看这张照片,羽毛球网并不那么明显。所以,电脑必须推理:哦,我看到一场羽毛球比赛,我看到运动员,一定有网。所以,好的,这是我们完成的一个项目。在完成之后,我们问自己,我们能否将这个项目应用到某个地方?让电脑标记这些图片很棒。我们能否开始考虑制造更智能的相册?我确定,尤其是这里的父母们,你们可能有很多孩子的照片文件夹,保存在你们的电脑里。因为我是一个新手父母,我每天都给我宝宝拍照,然后我的硬盘就满了。组织这些照片实际上非常烦人。到目前为止,我组织它们的方式是按日期。我说,但我可以想象有一天,我回到中国,给我的朋友看。如果我的朋友说:“我想看你宝宝所有的生日派对。”或者“我想看你的孩子和他最好的朋友约翰在一起。”这些都是非常常见的问题,有一天你我都会想用我们的照片来做的事情。但目前还没有这样的技术。所以,有一天我们希望它能实现。我们实验室有一个正在进行的项目,我们称之为“智能相册项目”。有一天,我们希望能够制作相册,打破对照片内容的限制,这样我们就可以打破当今照片组织程序的障碍,并能够进行这种搜索。这也受到我们拥有海量照片的事实启发。你知道,Facebook……我上周刚去过 Facebook 总部,一位工程师告诉我,他们每分钟上传 5000 张照片左右。而在 YouTube,每分钟上传 24 小时的视频。这是一个巨大的数字。你可以想象,人类根本无法处理这个数量。所以,有一天我们必须制造智能电脑来处理。所以,这里又是一个我们在实验室里做的玩具例子,这是我们第一次尝试如何比按日期命名文件夹更智能地组织照片。我们在这里进行了一个小型实验,我们拍摄了 4000 张用户照片,我们知道这 4000 张照片来自各种活动,比如婚礼、生日派对等等。但我们没有告诉电脑。我们只是给电脑看了 4000 张 Flickr 照片,然后告诉电脑,你能比仅仅按日期更智能地组织它们吗?这就是电脑所做的。电脑,我们的程序能够利用我们在第一个项目中展示的成果,你知道的,“什么”、“哪里”和“谁”,然后开始组织一个层次结构。这里有一个例子,它组织了所有的活动照片,并按婚礼和生日分开。在婚礼下,它进一步组织了婚纱和鲜花的照片。生日派对则分开了蛋糕和跳舞的照片。这里是另一个足球的例子,它区分了体育场镜头或比赛的更详细的照片。这里是食物,它将寿司与蛋糕分开,等等。这些都是由我们的计算机视觉算法自动生成的。当然,这是一个非常小的实验尝试,我们仍在完善它,但这是访问你的数字图书馆的一种更智能方式的一步。这是对那 4000 张图片的组织概览。所以,这是关于讲述图片中一切的两个项目。在成功构建最佳计算机视觉算法方面,最关键的组成部分之一就是物体,因为物体主导着视觉世界,而人类识别许多许多物体。所以,我们实验室与博士生和博士后投入了大量精力的一个项目就是识别许多许多物体。我将给你一些我们正在做的工作的例子。假设你有一个只有 100 个物体的世界。你的整个世界只有 100 个物体,这已经是一项艰巨的任务了。我读博士的时候,世界上最好的计算机视觉算法能识别大约四种物体。从那时起,我们取得了巨大的进步。这是一个有 100 个物体的世界,我想让你识别这张图片是关于什么的。当世界很小时,我们旧的计算机算法可以进行这样的搜索。它只是看着图片,尝试搜索它的数据库和模型,然后尝试找到匹配的物体。这里,它是一个海星。那么,一个有 1000 个物体的世界呢?这至少需要 10 倍的速度。那么,今天的互联网世界呢?你知道,有人能猜到人类一生中能识别多少种物体类别,比如椅子、桌子、成年人吗?你的答案是多少?一百万?是的,这个小女孩说一百万。还有人吗?十亿?哇,那非常乐观。答案是我们不知道,但我们有一个猜测。早在 1980 年代,在你出生之前,至少你们中的一半人还没有出生,互联网也还没有出现。南加州大学有一位心理学家,他使用他能找到的最大词典和所有东西进行估算,估计人类能识别大约 30,000 个物体类别。这个数字自那时以来一直受到挑战。事实上,我不知道你的名字,但是,她说了“一百万”。我们估计大约是一百万。如果你去维基百科,维基百科的条目数量级是百万。当然,并非所有内容都是视觉的,但我们认为数量级是一百万。但无论这个数字是多少,它都对计算机视觉科学家构成了巨大的挑战,因为我们希望训练能够识别数万甚至数百万个物体类别的计算机视觉算法,并且我们希望使其非常高效。否则,我们就没有希望将计算机送上火星,或者将计算机送到你家里。所以,我们的目标是快速准确地识别许多物体。我们的想法是,我们无法进行我刚才展示的那种逐个搜索来识别这个海星。我们希望快速消除许多不相关的物体,并不断缩小范围,快速得出正确的答案。这背后是相当复杂的数学,我今天不想在星期六让你感到厌烦,让你看方程式。你仍然需要完成高中,甚至可能大学才能理解背后的数学。但我可以告诉你,我的博士生和我正在愉快地处理这些方程式。这是我在这里展示的一个真实结果。这是一个有 1000 个图像、1000 个物体类别的世界。我给电脑看一张未知的图片,然后说:“嘿,电脑,告诉我这是什么。”我们的电脑能够非常高效地做到这一点。在第一次迭代中,它很快就消除了半数可能性,然后又消除了另一半。在短短四到五次迭代中,我们就得出了正确的答案。这比扫描一千种可能性要好得多。这是另一个例子。所以,我们的电脑可以告诉我们,这是一个戴着帽子的人。有时物体太难了,无论你做什么,你都不知道它是什么。有人知道这个物体的名字吗?哦,天哪,这么多人。让我们找一个后面的人。那个穿红衣服的男孩。是的,是鼹鼠吗?非常好。你说它是鼹鼠。你说它是星星。谁?让我们为她鼓掌。太棒了。你在哪里看到的?你见过吗?我看到了一张照片。哦,哇。我参加了一个夏令营,他们展示了照片。哦,自然营。是的。所以,下次我会给你看更难的。所以,是的,我认为她会超越所有电脑。是的,它是星鼻鼹鼠。但你也说对了,它也是鼹鼠。当我看到这个的时候,我只是说它是一种动物。所以我不知道它是什么。但是,但是有时我们……在试图制造智能电脑的过程中,在我们知道我们像她一样聪明之前,在我们知道它是星鼻鼹鼠之前,无论如何都要准确是很重要的。所以,现在我们正在构建世界上最大、我将在几分钟内向你们展示结果的识别系统之一。我们希望识别 20,000 种不同的物体,并且永不犯错。我们如何实现这一点,尤其是在看到像这样的图片时?一种方法是知道何时停止。例如,她知道星鼻鼹鼠。那边的男孩说它是鼹鼠,也是正确的。我也会说它是动物,我也没说错。所以,这是我们的结果。我们有一个绝对可靠的分类器。我们称之为图片,实际上它被称为物体,地面真相被称为红狐狸。但电脑不知道是什么。我们的算法看到这张图片,它也有心。我也会给你看一些你可能不知道的东西。给我一分钟。所以,旧的旧式计算机视觉算法,我们称之为“扁平化”,让我们原谅这个术语。它说它是鬣狗,这并不完全正确。而我们的算法在具有挑战性的情况下会说它是犬科动物。所以,它总是知道何时停止,并且永远不会出错。这在许多应用场景中非常重要,我们可以做出始终正确的猜测。例如,中间的图片,第二行。旧的计算机视觉系统会说它是飞艇,这实际上是错误的。我们真的不知道它是什么。至少我们称它为飞行器,这给了我们一些想法,然后我们可以改进我们的算法。所以,我想挑战一下,你叫什么名字?我必须知道你的名字。艾莉森。我想挑战艾莉森。好的,我先跳过这个。艾莉森,这是什么?一辆车。是一辆车。还有其他猜测吗?它是什么?赛车。所以,这就是传统算法会说的。我认为这是错误的。每个人都会同意我。这是我们的算法所说的。我们不确认为什么。我们不想犯错。所以,我们称它为交通工具。下次我会叫艾莉森上来问。那么,[笑声][掌声][音乐]艾莉森说它是鸟和鳄鱼。你会怎么说?它是……它是变异体。很好的答案。所以,所以,所以,这就是我们所说的,它是一种动物。所以,这里是另一个例子。所以,我不知道,你认为它能吃吗?艾莉森?艾莉森说它是可食用的水果。我认为它是可食用的水果。所以,所以,这里当然……所以,好消息是,我们的正常世界里并没有充满这些东西。所以,你知道,如果我们在充满这些东西的世界里行走,我们必须认真思考新的算法。但这只是为了证明,第一,我们在研究中玩得很开心。第二,更深层的是,我们正在努力识别许多许多物体,并且在面对真正奇怪和困难的物体时,我们也在寻找巧妙的解决方案,让我们更进一步,即使有时我们不确啶确切的答案是什么。所以我很自豪地报告,在斯坦福视觉实验室,我们是第一个构建出识别超过 20,000 个物体类别的视觉识别算法的。甚至谷歌都没有。[掌声]好的。所以,最后,我将以一个非常小的项目结束。我们也非常兴奋。世界不仅仅是图片。我们对视频也极其兴奋。这里是我们实验室与博士生一起进行的一项研究,用于识别人类动作。我真的很喜欢这些花样滑冰视频。这是我们的人工智能计算机视觉算法。你给它视频,它就能识别出这些运动员正在做什么类型的动作,并能标记出这些运动员正在进行的旋转和技术性姿势。这里是更复杂的结果。上面的两行是两个输入序列,下面的两行是电脑的两个输出序列。我们给出输入序列,我们训练了计算机算法,让它们能够跟踪这个人,识别这个人,并能够实时标记出这个人正在做什么。这是我们在实验室进行的另一个项目。所以,你知道,我希望我有更多时间坐在这里告诉你我们实验室里发生的一切,以及计算机视觉世界的现状。但我将在这里停止,因为我认为回答一些问题更有趣。哎呀。但我们正在做令人兴奋的事情。计算机视觉是一个非常令人兴奋的领域。有一天,我们希望……