Transcription
[音乐] 我们非常幸运能请到埃德温。嗯,我很期待接下来的一个小时左右,我们将与他聊天并听他讲述他的旅程。嗯,我们将涵盖几个方面。呃,其中之一是,呃,就是Surge的故事。我想很多人都很兴奋,呃,能听到关于Surge的故事,因为Surge在一段时间内一直默默无闻。嗯,在所有意义上都是一个真正的独角兽。呃,完全自力更生,收入超过十亿美元。嗯,它显然是生态系统中真正重要的参与者之一,将我们带到了今天拥有人工智能模型的地步。嗯,我们将谈论“负一”。我们将广泛讨论,呃,数据的前沿和数据的未来,以及更广泛地讨论人工智能和通用人工智能。对此感到非常兴奋。感谢您的到来。谢谢。谢谢邀请我。
呃,也许就从开始说起,呃,很高兴能让大家多了解您一点。嗯,正如许多通过SPC认识我的人所知,我最喜欢的问题之一是问别人他们来自哪里,以及那如何塑造了他们,以及他们如何看待世界。所以我会问埃德温,我也会问您同样的问题。呃,我知道您在佛罗里达湾的一个小镇长大,但也许可以多告诉我们一些关于您成长的地方。它如何塑造了您?是的。所以,我在佛罗里达州一个叫水晶河的小镇长大,它实际上以是海牛的家园而闻名。所以,那可能是它最广为人知的事情。老实说,我认为它塑造我最深的方式是,有点好笑的是,那里没什么可做的。所以,我小时候最终做的就是大量阅读。所以,我就会阅读所有关于数学和语言的东西,以及大量的科幻小说,这真的启发了我。所以,我实际上很喜欢这一点。我今天所做的一切,实际上都只是所有这些的成人版。
我喜欢那样。令人惊奇的是,这三者的交集无疑解释了您今天所做的事情,我们稍后会再谈。呃,另一个有趣的小破冰问题。呃,显然您的公司,嗯,呃,在我们今天使用的许多产品中扮演着重要角色。我很好奇,就您个人和职业而言,您的AI技术栈是什么?呃,您使用并喜欢哪些AI应用程序?所以我肯定大量使用ChatGPT和Claude,我倾向于将Claude用于许多专业工作项目,比如我认为它在起草文档方面非常出色,尤其是在您使用Sonic 4.5时,然后我实际上很喜欢它的知识库功能,所以每当我它的知识库中有一堆关于公司的文档时,我就会用它来,呃,基本上帮助起草很多东西,然后我倾向于将ChatGPT用于许多个人项目,比如计划旅行或餐厅推荐,老实说,它已经取代了我很多谷歌生产力,对我来说。然后我可能会使用的第三大工具实际上是谷歌的Notebook LM。比如我发现它在阅读论文时非常有用,我只需把一篇论文扔进Notebook LM,然后在我城市里散步时听一堆播客。
Notebook LM。嗯,它确实帮助我为这次活动做了准备。所以,呃,我们在这方面意见一致。呃,我很想知道您是如何体验AI产品的,因为我相信您在使用它们时会不断评估它们。就像,“哦,看看这个[笑声]回复。”是的,这实际上有点好笑。我注意到幻觉的次数,无论是关于我正在研究的东西,然后我就会想,“好吧,嘿,我该怎么做,我会把它发给你们,发给我们的一位客户,但是嘿,你们怎么能去修复这个问题呢?”所以,这非常非常有趣。
我相信您会看到一些回复,让您觉得,“你们应该从我们这里购买更多数据。”嗯,只是一个快速的,呃,破冰问题,因为我确实认为它可能为我们对话的其他部分奠定基础。呃,你知道,Serge使命的很大一部分是加速通用人工智能,但以一种能为其带来人性的方式。呃,请您快速定义一下通用人工智能,作为我们对话的框架,然后我们再深入探讨“负一”的故事。所以我思考通用人工智能的方式是,我真正思考的是我们想要为人类解决的巨大问题,以及它是否,比如,我们正在构建的系统是否真正造福于我们整个物种,例如,我经常思考如何构建最终能帮助我们解决贫困、治愈癌症和解决其他疾病的人工智能,这些是我在思考长期通用人工智能时真正思考的宏观问题,但同时我也担心它是否正在造福我们这个物种。比如我实际上非常担心教育的未来。当我们触手可及所有这些易于获取的信息时,人们未来还会想继续学习吗?或者他们只会整天观看这些AI树懒视频,然后我们就会变成像《机器人总动员》里的那些自动人?这有点好笑。几周前,我实际上大量使用了ChatGPT。我实际上让它帮我写一些电子邮件。所以我花了30分钟和它一起,让它帮我精心制作一封完美的电子邮件。它创建了10个迭代版本。每次迭代都变得越来越好。最终它做到了。它给了我完美的电子邮件,我发了出去。但那时我心想,我刚才做了什么?我花了30分钟精心制作一封完美的电子邮件,而过去我可能只需10秒钟就发送了。这真的重要吗?比如,当然,我们有这些极其智能的系统,但我只是担心它们正在使我们这个物种变得越来越懒惰,而且我们并没有完全优化正确的事情。
是的,百分之百。这就像一个更极端的版本,作为一个,呃,旧金山本地人,即使我能自己规划路线,我每次仍然会打开谷歌地图。嗯,让我们记住这一点,因为我认为我们接下来的很多对话都将围绕通用人工智能展开。我只是想把它提出来,因为我知道它对Serge所做的一切至关重要,但让我们,呃,让我们深入探讨Serge的故事。我想很多人都非常兴奋地想知道这一切是如何发生的。嗯,我们在SBC这里有一种说法,就是我们的旅程实际上是线条而不是点,但被报道和分享的,以及我们所有的理解,往往是这些点,比如Surge的收入超过十亿。我们不知道那条线是什么样子。所以让我们倒带一下。嗯,带我们回到是2020年还是2021年?我们在2020年开始的。好的。带我们回到21年。嗯,也许可以给我们讲讲Surge的灵感是什么,它是如何产生的,以及您在早期与谁一起构建了它?
是的,我以前在谷歌、Facebook和Twitter等一些大型科技公司担任研究员。我反复遇到的问题是,根本不可能获得我们训练模型所需的数据。举例来说,我以前在Twitter从事搜索工作。我记得我的第一个项目之一就是想构建一个情感分析分类器。所以这大约是2011年,即使在当时也是一个超级简单的问题。比如你只需要10,000条已标注的推文来训练你的模型。但问题是,我们的人工数据系统,他们只是两个从Craigslist上找来的人,朝九晚五地在我们办公室工作。所以我们花了一个月才甚至只是开始。然后我们又等了一个月,他们只是在一个电子表格中标记这10,000条推文。花了很长时间,因为是的,就两个人。然后我们终于拿回了数据,我一看,简直就是垃圾。比如你一看就知道,这两个人根本不懂俚语。他们不懂在线Twitter文化。他们不懂表情包。他们不懂话题标签。所以一切都被完全错误地标记了。所以我最终不得不自己花几周时间,逐一标记这10,000条推文。然后我去了谷歌,又去了Facebook,我只是不断地反复遇到同样的问题。所以GPT-3在2020年发布,我基本上意识到,如果我们想构建最终能走向下一个前沿的模型。所以构建能够为我们编写代码的模型,以及能够写诗、使用工具,是的,解决反弹的模型。我意识到我们真正需要一种全新的、根本不同的解决方案,它实际上专注于质量、专注于复杂性、专注于所有这些当时任何现有数据解决方案都没有关注的高级用例。所以我们基本上在一个月后就启动了Surge。
是的。我的意思是,我们会回到数据质量的话题,因为那将是我们对话的很大一部分。但是,嗯,你知道,这在今天仍然是一个问题,很多时候就像打开文件看看数据是否合格,遗憾的是行业内没有足够的人这样做。呃,显然您正在努力解决这个问题。嗯,我很好奇在早期,你知道,我们经常谈论从负一到一,它不是线性的。呃,也许可以分享几个关于早期旅程的例子,也许具体来说,其中一个可以分享的是,是否有那么一个时刻,您觉得我们真的有所发现,您早期的抱负是建立一家大公司,还是仅仅是让我们为人工智能公司和其他构建应用人工智能的人提供最棒的数据。
是的。所以第一次展示,我们实际上是在2020年6月开始的。所以这正值新冠疫情期间,我们的首席技术官安德鲁,我想他就在这个房间里,我记得他每隔几周就会来纽约,我们就会在城市里散步,谈论所有我们想构建的东西。所以这有点好笑,但我实际上记得那段合作时光是一种田园诗般的时光,因为有太多的探索和太多的想法碰撞,呃,是的,那真是太有趣了。我认为对我们来说一个重要的时刻是,我们早期的一位客户是谷歌的一位研究员,他正在研究一种新的搜索和发现算法,他也像我一样遇到了所有这些令人难以置信的数据质量问题。比如他已经迭代了六个月来处理他的数据管道。他被迫做了所有这些荒谬的数据简化,仅仅因为他无法获得他所需的质量。所以我们被介绍给他,甚至仅仅在一周内,他就停滞不前,因为我们的数据好10倍。比如我们为他构建了一个数据集,其大小是他以前数据集的10%,而他已经能够击败他以前所有的系统。所以我记得在一个周五的午夜,我和他一起讨论了3个小时,他因为我们能够提供给他的数据,而有了所有其他我想构建的东西的想法。我只是喜欢这一点,因为那一直是我们在Surge的梦想。比如我们只想加速研究并开启所有这些新的可能性。所以我认为那对我们来说真的非常关键。只是出于好奇,当您和安德鲁在纽约散步,呃,抛出想法时,有没有哪个想法是与您现在所做的事情相去甚远的?
所以大概有两件事。所以我记得我们经常争论名字应该是什么,我一直有这种心态。我想要一个更面向消费者的名字。所以我一直有个想法,我们应该叫“辣酱”而不是“Surge”。辣酱。我[笑声]喜欢那个。我会很好奇人们是否更喜欢那个名字,因为今天人们对我们的名字感到非常困惑,尤其因为我们不拥有surge.ai或其他什么。所以人们只是注册了错误的网站。但它是什么?那是一个URL。今天的URL是什么?所以我们的网址实际上是surgehq.ai,所以如果这里有人去了错误的网站,请去正确的那个。数据点表明名称和URL并非在所有情况下都真正重要。呃,那非常酷。非常酷的故事。
嗯,让我们谈谈Surge最值得注意的事情之一,那就是它从第一天起就完全是自力更生,这相当不可思议。嗯,告诉我们这是否是一个有意的选择,您是如何得出这个结论的,然后我们可以深入探讨这在您构建这个东西的过程中是如何影响您的。
是的。所以,这绝对是故意的。比如,我想人们经常问我,你知道,这帮了你还是害了你?我实际上真的非常高兴我们没有融资。比如,我认为不融资给了我们很大的自由,可以真正为长期目标进行优化,而不是构建所有这些短期目标。比如,我认为硅谷一直让我有点抓狂的一点是,对于很多人来说,这几乎是一种地位游戏,他们最终只是为了融资而融资。比如我有很多朋友,他们创办公司,并不是因为他们有一个他们根本相信的伟大产品理念。我觉得很多时候他们只是在融资。我的意思是他们也这样告诉我。他们通常只是因为不知道该做什么而融资,他们只是想筹集1000万美元,这样他们就可以告诉他们的朋友和家人。我真的很高兴我们从未玩过那个硅谷游戏。比如这总是有点荒谬,你小时候梦想做什么?是从零开始创办一家公司,深入研究代码,深入了解你的用户,每天深入研究你的产品吗?还是向风险投资家解释你所有的决定,并跳上这个巨大的公关和融资仓鼠轮?[笑声] 我认为这让事情对我们来说更困难,因为人们不是通过你融资时获得的那种融资炒作来了解我们的。这意味着我们成功的唯一途径是构建一个能让研究人员口口相传的十倍传播的产品。但我实际上真的很高兴我们这样做了,因为它意味着我们的客户,比如我们的早期客户,他们购买我们的产品是因为他们从根本上相信数据的力量。他们坚信高质量数据是他们所需要的,他们购买我们不是仅仅因为他们碰巧在某篇新闻文章中读到了我们。
您认为您的早期客户中,有没有人需要它是由风险投资支持的验证,或者他们根本没考虑过,只是看了数据和您的收集方法?我不认为这对他们很重要。比如我认为我们很幸运,因为我们面向的是非常技术性的受众,对吧?研究人员他们自己会深入研究,嗯,是的,所以我认为那不是,那对观众来说可能是一个好问题,因为我想我们这里实际上有几个人,呃,他们多年来一直是客户,并用您的数据构建了一些产品。嗯,但是是的,显然它没有造成太大的阻碍。嗯,当您回顾今天的旅程时,我知道Surge还有很多,呃,您从您选择的道路中学到了什么反直觉的教训,无论是自力更生还是您构建这家公司的方式?
所以,我认为我早期会告诉自己的一个教训是,永远专注于这些大的10倍问题,而不是担心那些只将指标提高10%的事情。比如我记得在早期,当我们试图寻找我们的初始客户时,我经常会思考并花费大量时间思考,好吧,我应该在早上8点还是晚上8点发送这封电子邮件,它应该是一句话长还是三段长?我认为正确的方法是尝试构建一些如此惊人的东西,以至于所有这些都变成了噪音,是的,我认为那是一个比以往任何时候都重要的教训。
我想在自力更生方面,呃,您的客户需要验证,但当您建立这个团队时,我认为这是一个100人的团队,您是否遇到过需要验证它是否由风险投资支持的问题,或者您最终吸引的是那些为了使命或仅仅是为了您正在构建的东西的智力好奇心而来的正确的人?
是的。是的。所以,在招聘方面,我也认为没有硅谷那种炒作对我们真的很有利,因为我认为当你是一家那样的初创公司,并且获得大量这种融资新闻时,倾向于申请你公司的人,他们可能是那些四处跳槽,只为了简历上最光鲜的名字的人。相反,我们很幸运,几乎所有加入我们的人,他们都从根本上相信我们的使命。比如这有点疯狂,但我们公司有99%的留存率,考虑到我们已经存在了五年,我认为这简直是闻所未闻。我认为那是因为许多加入我们的人,他们真的非常相信我们的使命,他们加入我们不是因为他们只是想在简历上增加另一个品牌。
酷。嗯,非常引人入胜,感谢分享一些“负一”的故事。嗯,我知道,呃,很多人都非常渴望了解一些早期的事情。我想我们今天来谈谈Surge,您很多时候将其描述为一个研究实验室,但您必须在脑海中平衡它既是一个研究实验室又是一个非常商业化的业务,我想,嗯,也许可以先从,因为我不想替您说话,但您为什么不向我们描述一下您如何看待Surge作为一家公司和一项业务,然后也许可以帮助我们理解您正在努力应对的那种张力。
是的。所以,我认为有趣的是,我实际上很少将我们自己视为一家企业。比如我实际上从不看我们的财务指标,这有点好笑。比如我的,我想我的团队对我有点抓狂,因为我不太关注,但我实际上从不真正关注那个。所以我更多地把它看作一个研究实验室,就像您说的。我认为区别在于,当我思考我们的目标时,它真的是实现通用人工智能,并尽一切努力促成这一点。这与您作为一家初创公司时的想法形成对比,初创公司您只关心您的估值,并且会不惜一切代价提高估值,但我们,我们表现得非常非常不同。所以我认为有几个不同之处。比如,其中之一是我们实际上根本不关心短期收入。比如我们有时实际上会主动告诉客户,我们认为他们不应该从我们这里购买某些数据集,因为我们认为这些数据集对我们的模型不会有效。比如我们真正关心的一件事是,我们始终被视为客户的长期合作伙伴,我们只是尽一切努力为他们的模型着想,并确保我们为他们提供惊人的投资回报率,而不是仅仅试图榨取短期收入指标。然后另一方面又回到了招聘。所以,就像我说的,我认为我们真的非常寻找那些从根本上对我们的使命、对研究以及对实现通用人工智能感兴趣的人。比如我们不寻找的是那些为了让用户注册,为了提高你的参与度指标而制造所有这些黑暗模式的增长黑客。我认为所有这些都源于我作为研究员的背景。比如我经常想,我宁愿是陶哲轩而不是沃伦·巴菲特。我认为这真正反映了我们作为一家公司如何看待自己,我们宁愿在研究论文中被引用,也不愿出现在某个科技头条上。
所以很多这些,嗯,由人类驱动的AI数据公司从外部看是有点不透明的,对吧?比如有点理解输入和输出,它是人们购买来训练模型的数据。但当你想到这家公司时,你知道,它可能一部分是劳动力市场,一部分是工具和技术,一部分是实际数据。嗯,我很好奇,我还会说一部分是研究。您如何看待您所做事情的组成部分?它们是如何相互作用的?嗯,我想您如何平衡Surge所做的一些运营部分和显然大量的研究?
是的。所以我看待我们公司的方式在某种程度上很像苹果,苹果的一个惊人之处在于它结合了硬件和软件。所以同样地,我认为我们一直为我们构建了大量技术来确保我们提供惊人的质量,确保我们能够处理数百万标注员并管理他们而感到自豪。但我们也有那个运营部分,我认为那也真的非常重要。比如我认为人们经常低估人类数据方面的事情,他们只是认为人们很聪明,所以你只需从街上找人来解决问题,他们不考虑人们试图欺骗你的系统的所有方式,或者如果你问人们50个问题,那几乎就是太多的认知负担。所以我认为我喜欢我们的一点是,我们有点像一家非常跨学科的公司,你在技术方面有所有关于数学、计算机科学和统计学的思考,但你在运营方面也有所有关于人类行为、认知科学和语言学等方面的研究。所以我一直喜欢公司的这一方面。
嗯,为了更深入地了解这项业务,我想再问两个问题,呃,关于它的劳动力方面和人类部分,我认为这在您所做的事情中非常核心。您能多分享一些关于您如何吸引世界级人才,比如激励他们并留住他们的方法吗?因为我认为您平台上的某些“Surge人”(您称他们为Surge人)是这些令人难以置信的人,他们,嗯,是他们领域的顶尖人物。所以也许可以帮助我们理解这一点,甚至可以分享一些关于特定个人的趣闻轶事。是的。所以,我们确实在寻找地球上最聪明的人。比如,字面上就是斯坦福大学的博士生、哈佛大学的教授,甚至是菲尔兹奖得主。比如,我认为我们实际上拥有地球上最聪明的人群为我们工作,这相当不可思议。比如,我实际上和这位在平台上工作的菲尔兹奖得主聊过。几周前我跟他聊天,他告诉我他之所以在我们的平台上工作,是因为数论中有许多未解决的问题,他希望在他有生之年能看到它们被解决。他相信实现这一目标的唯一方法是训练这些人工智能系统变得越来越智能,以便它们能够与他合作解决那些显而易见的问题,我认为这简直太棒了。所以我认为我们在考虑工作者体验时有几个原则。所以其中之一是,我们更关心您衡量的能力而不是您的资历。比如是的,我们寻找世界上最聪明的人,但仅仅拥有博士学位是不够的。比如你必须拥有所有这些创造力、精神韧性,以及这种全面的勤奋,以确保你能找到所有模型失败的问题,然后有能力以所有这些有趣的方式教导它们。所以我认为你真的需要再次衡量人们的能力,而不是仅仅考虑一个温暖的实体,这样你就可以抛出问题,然后另一方面是,我们希望成为你能拥有的最具智力回报的工作,比如我经常想到像麻省理工学院、哈佛大学和斯坦福大学这样的地方,对吧,你拥有世界上最聪明的人群,他们正在合作推动知识的前沿,这正是我们为人工智能需要做的事情,比如如果你是一名理论物理学家,你一生都在训练自己推动物理学的前沿,那么太棒了,这正是我们平台上需要的那种人,所以我们希望成为世界上对他们来说最好的工作。所以我们努力以一种使其非常协作、有趣且他们可以学到很多东西的方式来构建我们的工作者体验。所以那是其中之一。
你们是线下见面吗?这是你们为他们做的事情,还是全部远程?[笑声] 目前都是远程的。我有时想过,如果能举办所有这些聚会,亲自见到他们,那会多么有趣,但是,Surge派对之类的会很有趣。嗯,我想另一方面,呃,我读过,这就像一个广告。你们都应该阅读Surge的博客。那里有一些非常有趣的东西,但我很好奇,嗯,你们正在做哪些研究是您最兴奋并能够分享的。
所以,我真正兴奋的事情之一是我们所有关于基准和排行榜的工作。比如,我认为目前困扰行业的一个糟糕问题是,所有这些糟糕的基准和排行榜,比如El Marina。所以我实际上认为Elamina在很多方面积极阻碍了模型的进步。所以对于那些不知道的人来说,Alamarina基本上是一个流行的在线排行榜,世界各地的任何人,也就是所有这些在线的随机休闲用户,他们去输入一个提示,然后得到两个回复,他们投票选择哪个更好。但问题是他们只是为了好玩而这样做。所以他们不阅读回复。他们当然不会核实事实。所以发生的情况是,一个模型可以完全幻觉一切,但它会看起来令人印象深刻,因为它添加了一堆表情符号,添加了一堆粗体字,添加了标记格式,而且它真的很长,所以听起来像一个自信的专家。这些随机用户会说,“好吧,是的,这看起来非常令人印象深刻。”所以即使完全是幻觉,他们也不会意识到,他们还是会上传。这很像走进一家杂货店买小报。让我抓狂的是,很多研究人员告诉我,是的,他们也讨厌所有这些排行榜。他们也知道它们如何积极地阻碍模型进步。他们告诉我的是,他们认为获得晋升或年终奖金的唯一途径是提高Alamarina排名,所以这就是Alamarina,但我认为还有很多其他做作的学术基准也导致了相同的结果。所以我真的对我们很多工作来重建数据感到兴奋。
是的。当我们谈到这个话题时,显然Surge以及您提供的产品或价值的很大一部分都围绕着评估,而您确实依赖于您拥有的由最聪明的专家组成的网络。嗯,您能多分享一些关于你们如何看待评估的看法吗?您已经在博客中写过这方面的内容,但也许对观众来说,了解你们是如何以不同方式思考这个问题的会很有用。
是的。所以当我们进行评估时,我们真的相信人类评估的力量,比如我认为很多人采用所有这些学术基准或自动评估,他们没有意识到优化错误的东西会以各种方式阻碍他们的模型。那么,怎么说呢,嗯,我举个例子。所以有一个流行的,或者说有一个叫做“if eval”的基准,它是一个指令遵循的评估,如果你真的去看那些提示,我想很多人可能只是没有花时间去做,但如果你真的去看那些提示,你会发现有这样的东西,比如“嘿,你能为我写一篇论文吗,然后每第五个字母都大写”,这简直太疯狂了,这就是人们优化他们模型的类型,而这之所以发生,是因为当然你可以创建一个程序来自动评估它,通过检查每第五个字母是否大写,但如果你真的想优化你的模型以提高创造性和有用性,并超越这种非常机械的LLM概念,我认为你真的非常需要人类评估来真正评估它们。
这是一个很好的过渡。我的意思是,我们确实已经悄悄进入了关于数据质量和数据未来以及您对此的理念的对话核心。呃,我们已经谈论了一些基准和评估,但我想如果我们放大来看,呃,显然通用人工智能和通用人工智能的未来是激励您一切的中心,而且您一直坚持并正确地认为,在我看来,我们会有“垃圾进,垃圾出”的问题,所以您致力于提供最高质量的数据。您如何看待质量?哪些维度,以及在您构建Surge的过程中,它又是如何演变的?
所以,我举个例子。想象一下,你让一个AI写一首关于月亮的AI诗。如果你不考虑DBL质量,你可能会想,好吧,我判断这是否是一首好诗的方法是看它是否符合所有这些条件。这是一首诗吗?它有八行吗?它包含“月亮”这个词吗?所以,当然,很棒。这是一首很棒的诗。但我们根本不这样看待质量。比如我们真的想创作诺贝尔奖级别的诗歌。所以我们思考的是这首诗是否独特?它打动你了吗?它让你惊讶吗?它触动你的心弦了吗?它教你一些关于月光本质的东西了吗?比如,那就是我们追求的质量。比如我经常说的一件事是,我们希望AI学习的质量类型有一个无限的天花板。比如如果你想象像石黑一雄或海明威这样的人,如果他们活到500岁,他们能创作的写作类型将没有上限。他们只会变得越来越好。所以那种质量观念也是我们真正努力追求的。
您如何在Surge衡量质量,以及在如何良好而准确地衡量质量方面,有什么是容易被误解的?是的,所以我们在这里构建了大量的技术。比如我的背景是数据科学家。所以我一直非常关心每个工作者、每个任务、每个项目都有数千个信号。比如如果你是一名程序员,我们知道你后端编程和前端编程的水平如何。我们知道你C++和Python的水平如何。我们知道你创意写作和技术文档的水平如何。我们通过基本上收集关于您的数千个信号,然后将它们输入到,呃,所有这些算法中来完成这一切。我认为有趣的一点是,因为我们对质量的衡量如此深入,我们也可以运行旨在改进它的实验。比如我们每个月都在进行数百次AB测试,以找出所有改进质量的方法。是的,所以我只是认为那真的非常重要。
有趣。我很想转而谈谈,嗯,数据的未来以及您最兴奋的是什么。嗯,您正在投资、感到好奇并最兴奋的数据领域有哪些?因为从历史上看,Surge一直以文本和语言为基础。呃,但我很好奇,您是否正在超越这一点?甚至在Surge之外,最有趣的数据领域是什么?
是的。所以,我认为我现在最兴奋的领域是“强化学习环境”这个概念。所以,一个强化学习环境本质上是一个迷你世界。想象一下创建一个视频游戏,里面有一群角色,拥有一个完整的故事。然后你有一堆角色可以互动的业务和工具。然后我们所做的是,我们为模型设计这些有趣的、非常有趣的、具有挑战性的任务,让它们在这个世界中执行。然后我们运行模型。然后我们教导模型它们何时做得好,何时做得不好。我认为真正有趣的是,它们确实揭示了模型有时在现实世界的端到端任务中是多么脆弱。比如模型现在看起来非常好。比如它们在孤立的指令遵循和孤立的工具调用方面看起来非常好。它们在所有这些孤立的基准测试中表现出色。但突然你把它们扔进这些世界,它们接触到以前从未见过的工具,或者所有这些复杂、混乱、令人困惑的Slack消息,或者这些更长的时间范围,其中模型在第一步所做的事情会影响它在第50步将要做的事情。比如当你把模型放入这些环境中时,它们会以真正灾难性的、有点奇怪的方式失败。所以我认为我们的环境就像一个非常非常有趣的游乐场,供模型学习。
是的,我正在阅读您的一篇博客。嗯,您正在对一系列代理工作流进行评估,呃,我认为您那种代理能力层次结构在衡量不同模型方面非常有趣。嗯,另一个有趣的事情,也许这有点像贯穿Surge的共同主线,那就是人类专家始终是其中的一部分,而且我相信这在您构建强化学习环境的方式中也占了很大一部分,您实际上让很多专家参与其中。您能多分享一些关于您如何看待它的想法吗?
是的。所以,我认为人们经常高估合成数据。比如他们认为合成数据是万能的。但他们没有意识到的是,我的意思是首先这有点显而易见,但模型只能教自己它们已经知道的东西,不能教自己更多。然后合成数据也很,比如如果你只看几个例子,很难看出。但它就是不够多样化。一切都只存在于一个非常非常小的、被分割的整个数据空间中,所以我们所做的是,我们不使用合成数据,而是实际上通过大量的人机循环行为来创建这些环境。所以我们从零开始设计这些世界。我们从零开始创建所有任务。然后我们所做的是,我们设计所有这些非常非常有趣的奖励,试图捕捉模型是否成功。所以在整个过程中,这是一个非常非常内在的人类数据问题。
除了强化学习环境之外,您认为还有哪些其他类型的数据或数据收集技术对于我们更接近通用人工智能会非常重要?所以我肯定对我们的环境感到兴奋,但我认为有一个概念,我认为很多人现在忽略了强化学习轨迹中发生的事情。所以这就像我们最近一些博客文章的很大一部分。我们实际上正在深入研究模型在整个过程中正在做什么。我认为人们忽略了这一点,因为他们只是想,好吧,是的,我们只看最终奖励。我们将看看它是否成功,等等,等等。但他们没有意识到的是,有时模型可以成功,但却是以所有这些狂野而疯狂的方式,就像模型再次在破解更深层的行为。所以我认为有一个概念,我们需要更多地关注目录,或者需要有一个更深层次的反思和改进过程,我认为研究社区仍然需要更多地进行实验。嗯,但那是我们未来真正兴奋的一个领域。
你们提供一系列产品,对吧?有很多RLHF,有你们正在开始做的RL环境,有你们为客户生产的评估、基准和验证器。我很好奇,如果今天做一个快照,您看到客户的需求在哪里?他们最感兴趣的是什么?在过去的几年里,它发生了怎样的变化?是的。所以我认为数据需求在过去几年中确实发生了很大变化,可能最大的转变在于模型所需的真正高级的超专业知识量。比如我们一直专注于非常高级、非常复杂的用例,但我认为在过去一年中,模型所需的专业知识量已经爆炸式增长。所以实际上今天我们所做的大部分工作都在所有这些专业领域,比如高级数学、高级编码、法律、医学、金融,而且模型已经非常出色,以至于你需要教导模型在这些错误中变得更好的人,他们是像拥有十几年经验的高盛银行家,或者拥有机器学习分布式系统背景的洛杉矶软件工程师,或者常春藤盟校的教授,他们实际上正在训练模型与他们合作进行自己的研究。所以那可能是最大的转变之一。但其他转变包括多模态或非文本数据的显著增加,比如我们今天创建的大部分数据是图像、音频、视频、编码代理、我们的环境,其他领域将是国际化。所以在过去一年中,我们已经从30种语言扩展到80多种。另一个可能很大的变化是模型操作的时间范围。所以我认为一年前,我们可能做的最复杂的任务大约需要5到10个小时,但现在我们做的一些测试实际上需要50甚至100个小时才能完成。所以总的来说。
举个例子?所以我们做的一些工作实际上非常有趣。它是教导模型基本上发布前沿研究。所以想想一些实际上可以在数学期刊上发表的东西。所以非常接近通用人工智能。是的。是的。
我们稍后会回到那个时间点。那是一个数据点。嗯,这只是我脑海中突然冒出的一个想法。我的理解是您是平台上第一批“Surge人”之一。您还在做吗?您还在“Surge”吗?那是,是的。是的。所以,我的意思是,那是您使用的动词。我们应该采用“Surge”,但我只是说工作,或者辣酱。您是辣酱吗?是的。我实际上真的认为,对我以及公司所有的人来说,继续从事任务非常重要,比如我认为我们作为一家企业公司,我想,与Twitter或Instagram等消费公司相比,当你是一家那样的公司时,你自然每天都会使用你的产品,所以你对产品应该如何表现以及它仍然缺乏什么有非常深刻的感受,而对我们来说,产品的一个重要部分是工作者体验,所以我认为对我来说,对公司其他人来说,真正尝试自己,既体验作为一名工作者的感受,同时也要确保我们了解所有前沿实验室的需求,这非常重要。所以实际上我们每周都会有一个标注派对,我每周都会去,而且会是公司里的人轮流参加。所以我认为这都很有趣。明白了。酷。是的。我的意思是,这对每个人来说都是一个重要的教训,即使在您的规模下,您仍然非常接近正在进行的工作和您的用户。
嗯,让我们稍微转向应用方面。呃,您已经谈了很多关于智能和有用的人工智能,显然您在价值链中扮演着非常重要的角色,但最终这正是我们开始谈话时所说的那种体验的力量,嗯,帮助我们理解您如何看待智能和有用,显然您对您生产的数据中希望看到什么有自己的看法。
是的。所以我认为聪明和有用之间的区别,本质上是书本知识和街头智慧之间的区别。所以,比如,让我给您举个例子。想象一下,您凌晨3点被叫醒,因为您的所有服务器都宕机了。您会更喜欢哪种AI模型?您是想要一个能够复述教科书并赢得编程比赛的AI模型,还是想要一个经过数百万真实世界案例训练,能够实际解决您问题让您回去睡觉的AI?比如,这就是聪明和有用之间的区别。我认为这有点好笑,因为现在有很多模型可以赢得国际数学奥林匹克金牌,但同样的模型,你给它们一个PDF,让它们解析,它们实际上有一半时间会失败。这又回到了我之前说的所有这些排行榜上的基准。比如这些排行榜上的基准,它们通常很容易被操纵,而且操纵的方式使得改进它们不一定能提高它们在现实世界中的表现。比如我认为人们认为赢得国际数学奥林匹克金牌,例如,是很难的。是的,这确实很难,但人们没有意识到的是,它们通常有非常客观、明确的答案,这使得它们比现实世界中所有这些混乱模糊的问题更容易进行爬坡优化。所以我认为我们希望确保我们正在帮助客户构建的模型能够实际解决现实世界中的真实问题,而不是仅仅帮助他们通过基准测试。我喜欢这个定义。它让我对自己感觉更好,因为我认为我更有用而不是更聪明。嗯,呃,我想让我们回到我们开始讨论通用人工智能的地方。所以您有一个通用人工智能的定义,呃,我们每月与社区举行全体会议,我们的小乐趣练习之一是人们将通用人工智能何时到来进行分类预测。它开始时是“已经到来”、“未来两年”、“未来十年”,然后是“30年后”或“永不”。呃,我不认为那些是精确的分类,但您明白我的意思。您会把自己放在那个范围的哪个位置,为什么?所以我肯定会把自己放在更长的时间范围光谱上。比如我对此的看法是,当然,在两三年内,我们可能会得到能够自动化普通人70%到80%工作的AI模型。
软件工程师,但从 70% 到 80%,再到 90%,再到 99%,再到 99.99%,这之间有很大的区别。所以我想,每一次的进步可能都需要另外两、三年、五年。我想这是人们在考虑时间跨度时常常低估的一件事。
嗯,我知道我们马上就要开始提问了。我还有一个最后一个问题。我还有其他问题,但嗯,我就先问这个了。然后对于那些有问题的各位,请思考一下你们想问什么。我想我们这里有一些麦克风在分发。但嗯,我至少想以这个问题来结束我这边的话题,那就是,您对 AI 数据层的未来有什么愿景?所以,当我再次想到 AI 时,我想到的不是那些只是教科书般聪明的 AI 模型,就像我之前说的,不是那些只是机械地遵循指令的 AI 模型,而是那些富有创造力、富有洞察力、有趣的 AI 模型,基本上是那些能让你大吃一惊,真正反映人类最佳品质的 AI 模型。所以,我认为我们将需要一个套件,我想,就像一个由一百万个产品组成的套件,它们以人类学习的百万种不同方式来教导 AI 模型。就像你想到要成为一名伟大的作家一样,你不是通过仅仅记住一堆语法规则来成为一名伟大的作家。你通过出版一本书,通过在亚马逊上出版并查看所有评论,或者通过参加研讨会并向其他研讨会参与者学习,或者通过阅读所有这些杰作并将它们与你日常看到的糟糕的写作进行比较,来成为一名伟大的作家。所以,我认为我们将需要一个基本上能反映这一点的产品套件。然后我们需要构建更好的基准和排行榜,以将行业引向更好的方向。我们需要更好的评估技术来衡量模型是否做得好。然后我们需要基础研究来理解如何更好地做到这一切。所以,我认为有很多事情是我们想要做的。
太棒了。让我们举手示意,然后我想我们有几个人带着麦克风。嗯,就从这边红色衣服的这位开始吧。嗯,我对此感到兴奋,因为你们都更聪明、更有用。所以,问题可能更好。
是的,我今天穿红色衣服对我来说是明智的。所以,我的名字是 Amto,一家科技初创公司的联合创始人。嗯,是的,我对 Saj 将如何处理诸如,你知道,在制造业中有这样的经历,有一个大约 60 多岁的家伙,他只是听机器的声音,然后就能判断出,好的,问题出在哪里?如果我们在考虑未来的制造业 AI,你知道,随着工厂变得越来越智能,我们将如何处理那种能够处理这种知识的机器人或系统?你将如何获取这些数据?你实际上能否想出合成数据,就像那种或那种经验一样,有人拥有?对于这样一个空间,你将如何处理它?或者如果你已经在处理它,你将如何处理传感器融合并产生那种数据?
是的,所以说实话,我认为这是一个我们仍在探索的领域,就像 AI 模型需要从现实世界的互动或现实世界的实验中学习的整个概念一样。历史上,我们所做的绝大多数工作都纯粹是在线领域,纯粹是技术领域,我认为你在互联网这个知识来源方面有很多优势,而且我认为我们还没有完全弄清楚这一点。嗯,是的。所以,说实话,这是一个我们仍在探索的事情,但我认为它将变得非常重要,因为当我们构建所有这些 AG 模型时,我们确实希望它们能够与现实世界互动。嗯,是的,我认为这很重要,但这是我们还没有弄清楚的事情。
我们去房间另一边吧。那边怎么样?
你好,我叫 Virgil,我是一名 AI 研究员,我想问一下国际化的问题。你稍微提到了语言学方面的问题,但我研究过,我做了一个研究项目,我们探索了非物质文化概念以及它们如何在图像生成中得到体现。我觉得这是模型的一个日益增长的盲点,它们不知道如何体现,比如一个传统面具,它是一种模糊的表示,不属于任何特定的文化。Saj 在这方面有什么进展吗?AI 模型中的文化代表性。
是的,所以我们国际化工作的一个重要部分是确保模型不仅仅学习语言,还学习所有这些文化概念。所以,就像我们寻找从事这些项目的工作人员时,我们不仅仅寻找语言专业知识。我们真的想要那些在这些个体文化、这些个体国家长大的人,他们能够真正谈论他们正在做的与文化相关的方面。
你好,谢谢。我叫 Shiru,我在谷歌工作。我主要负责模型质量。所以我绝对能体会到你提到的痛苦。我最近注意到的一件有趣的事情是,我也想知道你对……当你有所有这些才华横溢的科学家或专家阅读或回答一些非常困难的问题时,你是否看到或预期到一些从跨学科问题中涌现出来的智能?
抱歉,C,你能重述一下你的问题吗?所以,所以通常就像人们只对一种类型的问题进行评分一样,比如数学博士对数学问题进行评分,物理博士对物理问题进行评分。但最近我与一些研究人员交谈过,他们说他们正在观察到一些从跨学科任务和数据中涌现出来的智能,比如 HLE 数据。
跨学科。
对,跨学科。好的,明白了。
是的,我绝对相信这一点。就像我们一直在努力确保我们所做的事情之一是,我们希望确保我们不仅仅是将工人孤立在特定的项目中,我们也不试图将项目简化为非常孤立的,我该怎么说呢?所以,我想历史上,例如,让我举个例子。历史上,我们认为对训练模型非常重要的一种方式是,我们试图在整体质量的概念上训练模型。就像我认为有时我们与研究人员交谈,他们会说,好的,不,我们不想问“这个回应整体上有多好?”之类的问题。相反,他们经常告诉我们,他们只想在各个维度上进行评估,比如这个模型是否擅长遵循指令?它是否擅长真实性?写作质量是否好?但他们从来没有过这种捕捉回应所有整体行为的“整体质量”的概念。所以,我们关心这一点。然后我们也关心确保当你是一名数学家时,我们不会仅仅因为你的简历上写着数学,你的博士学位是数学,就把你孤立在数学项目上。我们会衡量你所有的能力,看看你是否也擅长写作,或者你是否擅长生物学,或者你是否对所有这些其他领域都有令人惊讶的想法。所以,我认为这两种观念,就像当你将它们结合起来时,它们确实会带来这种扩展的概念,基本上就是将模型的知识扩展到这些非常非常孤立的容器之外。嗯,是的,我认为我们确实经常看到这种情况。
我们再问两个问题,就在这边。
我只是在曲折前进。
感谢这次精彩的对话。关于使用游戏数据进行模型训练,特别是世界模型,有一个快速的问题。抱歉,使用什么?游戏玩法数据。
嗯,是的,我认为这非常重要。就像我认为游戏玩法数据,我不知道。我想有两个平行之处。一个是就像预训练一样,另一个是非常类似于我提到的 RL 环境,我们通常将 RL 环境视为一个游戏,模型将在其中反复迭代,直到它们在我们定义的奖励方面取得成功。所以,是的,我认为这对行业来说是一个非常棒的、非常大的福音。
Faith,如果你想在后面的角落选一个。
我只是想知道,除了文本之外,还有一些模态具有人类的触感。例如,声音,对吧?你认为声音将是人类与这些 AI 系统交流的最大模态吗?如果是这样,你认为我们目前在语音到文本系统方面处于什么位置?
是的,所以我绝对认为它将是最大的之一。我不知道它是否会是最大的,因为我觉得在未来我们将拥有新的计算设备,我不知道,也许会有 VR 头显,或者也许会有这些神经风格系统,它们与我们今天的手机相比,基本上是全新的模态,你知道,当然你不想拿出手机播放视频,但也许你会和它说话。所以,我认为它会很大,但我不知道它是否会是最大的。嗯,至于我认为它们今天在哪里,我认为它们仍然不太成熟。所以,实际上我认为我总是对笔记本电脑声音的质量感到惊讶。但当我使用 ChatGPT 的语音模式时,例如,我发现它经常不知道我何时停顿但仍然想继续我的问题,或者它只是在我惹恼我时打断我,因为有时与之交谈真的很困难,或者有时声音非常不自然和合成,所以我只是有点厌烦与它们交谈。但我认为仍然有很大的进步空间。
但……我觉得对语音内容最好的评估是如果你和孩子一起使用它。我有三个孩子,我们在车里大量使用语音模式。作为一个成年人,我大概知道它是如何工作的。所以,当它没有完全捕捉到停顿的时候,我知道该怎么做。但天哪,如果一个孩子在它前面,它真的会变得非常混乱。他们会感到沮丧。我知道大家都有很多问题,但嗯,我想我们必须在这里结束了。我真的很享受这次谈话,非常感谢你们的到来。我对于 AI 的未来感到非常乐观,因为你是帮助提供大量专家和高质量数据的人之一。所以,感谢你的到来。
Y,谢谢你的邀请。