📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Duolingo and the Future of Personalized Education with AI

Delphina45:39

Transcription

语言学习中很多困难的部分,仅仅是这种焦虑,以及不想让自己难堪。而通过机器人进行练习尤其有用,因为你不会感到同样的压力,然后你就会开始,之后就会变得更容易。这是 Duolingo 的学习副总裁 Bjana Payak 在谈论人工智能在克服语言习得的最大障碍之一——口语焦虑——以及人工智能如何提供帮助时所说的话。另一方面,当我们问 Bjana 关于 Duolingo 在人工智能方面最大的突破时,她表示这根本不是技术。而是事物的“人”的一面。让我们得以前进的最大突破之一,实际上是重新培训我的团队,让他们能够使用人工智能完成大量这项工作。>> Jana 是 Duolingo 的第一位学习科学家,在过去十年里,她一直致力于将认知科学和统计学习融入公司的产品 DNA。在本期节目中,我们探讨了 Duolingo 如何从一家以工程为主导的初创公司,转型为基于证据的教育领域的领导者。Bojana 分享了在快速发展的科技文化中建立强大研究功能的见解,并解释了为什么长期的学习成果通常需要与短期准确性或参与度不同的优化信号。我们讨论了人工智能在 Duolingo 的演变,从 BirdBrain 的个性化难度模型,到当前生成式前沿,人工智能角色提供低风险、高影响力的对话练习。我们还谈到了 Boja 的团队如何利用代理工作流程来扩展内容,以及为什么下一波个性化涉及从难度级别转向针对特定用户兴趣量身定制的主题视角。最重要的是,我们还涵盖了反直觉的发现,即在长期记忆方面,确定性路径通常优于学习者自主性。如果您喜欢这些对话,请给我们留下评论,给我们五星好评,订阅我们的新闻通讯,并与您的朋友分享。链接在节目说明中。Bjana 也在招聘一些很棒的职位,我们也已将它们包含在节目说明中。我是 Hugo Ban Anderson,欢迎来到 High Signal,由 Delfina 提供,Delfina 是一个为您的分析提供超能力的 AI 代理。你好,Bjana,欢迎来到节目。>> 你好。谢谢你邀请我。很高兴你能来,我非常期待和你聊聊你在 Duolingo 的工作以及过去十年在那里看到的景象。我之前没有意识到这一点,直到我们开始通话,但你已经在 Duolingo 工作了将近 11 年了。>> 是的。真难以置信,但是的,我是在 2015 年年中加入的。所以,已经很久了。>> 太棒了。祝贺你十多年来的工作纪念日。>> 谢谢。>> 而且,在科技行业,这几乎是闻所未闻的,所以这里一定也是一个非常棒的工作场所。嗯,>> 实际上在 Duolingo,我会说这并不罕见。人们倾向于留下来。所以,我们为我们的文化感到非常自豪,这里是一个多么棒的地方,以至于人们会长期留下来。但实际上,我们甚至还有一些“回旋镖”,就是那些离开一段时间后又回来的人。他们认为 Duolingo 实际上更好。>> 太棒了。>> 真是这样。>> 好的,你是在说我的语言,因为我也是澳大利亚人。所以,我很有兴趣,十年前你是 Duolingo 的第一位学习科学家。所以,我的背景是语言学、认知科学。你的研究是关于注意力、记忆和语言的。当然,我们都知道 Duolingo 是一个我们用来学习语言等事物的应用程序。但我想知道你的背景以及 Duolingo 处理事情的研究背景是如何帮助你思考设计学习体验的。>> 是的。所以,是的,我的背景是语言学、认知科学。我还在学术界时,我的研究主要是关于人们如何学习,尤其是人们如何学习语言。我对此着迷,尤其是它在我们的大脑中是如何运作的,我们如何利用人们已经知道的东西来教他们新事物,帮助他们联系事物,进行泛化。所以我做了很多小实验,教人们语言的一部分,然后试图看看如何改进。事实证明,这对我在 Duolingo 的工作来说是一个很好的背景,很好的准备。正如你所说,我被聘为第一位学习科学家。因此,我获得了真正塑造我们教学方法的绝佳机会。结果是,我能够将我所知道的所有研究知识,我自己的研究,然后让人们兴奋地尝试在 Duolingo 上实施。有趣的一点是,我的专业知识确实是关于这种基础研究的。比如一般性地思考认知,而不是可能更具应用性的研究,比如在课堂环境中,人们如何在课堂中学习,这是一种更具应用性的领域,你可以考虑学习者如何在课堂中使用数字产品。因此,其结果是,我认为我们能够真正地将基础研究应用于思考,好吧,这对一般性应用意味着什么?我们是那些试图在应用方面进行创新的人,我认为这给了我们很多创造力,能够尝试以前从未尝试过的事情。我认为这种创新思维在将学习科学研究应用于 Duolingo 方面仍然存在。所以,一个例子是我们仍然在很大程度上依赖于一个叫做统计学习的研究领域。我不知道你是否听说过,但它本质上是思考人类如何学习周围的模式。事实证明,我们的大脑实际上非常擅长学习模式,捕捉模式。这就是我们学习各种事物的方式。例如,这就是我们学习第一门语言的方式。所以,这个领域实际上是通过研究婴儿如何学习他们的第一门语言来开始的。所以,这被认为是一个非常困难的问题。研究人员开始弄清楚,哦,婴儿实际上是如何捕捉他们听到的语言中的规律性的。然后,这项研究开始超越语言,扩展到各种规律性,视觉规律性,音乐,地图。我们开始利用这项研究,试图从中获得见解。好吧,这种统计学习是如何运作的?人们是如何在不知不觉中掌握这些模式的?这就是我们一直在产品中不断应用的东西。我仍然参加会议,以真正跟进这项研究。>> 这太迷人了,Jana。事实上,我将在节目说明中链接一篇你博客上由你的同事 Cindy Blanco 几年前写的关于统计学习的文章,特别是关于儿童如何学习的文章。希望当我们开始谈论习惯养成时,这也会有所帮助。我非常热衷于将科学引入科技初创公司和科技公司。作为 Duolingo 的第一位学习科学家,我想知道将科学和研究引入科技初创公司的产品团队,实际上是什么样的?现在你的团队已经发展到 40 多人。所以,我想知道这个职能的轨迹是怎样的。它取得了巨大的成功。>> 谢谢。但是的,这绝对是一段漫长的旅程。当我开始的时候,我承认这很困难。我花了大约两年时间才真正建立信任,真正能够产生影响,因为当我被聘用时,公司显然认为他们需要一个拥有这种专业知识的人,但当我加入时,他们真的不确定具体该怎么做。他们有自己的工作方式,只是在产品本身上工作,并拥有他们的工程解决方案。人工智能是一个重点,要非常聪明,并自动化我们能自动化的任何东西,而要融入其中并说服人们,也许有些事情我们应该重新考虑,也许采取略有不同的方法,这真的很难。所以,这很艰难。但在两年里,我逐渐提出想法,能够测试其中一些想法,并逐渐证明,哦,实际上我所说的是有回报的。我们在参与度指标上看到了胜利。当我们试图衡量学习成果时,我们在学习方面也看到了胜利。然后人们才真正开始更加信任。我能够聘请第一个人,实际上是从一名实习生开始的。我得到了一名实习生,然后我们全职聘用了那名实习生,然后我能够逐渐聘请更多人,现在我们与产品团队的整合程度更高,因为我们的工作方式是产品团队是跨职能的。所以,学习科学家、学习设计师与产品经理、产品设计师、工程师一起工作,所以人们在那里进行实际的讨论,我们应该做什么,我们应该如何构建不同的学习体验,人们知道学习科学家做什么,学习设计师做什么,但仍然很棘手。例如,每次我们招聘一名可能在其他科技公司工作过的更高级别的人员时,他们从未遇到过这个角色。他们从未与学习设计师、学习科学家一起工作过。所以,这又是试图确定,好吧,这个角色是什么?你贡献了什么?所以我认为这是一个持续的、正在进行的工作。我必须不断地告诉我的团队成员,他们是先驱。他们是来创新的。他们是来真正弄清楚如何影响他们所有的合作者,并以一种能引起其他职能共鸣的方式来解释事情。所以,这很艰难,这是我们每天都必须面对的事情。有很多模糊性,很多妥协,很多权衡,而这只是这个角色的一部分。所以,我认为即使我们现在整合得更好,这也不会真正消失。Duncan,我实际上对你的想法很感兴趣。我从来没有这样想过,当然有很多不同之处,但我想实际上与数据团队有很多相似之处,对吧 Duncan,就成为价值创造者而不是成本中心而言。在团队之间也有很多虚线连接,并且必须教育人们你实际上在做什么。太棒了。>> 是的,当我听到你描述你在 Du Lango 早期的经历时,Bojana,我的心都提到了嗓门眼。我实际上大约十年前是 Wealthfront(一家金融科技公司)的第一批数据科学家之一,我的背景是经济学,当时我带来的一件事实际上是对公司的一些行为经济学理解,并从行为角度思考我们应该如何设计我们的界面,以便人们做出明智的财务决策,以及我们如何通过产品提供财务建议。同样,公司也知道这是一个好主意。而且它显然是概念上合理的,但如何真正将我固定在一个拥有工程师、产品经理和设计师的产品团队中,他们并不真正了解我在做什么,这是一次冒险,最终对双方都有价值,但绝对是一次冒险。而且你是对的,Hugo,我认为数据团队通常也是那个三条腿凳子的第四条腿。直到组织建立起正确的肌肉来真正地将他们纳入其中,或者完全与某个团队结合,否则他们应该如何与组织合作并不完全清楚。但这是一段旅程,尤其是对于来自新组织、以前从未听说过或处理过这种情况的新领导者而言。我实际上很好奇,你是否可以简要提及一下:你的团队如何与技术团队整合?它是一种矩阵模型吗?或者我实际上只是好奇:在战术上,你如何真正做到这一点?>> 是的,没错。所以我们有一个矩阵式的结构。所以,当然有不同的角色,不同的职能以及他们的领导者。我是这个我们称之为学习和课程职能的负责人。但是,所有的产品工作都是跨职能的。所以,我们有跨职能的团队。它们由跨职能的领导者领导。所以,通常只是一个产品经理和一个工程师。实际上,越来越多的是,对于专注于教学、学习的团队,可能有一个学习设计师,这很有帮助。然后,这个结构有不同的层次,或者团队被分组到我们称之为区域中,然后区域被分组到我们称之为支柱中,我们有一个语言学习支柱,或者一个新科目支柱,因为 Duolingo 一直在扩展到新科目,或者一个增长支柱,一个货币化支柱。所以,学习设计师、学习科学家在语言学习和新科目中,他们嵌入在那些负责不同功能的团队中,而团队本身变化相当频繁,因为他们负责解决某些问题或负责某些功能,所以一旦他们完成了某项工作,我们可能会重组,或者当我们想要调整优先级时。所以,这些团队相当灵活。真正不变的是你自己的角色,你所属的职能。>> 这很有道理。我实际上想更深入地探讨一下你之前提到的 AI 角度,我认为 Duolingo 实际上是一个产品体验,从早期开始几乎肯定就有了 AI,并且产品中存在某种形式的 AI,因为它实际上是围绕早期个性化和与用户的对话而设计的,但我想知道你是否能详细介绍一下。你显然亲身经历过——人工智能在 Duolingo 的发展轨迹是怎样的,以及它是如何实现的?>> 是的。人工智能从一开始就一直是公司的重要组成部分。我们有 AI 专家,比我们有学习专家还要早。我们最先开始研究的领域确实是关于个性化的。所以,我们确实在考虑个性化难度级别,或者稍微调整一下顺序,我们如何向你展示我们拥有的内容,确切的课程对每个人来说都是一样的,但然后尝试为每个人具体选择,好吧,哪种内容最适合你?我们开发了一个名为 BirdBrain 的模型,它是我们的学生知识模型。它非常强大。我们仍然在使用它。所以,本质上,我们所做的是查看每个用户的历史记录,他们如何与应用程序互动,他们在不同类型的练习中如何回答。基于此,我们对任何新练习或他们正确回答的可能性做出预测。基于此,我们可以改变体验,个性化它。这非常成功,因为它确实,它确实让我们能够为每个人提供正确的挑战水平。当然,它仍然不完美。我们继续调整它。但是,不同学习者当然是不同的人,他们对挑战的渴望程度,他们已经知道多少,他们学习的速度等等,都有不同的阈值。所以,这是一个非常棒的关注领域。然后我们也大量使用人工智能进行评估。你可能也知道,Duolingo 不仅仅是一个应用程序。我们还有我们称之为 Duolingo 英语测试。这是一个单独的产品。这是一个高风险的、语言测试,当我们提供给需要证明他们的英语知识的人,并将其用于进入英语国家大学或证明工作能力时。所以,这个测试从一开始就基于人工智能,并且一直在创新如何设计新的项目,这些项目将非常敏感,并且远远超出评估领域的既定水平。所以,这很有趣,一开始它非常有争议,而更成熟的评估研究人员和公司对我们的测试非常怀疑,但随着时间的推移,我们确实设法证明了该测试非常严谨,并且现在已被世界各地的许多大学接受。所以,这也是一个巨大的成功,我们也正在将我们为 Duolingo 英语测试开发的部分内容应用于应用程序,以提供一些关于人们学习效果的信号。所以,这可以说是第二类。第三类,我想说的是生成式人工智能。生成式人工智能带来了许多新的机会,其中之一就是内容生成。生成式人工智能非常擅长生成内容。因此,我们能够大大加速课程的创建。我们想要添加大量内容,我们想要迭代。如果我们没有人工智能的帮助,我们可能需要 100 年才能推出我们过去几年所拥有的内容量。仍然有人工参与,但使用人工智能的速度要快得多。在生成式人工智能的范畴内,还有新的交互式功能,我们能够构建。我们推出的一项功能是视频通话,你可以通过它练习语言,与机器人进行对话。在这种情况下,这是 Duolingo 的一个角色,Lily,她是一个不怎么在意的青少年。 [笑声] 所以,和她聊天很有趣。所以,这是我们一直想做的事情,但当时没有技术能够真正实现。有了生成式人工智能,现在就可以实现了。你可以与机器人进行一次普通的对话。此外,通过生成式人工智能,我们能够为人们提供更好的反馈。以前,我们显示的内容是硬编码的,当你犯错时。现在,我们能够更加灵活,并且能够为特定用户针对他们的错误进行个性化。告诉他们为什么犯错,给他们一些有用的建议。所以,这也很重要,我们仍在不断迭代所有这些事情,并提出新的用例。>> 我很想深入探讨一下评估部分。我工作过的每家公司都难以衡量应用程序之外的真正长期影响。我们实际上在世界上为我们的用户做了什么?我想在你的世界里,这更加困难,因为你试图弄清楚你是否真的在帮助你的用户变得更好,他们想要变得更好。你如何看待这个问题?也许我们可以更多地谈谈你如何解决这个问题。>> 是的,这绝对是一个难题,而且很难像衡量用户留存率或日活跃用户那样来衡量学习。这很难的一个原因是时间尺度。学习需要很长时间,所以很难有一个指标,你可以在两周的窗口内衡量,这可能经常用于衡量,比如说留存率。所以,这是一个巨大的挑战,你实际上需要等待更长的时间才能看到,人们是否在学习。学习也是非线性的,所以有时短期内你可能会认为某件事看起来有所改善,因为也许人们的准确性提高了。但事实证明,长期来看,他们学习得比使用其他方法更差,也许最初他们需要更长时间才能弄清楚,但长期来看 [笑声] 他们会起飞。所以,有时很难知道,好吧,我们处于什么状态?人们真的在学习吗?还是这只是一个短期胜利?所以,这个时间窗口是一个巨大的挑战。所以,我们通常会尝试做不同的事情。第一,我们做的最严谨的事情是实际的研究,由我们的学习科学家进行,招募 Duolingo 的学习者,并实际用独立的衡量标准来测试他们。所以,也不是我们自己开发的衡量标准,而是试图使用独立的测试,并试图控制各种因素,比如他们使用的其他方法。通常试图招募那些至少自我报告只使用 Duolingo 的人,那些可能最好从一开始就只学习 Duolingo 的人。我们试图非常严谨地进行,然后进行各种测试。有时我们只是进行快照,好吧,让我们招募那些刚刚完成课程特定部分的人,比如说 Duolingo 西班牙语课程的前三个部分,然后看看他们的情况,他们的得分是多少,并思考,好吧,我们期望他们在某个水平。他们与此相比如何?测试不同的技能。最容易测试的是阅读、听力。最难测试的是口语、写作,但我们一直在尝试测试所有这些不同的技能。有时我们会进行更严谨的研究。所以,我们进行预测试和后测试,并真正跟踪人们在 Duolingo 上学习一段时间。通常,嗯,至少需要一个月。所以,通常这些研究会更长,几个月,这样我们才能真正看到效果。这非常有帮助,因为我们觉得我们对我们的产品有多好有了很好的信号。有趣的是,多年来,随着我们进行这些不同的研究,我们也能够看到,同样的评估在不同的人群中是如何比较的。当我们回顾 2020 年时,人们的得分不错,有扎实的学习成果。但当我们看 2024 年时,学习成果有了很大的飞跃,同样是完成同一门课程,同一部分,人们在课程的同一阶段得分要高得多。在这四年里,我们对我们的课程,我们的体验进行了大量的改进。所以,这让我们有信心,好吧,那些改变确实产生了很大的影响。当然,所有这些最大的缺点是它很慢。所以,我们不能用它来指导非常快速的迭代。这是我们需要等待的东西,我们试图进行一些快速的研究,但同样,它们至少需要几周的时间,所以这仍然不是我们通常以更快的速度进行其他类型的改变,所以我们只是试图获得更多不同类型的信号。我们肯定也会利用基本的参与度指标,因为这是一个非常快速的信号,表明某件事的效果如何,尤其是像留存率这样的事情,因为我们可以快速评估我们试图引入的某种体验是否令人沮丧。人们是否在退出?我们关注学习时间,人们是否花费了更多时间?我们关注我们显示的内容的难度,因为我再次提到我们进行了个性化,所以我们可以适应人们真正能处理的程度,所以我们可以看看,好吧,通过我们引入的这个改变,人们是否开始看到的内容平均来说更难,还是我们需要开始向他们展示更容易的内容,似乎人们没有学到足够的知识,他们做错了。所以,这也是一个非常有用的信号,而且相当快。然后,我们提到我们正在尝试利用我们为 Duolingo 英语测试开发的那些不同类型的评估。所以,现在真正令人兴奋的是,我们使用与 Lily 的视频通话来评估人们的熟练程度,因为我们可以分析这些视频通话,并快速获得一个信号,好吧,这是我们对他们口语熟练程度的估计,以及作为他们整体熟练程度的代理。这非常令人兴奋,因为这些视频通话可能相当短,我们只需要捕捉其中几个通话就可以对一个人的熟练程度有信心。所以,这绝对是我们将来会进一步探索的事情。>> 这都令人难以置信地令人兴奋,而且我认为很少有人知道或欣赏 Duolingo 在学习方面的研究的广度和复杂性。我的意思是,从纵向研究到前后评估,以及你现在与 Lily 所做的一切,而且我确实同意,通过这些类型的通话,你可以在短时间内获得高信号是惊人的。我想知道你是否能分享一下,你发现的关于什么真正能帮助人们学习,或者什么不能帮助人们学习的最令人惊讶的发现。>> 是的,有很多有趣的发现。有些可能并不令人惊讶。好吧。你需要花一定的时间学习才能取得更好的成果。>> 是 10,000 小时吗?是吗?不,我是在开玩笑。>> 不,取决于你的目标,肯定可以少得多。但我想分享的是,一个有趣的发现实际上是关于人们的沟通能力以及他们使用视频通话。我们发现,实际上你不需要很长时间就能开始进行非常基本的对话,因为人们通常认为在你能做任何事情之前都需要几个月。但我们发现,仅仅在四到六周后,人们就能形成自己的想法,自己的信息,尤其是在写作方面。这稍微容易一些,但口语也是如此。所以,这是一个相当令人兴奋的发现,我们看到了。好吧,这实际上是有效的。这种与机器人的对话,即使是简短的对话,数量不多,时间不长,也可以相当有效。可能它只是帮助人们打破一点障碍,然后继续前进。语言学习中很多困难的部分,仅仅是这种焦虑,以及不想让自己难堪。而通过机器人进行练习尤其有用,因为你不会感到同样的压力,然后你就会开始,之后就会变得更容易。另一个有趣的发现是,当我们改变了课程的 UI,导航方式时。所以,我们称之为旧的 Duolingo 只是我们称之为树,你只是以某种方式导航它。有一些选项可以水平移动,你可以向下移动。然后我们将其更改为我们称之为路径,它更线性。所以,嗯,我们主要做出这个改变是为了帮助人们导航整个体验,清楚地知道我们推荐他们接下来做什么。这实际上对学习成果产生了影响,这很有趣。我们实际上并没有完全预料到。我们认为它会相当相似,但实际上给予人们更强的建议,并使他们更容易导航应用程序,这确实有帮助。也许我还会说的一件事是,我们现在也有了几项关于 Duolingo 与课堂教学相比的发现。也许令人惊讶的是,在 Duolingo 上学习实际上可以与课堂学习相匹配,甚至在某些情况下更好,这让我们感到惊讶,因为我们认为,嗯,我们可能认为课堂体验仍然是优越的。所以,看到我们仍然认为我们还有很多工作要做来改进我们的体验,但它已经非常有效了,如果我们能够与课堂相匹配,甚至有时更好,这让我们感到兴奋。>> Duolingo 现在教授的不仅仅是语言,还有数学、音乐、国际象棋,甚至还有儿童阅读。我的孩子们用 Duolingo 来学习阅读。扩展到新科目如何改变了你对学习设计和结果衡量方法的看法?>> 扩展到其他科目非常有趣,因为我们对如何应用我们在开发语言应用程序方面的经验有一些直觉,但我们并不知道它会奏效。看到基本原理确实能够转移,并且我们可以使用相同类型的方法来处理这些不同的课程,这非常令人兴奋。所以,我们开始了数学、音乐、国际象棋。我们肯定也在考虑其他科目。所以,谁知道接下来会是什么,但总的来说,我们非常感兴趣地扩展,也许会做一些科学、物理学。我们认为,嗯,这些基本原理仍然有效,试图以一种很大程度上是“边做边学”的方式来教你。这是我们的整个方法论,比如确保你积极地参与材料,以一种非常动手的方式。你只是做练习,这确实适用于所有这些科目。我们发现这是一种非常吸引人的学习方式,我们不断确保你积极地与材料互动,但同时我们也确实看到,每个新科目都需要稍微不同的处理方式,所以随着每个科目,我认为我们从一个可能的起点开始,然后每个科目最终都会分化。所以,例如,在数学方面,我们确实更加专注于内容的广度和覆盖范围,这感觉就像一门好的数学课程的真正要求,我们可以提供许多不同的主题,并试图将其与现实世界联系起来,使其对学习者感觉更具相关性。对于音乐,我们意识到,好吧,这种体验必须非常有趣,甚至比我们为语言所做的还要有趣。我们正在进行大量的实验,甚至更多的动画,不同的可视化,大量的互动,大量的色彩,大量的有趣的东西。国际象棋本身就是一种游戏。所以,这也很有趣,试图看看,好吧,它是一种游戏,但我们如何构建课程来指导你?所以,我们想出了很多小型的谜题。有趣的是,不仅仅是语言启发了其他科目以及我们在那里所做的事情,而且当我们开始在新科目中开发新事物时,它们也开始启发语言方面的某些变化。所以,例如,在国际象棋中,我们开发了一些更明确的提示,我们的一个角色 Oscar,在你做小谜题时会给你。Oscar 会说,“好吧,这是这一步。移动到这里,然后会发生这种情况。”它们非常简短,而且通常非常有趣。所以,我们确实在那里利用幽默。现在,这非常有效。我们非常喜欢它,以至于我们正在考虑,好吧,我们如何将那种能量,那种体验带到语言方面,并可能提供更好的即时提示。所以,这是我们现在正在探索的事情。>> 迷人。我猜想,能够如此广泛地扩展和扩大我们的产品范围,很大程度上与你之前提到的有关,即生成式人工智能使 Duolingo 能够扩展内容创建,创建更多对话练习体验等等。我想知道是什么让这成为可能。我并不是说,当然,我认为你理解这一点,但我并不是说像 ChatGPT 或类似的东西。我的意思是,例如,我知道你们有代理工作流程,可以让你创建更多内容。所以,我实际上更多地在思考那些让你的团队能够构建的实际东西。>> 是的。当然,首先拥有模型是其中的重要组成部分。但真正让我们得以前进的最大突破之一,实际上是重新培训我的团队,让他们能够使用人工智能完成大量这项工作,并真正学习大量的提示技巧,能够真正使用新工具并与人工智能互动,以及再次进行提示工程,开始构建评估器,现在正如你所提到的,使用代理工作流程。所以,基本上我的团队已经发展了全新的技能,重新培训,深入研究如何真正使用这些工具,而且我们一直在与其他角色一起这样做。每个人都在学习如何使用这些新工具。但对我的团队来说,他们变得非常擅长我们需要的那些内容生成或构建对话功能等事情,因为他们能够将他们在学习和教学方面的专业知识与现在使用工具来表达它相结合。看到这一点非常有趣,因为他们能够阐明,好吧,我们需要什么。一个有效的体验需要什么。这种内容,这种类型的内容需要什么。好吧,它需要一、二、三。他们能够为评估者创建具体的评分标准。其他工程师或与人工智能合作的人无法阐明的。所以,这是非常有力的,他们能够做到这一点,它改变了他们在公司扮演的角色,它真正实现了内容生成、对话功能、我们提供的反馈等的快速开发。对于扩展和内容生成尤其如此。还有一些突破更具操作性和技术性。所以,我们实际上从头开始重新思考了课程创建。以前我们有一种特定的课程构建方式,当我们更多地手动完成时,这是合适的,我们确实是定制的,然后我们决定重新做整个过程,并尝试以不同的方式进行批处理。试图找到不同的方法来分组事物,使内容生成更有效,并且我们可以通过更广泛地传播更改来更快地扩展。所以,对于我们应该如何创建课程,有一种非常不同的概念性思考。我们还投入了大量资金用于我们自己的内部基础设施,构建工作流程、管道,让我们能够拥有这个扩展机器,并有意识地决定在哪里保留人类参与,在哪里不保留。我们仍在弄清楚整个过程,但我们正在大量迭代,这对语言来说非常强大。对数学来说也非常强大,我们决定完全放弃我们之前所有的内容,并完全通过使用人工智能来重做它。这再次需要构建整个基础设施,并重新思考,好吧,我们甚至如何构建课程。>> 太棒了,我非常喜欢你不仅关注技术和技术突破,还关注工作流程突破以及教育和培训突破,有多少实际上是让每个人都了解所需技能以及如何使用这些美妙的新技术。我也喜欢你提到迭代,我认为我们已经看到了代理技能的兴起。文本文件 Markdown,带有少量 YAML 前导信息,以及像这样的文档,你可以与代理一起迭代,这是一种持续学习 AI 的形式,而且我实际上看到的最有效的演变方式是,你不断地迭代你的工作流程,并且拥有像 Opus 4.5 或 Gemini 3 这样的代理系统,它们足够强大,可以帮助你像思想伙伴一样迭代这些事情,这真是令人难以置信,拥有这些不断发展的系统,我认为。>> 是的。是的,绝对。>> 嗯,另外,我之前提到过,Duolingo 的成功很大程度上在于激励和习惯养成。我只是想知道你在让人们长期保持学习动力和养成良好习惯方面学到的最重要的经验是什么。>> 是的,有很多经验。我想说最大的就是,动力不仅仅是你可以随意添加的东西。你真的需要有意识地将其视为更大学习设计的一部分,我们明确避免某些极端,比如我们不想让它过于游戏化而失去学习,我们也不想让它过于学术优化。当然,在学习方面我们可以做一些事情,我们知道它们可能非常有效,但然后它会变得有点不愉快,人们可能会精疲力尽。所以,我们真正要做的是保持在学习效果好和吸引人的交叉点上。我认为这非常强大,能够始终一起考虑它,这样就不会是“好吧,让我们构建一些有效的东西,然后尝试让它变得有趣”,或者“让我们构建一些感觉超级有趣的东西,然后我们会想办法让它有用”。这行不通。所以,相反,我们发现有帮助的是,你从一开始就试图考虑什么能同时给我们带来两者。而且,我想说的另一条经验是,这种习惯养成不仅仅是关于连胜和试图让人们每天上一节课。它比这更重要。它实际上是关于构建正确的体验,让学习感觉对人们来说是自然的。例如,我们一次又一次地看到,导致更好的学习、更好的参与度的就是那些更短的课程,也许更频繁。它们肯定更容易保持习惯,因为你可以完成一节 5 分钟的课程,比坐着听 15 到 20 分钟的东西要容易得多。所以,试图找到融入人们日程安排的方法,这非常重要。>> 太棒了。那么,最后一个问题,现在是人工智能领域的激动人心的时刻,每个人都在想象个性化辅导如何能极大地改变我们的学习方式,以及未来几年拥有更好的学习技术,世界会是什么样子。我想知道,当你想到技术、科学、产品和设计以及人工智能的交叉领域时,你拥有如此绝佳的视角来思考这个学习技术的大空间。什么让你最兴奋?什么让你早上起床,充满活力地迎接未来?>> 我绝对对我们现在所处的位置感到非常兴奋,新技术带来了如此多的新可能性。就个人而言,我最兴奋的是个性化。尽管个性化是我们一直以来都在努力的事情。我认为借助新技术,我们可以达到一个完全不同水平的个性化,变得更聪明,真正了解我们的学习者,并真正能够,虽然还不能完全实现,但希望在未来,能够即时生成真正符合人们需求的体验。这确实是一件困难的事情。个性化很难,但我认为我们可以考虑许多不同类型的个性化。例如,你可以想象我们教授你相同的课程,但实际上使用你可能感兴趣的不同主题。也许一个人对体育更感兴趣,另一个人对艺术更感兴趣,等等。我们可以例如,使用非常不同的主题来教授你语言和某些语法点。现在,它更多地是确定的,好吧,我们正在用这个主题教你这个语法,而这基本上是我们对每个人所做的。但现在,借助真正生成无限内容的能力,并且能够对每个人做出更快的响应,并且能够记住一个人对不同类型的内容的反应方式。我们可以更聪明地调整整个体验。不仅仅是难度级别,而是再次,就像主题、我们使用的角色、我们使用的语气,以及。我认为这将真正帮助我们更有针对性,更有效地满足每个学习者的非常个体化的需求。这是个性化、学习以及在正确的时间将正确的信息和体验传递给正确的人的激动人心的时代,而且你在 Duolingo 为此所做的努力,以及研究什么有效什么无效,真是令人难以置信且鼓舞人心。感谢 Boja 带来如此精彩的对话,感谢你的时间和智慧和专业知识。>> 嗯,非常感谢。这很有趣。>> 谢谢。非常感谢收听 High Signal,由 Delfina 提供。如果您喜欢本期节目,请不要忘记注册我们的新闻通讯,在 YouTube 上关注我们,并与您的朋友和同事分享这个播客。在 YouTube 上点赞并订阅,在 iTunes 和 Spotify 上给我们五星好评和评论。这将帮助我们为您带来更多您喜爱的对话。所有链接都在节目说明中。下次再见。