📱

Get Our Mobile App

Take your business learning on the go!

Download on the App StoreGet it on Google Play

Stanford CS547 HCI Seminar | Winter 2026 | Does GenAI Work in Education?

Stanford Online56:54

Transcription

大家好。我非常激动,呃,今天能在这里分享我们近期在设计人工智能辅助学习技术方面的工作。特别是,我将分享两个关于知识工程和认知对齐界面设计的案例。我希望这能引发更多关于何时以及如何将人工智能用于教育的讨论。

学习无处不在,呃,在大学和中小学课堂、在家或在工作场所。然而,在帮助人们发挥最大潜能方面仍然存在许多挑战。我将分享一些挑战的例子。以密歇根大学为例,这是我来自的地方。我们许多入门课程每年有超过 2000 名学生注册,这使得个性化支持变得难以实现。根据世界经济论坛 2023 年的《未来就业报告》,到 2027 年,约有十分之六的工人需要培训,但只有一半的人能够获得培训机会。国家教育统计中心的数据显示,过去 10 年,美国初中生的阅读和数学成绩一直在下降,并且仍在继续下降。而在工作场所培训方面,例如在我们的一些研究地点之一的教学医院,约有 92% 的普通外科住院医师报告在完成住院医师培训毕业时,未为独立执业做好准备。

嗯,所以我们看到了一些挑战的例子,而我研究的一个核心问题是如何通过技术支持人类技能的获取。自生成式人工智能兴起以来,关于生成式人工智能是否能解决我们提到的问题,一直有很多讨论。呃,例如,提供辅导、提高教学能力、提供培训机会。我们看到了关于其在教学和学习中作用的兴奋、炒作、怀疑和相互矛盾的观点,并希望分享一些近期结果。

许多报告和调查显示,学生们显然正在使用生成式人工智能来解决问题和创作输出。国际上的不同调查显示,约有 70% 到 85% 的大学生使用生成式人工智能完成家庭作业。随着数百家生成式人工智能驱动的教育科技初创公司的兴起,市场需求巨大,旨在简化教师的工作流程或提供个性化辅导。

然而,使用此类工具进行学习的证据却好坏参半。有一些研究显示了积极影响。例如,哈佛大学的一个团队进行的一项随机试验表明,经过精心设计的 AI 导师比课堂主动学习能带来更好的学习效果。这是在一门大学物理课程中进行的。另一项斯坦福大学团队的研究表明,为人类导师提供实时 AI 建议可以提高学生的学习效果,这是在中小学数学领域进行的。

然而,有更多的研究显示了生成式人工智能的负面影响。例如,宾夕法尼亚大学的一篇论文显示,在没有护栏的情况下让学生使用人工智能可以提高高中数学成绩,但当人工智能被移除时,学习效果会下降。麻省理工学院的一个团队的另一项研究表明,当人们使用人工智能助手撰写文章时,他们的大脑活动会减少。此外,今年在人工智能与教育会议上发表的一些论文表明,当人工智能用于生成提示或提供辅导时,约有 30% 到 50% 的提示和辅导对话存在质量问题。

因此,今天我不想回答“生成式人工智能在教育中是否有效”这个问题,因为我们已经看到了非常混杂的结果,我想开始提出并回答另一个问题:“鉴于教师和学生在教学和学习中越来越多地使用这些工具,如何让生成式人工智能在教育中发挥作用?”我们将在讲座结束时回到最初的问题,我将分享我工作中的两个案例和两个主要见解。

呃,第一个是知识工程,我相信这是开发人工智能驱动的教育软件的关键。第二个是创建认知对齐的界面。

那么,让我们从知识工程开始。我所说的知识工程是指为了理解执行一项任务所需的认知要求而付出的共同努力。通过知识工程,我们可以实现更高的认知保真度,从而实现更好的辅导、反馈和有针对性的练习。

知识工程的概念并不新鲜,可以追溯到大约十年前认知辅导器的开发,其动机是所谓的布鲁姆的“两个标准差挑战”。那么,什么是布鲁姆的“两个标准差挑战”呢?它表明一对一辅导比传统的课堂教学(一名教师对 30 名学生)更有效。

所以,在这张图上,X 轴是学生的成就分数,最平坦的曲线代表一名教师对 30 名学生的传统课堂教学,而最陡峭的曲线代表一对一辅导。这张图显示,接受一对一辅导的平均学生,其成就分数会比接受传统课堂教学的平均学生高出两个标准差。这就是我们所说的布鲁姆的“两个标准差挑战”。

然而,为每个学生提供一对一辅导是不切实际的,这促使了基于人工智能的个性化辅导器的开发。呃,特别是认知辅导器,它最早是在 20 世纪 90 年代引入的。在一系列从 1997 年到 2013 年的研究中,研究表明,在一年多的时间里,在许多学校里,认知辅导器在代数教学方面比传统的代数课程能带来两倍的学习效果。

那么,什么是认知辅导器呢?认知辅导器背后一个重要的概念是认知模型,它由一系列规则组成。因此,要创建一个认知辅导器,我们首先需要提取一个全面的认知模型来解决问题,然后我们可以创建一个人工智能代理,该代理可以根据认知模型解决这个问题,这是最早的基于规则的人工智能。第三,这个人工智能代理将模仿专家的思维过程,并向学习者提供反馈和提示。

让我们看一个具体的问题,假设我想创建一个辅导器来教某人这个分数加法问题,对吧?然后,按照创建认知辅导器的过程,我们将首先将其分解为三个步骤,然后我们可以编程一个人工智能代理,该代理可以按照这些步骤解决问题,并为学习解决此问题的初学者提供反馈。在这种情况下,假设示例的三个步骤包括找到公分母,在保持分母不变的情况下相加分子,然后简化所得分数。

认知辅导器中的另一个重要概念是认知保真度。呃,现在我有一个问题要问大家。假设您正在教某人找到最小公分母,如果他们输入 12 或 24,您会给他们相同的反馈吗?

>> 嗯,有人想分享一下,如果他们在这里输入 12 或 24,您会给出什么反馈吗?

>> 是的。您会将其用作教学时刻,告诉他们关于最小公倍数的信息。

>> 呃 [清嗓子] 是的,那可能是一个教学时刻。所以 24 是一个公分母,但它不是最小公分母。但如果他们输入 10 呢?呃,您会给他们什么反馈,与其他错误相比?

>> 是的。>> 我会回顾一下,我想,如何找到这个公分母。嗯,因为我也认为这取决于他们是已经学过一段时间了,现在正在复习,还是这是他们第一次学习?因为我会特别关注 24 和 10。如果他们是第一次学习,我可能会忽略 24,因为他们只是在学习过程,而不是如果他们很早就开始学习。如果他们输入 10,我会说,“等等。”嗯,“我们怎么做,怎么回到,我们怎么做这个特定的过程,或者也许再次进入教学阶段,因为也许他们完全做对了,或者他们需要一个提醒?”所以,这真的取决于学生。

>> 呃,所以,是的。所以您给学生的反馈可能取决于,呃,比如,他们的先验学习经验,以及根据他们输入的不同的答案,您可能会给他们,呃,不同的反馈。例如,如果他们在这里说 10,似乎他们是在将这两个分母相加,这是一个常见的错误,而不是找到最小公分母。这就是我们所说的认知保真度。

认知保真度表明,在人工智能辅导器的认知模型中,如果技能被充分分解并且常见误解被预见,它将为学生提供更个性化的反馈。然后是认知保真度。呃,我看到那里有一只手。

>> 您是想在最后提问,还是更喜欢在过程中提问?

>> 呃,如果有澄清性的问题?我现在很乐意回答。

>> 好的,太好了。谢谢。嗯,所以认知保真度因此能够实现刻意练习和个性化反馈。我们可以想象,在较低的保真度下,辅导器可能会给出强制性的反馈,并基于学生的错误提供更普遍的练习。但对于一个具有更高保真度的认知模型,呃,具有,呃,具有一个具有更高保真度的认知模型,辅导器可以给出更个性化和具体的反馈,例如在这里通过 XYZ 来改进,以及基于学生弱点的更有针对性的练习,从而使学习更有效。

所以,这是对认知辅导器的回顾,现在我想回到,呃,呃,我们对生成式人工智能在教育中的应用。我主张,在使用生成式人工智能时,我们仍然需要进行知识工程方面的努力,以便人工智能辅导器能够提供个性化和有效的反馈。我现在将分享一个例子,即生成式人工智能可用于提供学生写作反馈并提高写作表现,这需要知识工程。这项工作由我的博士生牵头,与 Phyis J Mutual Dadly Larissa Stano 合作,并已获得 Kai 26 的录用。

这项研究是在,是的,关于您之前的研究,您说知识工程,您是指基于规则的,我们将其编程到人工智能中,还是指基于人工智能推理?

>> 嗯,嗯,我可以再说一遍这个问题吗?所以,>> 当您谈到基于知识的推理时,您是指人工智能正在进行推理以找到这些规则,还是这些规则被编程到人工智能中?是编程进去的。所以,我我我指的是专家会参与这个知识工程过程,以便这个可以被提供给人工智能以提供反馈。

>> 是的,谢谢。嗯,这项研究是在密歇根大学的一门大型入门经济学课程 Econ 101 中进行的,这门课程有几项简短的论文作业。例如,找到过去三个月内包含市场失灵的新闻文章,分析市场失灵,并提出解决方案。这是一个开放式任务,学生会找到不同的文章,识别不同的市场失灵,并提出不同的解决方案。但他们在市场分析方面有着相似的推理过程。

关于这门课程的更多背景。每个学期约有 360 名学生,11 到 12 名助教。对于每一篇写作作业,助教,学生首先提交一份草稿,助教对第一份草稿提供反馈。学生修改后提交修改后的草稿。只有修改后的草稿才会被评分。

通过一个学期的共同设计和与讲师及助教的迭代测试,我们开发了 Feedback Writer 系统,这是一个供助教对学生书面论文提供反馈的系统。我将首先播放一个系统演示。

嗯,该系统的基石是我们提供的评分标准,用于生成反馈。嗯,在这种情况下,它是对推理过程的清单表示,我们与讲师进行了迭代设计过程,以提高认知保真度。正如我们之前提到的,当知识要求更具体时,反馈可以更具针对性和具体性。

这里我展示一些例子。嗯,在左边的列中显示了较低保真度的要求版本。例如,解释为什么该商品是外部性商品,或者解释为什么该商品是稀缺商品。嗯,然后一个更高保真度的版本包含了专家的推理过程。例如,为了解释为什么该商品是外部性商品,它有几个步骤:识别决策者,识别谁或什么不是决策者但受到伤害,并解决自由市场结果与有效结果之间的差异。

因此,通过这个改进的评分标准或成功标准版本,嗯,系统会对每个标准做出判断并生成反馈消息。

另一个重要的设计考虑是反馈消息不应泄露预期答案。我们确保反馈消息是作为提示生成的,而不是答案。

为了检验我们称之为人工智能辅助反馈的影响,即助教在向学生提供反馈时接收人工智能建议,我们在 360 名学生和 11 名助教的班级中进行了随机对照试验,在冬季 25 学期,也就是去年的这个时候,嗯,所以大约有 1400 篇论文获得了该系统的反馈。

该班级首先分为两组。在实验条件下,助教使用 Feedback Writer 系统,也就是我们的系统来提供反馈,而在基线条件下,助教使用具有相同评分标准和历史反馈但没有人工智能的基线系统。然后我们有结果衡量指标,包括学生修改后的草稿质量。

嗯,正如我们提到的,他们首先提交第一份草稿,然后收到反馈,然后修改草稿。所以我们衡量修改后草稿的质量与第一份草稿的比较,并且我们还有一个可选的修改期后的测试,我们颠倒了条件,用于写作作业,所以这给了我们一个组间和组内比较,这就是基线系统的样子。助教可以自由添加评论,并且他们可以访问与 Feedback Writer 系统相同的评分标准和历史反馈。

现在我想稍微谈谈我们的结果衡量指标。主要结果衡量指标是论文质量。我们使用人工智能评判来评估第一份和最后一份草稿的质量。人工智能评判对每个评分项做出满意(1)或缺失(0)的判断。我们比较了人工智能评判与专家讲师的准确性,它使用三种不同的模型,包括 GPT4、GPT5 和 Gemini 3 Pro,达到了约 85% 的准确率。

使用人工智能评判的另一个原因是,我们发现人类评判者之间的读者变异性比人工智能评判者更高,并且一个人对所有 1400 篇论文进行评分是不切实际的。

所以,这是我们发现的。接受人工智能辅助反馈的学生,其修改后的草稿质量明显高于仅接受人类反馈的学生。在这种情况下,嗯,在这张图上,蓝色条形代表人工智能条件,橙色条形代表仅人类反馈的基线条件。所以,Feedback Writer 条件下的差异明显更大,这表明改进比基线条件明显更大。

是的。>> 在关于 85% 到 87% 与专家的上一张幻灯片中,这是讲师 [清嗓子] 对助教吗?比如,专家是讲师?

>> 只是一个相关的问题,关于那里的差异,您是否查看了它与人工智能评判还是人类评判的相关性?比如,人工智能是否不成比例地犯了有利于人工智能情况的错误?

>> 啊 [清嗓子] 呃,所以,对于这些,所有的论文都是从两个条件中随机抽取的。所以我们没有看到两个条件之间有系统性的差异。

>> 所以我的意思是错误的系统化。所以,比如,当人工智能与人类评判者不同意时,这些错误是否倾向于有利于一个条件而不是另一个?

>> 对。>> 呃,让我想想。呃,也就是说,当这个,呃,当我们使用人工智能评判来,哦,当,呃,当我们分析不一致之处时,两个条件之间是否存在差异,我不知道,我记不清了。我不知道我们是否比较过,但据我回忆,我们确实交叉检查了这两个条件,并且,并且它没有,我不记得两个条件之间有任何差异。

>> 另一个说明是,人们可能在想生成评估偏差,但那通常是当同一个模型用于生成和评估文本时,同一个模型生成。但在这种情况下,所有的文本都是由学生写的,反馈只是间接影响了学生在修改版本中实施的内容。

>> 是的。>> 与此相关的是,使用这三种不同的模型,您知道它们与专家的 15% 的不一致之处,它们是否大致相同,还是有点?

>> 哦,是的,这是个好问题。嗯,我不认为我们做了这个比较,但我想这会是值得检查的。

>> 好的。所以,嗯,回到结果,我们发现接受人工智能辅助反馈的学生,其修改后的草稿质量明显高于仅接受人类反馈的学生。效应量为 0.5,相当于将学生从第 50 百分位数提升到第 70 百分位数,与接受仅人类反馈的学生相比。

>> 我们还发现,当助教采纳更多人工智能建议时,修改质量更高。所以,这与助教在系统中的互动以及我们看到的写作质量的提高相关。

>> 我想简要总结一下,我们认为 Feedback Writer 系统有效的原因。首先,我们与讲师一起迭代地改进了评分标准,以便评分标准准确地代表任务的知识要求,并且通过如此详细的评分标准,人工智能在检查知识要求方面比人类评估者做得更全面。其次,许多助教告诉我们,即使他们能够识别学生的错误,也很难在不泄露正确答案的情况下构建一个支持性和个性化的消息,而人工智能在 crafting 反馈消息方面做得更好,并且如果他们想进一步修改反馈,它也为他们提供了一个起点。

所以,我将向您展示一些人工智能辅助反馈的例子。

>> 是的。>> 问题是学生是否可以访问评分标准?

>> 呃,这是个好问题。所以,学生可以访问一个更通用的评分标准版本。嗯,学生们无法访问系统用于生成反馈的相同评分标准,因为有些评分标准会泄露正确答案。嗯,所以,所以评分标准,有些,呃,评分标准太详细了,比如,学生需要进行的具体推理过程是什么。学生有一个更通用的版本,告诉他们需要包含什么,以及交付成果应该是什么样子,但他们没有具体的步骤。

>> 嗯,所以这里有两个针对同一学生错误的反馈示例。嗯,在这种情况下,嗯,人工智能辅助反馈倾向于承认学生的部分进步,说“你已经识别了替代品的作用,但你如何进一步探索这种关系?”而仅人类反馈则更通用,比如“我也会提到某个想法,还有……”嗯,人工智能辅助反馈倾向于更个性化地针对学生的写作,例如,“如果胰岛素的价格是其边际成本会怎样?”而仅人类反馈有时会使用他们提供的模板,例如“考虑课堂上讨论的解决方案,会发生什么,等等。”

>> 嗯,所以,随着这项研究,嗯,随着我们在这项研究中看到的有希望的结果,我们正在继续这项工作,并且我们本学期正在进行一项我非常兴奋的新研究。我还没有任何结果,但我想分享我们正在探索的内容。

嗯,利用从两个学期收集的助教修改数据,我们改进了人工智能反馈引擎。嗯,所以,我们本学期在这门课程中试图做的是,我们将使用纯人工智能的方法,在 24 小时内对学生的第一份草稿提供反馈,这将导致大约 10 分钟的,呃,嗯,根据我们的日志数据,每位助教平均花费 10 分钟处理每篇学生论文。所以,这相当于为整个班级节省了大约 60 小时的总助教时间。

所以,我们问这个问题,如果我们使用人工智能来提供第一份草稿的反馈,助教是否可以将他们的时间用于更高影响力的工作?所以,本学期我们要求每位学生注册一个 10 分钟的办公时间,讨论他们获得的反馈。我们希望这能帮助学生与教学团队建立人际关系。然后我们希望与教师的这种面对面交流能为学生提供额外的动力来参与课程。

所以,我们看到的是,如果,我认为,如果我们看到人工智能能够合理地做好一些基础任务,并且有知识工程,那么也许我们可以看到教学范式的转变,教学资源和社会资本可以重新分配,以对学生产生更高的影响,特别是,呃,为了让教学团队与学生建立人际关系。

>> 非常好的工作,我有一个问题,对于那些从事写作任务的学生,您知道他们是否使用人工智能吗?

>> 这是个好问题,我们一直在关注这个问题。我们已经进行了两个学期的研究,冬季 25 和秋季 25。在这两个学期里,我们没有办法阻止他们这样做,但我们从数据收集的角度做了一个小技巧,我们在提示中使用了一个宽泛的提示。所以,如果,所以这是一个错误的经济学家的错误引用。所以,如果他们直接将这个提示复制粘贴到人工智能中,那么最终的交付成果中就会出现一些奇怪的东西,我们可以捕捉到。所以,我认为每篇论文大约有五到八名学生,在 360 名学生中,但我也知道这是一个较低的基线。从本学期开始,我们正在我们自己的平台上实施一个系统,让他们进行论文写作。所以一切都通过我们的平台记录。所以,它禁用了复制粘贴。我们还在根据我们可以检索到的日志来跟踪他们是否在打字。

>> 嗯,所以,我知道这并不能阻止他们这样做,但这可以为我们提供一些关于数据收集过程的见解。哪些数据实际上是可用的?哪些可能只是不可用?

>> 是的。这种在做得更好、结果更好,但学习效果却降低的张力,在这种意义上,他们做得更好,但学得更少。您能谈谈这些结果在这种背景下吗?

>> 是的。是的。嗯,这是一个,这是一个很好的问题。所以,嗯,在这项,我提到了研究设计,呃,呃,我们有两个衡量标准。一个是他们修改了草稿,第二个是我们有一个可选的后续测试。所以我没有在这里谈论后续测试的结果。所以,我们没有在两个条件下看到后续测试的显著差异。后续测试包括选择题和开放式问题,这些问题都涵盖在这篇写作作业中。我们看到一个趋势,我们的条件略好,但并不显著。

>> 我的假设是,对于每个知识组成部分,比如说他们正在学习如何识别,如何分析和解释负外部性,他们只有一次机会写作并获得反馈。所以,我认为剂量可能不足以让我们看到学习的收益。

>> 但即使我认为,他们正在做出更高质量的修改,这也很令人兴奋。我认为这也是学习的一个信号,因为反馈并没有直接告诉他们该做什么,反馈更多的是脚手架式的消息,他们也需要在修改之前仔细思考,但我同意,如果我们能看到后续测试的收益,那将更令人兴奋。

>> 我认为,对于这类技术,例如,学生在更短的时间周期内获得反馈,我们也许能够实施更多的学习机会,这可能会增加剂量,让我们看到学习的好处。

>> 是的。可以提问吗?

>> 我可以等到您完成演示。我以为是>> 呃,还没有。>> 好的。谢谢。

>> 好的。所以,那是,呃,那是第一个故事,知识工程的反馈提供。现在我想分享第二个见解,关于创建认知对齐的界面。

所以,让我们回顾一下 Feedback Writer 系统的设计。它与助教的反馈提供认知过程相符。具体来说,我们将助教的认知过程分解为三个步骤。对于每个评分项,他们会识别论文中的相关句子,然后对其满意度做出判断,然后构建反馈消息。然后,我们设计了界面来遵循这个过程,并在每一步显示人工智能的中间结果,以便助教可以在每一步纠正人工智能的错误。例如,如果他们对高亮不满意,他们可以重新绘制,他们可以翻转判断,然后他们可以修改反馈消息或完全忽略它。

除了 Feedback Writer,我想展示第二个例子,其中我们使界面设计与学生的笔记过程相符,以在记笔记时保留必要的认知参与并支持理解。这项工作由我的博士生牵头,与 Kunan Phis 和 Nathan Yap 合作,并获得了 SCSW25 的最佳论文奖。

我们知道人工智能越来越多地用于促进认知上具有挑战性的任务。例如,帮助我们在讲座或会议中做笔记。这引发了一个问题:人工智能辅助总是受欢迎且有益的吗?我们通过设计三种我们称之为 Note Copilot 的笔记系统的变体来回答这个问题。

>> 嗯,现在我想展示三种工具版本。我将在最后问大家一些问题。

>> 所以,假设您正在参加一个现场讲座,并在您的电脑上使用像这样的工具来记笔记,这是系统的第一个版本,称为自动化人工智能版本。

>> 所以,它与商业笔记工具类似。您右边有一个记事本。您可以记笔记,然后系统每两到三分钟生成一个结构化的笔记块。它有这些层次结构和这些项目符号。您可以将笔记块拖到记事本中作为您自己的笔记。这就是自动化人工智能版本。它生成一个结构化的块。

>> 然后在中间人工智能版本中,系统在每个发言轮次后生成一个摘要块。摘要块几乎实时出现,然后您可以将笔记块拖到记事本中作为您自己的笔记。

>> 然后在最小人工智能版本中,系统为每个发言轮次生成逐字记录。同样,它们实时出现,您也可以将记录块拖到记事本中以制作您自己的笔记。

>> 在所有三个版本的系统中,您都可以在记事本中自由记笔记,并忽略人工智能的输出。

>> 所以,现在我有一个问题要问大家。假设您使用这个工具的一个版本在讲座中记笔记,讲座结束后我们对您进行小测验。您认为哪个条件会导致讲座后小测验的最高分数?

>> 所以,这些是三个条件。自动化人工智能,每两到三分钟有一个碎片化的块。中间人工智能,在每次发言轮次后有一个摘要块。最小人工智能,生成逐字记录,不是来自您的笔记,而是来自说话者。正确。

>> >> 但它是来自说话者。所以就像一个讲座。是的。

>> >> 它不是来自您的笔记,因为我看到的图像有点让我困惑。您记笔记,然后它总结您的笔记。

>> >> 不,不,它是基于说话者所说的。所以,它就像,它在总结讲座。

>> >> 是的。

>> >> 我会猜中间版本,因为它,嗯,它仍然迫使您思考,它允许您在实际演讲中倾听,所以您不必总是在记笔记,但我想这取决于个人。也许有些人不会被记笔记分心,但如果您被分心了,那么它允许您同时倾听,它迫使您弄清楚哪些部分与您的摘要相关。

>> >> 酷。是的。所以,嗯,我认为我对中间版本有一个微弱的支持。呃,我看到另一只手。

>> >> 所以,我认为自动化人工智能会更好,因为它做了我讨厌做的事情。我宁愿听,也不愿记下所说的每一件事,每一个细节。

>> >> 是的。呃,好的。那么,举手投票。谁认为它是自动化人工智能?好的。谁认为它是中间人工智能?好的。谁认为它是最小人工智能?好的。我认为我看到大多数人都选择了中间版本,呃,自动化和最小版本的人数也差不多。

>> 所以,我们进行了一项包含 30 名用户的组内研究,每位用户都体验了所有三个变体。他们会观看一个现场讲座视频,并使用一个版本的系统来记笔记,最后我们对他们进行小测验,然后重复三次。

>> 事实上,我们发现中间人工智能的表现最好,呃,并且显著高于最小人工智能,而最小人工智能也显著高于自动化人工智能。

>> 所以,现在我有一个后续问题。现在我给您您刚做的笔记,您可以以任何您想要的方式修改您对测验的回答。那么,您认为哪个条件会带来最高的分数,考虑到您可以参考您的笔记并修改您的回答?

>> 谁认为它是自动化?好的,我认为我看到更多人选择了自动化。谁认为它是中间版本?呃,仍然是中间版本。谁认为它是最小版本?好的,我认为我看到最多人选择了自动化。

>> 所以答案是,当学生可以根据笔记修改答案时,趋势仍然如此。中间版本仍然是最好的。自动化版本能够赶上最小人工智能。所以自动化和最小版本之间没有显著差异。

>> 如果我们看看用户在系统中的互动,我们发现,嗯,中间人工智能条件下的用户互动最多。例如,他们在文本编辑器中的编辑次数最多,并且他们将人工智能内容拖到编辑器和构建内容的行为也最多。

>> 总结一下,Note Copilot 的设计旨在与人们的笔记过程相符,即编码和存储过程。特别是,通过这些中间人工智能摘要作为可重用材料,它补充了人们在记笔记过程中的编码过程。因此,与最小人工智能相比,它减少了记录信息的精力。而它将解释和构建过程留给用户来操作中间摘要,这个研究也表明编码过程会影响存储过程,如果人们不自己编码信息,检索就会变得更难,这解释了为什么如果你不自己记笔记,即使你得到了人工智能为你做的,即使你被要求进行理解测试,你的表现也不如你自己做的时候好。

>> 所以,这些是我今天分享的两个见解,关于知识工程和创建认知对齐的界面,通过两个领域特定的调查,我希望它们能为更广泛地使用人工智能开辟新的对话。

>> 这些研究也为我的研究小组开辟了新的方向。所以,现在让我们回到我们关于人工智能在教育中支持的更大图景。

>> 传统上,教师负责创造学生参与的学习环境。所以在常规课堂上,这包括创建作业、课堂活动等等。这个圆圈表示学生与教师或专家创建的环境的互动,这可能受到限制,因为专家的能力有限。

>> 随着技术的进步,学生正在获得更广泛的学习环境或机会的接触。

>> 随着生成式人工智能的兴起,许多工具都触手可及。

>> 今天我展示了,通过知识工程和认知对齐界面设计,教学能力可以得到增强。因此,专业知识首先通过知识工程提取,并传播到这些不同的可扩展格式中,例如人工智能反馈或人工智能辅导。

>> 所以,这个,这个更浅的绿色圆圈在这里表示,如果我们能够提取专家的心智模型,它可以传播到提供其他可扩展的支持格式给学生,以便学生获得,所以教学能力和学生与良好学习环境的互动得到增强。

>> 我们展示了一个例子,Feedback Writer,关于反馈提供。我们的实验室已经开发了支持教师在其他任务上的工作流程的系统,包括问题创建和评估,以及为各种领域编写智能辅导系统,从医学任务到体能任务再到对话训练。

>> 下一个重要的问题是如何提高知识工程过程的效率,以便更容易地提取专业知识。在我们之前的调查中,需要花费大量时间与讲师合作才能将这些专业知识表示出来。我们目前正在探索方法,以提高专业知识提取的效率,通过可视化方法、示例选择方法和模拟学生解决方案。

>> 另一个我们感兴趣的问题是,在测试专业知识时,有哪些不同的知识表示方法。

>> 另一项正在进行的工作是检查教学范式的转变。我们是否可以重新分配教师的时间和社会资本以获得更深入的学生参与。例如,在 Feedback Writer 研究的后续工作中,我们研究了助教的时间是否可以更好地用于与学生进行面对面交流,而不是在笔记本电脑后面提供反馈。

>> 因此,我想提出在使用人工智能进行教学时,教师与人工智能协作的两个循环。内循环是通过知识工程和认知对齐界面为教师提供工具支持。外循环是探索人工智能作为教学伙伴,并研究如何重新分配教学资源和教师的社会资本以获得更深入的学生参与。

>> 现在让我们看看学生。即使我们引入了这些有护栏的工具,学生仍然面临比以前更多的帮助选项。

>> 并且,深入的参与和思考过程可能会被绕过,这在我们的 Note Copilot 论文中得到了体现,我们正在进一步探索自我调节支持,以提高学生在寻求人工智能帮助时的意识,并通过协作学习提供激励和社会支持。

>> 因此,我想回到我们最初的问题,生成式人工智能在教育中是否有效?我认为通过研究和设计,我们可以使其在规模化提供个性化支持和增强更深入的人际互动方面发挥作用。我认为投资于这两个教师与人工智能协作的循环将是富有成效的,既可以通过知识工程和认知对齐界面设计为教师提供工具支持,也可以探索教学资源和教师社会资本的重新分配。同时,我认为投资于如何帮助学生应对人工智能辅助困境也将是富有成效的。

>> 好的,到此为止,我想感谢我所有的优秀学生和合作者以及资助方,并接受提问。

[掌声]

>> 这是我之前想到的问题。所以,当我申请本科学校时,我记得在哥伦比亚大学面试,我和招生官谈话。她说,“看,我得告诉你,这里的教学并不比其他学校好。”她还提到了其他学校,不如哥伦比亚大学好,[清嗓子] 我不会说。所以,老师们知道得更清楚。你在这里得不到这个。你来这里得到的是学生。你将从你的同学那里学习。而且我认为我的学习经历当然,你知道课堂是难以理解的,但我与那些通过了课程的学生或同学聊天,而那才是更多学习发生的地方。所以,我正在思考,我喜欢在学习的背景下,所有这些都与个人导师与学生社区相互学习之间的脱节有关。您在哪里看到这个触发点?我认为这似乎太交易化了,与学习的现实不符。

>> 嗯,是的,我完全同意,这种同伴支持、同伴学习和建立社区是非常重要的,而且非常重要,这可能比学习这些认知技能更重要,当某人在大学时。

>> 我认为,所以我认为有几个方面。所以,有一些认知,所以,我一直在做的工作集中在帮助学生获取认知技能。所以,例如,我正在尝试解决这个问题,以及我需要掌握哪些基础构建技能才能,才能解决这些问题。

>> 我确实看到了使用这些辅导方法或可扩展方法为学生准备这些构建块方法的希望,这样他们就可以更好地协作。例如,像真实的项目的学生可以相互合作,进行开放式项目并产生解决方案。

>> 我在我的课堂上经常使用协作学习。我认为原因是为了让学生相互了解,因为现在许多学生不了解,不了解他们在同一课堂上的同学。

>> 但从技能获取的角度来看,例如,我的课堂上有小组项目,我只是看到有很多非常基础的误解或从一开始就可能非常错误的事情,这些事情可以通过这些方法轻松纠正,然后他们就可以出去做这些事情了。所以,我认为,例如,如果我们不为学生准备这些基础技能,那么他们花在做这些真实项目上的时间可能就是浪费时间,就像他们在这个过程中没有做对事情一样,但我同意社交方面也非常重要。我认为我们可以取得平衡,如果我们投入一些资源来准备学生掌握这些基础构建技能,我们也可以有更多的能力来支持这些,呃,这些社会支持,并支持学生进行协作。

>> 只是一个快速的问题。除了即时的知识工程和对齐之外,您能否评论一下您将如何根据您的研究方向重新构想课堂和大学?

>> 嗯,是的。所以,我认为一个即时的,一个即时的实验是,呃,看看是否基于人工智能的工具,人工智能伙伴,精心设计,可以提供这些信息支持,例如,如果学生经常犯错误,他们可以很容易地获得更多这些技能的练习,然后教师的时间可以更多地用于,呃,帮助他们将课堂内容与现实世界问题联系起来,帮助他们,例如,建立人工智能素养或建立职业联系。

>> 嗯,我认为,呃,一遍又一遍地指出这些低级错误,并不是对人们时间的有效利用。

>> 而且我认为这是关于我们如何能够将一些教学资源重新分配到建立与学生的联系,这是我立即的想法。

>> 而且我认为还有其他方面。例如,嗯,支持协作学习,并帮助学生与其他学生建立社交网络。

>> >> 是的。所以,嗯,总而言之,您正在关注初学者以及他们如何获得这些基础技能。我认为我仍然很难接受这一点。但另一方面,您也有一个目标是增强,你知道,导师或教师。您如何期望在长期内,当这些,你知道,导师现在必须与人工智能一起教学,并且他们从一开始就是这样,他们从未有过没有人工智能的教学经验,也许其中一些隐性专业知识从未真正获得给导师自己?

>> >> 嗯嗯。嗯,是的,这是一个很好的问题。所以,所以,所以问题是,我们是否担心,呃,导师,人类导师缺乏领域专业知识来真正支持学生?

>> 嗯,是的,我认为这是一个很好的问题。这是我还没有,还没有想清楚的。所以,在经济学课程的例子中,我绝对可以看到这种情况发生,比如过去,呃,助教他们花了 10 分钟给每个学生,他们深入思考学生并给他们反馈,现在这个过程由人工智能完成,但我们仍然要求他们花时间与学生进行面对面交流来帮助他们解释事物,但他们可能不会参与同样的,呃,深入的思考过程,当他们评估工作时。

>> 我可以看到这是一个问题,而且,我想知道是否也有助于,呃,提供,呃,为导师本身提供培训,但,但我想这是一个很好的问题。是的,我以前没想过,但,是的,谢谢你问这个问题。

>> >> 是的,谢谢你很棒的工作。嗯,我有一个问题。所以,所以最后你提到了为所有这些不同的学生提供个性化人工智能的想法,你所报告的,至少在最后一个项目中,或多或少是平均效应。所以,我很好奇,当你看到分布细分时,每个人都在朝着同一个方向发展吗?它分散了吗?

>> 我问这个部分原因是因为,如果我们衡量平均效应,但我们真正关心的是个人结果。我们如何看待如何实现这一点?我之所以这样问,部分原因是我预计某些学生会从这些中受益更多,也许是那些更聪明或更有经验的人工智能。您如何看待这些异质性效应?

>> 是的,这也是一个很好的问题。那就是,这些技术是否会使来自不同背景的学生受益不同。嗯,我认为这是我们应该投入更多精力去研究的。例如,呃,呃,例如,我们可以,呃,将学生分成,呃,根据他们的表现,分成表现较低或表现较高的学生,看看他们如何,呃,接收反馈。

>> 所以,根据文献,我们看到的是,通常当学生,呃,对于表现较低或来自较少特权背景的学生,他们不像表现较高的学生那样投入材料,并且他们从,呃,人类支持和激励支持中受益更多。

>> 所以,我认为这就是我们试图在新研究中解决的问题。例如,如果你在,呃,在,呃,一个,呃,一个更短的周转时间内获得这些反馈,然后你可以去找助教,花更多的时间与可能提供更多激励你参与反馈的人进行面对面交流。

>> 所以,有一个 plus tutor 项目,在卡内基梅隆大学,他们正在做,他们也在研究人类与人工智能互补辅导,其中一个发现是,对于来自较少特权背景的学生,嗯,嗯,尽管人工智能辅导器可能提供正确的信息,但他们确实需要一个人类导师在那里提供激励支持。我认为这就是我们在新研究中试图解决的问题。

>> 嗯,谢谢。

>> >> 谢谢您的演讲。这项工作非常有趣。嗯,也许是关于同一个问题,就像上一个问题一样,我想知道您是否能帮助我们推测这些结果的普遍性范围。所以,如果我们认为生成式人工智能在教育中有帮助,比如有各种各样的中介因素,比如,教授的学科领域,比如,课程的设计和设置,也许是年龄组,以及在第二个研究的情况下,也许是不同于记讲座笔记的任务。所以,比如,您如何预测这些中介因素会影响这些结果,还是您发现它们在所有这些条件下都普遍稳定?

>> >> 是的,谢谢。这是一个很好的问题。嗯,所以,就普遍性而言,我认为,嗯,从认知技能获取的角度来看,系统本身可能无法直接推广到新的领域,因为人们正在获取不同类型的技能。

>> 我认为可以推广的是我们用来构建这些系统的过程。例如,知识工程过程,我们进行了大量的实验,这些实验并没有用于部署研究,但在我们部署系统之前,我们对不同类型的,呃,成功标准的保真度进行了大量的实验,或者评分项,以及越,呃,越具针对性,越具体的评分项,反馈的质量就越高。

>> 所以,我认为,参与这个知识工程过程,以便我们能够准确地表示专家的推理过程到系统设计中是非常重要的,我认为这个见解会转移到其他情境。

>> 对于第二个研究,嗯,我认为,嗯,我认为这个,这个关于认知对齐界面设计的见解,会转移到其他情境。所以,我们在这里看到的是中间条件处于中间位置。所以,有一个范围,你有人工智能自动化你的大部分工作,而你做大部分自己的工作,而中间有一个地方,人工智能给你一些你可以操作的东西。

>> 所以,这是最佳位置吗?我不确定,但我认为这是一个比其他两个极端更好的位置。

>> 而且我认为这个过程,例如,在记笔记方面,有编码和存储,我们想最大限度地支持编码过程,我们想保留必要的认知参与,我们希望他们能够解释,但我们希望他们能够更有效地解释,人工智能生成的摘要。

>> 我认为,我认为这个设计界面的过程会推广。