搜索
首页科技周边人工智能AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

或许,你做的数学考题,是机器生成的。

MIT 的学生可以不费吹灰之力就能解决多元微积分、微分方程、线性代数等数学课题,但这些却把机器学习模型给难倒了。因为机器学习模型只能回答小学或高中水平的数学问题,而且它们并不总是能找到正确答案。​

现在,来自 MIT、哥伦比亚大学、哈佛大学和滑铁卢大学的研究者,他们使用小样本学习、OpenAI 的 Codex 来自动合成程序,在几秒钟内解决了大学数学问题,达到了人类水平。这项研究发表在《美国国家科学院院刊》(PNAS)上。

此外,该模型对生成的解决方案还能进行解释,并能快速生成新的大学数学问题。当研究人员向学生展示这些机器生成的问题时,学生们甚至无法判断这些问题是由算法生成的还是由人类生成的。​​

这项研究还可以用来简化课程内容生成,这对拥有数千名学生的学校和大型开放式网络课程(MOOC)尤其有用。该系统还可以充当在线导师,向学生展示解决数学问题的步骤。

AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

论文地址:https://www.pnas.org/doi/epdf/10.1073/pnas.2123433119

该研究的方法结合了三个创新:

  • 与只在文本上进行预训练不同,该研究在文本上进行预训练的同时,还在代码上进行微调;
  • 采用小样本学习合成程序能够正确解决数学问题;
  • 该研究能够解决问题、解释解决方案以及生成新问题。

该研究生成新问题示例如下。

AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

能答题、解题、出题的模型

研究团队已经为这个项目花费了近两年时间。他们发现,仅使用文本进行预训练的模型,在高中数学问题上的准确率不会超过 8%,而使用图神经网络模型,可以在机器学习课程问题上做得很好,但需要一周的时间来训练。

该研究从七门课程中随机抽取 25 个问题:MIT 的 18.01 单变量微积分、18.02 多变量微积分、18.03 微分方程、18.05 概率与统计概论、18.06 线性代数、6.042 计算机科学数学和哥伦比亚大学的 COMS3251 计算线性代数。

对于 MATH 数据集,该研究从数据集中的六个主题(代数、计数与概率、中级代数、数论、初级代数和微积分)中随机抽取 15 个问题。

AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

在将这些编程任务输入到神经网络之前,研究人员添加了一个新步骤,使其能够大大优于以前的尝试。​​

与 GPT-3 等网络只在文本上进行预训练不同。他们把这些问题转化为编程任务,并应用程序合成和小样本学习技术。把数学问题变成编程任务,就像可以简单地把求两点之间的距离这个问题改写为编写一个程序来求两点之间的差。

值得一提的是该研究不仅对 Codex 进行了文本上的预训练,还在代码上进行了微调,使得其可以生成大规模解决数学问题的程序。

AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

预训练模型显示了来自在线存储库的数百万个代码示例。由于该模型的训练数据包括数百万自然语言单词和数百万行代码,因此它可以学习文本片段和代码片段之间的关系。​​

如下图所示该研究使用零样本和小样本学习来自动生成程序,该程序可以解决 81% 数学问题。然后他们使用 Codex 来解释生成的程序。生成的程序可以输出多种形式的答案。比如计算和描绘奇异值分解(SVD)的几何形状,不光给出正确答案,还能给出对应的解释!AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师应用神经网络 OpenAI Codex 来解决、解释和生成数学问题。​​

论文作者之一 Drori 解释说,许多数学问题可以用图或树来解决,但很难将文本编写的问题转化为这种表示形式。但是,由于该模型已经学习了文本和代码之间的关系,因此它可以将文本问题转换为代码,只需给出几个问题代码示例,然后运行代码就可以来回答问题。

「当你只使用文本提问题时,机器学习模型很难给出答案,即使答案可能在文本中,这项工作填补了代码和程序合成中缺失的部分。」Drori 说。

Drori 还补充说,这项工作是第一次解决本科数学问题,并将准确率从 8% 提高到 80% 以上。​​

添加上下文

其实将数学问题转化为编程任务并不总是那么简单。有些问题需要研究人员添加上下文,以便神经网络能够正确处理问题。一个学生在学习这门课程时会了解到这种背景知识,但除非研究人员明确说明,否则神经网络不具备这种背景知识。

例如,他们需要说明文本中的网络指的是神经网络而不是通信网络。或者他们可能需要告诉模型使用哪个编程包。他们可能还需要提供某些定义,例如在关于扑克牌的问题中,他们可能需要告诉模型每副牌包含 52 张牌。​​

该研究会自动将这些编程任务以及包含的上下文和示例输入到经过预训练和微调的神经网络,该神经网络会输出一个通常能产生正确答案的程序。80% 以上的问题都是正确的。

研究人员还使用他们的模型来生成问题,通过给神经网络一系列关于某个主题的数学问题,然后让它创建一个新的问题。例如,有关于水平线和垂直线的量子检测问题,它产生了关于对角线量子检测的新问题。因此,它不仅仅是通过替换现有问题中的值和变量来产生新问题。​​

人类提出的问题与机器生成的问题

研究人员通过向大学生展示机器生成的问题来测试这些问题。研究人员随机给学生们 10 道来自本科数学课程的问题;其中 5 个是由人类创造的,5 个是由机器生成的。

学生们无法判断机器生成的问题是由算法还是由人工生成的,他们对课程的难度和适当性给予了类似的评分。

AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师

不过,Drori 指出这项工作并不是为了取代人类教授。

「现在准确率已经达到 80%,但不会达到 100%。每当你解决了一个问题,就会有人提出一个更难的问题。但这项工作为人们开始用机器学习解决越来越难的问题开辟了领域。我们认为这将对高等教育产生巨大影响。」Drori 表示。​​

研究团队对他们方法的成功感到兴奋,并将工作扩展到处理数学证明上,同时他们还计划解决一些限制,目前,该模型无法使用可视化组件回答问题,也无法解决由于计算复杂性而难以计算的问题。

除了克服这些障碍外,该研究还致力于将模型扩展到数百门课程。有了这些课程,他们将生成更多的数据,以提高自动化程度,并提供对课程设计和课程的见解。

以上是AI几秒钟内解决大学数学问题,拿到80%多准确率,还充当出题老师的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:51CTO.COM。如有侵权,请联系admin@php.cn删除
AI内部部署的隐藏危险:治理差距和灾难性风险AI内部部署的隐藏危险:治理差距和灾难性风险Apr 28, 2025 am 11:12 AM

Apollo Research的一份新报告显示,先进的AI系统的不受检查的内部部署构成了重大风险。 在大型人工智能公司中缺乏监督,普遍存在,允许潜在的灾难性结果

构建AI测谎仪构建AI测谎仪Apr 28, 2025 am 11:11 AM

传统测谎仪已经过时了。依靠腕带连接的指针,打印出受试者生命体征和身体反应的测谎仪,在识破谎言方面并不精确。这就是为什么测谎结果通常不被法庭采纳的原因,尽管它曾导致许多无辜者入狱。 相比之下,人工智能是一个强大的数据引擎,其工作原理是全方位观察。这意味着科学家可以通过多种途径将人工智能应用于寻求真相的应用中。 一种方法是像测谎仪一样分析被审问者的生命体征反应,但采用更详细、更精确的比较分析。 另一种方法是利用语言标记来分析人们实际所说的话,并运用逻辑和推理。 俗话说,一个谎言会滋生另一个谎言,最终

AI是否已清除航空航天行业的起飞?AI是否已清除航空航天行业的起飞?Apr 28, 2025 am 11:10 AM

航空航天业是创新的先驱,它利用AI应对其最复杂的挑战。 现代航空的越来越复杂性需要AI的自动化和实时智能功能,以提高安全性,降低操作

观看北京的春季机器人比赛观看北京的春季机器人比赛Apr 28, 2025 am 11:09 AM

机器人技术的飞速发展为我们带来了一个引人入胜的案例研究。 来自Noetix的N2机器人重达40多磅,身高3英尺,据说可以后空翻。Unitree公司推出的G1机器人重量约为N2的两倍,身高约4英尺。比赛中还有许多体型更小的类人机器人参赛,甚至还有一款由风扇驱动前进的机器人。 数据解读 这场半程马拉松吸引了超过12,000名观众,但只有21台类人机器人参赛。尽管政府指出参赛机器人赛前进行了“强化训练”,但并非所有机器人均完成了全程比赛。 冠军——由北京类人机器人创新中心研发的Tiangong Ult

镜子陷阱:人工智能伦理和人类想象力的崩溃镜子陷阱:人工智能伦理和人类想象力的崩溃Apr 28, 2025 am 11:08 AM

人工智能以目前的形式并不是真正智能的。它擅长模仿和完善现有数据。 我们不是在创造人工智能,而是人工推断 - 处理信息的机器,而人类则

新的Google泄漏揭示了方便的Google照片功能更新新的Google泄漏揭示了方便的Google照片功能更新Apr 28, 2025 am 11:07 AM

一份报告发现,在谷歌相册Android版7.26版本的代码中隐藏了一个更新的界面,每次查看照片时,都会在屏幕底部显示一行新检测到的面孔缩略图。 新的面部缩略图缺少姓名标签,所以我怀疑您需要单独点击它们才能查看有关每个检测到的人员的更多信息。就目前而言,此功能除了谷歌相册已在您的图像中找到这些人之外,不提供任何其他信息。 此功能尚未上线,因此我们不知道谷歌将如何准确地使用它。谷歌可以使用缩略图来加快查找所选人员的更多照片的速度,或者可能用于其他目的,例如选择要编辑的个人。我们拭目以待。 就目前而言

加固芬特的指南 - 分析Vidhya加固芬特的指南 - 分析VidhyaApr 28, 2025 am 09:30 AM

增强者通过教授模型根据人类反馈进行调整来震撼AI的开发。它将监督的学习基金会与基于奖励的更新融合在一起,使其更安全,更准确,真正地帮助

让我们跳舞:结构化运动以微调我们的人类神经网让我们跳舞:结构化运动以微调我们的人类神经网Apr 27, 2025 am 11:09 AM

科学家已经广泛研究了人类和更简单的神经网络(如秀丽隐杆线虫中的神经网络),以了解其功能。 但是,出现了一个关键问题:我们如何使自己的神经网络与新颖的AI一起有效地工作

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热工具

EditPlus 中文破解版

EditPlus 中文破解版

体积小,语法高亮,不支持代码提示功能

记事本++7.3.1

记事本++7.3.1

好用且免费的代码编辑器

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)

Atom编辑器mac版下载

Atom编辑器mac版下载

最流行的的开源编辑器