搜索
首页科技周边人工智能一招分辨刷榜作弊大模型,博士小哥开源AI数学'照妖镜”

如今很多大模型都声称擅长数学,谁有真才实学?谁是靠背测试题“作弊”的?

今年,有人在匈牙利全国数学期末考试刚刚公布的题目上进行了一次全面测试

很多模型一下子就“现原形”了。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

先看绿色部分,这些大模型在经典数学测试集GSM8k和全新卷子上取得的成绩差不多,共同组成参照标准

再看红色部分,在GSM8K上的成绩显着高于同参数规模的大模型,一到全新卷子上成绩却明显下降,与同规模大模型差不多了。

研究者把他们归类为“疑似或已知在GSM8k上训练过”

有人看过这项测试后表示,应该开始对那些从未见过的题目进行评测了

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

有些人认为,这种测试和每个人对大型模型实际使用的经验,是目前唯一可靠的评估方法

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

马斯克Grok仅次于GPT-4,开源Llemma成绩出色

测试者Keiran Paster是多伦多大学博士生、谷歌学生研究者,也是测试中Lemma大模型的作者之一。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

让大模型考匈牙利全国高中数学期末考试,这招出自马斯克的xAI

为了排除xAI的Grok大模型无意中在网络数据中见过测试题的问题,除了几个常见的测试集,还额外进行了这项测试

这个考试今年5月底才考完,当前大模型基本没机会见过这套试题。

xAI发布时还公布了的GPT-3.5、GPT-4、Claude 2的成绩作为比较。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

在这组数据的基础上,Paster进行了进一步的测试,测试的对象是多个生成数学能力强的开源模型

并把测试题目、测试脚本、各模型回答结果都开源在了Huggingface上,供大家检验以及进一步测试其他模型。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

结果来看,GPT-4和Claude-2组成第一梯队,在GSM8k和新卷子上成绩都很高。

虽然这不代表GPT-4和Claude 2的训练数据中完全没有GSM8k的泄露题,但至少它俩泛化能力不错、能做对新题,就不计较了。

接下来,马斯克xAI的Grok-0(33B)和Grok-1(未公布参数规模)表现都不错。

Grok-1是“未作弊组”里成绩最高的,新卷子成绩甚至高过Claude 2。

Grok-0在GSM8k上的表现接近GPT3.5-Turbo,新卷子上略差一些。

除了上述几个封闭模型外,测试中的其他模型都是开源的

Code Llama系列是Meta自己在Llama 2基础上微调的,主打根据自然语言生成代码,现在看来数学能力比同规模的模型稍差

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

在Code Llama的基础上,多所大学和研究机构共同推出Llemma系列,并由EleutherAI开源。

团队从科学论文、包含数学的网络数据和数学代码中收集了Proof-Pile-2数据集,训练后的Llemma能使用工具和做形式定理证明,无需任何进一步的微调。

在新的卷子上,Llemma 34B的表现接近于GPT-3.5 Turbo水平

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

Mistral系列则是法国AI独角兽Mistral AI训练的,Apache2.0开源协议比Llama更宽松,成为羊驼家族之后最受开源社区欢迎的基础模型。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

“过拟合组”里的OpenChat 3.5MetaMath Mistral都是基于Mistral生态微调而来。

MetaMathMAmmoTH Code则是基于Code Llama生态。

选择在实际业务中采用开源大模型的人需要小心避开这一组,因为它们很可能只是为了刷榜而表现出色,但实际能力可能不如同规模的其他模型强

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

不少网友都对Paster这项试验表示感谢,认为这正是了解模型实际情况所需要的。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

有些人表达了担忧:

从这一天起,所有训练大模型的人都会加入匈牙利历年数学考试题。

同时他认为,解决办法可能是有一家拥有专有测试的专门大模型评估公司

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

另一项提议是建立一个逐年更新的测试基准,来缓和过度拟合问题。

一招分辨刷榜作弊大模型,博士小哥开源AI数学照妖镜”

以上是一招分辨刷榜作弊大模型,博士小哥开源AI数学'照妖镜”的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:51CTO.COM。如有侵权,请联系admin@php.cn删除
无法使用chatgpt!解释可以立即测试的原因和解决方案[最新2025]无法使用chatgpt!解释可以立即测试的原因和解决方案[最新2025]May 14, 2025 am 05:04 AM

ChatGPT无法访问?本文提供多种实用解决方案!许多用户在日常使用ChatGPT时,可能会遇到无法访问或响应缓慢等问题。本文将根据不同情况,逐步指导您解决这些问题。 ChatGPT无法访问的原因及初步排查 首先,我们需要确定问题是出在OpenAI服务器端,还是用户自身网络或设备问题。 请按照以下步骤进行排查: 步骤1:检查OpenAI官方状态 访问OpenAI Status页面 (status.openai.com),查看ChatGPT服务是否正常运行。如果显示红色或黄色警报,则表示Open

计算ASI的风险始于人类的思想计算ASI的风险始于人类的思想May 14, 2025 am 05:02 AM

2025年5月10日,麻省理工学院物理学家Max Tegmark告诉《卫报》,AI实验室应在释放人工超级智能之前模仿Oppenheimer的三位一体测试演算。 “我的评估是'康普顿常数',这是一场比赛的可能性

易于理解的解释如何编写和撰写歌词和推荐工具易于理解的解释如何编写和撰写歌词和推荐工具May 14, 2025 am 05:01 AM

AI音乐创作技术日新月异,本文将以ChatGPT等AI模型为例,详细讲解如何利用AI辅助音乐创作,并辅以实际案例进行说明。我们将分别介绍如何通过SunoAI、Hugging Face上的AI jukebox以及Python的Music21库进行音乐创作。 通过这些技术,每个人都能轻松创作原创音乐。但需注意,AI生成内容的版权问题不容忽视,使用时务必谨慎。 让我们一起探索AI在音乐领域的无限可能! OpenAI最新AI代理“OpenAI Deep Research”介绍: [ChatGPT]Ope

什么是chatgpt-4?对您可以做什么,定价以及与GPT-3.5的差异的详尽解释!什么是chatgpt-4?对您可以做什么,定价以及与GPT-3.5的差异的详尽解释!May 14, 2025 am 05:00 AM

ChatGPT-4的出现,极大地拓展了AI应用的可能性。相较于GPT-3.5,ChatGPT-4有了显着提升,它具备强大的语境理解能力,还能识别和生成图像,堪称万能的AI助手。在提高商业效率、辅助创作等诸多领域,它都展现出巨大的潜力。然而,与此同时,我们也必须注意其使用上的注意事项。 本文将详细解读ChatGPT-4的特性,并介绍针对不同场景的有效使用方法。文中包含充分利用最新AI技术的技巧,敬请参考。 OpenAI发布的最新AI代理,“OpenAI Deep Research”详情请点击下方链

解释如何使用chatgpt应用程序!日本支持和语音对话功能解释如何使用chatgpt应用程序!日本支持和语音对话功能May 14, 2025 am 04:59 AM

CHATGPT应用程序:与AI助手释放您的创造力!初学者指南 ChatGpt应用程序是一位创新的AI助手,可处理各种任务,包括写作,翻译和答案。它是一种具有无限可能性的工具,可用于创意活动和信息收集。 在本文中,我们将以一种易于理解的方式解释初学者,从如何安装chatgpt智能手机应用程序到语音输入功能和插件等应用程序所独有的功能,以及在使用该应用时要牢记的要点。我们还将仔细研究插件限制和设备对设备配置同步

如何使用中文版Chatgpt?注册程序和费用的说明如何使用中文版Chatgpt?注册程序和费用的说明May 14, 2025 am 04:56 AM

ChatGPT中文版:解锁中文AI对话新体验 ChatGPT风靡全球,您知道它也提供中文版本吗?这款强大的AI工具不仅支持日常对话,还能处理专业内容,并兼容简体中文和繁体中文。无论是中国地区的使用者,还是正在学习中文的朋友,都能从中受益。 本文将详细介绍ChatGPT中文版的使用方法,包括账户设置、中文提示词输入、过滤器的使用、以及不同套餐的选择,并分析潜在风险及应对策略。此外,我们还将对比ChatGPT中文版和其他中文AI工具,帮助您更好地了解其优势和应用场景。 OpenAI最新发布的AI智能

5 AI代理神话,您需要停止相信5 AI代理神话,您需要停止相信May 14, 2025 am 04:54 AM

这些可以将其视为生成AI领域的下一个飞跃,这为我们提供了Chatgpt和其他大型语言模型聊天机器人。他们可以代表我们采取行动,而不是简单地回答问题或产生信息

易于理解使用Chatgpt创建和管理多个帐户的非法性的解释易于理解使用Chatgpt创建和管理多个帐户的非法性的解释May 14, 2025 am 04:50 AM

使用chatgpt有效的多个帐户管理技术|关于如何使用商业和私人生活的详尽解释! Chatgpt在各种情况下都使用,但是有些人可能担心管理多个帐户。本文将详细解释如何为ChatGpt创建多个帐户,使用时该怎么做以及如何安全有效地操作它。我们还介绍了重要的一点,例如业务和私人使用差异,并遵守OpenAI的使用条款,并提供指南,以帮助您安全地利用多个帐户。 Openai

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

Video Face Swap

Video Face Swap

使用我们完全免费的人工智能换脸工具轻松在任何视频中换脸!

热门文章

热工具

SublimeText3 Linux新版

SublimeText3 Linux新版

SublimeText3 Linux最新版

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

Dreamweaver CS6

Dreamweaver CS6

视觉化网页开发工具

VSCode Windows 64位 下载

VSCode Windows 64位 下载

微软推出的免费、功能强大的一款IDE编辑器

SublimeText3 Mac版

SublimeText3 Mac版

神级代码编辑软件(SublimeText3)