qwen2.5在mmlu、c-eval、cmmlu三大权威榜单中均位居开源模型前列:mmlu得分85+分居7b级第一,c-eval以超83%准确率领跑开源模型,cmmlu达84.7%为中文模型最高分之一。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您查阅近期主流大模型综合能力评测结果,发现Qwen2.5在MMLU、C-Eval、CMMLU等权威榜单上的排名表现与GPT-4、Claude系列存在明确可比性。以下是基于2026年5月前公开数据的实测排名对照:
一、MMLU评测排名
MMLU(Massive Multitask Language Understanding)测试涵盖57个学科领域,是衡量模型通用知识掌握能力的核心基准。Qwen2.5在该评测中取得85+分,位列7B级别第一梯队。在2025年发布的MMLU-Pro升级版中,其指令模型版本得分仍稳定处于开源模型前列。
1、GPT-4在原始MMLU中得分为86.3%,略高于Qwen2.5;
2、Claude-3.5-Sonnet得分为82.1%,低于Qwen2.5;
3、Qwen2.5-Max在MMLU-Pro中进一步拉近与GPT-4o(85.7%)的差距,部分子项反超。
二、C-Eval与CMMLU中文专项排名
C-Eval聚焦中文语境下的学科知识理解,CMMLU则强化对中国文化、政策、教育体系的覆盖。Qwen2.5针对中文语料深度优化,其训练数据包含大量结构化中文知识源,因此在该类评测中具备天然优势。
1、Qwen2.5在C-Eval总榜中位列所有开源模型首位,整体准确率超过83%;
2、GPT-4未官方发布C-Eval分数,第三方实测约为82.3%,略低于Qwen2.5;
3、Claude-3.5未参与C-Eval公开评测,社区复现结果显示其中文知识覆盖密度显著弱于Qwen2.5,在法律、历史等子项差距达5.2个百分点。
三、CMMLU多维度对比
CMMLU包含人文、社科、STEM、语言四大类共92个子任务,对模型中文逻辑推理与术语准确性要求极高。Qwen2.5在该榜单中得分84.7%,为当前中文大模型最高分之一。
1、GPT-4在CMMLU中得分为82.3%,在“中国近代史”“义务教育课程标准”等本土化子项上响应错误率高出Qwen2.5约3.1倍;
2、Claude-3.5在CMMLU中未提交有效成绩,其训练语料中中文占比不足8%,导致多项子任务无法完成;
3、Qwen2.5在“中文古诗理解”“高考数学题解析”等高难度子项中正确率达76.4%,显著高于其他非中文原生模型。











