qwen2.5-coder-32b-instruct在humaneval基准得分为92.7%,为开源模型最高;在mbpp基准得分为90.2%,同样刷新开源历史最佳。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您查询千问Qwen2.5-Coder在权威代码生成基准测试中的具体得分,则需依据其官方公开的评测数据。以下是该模型在HumanEval和MBPP两项关键基准上的实测结果:
一、HumanEval基准得分
HumanEval用于评估模型在给定函数签名和文档字符串条件下生成正确可执行代码的能力,侧重于功能正确性与逻辑完整性。Qwen2.5-Coder-32B-Instruct在此基准上取得92.7%的通过率,该分数为当前开源代码模型中的最高纪录。
二、MBPP基准得分
MBPP(Mostly Basic Python Problems)聚焦于自然语言描述到短小Python程序的准确转换,强调语义理解与基础编程能力。Qwen2.5-Coder-32B-Instruct在该基准上获得90.2%的准确率,同样刷新开源模型历史最佳表现。











