豆包大模型披露评测成绩，较上一代'云雀”提升19%

豆包大模型披露评测成绩，较上一代'云雀”提升19%

Jun 06, 2024 pm 01:45 PM

产业

近日，豆包大模型在火山引擎原动力大会上正式发布。以超低价格促销大模型降价潮的同时，豆包的模型能力也引发行业关注。

在火山引擎的一份产品资料中，豆包模型团队发布了一期内部部分测试结果：在 MMLU、BBH、GSM8K、HumanEval 等11个行业主流的公开评测集上，Doubao-pro-4k 的总分为76.8分，相比上一代模型云雀Skylark2 的64.5分提升了19%。这也优于同期测试的其他国产模型。

此次评测在今年5月完成，主要包括豆包括通用模型Pro、云雀Skylark2以及内的九款国产大语言模型。除了云雀Skylark2以外，其他模型均为各家厂商最新发布的高级版本，通过API调用进行测试。

豆包大模型披露评测成绩，较上一代云雀”提升19%

图：豆包模型团队内部测试结果

根据评测结果显示，在评估代码能力的两个评测集"HumanEval"和"MBPP"上，豆包相比上一代模型提升了50%左右；在专业知识和指令遵循的评测集上，豆包分别获得33%和24%的性能提升，同时也是得分最高的国产模型。

除了数学能力、语言理解能力，以及综合评测集BCMMLU和CEval的评测上也有不错的表现。得分排在前三。综合11个公开评测集上的测试成绩，豆包通用模型-pro的总分为76.8分。根据OpenAI公布的测试成绩，GPT-4在这些评测集上的总分为80.1分，相比国产模型仍有一定领先优势。

据悉，豆包模型于5月15日刚刚推出，尚未加入到第三方机构测试中。预计未来一到两个月内，很多第三方评测机构将会陆续披露该模型的评测结果。与模型同名的AI助手"豆包"，官方公布的月活用户数已经达到2600万，用户可以自由体验测试。

此前，智源研究院公布了覆盖全球91个语言模型的评测报告。在偏重考察中文能力的主观评测中，云雀Skylark2排名第一，中文能力超过GPT-4。

豆包大模型披露评测成绩，较上一代云雀”提升19%

图：智源研究院语言模型评测结果（模型为4月20日之前的版本）

以上是豆包大模型披露评测成绩，较上一代'云雀”提升19%的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文内容由网友自发贡献，版权归原作者所有，本站不承担相应法律责任。如您发现有涉嫌抄袭侵权的内容，请联系admin@php.cn

及时工程中的思想图是什么

及时工程中的思想图是什么Apr 13, 2025 am 11:53 AM

介绍在迅速的工程中，“思想图”是指使用图理论来构建和指导AI的推理过程的新方法。与通常涉及线性S的传统方法不同

优化您的组织与Genai代理商的电子邮件营销

优化您的组织与Genai代理商的电子邮件营销Apr 13, 2025 am 11:44 AM

介绍恭喜！您经营一家成功的业务。通过您的网页，社交媒体活动，网络研讨会，会议，免费资源和其他来源，您每天收集5000个电子邮件ID。下一个明显的步骤是

Apache Pinot实时应用程序性能监视

Apache Pinot实时应用程序性能监视Apr 13, 2025 am 11:40 AM

介绍在当今快节奏的软件开发环境中，确保最佳应用程序性能至关重要。监视实时指标，例如响应时间，错误率和资源利用率可以帮助MAIN

Chatgpt击中了10亿用户？ Openai首席执行官说：'短短几周内翻了一番

Chatgpt击中了10亿用户？ Openai首席执行官说：'短短几周内翻了一番Apr 13, 2025 am 11:23 AM

“您有几个用户？”他扮演。阿尔特曼回答说：“我认为我们上次说的是每周5亿个活跃者，而且它正在迅速增长。” “你告诉我，就像在短短几周内翻了一番，”安德森继续说道。 “我说那个私人

pixtral -12b：Mistral AI＆＃039;第一个多模型模型 - 分析Vidhya

pixtral -12b：Mistral AI＆＃039;第一个多模型模型 - 分析VidhyaApr 13, 2025 am 11:20 AM

介绍 Mistral发布了其第一个多模式模型，即Pixtral-12b-2409。该模型建立在Mistral的120亿参数Nemo 12B之上。是什么设置了该模型？现在可以拍摄图像和Tex

生成AI应用的代理框架 - 分析Vidhya

生成AI应用的代理框架 - 分析VidhyaApr 13, 2025 am 11:13 AM

想象一下，拥有一个由AI驱动的助手，不仅可以响应您的查询，还可以自主收集信息，执行任务甚至处理多种类型的数据（TEXT，图像和代码）。听起来有未来派？在这个a

生成AI在金融部门的应用

生成AI在金融部门的应用Apr 13, 2025 am 11:12 AM

介绍金融业是任何国家发展的基石，因为它通过促进有效的交易和信贷可用性来推动经济增长。交易的便利和信贷

在线学习和被动攻击算法指南

在线学习和被动攻击算法指南Apr 13, 2025 am 11:09 AM

介绍数据是从社交媒体，金融交易和电子商务平台等来源的前所未有的速度生成的。处理这种连续的信息流是一个挑战，但它提供了

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么（黄色晶体）

3 周前By尊渡假赌尊渡假赌尊渡假赌

R.E.P.O.最佳图形设置

3 周前By尊渡假赌尊渡假赌尊渡假赌

刺客信条阴影：贝壳谜语解决方案

2 周前ByDDD

R.E.P.O.如果您听不到任何人，如何修复音频

3 周前By尊渡假赌尊渡假赌尊渡假赌

WWE 2K25：如何解锁Myrise中的所有内容

4 周前By尊渡假赌尊渡假赌尊渡假赌

热工具

VSCode Windows 64位下载

VSCode Windows 64位下载

微软推出的免费、功能强大的一款IDE编辑器

SublimeText3 Linux新版

SublimeText3 Linux新版

SublimeText3 Linux最新版

ZendStudio 13.5.1 Mac

ZendStudio 13.5.1 Mac

功能强大的PHP集成开发环境

SublimeText3 英文版

SublimeText3 英文版

推荐：为Win版本，支持代码提示！

Atom编辑器mac版下载

Atom编辑器mac版下载

最流行的的开源编辑器

热门话题

gmail邮箱登陆入口在哪里

7486

15

1377

52

steam的账户名称是什么格式

77

11

win11激活密钥永久

51

19

NYT连接提示和答案

19

38