搜索
首页科技周边人工智能开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单

能打得过GPT-4的开源模型出现了!

大模型竞技场最新战报:

1040亿参数开源模型Command R 攀升至第6位,与GPT-4-0314打成平手,超过了GPT-4-0613。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

这也是第一个在大模型竞技场上击败GPT-4的开放权重模型。

大模型竞技场,可是大神Karpathy口中唯二信任的测试基准之一。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

Command R 来自AI独角兽Cohere。这家大模型创业公司的联合创始人兼CEO,正是Transformer最年轻作者Aidan Gomez(简称割麦子)。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

这份战报一出,又掀起了一波大模型社区的热烈讨论。

大家伙儿兴奋的理由很简单:基础大模型卷了一整年,没想到在2024年格局还在不断地发展变化。

HuggingFace联合创始人Thomas Wolf就说:

最近大模型竞技场上的情况发生了巨大的变化:

Anthropic的Claude 3 opus在闭源模型中独占鳌头。

Cohere的Command R 则成为了开源模型中的最强者。

没想到,2024年在开源和闭源两条路线上,人工智能团队的发展都如此之快。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

另外,Cohere机器学习总监Nils Reimers还指出了值得关注的一点:

Command R 最大的特色是对内置RAG(检索增强生成)进行了全面优化,而在大模型竞技场中,RAG这样的外挂能力并未纳入测试。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

RAG优化模型登上开源王座

在Cohere官方定位中,Command R 是一个“RAG优化模型”。

就是说,这个1040亿参数的大模型主要针对检索增强生成技术进行了深度优化,以减少幻觉的产生,更适配于企业级工作负载。

和此前推出的Command R一样,Command R 的上下文窗口长度是128k。

此外,Command R 还具备以下特点:

  • 覆盖10 种语言,包括英语、中文、法语、德语等;
  • 能使用工具完成复杂业务流程的自动化

从测试结果来看,在多语种、RAG和工具使用这三个维度上,Command R 都达到了GPT-4 turbo的水平。

但在输入成本方面,Command R 的价格仅为GPT-4 turbo的1/3。

输出成本方面,Command R 则是GPT-4 turbo的1/2。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

正是这点引发了不少网友的关注:

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

不过,尽管在大模型竞技场这种人类主观评测上表现抢眼,还是有网友甩出了一些不同观点。

在HumanEval上,Command R 的代码能力就连GPT-3.5都没打过,在两组测试中分别排在32位和33位。

最新版GPT-4 turbo则没有悬念地拿下了第一。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

另外,我们也在最近刚登上正经论文的弱智吧benchmark上简单测试了一下Command R 的中文能力。

开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单图片

你给打个分?

需要说明的是,Command R 的开源只面向学术研究,并不能免费商用。

One More Thing

最后的最后,还是多聊一嘴割麦子小哥。

Aidan Gomez,Transformer圆桌骑士中最年轻的一位,加入研究团队时只是个本科生——

不过,是在多伦多大学读大三时就加入了Hinton实验室的那种。

2018年,割麦子被牛津大学录取,开始像他的论文搭子们那样攻读CS博士学位。

但在2019年,随着Cohere的创立,他最终选择退学加入AI创业的浪潮。

Cohere主要是为企业提供大模型解决方案,目前估值达到了22亿美元。

参考链接:
[1]https://www.php.cn/link/3be14122a3c78d9070cae09a16adcbb1[2]https://www.php.cn/link/93fc5aed8c051ce4538e052cfe9f8692

以上是开源模型首胜GPT-4!竞技场最新战报引热议,Karpathy:这是我唯二信任的榜单的详细内容。更多信息请关注PHP中文网其他相关文章!

声明
本文转载于:51CTO.COM。如有侵权,请联系admin@php.cn删除
阅读AI索引2025:AI是您的朋友,敌人还是副驾驶?阅读AI索引2025:AI是您的朋友,敌人还是副驾驶?Apr 11, 2025 pm 12:13 PM

斯坦福大学以人为本人工智能研究所发布的《2025年人工智能指数报告》对正在进行的人工智能革命进行了很好的概述。让我们用四个简单的概念来解读它:认知(了解正在发生的事情)、欣赏(看到好处)、接纳(面对挑战)和责任(弄清我们的责任)。 认知:人工智能无处不在,并且发展迅速 我们需要敏锐地意识到人工智能发展和传播的速度有多快。人工智能系统正在不断改进,在数学和复杂思维测试中取得了优异的成绩,而就在一年前,它们还在这些测试中惨败。想象一下,人工智能解决复杂的编码问题或研究生水平的科学问题——自2023年

开始使用Meta Llama 3.2 -Analytics Vidhya开始使用Meta Llama 3.2 -Analytics VidhyaApr 11, 2025 pm 12:04 PM

Meta的Llama 3.2:多模式和移动AI的飞跃 Meta最近公布了Llama 3.2,这是AI的重大进步,具有强大的视觉功能和针对移动设备优化的轻量级文本模型。 以成功为基础

AV字节:Meta' llama 3.2,Google的双子座1.5等AV字节:Meta' llama 3.2,Google的双子座1.5等Apr 11, 2025 pm 12:01 PM

本周的AI景观:进步,道德考虑和监管辩论的旋风。 OpenAI,Google,Meta和Microsoft等主要参与者已经释放了一系列更新,从开创性的新车型到LE的关键转变

与机器交谈的人类成本:聊天机器人真的可以在乎吗?与机器交谈的人类成本:聊天机器人真的可以在乎吗?Apr 11, 2025 pm 12:00 PM

连接的舒适幻想:我们在与AI的关系中真的在蓬勃发展吗? 这个问题挑战了麻省理工学院媒体实验室“用AI(AHA)”研讨会的乐观语气。事件展示了加油

了解Python的Scipy图书馆了解Python的Scipy图书馆Apr 11, 2025 am 11:57 AM

介绍 想象一下,您是科学家或工程师解决复杂问题 - 微分方程,优化挑战或傅立叶分析。 Python的易用性和图形功能很有吸引力,但是这些任务需要强大的工具

3种运行Llama 3.2的方法-Analytics Vidhya3种运行Llama 3.2的方法-Analytics VidhyaApr 11, 2025 am 11:56 AM

Meta's Llama 3.2:多式联运AI强力 Meta的最新多模式模型Llama 3.2代表了AI的重大进步,具有增强的语言理解力,提高的准确性和出色的文本生成能力。 它的能力t

使用dagster自动化数据质量检查使用dagster自动化数据质量检查Apr 11, 2025 am 11:44 AM

数据质量保证:与Dagster自动检查和良好期望 保持高数据质量对于数据驱动的业务至关重要。 随着数据量和源的增加,手动质量控制变得效率低下,容易出现错误。

大型机在人工智能时代有角色吗?大型机在人工智能时代有角色吗?Apr 11, 2025 am 11:42 AM

大型机:AI革命的无名英雄 虽然服务器在通用应用程序上表现出色并处理多个客户端,但大型机是专为关键任务任务而建立的。 这些功能强大的系统经常在Heavil中找到

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么(黄色晶体)
3 周前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.最佳图形设置
3 周前By尊渡假赌尊渡假赌尊渡假赌
R.E.P.O.如果您听不到任何人,如何修复音频
3 周前By尊渡假赌尊渡假赌尊渡假赌
WWE 2K25:如何解锁Myrise中的所有内容
3 周前By尊渡假赌尊渡假赌尊渡假赌

热工具

MinGW - 适用于 Windows 的极简 GNU

MinGW - 适用于 Windows 的极简 GNU

这个项目正在迁移到osdn.net/projects/mingw的过程中,你可以继续在那里关注我们。MinGW:GNU编译器集合(GCC)的本地Windows移植版本,可自由分发的导入库和用于构建本地Windows应用程序的头文件;包括对MSVC运行时的扩展,以支持C99功能。MinGW的所有软件都可以在64位Windows平台上运行。

PhpStorm Mac 版本

PhpStorm Mac 版本

最新(2018.2.1 )专业的PHP集成开发工具

SublimeText3汉化版

SublimeText3汉化版

中文版,非常好用

SublimeText3 英文版

SublimeText3 英文版

推荐:为Win版本,支持代码提示!

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境