大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

Apr 23, 2024 pm 03:28 PM

bootstrap版本gpt-4排列llama 3

关于Llama 3，又有测试结果新鲜出炉——

大模型评测社区LMSYS发布了一份大模型排行榜单，Llama 3位列第五，英文单项与GPT-4并列第一。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

不同于其他Benchmark，这份榜单的依据是模型一对一battle，由全网测评者自行命题并打分。

最终，Llama 3取得了榜单中的第五名，排在前面的是GPT-4的三个不同版本，以及Claude 3超大杯Opus。

而在英文单项榜单中，Llama 3反超了Claude，与GPT-4打成了平手。

对于这一结果，Meta的首席科学家LeCun十分高兴，转发了推文并留下了一个“Nice”。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

PyTorch之父Soumith Chintala也激动地表示，这样的成果令人难以置信，对Meta感到骄傲。

Llama 3的400B版本还没出来，单靠70B参数就获得了第五名……
我还记得去年三月GPT-4发布的时候，达到与之相同的表现几乎是一件不可能的事。
……
现在AI的普及化实在是令人难以置信，我对Meta AI的同仁们做出这样的成功感到非常骄傲。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

那么，这份榜单具体展示了什么样的结果呢？

近90个模型对战75万轮

截至最新榜单发布，LMSYS共收集了近75万次大模型solo对战结果，涉及的模型达到了89款。

其中，Llama 3参与过的有1.27万次，GPT-4则有多个不同版本，最多的参与了6.8万次。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

下面这张图展示了部分热门模型的比拼次数和胜率，图中的两项指标都没有统计平局的次数。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

榜单方面，LMSYS分成了总榜和多个子榜单，GPT-4-Turbo位列第一，与之并列的是早一些的1106版本，以及Claude 3超大杯Opus。

另一个版本（0125）的GPT-4则位列其后，紧接着就是Llama 3了。

不过比较有意思的是，较新一些的0125，表现还不如老版本1106。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

而在英文单项榜单中，Llama 3的成绩直接和两款GPT-4打成了平手，还反超了0125版本。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

中文能力排行榜的第一名则由Claude 3 Opus和GPT-4-1106共享，Llama 3则已经排到了20名开外。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

除了语言能力之外，榜单中还设置了长文本和代码能力排名，Llama 3也都名列前茅。

不过，LMSYS的“游戏规则”又具体是什么样的呢？

人人都可参与的大模型评测

这是一个人人都可以参与的大模型测试，题目和评价标准，都由参与者自行决定。

而具体的“竞技”过程，又分成了battle和side-by-side两种模式。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

battle模式下，在测试界面输入好问题之后，系统会随机调用库中的两个模型，而测试者并不知道系统到底抽中了谁，界面中只显示“模型A”和“模型B”。

在模型输出答案后，测评人需要选择哪个更好，或者是平手，当然如果模型的表现都不符合预期，也有相应的选项。

只有在做出选择之后，模型的身份才会被揭开。

side-by-side则是由用户选择指定的模型来PK，其余测试流程与battle模式相同

不过，只有battle的匿名模式下的投票结果才会被统计，且在对话过程中模型不小心暴露身份就会导致结果失效。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

按照各个模型对其他模型的Win Rate，可以绘制出这样的图像：

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

△示意图，较早版本

而最终的排行榜，是利用Win Rate数据，通过Elo评价系统换算成分数得到的。

Elo评价系统是一种计算玩家相对技能水平的方法，由美国物理学教授Arpad Elo设计。

具体到LMSYS，在初始条件下，所有模型的评分（R）都被设定为1000，然后根据这样的公式计算出期待胜率（E）。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

随着测试的不断进行，会根据实际得分（S）对评分进行修正，S有1、0和0.5三种取值，分别对应获胜、失败和平手三种情况。

修正算法如下式所示，其中K为系数，需要测试者根据实际情况调整。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

最终将所有有效数据纳入计算后，就得到了模型的Elo评分。

不过实际操作过程中，LMSYS团队发现这种算法的稳定性存在不足，于是又采用了统计学方法进行了修正。

他们利用Bootstrap方法进行重复采样，得到了更稳定的结果，并估计了置信度区间。

最终修正后的Elo评分，就成了榜单中的排列依据。

One More Thing

Llama 3已经可以在大模型推理平台Groq（不是马斯克的Grok）上跑了。

这个平台的最大亮点就是“快”，之前用Mixtral模型跑出过每秒近500 token的速度。

跑起Llama 3，也是相当迅速，实测70B可以跑到每秒约300 Token，8B版本更是接近了800。

大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五图片

参考链接：
[1]https://lmsys.org/blog/2023-05-03-arena/
[2]https://chat.lmsys.org/?leaderboard
[3]https://twitter.com/lmsysorg/status/1782483699449332144

以上是大模型一对一战斗75万轮，GPT-4夺冠，Llama 3位列第五的详细内容。更多信息请关注PHP中文网其他相关文章！

声明

本文转载于：51CTO.COM。如有侵权，请联系admin@php.cn删除

最新的最佳及时工程技术的年度汇编

最新的最佳及时工程技术的年度汇编Apr 10, 2025 am 11:22 AM

对于那些可能是我专栏新手的人，我广泛探讨了AI的最新进展，包括体现AI，AI推理，AI中的高科技突破，及时的工程，AI培训，AI，AI RE RE等主题

欧洲的AI大陆行动计划：Gigafactories，Data Labs和Green AI

欧洲的AI大陆行动计划：Gigafactories，Data Labs和Green AIApr 10, 2025 am 11:21 AM

欧洲雄心勃勃的AI大陆行动计划旨在将欧盟确立为人工智能的全球领导者。一个关键要素是建立了AI Gigafactories网络，每个网络都有大约100,000个高级AI芯片 - 2倍的自动化合物的四倍

微软的直接代理商故事是否足以创造更多的粉丝？

微软的直接代理商故事是否足以创造更多的粉丝？Apr 10, 2025 am 11:20 AM

微软对AI代理申请的统一方法：企业的明显胜利微软最近公告的新AI代理能力清晰而统一的演讲给人留下了深刻的印象。与许多技术公告陷入困境不同

向员工出售AI策略：Shopify首席执行官的宣言

向员工出售AI策略：Shopify首席执行官的宣言Apr 10, 2025 am 11:19 AM

Shopify首席执行官TobiLütke最近的备忘录大胆地宣布AI对每位员工的基本期望是公司内部的重大文化转变。这不是短暂的趋势。这是整合到P中的新操作范式

IBM启动具有完整AI集成的Z17大型机

IBM启动具有完整AI集成的Z17大型机Apr 10, 2025 am 11:18 AM

IBM的Z17大型机：集成AI用于增强业务运营上个月，在IBM的纽约总部，我收到了Z17功能的预览。以Z16的成功为基础（于2022年推出并证明持续的收入增长

5 Chatgpt提示取决于别人并完全相信自己

5 Chatgpt提示取决于别人并完全相信自己Apr 10, 2025 am 11:17 AM

解锁不可动摇的信心，消除了对外部验证的需求！这五个CHATGPT提示将指导您完全自力更生和自我感知的变革转变。只需复制，粘贴和自定义包围

AI与您的思想危险相似

AI与您的思想危险相似Apr 10, 2025 am 11:16 AM

人工智能安全与研究公司 Anthropic 最近的一项[研究]开始揭示这些复杂过程的真相，展现出一种令人不安地与我们自身认知领域相似的复杂性。自然智能和人工智能可能比我们想象的更相似。窥探内部：Anthropic 可解释性研究 Anthropic 进行的研究的新发现代表了机制可解释性领域的重大进展，该领域旨在反向工程 AI 的内部计算——不仅仅观察 AI 做了什么，而是理解它在人工神经元层面如何做到这一点。想象一下，试图通过绘制当有人看到特定物体或思考特定想法时哪些神经元会放电来理解大脑。A

龙翼展示高通的边缘动力

龙翼展示高通的边缘动力Apr 10, 2025 am 11:14 AM

高通的龙翼：企业和基础设施的战略飞跃高通公司通过其新的Dragonwing品牌在全球范围内积极扩展其范围，以全球为目标。这不仅仅是雷布兰

See all articles

热AI工具

Undresser.AI Undress

Undresser.AI Undress

人工智能驱动的应用程序，用于创建逼真的裸体照片

AI Clothes Remover

AI Clothes Remover

用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool

Undress AI Tool

免费脱衣服图片

Clothoff.io

Clothoff.io

AI脱衣机

AI Hentai Generator

AI Hentai Generator

免费生成ai无尽的。

热门文章

R.E.P.O.能量晶体解释及其做什么（黄色晶体）

3 周前By尊渡假赌尊渡假赌尊渡假赌

R.E.P.O.最佳图形设置

3 周前By尊渡假赌尊渡假赌尊渡假赌

刺客信条阴影：贝壳谜语解决方案

2 周前ByDDD

R.E.P.O.如果您听不到任何人，如何修复音频

3 周前By尊渡假赌尊渡假赌尊渡假赌

WWE 2K25：如何解锁Myrise中的所有内容

3 周前By尊渡假赌尊渡假赌尊渡假赌

热工具

Atom编辑器mac版下载

Atom编辑器mac版下载

最流行的的开源编辑器

适用于 Eclipse 的 SAP NetWeaver 服务器适配器

适用于 Eclipse 的 SAP NetWeaver 服务器适配器

将Eclipse与SAP NetWeaver应用服务器集成。

禅工作室 13.0.1

禅工作室 13.0.1

功能强大的PHP集成开发环境

VSCode Windows 64位下载

VSCode Windows 64位下载

微软推出的免费、功能强大的一款IDE编辑器

ZendStudio 13.5.1 Mac

ZendStudio 13.5.1 Mac

功能强大的PHP集成开发环境

热门话题

gmail邮箱登陆入口在哪里

7455

15

1375

52

steam的账户名称是什么格式

77

11

win11激活密钥永久

40

19

NYT连接提示和答案

14

9