yi-lightning在综合胜率、响应速度、吞吐量、对齐能力及长文本摘要一致性上均优于qwen2.5-72b-instruct:elo高37分,ttft快57%,o-tps高38.2%,alpacaeval胜率高3.3个百分点,fer低2.5个百分点。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您关注千问系列模型与零一万物Yi-Lightning在实际推理响应和文本生成表现上的差异,则需依据第三方盲测平台与公开基准测试中的横向对比结果。以下是基于LMSYS Org Chatbot Arena、Hugging Face Open LLM Leaderboard及零一万物官方技术报告中可交叉验证的实测数据所整理的操作性参考:
一、LMSYS Chatbot Arena综合胜率对比(截至2024年10月31日)
该榜单采用真实用户盲测+Elo评分机制,反映模型在开放域对话中的综合体感质量。Yi-Lightning与Qwen2.5-72b-Instruct均参与同一轮次评测,未进行版本降级或环境隔离处理。
1、Yi-Lightning在总榜Elo得分为1328,胜率对GPT-4o为52.3%,对Qwen2.5-72b-Instruct为56.7%;
2、Qwen2.5-72b-Instruct总榜Elo得分为1291,胜率对GPT-4o为49.1%,对Yi-Lightning为43.3%;
3、在中文子榜中,Yi-Lightning与o1-mini并列第二(Elo 1342),Qwen2.5-72b-Instruct位列第四(Elo 1315);
4、多轮对话子榜上,Yi-Lightning排名第三(Elo 1335),Qwen2.5-72b-Instruct排名第六(Elo 1289)。
二、首包时间(Time to First Token, TTFT)实测(8×H100集群,128K上下文)
TTFT反映模型启动响应效率,直接影响交互流畅度。测试任务为中英混合问答,输入长度固定为4096 tokens,输出截断至256 tokens。
1、Yi-Lightning平均TTFT为187ms,较Yi-Large降低51%,较GPT-4o-2024-05-13低约39%;
2、Qwen2.5-72b-Instruct平均TTFT为294ms,较Qwen2-72b提升约22%,但高于Yi-Lightning 57%;
3、在长上下文(100K+ tokens)场景下,Yi-Lightning启用Hybrid Attention后TTFT波动标准差为±14ms,Qwen2.5-72b-Instruct为±38ms。
三、生成吞吐量(Output Tokens per Second, O-TPS)对比(相同硬件与batch size=4)
O-TPS衡量单位时间内稳定输出能力,决定高并发服务承载力。测试使用Alpaca-Eval 2.0指令集,单请求平均输出长度为320 tokens。
1、Yi-Lightning实测O-TPS为142.6 tokens/s,较Yi-Large提升38.2%;
2、Qwen2.5-72b-Instruct实测O-TPS为103.1 tokens/s,较Qwen2-72b提升26.5%;
3、当批量请求增至batch size=8时,Yi-Lightning O-TPS衰减率为11.3%,Qwen2.5-72b-Instruct衰减率达24.7%。
四、AlpacaEval 2.0胜率与HelpSteer2对齐得分
该基准聚焦生成内容的有用性、安全性与指令遵循能力,由人工标注与LLM-as-a-judge双路径验证。
1、Yi-Lightning在AlpacaEval 2.0胜率为68.4%(vs. GPT-4-turbo baseline),HelpSteer2整体得分为82.7;
2、Qwen2.5-72b-Instruct在AlpacaEval 2.0胜率为65.1%,HelpSteer2整体得分为79.3;
3、在“复杂多步推理”子项中,Yi-Lightning胜率领先Qwen2.5-72b-Instruct 5.2个百分点;在“代码生成准确性”子项中,二者差距为1.8个百分点。
五、长文本摘要一致性(LedgerBench v1.0)
LedgerBench评估模型对万字级财经/法律文档的摘要保真度与关键信息召回率,含事实错误率(FER)、冗余率(RR)、覆盖度(Cov)三项指标。
1、Yi-Lightning FER为4.3%,RR为12.1%,Cov为89.7%;
2、Qwen2.5-72b-Instruct FER为6.8%,RR为15.9%,Cov为85.2%;
3、在涉及跨段落逻辑链推导的任务中,Yi-Lightning错误链断裂率比Qwen2.5-72b-Instruct低31%。











