jev在2026年结构化决策模型领域无统一排名,仅在llm chess中以elo 243位列第59;其专精单步并行打分,不参与通用大模型评测,赛道尚未被主流基准覆盖。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

想快速判断Jev在2026年结构化决策模型领域的实际定位,不能套用通用大模型榜单——因为Jev不生成文本、不参与对话、不跑MMLU或Humanity’s Last Exam这类测试。它只做带概率的固定选项选择、评分或布尔判断,必须用专属于结构化决策的评测框架来衡量。
结构化决策模型没有统一公开排行榜
截至2026年9月20日,【不存在覆盖全行业的“结构化决策模型综合排行榜”】。主流榜单如LMSYS Arena、LiveBench、Aider Leaderboard、Humanity’s Last Exam全部面向生成式AI设计,其评测协议(多轮交互、自由输出、长文本理解)与Jev的输入-输出范式天然冲突。TypeSafe官方明确表示“现有LLM基准在这里并不真正适用”,并跳过了所有常规公开榜单。
目前能查到的结构化决策能力横向对比,仅散见于三类场景:LLM Chess对局结果、维基链接导航任务、毁灭战士实时控制延迟测试。这些不是综合排名,而是单点能力快照。
Jev在LLM Chess中排第59位(Elo 243)
这是目前唯一可复现、可比对、且与结构化决策强相关的公开评测数据:
① 测试框架完全适配Jev:状态(FEN+执棋方)→合法UCI走法列表(≤255项)→Jev返回最高概率选项→转为make_move动作;
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
② 对手是同一套评测系统下的聊天模型(如Qwen3.6-27b、O4-mini-medium),协议一致、环境一致、对局数一致(80局);
③ Jev Elo 243,位列第59,紧贴Qwen3.6-27b与O4-mini-medium之间——这两个模型在通用推理榜上属中游偏强,但它们在LLM Chess中靠的是多轮自我博弈+思维链生成走法,而Jev靠的是单步并行打分,路径完全不同。
注意:这个名次不代表Jev“弱于”前58名模型——它没参加过那些模型所依赖的文本生成类评测,也无法参与。它的100%对局完成率和零非法走法,恰恰说明其结构化协议遵循能力远超多数聊天模型。
在实时决策类任务中Jev无公开对手可比
维基百科链接导航任务中,Jev完成速度超越多个“以高速非推理模式运行的前沿模型”,但未公布具体模型名称与数值;《毁灭战士》实测中,Jev每秒调用约10次、端到端响应70–500毫秒、每小时成本约7美元,这些指标目前没有其他结构化决策模型在同一任务中披露可比数据。
也就是说,Jev当前没有“同赛道竞品”出现在任何权威榜单上。它所在的赛道本身尚未被主流评测体系正式定义和覆盖。










