eapo是阿里通义实验室全新发布的长文本推理强化学习框架,其核心创新在于引入“证据奖励”机制,将传统依赖最终答案的监督信号,深度下探至证据提取与结构化推理全过程。该框架已正式被acl 2026录用,并在seal、longbench-v1/v2等8项主流长文本基准测试中实现突破性表现——基于30b参数量的qwen3模型,在多项任务上超越参数规模达120b的gpt-oss及claude-sonnet-4等闭源大模型。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

使用 @youdotcom-oss/teams-anthropic 将 Anthropic Claude 模型(Opus、Sonnet、Haiku)添加到 Microsoft Teams.ai 应用程序中。可选集成 You.com MCP 服务器以进行网页搜索和内容提取。
EAPO的核心能力
- 结构化证据驱动推理:强制模型严格遵循“任务分析→证据提取→推理执行→答案生成”四阶段流程,各环节由专属特殊token显式分隔,确保中间证据状态完全可观测、可监督。
- 多维度过程奖励建模:融合格式合规性奖励(α=0.1)、群组内相对证据质量奖励(β=0.3)与结果准确性奖励(γ=0.6),构建细粒度、高密度的过程导向反馈体系,摆脱对稀疏终局结果的单一依赖。
- 组内对比式证据评估:针对同一问题并行采样多条证据路径,由统一奖励模型打分(1–5分整数制),再经组内归一化生成[0,1]区间相对奖励,显著提升模型对高质量证据的识别与偏好能力。
- 奖励与策略动态协同进化:设计Outcome-Consistent Rejection Fine-Tuning闭环机制,持续筛选高置信度、答案与证据高度一致的优质rollout数据,反向精调奖励模型;随策略能力增强,评判标准同步升级,形成正向增强循环。
- 长文本鲁棒性强化:专为128K tokens高噪声、跨文档、多跳推理场景优化,在真实复杂语境下稳定释放小模型潜力,达成“以小博大”的性能跃迁。
EAPO的技术内核
- Evidence-Augmented Reasoning(EAR)范式:彻底重构推理链路,要求模型必须从原始长文本中逐字摘录支撑性证据片段,杜绝“答案正确但依据错误”的幻觉输出;四步token化结构使证据提取行为完全外显、可审计、可干预。
- Group-Relative Evidence Reward(GRE-Reward)机制:将RL优化目标从“答得对”转向“证得准”。通过组内横向比较而非绝对打分,有效缓解奖励模型饱和与判别力衰减问题,让模型真正理解“为什么这条证据更可靠”。
- Adaptive Reward-Policy Co-Evolution架构:突破静态奖励瓶颈,利用策略模型自身产出的高质量轨迹持续蒸馏奖励知识,实现双模型能力同步演进,避免评判标准滞后于策略进化。
- GRPO基座上的复合奖励工程:以Group Relative Policy Optimization为算法底座,叠加格式约束、证据质量、结果验证三重加权奖励,将单点稀疏反馈转化为全流程稠密引导信号。
EAPO的关键实施要素
- 研发主体:阿里通义实验室(龚鑫、李子健、黄申等),论文已获ACL 2026主会接收。
- 适配基座模型:支持Qwen3-14B(Dense)、Qwen3-30B-A3B-Instruct(MoE)、Qwen3-30B-A3B-Thinking(强推理型)三类架构,推荐使用30B-A3B-Thinking以发挥最佳效果。
- 上下文容量:训练与评测统一限定于128K tokens,兼顾效率与长程建模能力。
- 训练数据集:共4,664条高质量样本,覆盖32K–128K长度的MuSiQue多跳问答与混合维基百科QA(含结构化表格与非结构化段落)。
- 奖励模型配置:以Qwen3-30B-A3B-Thinking为初始化权重,每20个RL训练步更新一次,保障实时判别精度。
- 算法根基:基于GRPO扩展,深度融合群组相对证据评估与自适应协同进化模块。
- 部署前提:须基于原生支持超长上下文的Qwen3系列模型开展训练与微调。
EAPO的差异化价值
- 监督范式革新:首次在长文本RL中实现证据粒度的全程密集监督,终结“黑箱推理”,使每一步逻辑推导均有据可查、有迹可溯。
- 性能跨越式提升:Qwen3-30B-A3B-Thinking版本在8大基准平均得分达63.1%,显著领先同规模基线(GRPO:59.2%)及竞品QwenLong-32B(57.8%),成功实现小参数模型对超大闭源模型的全面反超。
- 双重错误率压降:证据引用错误率由17.7%降至13.5%,推理逻辑错误率由20.7%降至15.4%,证明过程监督能自发带动结果质量提升。
- 训练收敛加速:相较仅用结果奖励的GRPO基线,EAPO不仅收敛更快,且最终准确率上限更高;训练过程中证据质量指标始终维持断层式领先。
- 评判体系自进化:奖励模型不再固定不变,而是依托策略模型成长持续迭代升级,从根本上解决“裁判跟不上选手进步”的长期瓶颈。
EAPO的官方资源入口
EAPO与主流方案对比分析
| 对比维度 | EAPO | GRPO | QwenLong-32B |
|---|---|---|---|
| **技术定位** | 证据增强型强化学习框架 | 通用群组相对策略优化方法 | 长文本专用后训练模型 |
| **监督信号类型** | 显式证据级过程奖励 + 结果奖励 | 仅终局结果奖励 | 隐式长文本适配 |
| **证据提取方式** | 强制四步结构化输出,证据显式分离 | 无结构化要求 | 无显式证据机制 |
| **奖励模型演化能力** | 具备自适应协同进化闭环 | 无独立奖励模型 | 不涉及奖励建模 |
| **长文本场景适配性** | 专为128K高噪、多源、跨文档设计 | 通用型算法,未针对性优化 | 强长文本建模能力,但缺乏过程控制 |
| **实测综合性能** | 63.1%(30B,8基准均值) | 59.2%(30B基线) | 57.8% |
| **主要技术约束** | 需额外部署并维护奖励模型 | 无法规避“蒙对答案”捷径行为 | 缺乏可解释、可干预的证据监督路径 |
EAPO的典型落地场景
- 智能搜索与精准问答:攻克AI搜索“检索准、回答偏”的顽疾,强制模型从海量结果中锚定并引用真实支撑证据,根治无依据臆断。
- 高可信专业文档解析:面向法律合同审查、金融研报生成、临床诊疗辅助等强事实依赖领域,确保每一处结论均附带明确原文出处与完整证据链。
- 跨文献科研综述生成:支持对数十篇学术论文进行联合分析与交叉验证,自动提取关键图表数据、实验结论并规范标注来源,保障学术严谨性。
- 企业级知识中枢问答:在百万字级内部制度、操作手册、历史合同库中快速定位权威依据,为一线员工提供“有出处、可追溯”的业务决策支持。
- 教育智能辅导系统:在解题引导中强制标注每步推导所依据的题干原文或教材定义,批改时自动校验学生逻辑是否严格源自给定材料,提升思维训练质量。










