智能体跑长任务为何"失忆跑题":AWS、Claude Code、Manus 们用四套框架机制给出答案

夜晨君_5072

夜晨君_5072

2026-09-14

511人浏览

原创

☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

智能体跑长任务为何

大模型在执行长时间、多步骤任务时频频“失忆”,运行中途便模糊甚至遗忘初始目标——这一长期困扰智能体研发领域的顽疾,其症结未必出在模型自身,而更可能深藏于承载模型的“执行框架”之中。AWS 发布的一份面向自主云编程智能体的设计指南一针见血地指出:浅层智能体在长周期任务中极易遭遇上下文溢出、受噪声干扰而偏题,并丧失对任务状态的持续追踪能力。真正能修复这一短板的,是那个统筹管理“模型之外一切要素”的 harness 层。

一项覆盖多家主流智能体框架的新近研究,首次系统性地揭开了这层“外壳”的技术构成。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 以及 Amazon Bedrock AgentCore,均通过四套协同运作的机制——上下文预算管控、动态压缩策略、待办状态显式维护、跨会话记忆调度——将原本脆弱的浅层循环,升级为具备长程稳定性的深智能体架构。

最违背直觉的关键认知是:盲目扩大上下文窗口并不能根治问题。Chroma 发布的 Context Rot 报告对18款主流大模型进行了实测评估,结果表明,即便在基础检索任务中,输入长度越长,模型输出的可靠性反而越低。Anthropic 的解释直指底层机制:注意力机制需为 n 个 token 构建约 n² 对两两关联,每个新增 token 都在消耗本就稀缺的“注意力预算”;上下文本质上是一种边际收益递减的资源,而非可无限扩容的容器。Manus 进一步披露,一个典型端到端任务平均调用工具约50次,输入与输出体量比接近100:1——这意味着最初那条核心指令,终将被不断涌入的信息推至上下文窗口中段,而这恰恰正是模型回忆能力最薄弱的位置。

第一台“发动机”是上下文预算分配与主动卸载。Deep Agents 自启动即内置两条硬性约束:工具返回内容若超20000 token,则直接落盘至文件系统,仅在上下文中保留路径及前10行摘要;当会话上下文占用超过窗口容量的85%时,历史编辑调用将被截断为轻量级指针。Claude Code 将同类逻辑前置至加载阶段,自动记忆上限设为200行或25KB;MCP 工具调用模式默认仅展示工具名称,按需拉取完整定义。AWS AgentCore 的实践则更为激进:协调器并行启动3个浏览器子智能体,各自运行于隔离的 MicroVM 环境中;分析型子智能体仅接收结构化结果,全程预期耗时4–6分钟,若改用串行方式,延迟最高可达3倍。

OpenAI Codex Sub Agents
OpenAI Codex Sub Agents

使用 OpenAI Codex CLI 处理编码任务。触发词:codex、code review、fix CI、refactor code、implement feature、coding agent、gpt-5-codex。Clawdbot 可将编码工作委托给 Codex CLI 作为子代理或直接工具。

下载

第二台是语义感知型压缩。当卸载策略已逼近极限,框架便会触发对话摘要并重启上下文。Claude Code 的压缩提示严格保留系统架构决策与未闭环缺陷,剔除冗余中间输出,并在压缩后重载最近修改的最多5个源文件、重新注入关键技能正文;原始完整日志则同步写入磁盘,确保被摘要过滤的事实可在后续需要时精准召回。Deep Agents 更进一步,将“目标锚定”固化为摘要文档的结构属性,强制划分为“会话意图”“已交付产物”“下一步动作”三大字段。该能力已下沉至 API 层:OpenAI Responses API 提供 compact_threshold 参数支持服务端压缩,Codex 正依赖此机制支撑复杂编程任务;Claude 平台亦开放可编写自定义指令的压缩编辑接口。

第三台是待办状态显式化与“咒语式”强化。Manus 的实现极为简洁——维护一份 todo.md,逐项书写、完成即打勾,相当于将核心目标反复“念诵”至上下文末端,以物理方式将其顶至最易被模型捕获的位置,对抗“沉入中段”的漂移效应。但该策略并非万能:Deep Agents 在2026年7月发布的 v0.7 版本中,基于实证评估发现关闭待办中间件反而带来略高奖励分与更低计算开销,遂将其调整为可选模块;LangChain 则仍建议在长周期任务、模型能力较弱或需向用户可视化进度的场景下重新启用该机制。

第四台是跨会话记忆的轻量化调度。Claude Code 每次压缩后,均从本地磁盘重新载入 CLAUDE.md 与自动记忆快照;AgentCore Memory 则在后台持续运行信息抽取策略,使协调器下次可直接召回关键片段,无需重复推理。然而苏黎世联邦理工学院的一项研究泼下冷水:AGENTS.md 类上下文记忆文件虽常被寄予厚望,实际却未能显著提升任务成功率,反使单次推理成本上升20%–23%,每一次重载都等同于对有限注意力预算的一次刚性征税。因此 Claude Code 明确建议将 CLAUDE.md 严格控制在200行以内。

研究最终强调:判断一个框架是否真正“握得住目标”,必须通过强制触发压缩的鲁棒性测试来验证——最值得警惕的失败信号,是智能体在摘要完成后立即发起澄清追问,或错误宣告任务已完成。换言之,让智能体在漫长任务链中不迷航,较量的从来不是模型参数规模有多大,而是上述四台“发动机”在框架层被调校得有多精密、多克制、多懂模型。

相关专题

更多
Claude 新手入门教程
Claude 新手入门教程

本专题围绕 Claude 的基础使用与实际应用展开,面向零基础用户与初学者,系统梳理从“认识工具”到“高效使用”的完整路径。

2026.03.27

2451

19

Claude 提示词使用指南
Claude 提示词使用指南

本专题聚焦 Claude 的提示词(Prompt)设计与优化方法,围绕“如何让 AI 更准确理解需求并输出高质量结果”这一核心问题展开。内容从基础结构入手,逐步深入到复杂场景下的提示词构建策略,帮助用户建立清晰、可复用的提示词体系。

2026.03.27

354

20

Claude 进阶使用指南
Claude 进阶使用指南

本专题面向已经具备基础使用经验的用户,深入解析 Claude 在复杂场景中的高阶应用方式,重点解决“如何让 AI 真正参与到实际工作流程中”的问题。让 Claude 成为日常工作中可持续复用的效率引擎,在内容创作、开发实践与信息处理等多个领域实现显著提效。

2026.03.27

339

16

AI Agent 实战指南:从评测到落地
AI Agent 实战指南:从评测到落地

全面评测 Manus AI 与 ChatGPT、Claude、OpenAI Operator 等 AI Agent 产品,分析自动化能力、工作流与实际生产力差异。

2026.05.29

313

15

Manus AI使用指南大全
Manus AI使用指南大全

汇总 Manus AI 使用教程与实战案例,包含 Agent 自动化、AI 工作流、网页开发、Research 使用技巧以及新手快速入门指南。

2026.05.29

514

22

Manus AI案例汇总
Manus AI案例汇总

分享 Manus AI 企业落地案例,包括 AI 自动办公、Research、数据分析、AI 客服与企业级智能体应用解决方案。

2026.05.29

214

15

AI Agent 实战指南:从评测到落地
AI Agent 实战指南:从评测到落地

全面评测 Manus AI 与 ChatGPT、Claude、OpenAI Operator 等 AI Agent 产品,分析自动化能力、工作流与实际生产力差异。

2026.05.29

313

15

AI视频生成软件推荐
AI视频生成软件推荐

本专题汇总了当前主流的AI视频生成软件推荐与排行榜单,涵盖seko、AniShort、剧云、Lovart、LiblibAI及立刻mv等热门工具。同时整理了各软件在文生视频、图生视频、时长限制、画质表现及免费额度等方面的差异对比,助您快速选对适合创作需求的AI视频生成工具。

2026.09.16

140

9

ai生成视频的工具免费版合集
ai生成视频的工具免费版合集

本专题汇总了当前免费AI生成视频工具的排行榜与推荐清单,涵盖seko、讯飞智作、AniShort及剧云、Lovart等多模型集成平台。同时整理了各工具的免费额度、输出时长、水印政策及适用场景差异,助您快速选择合适工具开启AI视频创作。

2026.09.16

60

10

热门下载

更多
网站特效
/
网站源码
/
网站素材
/
前端模板

精品课程

更多
相关推荐
/
热门推荐
/
最新课程
Claude Code 快速上手核心指南
Claude Code 快速上手核心指南

共0课时 | 0人学习

Claude Code 官方文档
Claude Code 官方文档

共0课时 | 0人学习

Claude Code 官方中文文档
Claude Code 官方中文文档

共0课时 | 0人学习