☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

大模型在执行长时间、多步骤任务时频频“失忆”,运行中途便模糊甚至遗忘初始目标——这一长期困扰智能体研发领域的顽疾,其症结未必出在模型自身,而更可能深藏于承载模型的“执行框架”之中。AWS 发布的一份面向自主云编程智能体的设计指南一针见血地指出:浅层智能体在长周期任务中极易遭遇上下文溢出、受噪声干扰而偏题,并丧失对任务状态的持续追踪能力。真正能修复这一短板的,是那个统筹管理“模型之外一切要素”的 harness 层。
一项覆盖多家主流智能体框架的新近研究,首次系统性地揭开了这层“外壳”的技术构成。LangChain Deep Agents、Claude Code、Manus、OpenAI Codex 以及 Amazon Bedrock AgentCore,均通过四套协同运作的机制——上下文预算管控、动态压缩策略、待办状态显式维护、跨会话记忆调度——将原本脆弱的浅层循环,升级为具备长程稳定性的深智能体架构。
最违背直觉的关键认知是:盲目扩大上下文窗口并不能根治问题。Chroma 发布的 Context Rot 报告对18款主流大模型进行了实测评估,结果表明,即便在基础检索任务中,输入长度越长,模型输出的可靠性反而越低。Anthropic 的解释直指底层机制:注意力机制需为 n 个 token 构建约 n² 对两两关联,每个新增 token 都在消耗本就稀缺的“注意力预算”;上下文本质上是一种边际收益递减的资源,而非可无限扩容的容器。Manus 进一步披露,一个典型端到端任务平均调用工具约50次,输入与输出体量比接近100:1——这意味着最初那条核心指令,终将被不断涌入的信息推至上下文窗口中段,而这恰恰正是模型回忆能力最薄弱的位置。
第一台“发动机”是上下文预算分配与主动卸载。Deep Agents 自启动即内置两条硬性约束:工具返回内容若超20000 token,则直接落盘至文件系统,仅在上下文中保留路径及前10行摘要;当会话上下文占用超过窗口容量的85%时,历史编辑调用将被截断为轻量级指针。Claude Code 将同类逻辑前置至加载阶段,自动记忆上限设为200行或25KB;MCP 工具调用模式默认仅展示工具名称,按需拉取完整定义。AWS AgentCore 的实践则更为激进:协调器并行启动3个浏览器子智能体,各自运行于隔离的 MicroVM 环境中;分析型子智能体仅接收结构化结果,全程预期耗时4–6分钟,若改用串行方式,延迟最高可达3倍。
使用 OpenAI Codex CLI 处理编码任务。触发词:codex、code review、fix CI、refactor code、implement feature、coding agent、gpt-5-codex。Clawdbot 可将编码工作委托给 Codex CLI 作为子代理或直接工具。
第二台是语义感知型压缩。当卸载策略已逼近极限,框架便会触发对话摘要并重启上下文。Claude Code 的压缩提示严格保留系统架构决策与未闭环缺陷,剔除冗余中间输出,并在压缩后重载最近修改的最多5个源文件、重新注入关键技能正文;原始完整日志则同步写入磁盘,确保被摘要过滤的事实可在后续需要时精准召回。Deep Agents 更进一步,将“目标锚定”固化为摘要文档的结构属性,强制划分为“会话意图”“已交付产物”“下一步动作”三大字段。该能力已下沉至 API 层:OpenAI Responses API 提供 compact_threshold 参数支持服务端压缩,Codex 正依赖此机制支撑复杂编程任务;Claude 平台亦开放可编写自定义指令的压缩编辑接口。
第三台是待办状态显式化与“咒语式”强化。Manus 的实现极为简洁——维护一份 todo.md,逐项书写、完成即打勾,相当于将核心目标反复“念诵”至上下文末端,以物理方式将其顶至最易被模型捕获的位置,对抗“沉入中段”的漂移效应。但该策略并非万能:Deep Agents 在2026年7月发布的 v0.7 版本中,基于实证评估发现关闭待办中间件反而带来略高奖励分与更低计算开销,遂将其调整为可选模块;LangChain 则仍建议在长周期任务、模型能力较弱或需向用户可视化进度的场景下重新启用该机制。
第四台是跨会话记忆的轻量化调度。Claude Code 每次压缩后,均从本地磁盘重新载入 CLAUDE.md 与自动记忆快照;AgentCore Memory 则在后台持续运行信息抽取策略,使协调器下次可直接召回关键片段,无需重复推理。然而苏黎世联邦理工学院的一项研究泼下冷水:AGENTS.md 类上下文记忆文件虽常被寄予厚望,实际却未能显著提升任务成功率,反使单次推理成本上升20%–23%,每一次重载都等同于对有限注意力预算的一次刚性征税。因此 Claude Code 明确建议将 CLAUDE.md 严格控制在200行以内。
研究最终强调:判断一个框架是否真正“握得住目标”,必须通过强制触发压缩的鲁棒性测试来验证——最值得警惕的失败信号,是智能体在摘要完成后立即发起澄清追问,或错误宣告任务已完成。换言之,让智能体在漫长任务链中不迷航,较量的从来不是模型参数规模有多大,而是上述四台“发动机”在框架层被调校得有多精密、多克制、多懂模型。









