taco 是曼彻斯特大学、北京航空航天大学、香港科技大学以及 map 团队联合推出的无需训练、即插即用的终端智能体自进化观测压缩框架。该框架专为解决多轮命令行任务中 shell 输出噪声持续累积所引发的上下文膨胀问题而设计,能够自动从交互历史中识别冗余模式、生成并复用压缩规则,在大幅削减无关日志的同时精准保留关键报错与状态信号。其完全免训练、零微调,已深度集成至 harbor 项目中的 terminus-2 终端 agent。在 terminalbench 等权威基准测试中,taco 为 deepseek-v3.2、qwen3 等主流模型带来 1%–4% 的准确率提升,并显著压降低价值 token 消耗。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
TACO的主要功能
- 自进化规则发现:基于真实终端交互轨迹,全自动扫描原始 shell 输出流,识别高频冗余片段(如重复进度条、冗长系统路径、无意义调试信息),动态生成结构化压缩规则,摆脱人工预设提示或硬编码策略。
- 规则在线精炼与修复:依据每轮任务执行反馈(如命令失败、LLM 规划中断等)实时校准规则边界,避免关键错误被误删或有效状态被过度裁剪,实现压缩鲁棒性闭环优化。
- 全局规则池与跨任务迁移:构建持久化、可共享的规则知识库,支持新任务启动时直接加载经历史验证的压缩策略,实现跨仓库、跨环境、跨用户的经验沉淀与复用。
- 即插即用免训练集成:以轻量插件形式嵌入现有终端 Agent(如 Harbor terminus-2),仅需添加命令行参数即可启用,不依赖模型架构修改或额外训练流程。
- Token 效率与性能双增益:在抑制低信息量噪声的同时保障决策所需环境信号完整性,使长程多步任务的上下文增长趋于线性可控;实测在 TerminalBench 上同步提升准确率与 token 利用效率。
TACO的技术原理
- 问题背景:当前终端智能体普遍将原始 shell 输出全量回填至 LLM 上下文,导致系统日志、滚动输出、编译中间态等非关键内容随交互轮次呈二次甚至指数级膨胀,严重稀释关键故障线索,并快速耗尽上下文窗口。
- 三模块协同架构:由规则发现器(实时监听输出流,对超长未覆盖文本触发候选规则生成)、规则精炼器(结合任务成败反馈迭代修正规则适用范围)和全局规则池(存储经验证的稳定规则,支持跨会话加载)构成闭环演化系统。
- 在线运行机制:每轮交互优先调用全局规则池执行压缩;若遇到未覆盖的长输出,则即时触发新规则发现→本地验证→择优入库流程;整个过程由外部规划型 LLM 驱动,无需标注数据或模型更新,压缩能力随实际使用持续进化。
如何使用TACO
-
环境安装:克隆 GitHub 仓库后,在项目根目录执行
pip install -e .完成依赖部署;TACO 已作为 Harbor terminus-2 的原生组件默认可用。 -
快速启动:运行 Harbor 启动命令并指定
terminus-2agent,传入模型配置及 TACO 参数(如--ak enable_compress=True)即可启用;项目内scripts/run_taco_example.sh提供开箱即用的调用模板。 -
核心参数配置:通过
--ak前缀设置主开关——enable_compress=True启用压缩,enable_self_evo=True激活在线规则进化;同时需配置compress_base_url、compress_api_key与compress_model_name指向任意 OpenAI 兼容的规划 LLM 接口。 -
常用模式选择:完整能力需开启压缩+自进化+外部 LLM;若做消融实验,可加
freeze_rules=True锁定规则集;若仅限单任务本地进化且不继承全局池,则添加disable_global_evo=True。 -
运行控制:使用
--ak max_turns=200控制单任务最大交互轮次,通过model_info传入 LiteLLM 格式 JSON,精细约束输入/输出 token 预算,确保长程任务在成本边界内稳定执行。
TACO的核心优势
- 即插即用零训练:不修改大模型权重、不重训 Agent 主干、不依赖特定训练数据,仅靠参数开关即可激活全部能力。
- 自进化跨任务迁移:全局规则池使 Agent 在长期使用中持续积累压缩经验,新任务可“继承老经验”,避免重复试错。
- 性能与成本双赢:在 TerminalBench 上稳定提升 MiniMax-M2.5、DeepSeek-V3.2、Qwen3-Coder-480B 等模型 1%–4% 准确率,并在同等 token 预算下额外增益约 2%–3% 成功率。
- 强泛化与低开销:在 SWE-Bench Lite、CompileBench、DevEval、CRUST-Bench 等多元评测集上均保持成功率持平或提升,同时总 token 消耗显著下降。
TACO的项目地址
- GitHub仓库:https://www.php.cn/link/34c5d87943fe70502a8e9d5f758d92cb
- arXiv技术论文:https://www.php.cn/link/7029a498c4f596f73b35504df9bab02a
TACO的同类竞品对比
| 维度 | TACO | SWE-agent | OpenHands |
|---|---|---|---|
| 上下文处理 | 自进化规则压缩,全局知识池跨任务复用 | 保留完整原始终端输出,无智能压缩机制 | 依赖模型原生长上下文或用户自定义提示 |
| 训练依赖 | 完全免训练,即插即用 | 免训练,但需特定 Docker 环境配置 | 免训练,需复杂沙箱与运行时环境 |
| 跨任务迁移 | 全局规则池支持跨仓库/跨会话知识累积 | 单任务会话隔离,历史知识不继承 | 多任务支持,但无结构化压缩规则复用 |
| Token 效率 | 显式过滤冗余噪声,长程任务成本线性可控 | 原始输出回填导致 token 随轮次二次增长 | 长程任务 token 消耗高,易触顶上下文上限 |
| 开源集成 | 开源,深度集成 Harbor 评估框架 | 开源,社区生态成熟 | 开源,通用 Agent 平台 |
TACO的应用场景
- 长程软件工程 Agent:在 SWE-Bench 类多轮代码修复、编译调试、测试验证中抑制日志爆炸,维持上下文语义清晰度。
- 自动化运维与部署:高效处理海量 shell 返回的系统状态、进程快照、服务日志等冗余信息,增强 DevOps Agent 决策稳定性。
- 代码审查与测试分析:精准过滤无关编译警告、单元测试通过信息,聚焦关键错误堆栈、diff 差异与异常退出码。
- 学术研究复现与评测:作为 Harbor terminus-2 插件,支撑终端智能体的 token 效率评估、长程推理能力基准测试及算法对比实验。










