应启用self-improving-agent技能并配置三层记忆结构、部署每日自动复盘任务、接入lobsterloop四段式执行链路、构建双层记忆日志体系、集成外部评估器,以实现agent的自我反思与结果评估。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在使用OpenClaw执行任务后发现结果未达预期,或同一类错误反复出现,则可能是由于Agent缺乏有效的自我反思与执行结果评估机制。以下是实现该机制的具体方法:
一、启用Self-Improving-Agent技能并配置三层记忆结构
该方法通过结构化记忆系统支撑反思闭环,使Agent能区分高频经验、中期沉淀与历史归档,并基于不同优先级调用对应知识。系统自动将用户纠正、失败日志与优化建议分别写入HOT/WARM/COLD层,确保关键规则即时生效。
1、在OpenClaw配置目录中启用Self-Improving-Agent技能插件,确认其状态为active。
2、检查.agent/config.yaml文件,确保memory层级配置项包含hot: true、warm: true、cold: true三项布尔开关均设为true。
3、验证.learnings/目录下是否存在ERRORS.md、LEARNINGS.md和FEATURE_REQUESTS.md三份初始文档,若缺失则手动创建并赋予644权限。
4、向Agent发送测试指令如“请用pnpm安装依赖”,待其执行后故意纠正:“我们项目禁用pnpm,必须用npm”,观察是否自动生成corrections.md条目并同步至HOT层提示词。
二、部署每日凌晨4点自动复盘定时任务
该方法利用系统空闲时段触发全量反思流程,从当日对话日志中提取模式性偏差、工具误调用频次及解决方案有效性,强制更新核心记忆库MEMORY.md并保留版本历史,避免经验稀释。
1、在本地终端执行crontab -e命令,添加一行:0 4 * * * cd /path/to/openclaw && python3 scripts/daily_reflect.py >> /var/log/openclaw/reflect.log 2>&1。
2、确认scripts/daily_reflect.py脚本存在且具备读取YYYY-MM-DD.md日志与写入MEMORY.md的文件权限。
3、手动运行一次该脚本,检查输出是否包含“[REFLECT] Found 3 ERROR patterns”、“[UPDATE] MEMORY.md v20260518.1 written”等标识行。
4、查看MEMORY.md末尾是否新增带时间戳的反思区块,内容需包含“工具调用失败率上升→增加search超时重试逻辑”等可执行改进项。
三、接入LobsterLoop四段式执行链路并启用Reflect阶段校验
该方法将反思嵌入智能体原生循环,在每次Act→Observe完成后强制启动Reflect子流程,比对预期目标与实际观测值,生成结构化偏差报告而非简单标记成功/失败。
1、确认Gateway模块已加载lobster_loop_v2插件,且config.yaml中loop_strategy设为"think-act-observe-reflect"。
2、在Skills目录下启用reflect_validator.skill,该技能会解析Observation返回的JSON结构,比对key字段与task_schema定义是否一致。
3、构造测试任务:“从sales_api获取昨日各门店销售额并按金额降序排列”,执行后检查日志中是否出现[REFLECT] mismatch: expected 'amount' field, got 'revenue' in observation。
4、当检测到字段不匹配时,系统应自动将该案例写入ERRORS.md,并在LEARNINGS.md中追加“sales_api v3.2返回字段名变更,需适配revenue→amount映射”。
四、构建双层记忆日志体系并启用近两日自动回溯
该方法通过短期日志追加存储与长期规则固化结合,解决传统流水账记忆无法提炼共性问题的缺陷,使Agent在新任务启动时能主动加载相关失败根因与临时方案。
1、确认memory/YYYY-MM-DD.md日志文件按日期自动生成,且每条记录包含timestamp、task_id、status、observation_summary、root_cause字段。
2、在Agent初始化参数中设置context_window_days: 2,确保每次新任务启动时自动注入最近两个日期的日志摘要。
3、触发一个已知失败任务(如调用已停用的weather_legacy API),观察新会话中是否出现提示:“检测到同类API调用失败3次,已切换至weather_v2接口”。
4、检查WARM层是否在三次失败后自动生成rule_weather_api_migration.md,内容含接口替换逻辑与版本兼容性说明。
五、集成外部评估器对执行结果做客观度量
该方法引入独立于Agent自身的评估模块,通过预设指标函数对Observation输出进行数值化打分,避免LLM自我评估产生的确认偏误,支撑可量化的改进决策。
1、在skills/evaluators/目录下部署accuracy_score.py,该脚本需支持对结构化数据比对、文本相似度计算与任务完成状态判定三类评估。
2、在task_schema中为每个任务定义evaluator字段,例如{"evaluator": "accuracy_score", "threshold": 0.92}。
3、运行一个数据库查询任务,观察日志是否输出[ASSESS] accuracy_score=0.87
4、确认corrections.md中是否新增条目:“SELECT语句遗漏ORDER BY,导致结果顺序不可控;已更新SQL模板加入默认排序字段”。










