hermes agent通过分层记忆实现长期可靠记忆:高频缓存层用冻结快照(memory.md/user.md)锁死llm前缀缓存,会话检索层依托sqlite+fts5毫秒级回溯历史,技能沉淀层自动提炼高价值执行路径生成skill.md,三者协同确保记忆精准、高效、闭环。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要让Hermes Agent真正记住你上周提的需求、上个月改过的偏好、甚至去年部署时踩过的坑,不能只靠SQLite存聊天记录或往向量库扔几段文本——它必须分层写入、冻结快照、闭环更新,否则记忆会膨胀、缓存会失效、检索会错位。
高频缓存层:用冻结快照锁死LLM前缀缓存
第一步:启动会话时,系统自动将 MEMORY.md(项目事实,上限2200字符)和 USER.md(用户画像,上限1375字符)内容读取为纯文本快照;
第二步:该快照注入系统提示词前缀,作为本次会话的“不可变上下文锚点”;
第三步:若会话中用户明确说“记住这个配置”,系统会原子写入对应.md文件,但【不刷新当前会话的提示词前缀】——这是冻结快照的核心设计,避免LLM重算KV缓存,实测可防止API成本飙升至原价的3倍以上。
这一步操作起来很简单,直接把文件拖进去就行。但如果你手动编辑.md后强制reload提示词,前缀缓存就彻底失效,后续每轮推理token开销翻倍,且无法恢复。
会话检索层:SQLite+FTS5实现毫秒级历史回溯
方法一:本地全量存储 → 所有对话自动落库到 state.db,每条记录含时间戳、会话ID、角色、内容、工具调用链哈希;
方法二:FTS5全文索引 → 每次写入同时触发索引更新,支持中文分词、模糊匹配、布尔逻辑(如“飞书日报 AND 失败 NOT Excel”);
方法三:零LLM摘要 → 检索命中后,由Gemini Flash本地生成摘要,不走主模型通道,响应压在20毫秒内。
注意:该层不参与系统提示构建,仅用于人工回溯或Review Agent复盘调用。你查不到它,但它一直在记。
技能沉淀层:从失败路径中自动提炼可执行技能
① 触发条件必须同时满足:单次任务调用工具≥5次 + 至少1次错误修复 + 用户发出明确纠正(如“不对,应该先导出再清洗”) + 最终成功完成;
② Review Agent后台解析完整执行轨迹,剔除试探性调用与冗余步骤,提取输入模式、校验点、分支判断依据;
③ 生成 Skill.md 文件,存入 skills/ 目录,含YAML元数据(适用场景、成功率、最后验证时间);
④ 下次遇到相似意图(如“整理飞书日报”),技能引擎优先加载该文件,绕过LLM重新规划,直接调度OpenClaw→Atropos→Llama 3.1流水线。
这层记忆不暴露给用户编辑,也不允许手动删除——它只接受A/B测试验证后的自动迭代。强行删Skill.md会导致下次同类任务回归原始试错路径。











