将PDF和文档转换为Markdown,在本地建立索引用于RAG检索,并以token高效方式进行分析。适用于需要读取/分析/摘要等任务。
本地首个文件处理:PDF → 标记下 → RAG指数 → 符号效率分析是一项面向实际任务的技能,主要用于文档留在本地;只有相关的块会转到 LLM;
该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
本地优先的文档处理流程:PDF → Markdown → RAG 索引 → 令牌高效分析。
文档始终保留在本地。仅将相关文本片段发送至 LLM。知识吸收最大化,令牌消耗最小化。
由 opendataloader-pdf 驱动 —— PDF 解析基准测试排名第一(综合得分 0.90,表格解析准确率 0.93)。纯 CPU 运行,无需 GPU。
bash {SKILL_DIR}/scripts/boof.sh /path/to/document.pdf
bash {SKILL_DIR}/scripts/boof.sh /path/to/document.pdf --collection my-project
qmd query "your question" -c collection-name
Boof 文档:在 PDF 文件上运行 boof.sh。该脚本通过 opendataloader-pdf(本地 Java 引擎,不依赖 API,无需 GPU)将其转换为 Markdown,并将结果索引至 QMD 以支持语义搜索。
查询索引:使用 qmd query 检索仅与问题相关的文本片段,并将这些片段而非整份文档发送给 LLM。
分析内容:LLM 接收的是聚焦且高度相关的文本摘录。无令牌浪费,也避免“中间丢失”(lost-in-the-middle)问题。
“分析这篇论文中的特定方面” → 使用 Boof + query(成本最低、最聚焦)
“总结整份文档” → 先 Boof,再逐节阅读生成的 Markdown,分别总结每节内容,最后合并摘要。详见 advanced-usage.md。
“跨多篇论文对比研究发现” → 将所有论文 Boof 至同一集合中,然后跨集合统一查询。
“查找论文中讨论 X 的位置” → 使用 qmd search "X" -c collection 进行精确匹配;使用 qmd query "X" -c collection 进行语义匹配。
转换生成的 Markdown 文件默认保存至 knowledge/boofed/(可通过 --output-dir 参数覆盖)。
若 boof.sh 报告缺少依赖项,请参阅 setup-guide.md 获取安装说明(需安装 Java + opendataloader-pdf + QMD)。
ODL_ENV —— opendataloader-pdf Python 虚拟环境路径(默认:~/.openclaw/tools/odl-env)QMD_BIN —— qmd 二进制文件路径(默认:~/.bun/bin/qmd)BOOF_OUTPUT_DIR —— 默认输出目录(默认:~/.openclaw/workspace/knowledge/boofed)相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.4万人学习
共49课时 | 82.2万人学习