openclaw 通过“提取+理解”两步读取 pdf:先用 pdf-text-extractor 或 nano-pdf 提取文字、表格、标题等结构,扫描件需 ocr;再送入 glm-4.7-flash 等大模型执行摘要、问答等任务。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

OpenClaw 能读取 PDF,但不是“直接读懂”,而是通过两步完成:先准确提取文字和结构,再交给 AI 模型理解分析。关键在于选对技能、配好模型、用对方式。
PDF 读取分两步:提取 + 理解
PDF 本质是排版锁定的格式,可能含纯文本、扫描图片或混合内容。OpenClaw 不跳过底层处理,必须先“拆解”,再“思考”:
- 提取层:用 pdf-text-extractor 或 nano-pdf 技能把 PDF 中的文字、表格、标题层级等还原为可处理的文本流;扫描件需搭配 OCR(如 pdf-structure-enhancer 内置能力)
- 理解层:把提取出的文本送入本地或云端大模型(如 GLM-4.7-Flash、Qwen3-4b-instruct),执行摘要、问答、关键信息抽取等任务
三种主流使用方式(按推荐顺序)
不用写代码也能上手,适配不同场景:
OpenClaw 自我进化框架一键部署。安装宪法(AGENTS.md)、可进化灵魂(SOUL.md)、心跳系统、PARA三层记忆架构、目标管理,并通过场景化对话引导用户定义 Agent 性格。自动配置 EvoClaw(审批制进化)和 Self-Improving Agent(自主学习)。触发场景:"setup o...
-
命令行一键处理:适合单文件快速摘要
例如:openclaw process --file ~/report.pdf --task summary,自动调用已启用的 PDF 技能链与默认模型 -
Web 控制台拖拽上传:支持多文件、页面筛选、自定义提示词
上传后选择“PDF 分析工具”,可指定分析范围(如仅第3–8页)、输入指令(如“提取甲方义务条款并列表”) -
微信/Slack 自动触发:配置网关后,发 PDF 到企业微信机器人,自动执行预设流程
需提前安装pdf-analyzer和wechat网关技能,并在配置中启用文件监听
确保 PDF 能被正确读取的关键设置
很多失败不是模型不行,而是输入没准备好:
-
检查文件来源:本地路径支持
~展开(如~/Downloads/file.pdf),HTTP 链接需可公开访问;扫描 PDF 建议先用 nano-pdf 技能,它默认启用 OCR -
确认技能已启用:运行
clawhub list查看pdf-text-extractor、pdf-structure-enhancer或nano-pdf是否状态为 enabled;未启用则执行clawhub install nano-pdf -
验证模型连接正常:若用本地模型(如 Ollama 的 GLM-4.7-Flash),确保服务在
http://localhost:11434运行,并已在openclaw.json中正确定义 provider
提取核心信息的实用技巧
不只是“全文转文字”,要让结果真正可用:
- 用结构化提示词替代泛泛而谈的“总结一下”,例如:
“提取以下内容,以 JSON 格式返回:1) 文档标题;2) 三个核心结论,每条不超过20字;3) 所有带‘违约’字样的条款原文及所在页码” - 长文档建议分段处理:PDF 工具支持页面范围参数,如
--pages 5-12,18,避免上下文超限 - 合同/论文类文档,配合
paper-digester或pdf-analyzer技能包,可自动识别章节、公式、参考文献并标注类型









