应启用ocr技能:一、腾讯云ocr skill接入;二、本地部署nanobot+qwen3-4b-instruct模型;三、配置gemini 3 flash直连识别;四、启用pytesseract本地ocr技能。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您在微信中收到图片,需要快速提取其中的文字内容,但发现OpenClaw默认未启用图像识别能力,则可能是由于OCR技能未正确接入或模型配置缺失。以下是解决此问题的步骤:
一、使用腾讯云OCR Skill接入识别服务
该方法通过调用腾讯云通用文字识别API,实现高精度、多语种、抗排版干扰的图片文字提取,适用于简历、合同、截图等复杂场景。
1、访问Clawhub官网(https://clawhub.ai/),注册并登录账号。
2、进入Settings页面,点击API tokens,选择Create token,复制生成的token字符串。
3、在终端执行命令:clawhub login --token 【您的token】完成身份认证。
4、运行指令:clawhub search ocr查找可用OCR技能列表。
5、执行安装命令:clawhub install tencent-ocr-skill部署腾讯云OCR模块。
6、在OpenClaw配置文件~/.openclaw/openclaw.json中确认已启用该skill,并设置默认触发关键词为“识别图片”或“提取文字”。

二、本地部署nanobot+Qwen3-4B-Instruct模型
该方案完全离线运行,所有图像处理均在本地完成,保障敏感文档隐私不外泄,适合处理涉密材料或网络隔离环境。
1、确保系统已安装Docker,执行:docker pull nanobot/qwen3-4b-instruct拉取nanobot镜像。
2、启动服务容器:docker run -p 8000:8000 nanobot/qwen3-4b-instruct。
3、编辑~/.openclaw/openclaw.json,在models.providers下新增nanobot配置段,指定baseUrl为http://localhost:8000/v1。
4、创建自定义Python技能脚本screen_ocr.py,继承BaseSkill类,调用PIL加载图片并封装为base64传入nanobot接口。
5、在技能中设置input_type = "image"与output_format = "structured_text",确保返回结果含段落标记与坐标信息。

三、配置Gemini 3 Flash模型直连识别
利用Gemini 3 Flash模型的高速图文理解能力,适配微信截图类短文本识别任务,在响应速度与轻量级部署间取得平衡。
1、确认已配置Gemini API密钥,并在openclaw.json中添加google-generative provider条目。
2、将模型ID设为gemini-3-flash,并启用vision能力开关。
3、关闭Fallback机制,避免因首次识别失败触发冗余回退请求。
4、在微信中长按图片选择“转发给OpenClaw”,自动触发/think指令流程。
5、向OpenClaw发送自然语言指令,例如:“提取图中第三列电话号码,按CSV格式输出”,模型将结合上下文结构化响应。

四、启用PyTesseract本地OCR技能
该方法无需联网、不依赖外部API,基于Tesseract OCR引擎实现基础文字识别,适用于纯文本截图、白底黑字文档等低复杂度图像。
1、在Mac系统中执行:brew install tesseract;在Ubuntu中执行:sudo apt-get install tesseract-ocr。
2、安装Python绑定库:pip install pytesseract pillow。
3、新建技能文件tesseract_ocr.py,使用PIL.Image.open()读取微信保存的图片路径。
4、调用pytesseract.image_to_string()函数,指定lang='chi_sim+eng'以支持中英文混合识别。
5、将识别结果通过self.send_message()返回至微信对话窗口,支持自动换行与标点保留。











