longcat ai 通过“文字识别→区域定位→语义擦除→背景重建”流程实现文档敏感信息精准遮盖,需先将文档转为高质量图片,再用 longcat-image-editn 模型处理,支持中文自然语言指令、本地部署及安全代理预审。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

LongCat AI 本身不直接处理文档(如 PDF、Word),而是专注图像编辑。要实现对文档中敏感数据的遮盖,需先将文档转为图片,再用 LongCat-Image-Editn 模型执行精准擦除。整个流程强调“文字识别→区域定位→语义擦除→背景重建”,不是简单打码。
把文档转成高质量图片
这是前提。扫描件或截图质量直接影响识别效果:
- 优先用高分辨率扫描(300 DPI以上),避免模糊、倾斜、反光;
- PDF 转图建议用
pdf2image或 Adobe Acrobat 导出为 PNG,禁用压缩; - 手写体或印章重叠区域,可先做二值化预处理(如 OpenCV 的自适应阈值),提升文字可读性。
用自然语言指令精准擦除
LongCat-Image-Editn 支持中文指令,关键在于描述要具体、位置要明确:
监控一个或多个 GitCode 仓库的 PR,通过 OpenClaw Gateway 自动执行 AI 审查,发布 PR 评论,并发送钉钉和企业微信通知。
- ✅ 推荐写法:“擦除身份证号区域并智能填充背景”“隐去右下角银行账号,保留周围表格线条”;
- ❌ 避免模糊表达:“把敏感信息去掉”“打个马赛克”——模型无法自主判断什么是“敏感”;
- 若需批量处理,可封装为 API 调用,指令字段传入结构化提示,例如:
{"instruction": "删除图片中所有18位身份证号码", "preserve_layout": true}。
部署本地服务保障数据不出域
文档常含高度敏感内容,绝不能上传公网。必须本地部署:
- 从 CSDN 星图镜像广场拉取 “LongCat-Image-Editn(内置模型版)V2”,一键部署到内网服务器;
- 确认服务监听地址仅限内网访问(如
192.168.x.x:7860),关闭公网端口; - 若集成进 OA 或文档系统,API 请求走内部网络,不经过互联网出口。
搭配前置安全层自动拦截
靠人工写指令仍存在漏配风险。建议叠加 OpenClaw 类安全代理做自动化预审:
- 在文档转图前,用正则规则扫描文本层(如 PDF 提取文字),命中
\b\d{17}[\dXx]\b就触发 LongCat 自动擦除任务; - 配置脱敏模块,把识别出的身份证号、手机号等替换为占位符,再送入图像编辑流程;
- 所有操作留审计日志,记录原始文件名、擦除字段位置、处理时间,满足等保合规要求。










