不同pdf类型需匹配对应模型:原生文本pdf用glm-5.1保格式,扫描图片pdf用kimi k2.7或deepseek v4-pro做ocr,混合型pdf必须拆解后分模型处理。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

WorkBuddy处理PDF文档时,模型选错会导致解析失败、表格错乱、扫描件直接跳过——不是AI没能力,而是你没给它配对的“眼睛”和“手”。
先看结论:不同PDF类型,必须换不同模型
原生文本PDF(能复制文字)→用【GLM-5.1】最稳;扫描图片PDF(打开是图)→必须上【Kimi K2.7】或【DeepSeek V4-Pro】带OCR能力的模型;混合型PDF(前几页可复制、中间几页是图)→得拆开处理,不能一股脑丢给一个模型。
原生文本PDF:选GLM-5.1,格式不崩、表格不散
第一步:确认PDF是否为原生文本——随便点一段文字,能高亮+复制,就是原生文本。
第二步:在WorkBuddy右上角头像→设置→模型选择→切换至GLM-5.1。
第三步:输入指令时明确写“请从PDF中提取所有表格,保留原始行列结构,不要合并单元格”,GLM-5.1会严格按PDF逻辑分页识别,不会把跨页表格强行压成一列。其他模型如MiniMax M2.5容易把表头和数据行错位,V4-Flash则可能跳过附注里的小表格。
扫描图片PDF:必须用带OCR能力的模型
方法一:Kimi K2.7-Code(0.57x档)
它内置轻量OCR引擎,对A4纸打印件、发票、合同扫描件识别准确率超92%,且能自动区分文字区与印章/水印区域,不把红章当正文识别。
方法二:DeepSeek V4-Pro(0.51x档)
适合高精度场景,比如年报里带斜体小字号的审计说明页,它会先做图像增强再OCR,比K2.7多花0.8秒,但数字错误率下降67%。
注意:混元Hy3和MiniMax M2.5完全不支持OCR,丢进去只会返回“未检测到可读文本”。
混合型PDF:拆解预处理是关键
① 先用WorkBuddy的pdf技能识别文档结构:输入“分析这份PDF的页面类型,标出哪些页是文本层、哪些页是图像层”。
② 把图像页单独导出为新PDF文件(命名加“-img”后缀)。
③ 文本页用GLM-5.1处理,图像页用K2.7-Code处理。
④ 最后用WorkBuddy的xlsx技能把两路结果自动合并进同一张Excel,字段对齐靠“页码+关键词定位”,不是靠人工拖拽。
这一步不做拆解,直接喂给任何单一模型,都会在第17页(通常是审计报告图页)开始漏数据,且无报错提示。










