可采用四种方法实现pdf简历结构化提取:一、调用千问3.5-2b api进行图解析与标签匹配;二、基于openclaw+千问3.5-35b本地化流水线;三、使用千问3.5-27b多模态接口直接解析pdf图像;四、通过千问app批量上传+表格agent生成汇总表。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您拥有PDF格式的求职简历,但需要从中快速提取姓名、教育背景、工作经历等关键字段并转为结构化数据,则可能是由于PDF内容非文本化或版式复杂导致传统工具识别失败。以下是实现千问驱动的PDF简历自动解析与信息结构化提取的多种方法:
一、调用千问3.5-2B API进行简历图解析与标签匹配
该方法面向HR部门日常高频操作,支持将PDF先转为截图或直接上传图片,通过视觉层识别+文本层抽取+语义层建模三层结构,直接输出技能标签与匹配度分数,适合轻量级快速部署。
1、准备简历PDF文件,使用PyMuPDF(fitz)库提取每页图像:确保导出PNG分辨率不低于300dpi,避免文字模糊。
2、对每张截图进行Base64编码,并构造API请求载荷,prompt中必须明确指定:“请提取这份简历中的个人信息、教育背景、工作经历,并以JSON格式返回,字段包括name、contact、education、experiences”。
3、向https://your-domain.com/api/qwen35-2b发送POST请求,接收响应体中的JSON字符串。
4、解析返回结果,验证education数组是否包含学位、院校、时间三项,experiences数组中每项是否含company、role、duration字段。
二、基于OpenClaw+千问3.5-35B本地化流水线
该方法通过本地部署的OpenClaw智能体协调文件处理与大模型推理,全程数据不出设备,保障候选人隐私安全,适用于技术团队对结构化输出和高精度语义理解有强需求的场景。
1、执行安装脚本完成OpenClaw核心组件部署:curl -fsSL https://openclaw.ai/install.sh | bash。
2、运行配置向导并选择Advanced模式,在Provider中指定qwen-local,勾选file-processor和data-analyzer技能。
3、编辑~/.openclaw/openclaw.json,配置千问3.5-35B模型端点,确保baseUrl指向本地运行的http://localhost:8080/v1服务。
4、启动OpenClaw网关与千问模型服务(需分终端运行),验证模型状态:openclaw models list应显示qwen3-35b为active。
5、将PDF简历放入~/resume_processor/inbox目录,系统将自动触发解析、字段提取与结构化JSON生成流程。
三、使用千问3.5-27B多模态接口直接解析PDF图像
Qwen3.5-27B具备原生PDF图像理解能力,可跳过OCR预处理环节,直接从扫描件或图文混排PDF中识别区块语义,适用于教育背景与工作经历位置不固定的简历模板。
1、准备本地部署的Qwen3.5-27B服务端点,确认Web UI或API接口已就绪,地址为http://localhost:7860/generate_with_image。
2、使用requests库构建multipart/form-data请求,以二进制方式上传PDF第一页截图文件,并在data参数中传入prompt:“请识别并结构化提取教育背景与工作经历,输出为标准JSON,education字段为字符串数组,experience字段为对象数组,每个对象含company、role、duration、details四项”。
3、接收响应后检查JSON格式合法性,重点验证duration字段是否被正确识别为“2020.09–2023.06”类格式,而非自然语言描述。
4、将输出JSON保存为resumes_structured.json,供后续导入HRM系统使用。
四、通过千问APP内建批量上传+表格Agent联动生成汇总表
该方法无需部署本地环境,在端侧完成全部处理:批量上传后,表格Agent自动构建跨文档实体映射关系,识别同义字段(如“签约方”“甲方”“委托单位”)并归一化为标准列名,再执行值聚合与冲突消解。
1、打开通义千问APP,进入“文档”页,点击“批量上传”,一次选择最多100个PDF简历文件。
2、上传完成后,在对话框中输入指令:“将所有简历中的姓名、学历、最高学位、毕业院校、最近公司、职位、工作年限提取出来,生成一张Excel表格”。
3、等待表格Agent完成处理,查看预览界面中字段对齐效果,确认“工作年限”列是否已根据“2021年至今”等描述自动计算为数值型结果。
4、点击导出按钮,下载生成的resume_summary.xlsx文件,其中每一行对应一份简历的结构化字段。











