可采用五种技术路径实现招聘jd结构化抽取:一、siameseuie零样本抽取;二、rexuninlu镜像web批量解析;三、gte-large向量+指针网络轻量服务;四、qwen3.5-9b-awq指令式抽取;五、正则+规则引擎兜底。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您手头有一份非结构化的招聘JD文本,但需要从中快速、准确地提取出岗位名称、技能要求、薪资范围等结构化字段,则可能是由于JD表达自由度高、术语嵌套多、数值语义复杂所致。以下是实现该目标的多种技术路径:
一、使用SiameseUIE中文-base模型进行零样本抽取
该方法依赖Schema驱动的提示学习机制,无需标注数据或微调训练,仅通过自然语言定义抽取目标,模型即可在原文中定位并返回对应文本片段。其双流编码器结构能有效建模“技能要求”等提示词与JD中技术栈描述之间的深层语义对齐。
1、准备一段原始JD文本,例如:“招聘Java后端开发工程师,需熟练掌握Spring Boot、MyBatis、Redis,有分布式系统设计经验;学历要求本科及以上;薪资范围20K-35K·16薪。”
2、构造JSON格式Schema,明确指定待抽取字段:{"岗位名称": null, "技能要求": null, "学历要求": null, "薪资范围": null}
3、将JD文本与Schema一同输入SiameseUIE中文-base模型推理接口。
4、接收模型输出的结构化结果,如:{"岗位名称": "Java后端开发工程师", "技能要求": "Spring Boot、MyBatis、Redis、分布式系统设计", "学历要求": "本科及以上", "薪资范围": "20K-35K·16薪"}
二、基于RexUniNLU镜像的Web界面批量解析
该方案面向无代码环境,预置完整运行时,适合HR或运营人员直接操作。镜像已集成文本预处理、Schema配置、结果导出功能,支持单条调试与百条批量提交,避免本地部署与环境配置负担。
1、启动CSDN星图提供的RexUniNLU镜像,访问自动打开的Web界面地址。
2、在输入框粘贴JD文本,或上传包含多条JD的TXT/CSV文件。
3、点击“定义Schema”,选择预设模板“招聘JD四要素”,或手动添加字段如“云服务”“软技能”“工作地点”。
4、点击“开始解析”,等待处理完成,查看表格化结果并导出为Excel。
三、调用GTE文本向量-large构建轻量级三要素抽取服务
该路径适用于企业私有化部署场景,利用GTE-large强大的中文句向量表征能力,结合指针网络实现技能、学历、经验三类字段的联合抽取。模型不生成新内容,仅做原文片段定位,保障结果可追溯、无幻觉。
1、加载ModelScope平台上的iic/nlp_gte_sentence-embedding_chinese-large模型权重。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
2、对JD全文进行滑动窗口切分,并为每个窗口文本生成向量表示。
3、构建三个独立的二分类头,分别判断窗口是否属于“技能要求”“学历要求”“工作经验”语义范畴。
4、对每个类别得分最高的连续窗口进行合并,提取原始字符跨度作为最终抽取结果。
四、采用Qwen3.5-9B-AWQ-4bit模型执行指令式抽取
该方法利用大语言模型的强指令遵循能力,在低显存开销下完成高精度结构化输出。AWQ量化版本可在消费级显卡上实时运行,适合嵌入内部HR系统后台,响应延迟低于800ms。
1、部署Qwen3.5-9B-AWQ-4bit模型服务,启用chat template以兼容系统提示格式。
2、构造系统提示:“你是一个专业的招聘数据分析师,请严格按JSON格式返回以下字段:岗位名称、核心职责(3–5条)、硬性要求(学历、经验等)、薪资范围。不要添加任何解释性文字。”
3、将JD全文作为用户输入传入模型,设置temperature=0.0以确保确定性输出。
4、解析模型返回的JSON字符串,校验字段完整性,对缺失字段填充null值。
五、构建正则+规则引擎兜底层
该方法作为上述AI模型的补充手段,用于覆盖模型置信度低或格式极端异常的JD样本。通过人工归纳高频模式形成规则库,具备强可控性与可审计性,适用于合规审查严苛的金融、政务类客户。
1、建立关键词白名单,如“学历:”“要求:”“任职资格:”“薪资:”“待遇:”等常见引导词。
2、为薪资字段编写多模态正则:匹配“\d+[KkWw万]\s*[-~—至]\s*\d+[KkWw万]”、“年薪\d+[Ww万]起”、“面议”、“\d+K\s*×\s*\d+薪”等变体。
3、对技能字段采用术语词典匹配,加载行业标准技能库(含缩写映射表,如“K8s→Kubernetes”)。
4、当AI模型抽取结果为空或置信度低于0.65时,自动触发规则引擎进行二次扫描并融合结果。










