dify中需构建专利预审系统:先结构化获取并清洗专利数据,再配置规则引擎校验形式缺陷,最后通过双路检索与加权相似度评估识别技术重合风险。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要在Dify中搭建一套能自动预审企业专利申请文件、识别形式缺陷,并比对已公开专利库计算技术相似度的系统,避免人工逐条核对说明书、权利要求书格式与现有技术重合风险。
准备专利文本结构化数据源
第一步:从国家知识产权局官网或第三方API(如Incopat、PatentSight)导出近5年授权发明专利的XML或JSON格式全文数据,确保包含说明书、权利要求书、摘要、IPC分类号字段。不要用PDF截图或OCR文本——【OCR识别错误会导致权利要求项编号错乱,后续规则匹配全部失效】。
第二步:将原始数据清洗为统一JSON Schema,每个专利文档必须含以下键:id、title、abstract、claims(数组,每项为字符串)、description(长文本)、ipc_classes(字符串数组)。缺失claims字段的记录直接丢弃。
第三步:用Python脚本调用Dify Data API批量上传,设置chunk_size=512、overlap=64,启用“自动分割并保留段落语义”选项。这一步耗时较长,但跳过会导致后续RAG检索召回率低于40%。
配置专利预审规则引擎
方法一:使用Dify内置LLM节点编写结构化校验逻辑
在Workflow中添加“LLM”节点,模型选Qwen2.5-72B-Instruct,系统提示词写明:“你是一名资深专利代理师,严格按《专利审查指南》第二部分第二章执行形式审查。输入为JSON格式专利申请稿,输出为JSON数组,每项含字段:rule_id(如‘claims_numbering’)、status(‘pass’/‘error’)、message(具体问题描述)、suggestion(修改建议)。禁止自由发挥,只返回JSON。”
方法二:接入外部规则服务(推荐用于高并发场景)
部署一个FastAPI服务,接收Dify传入的claims数组,逐条正则匹配:^\d+\.\s+.*$ 验证编号连续性,用spacy加载中文法律术语模型检测“所述”“其特征在于”等关键表述是否缺失。Dify通过HTTP节点调用该服务,超时设为8秒——【超过10秒未响应会触发Dify默认降级,返回空结果】。
PHP中文网提供Qwen-1.0.2.6 MacOS官方客户端下载,专为苹果电脑优化的阿里通义千问桌面应用。本版本深度适配Mac系统,支持本地高效运行与多模态交互,集成超长上下文处理、AI写作、代码生成及智能体构建等核心功能。通过官方渠道下载,确保安全稳定,助您实现智能办公与创作升级。
构建专利相似度评估工作流
第一步:在Knowledge空间创建“已公开专利库”,上传清洗后的JSON数据集,索引类型选“Hybrid Search”,Embedding模型固定为bge-m3-zh,权重设置:keyword:0.3、semantic:0.7。
第二步:设计双路检索策略
→ 用户上传新申请文件 → 提取权利要求1的首句 + IPC分类号前三位 → 并行触发两路检索:① Keyword检索(IPC字段精确匹配);② Semantic检索(权利要求首句向量化) → 合并结果去重,截取Top20。
第三步:相似度打分模块
调用Dify内置Compare节点,对比新申请的权利要求1与Top20中每篇专利的权利要求1,使用Jaccard相似度(基于分词后关键词集合)和BERTScore(中文微调版)加权平均,权重设为Jaccard:0.4、BERTScore:0.6。得分高于0.65标为“高风险”,0.4–0.65为“中风险”,低于0.4为“低风险”。
第四步:生成可追溯报告
将每篇比对专利的id、标题、相似度分值、高亮差异片段(如“本发明涉及…”,对比原文中对应句)打包为Markdown表格,插入最终输出模板。注意:表格必须包含原始专利链接(来自Incopat的detail_url字段),否则代理师无法验证。










