dify可自动抓取解析行业研报并结构化输出核心结论:需通过rss或插件接入数据源,上传pdf/txt/html至知识库,按标题分割,用json提示词与few-shot示例提取6项字段,结合语义检索与定时工作流推送速递卡片。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要让Dify自动抓取、解析并结构化输出每日行业研报的核心结论,而不是手动复制粘贴再整理。这要求助手能识别PDF/网页中的关键段落、提取数据指标、过滤冗余描述,并按固定模板生成速递摘要。
准备研报数据源与接入方式
第一步:确认研报来源是否支持API或RSS。中信、中金、国君等头部券商多数提供公开RSS链接(如https://research.xxx.com/rss),部分需登录后获取;若无RSS,必须用浏览器插件+Webhook模拟人工下载→上传至Dify知识库,【不可直接上传未解压的ZIP包,Dify不解析压缩包内PDF】。
第二步:在Dify「数据集」中新建「行业研报原文」知识库,上传格式限定为PDF、TXT、HTML三种。单次上传不超过50份文件,否则触发限流导致解析失败。
第三步:启用「自动分割」,选择「按标题层级分割」而非「固定长度分割」——研报常含“核心观点”“风险提示”等二级标题,按标题切分才能保留语义完整性。
构建研报结构化提取提示词
方法一:用系统角色指令强制输出JSON格式
在应用「编排」→「提示词」中输入:你是一名资深行业分析师,请从以下研报文本中严格提取6项字段:{行业名称、今日评级、目标价区间、核心驱动因素(≤3条,每条≤12字)、主要风险(≤2条)、关键数据(仅数字+单位,如“+12.3% YoY”)}。所有字段必须存在,缺失则填“暂无”。输出纯JSON,不加任何说明文字。
方法二:用Few-shot示例约束模型行为
在相同提示词区域追加两组真实样例(输入文本片段+对应JSON),样例必须包含“目标价区间为空”和“关键数据含百分比与绝对值”的边界情况——否则模型遇到“维持‘增持’评级,目标价待更新”时会擅自补全为“0-0元”。
配置RAG检索增强逻辑
开启「高级检索」→勾选「启用语义检索」,在「相关性阈值」设为0.68。低于此值的片段不参与生成,避免模型从无关段落(如免责声明、作者简介)中幻觉出“政策利好”等错误结论。
为提升关键字段召回率,在「检索前处理」中添加规则:将用户问题自动重写为“提取【核心驱动因素】”“提取【主要风险】”,而非原问题“今天有什么要点”。【原问题未带字段标识时,模型大概率漏提某一项】
禁用「全文匹配」模式——研报中“风险”一词常出现在“市场风险”“操作风险”等干扰短语里,全文匹配会拉低真正“主要风险”段落的排序权重。
设置每日定时触发与结果分发
进入「工作流」→添加「定时触发器」,设置UTC时间07:00(对应国内15:00,覆盖午间及盘后研报发布高峰)。触发后自动执行:获取最新RSS条目→下载PDF→调用Dify解析接口→运行结构化提示词→生成Markdown速递。
最后一步:在工作流末端连接「飞书机器人」或「企业微信应用」,将输出内容以卡片形式推送。卡片标题固定为“【{行业名称}】{日期}核心速递”,正文使用表格呈现6个字段,确保移动端打开时无需横向滑动。











