需用qwen-vl-plus或qwen2-vl模型识别发票字段,输入base64/https图片,按指定json格式输出;pdf需先转单页图,多图可用循环或拼接长图处理;图表分析需预处理增强对比度;结果可转excel并下载。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

在扣子中调用图像理解模型识别发票关键字段
你需要从手机拍的模糊发票照片、扫描件或PDF截图中快速提取发票代码、金额、开票日期等结构化信息,避免手动录入错误和重复劳动。
打开扣子(Coze)平台,进入你已创建的 Bot 编辑界面→点击左侧【工作流】→新建一个工作流节点→选择【大模型】类型→在模型下拉菜单中选中 【Qwen-VL-Plus】 或 【Qwen2-VL】(二者均支持中英文混合图文理解,且对税务单据类图像优化较好;若未显示,请先在【Bot 设置→插件与模型】中启用对应视觉模型权限)。
在该节点的提示词框中输入:「请严格按以下JSON格式输出:{"invoice_code":"", "invoice_number":"", "date":"", "amount":"", "seller_name":"", "buyer_name":""}。仅输出JSON,不加任何说明、前缀或后缀。若某字段不可见则留空字符串。」
将上一步的图像输入连接至该节点的【image】参数槽位——注意:必须是 Base64 编码后的图片数据或可公开访问的 HTTPS 图片 URL;本地路径(如 C:\xxx.jpg)或相对路径会直接报错。
处理含多张发票的PDF或长图
扣子原生不支持PDF解析,需前置转换。先用 Python 脚本或在线工具(如 ilovepdf.com)将 PDF 拆为单页 JPG/PNG,每页一张发票;或使用 ImageMagick + Ghostscript 命令行批量转图(Windows 示例):magick -density 300 invoice.pdf -quality 95 page_%03d.jpg。
方法一:逐页调用图像理解节点
在工作流中插入【循环】节点,遍历图片列表→每次迭代触发一次 Qwen-VL 调用→结果收集进数组→最后用【合并 JSON 数组】节点统一输出。
统一LLM网关 - 一个API对接70+AI模型,使用单一API密钥即可调用GPT、Claude、Gemini、Qwen、Deepseek、Grok等主流模型。
方法二:拼接为长图后单次识别(适合发票排版规整的扫描件)
用 PIL 将多张发票图垂直拼接为一张长图,宽度保持一致(建议 1200px),高度自适应;拼接后图像需控制总大小 【不超过8MB】,否则扣子会拒绝上传;拼接时每张图之间加 40px 白色间隔,避免模型误判跨页字段。
从图表中提取趋势与数值(非发票类图像)
当你需要分析销售折线图、库存柱状图或财务饼图时,图像理解模型能直接读出坐标轴含义、关键点数值和整体结论。
第一步:上传图表图像至扣子知识库作为「文件」类型素材(支持 PNG/JPG),并打标签如 #sales_chart、#q2_revenue;
第二步:在 Bot 回复逻辑中添加【检索】节点,设置关键词匹配该标签;
第三步:将检索出的图表文件 ID 传入图像理解节点,提示词改为:「描述这张图表的类型、横纵轴含义、最高/最低值对应的数据点、以及近三个月销售额变化趋势(上升/下降/平稳)。用中文分点回答,不要 JSON。」
这一步不能依赖模型自动识别图例位置——如果图表中图例遮挡数据点、或颜色对比度低(如灰底配浅蓝柱),识别率会骤降。务必在上传前用画图工具手动增强对比度或标注箭头指引关键区域。
将识别结果写入 Excel 并触发下载
图像理解节点输出 JSON 后,立即接入【数据处理】节点,选择「JSON 转表格」功能,字段名自动映射为表头;
接着连接【Excel 操作】节点→选择【创建新文件】→设置文件名为「invoice_extract_{{now|date:"Ymd_His"}}.xlsx」;
勾选【自动填充数据】,源数据选上一步表格;
最后添加【文件下载】节点,将 Excel 文件作为 Bot 回复内容推送给用户。
注意:Excel 节点默认只写入首 Sheet,若需多表(如“发票明细”+“统计汇总”),必须拆成两个独立的【Excel 操作】节点,分别指定 sheet_name 参数;否则第二个写入会覆盖第一个。










