需将非结构化文件转为标准json:上传pdf/图片等至扣子知识库,命名避特殊符号;创建bot并严格配置提示词,确保仅输出纯json;调用后须校验格式有效性。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要从PDF、图片或扫描件中提取发票信息、合同条款、聊天记录等非结构化内容,并自动转成标准JSON格式供下游系统调用。
准备待处理的非结构化数据源
将原始文件上传至扣子知识库:支持PDF(含扫描版)、JPG/PNG(需文字清晰)、TXT、DOCX。单次上传不超过100MB,【文件名不能含中文括号、斜杠、星号等特殊符号】,否则后续解析会失败。
上传后点击“立即处理”,等待右上角出现绿色对勾图标,表示OCR与文本切片已完成。
创建专用提取Bot并配置提示词
新建Bot → 选择“自定义Bot” → 在“提示词”编辑区粘贴以下结构化指令:
你是一个专业数据提取器。请严格按以下规则处理用户提供的文本:①只输出纯JSON,不加任何说明、注释、markdown格式;②字段名必须为:invoice_number、issue_date、amount_cny、seller_name、buyer_name;③日期统一为YYYY-MM-DD格式;④金额只保留数字和小数点,不带逗号、货币符号;⑤缺失字段填null;⑥禁止虚构任何值。
这一步决定输出是否合规——漏掉“只输出纯JSON”会导致返回带解释文本,下游系统解析直接报错。
调用Bot完成提取与JSON校验
方法一:在Bot调试窗口直接粘贴文本 → 点击“发送” → 复制返回内容 → 粘贴到JSONLint.com验证格式有效性。
方法二:使用扣子API调用(需开启“公开API”开关)→ 构造POST请求,body中data字段传入base64编码后的文件内容 → 检查响应头Content-Type是否为application/json → 解析response.body。
【若返回内容首行是“```json”或包含中文说明,请立刻返回第二步检查提示词是否遗漏“只输出纯JSON”】










