duck.ai提供五种表格数据提取方法:一、键值对语义提取;二、duckdb清洗导出;三、api批量字段对齐;四、ocr预处理图像pdf;五、示例驱动定制规则。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

如果您正面对大量非结构化文本(如PDF、Word或扫描件),却需要从中快速获取表格形式的结构化数据,则可能受限于格式混乱、单元格合并、上下文缺失等问题。以下是利用Duck.ai实现高效表格数据提取的具体操作路径:
一、使用Duck.ai内置文本解析器直接提取键值对
Duck.ai支持将自然语言描述自动映射为预定义字段,适用于合同、登记表等含明确语义标签的文本。该方法不依赖视觉布局,而是通过语义理解定位关键信息。
1、在Duck.ai界面中点击“新建提取任务”,选择“Key-Value Extraction”模式。
2、粘贴待处理文本,或上传包含文本内容的PDF/DOCX文件。
3、在字段配置区手动输入期望提取的字段名,例如:甲方、乙方、签约金额、签订日期。
4、点击“运行提取”,系统将返回JSON格式结果,每个字段对应其在原文中最可能匹配的值。
二、结合DuckDB执行后处理清洗与结构化输出
当Duck.ai初步提取结果存在冗余、错位或类型错误时,可导出为CSV或Parquet格式,并交由DuckDB进行高性能清洗与重组织。DuckDB原生支持SQL查询与列式计算,适合快速完成去重、类型转换、行列转置等操作。
1、将Duck.ai导出的CSV文件命名为raw_output.csv并保存至本地工作目录。
2、启动DuckDB CLI,执行:.read_csv 'raw_output.csv' AS t。
3、运行清洗语句:SELECT DISTINCT TRIM(甲方) AS party_a, CAST(REPLACE(签约金额,'万元','') AS DOUBLE) * 10000 AS amount_cny FROM t WHERE 甲方 IS NOT NULL;
4、将清洗后结果导出为标准表格:COPY (上述查询) TO 'cleaned_table.xlsx' (FORMAT 'excel');
三、调用Duck.ai API批量处理多文档并按模板对齐字段
针对上百份格式相近但字段位置不一致的文档(如不同银行的贷款申请表),可通过API方式注入统一Schema约束,强制所有文档输出字段对齐,避免人工校验错位风险。
1、在Duck.ai开发者控制台创建新API密钥,并记录Endpoint地址。
2、准备JSON请求体,其中schema字段明确定义目标结构:{"borrower_name":"string","loan_purpose":"string","approved_amount":"number"}。
3、使用curl命令逐个提交PDF Base64编码内容:curl -X POST [endpoint] -H "Authorization: Bearer [key]" -d @request.json。
4、接收响应后,用Python脚本将全部返回的JSON合并为Pandas DataFrame,并导出为单个Excel文件。
四、嵌入OCR预处理流程以支持图像型PDF
对于扫描生成的PDF或截图类文档,Duck.ai默认文本层不可用,需前置OCR识别。Duck.ai已集成Tesseract兼容接口,可自动触发文字识别并保留原始坐标信息,为后续表格结构还原提供基础。
1、上传PDF前,在设置中启用Enable OCR for image-based PDFs选项。
2、选择OCR语言包,推荐使用Chinese (Simplied) + English双语模型以覆盖中英文混排场景。
3、等待OCR完成提示后,系统自动进入结构分析阶段,识别出疑似表格区域及行列边界。
4、在可视化校验界面中,手动拖拽调整误识别的单元格分隔线,确认后触发最终提取。
五、利用Duck.ai的“示例驱动学习”功能定制私有提取规则
当标准模型无法准确识别特定行业术语或特殊缩写(如“SOP-023”、“FY25Q3”)时,可通过提供少量标注样例训练轻量级适配模型,无需代码即可提升领域准确率。
1、进入Duck.ai“Custom Models”页面,点击“Create New Template”。
2、上传3–5份典型文档,并在每份文档中标注至少两个字段实例,例如圈选“项目编号”所在位置并输入值“PRJ-2026-007”。
3、保存模板后,在新任务中选择该模板作为提取引擎。
4、系统将基于标注样本自动泛化规则,对后续同类文档执行一致化字段定位与抽取。











