夸克支持从网页、pdf(嵌入式/扫描件)及图片中精准提取结构化表格:网页需用ai网页分析并明确字段;pdf嵌入表可用文档模块或ai指令提取;扫描件需ocr增强+结构分析;提取后可自然语言清洗重排。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

你需要从网页、PDF或图片中快速提取结构化表格数据,但目标内容被广告遮挡、表格是扫描件或列名不标准,手动复制粘贴容易错行漏列。
从网页中提取HTML表格或视觉对齐表格
该方法适用于电商参数页、政府公示表、新闻数据图表等已加载完成的网页,无需截图或下载。
第一步:在夸克浏览器中打开目标网页,确保页面完全加载,关闭所有弹窗和悬浮广告栏——【若页面未完全加载,AI可能只识别到前两行】。
第二步:长按屏幕任意空白处约1秒,调出菜单后点击「AI网页分析」;或直接点击地址栏右侧的「AI」图标。
第三步:在指令框中输入明确字段要求,例如:“提取本页商品表格,字段为:品牌、型号、月销量、好评率”,不要写“把表格给我”这种模糊指令。
第四步:等待3~8秒,AI返回带表头的纯文本表格,点击右下角「复制到Excel」按钮,自动适配制表符分隔,粘贴进WPS或Excel即成标准行列。
从PDF中提取嵌入式表格(非扫描件)
此路径专用于标准PDF文档中以矢量或表格对象形式嵌入的可选中表格,比如券商研报、年报附表、学术论文附录。
方法一:文档模块一键提取
打开夸克App→底部切换至【文档】→点击右上角「+」→选择「导入文件」→选取目标PDF→文件加载完成后,点击右上角「更多」→选择「提取表格」→系统自动定位全部表格区域并生成缩略图列表→点击任一缩略图预览,确认无误后勾选→点击底部「导出为Excel」。
方法二:AI对话指令触发
在夸克AI主界面输入:“从我刚上传的《2025行业白皮书.pdf》中提取第7页的‘区域市场份额对比表’,保留原表头,数字列不加千分位”,AI将跳过图像识别阶段,直取PDF底层表格对象数据。
从扫描版PDF或图片中识别并重建表格
当PDF是拍照生成或OCR识别失败后的灰度图时,必须启用图像语义分割能力,否则提取结果全是乱码或单列堆叠。
① 进入【文档】模块→点击「扫描文档」→选择「从相册导入」→选取扫描版PDF或JPG/PNG图片。
② 导入后点击右上角「AI处理」→选择「OCR增强识别」→等待识别完成,进入预览页。
③ 点击左下角「结构分析」标签,系统高亮所有被识别为「表格」的区块(蓝色虚线框),若某处未被框选,说明该区域文字密度或边框线不达标,需返回重拍。
④ 长按任一表格高亮区域→选择「识别为表格」→AI启动像素级列对齐算法,自动补全缺失横线与纵线,输出CSV结构化文本。
⑤ 点击「复制数据」,粘贴至Excel时选择“使用文本导入向导”,分隔符选“制表符”,完成列对齐。
用自然语言指令清洗并重排已提取表格
提取出来的表格常有标题错位、空行干扰、单位混杂等问题,此时不能靠手动删改,要用语义指令让AI理解业务逻辑。
在AI输入框中输入:“把‘单价’列所有含‘元/件’的文字替换为纯数字,删除‘规格’列中为空或含‘待定’的整行,将‘上市时间’列统一转为YYYY-MM-DD格式,最后按‘销量’降序排列。”
系统会实时高亮将要修改的单元格,并显示清洗后预览效果。确认无误后点击「执行」,整个过程不破坏原始列语义关系。
执行完成后,点击右上角「导出」→选择「Excel(.xlsx)」→文件自动保存至夸克文档/导出目录。









