将PDF中的表格和文本提取到Excel工作簿(XLSX),每页对应一个工作表。
PDF 到 Excel是一项面向实际任务的技能,主要用于What It Does. 从 PDF 中将表格和文本从 Excel 工作簿中摘录出来;每个页面都成为单独的工作表。
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;
若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
从 PDF 中提取表格和文本,并生成 Excel 工作簿。PDF 的每一页对应工作簿中的一个独立工作表。采用 PyMuPDF 进行表格检测,若检测失败则回退至逐行文本提取方式。
请提供以下任一输入:
url — 指向 PDF 文件的公开 URLfile — Base64 编码的 PDF 内容file 字段在请求头中通过 CLIENT-API-KEY 字段发送您的 API 密钥。
前往 https://pdfapihub.com 免费获取您的 API 密钥。完整的 API 文档请参阅 https://pdfapihub.com/docs。
/v1/convert/pdf/excel 是该接口的别名curl -X POST https://pdfapihub.com/api/v1/convert/pdf/xlsx
-H "CLIENT-API-KEY: your_api_key"
-H "Content-Type: application/json"
-d '{ "url": "https://pdfapihub.com/sample-pdfinvoice-with-image.pdf", "output": "url" }'
相关专题
热门下载
相关下载
精品课程
共162课时 | 43.7万人学习
共15课时 | 1.8万人学习
共28课时 | 3.5万人学习