使用 PaddleOCR API 解析文档,支持图像和 PDF 的同步与异步模式。
PaddleOCR 文档解析是一项面向实际任务的技能,主要用于使用 PaddleOCR 的 API 的 PDF 图像和文件;支持同步和同步解析模式, 并带有结构化输出;
Official。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。
从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
使用 PaddleOCR 的 API 解析图像和 PDF 文件。支持同步与异步两种解析模式,并输出结构化结果。
| 资源 | 链接 |
|---|---|
| 官方网站 | https://www.paddleocr.com |
| API 文档 | https://ai.baidu.com/ai-doc/AISTUDIO/Cmkz2m0ma |
| GitHub 仓库 | https://github.com/PaddlePaddle/PaddleOCR |
export PADDLEOCR_ACCESS_TOKEN="your_token_here"
export PADDLEOCR_API_URL="https://your-endpoint.aistudio-app.com/layout-parsing"
# 可选:异步模式所需
export PADDLEOCR_JOB_URL="https://your-job-endpoint.aistudio-app.com/api/v2/ocr/jobs"
export PADDLEOCR_MODEL="PaddleOCR-VL-1.5"
适用于小文件及快速处理场景:
# 解析本地图像
{baseDir}/paddleocr_parse.sh document.jpg
# 解析 PDF 文件
{baseDir}/paddleocr_parse.sh -t pdf document.pdf
# 从 URL 解析图像
{baseDir}/paddleocr_parse.sh https://example.com/document.jpg
# 将结果保存至文件
{baseDir}/paddleocr_parse.sh -o result.json document.jpg
# 启用详细日志输出
{baseDir}/paddleocr_parse.sh -v document.jpg
适用于大文件并需跟踪处理进度的场景:
# 异步解析大型 PDF 文件
{baseDir}/paddleocr_parse.sh --async large-document.pdf
# 通过 URL 异步解析 PDF
{baseDir}/paddleocr_parse.sh --async -t pdf https://example.com/doc.pdf
# 将异步解析结果保存至文件
{baseDir}/paddleocr_parse.sh --async -o result.json document.pdf
# 同步模式
python3 {baseDir}/paddleocr_parse.py document.jpg
# 异步模式
python3 {baseDir}/paddleocr_parse.py --async-mode document.pdf
# 指定输出文件的异步解析
python3 {baseDir}/paddleocr_parse.py -o result.json --async-mode document.pdf
{
"logId": "unique_request_id",
"errorCode": 0,
"errorMsg": "Success",
"result": {
"layoutParsingResults": [
{
"prunedResult": [...],
"markdown": {
"text": "# 文档标题nn段落内容...",
"images": {}
},
"outputImages": [...],
"inputImage": "http://input-image"
}
],
"dataInfo": {...}
}
}
关键字段说明:
prunedResult — 包含详细的版面元素信息,如位置坐标、类别标签等markdown — 存储转换后的 Markdown 格式文档内容,保留原始结构与排版样式| 使用场景 | 推荐模式 |
|---|---|
| 小尺寸图像(< 10MB) | Sync |
| 单页 PDF | Sync |
| 大型 PDF(> 10MB) | Async |
| 多页文档 | Async |
| 批量处理任务 | Async |
| 快速文本提取 | Sync |
脚本在以下情况将退出并返回错误码 1,同时打印错误信息: