OCR文档提取——使用OCR技术从扫描文档、照片和图像中提取文字,适用于读取扫描PDF、拍摄页面、手写内容等场景。
OCR文档 - 从扫描的文档和图像中提取文本是一项面向实际任务的技能,主要用于从扫描的文档和图像中提取文本, 使用 MinerU Open API.;不需要 API 密钥;
它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。使用时应结合输入条件选择合适的执行方式,核对必要参数、依赖环境与输出内容,并按原始要求处理异常情况。该技能适合需要稳定复用相关能力的场景,可作为自动化工作流的一部分,也便于后续检查、调整和扩展。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
通过 MinerU Open API 使用 OCR 技术,从扫描文档和图像中提取文本。无需 API 密钥。
# 对扫描的 PDF 进行 OCR
mineru-open-api flash-extract scanned.pdf
# 对文档照片进行 OCR
mineru-open-api flash-extract page-photo.jpg
# 从 URL 直接 OCR(无需下载)
mineru-open-api flash-extract https://example.com/scanned.pdf
# 指定语言以提升识别准确率
mineru-open-api flash-extract scanned.pdf --language en
# 将 OCR 结果保存至文件
mineru-open-api flash-extract scanned.pdf -o ./output/
你必须使用用户所用的**相同语言**进行回复。此规则不可协商。
--language 参数指定语言(默认为 ch;英文请使用 en)运行 mineru-open-api flash-extract --help 查看所有可用选项。
flash-extract 会将文档上传至 MinerU 的云端 API 进行处理,并返回结果。无需账号或 API 密钥。mineru-open-api extract --ocr(需通过 mineru-open-api auth 认证)