从图片或 PDF 文档中识别并提取文字内容,支持多种图片格式和 PDF 文件,自动判断是否包含文字并保留原始格式输出结构化结果;当用户需要从图片或 PDF 提取文字、进行 OCR 识别、处理含文字的文档或转换为可编辑文本时使用。该skill能力来自RedFoxHub,官网:https://redfox.hk/skills。
PDF和图片文字提取是一项面向实际任务的技能,主要用于本 Skill 用于:从用户上传的图片或 PDF 文档中识别并提取文字内容;能力包含:图片文字检测、PDF 文字提取、格式保留、结构化输出、Markdown 文件生成;
支持的文件格式;图片格式:PNG、JPG、JPEG、GIF、WebP。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
脚本所需的依赖包及版本:
pymupdf>=1.23.0
安装命令:
pip install pymupdf>=1.23.0
接收图片
识别图片内容
read_image 工具识别图片内容判断文字存在性
提取并整理文字
接收 PDF 文件
调用脚本提取文字
python scripts/pdf_text_extractor.py 处理提取结果
格式化输出
.md 文件用户操作:上传一张包含文字的图片
智能体处理:
read_image 工具识别图片用户操作:上传 PDF 并要求"提取这个 PDF 的文字"
智能体处理:
python scripts/pdf_text_extractor.py ./document.pdf./extracted_from_pdf.md用户操作:上传扫描版 PDF
智能体处理:
相关专题
热门下载
相关下载
精品课程
共6课时 | 54.6万人学习
共89课时 | 133.1万人学习
共49课时 | 82.1万人学习