腾讯云通用文字识别(高精度版)技能包。用户发送/粘贴图片、提供图片URL或要求识别图片文字时自动调用。支持中文、英文、中英混合、数字及特殊符号的检测与识别,返回文字框位置与内容。适用于文字较多、版式复杂、准召率要求高的场景。
腾讯云通用文字识别(高精度版)(GeneralAccurateOCR)是一项面向实际任务的技能,主要用于调用腾讯云OCR通用文字识别(高精度版)接口,对图片中的文字进行精准提取;核心能力:;
多语种简历结构化识别 :基于 OCR 结果,对简历进行结构化提取与格式化输。它将相关步骤、工具调用和结果整理方式集中到统一流程中,帮助使用者更快完成目标并减少重复操作。从功能定位来看,该技能强调把分散的操作要求整理成清晰、可复用的处理流程,使用户能够围绕既定目标快速准备输入、选择执行方式并获得结构化结果。
实际使用前应先确认任务范围、数据来源、运行环境、必要权限和关键参数,再依据技能说明逐步执行;若输入条件不完整,应先补齐信息或采用保守配置,避免因错误假设导致结果偏离需求。执行过程中需要关注工具调用是否成功、接口或依赖是否可用、输出格式是否符合预期,并对异常提示、缺失字段和边界情况进行处理;涉及批量任务时,还应保存进度,避免中断后重复操作。
调用腾讯云OCR通用文字识别(高精度版)接口,对图片中的文字进行精准提取。
核心能力:
references/resume-parsing.md)官方文档:https://cloud.tencent.com/document/api/866/37831
references/resume-parsing.md - 多语种简历结构化识别指引(处理流程、Prompt模板、输出格式化模板、格式化规则)当用户提出以下需求时触发此技能:
references/resume-parsing.md 指引)references/resume-parsing.md 指引)tencentcloud-sdk-python(通过 pip install tencentcloud-sdk-python 安装)TENCENTCLOUD_SECRET_ID:腾讯云API密钥IDTENCENTCLOUD_SECRET_KEY:腾讯云API密钥Key运行 scripts/main.py 脚本完成文字识别。
| 参数 | 类型 | 必填 | 说明 |
|---|---|---|---|
| ImageBase64 | str | 否(二选一) | 图片Base64值,不超过10MB |
| ImageUrl | str | 否(二选一) | 图片URL地址,优先使用 |
| IsPdf | bool | 否 | 是否开启PDF识别,默认false |
| PdfPageNumber | int | 否 | 需要识别的PDF页码,IsPdf为true时有效,默认1 |
| IsWords | bool | 否 | 是否返回单字信息,默认false |
| UserAgent | str | 否 | 请求来源标识(可选),不传时自动探测平台 |
--user-agent参数是可选参数,不传时脚本会自动探测当前调用平台(WorkBuddy / OpenClaw / QClaw / ADP / CodeBuddy),并输出 skill-<platform>;无法识别时回退为 skillother。用于标识API调用来源,便于按渠道追踪和统计调用次数:
| 调用平台 | 不传时的自动探测结果 | 说明 |
|---|---|---|
| WorkBuddy | skill-workbuddy |
自动识别 |
| CodeBuddy | skill-codebuddy |
自动识别 |
| OpenClaw | skill-openclaw |
自动识别 |
| QClaw | skill-qclaw |
自动识别 |
| ADP | skill-adp |
自动识别 |
| 未识别 | skillother |
兜底 |
| 显式传参 | 原样使用 | 人工覆盖,向后兼容 |
实现说明:
--user-agent 时,脚本通过环境变量 + 进程树回溯自动探测渠道SDK_PYTHON_x.x.x; skill-<platform> 注入到请求的 RequestClient 字段requestClient 字段,可直接聚合统计skillother,不影响 OCR 主流程识别成功后返回 JSON 格式结果:
{
"raw_text": "识别到的完整文字内容n第二行文字n第三行文字",
"RequestId": "xxx"
}
无文字时返回:
{
"raw_text": "",
"message": "No text detected in the image.",
"RequestId": "xxx"
}
# 基础调用示例(--user-agent 默认为 Skills,可不传)
python scripts/main.py --image-url "https://example.com/document.jpg"
# 使用 Base64 文件调用
python scripts/main.py --image-base64 "/path/to/document.jpg"
# 识别 PDF 文件中的文字
python scripts/main.py --image-url "https://example.com/doc.pdf"
--is-pdf true --pdf-page-number 1
# 返回单字信息
python scripts/main.py --image-url "https://example.com/document.jpg" --is-words true
🔗 腾讯云文字识别 OCR 购买页
在购买页面中选择 通用文字识别(高精度版) 完成购买。
🔗 腾讯云 API 密钥管理
Linux / macOS:
export TENCENTCLOUD_SECRET_ID="你的SecretId"
export TENCENTCLOUD_SECRET_KEY="你的SecretKey"
Windows (PowerShell):
$env:TENCENTCLOUD_SECRET_ID = "你的SecretId"
$env:TENCENTCLOUD_SECRET_KEY = "你的SecretKey"