必须用pdfocr替代codex本地ocr,先将证件图存于纯英文路径,pdfocr识别生成excel,再由codex读取、脱敏并转json,最后通过sql或python写入数据库。
☞☞☞AI 智能聊天, 问答助手, AI 智能搜索, 多模态理解力帮你轻松跨越从0到1的创作门槛☜☜☜

要在Windows 10上用Codex自动识别身份证、学位证等证件图像,完成OCR提取→敏感字段打码→结构化录入数据库全流程,必须绕过Codex官方不支持本地OCR的限制,改用PDFOCR工具链衔接Codex智能处理能力。
准备PDFOCR+Codex协同环境
下载安装PDFOCR识别导出Excel工具1.1(仅支持Windows 10/11 64位),确保已装.NET Framework 4.7.2和Microsoft Excel 2013+;Codex App需登录OpenAI账号并启用项目模式,【项目文件夹必须与PDFOCR输出目录为同一路径】。
打开PDFOCR,点击“导入文件夹”,选中你存放证件扫描图的本地文件夹(建议只放JPG/PNG格式,PDF需先转图);Codex中新建项目,指定该文件夹为工作区。
这一步操作起来很简单,直接把文件拖进去就行。但注意:PDFOCR不支持中文路径名,若路径含中文会导致识别失败——请把整个文件夹移到D:\id_scan这类纯英文路径下。
用PDFOCR精准识别证件表格
在PDFOCR界面勾选“去除特殊符号”,点击“开始识别”。软件会逐个分析图像,自动矫正倾斜、增强对比度,对齐文字区块。
识别完成后,状态栏显示“已完成”,文件列表中对应条目变为绿色;此时PDFOCR已生成同名.xlsx文件,存放在原图所在文件夹内。
PDFOCR采用离线OCR引擎,所有数据不出本地,但【识别前务必关闭杀毒软件的实时扫描】,否则可能拦截临时解压过程导致识别中断。
通过本地 Codex 或 OpenClaw OAuth 凭证直接调用 ChatGPT/Codex Responses 的 image_generation 工具来生成或编辑光栅图像,然后保存
在Codex项目中调用Excel数据并脱敏
回到Codex项目界面,点击左侧“项目”→当前项目名→右上角“+新对话”,输入指令:
“读取本项目文件夹中的xxx.xlsx(替换为实际文件名),提取‘姓名’‘身份证号’‘出生日期’三列,将身份证号中间8位替换为星号,出生日期格式统一为YYYY-MM-DD,输出为JSON数组。”
Codex会自动定位该Excel文件,解析内容,执行脱敏逻辑,并返回结构化结果。若提示“找不到文件”,说明PDFOCR输出的.xlsx未保存到Codex项目根目录——请检查文件是否被杀软隔离或路径拼写错误。
将脱敏后JSON自动写入数据库
方法一:用Codex生成SQL插入语句
在当前对话中追加提问:“把上面JSON数组转成MySQL INSERT语句,表名为id_records,字段顺序为name,id_number,birth_date,忽略重复主键冲突。”
方法二:直连数据库执行(需提前配置)
在Codex中运行命令:/run python -c "import sqlite3;conn=sqlite3.connect('id.db');c=conn.cursor();c.executemany('INSERT OR IGNORE INTO id_records VALUES (?,?,?)', [(d['name'],d['id_number'],d['birth_date']) for d in 【此处粘贴上步JSON数组】]);conn.commit()"
SQLite数据库文件id.db必须已存在于当前项目文件夹中,且表id_records已建好。Codex CLI模式下该命令执行更快,App界面需等待Python环境加载。










