验证码识别失败时应优先采用坐标点击或人工输入等绕过方案,而非优化ocr;预处理需灰度化、自适应二值化及形态学操作;pytesseract须限定字符集与psm模式;被软封锁时需检测响应体内容并重启浏览器实例。

验证码识别失败时,pytesseract 返回空字符串或乱码怎么办?
企业公示系统(如国家企业信用信息公示系统)的验证码通常是扭曲文字+干扰线+背景噪点的组合,pytesseract 直接 OCR 效果极差。这不是配置问题,而是模型根本没训练过这类验证码。
- 先用
cv2做基础预处理:转灰度 → 高斯模糊 → 自适应二值化(别用固定阈值cv2.THRESH_BINARY,背景渐变会导致切片断裂) - 二值化后务必做形态学闭操作(
cv2.MORPH_CLOSE)补断笔,再开操作(cv2.MORPH_OPEN)去孤立噪点 -
pytesseract.image_to_string必须加参数config='--psm 8 -c tessedit_char_whitelist=0123456789abcdefghijklmnopqrstuvwxyz',强制单行、限定字符集 - 如果仍返回空,说明图像质量不够——此时不要调参,直接换思路:这类验证码本质是“可穷举的 4 位字母数字”,暴力尝试比 OCR 更可靠
为什么用 selenium 模拟点击反而比自动识别更稳定?
公示系统前端通常把验证码图片和对应坐标映射关系藏在 JS 里(比如 canvas 绘制后绑定 onclick 事件),而点击行为本身不依赖 OCR 结果,只依赖坐标定位。
图片提示词生成器?不止如此。 马甲系统 —— 把脑海中的画面,翻译成AI能理解的专业表达。 用得越多,它越懂你:首次需要多问几句确认方向,用久了几乎一说就懂。 用得越多,它越快:缓存机制让后续对话越来越省。 RAG进化:成功案例持续入库,越跑越聪明。 输入「新手指南」查看完整功能介绍
- 不要截图后用 OpenCV 找文字位置——验证码每次刷新坐标都变,且文字被扭曲后轮廓不可靠
- 正确做法:用
selenium获取验证码图片元素的location和size,计算出左上角绝对坐标,再用ActionChains移动到相对偏移位置点击(例如 x+20, y+15) - 注意:必须等图片完全加载完成再取
location,否则坐标为(0, 0);可用WebDriverWait(driver, 5).until(EC.presence_of_element_located((By.ID, "captchaImg"))) - 点击后服务端会校验鼠标轨迹是否“像人”——所以别用
click(),要用move_to_element_with_offset(el, x, y).click().perform()
绕过滑块/点选类验证码时,requests 无法复用登录态的原因
公示系统现在多数已升级为行为验证(如极验、腾讯防水墙),其核心不是图片识别,而是客户端 JS 生成的加密 token(如 geetest_challenge、geetest_validate)。
-
requests发起的请求没有执行 JS,拿不到这些字段,即使你手动拼出 POST 数据,服务端也会校验 token 签名有效性 -
selenium虽能执行 JS,但默认不暴露window.geetest对象,需用driver.execute_script("return window.geetest")主动提取 - 更现实的做法:放弃全自动,改为半自动——用
selenium加载页面后,人工识别并输入,脚本只负责后续表单提交和翻页。因为验证码识别成功率很难长期稳定超过 70%,而人工干预一次可跑完一整天数据
反爬机制触发后,status_code 仍是 200 但返回空白页或跳转到验证页
这是公示系统典型的“软封锁”:HTTP 层没报错,但 HTML 内容已被替换成验证入口(如 <div id="verify">)或 JS 跳转逻辑。<ul>
<li>判断是否被拦截,不能只看 <code>response.status_code,要检查响应体:
if 'verify' in response.text or 'geetest' in response.text or '<title>请稍候</title>' in response.text:
selenium 场景下更隐蔽:页面看似加载成功,但关键元素(如搜索按钮)始终 not displayed 或 stale,此时应主动检测 driver.current_url 是否含 verify 或 captcha 字段driver.quit() + 新建),比清理 cookies 更彻底验证码的“自动点击”本质是绕过验证环节,而不是破解它。真正稳定的方案往往不是提高识别率,而是减少对识别的依赖——比如用坐标点击代替文字识别,用人工输入代替模型预测,用浏览器实例轮换代替 IP 轮换。这些细节不写在文档里,但决定脚本能跑几天。










