图像二值化本质是像素级逻辑判断,通过灰度转换、阈值设定与数组遍历实现:先用加权公式转单通道灰度数组,再依固定阈值、局部自适应阈值或otsu法计算二值结果。
图像二值化本质是像素级的逻辑判断,核心在于用数组存取灰度值,并对每个元素执行“大于阈值→设为255,否则→设为0”的操作。不需要复杂框架,纯数组遍历即可完成,关键在灰度转换准确、阈值设定合理、边界处理到位。
灰度数组构建:从彩色图到一维/二维灰度容器
原始图像多为BGR或RGB三通道,需先压缩为单通道灰度数组。常用加权公式:gray = 0.299×R + 0.587×G + 0.114×B。结果存入二维数组 gray[height][width] 或一维数组 gray[i](i = row×width + col)。注意:OpenCV读图默认BGR顺序,若用PIL则为RGB,权重系数不能错位。数组类型推荐 uint8(0–255),避免浮点运算开销。
固定阈值二值化:直接索引赋值,零延迟处理
定义阈值 T(如127),遍历灰度数组,逐点比较并写入二值结果数组 binary:
- 若使用二维数组:
binary[i][j] = (gray[i][j] >= T) ? 255 : 0; - 若使用一维数组:
binary[idx] = (gray[idx] >= T) ? 255 : 0;(idx 同上) - 无需额外库,C/C++、Python(NumPy)、Java 均可原生支持该模式
此方式适合光照均匀文档图,但对阴影、反光区域易失效——比如台灯下左亮右暗的笔记,全图用一个T会左侧过曝、右侧文字丢失。
变量阈值实战:按局部区域动态计算T,适配不均光照
当图像存在明暗渐变时,需为每个像素分配专属阈值 T(x,y)。典型做法是滑动窗口统计邻域灰度均值或高斯加权均值:
- 选定窗口尺寸(如11×11),对每个像素
(i,j),取其周围像素灰度平均值mean - 设
T(i,j) = mean − C,其中C是偏移常量(OpenCV默认为2,可调) - 再执行判断:
binary[i][j] = (gray[i][j] > T(i,j)) ? 255 : 0
注意:边缘像素需补零或镜像填充,否则窗口越界;窗口过大易模糊细节(如细小铅笔字),过小则噪声放大。实测中,11×11配C=2在A4手写扫描件上鲁棒性较好。
Otsu自动寻优:用直方图类间方差反推全局最优T
不手动试值,让数据自己选T。原理是遍历0–255所有可能阈值,对每个T计算前景(白)与背景(黑)的类间方差,取方差最大时的T为最优解:
- 先统计灰度直方图
hist[256],记录各灰度级出现频次 - 对每个候选T,累加计算背景权重、前景权重、全局均值、类间方差
- 找到使类间方差最大的T,代入二值化主循环
该方法对双峰直方图(如白纸黑字)效果极佳,OpenCV中仅需 cv2.THRESH_BINARY + cv2.THRESH_OTSU 一行触发,底层即基于上述数组直方图运算。它仍是全局阈值,但比人工设定更可靠。










