similar_text 不适合中文模糊去重,因其按字节而非字符计算,导致结果偏高或不准;仅适用于短英文、ascii 字符串比对,且需预处理、注意参数顺序与性能瓶颈。

别直接用 similar_text 做中文模糊去重,它对 UTF-8 多字节字符(比如中文)按字节算,不是按字符算,结果会偏高或不准。
为什么 similar_text 对中文返回值怪怪的
这个函数底层不识别 Unicode 字符边界,而是把字符串当字节数组处理。例如 '王业楼' 在 UTF-8 下占 9 个字节,'王业楼的个人博客' 占 27 个字节,similar_text 算出匹配 9 个“字节”,再套公式 (9 × 2) / (9 + 27) × 100 ≈ 50%,看起来像“一半字符相同”,其实只是前三个汉字的字节刚好对齐了。
- 中文、emoji、带重音符号的字母都会被拆成多个字节,导致匹配长度虚高
- 即使两个中文字符串完全一样,只要编码或 BOM 不一致,也可能算出
0 - 函数内部递归查找最长公共子串,但子串必须连续且字节对齐,对语义相似无感知
similar_text 的正确使用场景
它只适合短英文、纯 ASCII、格式高度一致的字符串比对,比如:用户输入的邮箱前缀、代码标识符、日志关键词片段。
- 输入
similar_text('user_login', 'user_logout')返回9(匹配user_logi连续 9 字节),合理 - 输入
similar_text('abc123', 'abc456')返回3(abc),可接受 - 不要传入超过 2000 字符的文本——算法复杂度是
O(N³),长字符串会让 PHP 超时或爆栈 - 调用前务必用
trim()和mb_strtolower()(注意:后者需确认编码)预处理,否则大小写和空格会大幅拉低结果
参数顺序会影响结果,别想当然
similar_text 不是对称函数。交换两个参数,返回值很可能不同——这不是 bug,是算法设计如此。
-
similar_text('bafoobar', 'barfoo')返回5,而反过来是3 - 这意味着你不能靠单次调用判断“是否相似”,得固定主参考串(比如数据库里已存的标准名),始终让待查串做第二个参数
- 如果要做双向比对(比如合并重复项),必须显式比较两次:
max(similar_text($a, $b), similar_text($b, $a)) - 百分比参数
$percent是引用传参,变量必须先声明,否则会报 Notice
更稳的替代方案建议
真要处理中文或需要语义级相似,别硬扛 similar_text。PHP 原生有更合适的选择:
- 用
levenshtein():编辑距离明确,对中文需先转数组(preg_match_all('/./u', $str, $m)),再传给自定义实现 - 用
soundex()或metaphone():适合拼音近似(如“张”和“章”),但对同音不同调的中文区分力弱 - 简单去重逻辑,优先用精确匹配 +
mb_stripos()包含判断,比模糊相似更可靠 - 若必须用相似度,阈值别设死 85%,先用真实数据样本跑一遍,观察分布再定(常见有效区间是 60–75%)
最常被忽略的一点:这个函数没有缓存机制,两两比对 N 个字符串会产生 N² 次调用,一旦 N > 100,性能就崩了——得提前剪枝,比如先用长度差过滤掉明显不相关的对。
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











