
本文介绍使用 PHP 原生函数(如 preg_replace)精准去除阿拉伯语字符串中连续重复的字母(如 سسس → س),避免误删非连续重复字符,并提供兼容 UTF-8 的健壮实现方案。
本文介绍使用 php 原生函数(如 `preg_replace`)精准去除阿拉伯语字符串中**连续重复的字母**(如 `سسس` → `س`),避免误删非连续重复字符,并提供兼容 utf-8 的健壮实现方案。
在处理阿拉伯语等右向左(RTL)、多字节 Unicode 字符串时,简单使用 strpos 或 tr -s 等 ASCII 专用工具极易失效——前者因未按 UTF-8 字符边界遍历导致乱码或截断,后者(如 tr -s 'a-z')完全不支持阿拉伯字母范围(\u0600–\u06FF)。关键在于:去重目标是“连续重复字符”(即连写冗余),而非全局去重。例如 "سسسللام" 应变为 "سلام",而非 "سلم"(后者会错误合并所有 س 和 ل)。
✅ 正确解法:使用支持 Unicode 的正则表达式,匹配两个及以上连续相同的 Unicode 字母,并替换为单个字符:
<?php function removeConsecutiveDuplicates($str) {
// 匹配任意 Unicode 字母(含阿拉伯、波斯、乌尔都等)的连续重复(≥2次)
return preg_replace('/(\p{L})\1+/u', '$1', $str);
}
// 测试阿拉伯语字符串
$str = "سسسللام علييكمم";
echo removeConsecutiveDuplicates($str); // 输出:سلام عليكم
// 同时兼容混合文本(如带空格、标点、英文)
$mix = "مرحباا! Helloo ورددد";
echo removeConsecutiveDuplicates($mix); // 输出:مرحبا! Hello ورد
?>
? 核心说明:
- \p{L} 是 PCRE 的 Unicode 字母类,覆盖阿拉伯字母(Arabic)、拉丁字母、西里尔字母等所有文字字符;
- \1+ 表示对捕获组 (\p{L}) 中匹配到的字符进行连续重复匹配(+ 表示一次或多次,配合前面的 \1 实现 ≥2 次);
- /u 修饰符启用 UTF-8 模式,确保正则引擎按 Unicode 码点(而非字节)解析字符串;
- $1 在替换中代表第一个捕获组的单个字符,自然实现“多→一”。
⚠️ 注意事项:
- ❌ 避免使用 strlen() + $string[$i]:PHP 字符串下标操作默认按字节寻址,对 UTF-8 阿拉伯字符(通常占 2–3 字节)会切碎字符,引发乱码或逻辑错误;
- ❌ 不要依赖 tr -s 或 uniq 等 Shell 工具:它们无 Unicode 支持,且 tr -s 仅压缩指定字符集,无法动态识别任意阿拉伯字母;
- ✅ 若需严格限定仅阿拉伯字母(排除其他文字),可改用 \p{Arabic}:
preg_replace('/(\p{Arabic})\1+/u', '$1', $str); - ✅ 对性能敏感场景,可预编译正则(preg_replace_callback + PREG_UNMATCHED_AS_NULL 非必需,本例简洁性优先)。
总结:处理阿拉伯语字符串去重,必须拥抱 Unicode-aware 方案。preg_replace 配合 \p{L} 和 /u 修饰符,是兼顾准确性、可读性与跨语言扩展性的最佳实践——它既解决 سسسللام → سلام 的核心需求,又天然支持未来可能加入的波斯语、普什图语等同属阿拉伯字母体系的文本。
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











