
本文介绍如何正确去除阿拉伯语字符串中连续重复的字符(如“سسسللام”→“سلام”),重点解决 strlen() 和字符串索引对多字节 UTF-8 字符失效的问题,并提供健壮、可复用的 PHP 实现方案。
本文介绍如何正确去除阿拉伯语字符串中连续重复的字符(如“سسسللام”→“سلام”),重点解决 `strlen()` 和字符串索引对多字节 utf-8 字符失效的问题,并提供健壮、可复用的 php 实现方案。
在处理阿拉伯语、中文等 Unicode 字符串时,一个常见误区是直接使用 strlen() 和 $string[$i] 进行遍历——这类操作基于字节而非字符,而阿拉伯字母在 UTF-8 编码下通常占 2–3 字节。例如字符串 "سسس" 的 strlen() 返回 6(每个 س 是 2 字节),但实际只有 3 个字符;若强行用 $string[0] 取值,可能截断字节流,导致乱码或逻辑错误。
因此,去除阿拉伯字符串中连续重复字符(注意:是“连续重复”,如 سسس → س,而非全局去重)需使用支持 UTF-8 的多字节函数。以下是推荐的两种专业实现方式:
✅ 方法一:使用 mb_substr() + 状态追踪(推荐,逻辑清晰)
<?php function removeConsecutiveDuplicates($str, $encoding = 'UTF-8') {
if ($str === '') return '';
$result = '';
$prevChar = '';
for ($i = 0; $i < mb_strlen($str, $encoding); $i++) {
$currentChar = mb_substr($str, $i, 1, $encoding);
if ($currentChar !== $prevChar) {
$result .= $currentChar;
$prevChar = $currentChar;
}
}
return $result;
}
// 测试
$str = "سسسللام علييكمم";
echo removeConsecutiveDuplicates($str); // 输出:سلام عليكم
?>
✅ 方法二:正则替换(简洁高效,适合简单场景)
<?php $str = "سسسللام علييكمم";
$result = preg_replace('/(\p{Arabic})\1+/u', '$1', $str);
echo $result; // 输出:سلام عليكم
?>
该正则中:
- \p{Arabic} 匹配任意阿拉伯文字字符(Unicode 属性);
- \1+ 表示紧随其后的一个或多个相同字符;
- /u 修饰符启用 UTF-8 模式;
- 替换为 $1 即保留首个字符,丢弃后续重复项。
⚠️ 注意事项:
- 若需同时支持阿拉伯语、波斯语、乌尔都语等扩展阿拉伯字符集,\p{Arabic} 已覆盖绝大多数常用字符(Unicode 0600–06FF, 0750–077F, 08A0–08FF 等区块);
- 不要使用 tr -s 或普通 ASCII 正则(如 (.)\1+),它们无法识别多字节字符边界,对阿拉伯文完全失效;
- 避免 for ($i=0; $i
- 如需全局去重(非仅连续),应改用 array_unique() 配合 mb_str_split(),但本例目标是自然语言中的连写压缩(如手写/OCR 后清理),故连续去重更符合语义。
综上,处理阿拉伯字符串重复字符的核心原则是:*始终使用多字节安全函数(`mb_` 系列或 Unicode-aware 正则)替代单字节函数**。选择方法一可获得最大可控性与可读性;选择方法二则兼顾简洁与性能,适用于标准清洗流程。
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











