必须用 mb_strlen($str, 'utf-8') 判断含泰文、越南文的字符串长度,因 strlen() 按字节计数导致结果错误;需确保文件、数据库、html、表单及 mbstring 扩展均统一 utf-8。

PHP 8.0 判断含泰文、越南文的字符串长度,核心只有一条:必须用 mb_strlen($str, 'UTF-8'),不能用 strlen()。
为什么 strlen() 不行
泰文(如สวัสดี)和越南文(如xin chào)在 UTF-8 编码下,多数字符占 2–3 字节。
而 strlen() 只数字节,不识别字符边界。例如:
-
strlen("สวัสดี")返回 12(6 个字符 × 平均 2 字节),但真实字符数是 6; -
strlen("đủ")返回 4,实际只有 2 个字符。
用它做长度限制、截断或校验,必然出错。
正确做法:mb_strlen() 显式指定 UTF-8
使用 mb_strlen() 并**强制传入第二个参数 'UTF-8'**:
-
mb_strlen("สวัสดี", 'UTF-8')→ 返回 6; -
mb_strlen("xin chào", 'UTF-8')→ 返回 9(空格也算 1 字符); - 中、英、泰、越、日、韩、希伯来、阿拉伯等所有 UTF-8 字符,统一按「1 字符」计数。
⚠️ 不写 'UTF-8' 很危险:依赖 mb_internal_encoding() 设置,线上环境可能默认不是 UTF-8,导致结果突变。
配套要点不能漏
仅改函数不够,需整体保持 UTF-8 一致:
- PHP 文件本身保存为 UTF-8 无 BOM;
-
数据库连接设
charset=utf8mb4(PDO DSN 加;charset=utf8mb4); -
HTML 页面声明
<meta charset="UTF-8">; -
表单提交确保
accept-charset="UTF-8"或前端设置请求头; -
mbstring 扩展必须启用:运行
php -m | grep mbstring确认,未启用会报错。
其他操作也要“多字节安全”
长度判断只是起点,后续处理也得同步升级:
- 截取用
mb_substr($str, $start, $length, 'UTF-8'),别用substr(); - 查找子串用
mb_strpos($haystack, $needle, 0, 'UTF-8'),区分大小写时注意泰/越文无传统大小写概念; - 正则匹配加
/u修饰符,用\p{L}匹配任意字母(含泰文、越南文字母),避免手动列字符。
php免费学习视频:立即使用
踏上前端学习之旅,开启通往精通之路!从前端基础到项目实战,循序渐进,一步一个脚印,迈向巅峰!











