分割gbk中文出现乱码的问题解决,分割gbk中文乱码
近日遇到一个神奇的字“弢(tao)”。
具体的过程是这样的:
<span>1</span> <span>$list</span> = <span>explode</span>('|', 'abc弢|bc'<span>); </span><span>2</span> <span>var_dump</span>(<span>$list</span>);
取得这个分割的结果。
和想象不同,结果居然是这样:
<span>array</span>(3<span>) { [</span>0]=> <span>string</span>(4) "<span>abc? [1]=> string(0) </span>""<span> [2]=> string(2) </span>"bc"<span> }</span>
出现了乱码,而且莫名其妙的出现了一个空元素。
究其原因,原来这个字“弢”的gbk编码是8f7c,而|的ASCII是7c,这样explode就把弢的第二ASCII作为|切割了。
既然是双字节的问题,我们用mbstring解决好了。
可惜,php并没有mb_explode这种函数,找了找,找到一个mb_split。
<span>array</span> mb_split ( <span>string</span> <span>$pattern</span> , <span>string</span> <span>$string</span> [, int <span>$limit</span> = -1 ] )
没有声明编码的地方。仔细一看,他是通过mb_regex_encoding声明编码的。
于是写出以下的代码:
<span>1</span> mb_regex_encoding('gbk'<span>); </span><span>2</span> <span>$list</span> = mb_split('\|', 'abc弢|bc'<span>); </span><span>3</span> <span>var_dump</span>(<span>$list</span>);
结果php报错,mb_regex_encoding不认识gbk,囧。
那就使用它认识的:
<span>1</span> mb_regex_encoding('gb2312'<span>); </span><span>2</span> <span>$list</span> = mb_split('\|', 'abc弢|bc'<span>); </span><span>3</span> <span>var_dump</span>(<span>$list</span>);
结果:
<span>array</span>(3<span>) { [</span>0]=> <span>string</span>(4) "<span>abc? [1]=> string(0) </span>""<span> [2]=> string(2) </span>"bc"<span> }</span>
发现,这种方法并没有什么用处。、
至于原因?“弢”这个字居然不在GB2312的编码集里面!!!!!但是有这个字的编码集(GBK, GB18030)这个函数都不支持!!!!!
既然这个不好用,也许万能的正则表达式是ok的。于是得到以下代码:
<span>1</span> <span>var_dump</span>(<span>preg_match_all</span>('/([^\|])*/', 'abc弢|bc', <span>$matches</span><span>)); </span><span>2</span> <span>var_dump</span>(<span>$matches</span>);
结果:
int(2<span>) </span><span>array</span>(2<span>) { [</span>0]=> <span>array</span>(2<span>) { [</span>0]=> <span>string</span>(4) "<span>abc? [1]=> string(2) </span>"bc"<span> } [1]=> array(2) { [0]=> string(1) </span>"?<span> [</span>1]=> <span>string</span>(1) "c"<span> } }</span>
好吧,我想多了。
现在研究一下,如何用正则描述这个场景。
参考一下,鸟哥大神的博客:分割GBK中文遭遇乱码的解决。遗憾的是,正则能力比较low的我,还是想不出来合适的正则表达式(如果有想出这个正则表达式的大神们,希望可以告诉我)。
没办法,思来想去,只好用substr了:
<span> 1</span> <span>function</span> mb_explode(<span>$delimiter</span>, <span>$string</span>, <span>$encoding</span> = <span>null</span><span>){ </span><span> 2</span> <span>$list</span> = <span>array</span><span>(); </span><span> 3</span> <span>is_null</span>(<span>$encoding</span>) && <span>$encoding</span> =<span> mb_internal_encoding(); </span><span> 4</span> <span>$len</span> = mb_strlen(<span>$delimiter</span>, <span>$encoding</span><span>); </span><span> 5</span> <span>while</span>(<span>false</span> !== (<span>$idx</span> = mb_strpos(<span>$string</span>, <span>$delimiter</span>, 0, <span>$encoding</span><span>))){ </span><span> 6</span> <span>$list</span>[] = mb_substr(<span>$string</span>, 0, <span>$idx</span>, <span>$encoding</span><span>); </span><span> 7</span> <span>$string</span> = mb_substr(<span>$string</span>, <span>$idx</span> + <span>$len</span>, <span>null</span>, <span>$encoding</span><span>); </span><span> 8</span> <span> } </span><span> 9</span> <span>$list</span>[] = <span>$string</span><span>; </span><span>10</span> <span>return</span> <span>$list</span><span>; </span><span>11</span> }
测试代码:
<span>1</span> <span>$a</span> = 'abc弢|bc'<span>; </span><span>2</span> <span>3</span> <span>var_dump</span>(mb_explode('|', <span>$a</span>, 'gbk'<span>)); </span><span>4</span> <span>var_dump</span>(mb_explode('bc', <span>$a</span>, 'gbk'<span>)); </span><span>5</span> <span>var_dump</span>(mb_explode('弢', <span>$a</span>, 'gbk'));
结果:
<span>array</span>(2<span>) { [</span>0]=> <span>string</span>(5) "abc弢"<span> [</span>1]=> <span>string</span>(2) "bc"<span> } </span><span>array</span>(3<span>) { [</span>0]=> <span>string</span>(1) "a"<span> [</span>1]=> <span>string</span>(3) "弢|"<span> [</span>2]=> <span>string</span>(0) ""<span> } </span><span>array</span>(2<span>) { [</span>0]=> <span>string</span>(3) "abc"<span> [</span>1]=> <span>string</span>(3) "|bc"<span> }</span>
这样就可以得到正确的结果了。

PHP类型提示提升代码质量和可读性。1)标量类型提示:自PHP7.0起,允许在函数参数中指定基本数据类型,如int、float等。2)返回类型提示:确保函数返回值类型的一致性。3)联合类型提示:自PHP8.0起,允许在函数参数或返回值中指定多个类型。4)可空类型提示:允许包含null值,处理可能返回空值的函数。

PHP中使用clone关键字创建对象副本,并通过\_\_clone魔法方法定制克隆行为。1.使用clone关键字进行浅拷贝,克隆对象的属性但不克隆对象属性内的对象。2.通过\_\_clone方法可以深拷贝嵌套对象,避免浅拷贝问题。3.注意避免克隆中的循环引用和性能问题,优化克隆操作以提高效率。

PHP适用于Web开发和内容管理系统,Python适合数据科学、机器学习和自动化脚本。1.PHP在构建快速、可扩展的网站和应用程序方面表现出色,常用于WordPress等CMS。2.Python在数据科学和机器学习领域表现卓越,拥有丰富的库如NumPy和TensorFlow。

HTTP缓存头的关键玩家包括Cache-Control、ETag和Last-Modified。1.Cache-Control用于控制缓存策略,示例:Cache-Control:max-age=3600,public。2.ETag通过唯一标识符验证资源变化,示例:ETag:"686897696a7c876b7e"。3.Last-Modified指示资源最后修改时间,示例:Last-Modified:Wed,21Oct201507:28:00GMT。

在PHP中,应使用password_hash和password_verify函数实现安全的密码哈希处理,不应使用MD5或SHA1。1)password_hash生成包含盐值的哈希,增强安全性。2)password_verify验证密码,通过比较哈希值确保安全。3)MD5和SHA1易受攻击且缺乏盐值,不适合现代密码安全。

PHP是一种服务器端脚本语言,用于动态网页开发和服务器端应用程序。1.PHP是一种解释型语言,无需编译,适合快速开发。2.PHP代码嵌入HTML中,易于网页开发。3.PHP处理服务器端逻辑,生成HTML输出,支持用户交互和数据处理。4.PHP可与数据库交互,处理表单提交,执行服务器端任务。

PHP在过去几十年中塑造了网络,并将继续在Web开发中扮演重要角色。1)PHP起源于1994年,因其易用性和与MySQL的无缝集成成为开发者首选。2)其核心功能包括生成动态内容和与数据库的集成,使得网站能够实时更新和个性化展示。3)PHP的广泛应用和生态系统推动了其长期影响,但也面临版本更新和安全性挑战。4)近年来的性能改进,如PHP7的发布,使其能与现代语言竞争。5)未来,PHP需应对容器化、微服务等新挑战,但其灵活性和活跃社区使其具备适应能力。

PHP的核心优势包括易于学习、强大的web开发支持、丰富的库和框架、高性能和可扩展性、跨平台兼容性以及成本效益高。1)易于学习和使用,适合初学者;2)与web服务器集成好,支持多种数据库;3)拥有如Laravel等强大框架;4)通过优化可实现高性能;5)支持多种操作系统;6)开源,降低开发成本。


热AI工具

Undresser.AI Undress
人工智能驱动的应用程序,用于创建逼真的裸体照片

AI Clothes Remover
用于从照片中去除衣服的在线人工智能工具。

Undress AI Tool
免费脱衣服图片

Clothoff.io
AI脱衣机

AI Hentai Generator
免费生成ai无尽的。

热门文章

热工具

EditPlus 中文破解版
体积小,语法高亮,不支持代码提示功能

WebStorm Mac版
好用的JavaScript开发工具

安全考试浏览器
Safe Exam Browser是一个安全的浏览器环境,用于安全地进行在线考试。该软件将任何计算机变成一个安全的工作站。它控制对任何实用工具的访问,并防止学生使用未经授权的资源。

SublimeText3 英文版
推荐:为Win版本,支持代码提示!

禅工作室 13.0.1
功能强大的PHP集成开发环境