python - 如何正则字符串中的所有汉字

Question

{代码...} 字符串如上，类型是'str'，要正则获得汉字。我之前使用[u4e00-u9fa5]结果获得的还是英文，符号跟数字的list。求教导正确姿势。另外说说我哪里写错了.. {代码...} 这是我写的...但是返回结果就没有汉字...

習慣沉默 · Answer

我这里假设你需要匹配的文本为s：

pattern = re.compile(ur"[\u4e00-\u9fa5]")
print pattern.findall(s.decode('utf8'))

这里的decode('utf8')是怕s的值为类似x66x77x88这样的Unicode散列。另外，需要注意compile()中ur修饰符，u为Unicode修饰符。

PS：我是从这篇文章得到的启发。

刚才看了下楼下说的，确实用Python 3就不存在输出为Unicode散列的情况了，以下摘自此处

Unicode 字符串

在Python2中，普通字符串是以8位ASCII码进行存储的，而Unicode字符串则存储为16位unicode字符串，这样能够表示更多的字符集。使用的语法是在字符串前面加上前缀 u。

在Python3中，所有的字符串都是Unicode字符串。

女神的闺蜜爱上我 · Answer

你用的是python2，uxxxx是unicode字符，匹配后得到的是字节串，print出来是各个字节值。

换python3 就没这个问题了