Python字串的處理那些事

Tomorin原創: 2018-08-23 17:47:291522瀏覽

本章介紹了Python字串的編寫與處理，在之前，我們搞清楚了令人頭疼的字元編碼問題後，我們再來研究Python的字串。

在最新的Python 3版本中，字串是以Unicode編碼的，也就是說，Python的字串支援多語言，例如：

>>> print(&#39;包含中文的str&#39;)
包含中文的str

對於單一字元的編碼，Python提供了ord()函數取得字元的整數表示，chr()函數把編碼轉換成對應的字元：

>>> ord(&#39;A&#39;)
65
>>> ord(&#39;中&#39;)
20013
>>> chr(66)
&#39;B&#39;
>>> chr(25991)
&#39;文&#39;

如果知道字元的整數編碼，還可以用十六進位這麼寫str：

>>> &#39;\u4e2d\u6587&#39;
&#39;中文&#39;

兩種寫法完全是等價的。

由於Python的字串類型是str，在記憶體中以Unicode表示，一個字元對應若干個位元組。如果要在網路上傳輸，或儲存到磁碟上，就需要把str變成以位元組為單位的bytes。

Python對bytes類型的資料用帶有b前綴的單引號或雙引號表示：

x = b&#39;ABC&#39;

要注意區分'ABC'和b'ABC'，前者是str，後者雖然內容顯示得和前者一樣，但bytes的每個字元都只佔用一個位元組。

以Unicode表示的str透過encode()方法可以編碼為指定的bytes，例如：

>>> &#39;ABC&#39;.encode(&#39;ascii&#39;)
b&#39;ABC&#39;
>>> &#39;中文&#39;.encode(&#39;utf-8&#39;)
b&#39;\xe4\xb8\xad\xe6\x96\x87&#39;
>>> &#39;中文&#39;.encode(&#39;ascii&#39;)
Traceback (most recent call last):
  File "<stdin>", line 1, in <module>UnicodeEncodeError:
   &#39;ascii&#39; codec can&#39;t encode characters in position 0-1: ordinal not in range(128)

純英文的str可以用ASCII編碼為bytes，內容是一樣的，含有中文的str可以用UTF-8編碼為bytes。含有中文的str無法用ASCII編碼，因為中文編碼的範圍超過了ASCII編碼的範圍，Python會報錯。

在bytes中，無法顯示為ASCII字元的位元組，用\x##顯示。

反過來，如果我們從網路或磁碟上讀取了位元組流，那麼讀到的資料就是bytes。要把bytes變成str，就需要用decode()方法：

>>> b&#39;ABC&#39;.decode(&#39;ascii&#39;)
&#39;ABC&#39;
>>> b&#39;\xe4\xb8\xad\xe6\x96\x87&#39;.decode(&#39;utf-8&#39;)
&#39;中文&#39;

如果bytes中包含無法解碼的字節，decode()方法會報錯：

>>> b&#39;\xe4\xb8\xad\xff&#39;.decode(&#39;utf-8&#39;)
Traceback (most recent call last):
  ...
UnicodeDecodeError: &#39;utf-8&#39; codec can&#39;t decode byte 0xff in position 3: invalid start byte

以上，就是Python字串編程的問題

以上是Python字串的處理那些事的詳細內容。更多資訊請關注PHP中文網其他相關文章！

Python 字符串字符串类型 ASCII

陳述：

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

上一篇：一文詳解Python網站開發會用到哪些orm框架下一篇：一文詳解Python網站開發會用到哪些orm框架

看更多