Python教學

編碼的秘密（python版）

巴扎黑

Jun 23, 2017 pm 03:49 PM

python秘密編碼

編碼（python版）

最近在學習python的過程中，被不同的編碼搞得有點暈，於是看了前人的留下的文檔，加上自己的理解，準備寫下來，分享給正在為編碼苦苦了掙扎的你。

編碼的概念

編碼就是將訊息從一種格式轉換成另一種格式，電腦只認識二進制，簡單的理解，將我們眼睛看到的文字轉換為電腦能夠識別的二進位格式視為編碼，而二進位以某種編碼格式轉換為我們能看的文字的過程可以看成是解碼。既然電腦只能認識二進位0,1，那麼我們用的字母、數字和文字等是怎樣和他們對應的呢？那就請繼續看下去！

python中查看預設的編碼規格是：

import sysprint(sys.getdefaultencoding())#运行结果：utf-8

ASCⅡ碼

我們都知道電腦是米國發明的，起初的時候也只有米國那些國家使用，而他們的語言僅僅只有26個字母組成，再加上一些符號，所以在一開始的時候，用的編碼規則就是ASCⅡ碼。 ASCⅡ，中文名叫美國資訊交換標準代碼，因為名叫American Standard Code for Information Interchange，下面我們來看看ASCⅡ表：

############################################################# ASCⅡ碼用一個字節，也就是8位元二進位組來標識一個字符，例如00100001就代表字符###！，第一版的ASCⅡ沒有用到最高的一個bit，所以取值範圍為0-127，只能表示128字元。為了滿足西歐等國家的字符要求，於是用了最高位的bit，能表示的字符也從128增加到了256個。 ###### #########在python中使用函數ord()，可以字元轉換為對應數值，使用函數chr可以將數值轉換為對應字元：######

>>> ord("a")     #将字符转换为数值97>>> ord("A")65>>> chr(65)'A'>>> chr(97)      #将数值转换为字符'a'>>>

# ##

GB2312和GBK

当计算机漂洋过海来到了中国，ASCⅡ已经不能满足我大天朝的需求了，常用的汉字大致都有2k-3k。所以中国国家标准总局在1980发布了《信息交换用汉字编码字符集》，也就是GB2313标准。GB2312一共收录了7445个字符（6763个汉字和682个其他符号），包括拉丁字母、希腊字母和日文平假名等，基本上满足了国人的需求。

在GB2312中每个汉字使用两个字节来表示，分为高字节和低字节，汉字区高字节从B0-F7，低字节从A1-FE，占用的码位是72*94=6768，其中有5个空位是D7FA-D7FE，规定第一个字节大于127的就代表这是一个汉字的开始（这一个字节和下一个字节就代表一个汉字），每个字节的最高位都位1。

但是对于人名、古汉语等方面出现的罕用字，GB2312不能处理，后来就出现了GBK。GBK向下兼容GB2312，其编码范围从8140到FEFE（不包括xx7F），共23940个码位，共收录了21003个汉字，这还是很厉害的了。现在我们使用的计算机默认的就是GBK编码。

Unicode和UTF-8

我们国家搞出了GBK，其他的国家也搞出了各种各样的编码，比如小日本的SJIJ，宝岛台湾的BIG5，国际组织一看，这不行啊，每个地方都各自搞各自的，那么在不同的国家之间就会出现不兼容，我用GBK编码格式写的软件，弄到你编码格式为SJIJ的计算机就不能执行了。所以就出现了Unicode，也称万国码。unicode是用2个字节来表示一个字符的，65536类个字符，这足以覆盖世界上所有的文字。

这样虽好，但是美国人民就不开心了，我一个字母，比如'a'就需要占用一个字节，现在需要占用两个字节，这样就大大的浪费了内存和硬盘的空间，所有后来就出现了UTF-32，UTF-16和UTF-8,前两个这里就不在敖述了，现在并不常用，我们这看看这个UTF-8，UTF-8是一种可变长的编码格式，存储英文字母只需要一个字节，存储汉字需要3个字节，但超大字符集中的更大多数汉字要占4个字节。我们在内存里面的数据是unicode，在传输数据和保存数据的时候使用UTF-8已节省空间和带宽。

Python2的编码

在python2中默认的编码是ASCII，python2的字符串类型有两种：str和Unicode，这两个只是字符串类型的名字，我们主要看它们在内存里面的内存地址：

= = u    repr(name2)

#输出结果

'\xe5\xbd\xac\xe5\xbd\xac' #字节数据
u'\u5f6c\u5f6c' #Unicode数据

在python2中，str类型字符串类型在内存中存储的是bytes数据，Unicode类型字符串在内存中存储的是unicode数据。那两种数据之间是什么关系了？这里就涉及到了解码(encode)和编码(decode)了。

=                 name2 = u            = name.decode(= name2.encode(<type><type></type></type>

由上运行结果可知，unicode转换为bytes数据的过程是编码。从bytes数据转换为unicode数据的过程是解码。我们再来看一下：

#coding=utf8name = '彬彬'name3 = name.decode('big5')print name3#运行结果敶砍蓮

我们可以看到得到一堆乱文，name存在内存里的时候是以UTF编码成的bytes数据，而我们这里decode('big5')使用big5来解码，虽然成功了，但是输出结果却不是我们想要的结果。

当我们把第一行coding改为big5的时候就不会出现乱文了，

#coding=big5name = '彬彬'name3 = name.decode('big5')print name3#运行结果彬彬

所以我们用什么规则编码的就要用什么区解码！

注意:我们在终端显示出来的明文，就是你用户所看到的，其实都是已经转换成unicode到内存里面，而bytes数据一般都是计算机识别的。

Python3的编码

在Python3中也定义了2种类型的字符串类型，str和bytes，str类型存储unicode数据，bytes类型存储bytes数据。

name = "彬彬"name2 = b"hello"print(type(name))print(type(name.encode('utf8')))print(type(name.encode('gbk')))print(type(name2))print(type(name2.decode('utf8')))#运行结果<class>
<class>
<class>
<class>
<class></class></class></class></class></class>

如上运行结果,bytes转换为unicode为解码，uicode转为bytes数据类型为编码。

由上图所示，在不同的编码之间转换的时候，我们都要经过unicode这个中转站，没办法，虽然unicode老大哥强大呢，当我们想把utf-8编码的数据转换为gbk的，我们就需要把utf-8的数据先解码成unicode,再由unicode编码成gbk。

在py2和py3中有个重要的区分就是，py2会自动把bytes数据解码成unicode，而py3就不会自动把bytes解码成unicode了。所以说py3更清晰的区分了bytes数据和unicode。

#py2中print(u"liu" + "bin")#运行结果liubin

( + b, line 2,  <module>( + bbytes</module>

print("liu" + (b"bin").decode('utf8'))

#运行结果

liubin

一个.py文件的"一生"

那我们创建.py文件，到执行.py文件，这里面的编码和解码是怎么来的呢？

1.当我们创建一个.py文件的时候，会有一个默认的编码格式（这里以pycharm为例），在右下角，默认是UTF-8，当然你也可以选择其他的编码：

2.当我们在.py文件里面写入代码的时候，会以unicode的编码格式保存在内存中；

print("你好，世界！")

3.当我们保存的时候，会将Unicode数据编码成utf-8格式的数据，然后保存在硬盘里面；

4.当我们执行文件的时候，pycharm会调用python的解释器来读取文件，在py2中，默认会以ASCII将代码解码成unicode数据，但是ASCII码并不认识中文，所以就会出现报错。

  File "E:/py/�ַ�����.py", line 2SyntaxError: Non-ASCII character '\xe4' in file E:/py/�ַ�����.py on line 2, but no encoding declared; see  for details

所以，在py2中，我们需要加上：

#coding=utf8print("你好，世界！")#运行结果你好，世界！

但是在py3中就不存在这个问题了，只要编码的时候适用的是UTF-8，python3默认的编码规范就是UTF-8，它会用UTF-8来将UTF-8的bytes数据解码成unicode，然后在计算机终端显示！

以上是編碼的秘密（python版）的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文內容由網友自願投稿，版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容，請聯絡admin@php.cn

Python與C：學習曲線和易用性Apr 19, 2025 am 12:20 AM

Python更易學且易用，C 則更強大但複雜。 1.Python語法簡潔，適合初學者，動態類型和自動內存管理使其易用，但可能導致運行時錯誤。 2.C 提供低級控制和高級特性，適合高性能應用，但學習門檻高，需手動管理內存和類型安全。

Python vs. C：內存管理和控制Apr 19, 2025 am 12:17 AM

Python和C 在内存管理和控制方面的差异显著。1.Python使用自动内存管理，基于引用计数和垃圾回收，简化了程序员的工作。2.C 则要求手动管理内存，提供更多控制权但增加了复杂性和出错风险。选择哪种语言应基于项目需求和团队技术栈。

科學計算的Python：詳細的外觀Apr 19, 2025 am 12:15 AM

Python在科學計算中的應用包括數據分析、機器學習、數值模擬和可視化。 1.Numpy提供高效的多維數組和數學函數。 2.SciPy擴展Numpy功能，提供優化和線性代數工具。 3.Pandas用於數據處理和分析。 4.Matplotlib用於生成各種圖表和可視化結果。

Python和C：找到合適的工具Apr 19, 2025 am 12:04 AM

選擇Python還是C 取決於項目需求：1)Python適合快速開發、數據科學和腳本編寫，因其簡潔語法和豐富庫；2)C 適用於需要高性能和底層控制的場景，如係統編程和遊戲開發，因其編譯型和手動內存管理。

數據科學和機器學習的PythonApr 19, 2025 am 12:02 AM

Python在數據科學和機器學習中的應用廣泛，主要依賴於其簡潔性和強大的庫生態系統。 1）Pandas用於數據處理和分析，2）Numpy提供高效的數值計算，3）Scikit-learn用於機器學習模型構建和優化，這些庫讓Python成為數據科學和機器學習的理想工具。

學習Python：2小時的每日學習是否足夠？Apr 18, 2025 am 12:22 AM

每天學習Python兩個小時是否足夠？這取決於你的目標和學習方法。 1)制定清晰的學習計劃，2)選擇合適的學習資源和方法，3)動手實踐和復習鞏固，可以在這段時間內逐步掌握Python的基本知識和高級功能。

Web開發的Python：關鍵應用程序Apr 18, 2025 am 12:20 AM

Python在Web開發中的關鍵應用包括使用Django和Flask框架、API開發、數據分析與可視化、機器學習與AI、以及性能優化。 1.Django和Flask框架：Django適合快速開發複雜應用，Flask適用於小型或高度自定義項目。 2.API開發：使用Flask或DjangoRESTFramework構建RESTfulAPI。 3.數據分析與可視化：利用Python處理數據並通過Web界面展示。 4.機器學習與AI：Python用於構建智能Web應用。 5.性能優化：通過異步編程、緩存和代碼優