怎麼使用python批次修改文字檔編碼格式-Python教學-PHP中文網

首頁

後端開發

Python教學

怎麼使用python批次修改文字檔編碼格式

WBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWBOYWB

May 01, 2023 pm 07:13 PM

python

使用python批次修改文字檔案編碼格式

把文字檔案的編碼格式進行批次幻化，例如ascii， gb2312， utf8等，相互轉化，字元集的大小來看，utf8>gb2312>ascii ,因此最好把gb2312轉為utf8，否則容易出現亂碼。

gb2312與utf-8的主要差異：

##關於字庫規模：UTF-8 > gb2312（utf8字全而gb2312只有漢字）

關於保存大小： UTF-8> gb2312（utf8更臃腫、加載更慢，gb2312更小巧，加載更快）

#關於適用範圍： gb2312主要在中國大陸地區使用，是一個本地化的字符集，UTF-8包含全世界所有國家需要用到的字符，是國際編碼，通用性強。 UTF-8編碼的文字可以在各國支援UTF8字元集的瀏覽器上顯示。

import sys
import chardet
import codecs
 
def get_encoding_type(fileName):
    &#39;&#39;&#39;print the encoding format of a txt file &#39;&#39;&#39;
    with open(fileName, &#39;rb&#39;) as f:
        data = f.read()
        encoding_type = chardet.detect(data)
        #print(encoding_type)
        return encoding_type
        # such as {&#39;encoding&#39;: &#39;GB2312&#39;, &#39;confidence&#39;: 0.99, &#39;language&#39;: &#39;Chinese&#39;}
 
def convert_encoding_type(filename_in, filename_out, encode_in="gb2312", encode_out="utf-8"):
    &#39;&#39;&#39;convert encoding format of txt file &#39;&#39;&#39;
    #filename_in = &#39;flash.c&#39;
    #filename_out = &#39;flash_gb2312.c&#39;
    #encode_in = &#39;utf-8&#39;  # 输入文件的编码类型
    #encode_out = &#39;gb2312&#39;# 输出文件的编码类型
    with codecs.open(filename=filename_in, mode=&#39;r&#39;, encoding=encode_in) as fi:
        data = fi.read()
        with open(filename_out, mode=&#39;w&#39;, encoding=encode_out) as fo:
            fo.write(data)
            fo.close()
        # with open(filename_out, &#39;rb&#39;) as f:
        #     data = f.read()
        #     print(chardet.detect(data))
 
if __name__=="__main__":
    # fileName = argv[1]
    # get_encoding_type(fileName)
    # convert_encoding_type(fileName, fileName)
    filename_of_files = sys.argv[1]   #the file contain full file path at each line
    with open(filename_of_files, &#39;rb&#39;) as f:
        lines = f.readlines()
        for line in lines:
            fileName = line[:-1]
            encoding_type = get_encoding_type(fileName)
            if encoding_type[&#39;encoding&#39;]==&#39;GB2312&#39;:
                print(encoding_type)
                convert_encoding_type(fileName, fileName)
                print(fileName)

補充：python實作檔案批次轉為utf-8格式

python實作檔案批次轉為utf-8格式

xml_path = &#39;./&#39;
with open(xml_path , &#39;rb+&#39;) as f:
    content = f.read()
    codeType = detect(content)[&#39;encoding&#39;]
    content = content.decode(codeType, "ignore").encode("utf8")
    fp.seek(0)
    fp.write(content)

以上是怎麼使用python批次修改文字檔編碼格式的詳細內容。更多資訊請關注PHP中文網其他相關文章！

陳述

本文轉載於：亿速云。如有侵權，請聯絡admin@php.cn刪除

Python和時間：充分利用您的學習時間Apr 14, 2025 am 12:02 AM

要在有限的時間內最大化學習Python的效率，可以使用Python的datetime、time和schedule模塊。 1.datetime模塊用於記錄和規劃學習時間。 2.time模塊幫助設置學習和休息時間。 3.schedule模塊自動化安排每週學習任務。

Python：遊戲，Guis等Apr 13, 2025 am 12:14 AM

Python在遊戲和GUI開發中表現出色。 1)遊戲開發使用Pygame，提供繪圖、音頻等功能，適合創建2D遊戲。 2)GUI開發可選擇Tkinter或PyQt，Tkinter簡單易用，PyQt功能豐富，適合專業開發。

Python vs.C：申請和用例Apr 12, 2025 am 12:01 AM

Python适合数据科学、Web开发和自动化任务，而C 适用于系统编程、游戏开发和嵌入式系统。Python以简洁和强大的生态系统著称，C 则以高性能和底层控制能力闻名。

2小時的Python計劃：一種現實的方法Apr 11, 2025 am 12:04 AM

2小時內可以學會Python的基本編程概念和技能。 1.學習變量和數據類型，2.掌握控制流（條件語句和循環），3.理解函數的定義和使用，4.通過簡單示例和代碼片段快速上手Python編程。

Python：探索其主要應用程序Apr 10, 2025 am 09:41 AM

Python在web開發、數據科學、機器學習、自動化和腳本編寫等領域有廣泛應用。 1)在web開發中，Django和Flask框架簡化了開發過程。 2)數據科學和機器學習領域，NumPy、Pandas、Scikit-learn和TensorFlow庫提供了強大支持。 3)自動化和腳本編寫方面，Python適用於自動化測試和系統管理等任務。