首頁  >  文章  >  後端開發  >  【XML】UTF8和GB2312編碼轉換出現亂碼的解決方案

【XML】UTF8和GB2312編碼轉換出現亂碼的解決方案

Y2J
Y2J原創
2017-04-22 13:53:092497瀏覽

審核完的資訊要產生XML類型的文件,並且XML要採用GB2312編碼,因為採集的新聞網站,有很多網站採用的是UTF8編碼,這樣在轉換的過程中又出現亂碼

#最近做了一個小項目,遇到這類問題,記錄一下,也算是一個總結。
此專案分為兩部分,一個是新聞資料收集,一個是收集資訊的審核,最後產生XML檔。
資料收集後的資料經過使用者編輯完後,要匯出一個ACCESS文件,然後把這個文件匯入到資訊審核系統。在ACCESS庫中儲存新聞資訊的字段類型是ntext類型,而審核系統庫中對應的是varchar(max)類型的字段,導入之後,發現有的空白字符會出現亂碼,表現為問號(?),其實經過後面的測試,這不是空白(空格)字符,而一個特殊字符,怎麼辦?經過幾番測試後發現,varchar(max)類型要改成nvarchar(max)類型,這樣匯入的資料就不會再有此類問題了。
但後面的測試過程中,又會發現對導入後的採集資訊變更(透過.net程式編輯功能)後,資料庫中此條資訊又出現了亂碼問題,研究後發現在插入語句中這樣寫就不會出現此類問題了,如insert into 表名(news)values(N'"+更新後的值+""),為什麼加N?去百度一下就明白了。
到此,心中總算得到安慰,但後面的問題又讓人陷入鬱悶之中。網站採用的是UTF8編碼,這樣在轉換的過程中又出現亂碼(還是那個「空白」特殊字元搞的),怎麼辦?問題,這下弄的一上午為了解決這個問題,最後還是沒有辦法,正鬱悶之時,突然想到透過VS的調試功能來看看這個特殊字符究竟是什麼玩意,最後通過把數據庫的此字段值讀取出後,然後轉換成字元數組,content.ToCharArray(); 一個一個的看,發現,導致亂碼的這個字元是' '注意引號中的空白,這不是一個空格,而是一個在GB2312中無法識別的特殊字符,此時突然想到,能不能把這個字符的值直接用空格替換呢? ,必須要用調試出來的這個值(因為這才是真正的導致亂碼的那個特殊字元),調試的時候在即使窗體中貼上。

以上是【XML】UTF8和GB2312編碼轉換出現亂碼的解決方案的詳細內容。更多資訊請關注PHP中文網其他相關文章!

陳述:
本文內容由網友自願投稿,版權歸原作者所有。本站不承擔相應的法律責任。如發現涉嫌抄襲或侵權的內容,請聯絡admin@php.cn