比如我從網上下載一些資訊或寫個電子郵件程式下載到本地,以記事本(txt)
形式寫入並儲存在本機電腦,為什麼看到只是英文和亂碼的?該怎樣做呢?
答
亂碼原因:
因為你的檔案聲明為utf-8,並且也應該是用utf-8的編碼儲存的源檔案。但是windows的本地預設編碼是cp936,也就是gbk編碼,所以在控制台直接列印utf-8的字串當然是亂碼了。
解決方案:
在控制台列印的地方用一個轉碼就ok了,列印的時候這麼寫:
print myname.decode('utf-8').encode('gbk')
比較通用的方法應該是:
import sys
type = sys.getfilesystemencoding()
print myname.decode('utf-8').encode(type)
下面我們看常用的中文亂碼解決方案集
方法一:
在檔案的開頭加入編碼聲明:
#coding = gbk
s = 'Google'
print s
輸出結果:Google
方法二:
在輸出時進行轉碼:
#coding = utf-8
s = 'Google'
print unicode(s,'gbk')
輸出結果:Google
txt檔案中文亂碼處理
某些軟體,如notepad,在儲存一個以utf-8編碼的檔案時,會在檔案開始的地方插入三個不可見的字元(0xef 0xbb 0xbf,即bom)。因此我們在讀取時需要自己去掉這些字元,python中的codecs module定義了這個常量
# coding=gbk
import codecs
data = open("test.txt").read()
if data[:3] == codecs.bom_utf8:
datadata = data[3:]
print data.decode("utf-8")
用unicode函數和decode方法把str轉換成unicode。為什麼這兩個函數的參數用"gbk"呢?
第一反應是我們的編碼聲明裡用了gbk(# coding=gbk),但真是這樣?
修改一下源檔案:
# coding=utf-8
s = "中文"
print unicode(s, "utf-8")
運行,報錯:
traceback (most recent call last):
file "chinesetest.py", line 3, in <module>
s = unicode(s, "utf-8")
unicodedecodeerror: 'utf8' codec can't decode bytes in position 0-1: invalid data
顯然,如果前面正常是因為兩邊都使用了gbk,那麼這裡我保持了兩邊utf-8一致,也應該正常,不至於報錯。
更進一步的例子,如果我們這裡轉換仍然用gbk:
# coding=utf-8
s = "中文"
print unicode(s, "gbk")
結果:中文