python 中文亂碼解決方案

來源:互聯網
上載者:User

比如我從網上下載一些資訊或寫個電子郵件程式下載到本地,以記事本(txt)
形式寫入並儲存在本機電腦,為什麼看到只是英文和亂碼的?該怎樣做呢?

亂碼原因:
因為你的檔案聲明為utf-8,並且也應該是用utf-8的編碼儲存的源檔案。但是windows的本地預設編碼是cp936,也就是gbk編碼,所以在控制台直接列印utf-8的字串當然是亂碼了。

解決方案:
在控制台列印的地方用一個轉碼就ok了,列印的時候這麼寫:

print myname.decode('utf-8').encode('gbk')

比較通用的方法應該是:

import sys
type = sys.getfilesystemencoding()
print myname.decode('utf-8').encode(type)

下面我們看常用的中文亂碼解決方案集

方法一:

在檔案的開頭加入編碼聲明:

#coding = gbk

s = 'Google'

print s

輸出結果:Google

 


方法二:

在輸出時進行轉碼:

#coding = utf-8

s = 'Google'

print unicode(s,'gbk')

輸出結果:Google

txt檔案中文亂碼處理

某些軟體,如notepad,在儲存一個以utf-8編碼的檔案時,會在檔案開始的地方插入三個不可見的字元(0xef 0xbb 0xbf,即bom)。因此我們在讀取時需要自己去掉這些字元,python中的codecs module定義了這個常量

# coding=gbk 

import codecs

data = open("test.txt").read()

if data[:3] == codecs.bom_utf8:

datadata = data[3:]

print data.decode("utf-8")


用unicode函數和decode方法把str轉換成unicode。為什麼這兩個函數的參數用"gbk"呢?
第一反應是我們的編碼聲明裡用了gbk(# coding=gbk),但真是這樣?
修改一下源檔案:

# coding=utf-8
s = "中文"
print unicode(s, "utf-8")


運行,報錯:

traceback (most recent call last):
  file "chinesetest.py", line 3, in <module>
    s = unicode(s, "utf-8")
unicodedecodeerror: 'utf8' codec can't decode bytes in position 0-1: invalid data


顯然,如果前面正常是因為兩邊都使用了gbk,那麼這裡我保持了兩邊utf-8一致,也應該正常,不至於報錯。
更進一步的例子,如果我們這裡轉換仍然用gbk:
# coding=utf-8
s = "中文"
print unicode(s, "gbk")
結果:中文

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.