轉
在電腦中字元通常並不是儲存為映像,每個字元都是使用一個編碼來表示的,而每個字元究竟使用哪個編碼代表,要取決於使用哪個字元集(charset)。
在最初的時候,Internet上只有一種字元集——ANSI的ASCII字元集,它使用7 bits來表示一個字元,總共表示128個字元,其中包括了英文字母、數字、標點符號等常用字元。之後,又進行擴充,使用8 bits表示一個字元,可以表示256個字元,主要在原來的7 bits字元集的基礎上加入了一些特殊符號例如定位字元。
後來,由於各國語言的加入,ASCII已經不能滿足資訊交流的需要,因此,為了能夠表示其它國家的文字,各國在ASCII的基礎上制定了自己的字元集,這些從ANSI標準派生的字元集被習慣的統稱為ANSI字元集,它們正式的名稱應該是MBCS(Multi-Byte Chactacter System,即多位元組字元系統)。這些派生字元集的特點是以ASCII 127 bits為基礎,相容ASCII 127,他們使用大於128的編碼作為一個Leading Byte,緊跟在Leading Byte後的第二(甚至第三)個字元與Leading Byte一起作為實際的編碼。這樣的字元集有很多,我們常見的GB-2312就是其中之一。
例如在GB-2312字元集中,“連通”的編碼為C1 AC CD A8,其中C1和CD就是Leading Byte。前127個編碼為標準ASCII保留,例如“0”的編碼是30H(30H表示十六進位的30)。軟體在讀取時,如果看到30H,知道它小於128就是標準ASCII,表示“0”,看到C1大於128就知道它後面有一個另外的編碼,因此C1 AC一同構成一個整個的編碼,在GB-2312字元集中表示“連”。
由於每種語言都制定了自己的字元集,導致最後存在的各種字元集實在太多,在國際交流中要經常轉換字元集非常不便。因此,提出了Unicode字元集,它固定使用16 bits(兩個位元組、一個字)來表示一個字元,共可以表示65536個字元。將世界上幾乎所有語言的常用字元收錄其中,方便了資訊交流。標準的Unicode稱為UTF-16。後來為了雙位元組的Unicode能夠在現存的處理單位元組的系統上正確傳輸,出現了UTF-8,使用類似MBCS的方式對Unicode進行編碼。注意UTF-8是編碼,它屬於Unicode字元集。Unicode字元集有多種編碼形式,而ASCII只有一種,大多數MBCS(包括GB-2312)也只有一種。
例如“連通”兩個字的Unicode標準編碼UTF-16 (big endian)為:DE 8F 1A 90
而其UTF-8編碼為:E8 BF 9E E9 80 9A
最後,當一個軟體開啟一個文本時,它要做的第一件事是決定這個文本究竟是使用哪種字元集的哪種編碼儲存的。軟體有三種途徑來決定文本的字元集和編碼:
最標準的途徑是檢測文本最開頭的幾個位元組,如下表:
開頭位元組 Charset/encoding
EF BB BF UTF-8
FE FF UTF-16/UCS-2, little endian
FF FE UTF-16/UCS-2, big endian
FF FE 00 00 UTF-32/UCS-4, little endian.
00 00 FE FF UTF-32/UCS-4, big-endian.
例如插入標記後,連通”兩個字的UTF-16 (big endian)和UTF-8碼分別為:
FF FE DE 8F 1A 90
EF BB BF E8 BF 9E E9 80 9A
但是MBCS文本沒有這些位於開頭的字元集標記,更不幸的是,一些早期的和一些設計不良的軟體在儲存Unicode文本時不插入這些位於開頭的字元集標記。因此,軟體不能依賴於這種途徑。這時,軟體可以採取一種比較安全的方式來決定字元集及其編碼,那就是彈出一個對話方塊來請示使用者,例如將那個“連通”檔案拖到MS Word中,Word就會彈出一個對話方塊。
如果軟體不想麻煩使用者,或者它不方便向使用者請示,那它只能採取自己“猜”的方法,軟體可以根據整個文本的特徵來猜測它可能屬於哪個charset,這就很可能不準了。使用記事本開啟那個“連通”檔案就屬於這種情況。
我們可以證明這一點:在記事本中鍵入“連通”後,選擇“Save As”,會看到最後一個下拉框中顯示有“ANSI”,這時儲存。當再當開啟“連通”檔案出現亂碼後,再點擊“File”->“Save As”,會看到最後一個下拉框中顯示有“UTF-8”,這說明記事本認為當前開啟的這個文本是一個UTF-8編碼的文本。而我們剛才儲存時是用ANSI字元集儲存的。這說明,記事本猜測了“連通”檔案的字元集,認為它更像一個UTF-8編碼文本。這是因為“連通”兩個字的GB-2312編碼看起來更像UTF-8編碼導致的,這是一個巧合,不是所有文字都這樣。可以使用記事本的開啟功能,在開啟“連通”檔案時在最後一個下拉框中選擇ANSI,就能正常顯示了。反過來,如果之前儲存時儲存為UTF-8編碼,則直接開啟也不會出現問題。
如果將“連通”檔案放入MS Word中,Word也會認為它是一個UTF-8編碼的檔案,但它不能確定,因此會彈出一個對話方塊詢問使用者,這時選擇“簡體中文(GB2312)”,就能正常開啟了。記事本在這一點上做得比較簡化罷了,這與這個程式的定位是一致的。
我們再次感謝高工給我們帶來的解釋,讓我們對這一現象有了比較清楚的認識。