通常情況下,我們的網頁要指定一個編碼字元集,如 GB2312、UTF-8、ISO-8859-1 等,這樣我們就可以在網頁上顯示我們指定編碼的文字了。但是我們很可能會遇到這種情況,那就是我們可能希望在 ISO-8859-1 編碼的網頁上顯示漢字,或者在 GB2312 編碼的網頁上顯示韓文等。當然一種解決辦法就是我們不用 ISO-8859-1 或者 GB2312 編碼,而統統都採用 UTF-8 編碼,這樣我們只要在這種編碼下,就可以混合顯示各國文字了,這是現在很多網站採用的方法。
而我這裡所說的並非上面這種方法,因為上面這種方法必須要指定字元集為 UTF-8 才可以,一旦使用者手工指定為其他字元集,或者可能因為某些原因,那個字元集設定沒起作用,而瀏覽器又沒有正確自動識別的話,我們看到的網頁還是亂碼,尤其是在某些用架構作的網頁中,某個架構中的頁面如果字元集設定沒起作用,在 firefox 中顯示亂碼而且還沒法改變(我是說在不裝RightEncode外掛程式的情況下)。
而我這裡介紹的方法即使是把網頁指定為 ISO-8859-1 字元集,也能夠正確顯示漢字、日文等。原理很簡單,就是把除了 ISO-8859-1 編碼中前128個字元以外的所有其他的編碼都用 NCR(Numeric character reference) 來表示。比如“漢字”這兩個字,如果我們寫成“汉字”這種形式,那麼它在任一字元集下都可以正確顯示。根據這個原理,我寫了下面這個程式,它可以把現有的網頁轉化為在任一字元集下都能顯示的網頁。你只需要指定源網頁的字元集和源網頁,點提交按鈕,就可以得到目標網頁了。你也可以只轉化某些文字,只需要把文字填寫到文字框中,並指定這些文字原來的字元集,點提交按鈕,就會在頁面上面顯示編碼後的文字了。另外我還編寫了WordPress 的外掛程式,現在我的 Blog 已經可以在任一字元集下都能正確顯示了。
實現方法:
首先第一步是要把源字元集的字串轉化為UTF-16字元集,做這一步是因為UTF-16字元集中的每個字元都是兩個位元組,後面處理起來很容易,而如果在源字元集上直接做處理則很複雜。源字元集可以從原網頁中的meta標籤中獲得,也可以單獨指定,我的程式是讓使用者在表單中指定源字元集,因為我不能保證使用者提交的檔案就一定是HTML檔案(其他檔案也是可以的,比如這個WordPress的漢化封裝來源檔案是個po檔案,它裡面的內容也可以這樣處理),而且即使是HTML檔案,裡面也不一定就有用於指定字元集的meta標籤,所以通過表單單獨指定字元集比較保險。你可能會覺得將一種字元集轉化為另一種字元集很複雜,確實如此,如果自己來實現的話,確實非常麻煩,但是用PHP來做卻很容易,因為它裡面已經包含這樣的函數了,你可以通過iconv函數很容易的來實現各種字元集之間的轉化,如果你的機器上沒有安裝iconv擴充,你也可以使用mb_convert_encoding函數,如果Multibyte String擴充也沒有安裝,那就沒辦法了,因為你要自己實現那麼多種編碼的轉化基本上是不可能的,除非你是頂級大牛!推薦使用iconv,因為這個效率高,支援的字元集也更多。
做完上面那一步之後,接下來是以每兩個位元組為單位對字串進行處理。這兩個位元組直接轉化為數字就是&#xxxxx;中的xxxxx,如果這個數字小於128就直接使用這個字元(注意這裡就變成單位元組了),否則就使用&#xxxxx;的形式。這裡有一點要注意,就是當這個數字是65279(16進位的0x FEFF)時,請把它忽略掉,因為這個是Unicode編碼中的傳輸控制字元,而我們現在的字串已經只有iso-8859-1編碼中的前128個字元了,所以我們不需要它了。
好了,基本思路就是這樣,下面是實現的程式:
以下為引用的內容:
<?php function nochaoscode($encode, $str) { $str = iconv($encode, "UTF-16BE", $str); for ($i = 0; $i < strlen($str); $i++,$i++) { $code = ord($str{$i}) * 256 + ord($str{$i + 1}); if ($code < 128) { $output .= chr($code); } else if ($code != 65279) { $output .= "&#".$code.";"; } } return $output; } ?> |
函數的參數中,$encode是源字元集,$str是需要進行轉化的字串。返回結果是轉化以後字串。