喔,似乎編碼問題很容易被解決,也很容易造成誤解,尤其是在不同系統互動的時候,特別是當傳遞的資料中包含中文的時候。
在中文的編碼上有太多的差異,有的系統喜歡用GB2312,有的系統卻採用UTF-8。
還有在網頁上,Content-Type也有多種寫法,有的愛好GB2312,其他的喜歡UTF-8等等。
很多系統中會用到MD5雜湊進行資料校正,尤其是提供介面的時候,當這個時候編碼不相同的話,就會出現很多頭疼的問題,如果找不到原因,你或許還會埋怨這誰發明的C#語言,竟然MD5演算法的結果不一樣?!
當然,如果在介面間傳遞的資料不是非英文的話,一般是不會出現的,但是成產環境中,非英文的資料是很多的。
因此我們需要找到真正的解決辦法來融合不同的系統。這裡舉一個小例子。
有一個第三方介面以HTTP方式提供,程式是用JAVA寫的,提供的資料是GB2312編碼的xml檔案,現在你要用.NET來封裝這個介面的實現,其中有些方法需要中文資料和MD5雜湊校正,而你的系統是UTF-8編碼。
找到問題在於編碼的不同,就已經解決了90%,剩下的就只有需要一個演算法了。
Code
/// <summary>
/// 指定位元組流編碼計算MD5雜湊值,可解決不同系統中文編碼差異的問題。
/// </summary>
/// <param name="source">要進行雜湊的字串</param>
/// <param name="bytesEncoding">擷取字串位元組流的編碼,如果是中文,不同系統之間請使用相同編碼</param>
/// <returns>32位大寫MD5雜湊值</returns>
public static string ComputeMD5(string source, Encoding bytesEncoding)
{
byte[] sourceBytes = bytesEncoding.GetBytes(source);
MD5CryptoServiceProvider md5 = new MD5CryptoServiceProvider();
byte[] hashedBytes = md5.ComputeHash(sourceBytes);
StringBuilder buffer = new StringBuilder(hashedBytes.Length);
foreach (byte item in hashedBytes)
{
buffer.AppendFormat("{0:X2}", item);
}
return buffer.ToString();
}
編碼問題其實真的很頭疼。