歸一化和標準化__歸一化

來源:互聯網
上載者:User

主要是讀了這篇文章才深入理解這兩個的區別

http://www.zhaokv.com/2016/01/normalization-and-standardization.html

歸一化
對未經處理資料進行線性轉換到 [0,1] 區間,如下:

最小值和最大值特別容易受異常值影響,因此魯棒性不好,比較適合傳統的小資料情境

標準化
最常用的方法是Z-score標準化,即將資料轉化成均值為0,標準差為1,處理方法如下:

其中 是樣本的均值, 是樣本的標準差,適合已有的樣本量足夠大的時候使用。

理論解釋
歸一化的依據非常簡單,歸一化可以消除量綱對結果的影響,使不同變數有可比性。

標準化的依據相對複雜,它表示原始值和均值之間差幾個標準差,是一個相對值,有去除量綱的效果,還帶來了兩個附加好處:均值為0,方差為1.

均值為0可以帶來很多遍曆,比如在去中心化的資料上做SVD分解等價於在未經處理資料上做PCA;機器學習中很多函數如Sigmoid、Tanh、Softmax等都以0為中心左右分布(不一定對稱),這點後續需要再詳細琢磨

標準差為1帶來的好處:對於 與 兩點間的距離為:

其中 是屬性 j 兩個點之間的距離, 是該屬性間距離在總距離中的權重,注意:就算 也不能實現每個屬性對最後的結果貢獻度相同,對於給定的資料集,所有點對間距離的平均值是個定值,

其中,

可見第j個變數對最終整體平均距離的影響是 ,所以是 可以使所有屬性對全體資料集平均距離的貢獻相同,再進一步假設 為歐式距離(即二次範數)的平方,則

其中 是 的樣本估計,也就是說每個變數對距離的貢獻度正比於這個變數在資料集上的方差。如果我令標準差為1,每個維度在計算距離是的重要程度相同。

如果想讓每個維度在計算距離時發揮相同的作用,應該選擇標準化,如果想保留未經處理資料中由標準差所反映的潛在權重關係,應該選擇歸一化;標準化更適合噪音大資料。

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.