標籤:注意 重複 特徵 演算法 bag 丟失 協助 空值 資料品質
轉自:http://www.tipdm.org/ganhuofenxiang/1026.jhtml
資料品質分析是資料採礦中的重要一環,錯誤的假設和糟糕的資料問題都是導致資料採礦結果產生偏差的重要原因。資料採礦從業者常常會說“Garbage In ,Garbage Out”即“垃圾進,垃圾出”,裝入的資料是垃圾,計算出來的結果也是垃圾。很多的時候我們過度重視重視演算法,而忽略資料本身,演算法固然重要,但是優質完整的資料卻是要優於好的演算法,假設如資料品質一樣,資料特徵選取合理,就演算法的本身而言是不會有特別大的差異的。
那麼,基於以上的認識,在做資料採礦建模之前,往往先要做相關的資料準備,今天我們重點介紹一下資料品質分析。
資料品質分析的主要任務就是檢查未經處理資料中是否有髒資料,髒資料一般是指不符合要求,以及不能直接用來建模分析的資料,主要包括:
缺失值
異常值
不一致的值
重複資料及含有特殊符號(如#、¥、*)的資料
缺失值產生的原因
資料缺失主要包括記錄缺失和記錄中某個欄位缺失,資料缺失的原因有很多主要包括:
有些資訊暫時無法擷取,或者擷取資訊的代價太大。
資訊被遺漏。這裡又有兩種情況,一種是認為因素,輸入時認為不重要、忘記填寫或對資料理解錯誤;另一種是物理故障,資料擷取裝置、儲存介質、傳輸媒體的故障。
屬性值不存在。在某些情況下,缺失值並不意味著資料有錯誤,如一個未婚者的配偶姓名、一個兒童的固定收入等。
缺失值的影響
資料缺失不僅會影響對業務的正常理解,更會影響建模的品質。資料有缺失會使其在建模的過程中丟失大量有用資訊,有的模型不能夠處理缺失值,比如SVN,最終會導致模型混亂,輸出不可靠的資訊。
異常值分析
異常值分析是檢驗資料是否含有錄入錯誤以及含有不合常理的資料。異常值也稱為離群點,表現為樣本中的個別值,其數值明顯偏離其餘的觀測值。異常值的分析也稱為離群點分析。不加剔除地把異常值包括進資料的計算分析過程中,對結果會帶來不良影響。分析異常值產生的原因,常常成為發現問題進而改進決策的契機。常用分析方法:簡單統計量分析、3σ原則、箱型圖分析。
簡單統計量分析
最常用的統計量主要是最大值和最小值,判斷這個變數中的資料是不是超出了合理的範圍。比如說,如身高的最大值為5米,則該變數的資料存在異常(巨人症也沒這麼高),某國家幹部履曆:12歲參加工作或者某客戶年齡199歲,這些都是異常值。
需要注意的是異常值是否真正“異常”,要結合業務背景分析其產生的原因,例如航空資訊資料中票價為空白值,票價最小值為0,折扣率最小值為0、總飛行公裡數大於0的記錄。正常分析這資料可能是存在問題的,但是結合業務去理解就知道這樣的資料是常旅客積分兌換造成的。
3 σ 原則
如果資料服從常態分佈,在3σ原則下,異常值被定義為與平均值的偏差超過三倍標準差的值。
箱型圖分析
箱型圖分析可以直觀地表現資料分布的本來面貌,不需要事先假定資料服從特定的分布形式,沒有對資料作任何限制性要求。判斷異常值的標準以四分位元和四分位距為基礎,具有一定的魯棒性。多達25%的資料可以變得任意遠而不會很大地擾動四分位元,所以異常值不能對這個標準施加影響。
一致性分析
在資料採礦過程中,不一致資料的產生主要發生在Data Integration的過程中,被挖掘資料來自於不同的資料來源,重複存放的資料未能進行一致性更新。如兩張表中都儲存了使用者的地址,在使用者的地址發生改變時,如果只更新了一張表中的資料,那麼這兩張表中就有了不一致的資料。
重複資料及含有特殊符號
如果遇到重複資料及含有特殊符合的資料,檢查一下產生的原因,一般情況的處理方式,通通刪掉。
資料品質分析的常用方法就介紹這些,希望可以對各位帶來協助,重視資料品質分析,別讓你資料淪為雞肋。
資料品質分析