資料採礦概念與技術(韓家偉)閱讀筆記4--Data Integration和變換

來源:互聯網
上載者:User

標籤:均值   意義   http   閱讀   目的   大於   國家   期望   協助   

1.Data Integration需考慮的問題

       a.模式整合和對象匹配

       b.冗餘。原因一:能夠用一個或一組屬性匯出,原因二:屬性或維命名的不一致。

2.屬性冗餘的相關分析檢測

       a.數值屬性計算相關係數

       

       說明:n為元祖個數,ai,bi分別為元祖i中屬性A,B的值。-A,-B分別為A和B的均值,然後是A,B的標準差,然後是AB叉積(即,對於每個元祖,屬性A乘以B)的和。注意應有:-1<=r<=1,如果r大於0,則A,B是正相關的。意味著A的值隨B的值得增加而增加,該值越大,相關性越強。r=0表示不想關。r<0,AB負相關,意味著一個屬性阻止另一個屬性的出現。

       另外:兩個屬性相關並不意味著一個導致另外一個。

      b.分類(離散)資料通過x2,卡方檢驗。

             設A有r個值,B有c個值,則A的r個值與B的c個值構成一個表的列和行。令(Ai,Bi)表示A取值ai,B取值bi的事件。

                                  

             其中,Oij是聯合事件(Ai,Bj)的觀測頻度(即實際計數),而eij是(Ai,Bj)的期望頻度,可以用下式計算:

                                   

             其中,N是資料元祖的個數,count(A=ai)是A具有值ai的元祖個數,count(B=bj)是B具有值bj的元祖個數。

3.元祖級冗餘檢測重複

       不一致通常出現在各種不同的副本之間,在於輸入的錯誤和更新了資料的部分出現,而未更新所有的出現。

 4.資料值衝突的檢測和處理

       不同資料來源屬性的表示,比例,單位,編碼不一致。不同資料來源相同名字屬性的表示意義可能不同。

 5.資料變換涉及的內容(資料準備)

        a.光滑:去雜訊

    b.聚集(不同於聚類):匯總和聚集更多的是對現有的資料進行綜合計算得到新的屬性值(例如:求年度營收)。

    c.資料泛化:使用概念分層,用高的概念替換未經處理資料。例如,國家替換街道,青年替換數值年齡等。

       d.屬性構造。構建新的屬性添加到屬性集中,以協助挖掘過程,類似於聚集,但不僅僅是匯總,而且目的不同。

 

 

 

 

 

  

        

資料採礦概念與技術(韓家偉)閱讀筆記4--Data Integration和變換

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.