標籤:均值 意義 http 閱讀 目的 大於 國家 期望 協助
1.Data Integration需考慮的問題
a.模式整合和對象匹配
b.冗餘。原因一:能夠用一個或一組屬性匯出,原因二:屬性或維命名的不一致。
2.屬性冗餘的相關分析檢測
a.數值屬性計算相關係數
說明:n為元祖個數,ai,bi分別為元祖i中屬性A,B的值。-A,-B分別為A和B的均值,然後是A,B的標準差,然後是AB叉積(即,對於每個元祖,屬性A乘以B)的和。注意應有:-1<=r<=1,如果r大於0,則A,B是正相關的。意味著A的值隨B的值得增加而增加,該值越大,相關性越強。r=0表示不想關。r<0,AB負相關,意味著一個屬性阻止另一個屬性的出現。
另外:兩個屬性相關並不意味著一個導致另外一個。
b.分類(離散)資料通過x2,卡方檢驗。
設A有r個值,B有c個值,則A的r個值與B的c個值構成一個表的列和行。令(Ai,Bi)表示A取值ai,B取值bi的事件。
其中,Oij是聯合事件(Ai,Bj)的觀測頻度(即實際計數),而eij是(Ai,Bj)的期望頻度,可以用下式計算:
其中,N是資料元祖的個數,count(A=ai)是A具有值ai的元祖個數,count(B=bj)是B具有值bj的元祖個數。
3.元祖級冗餘檢測重複
不一致通常出現在各種不同的副本之間,在於輸入的錯誤和更新了資料的部分出現,而未更新所有的出現。
4.資料值衝突的檢測和處理
不同資料來源屬性的表示,比例,單位,編碼不一致。不同資料來源相同名字屬性的表示意義可能不同。
5.資料變換涉及的內容(資料準備)
a.光滑:去雜訊
b.聚集(不同於聚類):匯總和聚集更多的是對現有的資料進行綜合計算得到新的屬性值(例如:求年度營收)。
c.資料泛化:使用概念分層,用高的概念替換未經處理資料。例如,國家替換街道,青年替換數值年齡等。
d.屬性構造。構建新的屬性添加到屬性集中,以協助挖掘過程,類似於聚集,但不僅僅是匯總,而且目的不同。
資料採礦概念與技術(韓家偉)閱讀筆記4--Data Integration和變換