本文為《機器學習實戰》學習筆記 1. 決策樹簡介
決策樹可以從資料集合匯總提取一系列的規則,建立規則的過程就是機器學習的過程。在構造決策樹的過程中,不斷選取特徵劃分資料集,直到具有相同類型的資料均在資料子集內。 1.1 劃分資料集
由於不同屬性的資料類型不同,其對應的測試條件也不同。即非葉子節點的每條出邊代表的含義不同。
二元屬性產生兩個可能的輸出。
標稱屬性具有多個屬性值。可以根據屬性值的數量產生多路劃分,每個出邊代表一個屬性值;對於只產生二元劃分的演算法(CART),可以建立k個屬性值二元劃分的所有 2(k−1)−1 2^{(k-1)}-1種劃分方法。
序數屬性在保證序數屬性值有序性的同時,可以產生二元或多路劃分。
連續屬性可以通過比較測試進行二元劃分,必須考慮所有可能的劃分點;也可以定義範圍區間多路劃分,必須考慮所有可能的連續區間。
劃分資料集的最大原則是把無序資料變得有序。可以使用資訊理論量化度量資訊的內容。
如果待分類的事務可能劃分在多個分類中,則符號 xi x_i的資訊定義為:
l(xi)=−log2p(xi) l(x_i) = -log_2p(x_i)
其中 p(xi) p(x_i)是選擇該分類的機率。
集合資訊的度量方式有多種,用於度量資料集的不純性,值越大表示資料集越混亂,混合的資料越多。
其中 香農熵(熵)定義為資訊的期望值。計算熵時,需要計算所有類別所有可能值包含的資訊期望值:
H=−∑i=1Np(xi)log2p(xi) H = -\sum_{i = 1}^{N}p(x_i)log_2p(x_i)
除了熵以外,資料集不純性度量方式還有基尼係數:
Gini=1−∑i=1Np(xi)2 Gini = 1- \sum_{i=1}^Np(x_i)^2
分類誤差:
Classificationerror=1−maxip(xi) Classification error = 1 - \max_ip(x_i)
資訊增益是劃分資料集前後資訊發生的變化:
Info=I(parent)−∑j=1kN(vj)NI(vj) Info=I(parent) - \sum_{j=1}^k\frac{N