機器學習實戰筆記--決策樹

來源:互聯網
上載者:User

本文為《機器學習實戰》學習筆記 1. 決策樹簡介

決策樹可以從資料集合匯總提取一系列的規則,建立規則的過程就是機器學習的過程。在構造決策樹的過程中,不斷選取特徵劃分資料集,直到具有相同類型的資料均在資料子集內。 1.1 劃分資料集

由於不同屬性的資料類型不同,其對應的測試條件也不同。即非葉子節點的每條出邊代表的含義不同。
二元屬性產生兩個可能的輸出。
標稱屬性具有多個屬性值。可以根據屬性值的數量產生多路劃分,每個出邊代表一個屬性值;對於只產生二元劃分的演算法(CART),可以建立k個屬性值二元劃分的所有 2(k−1)−1 2^{(k-1)}-1種劃分方法。
序數屬性在保證序數屬性值有序性的同時,可以產生二元或多路劃分。
連續屬性可以通過比較測試進行二元劃分,必須考慮所有可能的劃分點;也可以定義範圍區間多路劃分,必須考慮所有可能的連續區間。

劃分資料集的最大原則是把無序資料變得有序。可以使用資訊理論量化度量資訊的內容。
如果待分類的事務可能劃分在多個分類中,則符號 xi x_i的資訊定義為:
l(xi)=−log2p(xi) l(x_i) = -log_2p(x_i)
其中 p(xi) p(x_i)是選擇該分類的機率。
集合資訊的度量方式有多種,用於度量資料集的不純性,值越大表示資料集越混亂,混合的資料越多。
其中 香農熵(熵)定義為資訊的期望值。計算熵時,需要計算所有類別所有可能值包含的資訊期望值:
H=−∑i=1Np(xi)log2p(xi) H = -\sum_{i = 1}^{N}p(x_i)log_2p(x_i)
除了熵以外,資料集不純性度量方式還有基尼係數:
Gini=1−∑i=1Np(xi)2 Gini = 1- \sum_{i=1}^Np(x_i)^2
分類誤差:
Classificationerror=1−maxip(xi) Classification error = 1 - \max_ip(x_i)
資訊增益是劃分資料集前後資訊發生的變化:
Info=I(parent)−∑j=1kN(vj)NI(vj) Info=I(parent) - \sum_{j=1}^k\frac{N

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.