機器學習技法-隨機森林(Random Forest)

來源:互聯網
上載者:User

標籤:

課程地址:https://class.coursera.org/ntumltwo-002/lecture

重要!重要!重要~

一、隨機森林(RF)

1.RF介紹

  • RF通過Bagging的方式將許多個CART組合在一起,不考慮計算代價,通常樹越多越好。
  • RF中使用CART沒有經過剪枝操作,一般會有比較大的偏差(variance),結合Bagging的平均效果可以降低CART的偏差。
  • 在訓練CART的時候,使用有放回的隨機抽取樣本(bootstraping)、隨機的抽取樣本的特徵、甚至將樣本特徵通過映射矩陣P投影到隨機的子空間等技術來增大g(t)的隨機性、多樣性。

2.RF演算法結構和優勢

二、OOB(Out-Of-Bag)和自驗證(Automatic Validation)

1.RF中使用的有放回的抽樣方式(Bootstrapping)會導致能有些樣本在某次訓練中沒有被使用,沒有被用到的樣本稱為OOB(Out-Of-Bag)。

當樣本集合很大的時候,如果訓練資料的大小和樣本集合的大小相同,那麼某個樣本沒有被使用的機率大約為1/3,OOB的大小也約為樣本集合的1/3,下面是具體的數學描述。

2.RF Validation

RF 並不注重每棵樹的分類效果,實際中也不會用OOB資料來驗證g(t),而是使用OOB資料來驗證G。

但同時為了保證驗證資料絕對沒有在訓練時“偷窺”,使用的G是去掉與測試的OOB相關的g(t)組成的G-。

最後將所有的OOB測試結果取平均。林說:實際中Eoob通常都會非常精確。

三、特徵選取(Feature Selection)和排列檢驗(Permutation Test)

  • 在實際中,當樣本的特徵非常多的時候,有時會希望去掉冗餘或者與結果無關的特徵項,選取相對重要的特徵項。
  • 線性模型中,特徵項的重要性使用|Wi|來衡量,非線性模型中特徵項重要性的衡量一般會比較困難。
  • RF中使用統計中的工具排列檢驗(Permutation Test)來衡量特徵項的重要性。
  • N個樣本,每個樣本d個維度,要想衡量其中某個特徵di的重要,根據Permutation Test把這N個樣本的di特徵項都洗牌打亂,洗牌前後的誤差相減就是該特徵項重要性。
  • RF中通常不在訓練時使用Permutation Test,而是在Validation 時打亂OOB的特徵項,再評估驗證,獲得特徵項的重要性。

四、RF的應用

  • 在簡單資料集上,相比單棵的CART樹,RF模型邊界更加平滑,信賴區間(Margin)也比較大
  • 在複雜且有含有雜訊的資料集上,決策樹通常表現不好;RF具有很好的降噪性,相比而言RF模型也會表現得很好
  • RF中選多少棵樹好呢?總的來說是越多越好!!!實踐中,要用足夠多的樹去確保G的穩定性,所以可以使用G的穩定性來判斷使用多少棵樹好。

機器學習技法-隨機森林(Random Forest)

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.