統計學習方法 (第3章)K近鄰法 學習筆記

來源:互聯網
上載者:User

標籤:訓練   png   3.1.1   9.png   技術分享   統計   決策   影響   利用   

第3章 K近鄰法

  k近鄰演算法簡單、直觀:給定一個訓練資料集,對新的輸入執行個體,在訓練資料集中找到與該執行個體最鄰近的k個執行個體,這k個執行個體的多數屬於某個類,就把該輸入執行個體分為這個類。當K=1時,又稱為最近鄰演算法,這時候就是將訓練資料集中與x最鄰近點作為x的類。

3.1 k近鄰模型

  模型由三個基本要素——距離度量、k值得選擇、和分類決策規則決定。

  3.1.1 距離度量

    

    p=2時,稱為歐式距離,p=1時,稱為曼哈頓距離。

  3.1.2 k值的選擇

    k 值的選擇會對k 近鄰法的結果產生重大影響。如果選擇較小的k 值,就相當於用較小的鄰域中的訓練執行個體進行預測"學習"的近似誤差會減小,只有與輸入執行個體較近的(相似的)訓練執行個體才會對預測結果起作用但缺點是"學習"的估計誤差會增大,預測結果會對近鄰的執行個體點非常敏感山如果鄰近的執行個體點恰巧是雜訊,預測就會出錯。也就是說,k值月小,相當於模型越複雜,容易發生過擬合,當k=N的時候,那麼無論輸入什麼,都是簡單的預測特為含執行個體最多的類,模型太簡單。一般用交叉驗證法來選取最優k值。

  3.1.3 分類決策規則

    多數表決規則,即由輸入執行個體的k個近鄰的訓練執行個體中的多數類決定輸入執行個體的類。

3.2 K近鄰法的實現:kd樹

  kd樹是二叉樹,表示對k維空間的一個劃分,構造kd樹相當於不斷地用垂直於座標軸的超平面將k維空間切分,構成一系列的k維超矩形地區。kd樹的每個節點對應於以k維超矩形地區。

  3.2.1 構造kd樹

  

    給出例子便於理解:

    

  3.2.2 搜尋kd樹

    

    同樣,給出例子便於理解:

    

    所以,利用kd樹可以省去對大部分資料點的搜尋,從而減少搜尋的計算量。

 

統計學習方法 (第3章)K近鄰法 學習筆記

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.