機器學習 之 SVM VC維度、樣本數目與經驗風險最小化的關係

來源:互聯網
上載者:User

標籤:樣本數目   核函數   經驗風險最小   vc維度   svm   

        VC維在有限的訓練樣本情況下,當樣本數 n 固定時,此時學習機器的 VC 維越高學習機器的複雜性越高。VC 維反映了函數集的學習能力,VC 維越大則學習機器越複雜(容量越大)。
        所謂的結構風險最小化就是在保證分類精度(經驗風險)的同時,降低學習機器的 VC 維,可以使學習機器在整個樣本集上的期望風險得到控制。

        經驗風險和實際風險之間的關係,注意引入這個原因是什嗎?

        因為訓練誤差再小也就是在這個訓練集合上,實際的推廣能力不行就會引起過擬合問題。所以說要引入置信範圍也就是經驗誤差和實際期望誤差之間的關係

        期望誤差R(ω) ≤ Remp (ω)+ Φ(n/h)

        注意Remp (ω)是經驗誤差也就是訓練誤差(線性中使得所有的都訓練正確)。

        Φ(n/h)是置信範圍,它是和樣本數和VC維有關的。

        上式中置信範圍Φ 隨n/h增加,單調下降。

        即當n/h較小時,置信範圍Φ 較大,用經驗風險近似實際風險就存在較大的誤差,因此,用採用經驗風險最小化準則,取得的最優解可能具有較差的推廣性;

        如果樣本數較多,n/h較大,則置信範圍就會很小,採用經驗風險最小化準則,求得的最優解就接近實際的最優解。

        可知:影響期望風險上界的因子有兩個方面:

        首先是訓練集的規模 n,其次是 VC 維 h。

        可見,在保證分類精度(經驗風險)的同時,降低學習機器的 VC 維,可以使學習機器在整個樣本集上的期望風險得到控制,這就是結構風險最小化(Structure Risk Minimization,簡稱 SRM)的由來。

        在有限的訓練樣本情況下,當樣本數 n 固定時,此時學習機器的 VC 維越高(學習機器的複雜性越高),則置信範圍就越大,此時,真實風險與經驗風險之間的差別就越大,這就是為什麼會出現過學習現象的原因。

        機器學習過程不但要使經驗風險最小,還要使其 VC 維盡量小,以縮小置信範圍,才能取得較小的實際風險,即對未來樣本有較好的推廣性,它與學習機器的 VC 維及訓練樣本數有關。

著作權聲明:本文為博主原創文章,未經博主允許不得轉載。

機器學習 之 SVM VC維度、樣本數目與經驗風險最小化的關係

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.