分類器學習筆記

來源:互聯網
上載者:User

標籤:使用   os   資料   io   cti   re   

1、線性分類器(Linear Regression)

     1.1貝葉斯分類器

          樸素貝葉斯(Naive Bayes)分類器,以垃圾郵件分類為例子,需要特徵之間滿足條件獨立的假設;

      局限性:

      (1)要求自變數和因變數之間滿足線性關係;

      (2)因變數是定量變數,不可以是分類變數;如果因變數是分類變數,必須用logistic迴歸。

      1.2  Logistic Regression分類器

      Logistic Regression Cost Function:   minθ 1/m ∑i=1m [ y(i)*cost1(θTx(i))+(1-y(i))*cost0(θTx(i)) ]  +λ /(2m)  *∑nj=1 θ2j          (    cost1(θTx(i))=-log hθ(x(i)),  cost0(θTx(i))=-log(1-hθ(x(i)))      )

                                            hθ(x(i))=1/(1+e-θTx(i))=g(z)

      從logistic迴歸的成本函數運算式可以看出,第二項作為regularization items(懲罰項),其中的θ對成本函數的作用與第一項中θ的作用是相反的,添加了懲罰項後,由參數λ調節控制,前後兩項相互制約,使得θ既不能過大也不能過小,最終平衡到一個合適的值,使得訓練集和測試集效果接近。但是從logistic的假設函數hθ來看,如果資料不是線性可分,則效果還是不好的。

      局限性:

      (1)自變數對疾病的影響是獨立的,但實際情況及推導結果不同;

      (2)訓練集的範例數目要有200例以上才可不考慮參數估計的偏性;

      (3)logistic分類器說到底是線性分類器,如果資料不是線性可分的,還是不能用logistic迴歸

2、  SVM classifier

      SVM分類器既可以作為線性分類器,也可以作為非線性分類器,這主要取決於它的核函數。

      如果不使用kernel(saying:‘linear kernel‘),則它是一個線性分類器;如果使用其他的核函數(e.g. Gaussian kernel),則是一個非線性分類器,具有非線性判決邊界。

     SVM作為線性分類器主要用在特徵數目n很大,樣本資料m很小的情況。因為如果你的訓練樣本很少,再採用複雜的分類函數,就會很容易出現過擬合。SVM作為非線性分類器主要用在特徵數目很少,樣本數目非常多的情況。因為如果你有非常多的訓練樣本,就可以採用非線性判決邊界,去獲得更加準確的分類效果。

      Logistic Regression Cost Function:   minθ 1/m ∑i=1m [ y(i)*cost1(θTx(i))+(1-y(i))*cost0(θTx(i)) ]  +λ /(2m)  *∑nj=1 θ2j          (    cost1(θTx(i))=-log hθ(x(i)),  cost0(θTx(i))=-log(1-hθ(x(i)))      )

      SVM Cost Function:                           minθ    C* ∑i=1m [ y(i)*cost1(θTf(i))+(1-y(i))*cost0(θTf(i)) ]  +  1/2 *∑nj=1 θ2j               (    cost1(θTf(i))=-log hθ(x(i)),  cost0(θTf(i))=-log(1-hθ(x(i)))      )

      對比logistic迴歸和SVM的成本函數,發現它們在形式上是一樣的,不同之處其實僅僅在於假設函數hθ。logistic迴歸的判斷依據是θTx(i)>>0, y=1;θTx(i)<<0, y=0;即其分類依據是要讓成本函數整個的要儘可能小;而SVM分類器判別依據是:θTx(i)>=1, y=1;θTx(i)<=-1, y=0;即只要判為1的點和判為0的點都距離boundary有1的單位間隔就好了,所以SVM分類器又叫做“最大間隔分類器”。

      在上面的成本函數中,第二項體現了SVM被稱為“large margin classifier”(最大間隔分類器)的原理(根據計算內積的原理推導,約束條件是假設函數成立(即y=1時,θTx(i)>=1;y=0時,θTx(i)<=-1),此時第一項為0,只剩第二項。實際上還是取決於假設函數hθ(x(i)));第一項中的假設函數hθ(x(i)),以及核函數X--->f的映射,決定了SVM non-linear classifier的性質;第一項中的常數C,相當於logistic迴歸 regularization項中的參數λ,起到調節參數個數(即特徵個數),防止過擬合的作用。

      局限性:

      (1)由於SVM的核函數本質上的作用還是為了產生新的特徵,因此,對於特徵數目遠遠大於樣本數目的資料來說,先進行特徵篩選是非常有必要的,否則,會很容易出現過擬合;

      (2)核函數的選擇需要依靠經驗;

     

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.