標籤:一般來說 定義 line 學習 inline 3.3 正則 display 空間
3. 支援向量機3.1 本質
基本模型是定義在特徵空間上的間隔最大的線性分類器。核技巧使之成為實質上的非線性分類器。
學習策略是間隔最大化,可形式化為求解凸二次最佳化問題。等價於正則化的合頁損失函數的最小化問題。
學習演算法是求解凸二次規劃的最佳化演算法。
理解支援向量機可以從簡至繁推進:線性可分支援向量機(硬間隔SVM),線性支援向量機(軟間隔SVM),非線性支援向量機(軟間隔最大化+核技巧)。
3.2 訓練資料集
假設給定訓練資料集:\(T={(x_1,y_1), (x_2, y_2), ..., (x_N, y_N)}\)
其中\(x \in R^n\),\(y\in\{+1, -1\}\),+1表示為正例,-1表示負例。
學習的目標在於在特徵空間中尋找一個分離超平面\(w \cdot x + b = 0\),將正例和負例正確分開。感知機利用誤分類最小的策略。SVM利用間隔最大化的策略。
3.3 線性可分SVM
假設訓練資料集線性可分,則存在無窮個分離超平面可將兩類資料正確分開。若分類超平面為:\(w \cdot x + b = 0\)
相應的分類決策函數為:\(f(x)=sign(w \cdot x + b)\)
這種判別為模型為線性可分SVM。
線性可分SVM的學習策略(尋找超平面的策略)為間隔最大化。
那麼,何為間隔呢?
對於一個分離超平面\(w \cdot x +b = 0\),樣本點\(x_i\)距離超平面的幾何距離為:
\(\gamma_i = \frac{|w \cdot x+b|}{||w||}\)。一般來說,點\(x_i\)距離超平面的遠近可以表示分類預測的確信度。距離超平面較遠的點,其分類預測結果更可信。\(w \cdot x_i + b\)的符號與類標記\(y_i\)是否一致表示分類的正確性。
間隔就是分類正確性和確信度的一種表達,可分為函數間隔和幾何間隔。\(|w \cdot x_i + b|\)可以相對地表示點\(x_i\)距離超平面的遠近,\(y_i(w \cdot x_i +b)\)為函數間隔。\[\frac{y_i(w \cdot x_i + b)}{||w||}\]為幾何間隔。
3.3.1 求解分割超平面的問題建模:間隔最大化
SVM學習的基本想法是求解能夠正確劃分訓練資料集且幾何間隔最大的分離超平面。
\(min \gamma\)
\(s.t. \frac{y_i(w \cdot x_i + b)}{||w||}>\gamma\)
3. 支援向量機