貝葉斯簡介 貝葉斯學習方法的特徵 貝葉斯法則 極大假設 舉例 基本機率公式表
機器學習的學習速度不夠快,不過希望能夠學的比較踏實。畢竟雖然是IT但是更偏向數學,所以要學的嚴謹透徹,才能更好的應用到合適的情境裡。 貝葉斯簡介
貝葉斯推理提供了推理的一種機率手段。它基於如下的嘉定,既待考察的量遵循某機率分數,且可2根據這些機率及已觀察到的資料進行推理,以做出最優的決策。
貝葉斯學習對於機器學習相關有以下兩個原因:
1. 貝葉斯學習演算法能夠計算顯式的假設機率,如樸素貝葉斯分類器,它是解決響應學習問題的最實際的方法之一。對於文字文件分類(電子新聞類)。對於這樣的學習任務,樸素貝葉斯分類器是最有效分類之一。
2. 貝葉斯學習為理解多數學習演算法提供了一種有效手段,而這些演算法不一定直接操縱機率資料。 貝葉斯學習方法的特徵 觀察道德每個訓練範例可以增量的降低或升高某假設的估計機率。這提供了一種比其他演算法更合理的學習途徑。其他演算法會在某個假設與任一範例不一致時完全去掉該假設。 先驗知識可以觀察資料一起決定假設的最終機率。在貝葉斯學習中,先驗知識的形式可以是:(1)每個候選假設的先驗機率;(2)每個可能假設在可觀察資料上的機率分布。 貝葉斯方法可允許假設做出不確定性預測(比如這樣的假設: 這一肺炎病人有93%的機會康複) 新的執行個體分類可由多個假設一起做出預測,用他們的機率來加權。 即使在貝葉斯方法計算複雜度較高的時候,他們仍然可以作為一個最優的決策的標準衡量其他演算法。 貝葉斯法則
在機器學習中,通常我們感興趣的是在給定訓練資料D時,確定假設空間H中的最佳假設。所謂最佳( best ) 假設,一種辦法是把它定義為在給定資料集D以及H中的不同假設的先驗機率的有關知識得罪可能(most probable )假設。 貝葉斯理論提供了一種直接計算這種可能性的方法。 更精確地講,貝葉斯法則提供了一種計算假設機率的方法,它基於假設的先驗機率給定假設下觀察到不同資料的機率以及觀察到的資料本身。
上面長篇大論說了這麼多,是為了給一個概念,下面說下先驗機率,後驗機率 用P(h)來代表在沒有訓練資料前假設h擁有的初始機率。P(h)就被稱為h的先驗機率 ( prior probability ). 使用P(x|y)代表給定y時x的機率。即給定訓練資料D時h成立的機率。P(h|D)被稱為h的後驗機率( posterior probability )。 後驗機率P(h|D)反映了訓練資料D的影響;相反,先驗機率P(h)是獨立於D的。
貝葉斯法則是貝葉斯學習方法的基礎,因為它提供了從先驗機率P(h)以及P(D)和P(D|h)計算後驗機率P(h|D)的方法。
貝葉斯公式
P(h|D)=P(D|h)P(h)P(D)
這裡可以看到,P(D)越大,P(h|D)越小,其實是合理的,表示的是假如單獨D的先驗機率越高,也就是單獨觀察時候出現的機率越大,那麼D對h的支援度也就越小。 極大假設
在許多學習情境內各種,學習器考慮候選假設集合H並在其中尋找給定資料D時候,可能性最大的假設 h∈H (或者存在多個這樣的假設時選擇其中之一)。這樣的具有最大可能性的假設被稱為極大後驗( maximum a posteriori, MAP )假設。確定MAP假設的方法是用貝葉斯公式計算每個候選假設的後驗機率。 hMAP 為MAP假設。
hMAP≡argmaxh∈HP(h|D)=argmaxh∈HP(D|h)P(h)P(D)=argmaxh∈HP(D|h)P(h)
這裡可以看到在最後一步去掉了P(D),因為它不是依賴於h的常量。
在某些情況下,我們可以假定H中每個假設都有相同的先驗機率,即對任意的 hi 和 hj 都有, P(hi)=P(hj) 。這時候可以進一步簡化這個公式,只需要考慮P(D|h)就可以尋找加大可能假設了。
P(D|h) 被稱為給定h時資料 D 的似然度( likelihood )。而是 P(D|h) 最大的假設稱之為極大似然 ( maximum likelihood , ML)假設 hML
hML≡argmaxh∈HP(D|h)
這裡面資料D就是目標函數的訓練範例,H稱之為候選目標的函數空間。 舉例
來源於:機器學習
假如在社會中,一個人得cancer的機率是:0.8%,而對一個人進行檢測,檢測到得cancner的準確率是:98%,檢測一個人是沒得cancner的準確率是:97%。 那麼假如一個人來檢測,結果是 ⊕ 這個人是否應該判斷有癌症(就是判斷 P(cancner|⊕) ):
首先根據已知條件我們知道:
P(cancner)P(⇁cancner)P(⊕|cancner)P(⊕|⇁cancer)P(⊖|cancner)P(⊖|⇁cancer)=0.8%=99.2%=98%=3%=2%=97%
那麼根據上面的公式可以得到:
P(⊕|cancer)P(caner)P(⊕|⇁cancner)P(⇁cancer)=(0.8%∗99.2%)≈0.78%=(3%∗99.2%)≈2.98%
因此 hMAP=⇁cancer 。確切的後驗機率可以將上面的結果歸一化是他們的和為1.
P(cancer|⊕)=0.78%0.78%+2.98%=0.21
這個步驟的根據在於貝葉斯公式說明後驗機率就是上面的量除以 P(⊕) 。雖然沒有給出這個變數作為一直,但是因為
P(cancner|⊕)andP(⇁cancner|⊕)
這兩個變數的和一定為1.可以進行歸一化。所以雖然癌症的後驗機率要比先驗機率大,但是這裡還是可以假設這個病人是沒有癌症的。
注意上面計算檢測有癌症的先驗機率 P(⊕) 依據的是計算機率的:全機率法則 下面會講。 基本機率公式表 乘法規則 ( Product rule ): 兩件事 A 和 B 的交機率為 P(A∧B) :
P(A∧B)=P(A|B)P(B)=P(B|A)P(A) 加法規則 ( Sum rule ) : 兩件事 A 和 B 的並機率為 P(A∨B) :
P(A∨B)=P(A)+P(B)+P(A∧B) 貝葉斯規則 (Bayes theorem ): 給定 D 時 h 的後驗機率為 P(h|D) :
P(h|D)=P(D|h)P(h)P(D) 全機率法則 ( Theorem of total probability ) 如果時間 A1,...,An 互斥,且 ∑ni=1P(Ai)=1 則:
P(B)=∑i=1nP(B|Ai)P(Ai)
以上是貝葉斯的一些基本理論,作為基礎學習後面的Brute-force貝葉斯概念以及樸素貝葉斯分類器等都很重要。後面我會繼續努力學習的。