摘要
本文是關於MLE(最大似然估計)與MAP(最大後驗機率)的一些自己學習的心得.
(本文的重點在於對比MLE和MAP) 本文 1.MLE(最大似然估計)
MLE簡單的理解可以這樣:假設我們手上有一批資料(樣本),而且我們假設這些資料(樣本)服從某個分布( 模型已知),但是參數未知.這個時候,我們希望對這個參數進行估計,而MLE的思想就是找到一個參數值,使得每條樣本出現的機率最大!
具體來說假設樣本為 x1,x2.....xn x 1 , x 2 . . . . . x n ,待估計的參數為 θ θ .
那麼要最佳化的目標為:
argmax P(x1,x2,...xn|θ)(0) (0) a r g m a x P ( x 1 , x 2 , . . . x n | θ )
假設每個樣本間獨立同分布那麼我們有:
argmax ∏ni=1P(xi|θ)(1) (1) a r g m a x ∏ i = 1 n P ( x i | θ )
後面一般是取對數,把連乘轉化成連加的形式更方便計算,後面就不展開了. 2.MAP(最大後驗機率)
還是同樣的情境:我們有一批資料(樣本),我們假設其服從某個分布(模型已知),參數未知.但是,我們還有一個額外的資訊就是,我們雖然不知道參數具體是多少,但是我們知道這個參數也服從某個分布,MAP就是加上這個條件後,去對我們的參數進行估計.
具體可以表現為:
argmax P(θ|x1,x2,...xn)(2) (2) a r g m a x P ( θ | x 1 , x 2 , . . . x n )
做一步貝葉斯公式有:
argmax P(θ|x1,x2,...xn)=P(x1,..xn|θ)P(θ)P(x1,x2...xn)(3) (3) a r g m a x P ( θ | x 1 , x 2 , . . . x n ) = P ( x 1 , . . x n | θ ) P ( θ ) P ( x 1 , x 2 . . . x n )
其中 P(θ) P ( θ ) 就是我們對 θ θ 的一個先驗分布
對於分子,我們可以看到,其實就是先驗分布和似然機率的乘積.
所以在經過幾步的簡單推導,我們可以得出MLE和MAP其實區別在於:
首先,我們不要忘了我們的目的,我的們目的是求模型中未知的參數!
1.MLE是通過直接最大化似然機率 P(x1,..xn|θ) P ( x 1 , . . x n | θ ) 來求解參數 θ θ ,而MAP是通過最大化似然機率×先驗分布,即 P(x1,..xn|θ)P(θ) P ( x 1 , . . x n | θ ) P ( θ ) 來求解參數 θ θ .
那這裡似乎透露著利用MAP來估計參數會不會使得模型更加的好?這就取決於我們的這個先驗機率捏的準不準.
MLE和MAP的聯絡在於:
1.兩者都是用於模型已知,參數未知下對參數進行估計的方法
更多詳細的參考資料:
參考資料1
參考資料2