標籤:
機率統計與機器學習的關係
機率問題是已知整體的情況下判定樣本(整體推個體)
統計問題是機率問題的逆向工程(個體推整體)
機器學習監督學習中,首先根據樣本及樣本標籤訓練出模型(個體推整體),再根據模型對樣本標籤進行預測(整體推個體)。
- 統計估計的是分布,機器學習訓練出來的是模型,模型可能包含了很多分布。
- 訓練與預測過程的一個核心評價指標就是模型的誤差。
- 誤差本身就可以是機率的形式,與機率緊密相關。
- 對誤差的不同定義方式就演化成了不同損失函數的定義方式。
- 機器學習是機率與統計的進階版本。(不嚴謹的說法)
重要的統計量
共變數應用到機器學習中
共變數是兩個隨機變數具有相同方向變化趨勢的度量
- 若Cov(X,Y)>0,它們的變化趨勢相同;
- 若Cov(X,Y)<0,它們的變化趨勢相反;
- 若Cov(X,Y)=0,X和Y不相關;
若X為樣本的某一特徵,Y為樣本標籤,可根據特徵與標籤的共變數特性來篩選特徵,如樣本的顏色與品質是不相關的,其共變數為0,在訓練模型來預測品質時可篩除顏色特徵。
對於n個隨機變數(X1,X2,……Xn),任意兩個特徵都可以得到一個共變數,從而形成n*n的矩陣,即共變數矩陣,共變數矩陣為對稱矩陣。同樣的任意兩個特徵都可以計算相關係數,從而形成相關係數矩陣。共變數矩陣與相關係數矩陣都可以發現特徵之間的相關性。
若X1,X2是線性關係時,則X2=aX1+b,那麼X1與X2可以相互表示,那麼X1和X2隻保留其中一個即可,特徵之間的相關性越大相關係數絕對值越大,因此可以通過相關係數矩陣來篩選特徵。
用樣本估計參數
- 矩估計
矩估計法, 也稱“矩法估計”,就是利用樣本矩來估計總體中相應的參數.最簡單的矩估計法是用一階樣本原點矩來估計總體的期望而用二階樣本中心矩來估計總體的方差.
- 極大似然估計
在實踐中,由於求導的需要,往往將似然函數取對數,得到對數似然函數;若對數似然函數可導,可對Θ求偏導,通過使偏導為0求對數似然函數的駐點,然後分析該駐點是否為極大值點。
機器學習中的數理統計與參數估計