機器學習中的數理統計與參數估計

來源:互聯網
上載者:User

標籤:

機率統計與機器學習的關係

機率問題是已知整體的情況下判定樣本(整體推個體)

統計問題是機率問題的逆向工程(個體推整體)

機器學習監督學習中,首先根據樣本及樣本標籤訓練出模型(個體推整體),再根據模型對樣本標籤進行預測(整體推個體)。

  • 統計估計的是分布,機器學習訓練出來的是模型,模型可能包含了很多分布。
  • 訓練與預測過程的一個核心評價指標就是模型的誤差。
  • 誤差本身就可以是機率的形式,與機率緊密相關。
  • 對誤差的不同定義方式就演化成了不同損失函數的定義方式。
  • 機器學習是機率與統計的進階版本。(不嚴謹的說法)
重要的統計量
  • 期望
  • 方差
  • 矩
  • 共變數、相關係數
共變數應用到機器學習中

共變數是兩個隨機變數具有相同方向變化趨勢的度量
- 若Cov(X,Y)>0,它們的變化趨勢相同;
- 若Cov(X,Y)<0,它們的變化趨勢相反;
- 若Cov(X,Y)=0,X和Y不相關;
若X為樣本的某一特徵,Y為樣本標籤,可根據特徵與標籤的共變數特性來篩選特徵,如樣本的顏色與品質是不相關的,其共變數為0,在訓練模型來預測品質時可篩除顏色特徵。

對於n個隨機變數(X1,X2,……Xn),任意兩個特徵都可以得到一個共變數,從而形成n*n的矩陣,即共變數矩陣,共變數矩陣為對稱矩陣。同樣的任意兩個特徵都可以計算相關係數,從而形成相關係數矩陣。共變數矩陣與相關係數矩陣都可以發現特徵之間的相關性。

若X1,X2是線性關係時,則X2=aX1+b,那麼X1與X2可以相互表示,那麼X1和X2隻保留其中一個即可,特徵之間的相關性越大相關係數絕對值越大,因此可以通過相關係數矩陣來篩選特徵。

用樣本估計參數
  1. 矩估計


矩估計法, 也稱“矩法估計”,就是利用樣本矩來估計總體中相應的參數.最簡單的矩估計法是用一階樣本原點矩來估計總體的期望而用二階樣本中心矩來估計總體的方差.

  1. 極大似然估計

    在實踐中,由於求導的需要,往往將似然函數取對數,得到對數似然函數;若對數似然函數可導,可對Θ求偏導,通過使偏導為0求對數似然函數的駐點,然後分析該駐點是否為極大值點。

機器學習中的數理統計與參數估計

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.