標籤:style blog http color strong 資料
1. 統計學習
- 統計學習是關於電腦基於資料構建機率統計模型並運用模型對資料進行預測與分析的一門學科,也稱統計機器學習。
- 學習就是如果一個系統能夠通過執行某個流程改善它的效能,這就是學習。
- 統計學習的對象是資料,它從資料出發,提取資料的特徵,抽象出資料的模型,探索資料中的知識,又回到對資料的分析與預測中去。統計學習關於資料的基本假設是同質資料具有一定的統計規律性,這是統計學習的前提。
- 統計學習的目的就是考慮學習什麼樣的模型和如何學習模型, 以使模型能對書籍進行準確的預測與分析。
- 統計學習由監督學習(supervised learning)、非監督學習(unsupervised learning)、半監督學習(semi-supervised learning)、和強化學習(reinforcement learning)等組成。
- 從給定的、有限的、用於學習的訓練資料(training data)集合出發,假設資料獨立同分布,同一假設空間;應用某個評價標準,從假設空間中選取一個最優的模型。
- 三要素: 模型(model)、策略(strategy)、和演算法(algorithm)
- 統計學習方法步驟:
1). 得到一個有限的訓練資料集合;
2). 確定包含所有可能的模型的假設空間,即學習模型的集合;
3). 確定模型選擇的準則,即學習的策略;
4). 實現求解最優模型的演算法,即學習的演算法;
5). 通過學習方法選擇最優模型;
6). 利用學習的最優模型對新資料進行預測或分析。
2. 監督學習
- 任務: 學習一個模型,使模型能夠對任意給定的輸入,對其相應的輸出做出一個好的預測.
- 根據輸入、輸出變數的不同類型,對預測任務給予不同的名稱:輸入變數和輸出變數均為連續變數的預測問題稱為迴歸問題;輸出變數為有限個離散變數的預測問題稱為分類問題;輸入變數與輸出變數均為變數序列的預測問題稱為標註問題。
- 輸入即訓練集通常表示為;
其中,表示執行個體的特徵向量, 表示第i個輸入變數的第 j個特徵.
- 輸入(出)空間: 輸入(出)所有可能取值的集合,其中輸入與輸出對又稱為樣本。
- 監督學習假設輸入與輸出的隨機變數X和Y遵循聯合機率分布P(X,Y),P(X,Y)表示分布函數,或分布密度函數。訓練資料域測試資料被看做是依聯合機率分布P(X,Y)獨立同分布產生的。X和Y具有聯合機率分布的假設就是監督學習關於資料的基本假設.
- 監督學習的目的在於學習一個由輸入到輸出的映射,這一映射由模型來表示。而模型屬於由輸入空間到輸出空間的映射的集合,這個集合就是假設空間(hypothesis space), 假設空間的確定意味著學習範圍的確定.
- 監督學習的模型可以是機率模型或非機率模型,由條件機率分布P(Y|X)或決策函數Y=f(X)表示,隨具體學習方法而定。對具體的輸入進行相應的輸出預測時,寫作P(x|y) 或 y=f(x)
- 監督學習分為學習和預測兩個過程,由學習系統與預測系統完成,
3. 統計學習三要素(模型、策略、演算法)
(1). 模型
待續...
筆記來源於《統計學習方法》—李航著
參考:http://blog.csdn.net/qll125596718/article/details/8351337