《Python 機器學習》筆記(一)

來源:互聯網
上載者:User

標籤:輸出   有用   環境   測試資料   分類   特徵   無法   agent   驗證   

賦予電腦學習資料的能力

涵蓋:

1.機器學習的一般概念

2.機器學習方法的三種類型和基本術語

3.成功構建機器學習系統所需的模組

機器學習的三種不同方法

1.監督學習

2.無監督學習

3.強化學習

通過監督學習對未來事件進行預測

監督學習的主要目的是使用有類標的訓練資料構建模型,我們可以使用訓練得到的模型對未來資料進行預測。此外,術語監督是指訓練資料集中的每個樣本均有一個已知的輸出項(類標label)

1.利用分類對類標進行預測

分類是監督學習的一個子類,其目的是基於對過往類標已知樣本的觀測與學習,實現對新樣本類標的預測。這些類標是離散的、無序的值,他們可以視為樣本的組別資訊。

2.使用迴歸預測連續輸出值

通過強化學習解決互動式問題

強化學習的目標是構建一個系統(Agent),在與環境(environment)互動的過程中提高系統的效能。環境的目前狀態資訊中通常包含一個反饋(reward)訊號,我們可以將強化學習視為與監督學習相關的一個領域。然而,在強化學習中,這個反饋值不是一個確定的類標或者連續類型的值,而是一個通過反饋函數產生的對當前系統行為的評價。通過與環境的互動,Agent可以通過強化學習來得到一系列行為,通過探索性的試錯或者藉助精心設計的激勵系統使得正向反饋最大化。

通過無監督學習探索資料本身潛在的結構

1.通過聚類探索資料的子群

2.資料壓縮中的降維

構建機器學習系統的藍圖

1.資料預先處理

為了儘可能發揮機器學習演算法的效能,往往對未經處理資料的格式等有一些特定的要求,但未經處理資料很少能達到此標準。因此,資料預先處理是機器學習應用過程中必不可少的重要步驟之一。

某些屬性間可能存在較高的關聯,因此存在一定的資料冗餘。在此情況下,使用資料降維技術將資料壓縮到相對低維度子空間是非常有用的。資料降維不僅能夠使得所需的儲存空間更小,而且還能夠使學習演算法運行得更快。

2.選擇預測模型類型並進行訓練

目前已經有多種不同大的機器學習演算法用來解決不同的問題。“天下沒有免費的午餐”中,我們可以總結出重要的一點:我們無法真正免費使用學習演算法。舉例來說:任何分類演算法都有其內在的局限性,如果我們不對分類任務預先做一些設定,沒有任何一個分類模型會比其他模型更具優勢。

3.模型驗證與使用未知資料及進行預測

在使用訓練資料集構建出一個模型之後,可以採用測試資料集對模型進行測試,預測該模型在未知資料上的表現並對模型的泛化誤差進行評估。如果我們對模型的評估結果表示滿意,就可以使用此模型對以後新的未知資料進行預測。有一點需要注意,之前所提到的特徵縮放、降維等步驟中所需的參數,只可以從訓練資料集中擷取,並能夠應用於測試資料集及新的資料樣本,但僅在測試集上對模型進行效能評估或許無法偵測模型是否被過度最佳化。

《Python 機器學習》筆記(一)

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.