Hadoop之MapReduce任務的最佳化

來源:互聯網
上載者:User

1. 任務調度

   (1)計算方面:Hadoop總會優先將Task分配給閒置機器,所有的人物能公平地分享系統資源

   (2)I/O方面:Hadoop盡量將map Task分配給Input Split所在的機器,以減少網路I/O的消耗。

2.資料預先處理與Input Split的大小

  (1)提交MapReduce Task前可以先對資料進行一次預先處理,將資料合併以提高MapReduce Task的執行效率。參考Map Task 的執行時間,當一個Map Task執行時間比較短的時候,可以分配更多的資料。通過設定map的輸入資料大小來調節map的已耗用時間。

3.map和reduce任務的數量

(1)map任務槽和reduce任務槽。指的是這個叢集能夠同時啟動並執行map/reduce任務的最大數量。設定MapReduce Task的map數量主要參考的還是map Task的已耗用時間,而reduce任務的數量就只需要參考任務槽的設定了。

4.combine函數

  用於本地合并資料的函數,map中間有很多重複的資料,將這些記錄一一傳送給reduce task是很耗時的,所以MapReduce架構運行使用者寫一個combine函數,用於本地合并,這會大大減少網路I/O操作的消耗。job.setCombineClass(combine.class);

5.編寫MapReduce程式時,可以選擇對map的輸出和最終輸出結果進行壓縮(同時可以選擇壓縮方式)。在一些情況下,map的中間輸出可能會很大,對其進行壓縮可以有效減少網路上資料轉送量。

6.自訂compator

 在Hadoop中,可以自訂資料類型以實現更複雜的目的。當讀者想實現k-means演算法(一個基礎的聚類演算法)可以定義k個整數的集合。

      

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.