【轉】Spark架構與作業執行流程簡介

來源:互聯網
上載者:User

標籤:

原文連結 http://www.cnblogs.com/shenh062326/p/3658543.html

 

Spark架構與作業執行流程簡介Local模式

運行Spark最簡單的方法是通過Local模式(即偽分布式模式)。

    運行命令為:./bin/run-example org.apache.spark.examples.SparkPi local

基於standalone的Spark架構與作業執行流程

Standalone模式下,叢集啟動時包括Master與Worker,其中Master負責接收用戶端提交的作業,管理Worker。提供了Web展示叢集與作業資訊。

 

名詞解釋:

1. Standalone模式下存在的角色。

Client:用戶端進程,負責提交作業到Master。

Master:Standalone模式中主控節點,負責接收Client提交的作業,管理Worker,並命令Worker啟動Driver和Executor。

Worker:Standalone模式中slave節點上守護進程,負責管理本節點的資源,定期向Master彙報心跳,接收Master的命令,啟動Driver和Executor。

Driver: 一個Spark作業運行時包括一個Driver進程,也是作業的主進程,負責作業的解析、產生Stage並調度Task到Executor上。包括DAGScheduler,TaskScheduler。

Executor:即真正執行作業的地方,一個叢集一般包含多個Executor,每個Executor接收Driver的命令Launch Task,一個Executor可以執行一到多個Task。

2.作業相關的名詞解釋

Stage:一個Spark作業一般包含一到多個Stage。

Task:一個Stage包含一到多個Task,通過多個Task實現並行啟動並執行功能。

DAGScheduler: 實現將Spark作業分解成一到多個Stage,每個Stage根據RDD的Partition個數決定Task的個數,然後產生相應的Task set放到TaskScheduler中。

TaskScheduler:實現Task分配到Executor上執行。

 

提交作業有兩種方式,分別是Driver(作業的master,負責作業的解析、產生stage並調度task到,包含DAGScheduler)運行在Worker上,Driver運行在用戶端。接下來分別介紹兩種方式的作業運行原理。

Driver運行在Worker上

    通過org.apache.spark.deploy.Client類執行作業,作業運行命令如下:

        ./bin/spark-class org.apache.spark.deploy.Client launch spark://host:port file:///jar_url org.apache.spark.examples.SparkPi spark://host:port

    作業執行流1所示。

圖1

作業執行流程描述:

  1. 用戶端提交作業給Master
  2. Master讓一個Worker啟動Driver,即SchedulerBackend。Worker建立一個DriverRunner線程,DriverRunner啟動SchedulerBackend進程。
  3. 另外Master還會讓其餘Worker啟動Exeuctor,即ExecutorBackend。Worker建立一個ExecutorRunner線程,ExecutorRunner會啟動ExecutorBackend進程。
  4. ExecutorBackend啟動後會向Driver的SchedulerBackend註冊。SchedulerBackend進程中包含DAGScheduler,它會根據使用者程式,產生執行計畫,並調度執行。對於每個stage的task,都會被存放到TaskScheduler中,ExecutorBackend向SchedulerBackend彙報的時候把TaskScheduler中的task調度到ExecutorBackend執行。
  5. 所有stage都完成後作業結束。
Driver運行在用戶端

    直接執行Spark作業,作業運行命令如下(樣本):

        ./bin/run-example org.apache.spark.examples.SparkPi spark://host:port

    作業執行流2所示。

 

圖2

作業執行流程描述:

  1. 用戶端啟動後直接運行使用者程式,啟動Driver相關的工作:DAGScheduler和BlockManagerMaster等。
  2. 用戶端的Driver向Master註冊。
  3. Master還會讓Worker啟動Exeuctor。Worker建立一個ExecutorRunner線程,ExecutorRunner會啟動ExecutorBackend進程。
  4. ExecutorBackend啟動後會向Driver的SchedulerBackend註冊。Driver的DAGScheduler解析作業並產生相應的Stage,每個Stage包含的Task通過TaskScheduler分配給Executor執行。
  5. 所有stage都完成後作業結束。

 

基於Yarn的Spark架構與作業執行流程

這裡Spark AppMaster相當於Standalone模式下的SchedulerBackend,Executor相當於standalone的ExecutorBackend,spark AppMaster中包括DAGScheduler和YarnClusterScheduler。

    Spark on Yarn的執行流程可以參考http://www.csdn.net/article/2013-12-04/2817706--YARN spark on Yarn部分。    

     這裡主要介紹一下Spark ApplicationMaster的主要工作。代碼參考Apache Spark 0.9.0版本ApplicationMaster.scala中的run()方法。

         步驟如下:

  1. 設定環境變數spark.local.dir和spark.ui.port。NodeManager啟動ApplicationMaster的時候會傳遞LOCAL_DIRS(YARN_LOCAL_DIRS)變數,這個變數會被設定為spark.local.dir的值。後續臨時檔案會存放在此目錄下。
  2. 擷取NodeManager傳遞給ApplicationMaster的appAttemptId。
  3. 建立AMRMClient,即ApplicationMaster與ResourceManager的通訊串連。
  4. 啟動使用者程式,startUserClass(),使用一個線程通過發射調用使用者程式的main方法。這時候,使用者程式中會初始化SparkContext,它包含DAGScheduler和TaskScheduler。
  5. 向ResourceManager註冊。
  6. 向ResourceManager申請containers,它根據輸入資料和請求的資源,調度Executor到相應的NodeManager上,這裡的調度演算法會考慮輸入資料的locality。

【轉】Spark架構與作業執行流程簡介

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.