windows下 pycharm開發spark

來源:互聯網
上載者:User

標籤:

一 部署本地spark環境
1.1  安裝好JDK       下載並安裝好jdk1.7,配置完環境變數。
1.2 Spark環境變數配置      去http://spark.apache.org/downloads.html網站下載相應hadoop對應的版本,我下載的是spark-1.6.0-bin-hadoop2.6.tgz,spark版本是1.6,對應的hadoop版本是2.6

解壓下載的檔案,假設解壓 目錄為:D:\spark-1.6.0-bin-hadoop2.6。將D:\spark-1.6.0-bin-hadoop2.6\bin添加到系統Path變數,同時建立SPARK_HOME變數,變數值為:D:\spark-1.6.0-bin-hadoop2.6


1.3 hadoop相關包的安裝

      spark是基於hadoop之上的,運行過程中會調用相關hadoop庫,如果沒配置相關hadoop運行環境,會提示相關出錯資訊,雖然也不影響運行。

  去下載hadoop 2.6編譯好的包https://www.barik.net/archive/2015/01/19/172716/,我下載的是hadoop-2.6.0.tar.gz,解壓下載的檔案夾,將相關庫添加到系統Path變數中:D:\hadoop-2.6.0\bin;同時建立HADOOP_HOME變數,變數值為:D:\hadoop-2.6.0。同時去github上下載一個叫做 winutils  的組件,地址是 https://github.com/srccodes/hadoop-common-2.2.0-bin 如果沒有hadoop對應的版本(此時版本是 2.6),則去csdn上下載 http://download.csdn.net/detail/luoyepiaoxin/8860033,

我的做法是把CSDN這個壓縮包裡的所有檔案都複製到 hadoop_home的bin目錄下


二  python環境

   Spark提供了2個互動式shell, 一個是pyspark(基於python), 一個是spark_shell(基於scala). 這兩個環境其實是並列的, 並沒有相互依賴關係, 所以如果僅僅是使用pyspark互動環境, 而不使用spark-shell的話, 甚至連scala都不需要安裝.

 2.1 下載並安裝Anaconda 

   anaconda是一個整合了python解譯器和大多數python庫的系統,安裝anaconda 後可以不用再安裝python和pandas numpy等這些組件了。是 https://www.continuum.io/downloads。將python加到path環境變數中

三  啟動pyspark驗證

     在windows下命令列中啟動pyspark,:

    


 四 在pycharm中配置開發環境   

  4.1 配置Pycharm
 更詳細的材料 參考 https://stackoverflow.com/questions/34685905/how-to-link-pycharm-with-pyspark

 開啟PyCharm,建立一個Project。然後選擇“Run” ->“Edit Configurations”
 

 選擇 “Environment variables” 增加SPARK_HOME目錄與PYTHONPATH目錄。

  • SPARK_HOME:Spark安裝目錄

  • PYTHONPATH:Spark安裝目錄下的Python目錄



4.2 測試程式

先測試環境是否正確,代碼如下:

  

import osimport sys # Path for spark source folderos.environ[‘SPARK_HOME‘]="D:\javaPackages\spark-1.6.0-bin-hadoop2.6" # Append pyspark  to Python Pathsys.path.append("D:\javaPackages\spark-1.6.0-bin-hadoop2.6\python") try:    from pyspark import SparkContext    from pyspark import SparkConf     print ("Successfully imported Spark Modules") except ImportError as e:    print ("Can not import Spark Modules", e)    sys.exit(1)
  如果程式可以正常輸出: "Successfully imported Spark Modules"就說明環境已經可以正常執行。  如,黃色框內的是具體的spark環境和python環境: 

測試程式碼來源於 github :https://gist.github.com/bigaidream/40fe0f8267a80e7c9cf8


windows下 pycharm開發spark

聯繫我們

該頁面正文內容均來源於網絡整理,並不代表阿里雲官方的觀點,該頁面所提到的產品和服務也與阿里云無關,如果該頁面內容對您造成了困擾,歡迎寫郵件給我們,收到郵件我們將在5個工作日內處理。

如果您發現本社區中有涉嫌抄襲的內容,歡迎發送郵件至: info-contact@alibabacloud.com 進行舉報並提供相關證據,工作人員會在 5 個工作天內聯絡您,一經查實,本站將立刻刪除涉嫌侵權內容。

A Free Trial That Lets You Build Big!

Start building with 50+ products and up to 12 months usage for Elastic Compute Service

  • Sales Support

    1 on 1 presale consultation

  • After-Sales Support

    24/7 Technical Support 6 Free Tickets per Quarter Faster Response

  • Alibaba Cloud offers highly flexible support services tailored to meet your exact needs.