pycharm連接spark教程
1.解壓Hadoop
解壓到任意盤(pán),路徑不要帶中文路徑

進(jìn)入保存后的bin目錄,查看,是否解壓成功

2.解壓spark
到任意位置,路徑不要帶有中文


3. 打開(kāi)pycharm
把Hadoop,spark環(huán)境變量配置到pycharm中。
3.1新建項(xiàng)目


3.2在項(xiàng)目中創(chuàng)建一個(gè)python文件


3.3把Hadoop_home
python_home,pythonpath添加到Pycharm中.



- 1.HADOOP_HOME
- 2.SPARK_HOME
- 3.PYTHONPATH
注意?。。?/strong>
PYTHONPATH路徑要添加到D:\spark\spark-2.4.6-bin-hadoop2.7\python\lib\py4j-0.10.7-src.zip下



3.4 檢查是否有以下軟件包

3.4.1 如果沒(méi)有請(qǐng)按照以下教程下載,后期需要


3.4.2安裝py4j

3.4.3安裝pyspark推薦2.4.6版本

3.4.4安裝pip

3.5安裝findspark

4.把winutils.exe插件
放到Hadoop解壓后的/bin目錄下面

5.把以下代碼
復(fù)制到4.2步驟中,新建的python文件中
#添加此代碼
import findspark
findspark.init()
#在spark前,添加此代碼
from pyspark.sql import SparkSession
spark = SparkSession.builder.appName("WordCount").getOrCreate()
spark.sparkContext.textFile("file:///D:/Hadoop/hadoop-2.7.7/README.txt")\
.flatMap(lambda x: x.split(' '))\
.map(lambda x: (x, 1))\
.reduceByKey(lambda x, y: x + y)\
.foreach(print)
必須要有這句話在spark前面!??!

6.測(cè)試


出現(xiàn)以上內(nèi)容,表示pycharm連接spark成功。
總結(jié)
以上為個(gè)人經(jīng)驗(yàn),希望能給大家一個(gè)參考,也希望大家多多支持腳本之家。
- pycharm利用pyspark遠(yuǎn)程連接spark集群的實(shí)現(xiàn)
- Win10搭建Pyspark2.4.4+Pycharm開(kāi)發(fā)環(huán)境的圖文教程(親測(cè))
- windows下pycharm搭建spark環(huán)境并成功運(yùn)行 附源碼
- PyCharm搭建Spark開(kāi)發(fā)環(huán)境的實(shí)現(xiàn)步驟
- pycharm編寫(xiě)spark程序,導(dǎo)入pyspark包的3中實(shí)現(xiàn)方法
- PyCharm搭建Spark開(kāi)發(fā)環(huán)境實(shí)現(xiàn)第一個(gè)pyspark程序
- PyCharm+PySpark遠(yuǎn)程調(diào)試的環(huán)境配置的方法
相關(guān)文章
Windows下實(shí)現(xiàn)將Pascal VOC轉(zhuǎn)化為T(mén)FRecords
今天小編就為大家分享一篇Windows下實(shí)現(xiàn)將Pascal VOC轉(zhuǎn)化為T(mén)FRecords,具有很好的參考價(jià)值,希望對(duì)大家有所幫助。一起跟隨小編過(guò)來(lái)看看吧2020-02-02
Python將字符串轉(zhuǎn)換為小寫(xiě)字母的幾種常用方法
Django中ModelForm組件的簡(jiǎn)單配置與使用教程
Python generator生成器和yield表達(dá)式詳解
python+pyqt5實(shí)現(xiàn)KFC點(diǎn)餐收銀系統(tǒng)
利用Python將多張圖片合成視頻的實(shí)現(xiàn)

