最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Pyspark讀取parquet數(shù)據(jù)過程解析

 更新時間:2020年03月27日 11:31:22   作者:落日峽谷  
這篇文章主要介紹了pyspark讀取parquet數(shù)據(jù)過程解析,文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價值,需要的朋友可以參考下

parquet數(shù)據(jù):列式存儲結(jié)構(gòu),由Twitter和Cloudera合作開發(fā),相比于行式存儲,其特點是:

可以跳過不符合條件的數(shù)據(jù),只讀取需要的數(shù)據(jù),降低IO數(shù)據(jù)量;壓縮編碼可以降低磁盤存儲空間,使用更高效的壓縮編碼節(jié)約存儲空間;只讀取需要的列,支持向量運算,能夠獲取更好的掃描性能。

那么我們怎么在pyspark中讀取和使用parquet數(shù)據(jù)呢?我以local模式,linux下的pycharm執(zhí)行作說明。

首先,導(dǎo)入庫文件和配置環(huán)境:

import os
from pyspark import SparkContext, SparkConf
from pyspark.sql.session import SparkSession

os.environ["PYSPARK_PYTHON"]="/usr/bin/python3" #多個python版本時需要指定

conf = SparkConf().setAppName('test_parquet')
sc = SparkContext('local', 'test', conf=conf)
spark = SparkSession(sc)

然后,使用spark進(jìn)行讀取,得到DataFrame格式的數(shù)據(jù):host:port 屬于主機和端口號

parquetFile = r"hdfs://host:port/Felix_test/test_data.parquet"
df = spark.read.parquet(parquetFile)

而,DataFrame格式數(shù)據(jù)有一些方法可以使用,例如:

1.df.first() :顯示第一條數(shù)據(jù),Row格式

print(df.first())

2.df.columns:列名

3.df.count():數(shù)據(jù)量,數(shù)據(jù)條數(shù)

4.df.toPandas():從spark的DataFrame格式數(shù)據(jù)轉(zhuǎn)到Pandas數(shù)據(jù)結(jié)構(gòu)

5.df.show():直接顯示表數(shù)據(jù);其中df.show(n) 表示只顯示前n行信息

6.type(df):顯數(shù)據(jù)示格式

以上就是本文的全部內(nèi)容,希望對大家的學(xué)習(xí)有所幫助,也希望大家多多支持腳本之家。

相關(guān)文章

最新評論

宁城县| 进贤县| 佛坪县| 泰州市| 沧州市| 滨海县| 于田县| 舟曲县| 丰县| 博乐市| 信丰县| 攀枝花市| 罗江县| 潼关县| 肇东市| 巴彦县| 台南县| 齐齐哈尔市| 丹东市| 麻城市| 五常市| 信阳市| 措美县| 成都市| 北海市| 定兴县| 沧源| 南昌市| 临城县| 江门市| 通化县| 阜新| 通辽市| 广宁县| 延安市| 龙江县| 承德县| 安塞县| 蒙城县| 建德市| 义马市|