最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

大數(shù)據(jù)之Spark基礎(chǔ)環(huán)境

 更新時間:2023年04月06日 11:41:37   作者:敲鍵盤的杰克  
本篇文章開始介紹Spark基礎(chǔ)知識,包括Spark誕生的背景,應(yīng)用環(huán)境以及入門案例等,感興趣的同學可以參考閱讀本文

前言

本篇文章開始介紹Spark基礎(chǔ)知識,包括Spark誕生的背景,應(yīng)用環(huán)境以及入門案例等,還是Spark學習之旅前,得先安裝Spark環(huán)境才行,具體安裝步驟可以看Spark環(huán)境搭建,讓我們接著往下聊。

一、Spark概述

(一)Spark是什么

Spark是Apache頂級的開源項目,主要用于處理大規(guī)模數(shù)據(jù)的分析引擎,該引擎的核心數(shù)據(jù)結(jié)構(gòu)是RDD彈性分布式數(shù)據(jù)集,這是一種分布式內(nèi)存抽象,程序員可以使用RDD在大規(guī)模集群中做內(nèi)存運算,并具有一定的容錯方式;

Spark保留了MapReduce的分布式并行計算的優(yōu)點,還改進了其較為明顯的缺陷,中間數(shù)據(jù)存儲在內(nèi)存中,大大提高了運行速度,同時還提供了豐富的API,提高了開發(fā)速度。

(二)Spark的四大特點

Spark底層使用Scala語言,是一種面向?qū)ο?、函?shù)式編程語言,能夠像操作本地集合一樣輕松的操作分布式數(shù)據(jù)集,Spark具有運行速度快、易用性好、通用性強和隨處運行等特點;

(1)速度快,Spark支持內(nèi)存計算,并且通過DAG有向無環(huán)圖執(zhí)行引擎支持無環(huán)數(shù)據(jù)流,相對MapReduce來說,Spark處理數(shù)據(jù)時,可以將中間處理結(jié)果數(shù)據(jù)存儲到內(nèi)存中,Spark每個任務(wù)以線程方式執(zhí)行,并不是像MapReduce以進程方式執(zhí)行,線程的啟動和銷毀相對于進程來說比較快;
(2)易于使用,Spark 支持Java、Scala、Python 、R和SQL語言等多種語言;
(3)通用型強,Spark 還提供包括Spark SQL、Spark Streaming、MLib 及GraphX在內(nèi)的多個工具庫,可以在同一個應(yīng)用中無縫地使用這些工具庫;
(4)運行方式多,Spark 支持多種運行方式,包括在 Hadoop 和 Mesos 上,也支持 Standalone的獨立運行模式,同時也可以運行在云Kubernetes上,獲取數(shù)據(jù)的方式也很多,支持從HDFS、HBase、Cassandra 及 Kafka 等多種途徑獲取數(shù)據(jù)。

(三)Spark的風雨十年

Spark的發(fā)展主要經(jīng)歷過幾大階段:

(1)2009年Spark起源于加州伯克利分校;
(2)2013年被捐贈給Apache;
(3)2014年稱為Apache頂級項目;
(4)2016年Spark2.0發(fā)布
(5)2019年Spark3.0發(fā)布

(四)Spark框架模塊

整個Spark 框架模塊包含:Spark Core、 Spark SQL、 Spark Streaming、 Spark GraphX和 Spark MLlib,大部分模塊的能力都在建立在其核心引擎之上;

(1)Spark Core,該模塊的數(shù)據(jù)結(jié)構(gòu)是RDD,實現(xiàn)了Spark的基本功能,包括RDD、任務(wù)調(diào)度、內(nèi)存管理、錯誤恢復以及與存儲系統(tǒng)交互等;
(2)Spark SQL,該模塊的數(shù)據(jù)結(jié)構(gòu)主要是DataFrame,是Spark用來操作結(jié)構(gòu)化數(shù)據(jù)的程序包,通過該模塊,可以直接使用SQL操作數(shù)據(jù);
(3)Spark Streaming,其主要的數(shù)據(jù)結(jié)構(gòu)是DStream離散化流,是Spark對實時數(shù)據(jù)進行流式計算的組件;
(4)Spark GraphX,該模塊的數(shù)據(jù)結(jié)構(gòu)為RDD或者DataFrame,是Spark中用于圖計算的組件,性能良好,擁有豐富的功能和運算符,能在海量數(shù)據(jù)上自如地運行復雜的圖算法;
(5)Spark MLlib,該模塊的數(shù)據(jù)結(jié)構(gòu)也是RDD或者DataFrame,主要用于機器學習,提供了常見的機器學習功能的程序庫,包括分類、回歸、聚類等,同時也支持模型評估和數(shù)據(jù)導入等功能。

(五)Spark通信框架

整個Spark 框架通信模塊為Netty,Spark 1.6版本引入了Netty,在Spark 2.0之后,完全使用Netty,并移除了akka。

總結(jié)

Spark保留了MapReduce的分布式計算,基于內(nèi)存計算,提高的數(shù)據(jù)的計算能力;
其主要模塊有Spark Core、 Spark SQL、 Spark Streaming、 Spark GraphX和 Spark MLlib,不僅可以通過SQL的方式操作數(shù)據(jù),還可以對實時數(shù)據(jù)進行流式計算,同時也支持機器學習;
Spark的特點主要是計算速度快,支持多種編程語言,并且提供了眾多友好的API,使得Spark的學習成本大大降低了。

以上就是大數(shù)據(jù)之Spark基礎(chǔ)環(huán)境的詳細內(nèi)容,更多關(guān)于Spark基礎(chǔ)環(huán)境的資料請關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • 數(shù)據(jù)庫的三級模式和兩級映射介紹

    數(shù)據(jù)庫的三級模式和兩級映射介紹

    在這里大家一定要注意三級模式中的概念模式對應(yīng)的是數(shù)據(jù)庫設(shè)計的邏輯模型,而不是概念模型(E-R模型),一定不要弄混了
    2012-10-10
  • ssdb簡單介紹

    ssdb簡單介紹

    SSDB是一套基于LevelDB存儲引擎的非關(guān)系型數(shù)據(jù)庫(NOSQL),可用于取代Redis,更適合海量數(shù)據(jù)的存儲,這篇文章主要介紹了ssdb簡單介紹,需要的朋友可以參考下
    2023-08-08
  • 數(shù)據(jù)庫sql查詢性能優(yōu)化詳解

    數(shù)據(jù)庫sql查詢性能優(yōu)化詳解

    這篇文章主要介紹了數(shù)據(jù)庫sql查詢性能優(yōu)化詳解,查詢優(yōu)化的本質(zhì)是讓數(shù)據(jù)庫優(yōu)化器為SQL語句選擇最佳的執(zhí)行計劃,對于大型的應(yīng)用系統(tǒng),大量的數(shù)據(jù)當然需要效率最快的執(zhí)行語句,需要的朋友可以參考下
    2023-07-07
  • Navicat?premium?for?mac?12的安裝破解圖文教程

    Navicat?premium?for?mac?12的安裝破解圖文教程

    Navicat Premium是一款數(shù)據(jù)庫管理工具,將此工具連接數(shù)據(jù)庫,你可以從中看到各種數(shù)據(jù)庫的詳細信息,這篇文章主要介紹了Mac下Navicat?premium?for?mac?12的安裝破解過程,需要的朋友可以參考下
    2024-01-01
  • DBeaver執(zhí)行外部sql文件詳細圖文教程

    DBeaver執(zhí)行外部sql文件詳細圖文教程

    DBeaver最近才使用,以前使用的PL/SQL,有些不是很熟悉,記錄下來,下面這篇文章主要給大家介紹了關(guān)于DBeaver執(zhí)行外部sql文件的相關(guān)資料,文中通過圖文介紹的非常詳細,需要的朋友可以參考下
    2023-06-06
  • Hive?HQL支持2種查詢語句風格

    Hive?HQL支持2種查詢語句風格

    這篇文章主要為大家介紹了Hive?HQL支持2種查詢語句風格示例語法,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進步,早日升職加薪
    2022-06-06
  • SQL中Having與Where的區(qū)別

    SQL中Having與Where的區(qū)別

    何時使用having where,請遵照下面的說明:WHERE語句在GROUP BY語句之前;SQL會在分組之前計算WHERE語句。HAVING語句在GROUP BY語句之后;SQL會在分組之后計算HAVING語句。
    2016-01-01
  • SQL 優(yōu)化經(jīng)驗總結(jié)34條

    SQL 優(yōu)化經(jīng)驗總結(jié)34條

    我們要做到不但會寫SQL,還要做到寫出性能優(yōu)良的SQL,以下為筆者學習、摘錄、并匯總部分資料與大家分享!
    2009-07-07
  • 通過DBeaver連接Phoenix操作hbase的方法

    通過DBeaver連接Phoenix操作hbase的方法

    DBeaver?可通過?JDBC?連接到數(shù)據(jù)庫,可以支持幾乎所有的數(shù)據(jù)庫產(chǎn)品,本文介紹常用一種通用數(shù)據(jù)庫工具Dbeaver,通過DBeaver連接Phoenix操作hbase的操作,需要的朋友跟隨小編一起看看吧
    2021-11-11
  • SQLite快速入門指南

    SQLite快速入門指南

    這篇文章主要介紹了SQLite快速入門指南,作為開源的嵌入式數(shù)據(jù)庫,SQLite可以在不需要過多投入數(shù)據(jù)庫開發(fā)時提供十分輕便的服務(wù),需要的朋友可以參考下
    2015-07-07

最新評論

泗水县| 靖边县| 曲水县| 姚安县| 涿鹿县| 崇明县| 太保市| 平泉县| 博乐市| 舒城县| 太仆寺旗| 岳阳县| 巫溪县| 南乐县| 绩溪县| 宣威市| 北流市| 从江县| 建始县| 仁化县| 兴国县| 响水县| 泸水县| 信丰县| 麻阳| 二连浩特市| 乌审旗| 建昌县| 景谷| 辉县市| 郯城县| 西青区| 尼玛县| 隆尧县| 沁源县| 定日县| 浮梁县| 东光县| 湘阴县| 江达县| 鄂托克前旗|