最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Spark-Sql入門程序示例詳解

 更新時間:2021年12月03日 11:49:24   作者:山不在高水不在深  
Spark?SQL?作為?Spark?四大核心組件之一,主要用于處理結(jié)構(gòu)化數(shù)據(jù)或半結(jié)構(gòu)化數(shù)據(jù),它支持在Spark?中使用?SQL?對數(shù)據(jù)進行查詢,本文給大家介紹Spark-Sql入門程序,感興趣的朋友跟隨小編一起看看吧

SparkSQL運行架構(gòu)

Spark SQL對SQL語句的處理,首先會將SQL語句進行解析(Parse),然后形成一個Tree,在后續(xù)的如綁定、優(yōu)化等處理過程都是對Tree的操作,而操作的方法是采用Rule,通過模式匹配,對不同類型的節(jié)點采用不同的操作。

spark-sql是用來處理結(jié)構(gòu)化數(shù)據(jù)的模塊,是入門spark的首要模塊。

技術(shù)的學習無非就是去了解它的API,但是Spark有點難,因為它的例子和網(wǎng)上能搜到的基本都是Scala寫的。我們這里使用Java。

入門例子

數(shù)據(jù)處理的第一個例子通常都是word count,就是統(tǒng)計一個文件里每個單詞出現(xiàn)了幾次。我們也來試一下。

> 這個例子網(wǎng)上有很多,即使是通過spark實現(xiàn)的也不少;這里面大部分都是使用Scala寫的,我沒有試過;少部分是通過Java寫的;

Java里面的例子有一些是使用RDD實現(xiàn)的,只有極個別是通過DataSet來做的。但即使這一小撮例子,我也跑不通。

所以我自己來嘗試完成這個例子,看到別人用Scala寫三五行就完成了,而我嘗試了一整天幾無進展。在網(wǎng)上東拼西湊熟悉Spark的Java?

還是以我們前面的例子來改:

String logFile = "words";
SparkSession spark = SparkSession.builder().appName("Simple Application").master("local").getOrCreate();
Dataset<String> logData = spark.read().textFile(logFile).cache();

System.out.println("行數(shù):" + logData.count());這里我不再使用之前的README文件,自己創(chuàng)建了一個words文件,內(nèi)容隨意寫了一堆單詞。

執(zhí)行程序,可以正常打印出來:

接下來我們需要把句子分割成一個個單詞合在一起,然后統(tǒng)計每個單詞出現(xiàn)的次數(shù)。

> 可能有人會說,這個簡單,我用Java8的流一下就處理好了:

把行集合通過flatMap處理,每一行通過split(" ")分割成一個獨立的單詞集合,再把結(jié)果通過自身groupBy一下就拿到終止數(shù)據(jù)結(jié)構(gòu)Map了。

最后把map的key和value的大小拿到就好了。

的確,使用Java就是這樣實現(xiàn)。但是Spark提供了一套和Java的流API名字和效果類似的工具,區(qū)別是Spark的是分布式API

我們通過Spark的flatMap先來處理一下:

Dataset<String> words = logData.flatMap((FlatMapFunction<String, String>) k -> Arrays.asList(k.split("\\s")).iterator(), Encoders.STRING());
System.out.println("單詞數(shù):" + words.count());
words.foreach(k -> {
System.out.println("W:" + k);
});

不同于Java的流,spark這個flatMap的返回值是可以直接訪問結(jié)果的:

> 可能有人留意到spark中函數(shù)式方法的參數(shù)定義和Java差距較大。他們的參數(shù)不太一樣,還多了個編碼器。目前來講我還不清楚為啥這樣定義,不過印象中編碼器也是spark3的重要優(yōu)化內(nèi)容。

再Java中使用Scala的方法總是有些怪異,Lambda表達式前面總是需要強制類型轉(zhuǎn)換,只是為了指明參數(shù)類型,否則需要new一個匿名類。

這個也花了我不少時間,后來找到一個網(wǎng)頁org.apache.spark.sql.Dataset.flatMap java code examples | Tabnine

再往后我迷茫了:

KeyValueGroupedDataset<String, String> group = words.groupByKey((Function1<String, String>) k -> k, Encoders.STRING());

這樣我已經(jīng)group好了,但是返回的不是DataSet,我也不知道這個返回有啥用,怎么拿到里面的內(nèi)容呢?我費了好大勁沒搞定。

比如我發(fā)現(xiàn)count方法會返回一個DataSet:

看起來正是我想要的,但是當我想把它輸出竟然執(zhí)行報錯:

ount.foreach(t -> {
    System.out.println(t);
});

別說foreach了,就算想看看里面的數(shù)量(就像一開始我們查看了文件有幾行那樣)都會報錯,錯誤內(nèi)容一樣

count.count();

查了很多資料,大意是說spark的計算方法都是分布式的,各個任務之間需要通信,通信時需要序列化來傳遞信息。所以上面我們能看文件行數(shù)因為類型是String,有序列化標志;現(xiàn)在生成的是元組,不能序列化。我嘗試了各種方法,甚至自己創(chuàng)建新類模擬了計算過程還是不行

查了好久資料,比如Job aborted due to stage failure: Task not serializable: | Databricks Spark Knowledge Base (gitbooks.io)依然沒有解決。偶然的機會找到一個令人激動的網(wǎng)站Spark Groupby Example with DataFrame — SparkByExamples終于解決了我的問題。

使用DataFrame

DataFrame雖然是spark提供的重要工具,但是再Java上并沒有對應的類,只是把DataSet的泛型對象改成Row而已。注意這個Row沒有泛型定義,所以里面有哪些列不知道

可以從一開始就把DataSet轉(zhuǎn)成DataFrame:

但是可以看到要從Row里面拿數(shù)據(jù)比較麻煩。所以目前我只在需要序列化的地方轉(zhuǎn):

到此這篇關(guān)于Spark-Sql入門程序的文章就介紹到這了,更多相關(guān)Spark-Sql入門內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • spring boot如何指定啟動端口

    spring boot如何指定啟動端口

    這篇文章主要介紹了spring boot如何指定啟動端口,文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友可以參考下
    2019-12-12
  • 利用java獲取某個文件夾下的所有文件

    利用java獲取某個文件夾下的所有文件

    這篇文章主要給大家介紹了關(guān)于如何利用java獲取某個文件夾下的所有文件的相關(guān)資料,在從事web開發(fā)工作中,經(jīng)常需要對本地某一個目錄下的文件進行處理,需要的朋友可以參考下
    2023-07-07
  • 一篇文章帶你入門java代理模式

    一篇文章帶你入門java代理模式

    這篇文章主要介紹了Java代理模式,結(jié)合實例形式詳細分析了java基本數(shù)據(jù)類型、數(shù)據(jù)類型轉(zhuǎn)換、算術(shù)運算符、邏輯運算符等相關(guān)原理與操作技巧,需要的朋友可以參考下
    2021-08-08
  • Spring AOP源碼深入分析

    Spring AOP源碼深入分析

    這篇文章主要介紹了Spring AOP源碼,AOP(Aspect Orient Programming),直譯過來就是 面向切面編程,AOP 是一種編程思想,是面向?qū)ο缶幊蹋∣OP)的一種補充
    2023-01-01
  • Java依賴注入容器超詳細全面講解

    Java依賴注入容器超詳細全面講解

    依賴注入(Dependency Injection)和控制反轉(zhuǎn)(Inversion of Control)是同一個概念。具體含義是:當某個角色(可能是一個Java實例,調(diào)用者)需要另一個角色(另一個Java實例,被調(diào)用者)的協(xié)助時,在 傳統(tǒng)的程序設計過程中,通常由調(diào)用者來創(chuàng)建被調(diào)用者的實例
    2023-01-01
  • 基于JAVA代碼 獲取手機基本信息(本機號碼,SDK版本,系統(tǒng)版本,手機型號)

    基于JAVA代碼 獲取手機基本信息(本機號碼,SDK版本,系統(tǒng)版本,手機型號)

    本文給大家介紹基于java代碼獲取手機基本信息,包括獲取電話管理對象、獲取手機號碼、獲取手機型號、獲取SDK版本、獲取系統(tǒng)版本等相關(guān)信息,對本文感興趣的朋友一起學習吧
    2015-12-12
  • SpringBoot中Controller參數(shù)與返回值的用法總結(jié)

    SpringBoot中Controller參數(shù)與返回值的用法總結(jié)

    這篇文章主要介紹了SpringBoot中Controller參數(shù)與返回值的用法,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2023-07-07
  • 流讀取導致StringBuilder.toString()亂碼的問題及解決

    流讀取導致StringBuilder.toString()亂碼的問題及解決

    這篇文章主要介紹了流讀取導致StringBuilder.toString()亂碼的問題及解決方案,具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2022-11-11
  • SpringBoot靜態(tài)資源配置原理(源碼分析)

    SpringBoot靜態(tài)資源配置原理(源碼分析)

    這篇文章主要介紹了SpringBoot靜態(tài)資源配置原理(源碼分析),文中通過示例代碼介紹的非常詳細,對大家的學習或者工作具有一定的參考學習價值,需要的朋友們下面隨著小編來一起學習學習吧
    2021-01-01
  • java中switch case語句需要加入break的原因解析

    java中switch case語句需要加入break的原因解析

    這篇文章主要介紹了java中switch case語句需要加入break的原因解析的相關(guān)資料,需要的朋友可以參考下
    2017-07-07

最新評論

大邑县| 定西市| 孟连| 湄潭县| 固始县| 南华县| 莒南县| 偏关县| 青海省| 白水县| 芜湖县| 准格尔旗| 乌拉特后旗| 桐乡市| 太谷县| 大邑县| 博客| 老河口市| 南涧| 酉阳| 沂南县| 鸡东县| 博罗县| 开封县| 嵊州市| 五寨县| 洛川县| 丘北县| 金湖县| 义马市| 谢通门县| 札达县| 巴马| 宾阳县| 虎林市| 宁强县| 新干县| 福海县| 札达县| 凉城县| 镇沅|