最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

深入了解SparkSQL中數(shù)據(jù)的加載與保存

 更新時間:2023年11月15日 08:37:20   作者:shangjg3  
這篇文章主要為大家詳細介紹了SparkSQL中數(shù)據(jù)的加載與保存的相關(guān)知識,文中的示例代碼講解詳細,具有一定的學(xué)習價值,感興趣的小伙伴可以了解下

1 讀取和保存文件

SparkSQL讀取和保存的文件一般為三種,JSON文件、CSV文件和列式存儲的文件,同時可以通過添加參數(shù),來識別不同的存儲和壓縮格式。

1.1 CSV文件

1)代碼實現(xiàn)

package com.atguigu.sparksql;
import com.atguigu.sparksql.Bean.User;
import org.apache.spark.SparkConf;
import org.apache.spark.api.java.function.MapFunction;
import org.apache.spark.sql.*;
public class Test06_CSV {
    public static void main(String[] args) throws ClassNotFoundException {
        //1. 創(chuàng)建配置對象
        SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");
        //2. 獲取sparkSession
        SparkSession spark = SparkSession.builder().config(conf).getOrCreate();
        //3. 編寫代碼
        DataFrameReader reader = spark.read();
        // 添加參數(shù)  讀取csv
        Dataset<Row> userDS = reader
                .option("header", "true")//默認為false 不讀取列名
                .option("sep",",") // 默認為, 列的分割
                // 不需要寫壓縮格式  自適應(yīng)
                .csv("input/user.csv");
        userDS.show();
        // 轉(zhuǎn)換為user的ds
        // 直接轉(zhuǎn)換類型會報錯  csv讀取的數(shù)據(jù)都是string
//        Dataset<User> userDS1 = userDS.as(Encoders.bean(User.class));
        userDS.printSchema();
        Dataset<User> userDS1 = userDS.map(new MapFunction<Row, User>() {
            @Override
            public User call(Row value) throws Exception {
                return new User(Long.valueOf(value.getString(0)), value.getString(1));
            }
        }, Encoders.bean(User.class));
        userDS1.show();
        // 寫出為csv文件
        DataFrameWriter<User> writer = userDS1.write();
        writer.option("header",";")
                .option("header","true")
//                .option("compression","gzip")// 壓縮格式
                // 寫出模式
                // append 追加
                // Ignore 忽略本次寫出
                // Overwrite 覆蓋寫
                // ErrorIfExists 如果存在報錯
                .mode(SaveMode.Append)
                .csv("output");
        //4. 關(guān)閉sparkSession
        spark.close();
    }
}

1.2 JSON文件

package com.atguigu.sparksql;

import com.atguigu.sparksql.Bean.User;
import org.apache.spark.SparkConf;
import org.apache.spark.sql.*;
public class Test07_JSON {

    public static void main(String[] args) {

        //1. 創(chuàng)建配置對象
        SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");

        //2. 獲取sparkSession
        SparkSession spark = SparkSession.builder().config(conf).getOrCreate();

        //3. 編寫代碼
        Dataset<Row> json = spark.read().json("input/user.json");

        // json數(shù)據(jù)可以讀取數(shù)據(jù)的數(shù)據(jù)類型
        Dataset<User> userDS = json.as(Encoders.bean(User.class));
        userDS.show();

        // 讀取別的類型的數(shù)據(jù)也能寫出為json
        DataFrameWriter<User> writer = userDS.write();
        writer.json("output1");

        //4. 關(guān)閉sparkSession
        spark.close();

    }

}

1.3 Parquet文件

列式存儲的數(shù)據(jù)自帶列分割。

package com.atguigu.sparksql;

import org.apache.spark.SparkConf;
import org.apache.spark.sql.Dataset;
import org.apache.spark.sql.Row;
import org.apache.spark.sql.SparkSession;
public class Test08_Parquet {

    public static void main(String[] args) {
        //1. 創(chuàng)建配置對象
        SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");

        //2. 獲取sparkSession
        SparkSession spark = SparkSession.builder().config(conf).getOrCreate();

        //3. 編寫代碼
        Dataset<Row> json = spark.read().json("input/user.json");
        // 寫出默認使用snappy壓縮

//        json.write().parquet("output");

        // 讀取parquet 自帶解析  能夠識別列名
        Dataset<Row> parquet = spark.read().parquet("output");
        parquet.printSchema();

        //4. 關(guān)閉sparkSession
        spark.close();
    }
}

2 與MySQL交互

1)導(dǎo)入依賴

<dependency>
    <groupId>mysql</groupId>
    <artifactId>mysql-connector-java</artifactId>
    <version>5.1.27</version>
</dependency>

2)從MySQL讀數(shù)據(jù)

package com.atguigu.sparksql;

import org.apache.spark.SparkConf;
import org.apache.spark.sql.Dataset;
import org.apache.spark.sql.Row;
import org.apache.spark.sql.SparkSession;
import java.util.Properties;
public class Test09_Table {

    public static void main(String[] args) {

        //1. 創(chuàng)建配置對象
        SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");

        //2. 獲取sparkSession
        SparkSession spark = SparkSession.builder().config(conf).getOrCreate();

        //3. 編寫代碼
        Dataset<Row> json = spark.read().json("input/user.json");

        // 添加參數(shù)

        Properties properties = new Properties();
        properties.setProperty("user","root");
        properties.setProperty("password","000000");

//        json.write()

//                // 寫出模式針對于表格追加覆蓋

//                .mode(SaveMode.Append)

//                .jdbc("jdbc:mysql://hadoop102:3306","gmall.testInfo",properties);

        Dataset<Row> jdbc = spark.read().jdbc("jdbc:mysql://hadoop102:3306", "gmall.testInfo", properties);
        jdbc.show();

        //4. 關(guān)閉sparkSession
        spark.close();
    }
}

3 與Hive交互

SparkSQL可以采用內(nèi)嵌Hive(spark開箱即用的hive),也可以采用外部Hive。企業(yè)開發(fā)中,通常采用外部Hive。

3.1 Linux中的交互

1)添加MySQL連接驅(qū)動到spark-yarn的jars目錄

[atguigu@hadoop102 spark-yarn]$ cp /opt/software/mysql-connector-java-5.1.27-bin.jar /opt/module/spark-yarn/jars

2)添加hive-site.xml文件到spark-yarn的conf目錄

[atguigu@hadoop102 spark-yarn]$ cp /opt/module/hive/conf/hive-site.xml /opt/module/spark-yarn/conf

3)啟動spark-sql的客戶端即可

[atguigu@hadoop102 spark-yarn]$  bin/spark-sql --master yarn
spark-sql (default)> show tables;

3.2 IDEA中的交互

1)添加依賴

<dependencies>
    <dependency>
       <groupId>org.apache.spark</groupId>
       <artifactId>spark-sql_2.12</artifactId>
       <version>3.1</version>
    </dependency>
    <dependency>
       <groupId>mysql</groupId>
       <artifactId>mysql-connector-java</artifactId>
       <version>5.1.27</version>
    </dependency>
    <dependency>
       <groupId>org.apache.spark</groupId>
       <artifactId>spark-hive_2.12</artifactId>
       <version>3.1</version>
    </dependency>
    <dependency>
       <groupId>org.projectlombok</groupId>
       <artifactId>lombok</artifactId>
       <version>1.18.22</version>
    </dependency>
</dependencies>

2)拷貝hive-site.xml到resources目錄(如果需要操作Hadoop,需要拷貝hdfs-site.xml、core-site.xml、yarn-site.xml)

3)代碼實現(xiàn)

package com.atguigu.sparksql;

import org.apache.spark.SparkConf;
import org.apache.spark.sql.SparkSession;
public class Test10_Hive {

    public static void main(String[] args) {
        System.setProperty("HADOOP_USER_NAME","atguigu");

        //1. 創(chuàng)建配置對象
        SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");

        //2. 獲取sparkSession
        SparkSession spark = SparkSession.builder()
                .enableHiveSupport()// 添加hive支持
                .config(conf).getOrCreate();

        //3. 編寫代碼

        spark.sql("show tables").show();
        spark.sql("create table user_info(name String,age bigint)");
        spark.sql("insert into table user_info values('zhangsan',10)");
        spark.sql("select * from user_info").show();

        //4. 關(guān)閉sparkSession
        spark.close();

    }

}

到此這篇關(guān)于深入了解SparkSQL中數(shù)據(jù)的加載與保存的文章就介紹到這了,更多相關(guān)SparkSQL數(shù)據(jù)加載與保存內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • java中optional的一些常用方法總結(jié)

    java中optional的一些常用方法總結(jié)

    Java8引入了一個非常強大的特性就是Optional類,其主要解決的問題就是我們編程時常常遇到的空指針異常,下面這篇文章主要給大家介紹了關(guān)于java中optional的一些常用方法,需要的朋友可以參考下
    2023-04-04
  • spring cloud gateway集成hystrix實戰(zhàn)篇

    spring cloud gateway集成hystrix實戰(zhàn)篇

    這篇文章主要介紹了spring cloud gateway集成hystrix實戰(zhàn),具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教
    2021-07-07
  • Java生成N個不重復(fù)的隨機數(shù)的三種方法總結(jié)

    Java生成N個不重復(fù)的隨機數(shù)的三種方法總結(jié)

    這篇文章主要為大家詳細介紹了三種Java生成N個不重復(fù)的隨機數(shù)的方法,文中的示例代碼講解詳細,具有一定的參考價值,有需要的可以了解下
    2023-10-10
  • 教你怎么通過IDEA設(shè)置堆內(nèi)存空間

    教你怎么通過IDEA設(shè)置堆內(nèi)存空間

    這篇文章主要介紹了教你怎么通過IDEA設(shè)置堆內(nèi)存空間,文中有非常詳細的代碼示例,對正在使用IDEA的小伙伴們很有幫助喲,需要的朋友可以參考下
    2021-05-05
  • java中Integer包裝類裝箱的一個細節(jié)詳解

    java中Integer包裝類裝箱的一個細節(jié)詳解

    Java中的Integer是int的包裝類型,下面這篇文章主要給大家介紹了關(guān)于java中Integer包裝類裝箱的一個細節(jié)的相關(guān)資料,文中介紹的這個細節(jié)挺重要的,對大家的學(xué)習或者工作具有一定的參考學(xué)習價值,需要的朋友們下面隨著小編來一起看看吧
    2018-07-07
  • 10個Elasticsearch查詢的實用技巧分享

    10個Elasticsearch查詢的實用技巧分享

    Elasticsearch是一個非常流行的搜索引擎,已經(jīng)成為了許多企業(yè)的首選解決方案。本文將向大家介紹10個實用的Elasticsearch查詢技巧,并配上對應(yīng)的代碼示例,希望對大家有所幫助
    2023-04-04
  • Java基本知識點之變量和數(shù)據(jù)類型

    Java基本知識點之變量和數(shù)據(jù)類型

    這篇文章主要給大家介紹了關(guān)于Java基本知識點之變量和數(shù)據(jù)類型的相關(guān)資料,文中通過示例代碼介紹的非常詳細,對大家的學(xué)習或者工作具有一定的參考學(xué)習價值,需要的朋友們下面隨著小編來一起學(xué)習學(xué)習吧
    2021-04-04
  • Java之標準序列化機制詳解

    Java之標準序列化機制詳解

    本文介紹了Java中的序列化機制,包括Serializable接口的實現(xiàn)、ObjectOutputStream和ObjectInputStream的用法、transient關(guān)鍵字和writeObject/readObject方法的的自定義序列化
    2026-05-05
  • 詳解Java類動態(tài)加載和熱替換

    詳解Java類動態(tài)加載和熱替換

    本文主要介紹類加載器、自定義類加載器及類的加載和卸載等內(nèi)容,并舉例介紹了Java類的熱替換。
    2021-05-05
  • SpringBoot復(fù)雜參數(shù)應(yīng)用詳細講解

    SpringBoot復(fù)雜參數(shù)應(yīng)用詳細講解

    我們在編寫接口時會傳入復(fù)雜參數(shù),如Map、Model等,這種類似的參數(shù)會有相應(yīng)的參數(shù)解析器進行解析,并且最后會將解析出的值放到request域中,下面我們一起來探析一下其中的原理
    2022-09-09

最新評論

鲜城| 旬邑县| 雅江县| 册亨县| 崇信县| 阜阳市| 剑河县| 平泉县| 会泽县| 二连浩特市| 若羌县| 健康| 轮台县| 阿克陶县| 防城港市| 体育| 南华县| 扎囊县| 三门峡市| 洛扎县| 呈贡县| 大兴区| 贞丰县| 宝应县| 鄂托克前旗| 万山特区| 鹤山市| 宁武县| 万州区| 新乡市| 翁牛特旗| 新郑市| 晋州市| 云梦县| 延安市| 牙克石市| 台前县| 云龙县| 南澳县| 辽中县| 高淳县|