深入了解SparkSQL中數(shù)據(jù)的加載與保存
1 讀取和保存文件
SparkSQL讀取和保存的文件一般為三種,JSON文件、CSV文件和列式存儲的文件,同時可以通過添加參數(shù),來識別不同的存儲和壓縮格式。
1.1 CSV文件
1)代碼實現(xiàn)
package com.atguigu.sparksql;
import com.atguigu.sparksql.Bean.User;
import org.apache.spark.SparkConf;
import org.apache.spark.api.java.function.MapFunction;
import org.apache.spark.sql.*;
public class Test06_CSV {
public static void main(String[] args) throws ClassNotFoundException {
//1. 創(chuàng)建配置對象
SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");
//2. 獲取sparkSession
SparkSession spark = SparkSession.builder().config(conf).getOrCreate();
//3. 編寫代碼
DataFrameReader reader = spark.read();
// 添加參數(shù) 讀取csv
Dataset<Row> userDS = reader
.option("header", "true")//默認為false 不讀取列名
.option("sep",",") // 默認為, 列的分割
// 不需要寫壓縮格式 自適應(yīng)
.csv("input/user.csv");
userDS.show();
// 轉(zhuǎn)換為user的ds
// 直接轉(zhuǎn)換類型會報錯 csv讀取的數(shù)據(jù)都是string
// Dataset<User> userDS1 = userDS.as(Encoders.bean(User.class));
userDS.printSchema();
Dataset<User> userDS1 = userDS.map(new MapFunction<Row, User>() {
@Override
public User call(Row value) throws Exception {
return new User(Long.valueOf(value.getString(0)), value.getString(1));
}
}, Encoders.bean(User.class));
userDS1.show();
// 寫出為csv文件
DataFrameWriter<User> writer = userDS1.write();
writer.option("header",";")
.option("header","true")
// .option("compression","gzip")// 壓縮格式
// 寫出模式
// append 追加
// Ignore 忽略本次寫出
// Overwrite 覆蓋寫
// ErrorIfExists 如果存在報錯
.mode(SaveMode.Append)
.csv("output");
//4. 關(guān)閉sparkSession
spark.close();
}
}1.2 JSON文件
package com.atguigu.sparksql;
import com.atguigu.sparksql.Bean.User;
import org.apache.spark.SparkConf;
import org.apache.spark.sql.*;
public class Test07_JSON {
public static void main(String[] args) {
//1. 創(chuàng)建配置對象
SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");
//2. 獲取sparkSession
SparkSession spark = SparkSession.builder().config(conf).getOrCreate();
//3. 編寫代碼
Dataset<Row> json = spark.read().json("input/user.json");
// json數(shù)據(jù)可以讀取數(shù)據(jù)的數(shù)據(jù)類型
Dataset<User> userDS = json.as(Encoders.bean(User.class));
userDS.show();
// 讀取別的類型的數(shù)據(jù)也能寫出為json
DataFrameWriter<User> writer = userDS.write();
writer.json("output1");
//4. 關(guān)閉sparkSession
spark.close();
}
}1.3 Parquet文件
列式存儲的數(shù)據(jù)自帶列分割。
package com.atguigu.sparksql;
import org.apache.spark.SparkConf;
import org.apache.spark.sql.Dataset;
import org.apache.spark.sql.Row;
import org.apache.spark.sql.SparkSession;
public class Test08_Parquet {
public static void main(String[] args) {
//1. 創(chuàng)建配置對象
SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");
//2. 獲取sparkSession
SparkSession spark = SparkSession.builder().config(conf).getOrCreate();
//3. 編寫代碼
Dataset<Row> json = spark.read().json("input/user.json");
// 寫出默認使用snappy壓縮
// json.write().parquet("output");
// 讀取parquet 自帶解析 能夠識別列名
Dataset<Row> parquet = spark.read().parquet("output");
parquet.printSchema();
//4. 關(guān)閉sparkSession
spark.close();
}
}2 與MySQL交互
1)導(dǎo)入依賴
<dependency>
<groupId>mysql</groupId>
<artifactId>mysql-connector-java</artifactId>
<version>5.1.27</version>
</dependency>2)從MySQL讀數(shù)據(jù)
package com.atguigu.sparksql;
import org.apache.spark.SparkConf;
import org.apache.spark.sql.Dataset;
import org.apache.spark.sql.Row;
import org.apache.spark.sql.SparkSession;
import java.util.Properties;
public class Test09_Table {
public static void main(String[] args) {
//1. 創(chuàng)建配置對象
SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");
//2. 獲取sparkSession
SparkSession spark = SparkSession.builder().config(conf).getOrCreate();
//3. 編寫代碼
Dataset<Row> json = spark.read().json("input/user.json");
// 添加參數(shù)
Properties properties = new Properties();
properties.setProperty("user","root");
properties.setProperty("password","000000");
// json.write()
// // 寫出模式針對于表格追加覆蓋
// .mode(SaveMode.Append)
// .jdbc("jdbc:mysql://hadoop102:3306","gmall.testInfo",properties);
Dataset<Row> jdbc = spark.read().jdbc("jdbc:mysql://hadoop102:3306", "gmall.testInfo", properties);
jdbc.show();
//4. 關(guān)閉sparkSession
spark.close();
}
}3 與Hive交互
SparkSQL可以采用內(nèi)嵌Hive(spark開箱即用的hive),也可以采用外部Hive。企業(yè)開發(fā)中,通常采用外部Hive。
3.1 Linux中的交互
1)添加MySQL連接驅(qū)動到spark-yarn的jars目錄
[atguigu@hadoop102 spark-yarn]$ cp /opt/software/mysql-connector-java-5.1.27-bin.jar /opt/module/spark-yarn/jars
2)添加hive-site.xml文件到spark-yarn的conf目錄
[atguigu@hadoop102 spark-yarn]$ cp /opt/module/hive/conf/hive-site.xml /opt/module/spark-yarn/conf
3)啟動spark-sql的客戶端即可
[atguigu@hadoop102 spark-yarn]$ bin/spark-sql --master yarn
spark-sql (default)> show tables;
3.2 IDEA中的交互
1)添加依賴
<dependencies>
<dependency>
<groupId>org.apache.spark</groupId>
<artifactId>spark-sql_2.12</artifactId>
<version>3.1</version>
</dependency>
<dependency>
<groupId>mysql</groupId>
<artifactId>mysql-connector-java</artifactId>
<version>5.1.27</version>
</dependency>
<dependency>
<groupId>org.apache.spark</groupId>
<artifactId>spark-hive_2.12</artifactId>
<version>3.1</version>
</dependency>
<dependency>
<groupId>org.projectlombok</groupId>
<artifactId>lombok</artifactId>
<version>1.18.22</version>
</dependency>
</dependencies>2)拷貝hive-site.xml到resources目錄(如果需要操作Hadoop,需要拷貝hdfs-site.xml、core-site.xml、yarn-site.xml)
3)代碼實現(xiàn)
package com.atguigu.sparksql;
import org.apache.spark.SparkConf;
import org.apache.spark.sql.SparkSession;
public class Test10_Hive {
public static void main(String[] args) {
System.setProperty("HADOOP_USER_NAME","atguigu");
//1. 創(chuàng)建配置對象
SparkConf conf = new SparkConf().setAppName("sparksql").setMaster("local[*]");
//2. 獲取sparkSession
SparkSession spark = SparkSession.builder()
.enableHiveSupport()// 添加hive支持
.config(conf).getOrCreate();
//3. 編寫代碼
spark.sql("show tables").show();
spark.sql("create table user_info(name String,age bigint)");
spark.sql("insert into table user_info values('zhangsan',10)");
spark.sql("select * from user_info").show();
//4. 關(guān)閉sparkSession
spark.close();
}
}到此這篇關(guān)于深入了解SparkSQL中數(shù)據(jù)的加載與保存的文章就介紹到這了,更多相關(guān)SparkSQL數(shù)據(jù)加載與保存內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!
相關(guān)文章
spring cloud gateway集成hystrix實戰(zhàn)篇
這篇文章主要介紹了spring cloud gateway集成hystrix實戰(zhàn),具有很好的參考價值,希望對大家有所幫助。如有錯誤或未考慮完全的地方,望不吝賜教2021-07-07
Java生成N個不重復(fù)的隨機數(shù)的三種方法總結(jié)
這篇文章主要為大家詳細介紹了三種Java生成N個不重復(fù)的隨機數(shù)的方法,文中的示例代碼講解詳細,具有一定的參考價值,有需要的可以了解下2023-10-10
SpringBoot復(fù)雜參數(shù)應(yīng)用詳細講解
我們在編寫接口時會傳入復(fù)雜參數(shù),如Map、Model等,這種類似的參數(shù)會有相應(yīng)的參數(shù)解析器進行解析,并且最后會將解析出的值放到request域中,下面我們一起來探析一下其中的原理2022-09-09

