最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

使用Apache Spark處理Excel文件的方法

 更新時(shí)間:2024年01月22日 11:39:27   作者:i查拉圖斯特拉如是  
Excel作為功能強(qiáng)大的數(shù)據(jù)處理軟件,廣泛應(yīng)用于各行各業(yè),從企業(yè)管理到數(shù)據(jù)分析,可謂無處不在,本文介紹使用Apache Spark處理Excel文件的簡易指南,感興趣的朋友一起看看吧

前言

在日常的工作中,表格內(nèi)的工具是非常方便的x,但是當(dāng)表格變得非常多的時(shí)候,就需要一些特定的處理。Excel作為功能強(qiáng)大的數(shù)據(jù)處理軟件,廣泛應(yīng)用于各行各業(yè),從企業(yè)管理到數(shù)據(jù)分析,可謂無處不在。然而,面對大型且復(fù)雜的數(shù)據(jù),Excel的處理能力可能力不從心。

對此,我們可借助Apache Spark這一分布式計(jì)算框架,憑借其強(qiáng)大的計(jì)算與數(shù)據(jù)處理能力,快速有效地處理Excel數(shù)據(jù)。這些數(shù)據(jù)進(jìn)行一個(gè)分析,整理,篩選,排序。分析整理有用的內(nèi)容。

操作

創(chuàng)建一個(gè)spark項(xiàng)目,在IntelliJ IDEA中創(chuàng)建Spark項(xiàng)目時(shí),默認(rèn)的目錄結(jié)構(gòu)如下:

project-root/
│
├── src/
│   ├── main/
│   │   ├── java/
│   │   │   └── (Java source files)
│   │   └── scala/
│   │       └── (Scala source files)
│   └── test/
│       ├── java/
│       │   └── (Test Java source files)
│       └── scala/
│           └── (Test Scala source files)
├── resources/
│   └── (Resource files)
└── target/
    └── (Compiled output and build artifacts)

導(dǎo)入包

在build.sbt中添加操作文件的包

libraryDependencies ++= Seq(
  "org.apache.spark" %% "spark-core" % sparkVersion,
  "org.apache.spark" %% "spark-sql" % sparkVersion,
  "org.apache.spark" %% "spark-mllib" % sparkVersion,
  "org.apache.spark" %% "spark-streaming" % sparkVersion,
  "com.norbitltd" %% "spoiwo_2.12" % "1.4.1",
  "com.crealytics" %% "spark-excel" % "0.13.7",
  "com.monitorjbl" %% "xlsx-streamer" % "2.1.0"
)

測試數(shù)據(jù)

name

age

Mic

1

Andy

3

Steven

1

首先

使用Spark讀取Excel文件十分簡便。只需在DataFrame API中指定文件路徑及格式,Spark即可自動(dòng)導(dǎo)入Excel文件并將其轉(zhuǎn)成DataFrame,進(jìn)而展開數(shù)據(jù)處理和分析。

代碼示例

Spark不但提供多樣的數(shù)據(jù)處理方式,更在DataFrame API中支持篩選、聚合和排序等操作。此外,內(nèi)置豐富的數(shù)據(jù)處理函數(shù)和操作符使處理Excel數(shù)據(jù)更為便捷。

package com.example.spark
import org.apache.spark.{SparkConf, SparkContext}
import org.apache.spark.sql.SparkSession
object SparkTest {
  def main(args: Array[String]): Unit = {
    //scala版本
    val sparkConf = new SparkConf()
    sparkConf.setMaster("local")   //本地單線程運(yùn)行
    sparkConf.setAppName("testJob")
//    val sc = new SparkContext(sparkConf)
    val spark = SparkSession.builder().config(sparkConf)
      .appName("Excel Demo")
      .getOrCreate()
    // 讀取 Excel 文件
    val df = spark.read
      .format("com.crealytics.spark.excel")
      .option("dataAddress", "'Sheet2'!A1:B2") // 可選,設(shè)置選擇數(shù)據(jù)區(qū)域 例如 A1:C2。
      .option("useHeader", "false") // 必須,是否使用表頭,false的話自己命名表頭(_c0),true則第一行為表頭
      .option("treatEmptyValuesAsNulls", "true") // 可選, 是否將空的單元格設(shè)置為null ,如果不設(shè)置為null 遇見空單元格會(huì)報(bào)錯(cuò) 默認(rèn)t: true
      .option("inferSchema", "true") // 可選, default: false
      //.option("addColorColumns", "true") // 可選, default: false
      //.option("timestampFormat", "yyyy-mm-dd hh:mm:ss") // 可選, default: yyyy-mm-dd hh:mm:ss[.fffffffff]
      //.option("excerptSize", 6) // 可選, default: 10. If set and if schema inferred, number of rows to infer schema from
      //.option("workbookPassword", "pass") // 可選, default None. Requires unlimited strength JCE for older JVMs====
      //.option("maxRowsInMemory", 20) // 可選, default None. If set, uses a streaming reader which can help with big files====
      .schema(schema) // 可選, default: Either inferred schema, or all columns are Strings
//      .option("header", "true")
      .load("path/to/excel/file.xlsx")
    // 顯示 DataFrame 的內(nèi)容
    df.show()
    // +-------+---+
    // |   name|age|
    // +-------+---+
    // |    Mic| 1|
    // |   Andy| 3|
    // | Steven| 1|
    // +-------+---+
    // 將 DataFrame 寫入 Excel 文件
    df.write
      .format("com.crealytics.spark.excel")
      .option("dataAddress", "'Sheet'!A1:B2")
      .option("useHeader", "true")
      //.option("dateFormat", "yy-mmm-d") // Optional, default: yy-m-d h:mm
      //.option("timestampFormat", "mm-dd-yyyy hh:mm:ss") // Optional, default: yyyy-mm-dd hh:mm:ss.000
      .mode("append") // Optional, default: overwrite.
      .option("header", "true")
      .save("path/to/save/excel/file.xlsx")
  }
}

數(shù)據(jù)處理結(jié)束后,可將結(jié)果保存在全新Excel文件或其他格式文件中。借助DataFrame API,無論保存在本地文件系統(tǒng)還是云端,均能輕松實(shí)現(xiàn)。保留數(shù)據(jù)亦可依照需求選擇不同輸出格式,如CSV,XLSX等。

總結(jié)一下

雖然僅處理基礎(chǔ)數(shù)據(jù),但在集群環(huán)境下,Spark展現(xiàn)出優(yōu)秀的大規(guī)模數(shù)據(jù)處理能力。無論海量Excel數(shù)據(jù)還是復(fù)雜的結(jié)構(gòu)化數(shù)據(jù),都在Spark協(xié)助下,能輕松應(yīng)對并滿足各種數(shù)據(jù)處理與分析任務(wù)。

借助Apache Spark處理Excel文件,充分發(fā)揮分布式計(jì)算潛能,可讓數(shù)據(jù)處理與分析過程更為高效出色,同時(shí)也極大提升數(shù)據(jù)處理效率和準(zhǔn)確性。希望本文能讓您對Spark處理Excel有更深入了解,在實(shí)踐中更好地應(yīng)用。

引用

https://github.com/crealytics/spark-excel

最后

到此這篇關(guān)于使用Apache Spark處理Excel文件的簡易指南的文章就介紹到這了,更多相關(guān)Apache Spark處理Excel文件內(nèi)容請搜索腳本之家以前的文章或繼續(xù)瀏覽下面的相關(guān)文章希望大家以后多多支持腳本之家!

相關(guān)文章

  • linux NFS 服務(wù)安全加固方法

    linux NFS 服務(wù)安全加固方法

    NFS(Network File System)是 FreeBSD 支持的一種文件系統(tǒng),它允許網(wǎng)絡(luò)中的計(jì)算機(jī)之間通過 TCP/IP 網(wǎng)絡(luò)共享資源。不正確的配置和使用 NFS,會(huì)帶來安全問題,需要的朋友可以參考下
    2018-02-02
  • Linux使用Fail2ban防護(hù)惡意攻擊的操作指南

    Linux使用Fail2ban防護(hù)惡意攻擊的操作指南

    在當(dāng)今互聯(lián)網(wǎng)環(huán)境中,服務(wù)器安全已成為每個(gè)系統(tǒng)管理員和開發(fā)者必須重視的核心課題,Fail2ban 是一款輕量級但功能強(qiáng)大的入侵防御工具,本文將深入探討如何在 Linux 系統(tǒng)中部署和配置 Fail2ban,結(jié)合 Java 應(yīng)用場景提供實(shí)用示例,需要的朋友可以參考下
    2026-04-04
  • jmeter在linux系統(tǒng)下運(yùn)行及本地內(nèi)存調(diào)優(yōu)的方法詳解

    jmeter在linux系統(tǒng)下運(yùn)行及本地內(nèi)存調(diào)優(yōu)的方法詳解

    這篇文章主要介紹了jmeter在linux系統(tǒng)下運(yùn)行及本地內(nèi)存調(diào)優(yōu)的方法,本文通過圖文并茂的形式給大家介紹的非常詳細(xì),對大家的學(xué)習(xí)或工作具有一定的參考借鑒價(jià)值,需要的朋友可以參考下
    2020-07-07
  • Apache Rewrite實(shí)現(xiàn)URL的301跳轉(zhuǎn)和域名跳轉(zhuǎn)

    Apache Rewrite實(shí)現(xiàn)URL的301跳轉(zhuǎn)和域名跳轉(zhuǎn)

    Rewirte主要的功能就是實(shí)現(xiàn)URL的跳轉(zhuǎn),它的正則表達(dá)式是基于Perl語言??苫诜?wù)器級的(httpd.conf)和目錄級的 (.htaccess)兩種方式
    2012-05-05
  • keeplive+mysql+drbd高可用架構(gòu)安裝步驟

    keeplive+mysql+drbd高可用架構(gòu)安裝步驟

    本地(master)與遠(yuǎn)程主機(jī)(backup)的保證實(shí)時(shí)同步,如果本地系統(tǒng)出現(xiàn)故障時(shí),遠(yuǎn)程主機(jī)上還會(huì)保留有一份相同的數(shù)據(jù),可以繼續(xù)使用.在高可用(HA)中使用DRBD功能,可以代替使用一個(gè)共享盤陣.因?yàn)閿?shù)據(jù)同時(shí)存在于本地主機(jī)和遠(yuǎn)程主機(jī)上,切換時(shí),遠(yuǎn)程主機(jī)只要使用它上面的那份備份數(shù)據(jù)
    2017-08-08
  • Linux云服務(wù)器開放端口詳解

    Linux云服務(wù)器開放端口詳解

    文章簡要介紹了在阿里云添加安全組規(guī)則的步驟:訪問官網(wǎng)控制臺,手動(dòng)添加規(guī)則,選擇TCP/UDP協(xié)議,填寫目標(biāo)端口及源IP范圍,添加備注后點(diǎn)擊保存即可開放端口,最后提醒讀者這是個(gè)人經(jīng)驗(yàn),歡迎參考與支持
    2025-08-08
  • Linux進(jìn)程狀態(tài)和優(yōu)先級的用法及說明

    Linux進(jìn)程狀態(tài)和優(yōu)先級的用法及說明

    文章詳細(xì)介紹了操作系統(tǒng)中進(jìn)程狀態(tài)(運(yùn)行、阻塞、掛起)的概念及Linux操作系統(tǒng)中的具體狀態(tài)(R、S、D、T、t、X、Z),解釋了進(jìn)程的運(yùn)行、阻塞、掛起狀態(tài)的區(qū)別,具體狀態(tài)標(biāo)識及操作方法,如使用kill命令或Ctrl+C中斷進(jìn)程等
    2026-04-04
  • CentOS 7 網(wǎng)絡(luò)配置詳解

    CentOS 7 網(wǎng)絡(luò)配置詳解

    本篇文章主要介紹了CentOS 7 網(wǎng)絡(luò)配置,現(xiàn)在分享給大家,也給大家做個(gè)參考。需要的朋友可以參考下。
    2016-11-11
  • LINUX啟動(dòng)/重啟/停上MYSQL的命令(詳解)

    LINUX啟動(dòng)/重啟/停上MYSQL的命令(詳解)

    下面小編就為大家?guī)硪黄狶INUX啟動(dòng)/重啟/停上MYSQL的命令(詳解)。小編覺得挺不錯(cuò)的,現(xiàn)在就分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2016-11-11
  • 安裝Ubuntu 20.04后要做的事(小白教程)

    安裝Ubuntu 20.04后要做的事(小白教程)

    這篇文章主要介紹了安裝Ubuntu 20.04后要做的事(小白教程),文中通過示例代碼介紹的非常詳細(xì),對大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2020-05-05

最新評論

阆中市| 平定县| 昌邑市| 聂拉木县| 花垣县| 神木县| 平乡县| 新泰市| 宜川县| 凤阳县| 炎陵县| 子洲县| 石首市| 永城市| 沂南县| 海淀区| 晋中市| 衡山县| 松桃| 定兴县| 江门市| 巨野县| 贵溪市| 乾安县| 阿瓦提县| 三江| 陕西省| 凤凰县| 岑巩县| 桂东县| 鸡西市| 女性| 宣汉县| 武平县| 顺义区| 闽清县| 台中县| 渑池县| 务川| 饶阳县| 合作市|