最新国产好看的视频,伊人天堂AV在线,国产Aaaaaa视频,蜜臀视频在线观看一区,人妻av色图,密臀久久久精品影片,青青视频免费观看毛片,久草在线观看视,国产三级精品色情在线

Hadoop?MapReduce實(shí)現(xiàn)單詞計(jì)數(shù)(Word?Count)

 更新時(shí)間:2023年05月22日 11:42:02   作者:orion-orion  
這篇文章主要為大家詳細(xì)介紹了如何利用Hadoop實(shí)現(xiàn)單詞計(jì)數(shù)(Word?Count)的MapReduce,文中的示例代碼講解詳細(xì),感興趣的可以跟隨小編一起學(xué)習(xí)一下

1.Map與Reduce過程

1.1 Map過程

首先,Hadoop會(huì)把輸入數(shù)據(jù)劃分成等長(zhǎng)的輸入分片(input split) 或分片發(fā)送到MapReduce。Hadoop為每個(gè)分片創(chuàng)建一個(gè)map任務(wù),由它來運(yùn)行用戶自定義的map函數(shù)以分析每個(gè)分片中的記錄。在我們的單詞計(jì)數(shù)例子中,輸入是多個(gè)文件,一般一個(gè)文件對(duì)應(yīng)一個(gè)分片,如果文件太大則會(huì)劃分為多個(gè)分片。map函數(shù)的輸入以<key, value>形式做為輸入,value為文件的每一行,key為該行在文件中的偏移量(一般我們會(huì)忽視)。這里map函數(shù)起到的作用為將每一行進(jìn)行分詞為多個(gè)word,并在context中寫入<word, 1>以代表該單詞出現(xiàn)一次。

map過程的示意圖如下:

mapper代碼編寫如下:

public static class TokenizerMapper
        extends Mapper<Object, Text, Text, IntWritable> {
    private final static IntWritable one = new IntWritable(1);
    private Text word = new Text();
    public void map(Object key, Text value, Context context) throws IOException, InterruptedException {
        //每次處理一行,一個(gè)mapper里的value為一行,key為該行在文件中的偏移量
        StringTokenizer iter = new StringTokenizer(value.toString());
        while (iter.hasMoreTokens()) {
            word.set(iter.nextToken());
            // 向context中寫入<word, 1>
            context.write(word, one);
            System.out.println(word);
        }
    }
}

如果我們能夠并行處理分片(不一定是完全并行),且分片是小塊的數(shù)據(jù),那么處理過程將會(huì)有一個(gè)好的負(fù)載平衡。但是如果分片太小,那么管理分片與map任務(wù)創(chuàng)建將會(huì)耗費(fèi)太多時(shí)間。對(duì)于大多數(shù)作業(yè),理想分片大小為一個(gè)HDFS塊的大小,默認(rèn)是64MB。

map任務(wù)的執(zhí)行節(jié)點(diǎn)和輸入數(shù)據(jù)的存儲(chǔ)節(jié)點(diǎn)相同時(shí),Hadoop的性能能達(dá)到最佳,這就是計(jì)算機(jī)系統(tǒng)中所謂的data locality optimization(數(shù)據(jù)局部性優(yōu)化)。而最佳分片大小與塊大小相同的原因就在于,它能夠保證一個(gè)分片存儲(chǔ)在單個(gè)節(jié)點(diǎn)上,再大就不能了。

1.2 Reduce過程

接下來我們看reducer的編寫。reduce任務(wù)的多少并不是由輸入大小來決定,而是需要人工單獨(dú)指定的(默認(rèn)為1個(gè))。和上面map不同的是,reduce任務(wù)不再具有本地讀取的優(yōu)勢(shì)————一個(gè)reduce任務(wù)的輸入往往來自于所有mapper的輸出,因此map和reduce之間的數(shù)據(jù)流被稱為 shuffle(洗牌) 。Hadoop會(huì)先按照key-value對(duì)進(jìn)行排序,然后將排序好的map的輸出通過網(wǎng)絡(luò)傳輸?shù)絩educe任務(wù)運(yùn)行的節(jié)點(diǎn),并在那里進(jìn)行合并,然后傳遞到用戶定義的reduce函數(shù)中。

reduce 函數(shù)示意圖如下:

reducer代碼編寫如下:

 public static class IntSumReducer
            extends Reducer<Text, IntWritable, Text, IntWritable>{
        private IntWritable result = new IntWritable();
        public void reduce(Text key, Iterable<IntWritable> values, Context context) throws IOException, InterruptedException{
            int sum = 0;
            for (IntWritable val : values) {
                sum += val.get();
            }
            result.set(sum);
            context.write(key, result);
        }
    }

2.完整代碼

2.1 項(xiàng)目架構(gòu)

關(guān)于VSCode+Java+Maven+Hadoop開發(fā)環(huán)境搭建,可以參見我的博客《VSCode+Maven+Hadoop開發(fā)環(huán)境搭建》,此處不再贅述。這里展示我們的項(xiàng)目架構(gòu)如下:

Word-Count-Hadoop
├─ input
│  ├─ file1
│  ├─ file2
│  └─ file3
├─ output
├─ pom.xml
├─ src
│  └─ main
│     └─ java
│        └─ WordCount.java
└─ target

WordCount.java代碼如下:

import java.io.IOException;
import java.util.StringTokenizer;
import org.apache.hadoop.fs.FileSystem;
import org.apache.hadoop.conf.Configuration;
import org.apache.hadoop.fs.Path;
import org.apache.hadoop.io.IntWritable;
import org.apache.hadoop.io.Text;
import org.apache.hadoop.mapreduce.Job;
import org.apache.hadoop.mapreduce.Mapper;
import org.apache.hadoop.mapreduce.Reducer;
import org.apache.hadoop.mapreduce.lib.input.FileInputFormat;
import org.apache.hadoop.mapreduce.lib.output.FileOutputFormat;
public class WordCount{
    public static class TokenizerMapper
            extends Mapper<Object, Text, Text, IntWritable> {
        private final static IntWritable one = new IntWritable(1);
        private Text word = new Text();

        public void map(Object key, Text value, Context context) throws IOException, InterruptedException {
        //每次處理一行,一個(gè)mapper里的value為一行,key為該行在文件中的偏移量
            StringTokenizer iter = new StringTokenizer(value.toString());
            while (iter.hasMoreTokens()) {
                word.set(iter.nextToken());
                // 向context中寫入<word, 1>
                context.write(word, one);
            }
        }
    }

    public static class IntSumReducer
            extends Reducer<Text, IntWritable, Text, IntWritable>{
        private IntWritable result = new IntWritable();
        public void reduce(Text key, Iterable<IntWritable> values, Context context) throws IOException, InterruptedException{
            int sum = 0;
            for (IntWritable val : values) {
                sum += val.get();
            }
            result.set(sum);
            context.write(key, result);
        }
    }

    public static void main(String[] args) throws Exception{
        Configuration conf = new Configuration();
        Job job = Job.getInstance(conf, "word_count");

        job.setJarByClass(WordCount.class);

        job.setMapperClass(TokenizerMapper.class);
        //此處的Combine操作意為即第每個(gè)mapper工作完了先局部reduce一下,最后再全局reduce
        job.setCombinerClass(IntSumReducer.class);
        job.setReducerClass(IntSumReducer.class);

        job.setOutputKeyClass(Text.class);
        job.setOutputValueClass(IntWritable.class);

        //第0個(gè)參數(shù)是輸入目錄,第1個(gè)參數(shù)是輸出目錄
        //先判斷output path是否存在,如果存在則刪除
        Path path = new Path(args[1]);// 
        FileSystem fileSystem = path.getFileSystem(conf);
        if (fileSystem.exists(path)) {
            fileSystem.delete(path, true);
        }

        //設(shè)置輸入目錄和輸出目錄
        FileInputFormat.addInputPath(job, new Path(args[0]));
        FileOutputFormat.setOutputPath(job, new Path(args[1]));
        System.exit(job.waitForCompletion(true)?0:1);
    }
}

pom.xml中記得配置Hadoop的依賴環(huán)境:

    ...
  <!-- 集中定義版本號(hào) -->
  <properties>
    <project.build.sourceEncoding>UTF-8</project.build.sourceEncoding>
    <maven.compiler.source>17</maven.compiler.source>
    <maven.compiler.target>17</maven.compiler.target>
    <hadoop.version>3.3.1</hadoop.version>
  </properties>
  <dependencies>
    <dependency>
      <groupId>junit</groupId>
      <artifactId>junit</artifactId>
      <version>4.11</version>
      <scope>test</scope>
    </dependency>
    <!-- 導(dǎo)入hadoop依賴環(huán)境 -->
    <dependency>
        <groupId>org.apache.hadoop</groupId>
        <artifactId>hadoop-common</artifactId>
        <version>${hadoop.version}</version>
    </dependency>
    <dependency>
        <groupId>org.apache.hadoop</groupId>
        <artifactId>hadoop-hdfs</artifactId>
        <version>${hadoop.version}</version>
    </dependency>
    <dependency>
        <groupId>org.apache.hadoop</groupId>
        <artifactId>hadoop-mapreduce-client-core</artifactId>
        <version>${hadoop.version}</version>
    </dependency>
    <dependency>
        <groupId>org.apache.hadoop</groupId>
        <artifactId>hadoop-client</artifactId>
        <version>${hadoop.version}</version>
    </dependency>
    <dependency>
        <groupId>org.apache.hadoop</groupId>
        <artifactId>hadoop-yarn-api</artifactId>
        <version>${hadoop.version}</version>
    </dependency>
  </dependencies>
  ...
</project>

此外,因?yàn)槲覀兊某绦蜃詭л斎雲(yún)?shù),我們還需要在VSCode的launch.json中配置輸入?yún)?shù)intput(代表輸入目錄)和output(代表輸出目錄):

...
"args": [
    "input",
    "output"
],
...

編譯運(yùn)行完畢后,可以查看output文件夾下的part-r-00000文件:

David    1
Goodbye    1
Hello    3
Tom    1
World    2

可見我們的程序正確地完成了單詞計(jì)數(shù)的功能。

以上就是Hadoop MapReduce實(shí)現(xiàn)單詞計(jì)數(shù)(Word Count)的詳細(xì)內(nèi)容,更多關(guān)于Hadoop MapReduce的資料請(qǐng)關(guān)注腳本之家其它相關(guān)文章!

相關(guān)文章

  • AsyncHttpClient?ChannelPool線程池頻道池源碼流程解析

    AsyncHttpClient?ChannelPool線程池頻道池源碼流程解析

    這篇文章主要為大家介紹了AsyncHttpClient ChannelPool線程池頻道池源碼流程解析,有需要的朋友可以借鑒參考下,希望能夠有所幫助,祝大家多多進(jìn)步,早日升職加薪
    2023-12-12
  • Spring Cloud Hystrix 服務(wù)容錯(cuò)保護(hù)的原理實(shí)現(xiàn)

    Spring Cloud Hystrix 服務(wù)容錯(cuò)保護(hù)的原理實(shí)現(xiàn)

    這篇文章主要介紹了Spring Cloud Hystrix 服務(wù)容錯(cuò)保護(hù)的原理實(shí)現(xiàn),小編覺得挺不錯(cuò)的,現(xiàn)在分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2019-05-05
  • Java如何構(gòu)造DSL方法重構(gòu)

    Java如何構(gòu)造DSL方法重構(gòu)

    這篇文章主要介紹了Java如何構(gòu)造DSL方法重構(gòu),文章圍繞主題展開詳細(xì)的內(nèi)容介紹,具有一定的參考價(jià)值,需要的小伙伴可以參考價(jià)值
    2022-07-07
  • SpringCloud Eureka的使用教程

    SpringCloud Eureka的使用教程

    這篇文章主要給大家介紹了關(guān)于SpringCloud Eureka使用的相關(guān)資料,文中通過示例代碼介紹的非常詳細(xì),對(duì)大家的學(xué)習(xí)或者工作具有一定的參考學(xué)習(xí)價(jià)值,需要的朋友們下面隨著小編來一起學(xué)習(xí)學(xué)習(xí)吧
    2021-01-01
  • 基于RestTemplate的使用方法(詳解)

    基于RestTemplate的使用方法(詳解)

    下面小編就為大家?guī)硪黄赗estTemplate的使用方法(詳解)。小編覺得挺不錯(cuò)的,現(xiàn)在就分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2017-07-07
  • spring cloud 之 客戶端負(fù)載均衡Ribbon深入理解

    spring cloud 之 客戶端負(fù)載均衡Ribbon深入理解

    下面小編就為大家?guī)硪黄猻pring cloud 之 客戶端負(fù)載均衡Ribbon深入理解。小編覺得挺不錯(cuò)的,現(xiàn)在就分享給大家,也給大家做個(gè)參考。一起跟隨小編過來看看吧
    2017-06-06
  • java連接Mongodb實(shí)現(xiàn)增刪改查

    java連接Mongodb實(shí)現(xiàn)增刪改查

    這篇文章主要為大家詳細(xì)介紹了java連接Mongodb實(shí)現(xiàn)增刪改查,文中示例代碼介紹的非常詳細(xì),具有一定的參考價(jià)值,感興趣的小伙伴們可以參考一下
    2020-03-03
  • SWT(JFace)體驗(yàn)之ViewForm的使用

    SWT(JFace)體驗(yàn)之ViewForm的使用

    SWT(JFace)體驗(yàn)之ViewForm的使用
    2009-06-06
  • SpringBoot配置文件切換的全面指南

    SpringBoot配置文件切換的全面指南

    在SpringBoot應(yīng)用開發(fā)中,我們常常需要在不同的環(huán)境(如開發(fā)環(huán)境、測(cè)試環(huán)境、生產(chǎn)環(huán)境)中使用不同的配置,SpringBoot提供了強(qiáng)大且靈活的配置文件切換機(jī)制,使得我們能夠輕松應(yīng)對(duì)這種需求,本文將詳細(xì)介紹SpringBoot配置文件切換的相關(guān)知識(shí)與實(shí)踐,需要的朋友可以參考下
    2025-03-03
  • 深入理解Java設(shè)計(jì)模式之適配器模式

    深入理解Java設(shè)計(jì)模式之適配器模式

    這篇文章主要介紹了JAVA設(shè)計(jì)模式之適配器模式的的相關(guān)資料,文中示例代碼非常詳細(xì),供大家參考和學(xué)習(xí),感興趣的朋友可以了解
    2021-11-11

最新評(píng)論

南投市| 龙川县| 冀州市| 桂林市| 鄂尔多斯市| 上犹县| 荥阳市| 延川县| 鄂托克前旗| 青岛市| 定日县| 长春市| 宜兴市| 长宁县| 通州市| 枣阳市| 济南市| 泌阳县| 盐亭县| 霍山县| 成武县| 美姑县| 安龙县| 友谊县| 通渭县| 聊城市| 镇安县| 拜城县| 通辽市| 城市| 玉溪市| 于田县| 达日县| 民权县| 东宁县| 横峰县| 安国市| 阿拉尔市| 阳原县| 施甸县| 双辽市|