ホームページ >Java >&#&チュートリアル >WordCount を実装する 3 つの方法の紹介

WordCount を実装する 3 つの方法の紹介

不言
不言転載
2018-10-19 16:17:283787ブラウズ

この記事では、WordCount を実装する 3 つの方法を紹介します。必要な方は参考にしていただければ幸いです。

1. 合理化されたシェル

cat /home/sev7e0/access.log | tr -s ' '\n' | ソート | $2, $1}'
#cat コマンドはテキストの内容を一度に表示します
#tr -s ' ' '\n' テキスト内のスペースを Enter キーで置き換えます
#sort 指定されたすべてのファイルを並べ替えますを連続して実行し、結果を標準出力に書き込みます。
#uniq -c 入力ファイルまたは標準入力から隣接する一致する行をフィルターし、出力ファイルまたは標準出力に書き込みます。 -c は、各行の前に対応する行の出現数を示すプレフィックス番号を追加します。 #sort | uniq -c 出現回数をカウントするために同時に使用します
#sort -r 結果を逆順に並べます
#awk '{print $2,$1}' 結果をテキストとともに出力します前にカウント

2。使いやすいspark

//mapreduce方式
public static void main(String[] args) throws Exception {

    Configuration conf = new Configuration();
//        conf.set("fs.defaultFS", "hdfs://spark01:9000");
//        conf.set("yarn.resourcemanager.hostname", "spark01");

    Path out = new Path(args[1]);
    FileSystem fs = FileSystem.get(conf);

    //判断输出路径是否存在,当路径存在时mapreduce会报错
    if (fs.exists(out)) {
        fs.delete(out, true);
        System.out.println("ouput is exit  will delete");
    }
    
    // 创建任务
    Job job = Job.getInstance(conf, "wordcountDemo");
    // 设置job的主类
    job.setJarByClass(WordCount.class); // 主类

    // 设置作业的输入路径
    FileInputFormat.setInputPaths(job, new Path(args[0]));

    //设置map的相关参数
    job.setMapperClass(WordCountMapper.class);
    job.setMapOutputKeyClass(Text.class);
    job.setMapOutputValueClass(LongWritable.class);
    
    //设置reduce相关参数
    job.setReducerClass(WordCountReduce.class);
    job.setOutputKeyClass(Text.class);
    job.setOutputValueClass(LongWritable.class);

    //设置作业的输出路径
    FileOutputFormat.setOutputPath(job, out);
    job.setNumReduceTasks(2);
    System.exit(job.waitForCompletion(true) ? 0 : 1);
}

以上がWordCount を実装する 3 つの方法の紹介の詳細内容です。詳細については、PHP 中国語 Web サイトの他の関連記事を参照してください。

声明:
この記事はsegmentfault.comで複製されています。侵害がある場合は、admin@php.cn までご連絡ください。

関連記事

続きを見る