Hadoop Mapreduce分区、分组、二次排序过程详解[转]

徐海蛟 教学用途

1、MapReduce中数据流动
   (1)最简单的过程:  map - reduce
   (2)定制了partitioner以将map的结果送往指定reducer的过程: map - partition - reduce
   (3)增加了在本地先进性一次reduce(优化)过程: map - combin(本地reduce) - partition -reduce
2、Mapreduce中Partition的概念以及使用。
(1)Partition的原理和作用
        得到map给的记录后,他们该分配给哪些reducer来处理呢?hadoop采用的默认的派发方式是根据散列值来派发的,但是实际中,这并不能很高效或者按照我们要求的去执行任务。例如,经过partition处理后,一个节点的reducer分配到了20条记录,另一个却分配道了10W万条,试想,这种情况效率如何。又或者,我们想要处理后得到的文件按照一定的规律进行输出,假设有两个reducer,我们想要最终结果中part-00000中存储的是"h"开头的记录的结果,part-00001中存储其他开头的结果,这些默认的partitioner是做不到的。所以需要我们自己定制partition来根据自己的要求,选择记录的reducer。自定义partitioner很简单,只要自定义一个类,并且继承Partitioner类,重写其getPartition方法就好了,在使用的时候通过调用Job的setPartitionerClass指定一下即可

        Map的结果,会通过partition分发到Reducer上。Mapper的结果,可能送到Combiner做合并,Combiner在系统中并没有自己的基类,而是用Reducer作为Combiner的基类,他们对外的功能是一样的,只是使用的位置和使用时的上下文不太一样而已。Mapper最终处理的键值对<key, value>,是需要送到Reducer去合并的,合并的时候,有相同key的键/值对会送到同一个Reducer那。哪个key到哪个Reducer的分配过程,是由Partitioner规定的。它只有一个方法,

        getPartition(Text key, Text value, int numPartitions)

输入是Map的结果对<key, value>和Reducer的数目,输出则是分配的Reducer(整数编号)。就是指定Mappr输出的键值对到哪一个reducer上去。系统缺省的Partitioner是HashPartitioner,它以key的Hash值对Reducer的数目取模,得到对应的Reducer。这样保证如果有相同的key值,肯定被分配到同一个reducre上。如果有N个reducer,编号就为0,1,2,3……(N-1)。

(2)Partition的使用
        分区出现的必要性,如何使用Hadoop产生一个全局排序的文件?最简单的方法就是使用一个分区,但是该方法在处理大型文件时效率极低,因为一台机器必须处理所有输出文件,从而完全丧失了MapReduce所提供的并行架构的优势。事实上我们可以这样做,首先创建一系列排好序的文件;其次,串联这些文件(类似于归并排序);最后得到一个全局有序的文件。主要的思路是使用一个partitioner来描述全局排序的输出。比方说我们有1000个1-10000的数据,跑10个ruduce任务, 如果我们运行进行partition的时候,能够将在1-1000中数据的分配到第一个reduce中,1001-2000的数据分配到第二个reduce中,以此类推。即第n个reduce所分配到的数据全部大于第n-1个reduce中的数据。这样,每个reduce出来之后都是有序的了,我们只要cat所有的输出文件,变成一个大的文件,就都是有序的了

基本思路就是这样,但是现在有一个问题,就是数据的区间如何划分,在数据量大,还有我们并不清楚数据分布的情况下。一个比较简单的方法就是采样,假如有一亿的数据,我们可以对数据进行采样,如取10000个数据采样,然后对采样数据分区间。在Hadoop中,patition我们可以用TotalOrderPartitioner替换默认的分区。然后将采样的结果传给他,就可以实现我们想要的分区。在采样时,我们可以使用hadoop的几种采样工具,RandomSampler,InputSampler,IntervalSampler。

       这样,我们就可以对利用分布式文件系统进行大数据量的排序了,我们也可以重写Partitioner类中的compare函数,来定义比较的规则,从而可以实现字符串或其他非数字类型的排序,也可以实现二次排序乃至多次排序。

2、MapReduce中分组的概念和使用
    分区的目的是根据Key值决定Mapper的输出记录被送到哪一个Reducer上去处理。而分组的就比较好理解了。笔者认为,分组就是与记录的Key相关。在同一个分区里面,具有相同Key值的记录是属于同一个分组的。

3、MapReduce中Combiner的使用
        很多MapReduce程序受限于集群上可用的带宽,所以它会尽力最小化需要在map和reduce任务之间传输的中间数据。Hadoop允许用户声明一个combiner function来处理map的输出,同时把自己对map的处理结果作为reduce的输入。因为combiner function本身只是一种优化,hadoop并不保证对于某个map输出,这个方法会被调用多少次。换句话说,不管combiner function被调用多少次,对应的reduce输出结果都应该是一样的。

  下面我们以《权威指南》的例子来加以说明,假设1950年的天气数据读取是由两个map完成的,其中第一个map的输出如下:
  (1950, 0)
  (1950, 20)
  (1950, 10)

第二个map的输出为:
       (1950, 25)
       (1950, 15)

而reduce得到的输入为:(1950, [0, 20, 10, 25, 15]), 输出为:(1950, 25)

  由于25是集合中的最大值,我们可以使用一个类似于reduce function的combiner function来找出每个map输出中的最大值,这样的话,reduce的输入就变成了:
  (1950, [20, 25])

  各个funciton 对温度值的处理过程可以表示如下:max(0, 20, 10, 25, 15) =max(max(0, 20, 10), max(25, 15)) = max(20, 25) = 25

  注意:并不是所有的函数都拥有这个属性的(有这个属性的函数我们称之为commutative和associative),例如,如果我们要计算平均温度,就不能这样使用combiner function,因为mean(0, 20, 10, 25, 15) =14,而mean(mean(0, 20, 10),mean(25, 15)) = mean(10, 20) = 15

  combiner function并不能取代reduce function(因为仍然需要reduce function处理来自不同map的带有相同key的记录)。但是他可以帮助减少需要在map和reduce之间传输的数据,就为这一点combiner function就值得考虑使用。

4、Shuffle阶段排序流程详解
        我们首先看一下MapReduce中的排序的总体流程。

        MapReduce框架会确保每一个Reducer的输入都是按Key进行排序的。一般,将排序以及Map的输出传输到Reduce的过程称为混洗(shuffle)。每一个Map都包含一个环形的缓存,默认100M,Map首先将输出写到缓存当中。当缓存的内容达到“阈值”时(阈值默认的大小是缓存的80%),一个后台线程负责将结果写到硬盘,这个过程称为“spill”。Spill过程中,Map仍可以向缓存写入结果,如果缓存已经写满,那么Map进行等待。

Spill的具体过程如下:首先,后台线程根据Reducer的个数将输出结果进行分组,每一个分组对应一个Reducer。其次,对于每一个分组后台线程对输出结果的Key进行排序。在排序过程中,如果有Combiner函数,则对排序结果进行Combiner函数进行调用。每一次spill都会在硬盘产生一个spill文件。因此,一个Map task有可能会产生多个spill文件,当Map写出最后一个输出时,会将所有的spill文件进行合并与排序,输出最终的结果文件。在这个过程中Combiner函数仍然会被调用。从整个过程来看,Combiner函数的调用次数是不确定的。下面我们重点分析下Shuffle阶段的排序过程:

        Shuffle阶段的排序可以理解成两部分,一个是对spill进行分区时,由于一个分区包含多个key值,所以要对分区内的<key,value>按照key进行排序,即key值相同的一串<key,value>存放在一起,这样一个partition内按照key值整体有序了。

        第二部分并不是排序,而是进行merge,merge有两次,一次是map端将多个spill 按照分区和分区内的key进行merge,形成一个大的文件。第二次merge是在reduce端,进入同一个reduce的多个map的输出 merge在一起,该merge理解起来有点复杂,最终不是形成一个大文件,而且期间数据在内存和磁盘上都有。所以shuffle阶段的merge并不是严格的排序意义,只是将多个整体有序的文件merge成一个大的文件,由于不同的task执行map的输出会有所不同,所以merge后的结果不是每次都相同,不过还是严格要求按照分区划分,同时每个分区内的具有相同key的<key,value>对挨在一起。

        Shuffle排序综述:如果只定义了map函数,没有定义reduce函数,那么输入数据经过shuffle的排序后,结果为key值相同的输出挨在一起,且key值小的一定在前面,这样整体来看key值有序(宏观意义的,不一定是按从大到小,因为如果采用默认的HashPartitioner,则key 的hash值相等的在一个分区,如果key为IntWritable的话,每个分区内的key会排序好的),而每个key对应的value不是有序的。

5、MapReduce中辅助排序的原理与实现
(1)任务
我们需要把内容如下的sample.txt文件处理为下面文件:

源文件:Sample.txt

bbb 654

ccc 534

ddd 423

aaa 754

bbb 842

ccc 120

ddd 219

aaa 344

bbb 214

ccc 547

ddd 654

aaa 122

bbb 102

ccc 479

ddd 742

aaa 146

目标:part-r-00000

aaa 122

bbb 102

ccc 120

ddd 219

(2)工作原理
   过程导引:
   1、定义包含记录值和自然值的组合键,本例中为MyPariWritable.

   2、自定义键的比较器(comparator)来根据组合键对记录进行排序,即同时利用自然键和自然值进行排序。(aaa 122组合为一个键)。

   3、针对组合键的Partitioner(本示例使用默认的hashPartitioner)和分组comparator在进行分区和分组时均只考虑自然键。

   详细过程:
首先在map阶段,使用job.setInputFormatClass定义的InputFormat将输入的数据集分割成小数据块splites,同时InputFormat提供一个RecordReder的实现。本例子中使用的是TextInputFormat,他提供的RecordReder会将文本的一行的行号作为key,这一行的文本作为value。这就是自定义Map的输入是<LongWritable, Text>的原因。然后调用自定义Map的map方法,将一个个<LongWritable, Text>对输入给Map的map方法。注意输出应该符合自定义Map中定义的输出< MyPariWritable, NullWritable>。最终是生成一个List< MyPariWritable, NullWritable>。在map阶段的最后,会先调用job.setPartitionerClass对这个List进行分区,每个分区映射到一个reducer。每个分区内又调用job.setSortComparatorClass设置的key比较函数类排序。可以看到,这本身就是一个二次排序。在reduce阶段,reducer接收到所有映射到这个reducer的map输出后,也是会调用job.setSortComparatorClass设置的key比较函数类对所有数据对排序。然后开始构造一个key对应的value迭代器。这时就要用到分组,使用jobjob.setGroupingComparatorClass设置的分组函数类。只要这个比较器比较的两个key相同,他们就属于同一个组(本例中由于要求得每一个分区内的最小值,因此比较MyPariWritable类型的Key时,只需要比较自然键,这样就能保证只要两个MyPariWritable的自然键相同,则它们被送到Reduce端时候的Key就认为在相同的分组,由于该分组的Key只取分组中的第一个,而这些数据已经按照自定义MyPariWritable比较器排好序,则第一个Key正好包含了每一个自然键对应的最小值),它们的value放在一个value迭代器,而这个迭代器的key使用属于同一个组的所有key的第一个key。最后就是进入Reducer的reduce方法,reduce方法的输入是所有的key和它的value迭代器。同样注意输入与输出的类型必须与自定义的Reducer中声明的一致。

转载于:https://www.cnblogs.com/hadoop-dev/p/5910459.html

MapReduce案例之分组 MapReduce中,分组主要是用于确定将哪些数据作为一个组,相同的key会被分为一组,然后调用一次reduce方法。默认情况下不同的key会被分为不同的组,从而每个组都会调用一次reduce方法。但是如果我们的业务中需要将不同的key放在同一个组里,调用一次reduce方法,那么就需要我们去自定义实现分组。在该案例中我们要实现的是将学生的语文、数学、英语成绩进行分组,并求出每个科目(每组)中成绩最高的一条数据。实现的大致思路:将数据上传至HDFS: 新建project: 自定义JavaBe 阅读详情

相关推荐

SAP-ABAP:SAP库存管理核心增强:IF_EX_MB_DOCUMENT_BADI 深度解析

SAP库存管理核心增强:IF_EX_MB_DOCUMENT_BADI 深度解析

baidu_35680696的博客 1419

MapReduce分区分组

分区分组 分区:在Mapper的输出时进行,默认会采用HashPartitioner,会根据key值和reduce数进行分组;在写入MapOutputBuffer的缓冲区之前每个kv对就已经获取了对应的分区索引,在溢写时默认会根据分区索引从小到大,key值从小到大进行排序;并且rudecer数决定了分区数量,因为一个reducer只能处理一个分区。自定义分组器通过Job.setPartitio...

Jodness' Blogs 3503

Python爬虫实战:东方财富股吧与雪球舆情数据实时爬取与情绪指标挖掘

本文详细介绍如何使用Python爬虫技术实时爬取东方财富股吧和雪球平台的讨论数据,结合股价波动构建情绪分析指标。我们将使用最新的异步爬虫技术、自然语言处理方法和可视化工具,为量化交易提供数据支持。文章包含完整的代码实现和技术细节,适合有一定Python基础的读者学习。

2201_76125261的博客 1161

MapReduce排序分区分组总结

1. 分区 1.1 自定义分区器 1) 自定义分区器继承 Partitioner类,并重写getPartition方法 2) 在driver类中设置使用 job.setPartitionerClass(PhoneNumPartitioner.class); 3) 设置reduce的个数 正常情况下,根据分区器业务来决定设置多少个,说白了就是分区器的逻辑会生成多少个分区, 则设置的多少个reduce 1.2 分区使用的注意事项: 1). reduce个数的设置 如果不设置,red

qq_43206800的博客 2100

MapReduce的运作详解分区

分区的概念: Map阶段处理的数据,在向环形缓冲区写的时候 是以分区的方式写的 一般情况下,MR程序分区数有多少 reduceTask数量就应该有多少 ,一个分区的数据一个reduceTask去处理,reduceTask处理完成之后都会生成一个结果文件 ...

阳哥的博客 4115

Mapreduce中的分组分区

在讲述两个概念之前,先对Mapreduce的流程做一个简单的阐述:        (1)最简单的流程Map -&gt; Reduce        (2)定制了partitioner : Map -&gt; MyPartiton -&gt; Redcue        (3)增加combiner(相当于在reduce之前map端的一次本地化reduce) : Map -&gt; Combiner ...

Dzhantao的博客 6683

MapReduce实战小案例(自定义排序二次排序分组分区

MapReduce实战小案例

fengxiandada的博客 7471

Hadoop Mapreduce 分片、分区分组二次排序过程详解

首先需要明确的是,hadoop里的key一定要是可排序的,要么key自身实现了WritableComparator接口,要么有一个排序类可以对key进行排序。如果key本身不实现WritableComparator接口,而是由另外的一个工具类(实现RawComparator接口)来提供排序的话,需要单独设置key的排序类: job.setOutputKeyComparatorClass(XXX.class); 在map输出的时候,会进行分片,在片内再对key进行排序。分片的作用是确定分发到哪个reduce;

道语星航 1418

mapreduce二次排序详解

mapreduce二次排序详解 - linzch3 - 博客园 什么是二次排序排序的数据具有多个字段,首先对第一个字段排序,再对第一字段相同的行按照第二字段排序,第二次排序不破坏第一次排序的结果,这个过程就称为二次排序。 如何在mapreduce中实现二次排序 mapreduce的工作原理 MR的工作原理如下图(如果看不清可右键新标签页查看): 图片部分数据参考自:HadoopMapReduce原理解析 相关重点: 分区(partitioning):使得具有相同Key值的键值.

hellojoy的博客 2737

HadoopMapReduce详解

MapReduce详解MapReduce介绍MapReduce的基本编程模型MapReduce的计算过程1. Map阶段可以概括为5个步骤:2. Reduce节点也可以分为5个步骤:设置ReduceTask并行度(个数)关于分片(Split)关于ShuffleMap端的shuffleReduce端的ShuffleShuffle流程详解补充问题:MapReduce分区相关问题理解1.Partition的原理和作用2.Partition的使用3.分组的概念和使用分组排序的步骤4.Combiner的使用概念实现步

小哲的博客 9337

Hadoop Mapreduce分区分组、连接以及辅助排序(也叫二次排序过程详解

目录1、MapReduce中数据流动2、Mapreduce中Partition的概念以及使用。1)Partition的原理和作用2)Partition的使用3、MapReduce中Combiner的使用4、Shuffle阶段排序流程详解5、MapReduce中辅助排序的原理与实现(1)任务2)工作原理3)实现代码1 首先说一下工作原理:2 二次排序就是首先按照第一字段排序,然后再对第一字段相同的...

baidu_21349635的专栏 908

MapReduce中的 分区分组排序(区别)

2020-7-26 一. Partition分区: 功能: 按照条件将结果输入到不同的文件中 实现步骤: 自定义排序规则继承Partitioner类,重写getPartition()方法 在job驱动Driver中设置自定义排序规则 在Driver中根据分区数,设置ReduceTask数 分区数和ReduceTask关系 如果ReduceTask的数量(分区数)大于getPartition设置的数量,会产生空的输出文件 如果ReduceTask的数量大于1,getPartiti

jsx____的博客 1564

Hadoop3 - MapReduce 分组介绍及案例实践

排序进行筛选的,这种情况在数据量巨大的情况下很容易产生。分区进行了介绍,通过分区规则控制不同的数据进到不同的。,因此可以基于自定义排序分组的方式计算出。中,而本篇文章将的分组则是进到同一个。阶段进行分组之前,会首先进行数据排序行为(则认为前后两个相等分为一组,该类需要在。下面利用上面的特征对前面文章讲解的。两个属性,其中自定义分组中根据。相同则认为一组,可以发现在遍历。执行成功后,到输出目录中查看结果。都是不同的,因此可以通过便利。的内容,而 key 则根据。如果需要自定义规则,只需继承。

小毕超博客 1295

初学MapReduce

MapReduce计算框架 并行计算框架 一个大的任务拆分成多个小任务,将多个小任务分发到多个节点上。每个节点同时执行计算。 MapReduce核心思想 分而治之,先分后和:将一个大的、复杂的工作或任务,拆分成多个小的任务,并行处理,最终进行合并。 MapReduce由Map和Reduce组成 Map: 将数据进行拆分 Reduce:对数据进行汇总 ...

weixin_45749011的博客 2万+

Hadoop系列-MapReduce工作原理详解(十二)

MapReduce工作原理详解,包括mapper、reducer、键值对、InputFormat \outputFormat、InputSplit、RecordReader、partitioner、shuffle

Toby的博客 3030

MapReduce排序分区

一、排序:按照key2进行排序 1、数字的排序 2、字符串的排序 3、对象的排序: 实现WritableComparable接口 (1)序列化 (2)可被排序 员工数据 Employee.java ----> 作为key2输出 复习SQL:order by 后面 + 列名、表达式、别名、序号 desc desc 只作用于离他最近的一个列 ...

weixin_30305735的博客 303

MapReduce的自定义排序分区分组

自定义排序(WritableComparable) 当写mr程序来处理文本时,经常会将处理后的信息封装到我们自定义的bean中,并将bean作为map输出的key来传输 而mr程序会在处理数据的过程中(传输到reduce之前)对数据排序(如:map端生成的文件中的内容分区且区内有序)。 操作: 自定义bean来封装处理后的信息,可以自定义排序规则用bean中的某几个属性来作为排序...

axs441702的博客 679

UMAT-CREEP.rar_abaqus子程序_fortran creep_fortran inp_umat-creep_流变

ABAQUS用户自定义流变本构模型子程序,附有验证INP文件,程序经调试通过。

上一篇: hdfs 名称节点和数据节点
下一篇: pig的各种运行模式与运行方式详解
dfug3303
博客等级 码龄11年 2粉丝 0原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值