TeraSort实验--测试Map和Reduce Task数量对Hadoop性能的影响

hadoop 性能调优 重要参数设置技巧 这里主要针对Mapreduce性能调优。 这一两个月在做mapreduce性能调优,有些心得,还是要记下来的,以郷后人~ 这里主要涉及的参数包括: HDFS: dfs.block.size Mapredure: io.sort.mb io.sort.spill.percent mapred.local.dir mapred.map.tasks & mapred 阅读详情

一、           实验环境


1master节点, 16slave节点: CPU:8GHZ , 内存: 2G

网络:局域网

实验人:谢


二、           实验描述


   通过Hadoop自带的Terasort排序程序,测试不同的map taskreduce task数量,对Hadoop性能的影响。

   实验数据由程序中的teragen程序生成,数据量为1GB10GB

   通过设置mapred.min.split.size,从而调节map task的数量;设置mapred.reduce.tasks,从而调节reduce task的数量;

   dfs.replication的值设为3,其它参数默认。


三、           实验结果与分析


 

Ø  实验一

                表1、改变reduce task(数据量为1GB)

Map task = 16

Reduce task

1

5

10

15

16

20

25

30

45

60

总时间

892

146

110

92

88

100

128

101

145

104

Map 时间

24

21

25

50

2

测试眼里的Hadoop系列 之Terasort TeraSortHadoop测试中很有用的一个工具,但以前只是粗略的知道它的功能用法,简单的用它做了几个测试用例。实际上,对于这种比较通用的工具,如果能够了解它更多一些的话,对于理解Hadoop是很有帮助的,同时也可以更好的利用它来帮助测试。最近有点时间,就了解了一些它的背景,代码实现原理等等,就先记录下来吧。 1. Hadoop与Sort Benchmarks SortBenchmar 阅读详情

相关推荐

C# chart以鼠标所在位置为中心进行缩放

以前都用labview做一些软件,但给出去总是会遇到版本,安装包过大等一些问题,于是想自学C#,记录一下使用过程中遇到的一些问题解决措施,便于日后回顾。 在这个项目中需要绘制折线图,由于数据比较大,需要对图表进行缩放操作,以鼠标为中心对图表进行缩放,在网上查找了一些资料没找到我想要的,于是自己想了一个解决方案,可以基本实现,但略显繁琐,由于刚开始学习C#,对一些操作不太了解,若以后遇...

fei的博客 6348

【信息科学与工程学】计算机科学与自动化——第八十四篇 C++分布式软件高并发/高可用算法01

4. 提交:协调者选择提交时间戳(>所有读时间戳),两阶段提交:a) 写意图预提交到所有参与者,b) 参与者持久化后确认,c) 协调者决定提交,异步清理意图。:客户端请求发送到协调节点,协调节点根据路由转发到主分片所在节点。Span有父子关系。1. 索引文档:客户端发送PUT请求到协调节点,协调节点路由到主分片节点,主分片写入本地,然后并行复制到副本分片,等待确认后响应客户端。3. 搜索:客户端发送搜索请求到协调节点,协调节点广播到所有相关分片,每个分片执行查询,返回结果,协调节点合并、排序、分页后返回。

weixin_49199313的博客 1030

Mac版Burp Suite专业版破解与汉化完整指南

在Web安全测试领域,Java应用程序的许可证验证机制与本地化实现是常见的技术课题。其原理通常涉及Java Agent技术,通过在JVM启动时动态修改字节码,实现对软件授权状态的校验逻辑进行拦截与重写,从而绕过官方验证。同时,软件界面的国际化(i18n)与本地化(l10n)则依赖于资源文件的替换与加载。从技术价值角度看,深入理解这些机制不仅能满足特定场景下的工具定制需求,更能加深对Java安全机制、软件保护与逆向工程的理解。在实际的工程实践中,安全研究人员与开发者常面临功能受限或语言障碍的挑战,尤其是在渗透

weixin_29327525的博客 655

Spark 与 Hadoop 关于 TeraGen/TeraSort 的对比实验(包含源代码)

自从 Hadoop 问世以来,MapReduce 在很长时间内都是排序基准测试的纪录保持者,但这一垄断在最近被基于内存计算的 Spark 打破了。在今年Databricks与AWS一起完成的一个Daytona Gray类别的Sort Benchmark中,Spark 完胜 Hadoop MapReduce:“1/10计算资源,1/3耗时”。这是个很有意思的对比实验,因此笔者也在一个小规模集群上做了一个微缩版的类似试验。

samhacker的专栏 8331

Spark TeraSort 实现与调优

参考ehiggs/spark-terasort以及RDD#sortBy的代码,我自己实现了一个Spark的TeraSort程序。

Just for Fun la 4631

Spark性能测试Terasort

上次做了Hadoop集群的性能测试,因为主要的大数据开发工作在Spark上,这次做一下Spark的性能测试。 CDH6.0.1环境Hadoop集群性能测试 代码参考:spark-terasort 因为使用的CDH6.0.1,Spark版本2.2.0,代码需要做一些修改,这里已经在Spark2.3源码下修改好并编译打包,放到了Spark的examples里,可以替换Spark的exampl...

L, there! 2463

Hadoop集群性能调优实战:从原理到参数配置的完整指南

在大数据生态系统中,分布式存储与计算框架是处理海量数据的核心基础设施。其工作原理基于将数据分片存储与并行计算,通过资源统一调度来提升吞吐量。这项技术的核心价值在于,能够以横向扩展的方式,高效、稳定地处理PB级数据,并显著降低海量数据处理的硬件与运维成本。其典型应用场景包括企业级数据仓库、实时数据分析平台以及机器学习训练管道。本文将聚焦于Hadoop这一经典框架,深入探讨如何通过系统化的性能调优,解决数据倾斜与资源利用率低下等常见工程挑战,从而充分挖掘集群潜力,实现从“能用”到“好用”的跨越。

culiao2169的博客 506

Hadoop测试TeraSort

http://www.opstool.com/article/249 使用teragen产生数据 使用Teragen来产生数据,示例如下: hadoop jar hadoop-*-examples.jar teragen 参数1 参数2 teragen的参数解释: 参数1:表示要产生的数据的行数。Teragen每行数据的大小是100B。 要产生1T的数据,需要的

qiezikuaichuan的专栏 1653

MapReduce NativeTask优化详解

提示:文章写完后,目录可以自动生成,如何生成可参考右边的帮助文档 文章目录 前言 一、pandas是什么? 二、使用步骤 1.引入库 2.读入数据 总结 基本介绍 NativeTaskHadoop MapReduce 的高性能 C++ API 运行时。为什么叫 NativeTask 是因为它是一个只专注于数据处理的原生计算单元,这正是 TaskHadoop MapReduce 上下文中所做的事情。换句话说,NativeTask 不负责资源管理、作业调度.

Dreamershi的专栏 3113

Terasort 基准测试

Terasort 基准测试 生成数据,teragen 后面生成数据大小,比如我们要生成4GB数据 410241024*1024/100 行数据,因为每一行数据是100B,所有要除以100。 第二个参数是 数据存放目录 /opt/model/hadoop-2.7.6/bin/hadoop jar ./hadoop-mapreduce-examples-2.7.6.jar teragen 42949672 terasort/4GB-input ...

qq_38347727的博客 816

HadoopTeraSort算法分析

<br /><br />1、概述<br />1TB排序通常用于衡量分布式数据处理框架的数据处理能力。TerasortHadoop中的的一个排序作业,在2008年,Hadoop在1TB排序基准评估中赢得第一名 ,耗时209秒。那么TerasortHadoop中是怎样实现的呢?本文主要从算法设计角度分析Terasort作业。<br />2、算法思想<br />实际上,当我们要把传统的串行排序算法设计成并行的排序算法时,通常会想到分而治之的策略,即:把要排序的数据划成M个数据块(可以用Hash的方 法做到),

npucloud的专栏 1255

CDH6官方文档中文系列(1)---适用于裸机部署的Cloudera Enterprise参考架构

适用于裸机部署的Cloudera Enterprise参考架构 最近在学习cdh6的官方文档,网上也比较难找到中文的文档。 其实官方英文文档的阅读难度其实并不是很高,所以在这里在学习官方文档的过程中,把它翻译成中文,在翻译的过程中加深学习了解,并分享出来大家一起学习。 中文内容是本人的渣渣英文水平结合有道词典,谷歌翻译的结果,文中部分词语可能翻译的并不准确,希望大家多多提出意见,共同进步。 cdh6的官方中文文档系列长期更新,最后目标整理成gitbook,同大家交流学习。 最后,如果你觉得本文对你有用,

hanli2020的博客 4077

mapreducemaptask个数的决定因素

map阶段读取数据前,FileInputFormat会将输入文件分割成split。split的个数决定了map的个数。影响map个数(split个数)的主要因素有:   1) 文件的大小。当块(dfs.block.size)为128m时,如果输入文件为128m,会被划分为1个split;当块为256m,会被划分为2个split。   2) 文件的个数。FileInputFormat按

大众博客 6272

Hadoop参数性能调优(二)--Map and Reduce tasks 数量

Map and Reduce tasks 数量性能影响

学术技术交流,分享生活感悟 1万+

Hadoop MapReduce Job性能调优——修改MapReduce个数

map task数量mapred.map.tasks的参数值,用户不能直接设置这个参数。Input Split的大小,决定了一个Job拥有多少个map。默认input split的大小是64M(与dfs.block.size的默认值相同)。然而,如果输入的数据量巨大,那么默认的64M的block会有几万甚至几十万的Map Task,集群的网络传输会很大,最严重的是给Job Tracker的调度

Athenaer的专栏 2573

缠论.zip_mt4分笔指标_缠 mt4_缠论MT4_缠论mt4公式_缠论指标

缠论分笔MT4公式,给广大缠友提供一个合适的指标公式。祝愿天下缠友早日破缠得禅

上一篇: Hadoop性能调优(二)--Map and Reduce tasks 数量
下一篇: Hadoop0.21.0源码流程分析(1)-客户端提交作业
npucloud
博客等级 码龄15年 6粉丝 9原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值