yarn环境跑mapreduce报错某个container 600s未报告进度超时被杀


问题:

发现每次reduce阶段跑到98%,相关的container被杀。报出的log大概的意思:container 600s未报告进度超时被杀

解决的方法:

在mapreduce程序里加上

conf.set("mapred.task.timeout", "0");                        //不检查超时


又一次打包执行,最后没有出现错误,可是执行非常长时间,总算执行完了,怀疑程序问题有大循环
最后检查reduce发现会有双层循环,有可能会很大,导致卡在reduce内部,长时间没有进行不论什么的读写,也就没有汇报他的进度情况

总结

问题的解决办法起于对于悬挂的task,假设NMr在一段时间(默认是10min。能够通过mapred.task.timeout属性值来设置。单位是毫秒)内一直没有收到它的进度报告。则把它标记为失效



Cloudera CDP实战指南:从CDP安装、CM配置到HDFS/YARN/Hive调优 Cloudera Data Platform(CDP)是现代企业级云原生数据平台的核心代表,它已取代传统CDH,基于Kubernetes构建,融合HDFS分布式存储、YARN资源调度与Hive/Tez计算引擎。理解其架构演进(CDH→CDP)、掌握Cloudera Manager三级配置体系、规避Kubernetes环境部署陷阱(如CNI选型、etcd存储、Operator配置),是保障集群稳定与性能的关键。在真实生产中,HDFS小文件治理、YARN容量队列精细化配额、Hive on Tez会话复用与Shu 阅读详情

相关推荐

Hadoop 2.7.1 伪分布式环境搭建与核心组件配置实战

分布式系统是处理海量数据的核心技术架构,其核心原理在于将计算任务与数据存储分散到多台计算机上协同工作,以实现高吞吐量和高容错性。这一技术价值在于能够经济高效地应对大数据时代的数据存储、处理和分析挑战,广泛应用于日志分析、数据仓库、机器学习等场景。Hadoop作为此类系统的经典开源实现,其2.7.1版本集成了HDFS、YARNMapReduce三大核心组件,构成了稳定可靠的大数据处理的基石。本文聚焦于Hadoop 2.7.1伪分布式模式的部署,详细解析了从Java环境配置、SSH无密码登录到HDFS、YAR

culiao2169的博客 453

MapReduce设置参数防止超时

1. 如果碰到异常“Task attempt failed to report status for xxx seconds. Killing!”,最可能是碰到死循环了。 2. 如果没有死循环:控制超时的属性是:mapred.task.timeout,默认600000ms,即600s。可以设置成更大的值。可以直接在Jobconf或Configuration中修改(只对本Job起作用),也可以修改...

weixin_30735391的博客 448

Sqoop安装配置与实战:从MySQL到Hadoop的高效数据迁移指南

在构建数据仓库和数据湖的ETL(抽取、转换、加载)流程中,关系型数据库与Hadoop生态间的批量数据传输是一个基础且高频的需求。其核心原理在于通过并行化框架(如MapReduce)实现数据的高效搬运,将复杂的连接、分页、异常处理等底层操作封装为简洁的命令行接口。这项技术的核心价值在于显著提升数据同步的稳定性和开发效率,避免重复造轮子。它广泛应用于数据仓库初始化、数据湖构建、以及日常的增量数据同步等场景。本文聚焦于Apache Sqoop这一经典工具,通过详解其安装配置、连接MySQL数据库、并行导入到HDF

weixin_34234829的博客 332

大数据集群yarn任务延迟问题调查

大数据集群yarn任务延迟竟然是因为机器的光口有问题导致的。

qingchen191的专栏 1995

maptask 超时问题 Timed out after 600 secs

Maptask 超时问题(1) 1.Maptask超时问题情况描述 某个maptask重试四次后导致job失败,失败原因就是task超时,如下: ` AttemptID:attempt_1470311300058_6506513_m_000010_0 Timed out after 600 secs ` mapred.task.timeout 参数说明 The number of mi...

败八 1万+

spark yarn任务的executor 无故 timeout之原因分析

问题: 用 spark-submit --master yarn --deploy-mode cluster --driver-memory 2G --num-executors 6 --executor-memory 2G ~~~ 提交任务时,最后一个executor 执行时间 超过了 160s 导致 timeout而退出,造成任务重新执行造成用时过长。具体请看...

a11133333的博客 1898

从零搭建Hadoop+Spark大数据平台:本地部署、核心验证与实战指南

大数据处理的核心在于对海量、多源、高速增长的数据进行高效存储、计算与分析,其技术原理通常基于分布式系统架构,通过将任务分解并行处理来突破单机性能瓶颈。这一技术价值体现在能够为数据密集型应用提供可扩展、高容错的解决方案,广泛应用于互联网、金融、物联网等领域的用户行为分析、实时风控和智能推荐等场景。本文聚焦于大数据技术栈的本地化部署与实践,详细阐述了以Hadoop分布式文件系统(HDFS)和YARN资源调度为核心,集成Spark计算引擎的伪分布式环境搭建过程。内容涵盖从Java环境配置、SSH免密登录到HDFS

weixin_33978044的博客 355

systemd服务配置文件.service的配置项说明

service 服务配置文件是 systemd 初始化系统的核心组件,用于定义 Linux 服务的启动、运行和管理行为。.service文件定义‌单个服务的行为与管理规则‌,配置文件包含三个主要区块,以下是各配置项的详细说明:‌‌ 服务的简短描述(如 ),用于日志和管理命令中的标识。‌‌‌ 服务文档链接(如手册页或在线文档),例如 。‌‌ / ‌‌ / ‌‌‌ 定义冲突服务(如 ),冲突服务运行时当前服务无法启动。‌‌启动顺序控制‌: - :指定当前服务在哪些目标/服务‌之后启动‌(如 )

zhaominyong的专栏 793

yarn RM crash问题一例

今天收到线上的resource manager报警:报错信息如下:2014-07-0813:22:54,118INFOorg.apache.hadoop.yarn.util.AbstractLivelinessMonitor:Expired:xxxx:53356Timedoutafter600secs 2014-07-0813:22:54,118INFO...

weixin_34244102的博客 206

【异常问题】Hive中SQL执行mapreduce.task.timeout超时问题

【异常描述】 Task with the most failures(4):  ----- Task ID:task_1479051658015_121922_r_000000 URL:http://hnn01.ns4f.hi.ipm.nokia.com:8088/taskdetails.jsp?jobid=job_1479051658015_121922&tipid=task_14790

Insist 1万+

AttemptID:attempt_1527588965479_0001_m_000000_0 Timed out after 600 secs

1.在用MapReduce Hbase任务是出现这个从错误: AttemptID:attempt_1380292154249_0838_m_000035_0 Timed out after 600 secsContainer killed by the ApplicationMaster. 这个问题出现的背景是:Hbase中某张表每一条都含有照片,并且照片较大。问题原因貌似跟内存有关,可能是集群...

wscrf的博客 7305

HiveQL中如何排查数据倾斜问题

转https://blog.csdn.net/u010010664/article/details/79731044 数据倾斜的现象: 会导致的问题 可能会导致下面2个问题 1)某个reduce task,卡在99.9%半天不动。如下 2)任务超时掉 Reduce处理的数据量巨大,在做full gc的时候,stop the world。导致响应超时,超出默认的600秒,任务被掉。报错信息 AttemptID:attempt_1498075186313_242232_r_0.

qq_24271537的博客 335

Hive 优化-参数设置

参考链接: https://blog.csdn.net/WYpersist/article/details/79797075 https://blog.csdn.net/baidu_29843359/article/details/46967473 http://blog.sina.com.cn/s/blog_6ff05a2c010178qd.html map数的计算 https://bl...

fengzheku的专栏 6558

浅析Yarn中的关键概念-Container

初学Yarn的时候,对于Container的概念感觉非常陌生,即便是后期用了很长时间的Yarn平台,依旧觉得对于Container这个概念没有达到非常熟悉的程度:本文,从源码的角度上来说说,到底什么是Container:说起来非常容易,Container就是Yarn中的一个动态资源分配的概念,其拥有一定的内存,核数,由RM分配给ApplicationMaster或者MapTask或者ReduceT...

夜阑听风 1万+
上一篇: Android Studio快捷键每日一练(3)
下一篇: 前端学PHP之基础语法
weixin_33924220
博客等级 码龄11年 5325粉丝 734原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值