初识hadoop

大数据之 Hadoop 初识 Hadoop概述 Hadoop:一个由Apache基金会所开发的分布式系统基础架构,主要解决海量数据的存储和海量数据的分析计算问题。 Hadoop优势 (4高) 高可靠性:Hadoop底层维护多个数据副本,所以即使Hadoop某个计算元 素或存储出现故障,也不会导致数据的丢失。 高扩展性:在集群间分配任务数据,可方便的扩展数以千计的节点。 高有效性:在MapReduce的思想下,Hadoop是并行工作的,以加快任务处 理速度。 高容错性:能够自动将失败的任务重新分配。 Hadoop组成 (面试重点) H 阅读详情

hadoop做了什么事:

    提供了海量离线数据的存储,提供了海量离线数据的分布式计算,同时具备高可靠,高吞吐,分布式的特点。

hadoop核心组件:

    hdfs(分布式存储),mapreduce(分布式计算),yarn(资源调度平台)

①海量数据的存储:

    通过hdfs实现,hdfs是一个分布式的高可靠的存储框架,由namenode,datanode,secondarynamenode(hadoop2.x中已经不需要他来进行hdfs日志的合并)组成,hdfs主要完成的功能:元数据保存,副本存放,和文件切块。

    namenode主要进行一个元数据管理,包括内存中完整的元数据,磁盘中接近完整的元数据文件fsimage,以及记录的操作日志文件edits。

    datanode主要是对数据进行存储,通过配置的dfs.replication的值,来决定保存一个副本。

    secondarynamenode:namenode负责管理元数据(有几个副本,副本存放在那个datanode上),这些信息是保存在namenode节点的内存中的,但是当我们上传数据的时候,是先记录操作日志edits文件,这一步的目的是什么呢?是为了后续更新namenode元数据而做准备,如果namenode既提供访问服务,又要实时更新元数据的变化,这样他的负荷就会很大,有了这样的问题,我们就用一个secondarynamenode来定时向namenode请求到操作日志,并把fsimage(namenode中的元数据镜像文件)下载下来,在sn(secondarynamenode)上做合并,并发送给namenode,namenode更新内存中的元数据,并在edits中打标记,这个时间点的元数据就是最新的了。一句话总结:sn在nn失效的时候并不能代替nn对外提供服务,达到热备的效果,只能帮助nn合并操作日志,更新元数据。

②海量数据的分布式计算

    hadoop提供了一个mapreduce的分布式计算框架,计算过程分为map阶段和reduce阶段,此文章中不对mr进行详细分析,请参考后续博文

③高可靠

    hadoop2.x中引入了HA和联邦机制的概念,主要是namenode的高可靠,通过zookeeper去协调切换,做失活处理。

    


深入解析Vortex GPGPU cache设计(2),关于cache_bank 本文分析了Vortex处理器的cache_bank模块设计,作为cache系列的第二部分。文章详细阐述了cache_bank的基本结构,包括地址位分配和默认配置参数。重点解析了cache的5种操作及其优先级。文章详细介绍了二级流水线设计,包括TAG/DATARAM的读写操作时序。 阅读详情

相关推荐

【数据集】全球湿度数据集总结

【数据集】全球湿度数据集总结

WW、forever的博客 1618

1 初识hadoop

insider_way 172

歌声数据集-内含干声、乐谱musicscore、mid、标注数据

歌声数据集-内含干声、乐谱musicscore、mid、标注数据

Hadoop入门——初识Hadoop

推荐一个微信商城,扫码即可购买,性价比超高,程序员必备 店主就是博主,有任何问题可随时通过商城内的微信与博主取得联系 一.hadoop是什么 Hadoop被公认是一套行业大数据标准开源软件,在分布式环境下提供了海量数据的处理能力。几乎所有主流厂商都围绕Hadoop开发工具、开源软件、商业化工具和技术服务。今年大型IT公司,如EMC、Microsoft、Intel、Teradata、...

东天里的冬天 13万+

初识Hadoop

目录 什么是Hadoop Hadoop三大核心组件介绍 Hadoop的发行版本介绍 Hadoop版本演变历史 Hadoop2.x的细节优化 Hadoop3.x的细节优化 什么是Hadoop 我们生活在一个数据大爆炸的时代,数据飞快的增长,急需解决海量数据的存储和计算问题。 这个时候,Hadoop就应运而生了。 Hadoop是一个适合海量数据的分布式存储和分布式计算的框架。 在这里要注意,分布式存储和分布式计算。 分布式存储,可以简单理解为存储数据的时候,数据不只...

ssn520的博客 1339

Hadoop Say Hello——初识Hadoop

Hadoop Say Hello,认识Hadoop,带你步入大数据的“不归路”

爱做梦的锤子 1170

初识HadoopHadoop知识小结

Hadoop知识,优缺点,生态圈,功能组件

weixin_51535120的博客 1686

006 Hadoop之MapReduce初识

MapReduce概念: MapReduce是一个分布式运算程序的编程框架,是用户开发“基于Hadoop的数据分析应用”的核心框架。 MapReduce核心功能是将用户编写的业务逻辑代码和自带默认组件整合成一个完整的分布式运算程序,并行运行在一个Hadoop集群上。 MapReduce优点 易于编程:它简单的实现一些接口,就可以完成一个分布式程序,这个分布式程序可以分布到大量廉价的PC机器上运行。 易于扩展:当你的计算资源不能得到满足的时候,你可以通过简单的增加机器来扩展它的计算能力。 高容错性:ha

小哥哥咯的博客 1660

Hadoop初识

Hadoop初识 1.大数据概念 2.Hadoop的思想之源 3.Hadoop背景介绍 3.1.什么是Hadoop 3.2.Hadoop产生背景 4.Hadoop组成 5.Hadoop的优势 6.HADOOP生态圈以及各组成部分的简介 1.大数据概念     大数据指无法在一定时间内用常规软件工具进行捕捉、管理和处理的数据集合,是需要新处理模式才能具有更强的决策力、洞察发现力和流程优化能力的海量、...

qq_45763007的博客 247
上一篇: 关于就业的一些思考
下一篇: hdfs写文件流程
Java_Soldier
博客等级 码龄10年 27粉丝 82原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值