Hadoop2.2.0 HA高可用分布式集群搭建(hbase,hive,sqoop,spark)

大数据学习之路 Hadoop篇(一):超简单的虚拟机搭建Hadoop+Hive+Spark+HBase环境 这么长时间没有写博客,期间也发生了很多事情,我也一不小心从萌萌的开发变成了萌萌的数据。 我在写这篇博客的时候还是数据方面的初学者,一来可以回顾总结自己最近学习的内容,督促自己更快更仔细的学习;二来可以为和我一样的初学者提供方便,不必花很多精力去找一些资源和技巧或者环境的搭建,而是专注于知识的学习。 工欲善其事,必先利其器。要想学好大数据,得先有大数据方面的环境。我看过网上很多搭建的教程,自己一... 阅读详情


1 需要软件

Hadoop-2.2.0

Hbase-0.96.2(这里就用这个版本,跟Hadoop-2.2.0是配套的,不用覆盖jar包什么的)

Hive-0.13.1

Zookeepr-3.4.6(建议使用Zookeepr-3.4.5,这样就不用替换storm和hive里面的zookeepr-3.4.5.jar了)

Sqoop1.4.5

Scala-2.10.4

Spark-1.0.2-bin-hadoop2

Jdk1.7.0_51

2 集群结构图

NN : NameNode

JN : JournalNode

DN : DataNode

ZK : ZooKeeper

HM:HMster

HRS:HregionServer

SpkMS:Spark Master

SpkWK:Spark worker




3 Zookeeper-3.4.6 

添加环境变量

##set zookeepr enviroment

export ZOOKEEPER_HOME=/home/cloud/zookeeper346

export PATH=$PATH:$ZOOKEEPER_HOME/bin

3.1 zoo.cfg 配置文件的修改

cloud@hadoop37:~/zookeeper346/conf> ls

configuration.xsl log4j.properties zookeeper.out  zoo_sample.cfg

cloud@hadoop37:~/zookeeper346/conf> cpzoo_sample.cfg zoo.cfg

cloud@hadoop37:~/zookeeper346/conf> vi zoo.cfg

 # The number of milliseconds of each tick

tickTime=2000

# The number of ticks that the initial

# synchronization phase can take

initLimit=10

# The number of ticks that can pass between

# sending a request and getting an acknowledgement

syncLimit=5

# the directory where the snapshot is stored.

# do not use /tmp for storage, /tmp here is just

# example sakes.

dataDir=/home/cloud/zookeeper346/zkdata

dataLogDir=/home/cloud/zookeeper346/logs

# the port at which the clients will connect

clientPort=2181

# the maximum number of client connections.

# increase this if you need to handle more clients

#maxClientCnxns=60

#

# Be sure to read the maintenance section of the

# administrator guide before turning on autopurge.

#

#http://zookeeper.apache.org/doc/current/zookeeperAdmin.html#sc_maintenance

#

# The number of snapshots to retain in dataDir

#autopurge.snapRetainCount=3

# Purge task interval in hours

# Set to "0" to disable auto purge feature

#autopurge.purgeInterval=1

 

server.1=hadoop37:2888:3888

server.2=hadoop38:2888:3888

server.3=hadoop40:2888:3888

server.4=hadoop41:2888:3888

server.5=hadoop42:2888:3888

server.6=hadoop43:2888:3888

server.7=hadoop44:2888:3888

3.2 dataDir目录下创建 myid文件

cloud@hadoop37:~/zookeeper346/zkdata> vi myid

cloud@hadoop37:~/zookeeper346/zkdata> ll

total 12

-rw-r--r-- 1 cloud hadoop    2May 28 18:54 myid

cloud@hadoop37:~/zookeeper346/zkdata>

3.3 复制(SCP)到其它的服务器下去

cloud@hadoop37:~ > scp -r/home/cloud/zookeeper346 cloud@hadoop38:~/

cloud@hadoop37:~ > scp -r/home/cloud/zookeeper346 cloud@hadoop40:~/

cloud@hadoop37:~ > scp -r/home/cloud/zookeeper346 cloud@hadoop41:~/

cloud@hadoop37:~ > scp -r/home/cloud/zookeeper346 cloud@hadoop42:~/

cloud@hadoop37:~ > scp -r/home/cloud/zookeeper346 cloud@hadoop43:~/

cloud@hadoop37:~ > scp -r/home/cloud/zookeeper346 cloud@hadoop44:~/

然后只要修改…data/myid文件成对应的id就好了

hadoop37中写入 1,

hadoop38中写入 2,

以此类推 …

4 Hadoop-2.2.0

添加环境变量

##set hadoop enviroment

export HADOOP_HOME=/home/cloud/hadoop220

export YARN_HOME=/home/cloud/hadoop220

export HADOOP_MAPARED_HOME=${HADOOP_HOME}

export HADOOP_COMMON_HOME=${HADOOP_HOME}

export HADOOP_HDFS_HOME=${HADOOP_HOME}

export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop

export YARN_CONF_DIR=$HADOOP_HOME/etc/hadoop

export HDFS_CONF_DIR=${HADOOP_HOME}/etc/hadoop

export HADOOP_PREFIX=${HADOOP_HOME}

exportHADOOP_COMMON_LIB_NATIVE_DIR=${HADOOP_PREFIX}/lib/native

exportHADOOP_OPTS="-Djava.library.path=$HADOOP_PREFIX/lib"

export PATH=$PATH:$HADOOP_HOME/bin

4.1 修改7个配置文件

~/hadoop220/etc/hadoop/hadoop-env.sh

~/ hadoop220/etc/hadoop/core-site.xml

~/ hadoop220/etc/hadoop/hdfs-site.xml

~/ hadoop220/etc/hadoop/mapred-site.xml

~/ hadoop220/etc/hadoop/yarn-env.sh

~/ hadoop220/etc/hadoop/yarn-site.xml

~/ hadoop220/etc/hadoop/slaves

4.1.1修改hadoop-env.sh配置文件(jdk 路径)

cloud@hadoop59:~/hadoop220/etc/hadoop> pwd

/home/cloud/hadoop220/etc/hadoop

[root@masterhadoop]# vi hadoop-env.sh

 …

# Set Hadoop-specific environment variables here.

 

# The only required environment variable is JAVA_HOME.  All others are

# optional.  When running adistributed configuration it is best to

# set JAVA_HOME in this file, so that it is correctly defined on

# remote nodes.

 

# The java implementation to use.

export JAVA_HOME=/usr/java/jdk1.7.0_51

4.1.2修改core-site.xml文件修改 (注意fs.defaultFS的配置)

 cloud@hadoop59:~/hadoop220/etc/hadoop>  vi core-site.xml

 

<configuration>

    <property>

       <name>fs.defaultFS</name>

       <value>hdfs://mycluster</value>

    </property>

   

    <property>

               <name>hadoop.tmp.dir</name>

                <value>file:/home/cloud/hadoop220/temp</value>

        </property>

   

    <property>

               <name>dfs.nameservices</name>

                <value>mycluster</value>

        </property>

 

    <property>

               <name>ha.zookeeper.quorum</name>

                <value>hadoop37:2181,hadoop38:2181,hadoop40:2181,hadoop41:2181,hadoop42:2181,hadoop43:2181,hadoop44:2181</value>

        </property>

 

</configuration>

4.1.3修改hdfs-site.xml配置文件

cloud@hadoop59:~/hadoop220/etc/hadoop> vihdfs-site.xml

 

<configuration>

    <property>

       <name>dfs.nameservices</name>

       <value>mycluster</value>

    </property>

 

    <property>

       <name>dfs.ha.namenodes.mycluster</name>

       <value>hadoop59,hadoop60</value>

    </property>

 

    <property>

        <name>dfs.namenode.rpc-address.mycluster.hadoop59</name>

       <value>hadoop59:8020</value>

    </property>

 

    <property>

       <name>dfs.namenode.rpc-address.mycluster.hadoop60</name>

       <value>hadoop60:8020</value>

    </property>

 

    <property>

       <name>dfs.namenode.http-address.mycluster.hadoop59</name>

       <value>hadoop59:50070</value>

    </property>

 

    <property>

       <name>dfs.namenode.http-address.mycluster.hadoop60</name>

       <value>hadoop60:50070</value>

    </property>

 

    <property>

       <name>dfs.namenode.shared.edits.dir</name>

       <value>qjournal://hadoop26:8485;hadoop27:8485;hadoop28:8485/mycluster</value>

    </property>

   

     <property>

               <name>dfs.namenode.name.dir</name>

                <value>file:///home/cloud/hadoop220/dfs/name</value>

        </property>

 

    <property>

               <name>dfs.datanode.data.dir</name>

                <value>file:///data1,/data2,/data3</value>

        </property>

###这里暂时只用了data1~data3,后面如果需要填加data盘的话,只需###要修改配置文件,并且重启集群即可。

    <property>

       <name>dfs.ha.automatic-failover.enabled.mycluster</name>

       <value>true</value>

    </property>

 

    <property>

       <name>dfs.client.failover.proxy.provider.mycluster</name>

    <value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>

    </property>

 

    <property>

       <name>dfs.ha.fencing.methods</name>

       <value>sshfence</value>

    </property>

 

    <property>

       <name>dfs.ha.fencing.ssh.private-key-files</name>

       <value>/home/cloud/.ssh/id_rsa</value>

    </property>

   

    <property>

       <name>dfs.journalnode.edits.dir</name>

       <value>/home/cloud/hadoop220/tmp/journal</value>

    </property>

   

    <property>

             <name>dfs.replication</name>

             <value>3</value>

       </property>

 

       <property>

             <name>dfs.webhdfs.enabled</name>

             <value>true</value>

       </property>      

 

</configuration>

4.1.4修改 mapred­-site.xml配置文件

cloud@hadoop59:~/hadoop220/etc/hadoop> cpmapred-site.xml.template mapred-site.xml

cloud@hadoop59:~/hadoop220/etc/hadoop> vi mapred-site.xml

 

<configuration>

       <property>

             <name>mapreduce.framework.name</name>

             <value>yarn</value>

       </property>

</configuration>

4.1.5修改yarn-env.sh配置文件

cloud@hadoop59:~/hadoop220/etc/hadoop> viyarn-env.sh

 # some Java parameters

export JAVA_HOME=/usr/java/jdk1.7.0_51

4.1.6修改yarn-site.xml配置文件

cloud@hadoop59:~/hadoop220/etc/hadoop> viyarn-site.xml

 

<configuration>

<!-- Site specific YARN configuration properties-->

       <property>

             <name>yarn.nodemanager.aux-services</name>

             <value>mapreduce_shuffle</value>

       </property>

       <property>

             <name>yarn.nodemanager.aux-services.mapreduce.shuffle.class</name>

             <value>org.apache.hadoop.mapred.ShuffleHandler</value>

       </property>

       <property>

             <name>yarn.resourcemanager.hostname</name>

             <value>hadooo59</value>

       </property>

</configuration>

4.1.7修改slaves配置文件

cloud@hadoop59:~/hadoop220/etc/hadoop> vislaves

 

hadoop26

hadoop27

hadoop28

hadoop29

hadoop36

hadoop37

hadoop38

hadoop40

hadoop41

hadoop42

hadoop43

hadoop44

5 Hadoop配置结束,开始启动各个程序(笔记只保留重要日志信息)

5.1 在每个节点上启动Zookeeper

cloud@hadoop37:~/zookeeper346> pwd

/home/cloud/zookeeper346

cloud@hadoop37:~/zookeeper346>bin/zkServer.sh start

JMX enabled by default

Using config: /home/cloud/zookeeper346/bin/../conf/zoo.cfg

Starting zookeeper ... STARTED

其它服务器也这样启动,这里就不写了…

# 验证Zookeeper是否启动成功1

在hadoop41上查看zookeeper的状态发现是leader

cloud@hadoop41:~> zkServer.sh status

JMX enabled by default

Using config: /home/cloud/zookeeper346/bin/../conf/zoo.cfg

Mode: leader

cloud@hadoop41:~>

在其他的机器上查看zookeeper的状态发现是follower

#验证Zookeeper是否启动成功2

cloud@hadoop41:~> zookeeper346/bin/zkCli.sh

Connecting to localhost:2181

2015-06-01 15:50:50,888 [myid:] - INFO  [main:Environment@100] - Clientenvironment:zookeeper.version=3.4.6-1569965, built on 02/20/2014 09:09 GMT

2015-06-01 15:50:50,895 [myid:] - INFO  [main:Environment@100] - Clientenvironment:host.name=hadoop41

2015-06-01 15:50:50,895 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.version=1.7.0_51

2015-06-01 15:50:50,900 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.vendor=Oracle Corporation

2015-06-01 15:50:50,900 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.home=/usr/java/jdk1.7.0_51/jre

2015-06-01 15:50:50,900 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.class.path=/home/cloud/zookeeper346/bin/../build/classes:/home/cloud/zookeeper346/bin/../build/lib/*.jar:/home/cloud/zookeeper346/bin/../lib/slf4j-log4j12-1.6.1.jar:/home/cloud/zookeeper346/bin/../lib/slf4j-api-1.6.1.jar:/home/cloud/zookeeper346/bin/../lib/netty-3.7.0.Final.jar:/home/cloud/zookeeper346/bin/../lib/log4j-1.2.16.jar:/home/cloud/zookeeper346/bin/../lib/jline-0.9.94.jar:/home/cloud/zookeeper346/bin/../zookeeper-3.4.6.jar:/home/cloud/zookeeper346/bin/../src/java/lib/*.jar:/home/cloud/zookeeper346/bin/../conf::/usr/java/jdk1.7.0_51/lib:/usr/java/jdk1.7.0_51/jre/lib

2015-06-01 15:50:50,901 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.library.path=/usr/java/packages/lib/amd64:/usr/lib64:/lib64:/lib:/usr/lib

2015-06-01 15:50:50,901 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.io.tmpdir=/tmp

2015-06-01 15:50:50,901 [myid:] - INFO  [main:Environment@100] - Clientenvironment:java.compiler=<NA>

2015-06-01 15:50:50,901 [myid:] - INFO  [main:Environment@100] - Clientenvironment:os.name=Linux

2015-06-01 15:50:50,902 [myid:] - INFO  [main:Environment@100] - Clientenvironment:os.arch=amd64

2015-06-01 15:50:50,902 [myid:] - INFO  [main:Environment@100] - Clientenvironment:os.version=3.0.13-0.27-default

2015-06-01 15:50:50,902 [myid:] - INFO  [main:Environment@100] - Clientenvironment:user.name=cloud

2015-06-01 15:50:50,902 [myid:] - INFO  [main:Environment@100] - Clientenvironment:user.home=/home/cloud

2015-06-01 15:50:50,903 [myid:] - INFO  [main:Environment@100] - Clientenvironment:user.dir=/home/cloud

2015-06-01 15:50:50,906 [myid:] - INFO  [main:ZooKeeper@438] - Initiating clientconnection, connectString=localhost:2181 sessionTimeout=30000watcher=org.apache.zookeeper.ZooKeeperMain$MyWatcher@75e5d16d

Welcome to ZooKeeper!

2015-06-01 15:50:50,959 [myid:] - INFO  [main-SendThread(localhost:2181):ClientCnxn$SendThread@975]- Opening socket connection to server localhost/0:0:0:0:0:0:0:1:2181. Will notattempt to authenticate using SASL (unknown error)

2015-06-01 15:50:50,969 [myid:] - INFO [main-SendThread(localhost:2181):ClientCnxn$SendThread@852] - Socketconnection established to localhost/0:0:0:0:0:0:0:1:2181, initiating session

JLine support is enabled

2015-06-01 15:50:51,009 [myid:] - INFO [main-SendThread(localhost:2181):ClientCnxn$SendThread@1235] - Sessionestablishment complete on server localhost/0:0:0:0:0:0:0:1:2181, sessionid =0x44d9d846f630001, negotiated timeout = 30000

 

WATCHER::

 

WatchedEvent state:SyncConnected type:None path:null

[zk: localhost:2181(CONNECTED) 0]

[zk: localhost:2181(CONNECTED) 1] ls /

[zookeeper]

[zk: localhost:2181(CONNECTED) 2]

出现这样的提示的话,那么zookeeper就启动成功了

5.2 在hadoop59上格式化Zookeeper(这里一定要在namenode配置的机器上执行,否则会报错,是一个bug)

Bug详情见https://issues.apache.org/jira/browse/HDFS-6731

cloud@hadoop59:~/hadoop220/bin >hdfs zkfc-formatZK

/cloud/hadoop220/contrib/capacity-scheduler/*.jar

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Client environment:java.library.path=/home/cloud/hadoop220/lib/native

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:java.io.tmpdir=/tmp

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:java.compiler=<NA>

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:os.name=Linux

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:os.arch=amd64

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:os.version=3.0.76-0.11-default

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:user.name=cloud

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:user.home=/home/cloud

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Clientenvironment:user.dir=/home/cloud/hadoop220/bin

15/06/01 09:42:20 INFO zookeeper.ZooKeeper: Initiating clientconnection,connectString=hadoop37:2181,hadoop38:2181,hadoop40:2181,hadoop41:2181,hadoop42:2181,hadoop43:2181,hadoop44:2181sessionTimeout=5000watcher=org.apache.hadoop.ha.ActiveStandbyElector$WatcherWithClientRef@58d48756

15/06/01 09:42:20 INFO zookeeper.ClientCnxn: Opening socketconnection to server hadoop37/192.168.100.37:2181. Will not attempt toauthenticate using SASL (unknown error)

15/06/01 09:42:20 INFO zookeeper.ClientCnxn: Socket connectionestablished to hadoop37/192.168.100.37:2181, initiating session

15/06/01 09:42:20 INFO zookeeper.ClientCnxn: Session establishmentcomplete on server hadoop37/192.168.100.37:2181, sessionid = 0x14d9d846f810001,negotiated timeout = 5000

15/06/01 09:42:20 INFO ha.ActiveStandbyElector: Session connected.

15/06/01 09:42:20 INFO ha.ActiveStandbyElector: Successfully cre

快速部署Hadoop+MySQL+Hive+Spark集群 对于学习Hadoop时,可能有朋友想快速搭建一个Hadoop集群,所有我现在自己将觉得是可以快速的方法分享给大家,大多数的配置参数是来自我们老师发给我们的文档的,如果你有自己想要的配置参数可以查看Hadoop的文档Hadoop文档。 这个文章是主要是写给我们班上的同学的,是学习记录,如果有什么错误之处,还请大佬指点,谢谢! 如果需要下载linux的CentOS镜像文件可以参考:Centos6.5镜像下载_你的破壁人呀的博客-CSDN博客_centos6.5 对于在VMware Workstation 阅读详情

相关推荐

Hadoop 全家桶分布式搭建的混沌笔记

文章目录Hadoop 全家桶分布式搭建先安装JDK解压安装包后配置环境变量先明确对应的分布式节点的功能与角色笔者的节点部署Hadoop 本体分布式安装安装包解压完毕之后需要修改以下几份核心配置文件`core-site.xml`配置`hdfs-site.xml` 配置`mapred-site.xml` 配置`yarn-site.xml` 配置`slaves` 配置请在这个文件里面写入你的集群节点名单...

qq_36259161的博客 1621

Hadoop+Spark+Hive+HBase+Oozie+Kafka+Flume+Flink+ES+Redash等详细安装部署

1、内容概要:Hadoop+Spark+Hive+HBase+Oozie+Kafka+Flume+Flink+Elasticsearch+Redash等大数据集群及组件搭建指南(详细搭建步骤+实践过程问题总结)。 2、适合人群:大数据运维、大数据相关技术及组件初学者。 3、能学到啥:大数据集群及相关组件搭建的详细步骤,了解大数据各组件的用途,深入认识各大数据组件工作原理及优化方案。 4、阅读建议:使用过以上大数据组件进行简单开发、了解以上大数据组件的相关功能。 5、资源价值:大数据组件搭建的详细实践步骤、一次性提供较全面的常用大数据集群及组件安装部署内容、资源是博主结合官网文档+网上各类搭建文档+本人亲自实践后总结整合的文档(包括过程踩坑记录+对应解决方案)。

大数据各组件安装(数据中台搭建

文章目录一、基础环境配置(三台机器都操作)1.修改主机名:2.关闭防火墙:3.关闭Selinux:4.文件描述符配置:5.自定义JDK安装:5.1 删除默认openJDK:5.2 安装jdk1.8.0_91:6.创建Hadoop用户:7.配置SSH免密登录:二、大数据组件安装1.安装Zookeeper:2.安装Hadoop:3.安装Hbase:4.安装Hive:4.1 安装MySQL:4.2 部署Hive:5.安装kafka:6.安装Solr:7.安装Atlas:7.1 集成 Hbase:7.2 集成 So

小强签名设计 的博客 9131

hadoop完全分布式环境搭建,整合zookeeper,hbase,spark,hive,hue

前期准备工作 1、由于测试环境的所有服务器只在内网访问,所以全部关闭防火墙,省去配置访问规则时间。 service iptables stop 2集群中包括4个节点:1个master,3个salve,所以节点均安装好jdk,节点之间局域网连接,可以相互ping通。节点IP地...

chunqing7023的博客 926

高可用(HA)Hadoop搭建Hive on Spark

hadoop高可用搭建hive on spark

qq_45453417的博客 1109

基于Hadoop HA集群部署HBase HA集群(详细版)

本文介绍Hadoop高可用(HA)集群的部署方法,重点阐述ZooKeeper在HadoopHBase高可用架构中的核心作用。文章首先说明ZooKeeper通过临时节点机制实现主从选举,为Hadoop NameNode和HBase Master提供故障转移支持。随后详细讲解ZooKeeper集群的配置步骤,包括myid文件设置和环境变量配置。在Hadoop HA配置部分,文章展示了core-site.xml和hdfs-site.xml的关键参数,特别是ZooKeeper服务地址和nameservice的配置

pysense的博客 5366

hadoop完全分布式+hive+sqoop+hbase+spark+zookeeper

hadoop2.7 完全分布式部署教程 hadoop 2.7 + hive 安装部署 hive2 的安装部署 sqoop 工具的安装 spark集群的安装 hbase集群部署

su_mingyang的博客 7700

HA高可用+hive+hbase+sqoop+kafka+flume+spark安装部署

资料 链接:https://pan.baidu.com/s/162xqYRVSJMy_cKVlWT4wjQ 提取码:yikm

慕铭yikm 2171

Centos7搭建Hadoop HA完全分布式集群(6台机器)(内含hbasehive,flume,kafka,sparksqoop,phoenix,storm)

​​​​。

eagle89的专栏 1261

HadoopSpark、Storm相关组件安装

Hadoop2.6.4、zookeeper3.4.6、HBase1.2.2Hive1.2.1、sqoop1.99.7、spark1.6.2安装

梓纾的专栏 4398

构建基于Hadoop的大数据离线分析系统:HiveSqoop配置实战

大数据技术的发展是一个跨越信息时代的重要里程碑,它的进步直接影响到了我们对于数据的理解和应用。离线分析作为大数据处理的核心方式之一,为存储、处理和分析大规模数据集提供了强大的技术支撑。大数据(Big Data)涉及的数据量大到传统数据库管理系统无法有效处理,往往需要分布式计算来处理。其定义不仅包括数据的体量巨大,还涵盖了数据的多样性、速度、复杂性等特征。

weixin_42163404的博客 1206

【大数据基础】大数据处理架构Hadoop02 Hadoop生态系统

本文讲解Hadoop生态系统,涵盖HDFS、HBase等众多组件。它们各司其职,协同运作,在数据存储、处理、分析、协同及管理等方面发挥优势,为大数据应用提供全面支撑。

Morse_Chen的博客 3090

大数据平台搭建(二):hadoop HA 集群搭建

前言      本章搭建zookeeper集群hadoop集群 1.hadoop版本的选择     1.目前而言,不收费的Hadoop版本主要有三个(均是国外厂商),分别是:Apache(最原始的版本,所有发行版均基于这个版本进行改进)、Cloudera版本(Cloudera’s Distribution Including Apache Hadoop,简称CDH)、Hor...

守得云开见月明 3028

基于Hadoop生态的相关框架与组件的搭建

本篇文章,着重与Hadoop生态的相关框架与组件的搭建,以及不同框架或组件之间的依赖配置,使读者能够熟悉与掌握Hadoop集群搭建,对于Hadoop生态有一定的认识。本次搭建三台虚拟机为hadoop01.bgd01、hadoop02.bgd01、hadoop03.bgd01,hadoop01.bgd01为主节点,其中所需的素材,笔者已放入网盘中,有需要的的可自行下载。关于虚拟机的搭建,可参考笔者之前的系列文章,这里只对虚拟机的一些配置进行描述。

weixin_63507910的博客 2911

搭建5个节点的hadoop集群环境(CDH5)

搭建一个分布式hadoop集群环境,下面是详细步骤,使用cdh5 。提示:如果还不了解Hadoop的,可以下查看这篇文章Hadoop生态系统,通过这篇文章,我们可以首先大致了解HadoopHadoop的生态系统中的工具的使用场景。 一、硬件准备 基本配置: 操作系统 64位 CPU (英特尔)Intel(R) I3处理器 内存 8.00 GB ( 1600 MHz) 硬盘剩余空间 50G 流畅配置: 操作系统 64位

陌上花开 6万+

Hadoop 大数据技术学习心得:从 0 到 1 搭建高可用集群的实践与思考

这门课不仅让我掌握了 Hadoop 的从 0 到 1 搭建,更培养了 “分布式系统的问题解决思维”—— 后续我将基于此集群,完成 “电商用户画像分析” 的实战项目。这门课让我明确了 Hadoop 的适用边界:它擅长处理。

Azure01cc的博客 384

CentOS7:hadoop2.6.5 HA yarn 高可用集群搭建 hbase-0.98.12.1-hadoop2-bin.tar.gz mysql5.7 hbase-0.98.12.1 apac...

操作系统是CentOS7 节点规划 ntp校时 ;每一台虚拟机 yum install ntp -y service ntpd restart service ntpd stop ntpdate 210.72.145.39 date 查看日期时间 timedatectl 查看时区ln -sf /usr/share/zonei...

weixin_30501857的博客 459

Hadoop分布式环境搭建

Hadoop是一个开源的框架,可编写和运行分布式应用处理大规模数据,是专为离线和大规模数据分析而设计的,并不适合那种对几个记录随机读写的在线事务处理模式。 Hadoop的数据来源可以是任何形式,在处理半结构化和非结构化数据上与关系型数据库相比有更好的性能,具有更灵活的处理能力,不管任何数据形式最终会转化为key/value,key/value是基本数据单元。 Hadoop就是一个分布式计算的解决方案。

charles0902的专栏 961
上一篇: 取每个月最后一天的日期
下一篇: BookKeeper
edentyin
博客等级 码龄14年 0粉丝 11原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值