Hadoop 集群搭建详细介绍

Ubuntu搭建Hadoop集群详细操作流程 Ubuntu搭建Hadoop集群详细操作流程 一、准备工作 若还没安装虚拟机可参考:VMVMware14虚拟机安装程 没安装Ubuntu的可参考:Ubuntu的安装教程 Haddop的下载可以到https://mirrors.cnnic.cn/apache/hadoop/common/ 这个网址下载,下载的时候版本是选择Hadoop2.x.版本。格式文件选择hadoop-2.x.y.tar.g... 阅读详情

Hadoop 集群搭建教程

What is Apache Hadoop?
The Apache Hadoop project develops open-source software for reliable, scalable, disttributed couputing .

  • 分布式文件系统(HDFS)
  • 并行计算框架(MapReduce)
  • 资源管理调度系统 (YARN Yet Another Resource Negotiator)

一. Hadoop部署方式

本地模式
伪分布模式
集群模式

本地模式: 即在本地下载hadoop包,进行安装,以单节点方式即可使用;
伪分布式:一般供学习.了解使用,通过虚拟机或者docker之类方式,搭建hadoop集群,详细步骤如下:
集群模式: 步骤基本如同伪分布式搭建;


二. Linux上 伪分布式集群配置

1. 常用命令
  • ifconfig 查看网络ip信息
  • hostname 查看主机名
  • service iptables status 查看防火墙信息
2. 主机名修改
  • 切换到root权限 编辑network配置文件

      # vim /etc/sysconfig/network
        
      在文件中输入以下代码
      NETWORKING=yes
      HOSTNAME=用户名
        
      输入‘hostname 用户名', 确认修改
      # hostname 用户名
    
  • 将瞬态修改(开机重启则恢复),改成静态修改

      # vi /etc/hostname
      在编辑器中将默认的localhost.localdomain主机名改成要修改主机名 
    
3. 关闭防火墙
  • 查看防火墙状态   (括号中为旧版操作命令,下同)

    # systemctl status iptables.service   (service iptables status)
    
  • 关闭防火墙

    # systemctl stop firewalld.service  (service iptables stop)
    
  • 关闭开机启动 (如果只是简单的关闭防火墙,则机器重启时会开启防火墙)

    # systemctl disable firewalld.service   (chkconfig iptables off)
    
4. 网络设置
  • 网络地址修改

    VM上的linux主机采用bridge,NET,或者Host-only都行,只要保证集群里面的所有虚拟机在同一网段内,并且相互任意之间均可ping通,

    修改方式可通过命令行进行修改,也可通过图形化界面进行修改.若担心下次网络重新连接时,原有的ip地址被改变,可设置静态ip地址

  • 修改主机名和ip的映射关系, 主要是为了方便通过主机名进行网路访问

    # vi /etc/hosts 
    
    输入以下代码(注意,保留原有代码,在后面添加新代码),192.168.169.129 P-01
    192.168.169.130 P-02
    192.168.169.131 P-03
    192.168.169.128 H-01
    

注意:上述操作,需要在集群的所有主机上进行.

在任意主机终端,通过 ping <主机名> 测试连通性

5. 安装JDK

Hadoop平台是基于Java环境的,因此我们必须在linxu主机上安装JDK
由于在新建linux虚拟机的时候,已经安装了jdk环境,所以这次安装JDK步骤就省去了

步骤就两步:

  1. 在合适的地方解压缩JDK安装压缩包;

  2. 配置java环境变量

# vi /home/dlyw/.bash_profile

在已有的代码尾部,加上如下代码(原有代码,不能改动)

# 以下是新加的代码
export JAVA_HOME=JDK 的安装路径
export PATH=$JAVA_HOME/bin:$PATH

假设JDK的安装路径为/usr/java/jdk1.9.0_31/ , 则"JDK的安装路径"几个字就用 /usr/java/jdk1.9.0_31/代替

修改完之后,执行source /home/dlyw/.bash_profile 命令,使修改生效;

最后执行 java -version 命令,测试是否配置成功!

6. 免密钥登陆配置

生成ssh免登陆密钥(首先在Maste节点进行配置)
$ ssh-keygen -t rsa
出现一系列提示,简单回车即可.

ssh-keygen是用来生成私钥(id_rsa文件),公钥(id_rsa.pub文件)密钥对的命令, 将本机的公钥文件拷贝到远程的主机上, 则本机就可以使用ssh登陆远程主机而不用输入密码.

通过参数 ‘-t’ 指定加密算法, RSA加密算法是一种典型的非对称加密算法

生成的密钥在.ssh目录下 如 /home/dlyw/.ssh/ 下, 可通过 ls -l 查看

接下来将公钥文件复制到.ssh目录下

$ cp ~/.ssh/id_rsa.pub ~/.ssh/authorized.keys
// 然后将authorized.keys文件复制到所有的Slave节点上, 本次搭建的有三个从属节点,需要执行三次命令

$ scp ~/.ssh/authorized_keys dlyw@P-01:~/
$ scp ~/.ssh/authorized_keys dlyw@P-02:~/
$ scp ~/.ssh/authorized_keys dlyw@P-03:~/         //P-01, P-02, P-03是三个从属节点的主机名, dlyw是用户名

这样就完成了Master结点的配置,然后进行Slave结点的配置

首先还是用ssh-keygen命令生成密钥,一路回车即可

接着将authorized_keys(该文件是从 Master主机上拷贝过来的)文件,移动到.ssh目录下

$ mv authorized_keys ~/.ssh

然后将此Slave配置在其他的从属节点上也操作一遍

验证是否配置成功,

$ ssh P-02

执行上述命令,用ssh命令连接任意一台从属节点,若登陆成功,且无需输入密码,则配置成功!
(使用exit命令,从远程节点退回到本地计算机)



三. Hadoop HDFS 安装与配置

注意: 每个结点的安装和配置是相同的,在实际工作中,通常在Master节点上完成安装和配置,然后将安装目录复制到其他的节点即可.(这里的所有操作是root权限)


1. 下载解压安装 Hadoop

推荐在 archive.apache.org中下载 新手下载稳定版本使用.

# wget https://archive.apache.org/dist/hadoop/core/stable/hadoop-2.9.1.tar.gz
// 这里我们把它解压到用户目录下面
  
# tar -zxvf hadoop-2.9.1.tar.gz -C ~/
// 解压成功后,系统则在用户目录下面自动创建Hadoop-2.9.1子目录,此为Hadoop的安装目录
2. 配置 Hadoop 环境变量

Hadoop 的环境变量文件是 hadoop-env.sh, 它在hadoop安装目录的子目录中,我们只需要修改该文件的JDK路径即可

# vi /home/dlyw/hadoop-2.9.1/etc/hadoop/hadoop-env.sh 
    
在文件的前面找到" export JAVA_HOME=${JAVA_HOME} " ,该行代码;
    
将 ${JAVA_HOME}**实际的jdk路径**替换,保存,退出即可
3. 配置 Yarn 环境变量

Yarn 的环境变量文件是 Yarn-env.sh, 它也在hadoop安装目录的子目录中,我们只需要修改该文件的JDK路径即可

# vi /home/dlyw/hadoop-2.9.1/etc/hadoop/yarn-env.sh 

// 在文件的前面找到" export JAVA_HOME=/home/y/libexec/jdk1.6.0/ " ,该行代码;
    
// 将 /home/y/libexec/jdk1.6.0/ 用**实际的jdk路径**替换,保存,退出即可
4. 配置核心组件文件

Hadoop的核心组件文件是 core-site.xml,也位于hadoop安装目录的子目录中,编辑该文件

# vi /home/dlyw/hadoop-2.9.1/etc/hadoop/core-site.xml

//需要将下面的配置代码放在文件的<configuration>和\</configuration>之间
<property>
	<name>fs.defaultFS</name>
        <value>hdfs://H-01:9000</value>
</property>
<property>
	<name>hadoop.tmp.dir</name>
        <value>/home/dlyw/hadoopdata</value>
</property>

编辑完毕,保存退出

5. 配置文件系统

Hadoop的文件系统配置文件是 hdfs-site.xml,也位于hadoop安装目录的子目录中,编辑该文件

# vi /home/dlyw/hadoop-2.9.1/etc/hadoop/hdfs-site.xml

// 需要将下面的配置代码放在文件的<configuration>和</configuration>之间
<property>
	<name>dfs.replication</name>
        <value>1</value>
</property>

编辑完毕,保存退出

6. 配置yarn-site.xml文件

Yarn的站点配置文件是 yarn-site.xml,也位于hadoop安装目录的子目录中,编辑该文件

# vi /home/dlyw/hadoop-2.9.1/etc/hadoop/yarn-site.xml

// 需要将下面的配置代码放在文件的<configuration>和</configuration>之间
	
 <property>
     <name>yarn.nodemanager.aux-services</name>
     <value>mapreduce_shuffle</value>
 </property>

 <property>
     <name>yarn.resourcemanager.address</name>
     <value>H-01:18040</value>
 </property>

 <property>
     <name>yarn.resourcemanager.scheduler.address</name>
     <value>H-01:18030</value>
 </property>
 
 <property>
     <name>yarn.resourcemanager.resource-tracker.address</name>
     <value>H-01:18025</value>
 </property>

 <property>
     <name>yarn.resourcemanager.admin.address</name>
     <value>H-01:18141</value>
 </property>

 <property>
     <name>yarn.resourcemanager.webapp.address</name>
     <value>H-01:18088</value>
 </property>

编辑完毕,保存退出

7. 配置MapReduce计算框架文件

在~/hadoop-2.9.1/etc/hadoop子目录下,系统已有一个mapred-site.xml.template文件,我们需要将其复制并改名,位置不变

$ cp /home/dlyw/hadoop-2.9.1/etc/hadoop/mapred-site.xml.template /home/hadoop-2.9.1/etc/hadoop/mapred-site.xml
    
// 然后编辑mapred-site.xml文件
    
$ vi /home//hadoop-2.9.1/etc/hadoop/mapred-site.xml

// 需要将下面的代码填充到文件的<configuration>和</configuration>中
    
<property>
	<name>mapreduce.framework.name</name>
    <value>yarn</value>
</property>

编辑完成,保存退出.

8. 配置Master的slaves文件

slaves 文件给出Hadoop集群的slavae节点列表.该文件十分重要,启动时系统总是根据当前slaves文件中的slave节点列表启动集群,不在列表中的slave节点便不会视为计算节点

编辑 slaves 文件

$ vi /home/dlyw/hadoop-2.9.1/etc/hadoop/slaves
    
// 删除文件中原来有的缺省的localhost,然后添加计划投入使用的集群主机,如输入以下代码
  
P-01
P-02
P-03

编辑完成,保存退出.

9. 复制 Master 上的 Hadoop 到 Slave 节点

通过负责 Master 节点上的 Hadoop,能大大提高系统部署效率,使用如下命令

$ scp -r /home/dlyw/hadoop-2.9.1 dlyw@P-01:~/
$ scp -r /home/dlyw/hadoop-2.9.1 dlyw@P-02:~/
$ scp -r /home/dlyw/hadoop-2.9.1 dlyw@P-03:~/

注意: 由于我们前面已经配置了免密钥登陆,因此这里不会有密码输入认证,回车后就开始复制

这样,我们就完成了 Hadoop 集群的安装和配置!


四. Hadoop 集群的启动

在首次启动hadoop之前,还需要做一些配置


1. 配置操作系统环境变量

由于我们是在Linux集群上安装的 Hadoop 集群,自然需要配置 Linux 系统平台的环境变量.(需要在集群的所有计算机上进行,以普通用户身份)

进入用户目录,编辑 .bash_profile 文件

 $ vi ~/.bash_profile
 
 // 将下述代码追加到文件的尾部
 
 # hadoop
 export HADOOP_HOME=/home/dlyw/hadoop-2.9.1
 export PATH=$HADOOP_HOME/bin:$HADOOP_HOME/sbin:$PATH

保存退出,执行 ’ source ~/.bash_profile’ 命令,使上述配置生效

其他节点,也需进行上述配置.

2. 创建Hadoop数据目录

可在用户主目录下,创建数据目录

$ mkdir /home/dlyw/hadoopdata

这里的数据目录名 ‘hadoopdata’ 需要和前面 Hadoop 核心组件文件 core-site.xml中的配置中的数据目录名保持一致.

其他所有节点也需进行上述配置

3. 格式化文件系统

该操作只需要 Master 节点上进行,命令如下

 $ hdfs namenode -format
4. 启动和关闭 Hadoop

进入 Hadoop 安装主目录, 然后执行 sbin/start-all.sh 命令推荐使用 start-dfs.sh 和 start-yarn.sh开启hadoop集群

按照提示输入,即可启动Hadoop.

要关闭 Hadoop 集群, 可以使用 stop-all.sh 命令

下次启动 Hadoop 时, 无需 Nameode的初始化, 只需要 使用 start-dfs.sh,然后使用 start-yarn.sh 启动 yarn 即可.

5. 验证 Hadoop 是否启动成功

用户在 终端 执行 jps 命令查看Hadoop是否启动成功

在Master节点, 如果显示 SecondaryNameNode, ResourceManager, Jps 和 NameNode ,则说明启动成功

在Slave节点, 如果显示 NodeManager, Jps 和 DateNode 三个进程,则说明从节点启动成功.

也可使用Web界面查看系统状况,在 Master 节点的浏览器中输入 http://H-01:9000 ,查看.

或输入 http://H-01:18088 查看yarn的运行状况

(主机名和端口号都以配置时的数值为准)

[零基础]用docker搭建Hadoop集群 [零基础]用docker搭建Hadoop集群,每一步都有详细的解释! 阅读详情

相关推荐

Linux中Hadoop 集群搭建

零、下载Hadoop: http://archive.cloudera.com/cdh5/cdh/5/?tdsourcetag=s_pctim_aiomsg 一、集群规划: 搭建hadoop 集群由 3 台服务器组成,分别叫做 master,salve1 和 slave2。其中 master 作为主节点,slave1 和 slave2 作为从节点。 二、网络配置: 1.查看 3 个节点的主机名...

白墨的小白博客 3964

Hadoop集群搭建(全网最详细,看了就会)

Hadoop是Apache旗下的一个用java语言实现开源软件框架,是一个开发和运行处理大规模数据的软件平台。允许使用简单的编程模型在大量计算机集群上对大型数据集进行分布式处理。在搭建之前请一定要确保Hadoop集群搭建的前置准备已经完成,详细内容可以参考我的这篇文章。Hadoop安装包链接:https://pan.baidu.com/s/12R1q8ygEnosP9pVbX5rvxg提取码:LZZY。

m0_74343117的博客 4800

Hadoop高可用集群,基于Zookeeper集群详细搭建流程!

上次给大家讲过搭建hadoop高可用集群的具体思路,今天就开始正式根据思路搭建搭建前准备 1.官方地址:http://hadoop.apache.org/ 2.HDFS 高可用集群规划,请保证 Hadoop 完全分布式和 ZooKeeper 完全分布式环境已经安装完成,以3台机为例。 3.先在一台机hadoop2上配置文件信息 进入文件夹下的配置文件目录下 cd /opt/soft/hadoop260/etc/hadoop/ 3.在 hadoop2 配置 core-site.xml vi core-si

zp17834994071的博客 2400

Hadoop搭建集群

Hadoop集群部署是为了实现分布式存储和计算,提高大数据处理的效率和性能。1.确定集群规模和硬件资源,选择合适的操作系统和Hadoop版本,进行网络配置,确保集群内各节点之间可以互相通信。2.设置各节点的环境变量,安装和配置Java环境以及其他必要的软件和工具。3.配置Hadoop的核心组件(如HDFS和YARN)和各节点角色(如NameNode、DataNode、ResourceManager、NodeManager等),完成集群的部署。

m0_70405779的博客 1万+

搭建hadoop集群

搭建hadoop集群

陆卿之的博客 7504

Hadoop集群环境配置及安装配置(详细过程包含安装包)

进入到网络配置文件中。快照,是对虚拟机的当前状态进行保存,在虚拟机出现问题无法解决,可以通过返回快照,使虚拟机返回到快照拍摄状态。4.配置jdk软连接 命令:ln -s /export/servers/jdk1.8.0_361 /export/servers/jdk。3.选择克隆对象,一共有两种方式,第一种是直接克隆虚拟机的当前状态,第二种是选取虚拟机的快照,克隆指定快照的虚拟机状态。构建软连接: ln -s /export/servers/jdk/bin/java /usr/bin/java。

2202_75347029的博客 5万+

Hadoop集群简介

Hadoop集群整体概述,MapReduce,HDFS架构概述,YARN架构概述,MapReduce架构概述,HDFS、YARN、MapReduce三者关系,大数据技术生态体系,推荐系统项目框架

qq_52175048的博客 2458

Hadoop集群搭建 详细介绍

Hadoop集群搭建 1.发行版本 Hadoop发行版本分为开源区版和商业版,社区版是指由Apache 软件基金会维护的版本,是官方维护的版本体系。 商业版Hadoop是指由第三方商业公司在社区版Hadoop基础上进行了一些修改、整合以及各个服务组件兼容性测试而发行的版本,比较著名的有cloudera的CDH、mapR等。 我们学习的是社区版:Apache Hadoop。后续如未说明都是指Apac...

阿火 725

Hadoop集群搭建

Hadoop集群搭建 HDFS集群(分布式存储)主角色:NameNode从角色:DataNode主角色辅助角色:SecondaryNameNodeYARN集群(资源管理、调度)主角色:ResourceManager从角色:NodeManager。

藤藤菜的专栏 1934

Hadoop之——基于3台服务器搭建Hadoop3.x集群(实测完整版)

转载请注明出处:https://blog.csdn.net/l1028386804/article/details/93892479 一、 服务器规划 二、Hadoop集群环境的准备 搭建Hadoop集群环境之前,需要为搭建Hadoop集群环境做一些相关的准备工作,以达到正确安装Hadoop集群的目的。 1.添加hadoop用户身份 以root身份登录每台虚拟机服务器,在每台服务器...

冰河的专栏 9456

Hadoop入门详解以及Hadoop集群搭建

Hadoop基础知识入门详解,CentOs8搭建Hadoop集群

weixin_45236540的博客 2081

尚硅谷hadoop3.x集群配置笔记及常见错误解决方式

1.搭建集群准备工作 总体流程 准备3台客户机(关闭防火墙、静态IP、主机名称) 安装JDK 配置环境变量 安装Hadoop 配置环境变量 配置集群 单点启动 配置ssh 群起并测试集群 一、模板虚拟机的搭建 配置要求:IP地址192.168.10.100**、主机名称hadoop100、内存4G、**硬盘50G(内存硬盘大小根据电脑配置自行更改) 关于是否安装桌面:未安装桌面的版本需要要执行以下命令,用于配置工具包集合,包含ifconfig等命令以及软件...

m0_51404279的博客 6559

大数据Hadoop入门,Hadoop集群介绍,集群模式安装(Cluster mode,在VMware虚拟机集群上部署HDFS集群,,修改配置文件,应用自定义设置,配置环境变量,查看HDFS WEBUI

配置 HDFS 集群,我们主要涉及到如下文件的修改:workers : 配置从节点( DataNode )hadoop-env.sh : 配置 Hadoop 的相关环境变量core - site.xml : Hadoop 核心配置文件hdfs - site.xml : HDFS 核心配置文件这些文件均存在与。

WZY22502701的博客 906

hadoop集群

## 一、概念 Hadoop是由java语言编写的,在分布式服务器集群上存储海量数据并运行分布式分析应用的开源框架,其核心部件是HDFS与MapReduce。HDFS是一个分布式文件系统,类似mogilefs,但又不同于mogilefs,hdfs由存放文件元数据信息的namenode和存放数据的服务器datanode组成;hdfs它不同于mogilefs,hdfs把元数据信息放在内存中,而mogilefs把元数据放在数据库中;而对于hdfs的元数据信息持久化是依靠secondary name node(第二

qq_42040129的博客 750

Hadoop集群搭建实战:超详细保姆级教程

本文深入探讨了Hadoop集群搭建过程,从理论基础到实战操作,为读者提供了一站式的指南。文章首先概述了Hadoop作为大数据处理框架的重要性,并简要介绍了其分布式存储(HDFS)和分布式计算(MapReduce)两大核心组件。随后,详细阐述了Hadoop集群搭建前的准备工作,包括环境规划、硬件选型、软件版本选择以及网络配置等关键步骤。 在搭建过程中,文章以实战为导向,逐步讲解了Hadoop集群的安装与配置,包括JDK环境配置、Hadoop安装包的下载与解压、配置文件(如core-site.xml、hdf

博客虽小,世界尽在其中 1万+

Hadoop 集群部署与配置详解

本文详细介绍Hadoop 集群的部署与配置过程,包括 JDK 解压与安装、IP 映射配置、环境变量配置、Hadoop 解压与安装、核心文件配置、目录创建、NameNode 初始化、集群启动以及安装验证等步骤。通过按照本文的步骤操作,可以成功搭建一个基础的 Hadoop 集群,为后续的大数据处理和分析奠定基础。在实际部署过程中,可能还需要根据具体的硬件环境和业务需求进行进一步的优化和调整。

a1199a的博客 2101

Hadoop三大核心组件——HDFS、YARN、MapReduce原理解析

Hadoop 文章目录Hadoop一、 简介二、工作原理1.HDFS原理组成介绍执行流程图2.YARN原理组成介绍执行流程图3.MapReduce原理什么是MapReduce完整工作流程图流程详细描述MapTask流程Shuffle流程Reduce Task流程总结 一、 简介 Hadoop主要在分布式环境下集群机器,获取海量数据的处理能力,实现分布式集群下的大数据存储和计算。 其中三大核心组件: HDFS存储分布式文件存储、YARN分布式资源管理、MapReduce分布式计算。 二、工作原理 1.HD

笑里笑外~ 1万+
上一篇: 掌握socket网络编程需要学习哪些基础知识
下一篇: Nodejs 快速入门教程
D-lyw
博客等级 码龄10年 57粉丝 12原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值