Hadoop集群搭建和配置

Hadoop集群搭建,巨详细的过程,一步步来必成 查看/etc/sysconfig/network-scripts/ifcfg-ens33配置文件的内容。不同于Windows系统采用菜单方式修改网络配置,Linux系统的网络配置参数是写在配置文件里的,ifcfg-ens33是CentOS 7.8版本的Linux系统中的网络配置文件,可以设置IP地址、子网掩码等网络配置信息。 阅读详情

一:认识Hadoop

1:基本介绍

Hadoop是一个由Apache基金会所开发的分布式系统基础架构,它允许用户在不了解分布式底层细节的情况下,开发分布式程序,并充分利用集群的威力进行高速运算和存储。Hadoop起源于Apache Nutch项目,该项目是Apache Lucene的子项目之一。Hadoop的命名来源于其创始人Doug Cutting儿子的玩具大象。

2:优点及用途

Hadoop的优点包括高可靠性、高扩展性、高效性、高容错性和低成本。Hadoop还具有高可扩展性,可以方便地将数据计算任务分配到更多的计算机上进行处理。此外,Hadoop还具有低成本的特点,因为它依赖于社区服务,使得任何人都可以使用。

Hadoop的用途非常广泛,包括数据清洗、ETL和批处理分析等任务,大数据存储,实时数据处理,数据仓库和商业智能,日志和事件处理,机器学习和人工智能,以及图计算等。

3:需要安装VMware Workstation 17 Player并配置虚拟机及克隆并用到MobaXterm

 1:查看ip地址的起始和结束地址

 

2:修改网络配置文件

①vi /etc/sysconfig/network-scripts/ifcfg-ens33

mac地址为2步骤的enter值
ip地址参照4步骤自行选择(必须在起始和结束的范围内)
子网掩码默认设置为255.255.255.0
网关的值为将ip地址中最后一段的值改为2
DNS使用谷歌提供的免费dns1:8.8.8.8

二:设置SSH无密码登录节点 

执行命令在本机生成公钥、私钥和验证文件

ssh-keygen -t rsa

执行命令将登录信息复制到验证文件

ssh-copy-id md1   # master为主机名
ssh-copy-id md2   # master为主机名
ssh-copy-id md3   # master为主机名
注:这里免密登录配置和上面一样,虚拟机相互之间都要执行ssh-copy-id这个命令
————————————————

                            版权声明:本文为博主原创文章,遵循 CC 4.0 BY-SA 版权协议,转载请附上原文出处链接和本声明。
                        
原文链接:https://blog.csdn.net/JunLeon/article/details/120505585

三集群搭建和配置

1:分布式集群的网络和节点规划

主机名ip地主节点类型
master192.168.255.66master
md1192.168.255.67md1
md2192.168.255.68md2
md3192.168.255.69md3

2:节点规划

服务mastermd1md2md3
jps****
Secondary NameNode*
NodeManager***
DataNode****

3:设置主机名和IP的映射

使用:vi /etc/hostsj进入/etc/hosts文件编辑,如下图

4:防火墙

systemctl status firewalld #查看防火墙状态(active(running)表示防火墙在启动状态)

systemctl stop firewalld #关闭防火墙 (inactive(dead)表示已经关闭防火墙了)

systemctl is-enabled firewalld #查看防火墙是否开机自启(enabled:表示开机自启;disabled:表示开机不自启)

三:Hadoop配置

1:安装Java和hadoop并配置环境变量

安装好就要配置/my_env.sh

java的;在/etc/profile.d下创建一个my_env.sh,进行配置JAVA环境变量,命令:vi /etc/profile.d/my_env.sh;同理Hadoop也是一样

Java

Hadoop:

2:配置分布式集群环境

环境变量配置文件:hadoop-env.sh、yarn-env.sh、mapred-env.sh

全局核心配置文件:core-site.xml

HDFS配置文件:hdfs-site.xml

YARN配置文件:yarn-site.xml

1:vi  etc/core-site.xml

<configuration>
        <property>
                <name>fs.defaultFS</name>
                <value>hdfs://master:8020</value>
            </property>
        <property>
                <name>hadoop.tmp.dir</name>
                <value>/var/log/hadoop/tmp</value>
        </property>
</configuration>

2:vi /hadoop-env.sh进入文件添加以下部分export JAVA_HOME=/opt/jdk1.8.0_221,修改yarn-env.sh文件,在底部添加以下部分export JAVA_HOME=/opt/jdk1.8.0_221

3:vi /mapred-site.xml进入文件,添加以下代码

<configuration>
        <property>
                <name>mapreduce.framework.name</name>
                <value>yarn</value>
        </property>

        <property>
                <name>mapreduce.jobhistory.address</name>
                <value>master:10020</value>
        </property>
        <property>
                <name>mapreduce.jobhistory.webapp.address</name>
                <value>master:19888</value>
        </property>

        <property>
                <name>yarn.app.mapreduce.am.env</name>
                <value>HADOOP_MAPRED_HOME=${HADOOP_HOME}</value>
        </property>
        <property>
                <name>mapreduce.map.env</name>
                <value>HADOOP_MAPRED_HOME=${HADOOP_HOME}</value>
        </property>
        <property>
                <name>mapreduce.reduce.env</name>
                <value>HADOOP_MAPRED_HOME=${HADOOP_HOME}</value>
        </property>
</configuration>

4:vi /yarn-site.xml进入文件添加

<configuration>

<!-- Site specific YARN configuration properties -->

        <property>
                <name>yarn.resourcemanager.hostname</name>
                <value>master</value>
        </property>
        <property>
                <name>yarn.resourcemanager.address</name>
                <value>${yarn.resourcemanager.hostname}:8032</value>
        </property>
        <property>
                <name>yarn.resourcemanager.scheduler.address</name>
                <value>${yarn.resourcemanager.hostname}:8030</value>
        </property>
        <property>
                <name>yarn.resourcemanager.webapp.address</name>
                <value>${yarn.resourcemanager.hostname}:8088</value>
        </property>
        <property>
                <name>yarn.resourcemanager.webapp.https.address</name>
                <value>${yarn.resourcemanager.hostname}:8090</value>
        </property>
        <property>
                <name>yarn.resourcemanager.resource-tracker.address</name>
                <value>${yarn.resourcemanager.hostname}:8031</value>
        </property>
        <property>
                <name>yarn.resourcemanager.admin.address</name>
                <value>${yarn.resourcemanager.hostname}:8033</value>
        </property>
        <property>
                <name>yarn.nodemanager.local-dirs</name>
                <value>/data/hadoop/yarn/local</value>
        </property>
        <property>
                <name>yarn.log-aggregation-enable</name>
                <value>true</value>
        </property>
        <property>
                <name>yarn.nodemanager.remote-app-log-dir</name>
                <value>/data/tmp/logs</value>
        </property>
        <property>
                <name>yarn.log.server.url</name>
                <value>http:///master:19888/jobhistory/logs</value>
                <description>URL for job history server</description>
        </property>
        <property>
                <name>yarn.nodemanager.vmem-check-enabled</name>
                <value>false</value>
        </property>
        <property>
                <name>yarn.nodemanager.aux-services</name>
                <value>mapreduce_shuffle</value>
       </property>
<property>
                <name>yarn.nodemanager.aux-services.mapreduce.shuffle.class</name>
                <value>org.apache.hadoop.mapred.ShuffleHandler</value>
        </property>
        <property>
                <name>yarn.nodemanager.resource.memory-mb</name>
                <value>2048</value>
        </property>
        <property>
                <name>yarn.scheduler.minimum-allocation-mb</name>
                <value>512</value>
        </property>
        <property>
                <name>yarn.scheduler.maximum-allocation-mb</name>
                <value>4096</value>
        </property>
        <property>
                <name>mapreduce.map.memory.mb</name>
                <value>2048</value>
        </property>
        <property>
                <name>mapreduce.reduce.memory.mb</name>
                <value>2048</value>
        </property>
        <property>
                <name>yarn.nodemanager.resource.cpu-vcores</name>
                <value>1</value>
        </property>
</configuration>

5:vi /workers文件

改成以下部分(这里不添加master节点,因此后面启动时候master没有datanote,其他3个子节点会有datanote)

md1

md2

md3

6:vi /hdfs-site.xml文件,添加以下代码

<configuration>
        <property>
                <name>dfs.namenode.name.dir</name>
                <value>file:///data/hadoop/hdfs/name</value>
        </property>
        <property>
                <name>dfs.datanode.data.dir</name>
                <value>file:///data/hadoop/hdfs/data</value>
        </property>
        <property>
                <name>dfs.namenode.secondary.http-address</name>
                <value>master:50090</value>
        </property>

        <property>
                <name>dfs.replication</name>
                <value>3</value>
        </property>
</configuration>

注意:1-6点进入的文件都在/usr/local/hadoop-3.1.3/etc/hadoop/路径下进入修改

7:/usr/local/hadoop-3.1.3/sbin/下进入以下文件修改并添加代码

vi /start-dfs.sh

HDFS_DATANODE_USER=root

HDFS_DATANODE_SECURE_USER=hdfs

HDFS_NAMENODE_USER=root

HDFS_SECONDARYNAMENODE_USER=root

vi /stop-dfs.sh

HDFS_DATANODE_USER=root

HDFS_DATANODE_SECURE_USER=hdfs

HDFS_NAMENODE_USER=root

HDFS_SECONDARYNAMENODE_USER=root

vi /start-yarn.sh

注意:在文件开头添加以下部分

YARN_RESOURCEMANAGER_USER=root

HADOOP_SECURE_DN_USER=yarn

YARN_NODEMANAGER_USER=root

vi /stop-yarn.sh

注意:在文件开头添加以下部分

YARN_RESOURCEMANAGER_USER=root

HADOOP_SECURE_DN_USER=yarn

YARN_NODEMANAGER_USER=root

四:配置时间同步服务

1:查看

版本命令:ntpq -c version;没有则安装命令为:yum install -y ntp

2:修改master,md1、md2、md3里的vi /etc/ntp.conf文件,用#注释掉server行并添加以下代码

restrict 192.168.0.0 mask 255.255.255.0 nomodify notrap
server 127.127.1.0
fudge 127.127.1.0 stratum 10

3:在mster、md1、md2、md3里使用以下命令

systemctl start ntpdsystemctl enable ntpd启动服务、systemctl status ntpd查看服务状态

4:在md1、md2、md3里使用以下命令

使用命令ntpdate master同步时间

五:启动和关闭Hadoop集群

1:启动集群

进入Hadoop安装目录:cd $HADOOP_HOME

start-all.sh

开启所用HDFS,不包含日志,要在单独开一次日志

sbin/start-dfs.sh

开启HDFS

sbin/start-yarn.sh

开启yarn

mapred --daemon start historyserver开启日志

2:关闭集群

进入cd $HADOOP_HOME关闭集群命令

stop-all.sh关闭所用HDFS,不包含日志,要在单独关一次日志

sbin/stop-yarn.sh

关闭HDFS

sbin/stop-dfs.sh

关闭yarn

mapred --daemon stop historyserver

关闭日志

大数据Hadoop集群 综上所述,Hadoop集群是一个强大的分布式计算平台,用于处理分析大规模的数据集。它由多个计算节点组成,通过分布式存储计算实现数据的高效处理。Hadoop是一个开源的大数据处理框架,最初由Doug CuttingMike Cafarella开发,旨在处理分析大规模的数据集。MapReduce是Hadoop的分布式计算框架,它允许程序员在不了解分布式系统底层细节的情况下,编写处理大规模数据的程序。Hadoop集群是由多台计算机(节点)组成的一个分布式计算系统,主要用于处理大规模的数据集。 阅读详情

相关推荐

Hadoop分布式集群搭建(完整版)

VMwareCentos7下载安装教程:https://blog.csdn.net/m0_59209350/article/details/117793482XShellXftp下载安装教程:https://blog.csdn.net/m0_59209350/article/details/117877235安装一台虚拟机作为模板:IP地址:192.168.10.100主机名:hadoop100内存:4G硬盘:50G对安装好的VMware进行网络配置,方便虚拟机联网,本次设置选择NAT模式,需要宿主机的

web15285868498的博客 954

Hadoop集群搭建(全网最详细,看了就会)

Hadoop是Apache旗下的一个用java语言实现开源软件框架,是一个开发运行处理大规模数据的软件平台。允许使用简单的编程模型在大量计算机集群上对大型数据集进行分布式处理。在搭建之前请一定要确保Hadoop集群搭建的前置准备已经完成,详细内容可以参考我的这篇文章。Hadoop安装包链接:https://pan.baidu.com/s/12R1q8ygEnosP9pVbX5rvxg提取码:LZZY。

m0_74343117的博客 4800

Hadoop 集群搭建配置实战指南

搭建配置 Hadoop 集群是一个涉及多个环节的复杂过程,需要仔细地进行环境准备、文件配置节点设置等步骤。通过本文的详细介绍,读者应该能够成功搭建一个基本的 Hadoop 集群,并通过简单示例验证其功能。在实际应用中,根据不同的业务需求数据规模,可以进一步优化扩展集群。希望本文能为大数据爱好者从业者在 Hadoop 集群搭建方面提供有力的帮助。如果您在搭建过程中遇到任何问题,欢迎在评论区留言,大家一起交流解决。同时,也欢迎分享您在 Hadoop 集群使用过程中的经验技巧。

Dongguazhuzhuzhu的博客 1255

Hadoop搭建集群

Hadoop集群部署是为了实现分布式存储计算,提高大数据处理的效率性能。1.确定集群规模硬件资源,选择合适的操作系统Hadoop版本,进行网络配置,确保集群内各节点之间可以互相通信。2.设置各节点的环境变量,安装配置Java环境以及其他必要的软件工具。3.配置Hadoop的核心组件(如HDFSYARN)各节点角色(如NameNode、DataNode、ResourceManager、NodeManager等),完成集群的部署。

m0_70405779的博客 1万+

Hadoop集群搭建配置教程

Hadoop3.1.3集群搭建前言集群规划集群搭建具体步骤1、下载`hadoop-3.1.3.tar.gz`2、上传并解压3、配置`path`变量4、修改配置文件4.1 修改文件`hadoop-env.sh`4.2 修改文件workers4.3 修改文件`core-site.xml`4.4 修改文件`hdfs-site.xml`4.5 修改文件`mapred-site.xml`4.6 修改文件 `yarn-site.xml`5、把`/opt/module/hadoop`复制到其他节点上6、在其他节点上操作7

笑看风云路的博客 9447

Hadoop集群搭建配置

通过以上详细的步骤,我们成功地搭建配置Hadoop 集群。在实际应用中,还可以根据具体的业务需求数据特点进一步优化集群配置,如调整资源分配策略、优化存储格式、设置数据压缩等。同时,还需要关注集群的性能监控故障排查,以确保集群能够稳定、高效地运行。希望本文能够为广大读者在 Hadoop 集群搭建配置的学习实践过程中提供全面、深入的参考帮助,让大家能够顺利地开启大数据处理的征程。

2401_84239988的博客 1756

Hadoop集群搭建(结束)——修改hadoop配置文件以及启动集群服务

(1)修改 hadoop-env.sh 文件 (2)修改 yarn-env.sh 文件 (3)修改 core-site.xml 文件 (4)修改 hdfs-site.xml 文件 (5)修改 mapred-site.xml 文件 (6)修改 yarn-site.xml 文件 (7)修改 masters 文件 (8)修改 slaves 文件

小袁同学的博客 1万+

Hadoop集群搭建配置

操作环境 1.VMware 2.CentOS6.8系统 操作步骤 创建Linux虚拟机

weixin_45152262的博客 7480

Linux系统中进行Hadoop的安装配置集群搭建Hadoop的定义作用

Hadoop的安装配置集群搭建Hadoop的定义作用 Hadoop的定义作用 hadoop是什么?Hadoop是一种分析处理大数据的软件平台,是Appach的一个用Java语言所实现的开源软件的框架,在大量计算机组成的集群当中实现了对于海量的数据进行的分布式计算。 Hadoop的框架最核心的设计就是:HDFSMapReduce。HDFS为海量的数据提供了存储,则MapReduce为海量的数据提供了计算。 HDFSHadoop Distributed File System):Hadoop

共享,共进步 1220

hadoop集群搭建以及hadoop配置

hadoop集群搭建以及hadoop配置环境说明目的配置说明准备hadoop-env.shcore-site.xmlhdfs-site.xmlyarn-site.xmlmapred-site.xmllog4j.propertiesssh 免密启动验证界面任务历史任务提交总结 环境说明目的 准备:我自己准备了三台虚拟机在windows平台上使用Hyper-V搭建虚拟机集群环境_a18792721831的博客-CSDN博客 环境如下 主机 nameNode dataNode resourceMa

a18792721831的博客 3354

Linux虚拟机中hadoop的安装配置集群搭建

文章目录Hadoop的安装配置第一步第二步第三步第四步第五步第六步集群搭建第一步第二步第三步第四步 Hadoop的安装配置 首先需要有以下安装包(如有需要,可私信邮箱地址) hadoop-2.6.0-cdh5.14.2.tar.gz hadoop-native-64-2.6.0.tar hbase-1.2.0-cdh5.14.2.tar.gz hive-1.1.0-cdh5.14.2.tar.gz zookeeper-3.4.6.tar.gz 第一步 配置免登录: ssh-keygen -t rsa

weixin_46752181的博客 1502

Hadoop集群搭建配置

通过以上步骤,可以在CentOS操作系统上成功搭建配置一个Hadoop集群搭建过程中需要注意网络配置、主机名配置、SSH免密登录配置以及Hadoop配置文件中的各项参数。测试集群时,可以运行Hadoop自带的示例程序来验证集群的工作状态。希望本文能帮助读者顺利完成Hadoop集群搭建配置

QWQ20050402的博客 640

Hadoop集群搭建配置

一、Hadoop是什么?二、Hadoop集群搭建配置1、安装方式2、设置静态IP3、远程连接虚拟机4、防火墙5、设置主机名6、设置主机名IP的映射7、安装JAVA8、安装Hadoop大数据时代下,针对大数据处理的新技术也在不断地开发运用中,并逐渐成为数据处理挖掘行业广泛使用的主流技术之一。在大数据时代,Hadoop作为处理大数据的分布式存储计算框架,在国内外大、中、小型企业中已得到了广泛应用。学习Hadoop技术是从事大数据行业工作必不可少的一步。

2203_75921162的博客 1736

原生Hadoop集群搭建配置

原生Hadoop集群在Centos7.0上的搭建

小姚的博客 1951

Hadoop集群坏境搭建配置

Hadoop集群坏境搭建配置 前言 关于时下最热的技术潮流,无疑大数据是首当其中最热的一个技术点,关于大数据的概念方法论铺天盖地的到处宣扬,但其实很多公司或者技术人员也不能详细的讲解其真正的含义或者就没找到能被落地实施的可行性方案,更有很多数据相关的项目比如弄几张报表,写几个T-SQL语句就被冠以“大数据项目”,当然了,时下热门的话题嘛,先把“大数据”帽子扣上,这样才能显示出项目的高大...

菜鸟-传奇 447

    第6篇Hadoop 集群搭建配置,提供了一个 Hadoop 集群搭建过程,展示了 Hadoop

作者:禅计算机程序设计艺术 1.简介 Apache Hadoop 是 Apache 基金会的一个开源分布式计算平台,可以实现对大数据集的存储、处理、分析实时查询等功能。其主要由 HDFSHadoop Distributed File System)、MapReduce(基于 Hadoop 分布式计

AI天才研究院 178
上一篇: Pyecharts数据可视化中数据对比类图形
下一篇: 爬取招聘网站时出现这两个问题,从是爬不出来
派大星我们去捉水母吧827
博客等级 码龄3年 78粉丝 5原创
评论 1
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值