Linux云服务器上Hadoop集群配置全攻略
在大数据时代,Hadoop作为分布式计算框架的核心组件,其配置过程常常让初学者望而生畏。本文将手把手教你如何在Linux云服务器上完成Hadoop集群的完整配置,涵盖从环境准备到集群测试的全流程。
一、环境准备
1.1 服务器规格选择
推荐配置至少3台云服务器组成集群:
- 主节点:4核8GB内存(NameNode+ResourceManager)
- 从节点:2-4核4-8GB内存(DataNode+NodeManager)x2
提示:阿里云/腾讯云的通用型实例即可满足学习需求
1.2 系统环境配置
# 更新系统
sudo apt-get update && sudo apt-get upgrade -y
# 安装必备工具
sudo apt-get install -y ssh pdsh openjdk-8-jdk
二、SSH免密登录配置
集群节点间的SSH免密登录是Hadoop正常工作的基础:
2.1 生成密钥对
ssh-keygen -t rsa -P '' -f ~/.ssh/id_rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
2.2 分发公钥到所有节点
scp ~/.ssh/id_rsa.pub user@slave1:~/.ssh/authorized_keys
scp ~/.ssh/id_rsa.pub user@slave2:~/.ssh/authorized_keys
注意:确保所有节点的~/.ssh目录权限为700
三、Hadoop安装与配置
3.1 下载与解压
wget https://archive.apache.org/dist/hadoop/core/hadoop-3.3.4/hadoop-3.3.4.tar.gz
tar -xzvf hadoop-3.3.4.tar.gz -C /opt/
mv /opt/hadoop-3.3.4 /opt/hadoop
3.2 环境变量配置
编辑~/.bashrc文件:
export HADOOP_HOME=/opt/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
3.3 核心配置文件修改
需要配置的5个核心文件:
- hadoop-env.sh:设置JAVA_HOME
- core-site.xml:配置HDFS地址
- hdfs-site.xml:配置副本数等参数
- mapred-site.xml:配置YARN作为资源调度器
- yarn-site.xml:配置NodeManager资源
四、集群启动与验证
4.1 格式化HDFS
hdfs namenode -format
4.2 启动集群
start-dfs.sh
start-yarn.sh
4.3 验证服务状态
jps # 检查Java进程
hdfs dfsadmin -report # 查看HDFS状态
yarn node -list # 查看YARN节点
4.4 运行测试任务
hadoop jar $HADOOP_HOME/share/hadoop/mapreduce/hadoop-mapreduce-examples-*.jar pi 16 1000
五、常见问题排查
- 节点无法通信:检查防火墙设置和/etc/hosts文件
- 磁盘空间不足:调整hdfs-site.xml中的dfs.datanode.data.dir
- 内存溢出:修改yarn-site.xml中的资源分配参数
- 权限问题:确保所有节点使用相同用户操作
通过以上步骤,您已成功在Linux云服务器上搭建了Hadoop集群。建议在生产环境中:
- 配置ZooKeeper实现高可用
- 设置监控告警系统
- 定期进行数据备份
大数据之旅刚刚开始,下一步可以探索Hive、Spark等生态组件的集成使用。
