手把手教你:Linux云服务器Hadoop安装配置全攻略
作为大数据处理的核心框架,Hadoop在云计算环境中的部署正成为企业标配。本文将用实操演示+原理图解的方式,带你完成从零开始的Hadoop集群搭建旅程。
一、环境准备阶段
首先确保你的云服务器满足以下条件:
- Linux系统(推荐CentOS 7+或Ubuntu 18.04+)
- 至少4GB内存(生产环境建议8GB+)
- Java 8运行环境(OpenJDK或Oracle JDK)
# 检查Java版本
java -version
# 若未安装可使用yum安装
sudo yum install java-1.8.0-openjdk-devel
二、Hadoop安装四部曲
1. 用户与权限配置
为Hadoop创建专用用户组能有效隔离权限:
sudo groupadd hadoop
sudo useradd -g hadoop hduser
sudo passwd hduser
2. SSH免密登录配置
集群节点间通信的关键步骤:
su - hduser
ssh-keygen -t rsa
cat ~/.ssh/id_rsa.pub >> ~/.ssh/authorized_keys
chmod 600 ~/.ssh/authorized_keys
3. Hadoop二进制包安装
以Hadoop 3.3.4为例:
wget https://archive.apache.org/dist/hadoop/common/hadoop-3.3.4/hadoop-3.3.4.tar.gz
tar -xzvf hadoop-3.3.4.tar.gz -C /usr/local/
mv /usr/local/hadoop-3.3.4 /usr/local/hadoop
4. 环境变量配置
编辑~/.bashrc文件添加:
export HADOOP_HOME=/usr/local/hadoop
export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin
export HADOOP_CONF_DIR=$HADOOP_HOME/etc/hadoop
三、核心配置文件精讲
1. hadoop-env.sh
设置Java环境路径:
export JAVA_HOME=/usr/lib/jvm/java-1.8.0
2. core-site.xml
fs.defaultFS
hdfs://your-server-ip:9000
3. hdfs-site.xml
dfs.replication
1
四、集群启动与验证
1. 格式化HDFS
hdfs namenode -format
2. 启动服务
start-dfs.sh
start-yarn.sh
3. 验证服务
通过jps命令查看进程:
jps
# 应看到NameNode/DataNode/ResourceManager等进程
浏览器访问:http://your-server-ip:9870 查看HDFS状态
五、常见问题排错指南
- 端口冲突:检查50070/8088等端口占用情况
- 权限错误:确保hduser对/usr/local/hadoop有读写权限
- 启动失败:查看logs目录下对应日志文件
六、后续优化建议
完成基础部署后,建议:
- 配置多节点集群
- 设置HDFS副本策略
- 调整YARN资源分配参数
- 集成Kerberos安全认证
