Linux系统下Hadoop安装与配置完整指南
在大数据时代,Hadoop作为分布式系统基础架构已经成为处理海量数据的首选工具。本文将详细介绍在Linux环境下从零开始安装和配置Hadoop的全过程,帮助您快速搭建大数据处理平台。
一、准备工作
1.1 系统要求
- 操作系统:Ubuntu 18.04/CentOS 7或更高版本
- 内存:建议8GB以上
- 存储空间:至少50GB可用空间
- Java环境:JDK 1.8+
1.2 软件下载
访问Apache官网下载最新稳定版Hadoop(当前推荐3.3.4版本):
wget https://downloads.apache.org/hadoop/common/hadoop-3.3.4/hadoop-3.3.4.tar.gz
二、安装步骤
2.1 创建专用用户
sudo adduser hadoop sudo usermod -aG sudo hadoop su - hadoop
2.2 安装Java环境
sudo apt update sudo apt install openjdk-8-jdk java -version # 验证安装
2.3 解压Hadoop
tar -xzvf hadoop-3.3.4.tar.gz sudo mv hadoop-3.3.4 /usr/local/hadoop
三、环境配置
3.1 设置环境变量
编辑~/.bashrc文件添加以下内容:
export HADOOP_HOME=/usr/local/hadoop export PATH=$PATH:$HADOOP_HOME/bin:$HADOOP_HOME/sbin export JAVA_HOME=/usr/lib/jvm/java-8-openjdk-amd64
使配置生效:
source ~/.bashrc
3.2 配置Hadoop核心文件
core-site.xml配置:
fs.defaultFS hdfs://localhost:9000
hdfs-site.xml配置:
dfs.replication 1
四、启动与验证
4.1 格式化NameNode
hdfs namenode -format
4.2 启动HDFS
start-dfs.sh
4.3 验证安装
jps # 应显示NameNode、DataNode等进程 hdfs dfs -ls / # 查看HDFS根目录
五、常见问题解决
- SSH免密登录失败:检查~/.ssh权限应为700
- 端口冲突:修改hdfs-site.xml中的默认端口
- 内存不足:调整hadoop-env.sh中的JVM参数
通过上述步骤,您已成功在Linux系统上搭建了Hadoop单机环境。要搭建完全分布式集群,只需在此基础上配置多台主机并修改相应参数即可。建议在实际生产环境中使用3-5个节点的集群配置,以获得更好的性能和可靠性。
