售前咨询400-838-0503

如何在Linux云服务器上安装和配置Spark?

发布:2025-04-08 15:33

一站式指南:在Linux云服务器上安装和配置Spark集群

Apache Spark作为当前最流行的大数据处理框架之一,其分布式计算能力深受企业青睐。本文将手把手教您在Linux云服务器上完成Spark从安装到配置的全过程,无论您是数据分析师、运维工程师还是大数据爱好者,都能轻松掌握。

一、环境准备阶段

1.1 服务器规格选择

建议配置至少:

  • 4核CPU
  • 8GB内存
  • 50GB存储空间

1.2 系统环境要求

支持的主流Linux发行版:

  1. Ubuntu 18.04/20.04 LTS
  2. CentOS 7/8
  3. Amazon Linux 2

需预先安装Java 8或11:

sudo apt update
sudo apt install openjdk-11-jdk

二、Spark安装详细步骤

2.1 下载Spark安装包

访问官网下载页选择:

  • 最新稳定版本(当前为3.3.1)
  • Package type选择"Pre-built for Apache Hadoop 3.3"

2.2 解压与目录配置

tar -xzf spark-3.3.1-bin-hadoop3.tgz
sudo mv spark-3.3.1-bin-hadoop3 /opt/spark

2.3 环境变量设置

编辑~/.bashrc文件:

export SPARK_HOME=/opt/spark
export PATH=$PATH:$SPARK_HOME/bin

三、集群配置详解

3.1 单机模式配置

修改$SPARK_HOME/conf/spark-env.sh:

export SPARK_MASTER_HOST=your_server_ip
export SPARK_WORKER_CORES=4
export SPARK_WORKER_MEMORY=4g

3.2 分布式集群配置

在conf/workers文件中添加:

worker1
worker2
worker3

3.3 安全配置建议

  • 配置SSH免密登录
  • 设置防火墙规则
  • 启用Spark UI认证

四、验证与测试

4.1 启动Spark服务

$SPARK_HOME/sbin/start-all.sh

4.2 运行测试案例

spark-submit --class org.apache.spark.examples.SparkPi \
--master spark://master:7077 \
$SPARK_HOME/examples/jars/spark-examples_2.12-3.3.1.jar 100

4.3 Web UI访问

通过浏览器访问:http://your_server_ip:8080

五、常见问题解决方案

问题现象 可能原因 解决方案
Worker节点无法连接Master 防火墙阻止或网络配置错误 检查端口7077,8080是否开放
内存不足错误 任务分配内存过大 调整spark.executor.memory参数

通过以上步骤,您已成功在Linux云服务器上搭建了Spark环境。建议定期检查Spark官方文档获取最新安全补丁和功能更新,保持集群的最佳性能状态。

按文档操作后还是不行,把机器编号、出问题的时间点和现象截图一起提工单,能少来回一轮。

提交工单