• 08 spark 集群搭建


    前言

    呵呵 最近有一系列环境搭建的相关需求

    记录一下

    spark 三个节点 : 192.168.110.150, 192.168.110.151, 192.168.110.152

    150 为 master, 151 为 slave01, 152 为 slave02

    三台机器都做了 trusted shell

    spark 版本是 spark-3.2.1-bin-hadoop2.7 

    spark 集群搭建

    spark 三个节点 : 192.168.110.150, 192.168.110.151, 192.168.110.152

    1. 基础环境准备

    192.168.110.150, 192.168.110.151, 192.168.110.152 上面安装 jdk, 上传 spark 的安装包

    安装包来自于 Downloads | Apache Spark

    2. spark 配置调整

    复制如下 三个配置文件, 进行调整, 调整了之后 scp 到 slave01, slave02 上面 

    1. root@master:/usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7# cp conf/spark-defaults.conf.template conf/spark-defaults.conf
    2. root@master:/usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7# cp conf/spark-env.sh.template conf/spark-env.sh
    3. root@master:/usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7# cp conf/workers.template conf/workers

    更新 workers

    1. # A Spark Worker will be started on each of the machines listed below.
    2. slave01
    3. slave02

    更新 spark-defaults.conf

    1. spark.master spark://master:7077
    2. # spark.eventLog.enabled true
    3. # spark.eventLog.dir hdfs://namenode:8021/directory
    4. spark.serializer org.apache.spark.serializer.KryoSerializer
    5. spark.driver.memory 1g
    6. # spark.executor.extraJavaOptions -XX:+PrintGCDetails -Dkey=value -Dnumbers="one two three"

    更新 spark-env.sh 

    1. export JAVA_HOME=/usr/local/ProgramFiles/jdk1.8.0_291
    2. export HADOOP_HOME=/usr/local/ProgramFiles/hadoop-2.10.1
    3. export HADOOP_CONF_DIR=/usr/local/ProgramFiles/hadoop-2.10.1/etc/hadoop
    4. export SPARK_DIST_CLASSPATH=$(/usr/local/ProgramFiles/hadoop-2.10.1/bin/hadoop classpath)
    5. export SPARK_MASTER_HOST=master
    6. export SPARK_MASTER_PORT=7077

    3. 启动集群 

    master 所在的机器执行 start-all.sh 

    1. root@master:/usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7# ./sbin/start-all.sh
    2. starting org.apache.spark.deploy.master.Master, logging to /usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7/logs/spark-root-org.apache.spark.deploy.master.Master-1-master.out
    3. slave01: starting org.apache.spark.deploy.worker.Worker, logging to /usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7/logs/spark-root-org.apache.spark.deploy.worker.Worker-1-slave01.out
    4. slave02: starting org.apache.spark.deploy.worker.Worker, logging to /usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7/logs/spark-root-org.apache.spark.deploy.worker.Worker-1-slave02.out
    5. root@master:/usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7#

    测试集群

    使用 spark-submit 提交 SparkPI 迭代 1000 次

    spark-submit --class org.apache.spark.examples.SparkPi /usr/local/ProgramFiles/spark-3.2.1-bin-hadoop2.7/examples/jars/spark-examples_2.12-3.2.1.jar 1000

    java driver 提交 spark 任务 

    spark web ui 监控页面

  • 相关阅读:
    C++ Primer Plus第十三章编程练习答案
    【前端】HTTP相关知识总结
    关于 GridBagLayout 的布局问题
    关于 obdeploy 部署脚本中的 Oceanbase 相关密码的理解
    【Proteus仿真】【Arduino单片机】LCD1602-IIC液晶显示
    轻量级3D STEP STL 格式处理 SDK 之CAD DLL C++ Crack
    【笔试刷题训练】day_15
    悬浮波导SiO2薄膜的应力和折射率控制
    2.3 如何使用FlinkSQL读取&写入到JDBC(MySQL)
    Java基础逻辑面试题
  • 原文地址:https://blog.csdn.net/u011039332/article/details/124900140