【问题解决】Spark集群，通过master节点执行start-all.sh启动slave报错

最新推荐文章于 2023-11-28 23:28:07 发布

原创最新推荐文章于 2023-11-28 23:28:07 发布 · 6.6k 阅读

10 ·

CC 4.0 BY-SA版权

文章标签：

#Spark #大数据

问题解决同时被 2 个专栏收录

5 篇文章

订阅专栏

大数据

3 篇文章

订阅专栏

本文记录了一次Spark集群部署过程中遇到的问题：通过master节点使用start-all.sh脚本启动集群时出现路径错误及连接失败的情况。分析了问题原因在于不同节点间Spark安装路径不一致及主机名解析问题，并给出了相应的解决办法。

Spark集群，通过master节点执行start-all.sh启动slave报错：./sbin/start-all.sh

所以最初我搭建完Spark集群后，一直是分别执行master和各slave的脚本来进行启动的：

启动master：

./sbin/start-master.sh -h 192.168.3.207 --host 192.168.3.207

启动slave：

/sbin/start-slave.sh spark://192.168.3.207:7077

而且各操作都是在各自的机器上。

今天同事说正常应该是直接通过master节点，直接start-all就可以启动所有节点。

我在master启动全部时，报错如下：

$ ../sbin/start-all.sh
starting org.apache.spark.deploy.master.Master, logging to /home/ubutnu/spark_2_2_1/logs/spark-ubutnu-org.apache.spark.deploy.master.Master-1-ubutnu-Super-Server.out
192.168.3.104: bash: 第 0 行: cd: /home/ubutnu/spark_2_2_1: 没有那个文件或目录
192.168.3.104: bash: /home/ubutnu/spark_2_2_1/sbin/start-slave.sh: 没有那个文件或目录
192.168.3.102: bash: 第 0 行: cd: /home/ubutnu/spark_2_2_1: 没有那个文件或目录
192.168.3.102: bash: /home/ubutnu/spark_2_2_1/sbin/start-slave.sh: 没有那个文件或目录

关键点：路径找不到，是192.168.3.102和104报的。因为master机器只配了各slave的ip，并不知道他们的spark安装路径，所以我猜测master是按本机的路径去调，但可惜spark在另外两台的目录和master并不一样，因此就找不到指定的路径了。

解决办法：将所有slave机器的spark路径改成和master一致，便可解决。

$ ./start-all.sh 
starting org.apache.spark.deploy.master.Master, logging to /home/ubutnu/spark_2_2_1/logs/spark-ubutnu-org.apache.spark.deploy.master.Master-1-ubutnu-Super-Server.out
192.168.3.104: starting org.apache.spark.deploy.worker.Worker, logging to /home/ubutnu/spark_2_2_1/logs/spark-he-org.apache.spark.deploy.worker.Worker-1-he-V660.out
192.168.3.102: starting org.apache.spark.deploy.worker.Worker, logging to /home/ubutnu/spark_2_2_1/logs/spark-he-org.apache.spark.deploy.worker.Worker-1-he-200.out

但是打开webui页面，URL仍然是带主机名的：URL: spark://ubutnu-Super-Server:7077

而且worker机器报错：

18/04/17 17:03:33 INFO Worker: Spark home: /home/ubutnu/spark_2_2_1
18/04/17 17:03:33 INFO Utils: Successfully started service 'WorkerUI' on port 8081.
18/04/17 17:03:33 INFO WorkerWebUI: Bound WorkerWebUI to 192.168.3.102, and started at http://192.168.3.102:8081
18/04/17 17:03:33 INFO Worker: Connecting to master ubutnu-Super-Server:7077...
18/04/17 17:03:38 WARN TransportClientFactory: DNS resolution for ubutnu-Super-Server:7077 took 5028 ms
18/04/17 17:03:38 WARN Worker: Failed to connect to master ubutnu-Super-Server:7077
Caused by: java.io.IOException: Failed to connect to ubutnu-Super-Server:7077

解决办法：将master和slave各机器的conf/spark-env.sh加上：