Spark集群无法停止的原因分析和解决（Hadoop集群也有这个问题）

今天想停止spark集群，发现执行stop-all.sh的时候spark的相关进程都无法停止。提示：

no org.apache.spark.deploy.master.Master to stop

no org.apache.spark.deploy.worker.Worker to stop

上网查了一些资料，再翻看了一下stop-all.sh，stop-master.sh，stop-slaves.sh，spark-daemon.sh，spark-daemons.sh等脚本，发现很有可能是由于$SPARK_PID_DIR的一个环境变量导致

1. 原因分析

我搭建的是Hadoop2.6.0+Spark1.1.0+Yarn的集群。Spark、Hadoop和Yarn的停止，都是通过一些xxx.pid文件来操作的。以spark的stop-master为例，其中停止语句如下：

Spark集群无法停止的原因分析和解决（Hadoop集群也有这个问题）

再查看spark-daemon.sh中的操作：

Spark集群无法停止的原因分析和解决（Hadoop集群也有这个问题）

$SPARK_PID_DIR中存放的pid文件中，就是要停止进程的pid。其中$SPARK_PID_DIR默认是在系统的/tmp目录：

系统每隔一段时间就会清除/tmp目录下的内容。到/tmp下查看一下，果然没有相关进程的pid文件了。这才导致了stop-all.sh无法停止集群。

2. 停止Spark集群

jps 暂时可以先kill掉这个进程（慎用，可能会造成文件损坏）

3.根治方案

要根治这个问题，只需要在集群所有节点都设置$SPARK_PID_DIR， $HADOOP_PID_DIR和$YARN_PID_DIR即可。

hadoop中：

修改hadoop-env.sh，增加：

export HADOOP_PID_DIR=/home/ap/cdahdp/app/pids

修改yarn-env.sh，增加：

export YARN_PID_DIR=/home/ap/cdahdp/app/pids

spark中：

修改spark-env.sh，增加：

export SPARK_PID_DIR=/home/ap/cdahdp/app/pids

启动集群以后，查看/home/ap/cdahdp/app/pids目录，如下：

Spark集群无法停止的原因分析和解决（Hadoop集群也有这个问题）

此时，这个问题就已经从根本上解决了，搭建集群的时候一定要注意