hadoop - 自动故障转移在 Hadoop 中不起作用

标签 hadoop hdfs high-availability namenode automatic-failover

我正在尝试构建一个 3 节点集群(2 个 Namenode(nn1,nn2) 和 1 个 datanode(dn1))。使用 Namenode WEBUI,我能够看到 nn1 处于事件状态,nn2 处于备用状态。然而,当我杀死活跃的 nn1 时,备用 nn2 不会活跃。请帮助我我做错了什么或需要修改什么

nn1/etc/hosts

127.0.0.1 localhost
192.168.10.153 nn1
192.168.10.154 dn1
192.168.10.155 nn2

nn2/etc/hosts

127.0.0.1       localhost nn2
127.0.1.1       ubuntu

    # The following lines are desirable for IPv6 capable hosts
    ::1     ip6-localhost ip6-loopback
    fe00::0 ip6-localnet
    ff00::0 ip6-mcastprefix
    ff02::1 ip6-allnodes
    ff02::2 ip6-allrouters

核心网站.xml (nn1,nn2)

<configuration>
<property>
<name>fs.defaultFS</name>
<value>hdfs://192.168.10.153:8020</value>
</property>

<property>
<name>dfs.journalnode.edits.dir</name>
<value>/usr/local/hadoop/hdfs/data/jn</value>
</property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

</configuration>

hdfs-site.xml(nn1,nn2,dn1)

<property>
 <name>dfs.replication</name>
 <value>1</value>
 </property>
 <property>
 <name>dfs.permissions</name>
 <value>false</value>
 </property>
 <property>
 <name>dfs.nameservices</name>
 <value>ha-cluster</value>
 </property>
 <property>
 <name>dfs.ha.namenodes.ha-cluster</name>
 <value>nn1,nn2</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>
 <property>
 <name>dfs.namenode.rpc-address.ha-cluster.nn2</name>
 <value>192.168.10.155:9000</value>
 </property>
 <property>/usr/local/hadoop/hdfs/datanode</value>
 <name>dfs.namenode.http-address.ha-cluster.nn1</name>
 <value>192.168.10.153:50070</value>
 </property>
 <property>
 <name>dfs.namenode.http-address.ha-cluster.nn2</name>
 <value>192.168.10.155:50070</value>
 </property>
 <property>
 <name>dfs.namenode.shared.edits.dir</name>
 <value>qjournal://192.168.10.153:8485;192.168.10.155:8485;192.168.10.154:8485/ha-cluster</value>
 </property>
 <property>
 <name>dfs.client.failover.proxy.provider.ha-cluster</name>
 <value>org.apache.hadoop.hdfs.server.namenode.ha.ConfiguredFailoverProxyProvider</value>
 </property>
 <property>
 <name>dfs.ha.automatic-failover.enabled</name>
 <value>true</value>
 </property>
 <property>
 <name>ha.zookeeper.quorum</name>
 <value>192.168.10.153:2181,192.168.10.155:2181,192.168.10.154:2181</value>
 </property>

<property>
 <name>dfs.ha.fencing.methods</name>
 <value>sshfence</value>
 </property>
 <property>
 <name>dfs.ha.fencing.ssh.private-key-files</name>
 <value>/home/ci/.ssh/id_rsa</value></property></configuration>

LOGS :(zkfc nn1,nn2)(namenode nn1,nn2) 停止 nn1(事件节点) https://pastebin.com/bWvfnanQ

最佳答案

您的提及 <IP>:<port>对于 fs.defaultFScore-site.xml 中用于 HA 集群。因此,当关闭您的事件名称节点时,它不知道要重定向到哪里。

为名称服务选择逻辑名称,例如“mycluster”。

然后更改 hdfs-site.xml,dfs.namenode.http-address.[nameservice ID].[name node ID] - 每个要监听的 NameNode 的完全限定 HTTP 地址

在你的情况下,你必须给

核心站点.xml

<property>
<name>fs.defaultFS</name>
<value>hdfs://myCluster</value>
</property>

hdfs-site.xml

 <property>
 <name>dfs.namenode.rpc-address.myCluster.nn1</name>
 <value>192.168.10.153:9000</value>
 </property>

看清楚说明书https://hadoop.apache.org/docs/r2.7.2/hadoop-project-dist/hadoop-hdfs/HDFSHighAvailabilityWithQJM.html

希望对您有所帮助。

关于hadoop - 自动故障转移在 Hadoop 中不起作用,我们在Stack Overflow上找到一个类似的问题: https://stackoverflow.com/questions/43490369/

相关文章:

java - 在 HDFS 上使用 libhdfs 进行文件 i/o

mysql - HAProxy/MySQL Proxy/Mysql Router 主从复制;读写分离策略

perl - 将 Hadoop 流与 perl 结合使用以进行 map reduce

configuration - 为 Hive 中的 INSERT OVERWRITE SELECT 指定压缩编解码器

apache-spark - 使用Value Spark Java API连接数据集中的列

hadoop - 无法构建 fuse-dfs 来挂载 HDFS

hadoop - 关于 Pig 作业 Jar 文件

hadoop - 与Hadoop中的MapReduce中的 'controller'等效

kubernetes - 使用群集自动缩放器时,如何在不导致服务停机的情况下实现节点的正常终止?

linux - 保持 PC 资源始终在所有主机上运行