《Hadoop技术详解》一2.7　NameNode联盟-阿里云开发者社区

《Hadoop技术详解》一2.7　NameNode联盟

2017-05-02 1767

版权

本文内容由阿里云实名注册用户自发贡献，版权归原作者所有，阿里云开发者社区不拥有其著作权，亦不承担相应法律责任。具体规则请查看《阿里云开发者社区用户服务协议》和《阿里云开发者社区知识产权保护指引》。如果您发现本社区中有涉嫌抄袭的内容，填写侵权投诉表单进行举报，一经查实，本社区将立刻删除涉嫌侵权内容。

简介：

本节书摘来异步社区《Hadoop技术详解》一书中的第2章，第2.7节，作者：【美】Eric Sammer 译者：刘敏 , 麦耀锋 , 李冀蕾 , 等，更多章节内容可以访问云栖社区“异步社区”公众号查看。

2.7　NameNode联盟

很多Hadoop用户心里一直不爽：对存储在NameNode内存中的元数据大小有限制。为了冲破单个NameNode服务器中物理内存的限制，需要一种大规模系统来取代之前的按比例增长模式。正如HDFS的块存储一样，可以将文件系统元数据分布存储在多台主机上，这一技术被称之为命名空间联盟（Namespace Federation），即通过一组自治系统来组织一个逻辑名字空间。Linux文件系统是一个例子：多个设备被动态地配置在一个名字空间下，客户端可以方便地通过寻址访问就该名字空间而无需关注数据到底存储在哪个底层设备上。

NameNode联盟（如图2-6所示）将文件系统名字空间分片并分散存储到多台NameNode上，这样就绕开了单个NameNode内存限制的问题。顾名思义，NameNode联盟由一组各自独立的NameNode组成，每一个NameNode负责管理目录结构的不同部分。与相互隔离集群的最主要区别在于，由NameNode联盟管理的集群中每个DataNode可以给多个NameNode存储数据块。更确切地说，每个DataNode为每个名字空间维护一个数据块池（Block Pool）。尽管来自不同数据块池的数据块可以存储在同一个物理磁盘中，但在逻辑上它们是独立的。每个DataNode同时发送心跳报文和块报告给每一个NameNode。

客户端通常不关心存在多少个NameNode，因此引入ViewFS API来映射文件系统片与NameNode的关系。理论上，与Linux的/etc/fstab文件的功能是一样的，ViewFS除了映射路径和物理设备的关系，还映射路径和HDFS NameNode的关系。例如，ViewFS将NameNode1映射到路径/logs，NameNode2映射到路径/hbase。NameNode联盟还允许基于名字空间分区来控制系统可用性和文件系统片的容错性。如前所述，/hbase可能需要非常高的可靠性，而/logs仅仅需要支持MapReduce的批处理。

最后，请注意高可用性和NameNode联盟是两个互相独立的功能，因为它们是针对不同的问题的。可以分别激活它们而互不影响，也就是说，名字空间可以被分区，其中部分分区（或全部分区）可以给一对高可用的NameNode提供服务。

《Hadoop技术详解》一2.7　NameNode联盟

2.7　NameNode联盟

热门文章

最新文章

相关课程

相关电子书

相关实验场景

《Hadoop技术详解》一2.7 NameNode联盟

2.7 NameNode联盟

热门文章

最新文章

相关课程

相关电子书

相关实验场景

《Hadoop技术详解》一2.7　NameNode联盟

2.7　NameNode联盟