HDFS 使用 RBF 注意事项

2024-01-29 12:12
文章标签 使用 注意事项 hdfs rbf

本文主要是介绍HDFS 使用 RBF 注意事项,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一 NameNode

NN 启用 RPC context 特性,在审计日志中打印真实的客户端 IP.

默认情况下,NN 的审计日志记录的所有请求的源 IP 都是 Router,如果要看到真正的 client IP,需要在 NameNode 侧,hdfs-site.xml 中,使能 callerContext,之后在 NN 审计日志中,将在 CallerContext 字段记录此次 RPC 请求的真实 IP:

在 NameNode 侧,hdfs-site.xml 中,做如下配置:

<property><name>hadoop.caller.context.enabled</name><value>true</value>
</property>

二 客户端

客户端随机选择 router,而不是总选择第一个.

默认情况下,在客户端配置了多个 router 时,客户端总是优先使用第一个 router,如果所有客户端都是这种行为的话,很可能会造成第一个 router 累死,而其它 router 饿死,为了防止这种情况出现,需要让客户端随机选取 router。

在 Client 侧,hdfs-site.xml 中,做如下配置:

<property><name>dfs.client.failover.random.order</name><value>true</value>
</property>

三 Router

  1. 配置 ganglia 监控

    Router 的监控信息,也需要输出到 ganglia 上

    在 Router 侧,hadoop-metrics2.properties 中,增加下面配置:

    *.sink.ganglia.class=org.apache.hadoop.metrics2.sink.ganglia.GanglisSink31
    *.sink.ganglia.period=60
    router.sink.ganglia.servers=ganglia机器ip:8649
    
  2. 增大 Router RPC server 的 reader count 和 handler count.

    默认情况下,router 的 handler count 为10,reader count 为1,这些值都太小,需要加大.

    在 Router 侧,hdfs-rbf-site.xml 中,将 RPC handler count 配置为 4096:

    <property><name>dfs.federation.router.handler.count</name><value>4096</value>
    </property>
    

    将RPC reader count配置为16:

    <property><name>dfs.federation.router.reader.count</name><value>16</value>
    </property>
    
  3. 开启各个 Router 之间的 mount table 即时更新功能.

    默认情况下,如果一个 router 修改了 mount table,那么其他 router 不能立即更新,需要等待一段时间才能达到同步状态。开启即时更新功能后, 修改了 mount table 的 router 会主动通知其他 router 更新 cache,从而使其他 router 立即达到同步状态.

    在 Router 侧,hdfs-rbf-site.xml 中,做如下配置:

    <proterty><name>dfs.federation.router.mount-table.cache.update</name><value>true</value>
    </proterty>
    
  4. 开启 Router 的超载拒绝服务特性.

    默认情况下,如果一个 router 接收到的 RPC 请求太多,则会严重排队。开启该特性后,一个 router 在满载之后,会立即拒绝新的 RPC 请求,之后客户端会继续尝试其他的 router:

    在 Router 侧,hdfs-rbf-site.xml 中,做如下配置:

    <proterty><name>dfs.federation.router.client.reject.overload</name><value>true</value>
    </proterty>
    
  5. 禁用 Router 的 “部分 list/count” 特性.

    如果 router 启用了 multi destination 挂载功能,且一个挂载目录的某些 sub cluster 不可用时,可能出现不能完整 list/count 一个目录的情况,此时只能 list/count 到一部分目录内容。这种结果不可接受,需要禁用该特性,此时应直接返回失败。

    在 Router 侧,hdfs-rbf-site.xml 中,做如下配置:

    <proterty><name>dfs.federation.router.client.allow-partial-listing</name><value>true</value>
    </proterty>
    
  6. 禁止 Router 缓存客户端 RPC 请求的路径解析结果.

    默认情况下,Router 会缓存客户端 RPC 请求的路径解析结果,最多缓存1W条,但如果客户端的操作路径非常多变(典型情况:集群业务量超大,Router 收到的 RPC 请求路径频繁变化),则这种缓存意义不大,且额外的缓存操作还会增加 Router 时耗,此时应该禁用缓存。

    在 Router 侧,hdfs-rbf-site.xml 中,做如下配置:

    <proterty><name>dfs.federation.router.mount-table.cache.enable</name><value>true</value>
    </proterty>
    
  7. 禁止 Router 自动监听本地 NameNode.

    默认情况下,Router 仅自动监听本地 NameNode,实际使用中,我们会手动配置 Router 需要监听的所有 NN.

    在 Router 侧,hdfs-rbf-site.xml 中,做如下配置:

    <property><name>dfs.federation.router.monitor.localnamenode.enable</name><value>false</value>
    </property>
    

四 几个问题需要确认

  • Router 性能损耗

    在 Client 和 NameNode 直接插入 Router 之后,对业务的 RPC 时耗影响大概有多大?

  • Router MountTable 性能问题

    在 Router 的 MountTable Entry 过多时(例如 10W 条),是否会对 Router 性能产生影响?

  • token 性能问题

    各个 Router 的 token 都存在一个 zk 里面,并且使用 zk 的 CallBack 更新机制,以现网目前的 token 量,zk 是否撑得住?


欢迎关注微信公众号:大数据AI

这篇关于HDFS 使用 RBF 注意事项的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/656866

相关文章

使用Python开发一个Ditto剪贴板数据导出工具

《使用Python开发一个Ditto剪贴板数据导出工具》在日常工作中,我们经常需要处理大量的剪贴板数据,下面将介绍如何使用Python的wxPython库开发一个图形化工具,实现从Ditto数据库中读... 目录前言运行结果项目需求分析技术选型核心功能实现1. Ditto数据库结构分析2. 数据库自动定位3

Python yield与yield from的简单使用方式

《Pythonyield与yieldfrom的简单使用方式》生成器通过yield定义,可在处理I/O时暂停执行并返回部分结果,待其他任务完成后继续,yieldfrom用于将一个生成器的值传递给另一... 目录python yield与yield from的使用代码结构总结Python yield与yield

Go语言使用select监听多个channel的示例详解

《Go语言使用select监听多个channel的示例详解》本文将聚焦Go并发中的一个强力工具,select,这篇文章将通过实际案例学习如何优雅地监听多个Channel,实现多任务处理、超时控制和非阻... 目录一、前言:为什么要使用select二、实战目标三、案例代码:监听两个任务结果和超时四、运行示例五

python使用Akshare与Streamlit实现股票估值分析教程(图文代码)

《python使用Akshare与Streamlit实现股票估值分析教程(图文代码)》入职测试中的一道题,要求:从Akshare下载某一个股票近十年的财务报表包括,资产负债表,利润表,现金流量表,保存... 目录一、前言二、核心知识点梳理1、Akshare数据获取2、Pandas数据处理3、Matplotl

Java使用Thumbnailator库实现图片处理与压缩功能

《Java使用Thumbnailator库实现图片处理与压缩功能》Thumbnailator是高性能Java图像处理库,支持缩放、旋转、水印添加、裁剪及格式转换,提供易用API和性能优化,适合Web应... 目录1. 图片处理库Thumbnailator介绍2. 基本和指定大小图片缩放功能2.1 图片缩放的

Python使用Tenacity一行代码实现自动重试详解

《Python使用Tenacity一行代码实现自动重试详解》tenacity是一个专为Python设计的通用重试库,它的核心理念就是用简单、清晰的方式,为任何可能失败的操作添加重试能力,下面我们就来看... 目录一切始于一个简单的 API 调用Tenacity 入门:一行代码实现优雅重试精细控制:让重试按我

MySQL中EXISTS与IN用法使用与对比分析

《MySQL中EXISTS与IN用法使用与对比分析》在MySQL中,EXISTS和IN都用于子查询中根据另一个查询的结果来过滤主查询的记录,本文将基于工作原理、效率和应用场景进行全面对比... 目录一、基本用法详解1. IN 运算符2. EXISTS 运算符二、EXISTS 与 IN 的选择策略三、性能对比

使用Python构建智能BAT文件生成器的完美解决方案

《使用Python构建智能BAT文件生成器的完美解决方案》这篇文章主要为大家详细介绍了如何使用wxPython构建一个智能的BAT文件生成器,它不仅能够为Python脚本生成启动脚本,还提供了完整的文... 目录引言运行效果图项目背景与需求分析核心需求技术选型核心功能实现1. 数据库设计2. 界面布局设计3

使用IDEA部署Docker应用指南分享

《使用IDEA部署Docker应用指南分享》本文介绍了使用IDEA部署Docker应用的四步流程:创建Dockerfile、配置IDEADocker连接、设置运行调试环境、构建运行镜像,并强调需准备本... 目录一、创建 dockerfile 配置文件二、配置 IDEA 的 Docker 连接三、配置 Do

Android Paging 分页加载库使用实践

《AndroidPaging分页加载库使用实践》AndroidPaging库是Jetpack组件的一部分,它提供了一套完整的解决方案来处理大型数据集的分页加载,本文将深入探讨Paging库... 目录前言一、Paging 库概述二、Paging 3 核心组件1. PagingSource2. Pager3.