HDFS读写流程详解 —— 一图在手,天下我有~

2024-03-08 04:30

本文主要是介绍HDFS读写流程详解 —— 一图在手,天下我有~,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

HDFS读写流程详解

  • 一、HDFS写入文件流程
    • 1.详解图
    • 2.步骤详解
  • 二、HDFS读取文件流程
    • 1.详解图
    • 2.步骤详解

一、HDFS写入文件流程

1.详解图

HDFS写入文件流程图

2.步骤详解

1.客户端发起上传文件的请求。
2.NameNode进行校验权限,判断该客户端是否具有写入权限,如果没有直接报错,如果有则判断该文件是否已经存在,如果已存在则报错.如果没有则校验成功,通知客户端上传文件.
3.客户端对文件进行切块(切片)
4.客户端重新请求NameNode,询问第一个块上传到哪里.
5.NameNode接收到客户端请求后,根据副本机制,负载均衡,机架感知原理,以及网络拓扑图,找到存储第一个block块的DataNode列表.
以下使用node1,node2,node3为例.
6.根据收到的DataNode列表,连接就近的服务器.
7.依次和DataNode列表中其他节点连接,形成:传输管道(pipeline)
8.采用数据报包(DatagramPacket) 的方式进行传输数据,并建立:ACK确认机制(反向应答机制)
9.传输过程:
传输管道: 客户端 -> node1 -> node2 -> node3
ACK确认机制: node3 -> node2 -> node1 -> 客户端
不断传输直至第一个block块传输完毕.
10.返回第4步,获取第二个block块的上传位置,重新往下执行,直至所有的block上传完毕,写入数据任务完成.

二、HDFS读取文件流程

1.详解图

HDFS读取文件流程图

2.步骤详解

1.客户端发起读取请求.
2.NameNode进行校验,判断该客户端是否有读取权限,如果没有直接报错,如果有则判断该文件是否存在,如过不存在则报错.校验成功后会根据机架感知原理 和 网络拓扑图,返回存储该文件block块的地址.
3.客户端根据NameNode返回的DataNode列表 并行 的从这些DataNode中读取对应的块信息.
4.如果之前读取的是部分块信息,则这些块读取完成后,会重新请求NameNode从而获取剩下全部或部分block地址,然后继续读取,直至所有数据块信息读取完毕.
5.按照block块的信息,对读取的这些数据块.

这篇关于HDFS读写流程详解 —— 一图在手,天下我有~的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/786000

相关文章

Mysql数据库聚簇索引与非聚簇索引举例详解

《Mysql数据库聚簇索引与非聚簇索引举例详解》在MySQL中聚簇索引和非聚簇索引是两种常见的索引结构,它们的主要区别在于数据的存储方式和索引的组织方式,:本文主要介绍Mysql数据库聚簇索引与非... 目录前言一、核心概念与本质区别二、聚簇索引(Clustered Index)1. 实现原理(以 Inno

使用python生成固定格式序号的方法详解

《使用python生成固定格式序号的方法详解》这篇文章主要为大家详细介绍了如何使用python生成固定格式序号,文中的示例代码讲解详细,具有一定的借鉴价值,有需要的小伙伴可以参考一下... 目录生成结果验证完整生成代码扩展说明1. 保存到文本文件2. 转换为jsON格式3. 处理特殊序号格式(如带圈数字)4

MySQL数据库双机热备的配置方法详解

《MySQL数据库双机热备的配置方法详解》在企业级应用中,数据库的高可用性和数据的安全性是至关重要的,MySQL作为最流行的开源关系型数据库管理系统之一,提供了多种方式来实现高可用性,其中双机热备(M... 目录1. 环境准备1.1 安装mysql1.2 配置MySQL1.2.1 主服务器配置1.2.2 从

Linux kill正在执行的后台任务 kill进程组使用详解

《Linuxkill正在执行的后台任务kill进程组使用详解》文章介绍了两个脚本的功能和区别,以及执行这些脚本时遇到的进程管理问题,通过查看进程树、使用`kill`命令和`lsof`命令,分析了子... 目录零. 用到的命令一. 待执行的脚本二. 执行含子进程的脚本,并kill2.1 进程查看2.2 遇到的

MyBatis常用XML语法详解

《MyBatis常用XML语法详解》文章介绍了MyBatis常用XML语法,包括结果映射、查询语句、插入语句、更新语句、删除语句、动态SQL标签以及ehcache.xml文件的使用,感兴趣的朋友跟随小... 目录1、定义结果映射2、查询语句3、插入语句4、更新语句5、删除语句6、动态 SQL 标签7、ehc

详解SpringBoot+Ehcache使用示例

《详解SpringBoot+Ehcache使用示例》本文介绍了SpringBoot中配置Ehcache、自定义get/set方式,并实际使用缓存的过程,文中通过示例代码介绍的非常详细,对大家的学习或者... 目录摘要概念内存与磁盘持久化存储:配置灵活性:编码示例引入依赖:配置ehcache.XML文件:配置

从基础到高级详解Go语言中错误处理的实践指南

《从基础到高级详解Go语言中错误处理的实践指南》Go语言采用了一种独特而明确的错误处理哲学,与其他主流编程语言形成鲜明对比,本文将为大家详细介绍Go语言中错误处理详细方法,希望对大家有所帮助... 目录1 Go 错误处理哲学与核心机制1.1 错误接口设计1.2 错误与异常的区别2 错误创建与检查2.1 基础

Nginx分布式部署流程分析

《Nginx分布式部署流程分析》文章介绍Nginx在分布式部署中的反向代理和负载均衡作用,用于分发请求、减轻服务器压力及解决session共享问题,涵盖配置方法、策略及Java项目应用,并提及分布式事... 目录分布式部署NginxJava中的代理代理分为正向代理和反向代理正向代理反向代理Nginx应用场景

k8s按需创建PV和使用PVC详解

《k8s按需创建PV和使用PVC详解》Kubernetes中,PV和PVC用于管理持久存储,StorageClass实现动态PV分配,PVC声明存储需求并绑定PV,通过kubectl验证状态,注意回收... 目录1.按需创建 PV(使用 StorageClass)创建 StorageClass2.创建 PV

Python版本信息获取方法详解与实战

《Python版本信息获取方法详解与实战》在Python开发中,获取Python版本号是调试、兼容性检查和版本控制的重要基础操作,本文详细介绍了如何使用sys和platform模块获取Python的主... 目录1. python版本号获取基础2. 使用sys模块获取版本信息2.1 sys模块概述2.1.1