大规模数据处理学习笔记:1.从未入门到放弃MapReduce

本文主要是介绍大规模数据处理学习笔记:1.从未入门到放弃MapReduce,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

1. 从未入门到放弃MapReduce

\quad 之前看过一些关于大数据技术的内容和文章,了解了一些关于MapReduce的东西,不得不感慨技术发展是如此之快,MapReduce这么快已经开始逐渐沦落为“明日黄花”了。到2014年,Google内部已经几乎没有人写新的MapReduce了。

MapReduce被取代的原因主要有以下两个:

  • 高昂的维护成本
  • 时间性能达不到用户期待

MapReduce复杂度很高,从Google500多页的性能优化手册就足够说明它的复杂度了。

从2016年开始,Google在新员工的培训中已经将MapReduce改为FlumeJava(它后来的开源版本为Apache Beam)的数据处理技术

下一代数据处理技术雏型也即上面提到的FlumeJava,则解决了上面列举的MapReduce的短板。此外,它还带来了更好的一些别的优点:

  • 更好的可测试性
  • 更好的可监控性
  • 从1条数据到1亿条数据可以无缝扩展,不需要修改一行代码

这里记录一下分片的概念:
在这里插入图片描述
在这里插入图片描述
如何缓解上面分片的问题(20+岁的用户较多),也即处理Reducer key的倾斜问题,可以有以下几种缓解的思路:

  1. 将年龄的十位数和个位数调换,如21,22,23,24转换为12,22,32,42;但也存在hot spot的问题(如25岁的用户特别多)
  2. 哈希思想解决。传统哈希的求余运算在面对需要增减对象的场景时不够友好(m变了有些位置就映射不到了,需要重新再计算所有对象的位置)。改善方法为:使用Consistent hashing,即一致性哈希环处理,采用虚拟节点分配数据较多的对象

课程来自极客时间,以下为购买链接:(老师回答问题很认真,高手风范)
https://time.geekbang.org/column/intro/167?code=eBldjnQWBAomFiOJ0QysW3uX1hpGY2UfRDE75sBHQKQ%3D

这篇关于大规模数据处理学习笔记:1.从未入门到放弃MapReduce的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/449673

相关文章

从基础到进阶详解Pandas时间数据处理指南

《从基础到进阶详解Pandas时间数据处理指南》Pandas构建了完整的时间数据处理生态,核心由四个基础类构成,Timestamp,DatetimeIndex,Period和Timedelta,下面我... 目录1. 时间数据类型与基础操作1.1 核心时间对象体系1.2 时间数据生成技巧2. 时间索引与数据

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

Python中OpenCV与Matplotlib的图像操作入门指南

《Python中OpenCV与Matplotlib的图像操作入门指南》:本文主要介绍Python中OpenCV与Matplotlib的图像操作指南,本文通过实例代码给大家介绍的非常详细,对大家的学... 目录一、环境准备二、图像的基本操作1. 图像读取、显示与保存 使用OpenCV操作2. 像素级操作3.

重新对Java的类加载器的学习方式

《重新对Java的类加载器的学习方式》:本文主要介绍重新对Java的类加载器的学习方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、介绍1.1、简介1.2、符号引用和直接引用1、符号引用2、直接引用3、符号转直接的过程2、加载流程3、类加载的分类3.1、显示

POI从入门到实战轻松完成EasyExcel使用及Excel导入导出功能

《POI从入门到实战轻松完成EasyExcel使用及Excel导入导出功能》ApachePOI是一个流行的Java库,用于处理MicrosoftOffice格式文件,提供丰富API来创建、读取和修改O... 目录前言:Apache POIEasyPoiEasyExcel一、EasyExcel1.1、核心特性

Python中模块graphviz使用入门

《Python中模块graphviz使用入门》graphviz是一个用于创建和操作图形的Python库,本文主要介绍了Python中模块graphviz使用入门,具有一定的参考价值,感兴趣的可以了解一... 目录1.安装2. 基本用法2.1 输出图像格式2.2 图像style设置2.3 属性2.4 子图和聚

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen

MySQL重复数据处理的七种高效方法

《MySQL重复数据处理的七种高效方法》你是不是也曾遇到过这样的烦恼:明明系统测试时一切正常,上线后却频频出现重复数据,大批量导数据时,总有那么几条不听话的记录导致整个事务莫名回滚,今天,我就跟大家分... 目录1. 重复数据插入问题分析1.1 问题本质1.2 常见场景图2. 基础解决方案:使用异常捕获3.

利用Python快速搭建Markdown笔记发布系统

《利用Python快速搭建Markdown笔记发布系统》这篇文章主要为大家详细介绍了使用Python生态的成熟工具,在30分钟内搭建一个支持Markdown渲染、分类标签、全文搜索的私有化知识发布系统... 目录引言:为什么要自建知识博客一、技术选型:极简主义开发栈二、系统架构设计三、核心代码实现(分步解析