给大数据入门小伙伴的几个小挑战No.28

2024-05-15 08:48

本文主要是介绍给大数据入门小伙伴的几个小挑战No.28,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

我是小蕉。

子曰:视其所以,观其所由,察其所安,人焉廋哉?人焉廋哉?

子曰:不患无位,患所以立;不患莫己知,求为可知也。


今天突然神来之笔,有小伙伴说想入门大数据但是苦于还是不知道怎么入手,或者说没有东西练手。

好,那就直接跟你们分享几个小任务,我相信你要是用心去做,用心去理解有什么解决方案,背后的运行逻辑,你至少可以把大数据入个门,这几个任务为期两个月,具体时间分配自己把握。

敲黑板!!!

我不会提供任何的源码,也不会提供任何方案,但是可以提供咨询。

(当然一切问题小伙伴们还是先问度娘,因为只要是能度娘的问题,我全部都会直接回复:问度娘。)

任务一:环境搭建

自己开虚拟机或者云主机搭好Hadoop,Spark,Hive,sqoop,原生的那种。

注意事项:版本搭配要合理,不然会有很多坑。

任务二、数据准备

使用Spark生成500万数据,包含[身份证,手机号,日期]三个字段。其中身份证格式为18位,手机号为6位,日期为yyyy-mm-dd,手机号其中有100万必须为10086,都必须为合理的随机数据,不能是序列,结果保存到Hive表中。

注意事项:版本搭配要合理,不然会有很多坑。

任务三、MapReduce初探

使用任务二的数据进行关系生成,相同手机号的人认为有关系。过滤空数据以及6位号码相同的,若发现同一号码导致的关系数超过3000,剔除,结果保存到Hive中。

注意事项:注意考虑数据倾斜是怎么被解决的。

任务四、内存调优及算法实现

利用任务三生成的关系,利用GraphX和SLPA进行社区划分。

注意事项:SLPA需要自己实现,要思考GraphX的局限性。


完成了的小伙伴可以后台告诉我,也可以每天跟我互动进展。

很好玩的,肯定会会遇到很多很多的问题,也可以增进对Hadoop这一套东西的理解。

周末又过去了,小蕉除了看了点书看了点视频做了个PPT啥也没干。

要谢谢大家的支持~读者马上要破300啦~

虽然读者也不多,表达能力也不过关,没能给更多的读者带来帮助,但是呢,也是小小的激动,毕竟也写了四个多月啦,谢谢大家支持,喜欢的小伙伴呢,也可以分享给小伙伴,不然写起来很没劲吖~~

昨天的PPT放出来目录后还是收到了很多的建议,但是现在还没做好,所以暂时应该还不会放出来,相信到时候对大家理解机器学习这个东西和如何入门应该会有不小的帮助。

读着《数学之美》,越看越觉得数学在我们生活中的应用真的太被小看了,很多事情的解决方案,都可以从数学的角度来看待。可能大家经过了高中的教育后,对于天体,以及电子中的数学都比较熟悉了,但是对于语言、图论、密码学、信息噪音、搜索等领域的数学可能都是一片浆糊。

书中不断提及的一点:简单有效的方法,可能不是最准确的,但一定是最好用的。

也在同时看着《论语》,当然是有翻译那种,每次读都能读到一些之前可能不太想得到的东西,当然也有的东西过于极端化。嘛,每个人价值观都不一样嘛。

0?wx_fmt=jpeg

这篇关于给大数据入门小伙伴的几个小挑战No.28的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/991365

相关文章

SpringBoot多环境配置数据读取方式

《SpringBoot多环境配置数据读取方式》SpringBoot通过环境隔离机制,支持properties/yaml/yml多格式配置,结合@Value、Environment和@Configura... 目录一、多环境配置的核心思路二、3种配置文件格式详解2.1 properties格式(传统格式)1.

解决pandas无法读取csv文件数据的问题

《解决pandas无法读取csv文件数据的问题》本文讲述作者用Pandas读取CSV文件时因参数设置不当导致数据错位,通过调整delimiter和on_bad_lines参数最终解决问题,并强调正确参... 目录一、前言二、问题复现1. 问题2. 通过 on_bad_lines=‘warn’ 跳过异常数据3

Spring WebClient从入门到精通

《SpringWebClient从入门到精通》本文详解SpringWebClient非阻塞响应式特性及优势,涵盖核心API、实战应用与性能优化,对比RestTemplate,为微服务通信提供高效解决... 目录一、WebClient 概述1.1 为什么选择 WebClient?1.2 WebClient 与

C#监听txt文档获取新数据方式

《C#监听txt文档获取新数据方式》文章介绍通过监听txt文件获取最新数据,并实现开机自启动、禁用窗口关闭按钮、阻止Ctrl+C中断及防止程序退出等功能,代码整合于主函数中,供参考学习... 目录前言一、监听txt文档增加数据二、其他功能1. 设置开机自启动2. 禁止控制台窗口关闭按钮3. 阻止Ctrl +

java如何实现高并发场景下三级缓存的数据一致性

《java如何实现高并发场景下三级缓存的数据一致性》这篇文章主要为大家详细介绍了java如何实现高并发场景下三级缓存的数据一致性,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 下面代码是一个使用Java和Redisson实现的三级缓存服务,主要功能包括:1.缓存结构:本地缓存:使

在MySQL中实现冷热数据分离的方法及使用场景底层原理解析

《在MySQL中实现冷热数据分离的方法及使用场景底层原理解析》MySQL冷热数据分离通过分表/分区策略、数据归档和索引优化,将频繁访问的热数据与冷数据分开存储,提升查询效率并降低存储成本,适用于高并发... 目录实现冷热数据分离1. 分表策略2. 使用分区表3. 数据归档与迁移在mysql中实现冷热数据分

C#解析JSON数据全攻略指南

《C#解析JSON数据全攻略指南》这篇文章主要为大家详细介绍了使用C#解析JSON数据全攻略指南,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、为什么jsON是C#开发必修课?二、四步搞定网络JSON数据1. 获取数据 - HttpClient最佳实践2. 动态解析 - 快速

Spring Boot 与微服务入门实战详细总结

《SpringBoot与微服务入门实战详细总结》本文讲解SpringBoot框架的核心特性如快速构建、自动配置、零XML与微服务架构的定义、演进及优缺点,涵盖开发环境准备和HelloWorld实战... 目录一、Spring Boot 核心概述二、微服务架构详解1. 微服务的定义与演进2. 微服务的优缺点三

从入门到精通详解LangChain加载HTML内容的全攻略

《从入门到精通详解LangChain加载HTML内容的全攻略》这篇文章主要为大家详细介绍了如何用LangChain优雅地处理HTML内容,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录引言:当大语言模型遇见html一、HTML加载器为什么需要专门的HTML加载器核心加载器对比表二

从入门到进阶讲解Python自动化Playwright实战指南

《从入门到进阶讲解Python自动化Playwright实战指南》Playwright是针对Python语言的纯自动化工具,它可以通过单个API自动执行Chromium,Firefox和WebKit... 目录Playwright 简介核心优势安装步骤观点与案例结合Playwright 核心功能从零开始学习