记csv、parquet数据预览一个bug的解决

2024-01-14 06:12

本文主要是介绍记csv、parquet数据预览一个bug的解决,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

  • 一、概述
  • 二、实现过程
    • 1. 业务流程如图:
    • 2. 业务逻辑
    • 3. 运行结果
  • 三、bug现象
    • 1. 单元测试
    • 2.运行结果
  • 三、流程梳理
    • 1. 方向一
    • 2. 方向二

一、概述

工作中遇到通过sparksession解析csv、parquet文件并预览top100的需求。

二、实现过程

1. 业务流程如图:

hiveSQL读取数据
数据写入csv或parquet文件
预览csv或parquet文件top100数据

2. 业务逻辑

为了便于测试,我们下面以单元测试中模拟数据来说明


import java.util.ArrayList;
import java.util.List;
import java.util.Map;
import java.util.stream.Collectors;import org.junit.jupiter.api.BeforeAll;
import org.junit.jupiter.api.Test;import com.alibaba.fastjson.JSONObject;import lombok.extern.slf4j.Slf4j;@Slf4j
public class GroupingByDataTest
{static List<String> result = new ArrayList<>();@BeforeAllpublic static void init(){result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");}@Testpublic void test002(){Map<Object, List<Object>> r = result.stream().map(s -> JSONObject.parseObject(s).entrySet()) // map.flatMap(m -> m.stream()) // flatMap.collect(Collectors.groupingBy(mp -> mp.getKey(), Collectors.mapping(x -> x.getValue(), Collectors.toList())));log.info("{}", r);}
}

3. 运行结果

 com.fly.lambda.GroupingByDataTest - {student_name=[学生6, 学生6, 学生6, 学生6], student_no=[0204006, 0204006, 0204006, 0204006], value2=[6, 6, 6, 6], field=[项目6, 项目6, 项目6, 项目6], sex=[女, 女, 女, 女]}

目前看来一切正常。

三、bug现象

实际测试过程中发现,hive数据仓库中的字段由于各种原因并不一定都有值,从而导致csv、parquet保存结果时字段为空

1. 单元测试


import java.util.ArrayList;
import java.util.List;
import java.util.Map;
import java.util.stream.Collectors;import org.junit.jupiter.api.BeforeAll;
import org.junit.jupiter.api.Test;import com.alibaba.fastjson.JSONObject;import lombok.extern.slf4j.Slf4j;@Slf4j
public class GroupingByDataTest
{static List<String> result = new ArrayList<>();@BeforeAllpublic static void init(){result.add("{\"student_name\":\"学生1\",\"student_no\":\"0204001\",\"field\":\"项目1\",                 \"sex\":\"男\"}");result.add("{\"student_name\":\"学生2\",\"student_no\":\"0204002\",\"field\":\"项目2\",\"value2\":\"2\"               }");result.add("{\"student_name\":\"学生3\",                           \"field\":\"项目3\",\"value2\":\"3\",\"sex\":\"女\"}");result.add("{                           \"student_no\":\"0204004\",\"field\":\"项目4\",\"value2\":\"4\",\"sex\":\"男\"}");result.add("{\"student_name\":\"学生5\",\"student_no\":\"0204005\",\"field\":\"项目5\",\"value2\":\"5\",\"sex\":\"女\"}");result.add("{\"student_no\":\"0204006\",\"student_name\":\"学生6\",\"field\":\"项目6\",\"value2\":\"6\",\"sex\":\"女\"}");}@Testpublic void test002(){Map<Object, List<Object>> r = result.stream().map(s -> JSONObject.parseObject(s).entrySet()) // map.flatMap(m -> m.stream()) // flatMap.collect(Collectors.groupingBy(mp -> mp.getKey(), Collectors.mapping(x -> x.getValue(), Collectors.toList())));log.info("{}", r);}
}

2.运行结果

 com.fly.lambda.GroupingByDataTest - {student_name=[学生1, 学生2, 学生3, 学生5, 学生6], student_no=[0204001, 0204002, 0204004, 0204005, 0204006], value2=[2, 3, 4, 5, 6], field=[项目1, 项目2, 项目3, 项目4, 项目5, 项目6], sex=[男, 女, 男, 女, 女]}

期望的结果为

 com.fly.lambda.GroupingByDataTest - before : {student_name=[学生1, 学生2, 学生3, null, 学生5, 学生6], student_no=[0204001, 0204002, null, 0204004, 0204005, 0204006], value2=[null, 2, 3, 4, 5, 6], field=[项目1, 项目2, 项目3, 项目4, 项目5, 项目6], sex=[男, null, 女, 男, 女, 女]}

三、流程梳理

解决这个问题有2个方向

1. 方向一

从数据来源解决,也就是 hiveSQL读取数据使用 coalsce 函数进行空值处理,实际去解决的过程中发现2个问题。

  1. 强制业务用户编辑hiveSQL时显式调用(用户体验太差,增加使用难度
  2. 不强制业务用户编辑hiveSQL时显式调用,后台接受到SQL后自动添加coalsce 函数(后台业务逻辑复杂,eg: 使用了条件语句、多表关联查询等等情况。不一而足,几乎没法妥善处理

2. 方向二

hiveSQL读取数据
数据写入csv或parquet文件
预览csv或parquet文件top100数据

hiveSQL读取数据、数据写入csv或parquet文件正常进行,不用特殊处理, 修改步骤3

分为2步骤,步骤1,遍历获取全部的key去重,步骤2,自动对缺失数据的key补充空值

核心代码如下:

@Testpublic void test003()throws IOException{// 取keysList<String> keys = result.stream().map(s -> JSONObject.parseObject(s).entrySet()).flatMap(m -> m.stream()).map(r -> r.getKey()).distinct().collect(Collectors.toList());keys.stream().forEach(log::info);Map<String, List<Object>> r = result.stream().map(s -> parse(s, keys)).flatMap(m -> m.stream()) // flatMap.collect(Collectors.groupingBy(mp -> mp.getKey(), Collectors.mapping(x -> x.getValue(), Collectors.toList())));log.info("before : {}", r);log.info("sorted : {}", new TreeMap<>(r));}/*** 设置value, 根据需要补充空值*/private Set<Entry<String, Object>> parse(String s, List<String> keys){JSONObject jsonObject = JSONObject.parseObject(s);keys.stream().forEach(key -> {if (!jsonObject.containsKey(key)){jsonObject.put(key, null);}});return jsonObject.entrySet();}

可以说,花比较小的成本,以比较少的代码变动,相对稳妥的解决了问题。


有任何问题和建议,都可以向我提问讨论,大家一起进步,谢谢!

-over-

这篇关于记csv、parquet数据预览一个bug的解决的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/604177

相关文章

SQL Server安装时候没有中文选项的解决方法

《SQLServer安装时候没有中文选项的解决方法》用户安装SQLServer时界面全英文,无中文选项,通过修改安装设置中的国家或地区为中文中国,重启安装程序后界面恢复中文,解决了问题,对SQLSe... 你是不是在安装SQL Server时候发现安装界面和别人不同,并且无论如何都没有中文选项?这个问题也

C#监听txt文档获取新数据方式

《C#监听txt文档获取新数据方式》文章介绍通过监听txt文件获取最新数据,并实现开机自启动、禁用窗口关闭按钮、阻止Ctrl+C中断及防止程序退出等功能,代码整合于主函数中,供参考学习... 目录前言一、监听txt文档增加数据二、其他功能1. 设置开机自启动2. 禁止控制台窗口关闭按钮3. 阻止Ctrl +

java如何实现高并发场景下三级缓存的数据一致性

《java如何实现高并发场景下三级缓存的数据一致性》这篇文章主要为大家详细介绍了java如何实现高并发场景下三级缓存的数据一致性,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 下面代码是一个使用Java和Redisson实现的三级缓存服务,主要功能包括:1.缓存结构:本地缓存:使

java内存泄漏排查过程及解决

《java内存泄漏排查过程及解决》公司某服务内存持续增长,疑似内存泄漏,未触发OOM,排查方法包括检查JVM配置、分析GC执行状态、导出堆内存快照并用IDEAProfiler工具定位大对象及代码... 目录内存泄漏内存问题排查1.查看JVM内存配置2.分析gc是否正常执行3.导出 dump 各种工具分析4.

在MySQL中实现冷热数据分离的方法及使用场景底层原理解析

《在MySQL中实现冷热数据分离的方法及使用场景底层原理解析》MySQL冷热数据分离通过分表/分区策略、数据归档和索引优化,将频繁访问的热数据与冷数据分开存储,提升查询效率并降低存储成本,适用于高并发... 目录实现冷热数据分离1. 分表策略2. 使用分区表3. 数据归档与迁移在mysql中实现冷热数据分

C#解析JSON数据全攻略指南

《C#解析JSON数据全攻略指南》这篇文章主要为大家详细介绍了使用C#解析JSON数据全攻略指南,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、为什么jsON是C#开发必修课?二、四步搞定网络JSON数据1. 获取数据 - HttpClient最佳实践2. 动态解析 - 快速

Java实现预览与打印功能详解

《Java实现预览与打印功能详解》在Java中,打印功能主要依赖java.awt.print包,该包提供了与打印相关的一些关键类,比如PrinterJob和PageFormat,它们构成... 目录Java 打印系统概述打印预览与设置使用 PageFormat 和 PrinterJob 类设置页面格式与纸张

Spring的RedisTemplate的json反序列泛型丢失问题解决

《Spring的RedisTemplate的json反序列泛型丢失问题解决》本文主要介绍了SpringRedisTemplate中使用JSON序列化时泛型信息丢失的问题及其提出三种解决方案,可以根据性... 目录背景解决方案方案一方案二方案三总结背景在使用RedisTemplate操作redis时我们针对

SpringBoot整合Dubbo+ZK注册失败的坑及解决

《SpringBoot整合Dubbo+ZK注册失败的坑及解决》使用Dubbo框架时,需在公共pom添加依赖,启动类加@EnableDubbo,实现类用@DubboService替代@Service,配... 目录1.先看下公共的pom(maven创建的pom工程)2.启动类上加@EnableDubbo3.实

nginx中端口无权限的问题解决

《nginx中端口无权限的问题解决》当Nginx日志报错bind()to80failed(13:Permissiondenied)时,这通常是由于权限不足导致Nginx无法绑定到80端口,下面就来... 目录一、问题原因分析二、解决方案1. 以 root 权限运行 Nginx(不推荐)2. 为 Nginx