SparkSQL在字节跳动的应用实践和优化实战

2024-09-06 21:32

文章标签 实战实践应用优化字节跳动 sparksql

本文主要是介绍SparkSQL在字节跳动的应用实践和优化实战，希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

来源:字节跳动白泉的分享

作者:大数据技术与架构整理

点击右侧关注，大数据开发领域最强公众号！

点击右侧关注，暴走大数据！

By 大数据技术与架构

场景描述： 面对大量复杂的数据分析需求，提供一套稳定、高效、便捷的企业级查询分析服务具有重大意义。本次演讲介绍了字节跳动基于SparkSQL建设大数据查询统一服务TQS（Toutiao Query Service）的一些实践以及在执行计划调优、数据读取剪枝、SQL兼容性等方面对SparkSQL引擎的一些优化。

关键词：SparkSQL优化字节跳动

本文是根据来自字节跳动的分享整理而成。

作者来自字节跳动数据平台查询分析团队。

目标和能力

为公司内部提供 Hive 、 Spark - SQL 等 OLAP 查询引擎服务支持。

提供全公司大数据查询的统一服务入口，支持丰富的API接口，覆盖Adhoc、ETL等SQL查询需求
支持多引擎的智能路由、参数的动态优化
Spark-SQL/Hive引擎性能优化

针对SparkSQL，主要做了以下优化：

1. 执行计划自动调优

•基于AE的 ShuffledHashJoin调整

•Leftjoinbuildleftmap技术

2. 数据读取剪枝

•Parquetlocalsort

•BloomFilter&BitMap

•Prewhere

3. 一些其它优化

执行计划调优

执行计划的自动调优：

Spark Adaptive Execution （ Intel®Software）,简称SparkAE，总体思想是将sparksql生成的1个job中的所有stage单独执行，为每一个stage单独创建一个子job，子job执行完后收集该stage相关的统计信息（主要是数据量和记录数），并依据这些统计信息优化调整下游stage的执行计划。

目前SparkAE主要支持的功能：

（1）数据倾斜的调整

（2）小task的合并

（3）sortmerge-> broadcase

Spark 有3种join方式：Broadcastjoin、ShuffledHashJoin、SortMergeJoin

普通leftjoin无法build 左表

优化点：

在AE的框架下，根据shuffle数据量大小，自动调整join执行计划：SortMergeJoin调整为 ShuffledHashJoin•扩展支持left-join时将左表build成HashMap。

省去了大表join小表的情况下对shuffle数据的排序过程、join过程以HashMap完成，实现join提速。

SortMergeJoin调整为ShuffledHashJoin

640?wx_fmt=png

Leftjoin build left sidemap

1、初始化表A的一个匹配记录的映射表

目标：

对于Left-join的情况，可以对左表进行HashMapbuild。使得小左表leftjoin大右表的情况可以进行ShuffledHashJoin调整

难点：

Left-join语义：左表没有join成功的key，也需要输出

原理

在构建左表Map的时候，额外维持一个"是否已匹配"的映射表；在和右表join结束之后，把所有没有匹配到的key，用null进行join填充。

以 Aleft join B 为例：

640?wx_fmt=png

2、join过程中，匹配到的key置为1，没有匹配到的项不变（如key3）

640?wx_fmt=png

3、join结束后，没有匹配到的项，生成一个补充结果集R2

640?wx_fmt=png

640?wx_fmt=png

4.合并结果集R1和结果集R2，输出最终生成的join结果R。

640?wx_fmt=png

优化结果

约95%左右的joinSQL有被调整成ShuffledHashJoin/BroadcastJoin
被优化的SQL整体速度提升20%~30%
整体执行时长缩短

640?wx_fmt=png

基于Parquet数据读取剪枝

以parquet格式数据为对象，在数据读取时进行适当的过滤剪枝，从而减少读取的数据量，加速查询速度

优化点：

LocalSort
BoomFilter
BitMap
Prewhere

基于Parquet数据读取剪枝：LocalSort

对parquet文件针对某个高频字段进行排序。从而实现读数据时RowGroup的过滤

目标：

自动选择排序字段
生成文件时自动排序

640?wx_fmt=png

Parquet文件读取原理：

（1）每个rowgroup的元信息里，都会记录自己包含的各个列的最大值和最小值

（2）读取时如何这个值不在最大值、最小值范围内，则跳过RowGroup

生成hive分区文件时，先读取metastore，获取它是否需要使用localsort，如果需要，选择它的高频列是哪个。

基于Parquet数据读取剪枝：BloomFilter&BitMap

640?wx_fmt=png

640?wx_fmt=png

640?wx_fmt=png

整体优化结果：

命中索引平均性能提升 30%
生成时间增加：10%
空间开销增加：5%

如何选取合适的列

640?wx_fmt=png

Local_sort &BloomFilter & BitMap 如何自动生效

640?wx_fmt=png

基于Parquet数据读取剪枝：Prewhere

基于列式存储各列分别存储、读取的特性•针对需要返回多列的SQL，先根据下推条件对RowId进行过滤、选取。再有跳过地读取其他列，从而减少无关IO和后续计算•谓词选择（简单、计算量小）:in,=,<>,isnull,isnotnull

优化结果使得：特定 SQL （ Project16 列， where条件 2 列） SQL 平均性能提升 20%

其他优化

Hive/SparkLoad分区Move文件优化：

通过调整staging目录位置，实现在Load过程中mv文件夹，替代逐个mv文件，从而减少与NameNode的交互次数

Spark生成文件合并

通过最后增加一个repartitionstage合并spark生成文件。

Vcore

对于CPU使用率低的场景，通过vcore技术使得一个yarn-core可以启动多个spark-core

Spark 访问hivemetastore 特定filter下推：

构造 get_partitions_by_filter实现 cast、substring等条件下推hivemetastore，从而减轻metastore返回数据量

运行期调优

在SQL执行前，通过统一的查询入口，对其进行基于代价的预估，选择合适的引擎和参数:

1.SQL分析

抽取Hiveexplain逻辑，进行SQL语法正确性检查
对SQL包含的算子、输入的数据量进行标注

2.自动引擎选择/自动参数优化

标注结果自动选择执行引擎：

小SQL走SparkServer（省去yarn申请资源耗时）
其他默认走Spark-Submit

标注结果选择不同运行参数：

Executor个数/内存
Overhead、堆外内存

调优后使得Adhoc30s以内SQL占比45%，Spark-Submit内存使用量平均减少20%。

欢迎点赞+收藏+转发朋友圈素质三连

640?wx_fmt=jpeg

文章不错？点个【在看】吧！ ?

这篇关于SparkSQL在字节跳动的应用实践和优化实战的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

http://www.chinasem.cn/article/1143176。 23002807@qq.com

相关文章

JDK21对虚拟线程的几种用法实践指南

JDK21对虚拟线程的几种用法实践指南

《JDK21对虚拟线程的几种用法实践指南》虚拟线程是Java中的一种轻量级线程,由JVM管理,特别适合于I/O密集型任务,：本文主要介绍JDK21对虚拟线程的几种用法,文中通过代码介绍的非常详细,... 目录一、参考官方文档二、什么是虚拟线程三、几种用法1、Thread.ofVirtual().start(

阅读更多...

从基础到高级详解Go语言中错误处理的实践指南

从基础到高级详解Go语言中错误处理的实践指南

《从基础到高级详解Go语言中错误处理的实践指南》Go语言采用了一种独特而明确的错误处理哲学,与其他主流编程语言形成鲜明对比,本文将为大家详细介绍Go语言中错误处理详细方法,希望对大家有所帮助... 目录1 Go 错误处理哲学与核心机制1.1 错误接口设计1.2 错误与异常的区别2 错误创建与检查2.1 基础

阅读更多...

Python版本信息获取方法详解与实战

Python版本信息获取方法详解与实战

《Python版本信息获取方法详解与实战》在Python开发中,获取Python版本号是调试、兼容性检查和版本控制的重要基础操作,本文详细介绍了如何使用sys和platform模块获取Python的主... 目录1. python版本号获取基础2. 使用sys模块获取版本信息2.1 sys模块概述2.1.1

阅读更多...

springboot依靠security实现digest认证的实践

springboot依靠security实现digest认证的实践

《springboot依靠security实现digest认证的实践》HTTP摘要认证通过加密参数（如nonce、response）验证身份,避免明文传输,但存在密码存储风险,相比基本认证更安全,却因... 目录概述参数Demopom.XML依赖Digest1Application.JavaMyPasswo

阅读更多...

Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题

Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题

《Python爬虫HTTPS使用requests,httpx,aiohttp实战中的证书异步等问题》在爬虫工程里,“HTTPS”是绕不开的话题,HTTPS为传输加密提供保护,同时也给爬虫带来证书校验、... 目录一、核心问题与优先级检查（先问三件事）二、基础示例：requests 与证书处理三、高并发选型：

阅读更多...

利用Python操作Word文档页码的实际应用

利用Python操作Word文档页码的实际应用

《利用Python操作Word文档页码的实际应用》在撰写长篇文档时,经常需要将文档分成多个节,每个节都需要单独的页码,下面：本文主要介绍利用Python操作Word文档页码的相关资料,文中通过代码... 目录需求：文档详情：要求：该程序的功能是：总结需求：一次性处理24个文档的页码。文档详情：1、每个

阅读更多...

分析 Java Stream 的 peek使用实践与副作用处理方案

分析 Java Stream 的 peek使用实践与副作用处理方案

《分析JavaStream的peek使用实践与副作用处理方案》StreamAPI的peek操作是中间操作,用于观察元素但不终止流,其副作用风险包括线程安全、顺序混乱及性能问题,合理使用场景有限... 目录一、peek 操作的本质：有状态的中间操作二、副作用的定义与风险场景1. 并行流下的线程安全问题2. 顺

阅读更多...

Java 结构化并发Structured Concurrency实践举例

Java 结构化并发Structured Concurrency实践举例

《Java结构化并发StructuredConcurrency实践举例》Java21结构化并发通过作用域和任务句柄统一管理并发生命周期,解决线程泄漏与任务追踪问题,提升代码安全性和可观测性,其核心... 目录一、结构化并发的核心概念与设计目标二、结构化并发的核心组件（一）作用域（Scopes）（二）任务句柄

阅读更多...

Java中的Schema校验技术与实践示例详解

Java中的Schema校验技术与实践示例详解

《Java中的Schema校验技术与实践示例详解》本主题详细介绍了在Java环境下进行XMLSchema和JSONSchema校验的方法,包括使用JAXP、JAXB以及专门的JSON校验库等技术,本文... 目录1. XML和jsON的Schema校验概念1.1 XML和JSON校验的必要性1.2 Sche

阅读更多...

SpringBoot集成WebService(wsdl)实践

SpringBoot集成WebService(wsdl)实践

《SpringBoot集成WebService(wsdl)实践》文章介绍了SpringBoot项目中通过缓存IWebService接口实现类的泛型入参类型,减少反射调用提升性能的实现方案,包含依赖配置... 目录pom.XML创建入口ApplicationContextUtils.JavaJacksonUt

阅读更多...