大数据 - 行式存储与列式存储

2024-09-07 03:20
文章标签 数据 存储 列式 行式

本文主要是介绍大数据 - 行式存储与列式存储,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

为什么要区分?

大多数数据库系统存储一组数据记录,这些记录由表中的列和行组成。表可以水平分区(将属于同一行的值存储在一起),也可以垂直分区(将属于同一列的值存储在一起)。
数据库用于存储、检索和管理大量数据,一般情况下,数据库系统采用了两种主要的存储方式:行式存储和列式存储。
在数据库管理系统中,数据存储的方式对性能和效率有重要影响,所以用户可以根据业务场景自行选择行存还是列存的数据库。
在这里插入图片描述

行式存储

在行式存储中,一条记录(即一行数据)被存储在一块连续的物理空间中,而整张表的所有记录按照一定的顺序依次存放。
适用的场景,如:数据记录(姓名、出生日期和电话号码)类的数据。即:由多个字段组成且用某个键(在本例中为单调递增的ID)进行唯一标识。
表示单个用户的数据记录的所有字段通常被一起读取,在创建数据时(例如,当用户填写注册表单时),我们也将它们一起写入数据库,同时我们可以单独修改某个字段。因为诸如磁盘之类的持久性介质上的数据通常是按块访问的(换句话说,磁盘访问的最小单位是块),所以单个块可能将包含某行中所有列的数据。

对于我们希望访问用户的整条记录的情况非常有用,但这样的存储布局会使访问多个用户记录某个字段的查询(例如,只获取电话号码的查询)开销更大,因为其他字段的数据在这个过程中也会被读入。

优势:
A. 顺序访问:由于行式存储按照记录的顺序进行存储,因此可以快速地访问特定的记录,即通过主键或索引进行查询。
B. 事务处理:由于行式存储按照记录的顺序进行存储,因此在执行事务处理(如增删改查操作)时,行式存储能够更好地支持并发控制和恢复机制。
C. 完整性约束:行式存储可以更好地支持完整性约束,如主键、外键等。
劣势:
A. 空间利用:如果某些行的某些列没有值,那么这些位置将会被占用,造成空间浪费。
B. 数据压缩:由于行式存储是按照记录的顺序进行存储的,因此无法简单地利用数据压缩技术来减少存储空间。
C. 全表扫描:在查询时,如果需要通过全表扫描来查找满足某些条件的数据,那么将会带来较大的性能开销。

列式存储

在列式存储中,同一列的所有数据都被存储在一起,而不同列的数据则被分开存储。
适用的场景,如:存储股票市场的历史价格,那么股票价格这一列的数据便会被存储在一起。不同列的值存储在不同的文件或文件段中,可以按列进行有效的查询,因为它们可以一次性地被读取出来,而不是先对整行进行读取后再丢弃掉不需要的列。

面向列的存储非常适合计算聚合的分析型工作负载,如:查找趋势、计算平均值等。

优势:
A. 数据压缩:在列式存储中,将同一列的数据存储在一起,因此可以使用更高效的数据压缩算法来减少存储空间。如果某一列的数据类型都是相同的(如全部为数字),那么可以使用位图索引等技术来进行压缩。
B. 查询优化:在列式存储中,数据是按照列进行组织的,因此在查询时可以更快地定位到满足条件的数据。此外,列式存储也支持更高级的索引技术(如位图索引、B树索引等),进一步提高了查询性能。
C. 分页和缓存:列式存储在分页和缓存方面也表现出较好的性能。由于同一页或缓存块中的数据是同一列的,因此可以减少I/O操作次数。
劣势:
A. 访问特定行:在列式存储中,数据是按照列进行组织的,因此在访问特定的行数据时需要更多的I/O操作。
B. 事务处理:由于列式存储的数据是分开的,因此在执行事务处理(如增删改查操作)时需要更多的锁资源,可能影响并发性能。

优劣对比

在这里插入图片描述

总结

A. 行式存储在数据写入和修改上具有优势;列式存储在数据读取和解析、分析数据上具有优势。
B. 将具有相同数据类型的值存储在一起(例如,数字与数字在一起,字符串与字符串在一起)可以提高压缩率。我们可以根据不同的数据类型使用不同的压缩算法,并为每种情况选择最有效的压缩方法。

这篇关于大数据 - 行式存储与列式存储的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1143909

相关文章

C#监听txt文档获取新数据方式

《C#监听txt文档获取新数据方式》文章介绍通过监听txt文件获取最新数据,并实现开机自启动、禁用窗口关闭按钮、阻止Ctrl+C中断及防止程序退出等功能,代码整合于主函数中,供参考学习... 目录前言一、监听txt文档增加数据二、其他功能1. 设置开机自启动2. 禁止控制台窗口关闭按钮3. 阻止Ctrl +

java如何实现高并发场景下三级缓存的数据一致性

《java如何实现高并发场景下三级缓存的数据一致性》这篇文章主要为大家详细介绍了java如何实现高并发场景下三级缓存的数据一致性,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 下面代码是一个使用Java和Redisson实现的三级缓存服务,主要功能包括:1.缓存结构:本地缓存:使

在MySQL中实现冷热数据分离的方法及使用场景底层原理解析

《在MySQL中实现冷热数据分离的方法及使用场景底层原理解析》MySQL冷热数据分离通过分表/分区策略、数据归档和索引优化,将频繁访问的热数据与冷数据分开存储,提升查询效率并降低存储成本,适用于高并发... 目录实现冷热数据分离1. 分表策略2. 使用分区表3. 数据归档与迁移在mysql中实现冷热数据分

C#解析JSON数据全攻略指南

《C#解析JSON数据全攻略指南》这篇文章主要为大家详细介绍了使用C#解析JSON数据全攻略指南,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、为什么jsON是C#开发必修课?二、四步搞定网络JSON数据1. 获取数据 - HttpClient最佳实践2. 动态解析 - 快速

MyBatis-Plus通用中等、大量数据分批查询和处理方法

《MyBatis-Plus通用中等、大量数据分批查询和处理方法》文章介绍MyBatis-Plus分页查询处理,通过函数式接口与Lambda表达式实现通用逻辑,方法抽象但功能强大,建议扩展分批处理及流式... 目录函数式接口获取分页数据接口数据处理接口通用逻辑工具类使用方法简单查询自定义查询方法总结函数式接口

SpringBoot3.X 整合 MinIO 存储原生方案

《SpringBoot3.X整合MinIO存储原生方案》本文详细介绍了SpringBoot3.X整合MinIO的原生方案,从环境搭建到核心功能实现,涵盖了文件上传、下载、删除等常用操作,并补充了... 目录SpringBoot3.X整合MinIO存储原生方案:从环境搭建到实战开发一、前言:为什么选择MinI

SQL中如何添加数据(常见方法及示例)

《SQL中如何添加数据(常见方法及示例)》SQL全称为StructuredQueryLanguage,是一种用于管理关系数据库的标准编程语言,下面给大家介绍SQL中如何添加数据,感兴趣的朋友一起看看吧... 目录在mysql中,有多种方法可以添加数据。以下是一些常见的方法及其示例。1. 使用INSERT I

Python使用vllm处理多模态数据的预处理技巧

《Python使用vllm处理多模态数据的预处理技巧》本文深入探讨了在Python环境下使用vLLM处理多模态数据的预处理技巧,我们将从基础概念出发,详细讲解文本、图像、音频等多模态数据的预处理方法,... 目录1. 背景介绍1.1 目的和范围1.2 预期读者1.3 文档结构概述1.4 术语表1.4.1 核

MySQL 删除数据详解(最新整理)

《MySQL删除数据详解(最新整理)》:本文主要介绍MySQL删除数据的相关知识,本文通过实例代码给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录一、前言二、mysql 中的三种删除方式1.DELETE语句✅ 基本语法: 示例:2.TRUNCATE语句✅ 基本语

Python实现对阿里云OSS对象存储的操作详解

《Python实现对阿里云OSS对象存储的操作详解》这篇文章主要为大家详细介绍了Python实现对阿里云OSS对象存储的操作相关知识,包括连接,上传,下载,列举等功能,感兴趣的小伙伴可以了解下... 目录一、直接使用代码二、详细使用1. 环境准备2. 初始化配置3. bucket配置创建4. 文件上传到os