千万级别的数据导出Redis、php

2024-08-21 23:52

本文主要是介绍千万级别的数据导出Redis、php,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

要处理千万级别数据涵盖了多表联查、条件筛选、Redis缓存优化、yield生成器优化内存,以及将数据导出到Excel文件。

方案概述

  1. 多表分步查询:避免直接的多表联查,通过逐表查询并在应用层进行数据组合,以减少数据库的锁定风险

  2. Redis 缓存:在多表联查过程中使用 Redis 进行中间结果的缓存,减少数据库查询次数。

  3. yield生成器:通过 PHP 的 yield 生成器逐条处理数据,减少内存占用。

  4. 分批导出:使用 PhpSpreadsheet 进行数据的分批写入,控制内存占用。

MySQL 表结构示例

假设有三张表 orderscustomers, 和 products,分别存储订单信息、客户信息和商品信息。

CREATE TABLE customers (id BIGINT PRIMARY KEY,name VARCHAR(255),email VARCHAR(255)
);CREATE TABLE products (id BIGINT PRIMARY KEY,name VARCHAR(255),price DECIMAL(10, 2)
);CREATE TABLE orders (id BIGINT PRIMARY KEY,customer_id BIGINT,product_id BIGINT,quantity INT,order_date DATETIME,FOREIGN KEY (customer_id) REFERENCES customers(id),FOREIGN KEY (product_id) REFERENCES products(id)
);

1. 分步查询与数据组合

首先分步查询每个表的数据,然后在应用层面合并这些数据,避免复杂的 SQL JOIN 操作

function fetchOrders($pdo, $batchSize, $offset, $conditions) {$sql = "SELECT * FROM orders WHERE $conditions LIMIT :limit OFFSET :offset";$stmt = $pdo->prepare($sql);$stmt->bindValue(':limit', $batchSize, PDO::PARAM_INT);$stmt->bindValue(':offset', $offset, PDO::PARAM_INT);$stmt->execute();return $stmt->fetchAll(PDO::FETCH_ASSOC);
}function fetchCustomers($pdo, $customerIds) {$inQuery = implode(',', array_fill(0, count($customerIds), '?'));$sql = "SELECT * FROM customers WHERE id IN ($inQuery)";$stmt = $pdo->prepare($sql);$stmt->execute($customerIds);return $stmt->fetchAll(PDO::FETCH_ASSOC);
}function fetchProducts($pdo, $productIds) {$inQuery = implode(',', array_fill(0, count($productIds), '?'));$sql = "SELECT * FROM products WHERE id IN ($inQuery)";$stmt = $pdo->prepare($sql);$stmt->execute($productIds);return $stmt->fetchAll(PDO::FETCH_ASSOC);
}function combineData($orders, $customers, $products) {$customerMap = array_column($customers, null, 'id');$productMap = array_column($products, null, 'id');foreach ($orders as &$order) {$order['customer_name'] = $customerMap[$order['customer_id']]['name'] ?? '';$order['product_name'] = $productMap[$order['product_id']]['name'] ?? '';$order['price'] = $productMap[$order['product_id']]['price'] ?? 0.0;}return $orders;
}

2. 使用 Redis 缓存中间数据

在进行下一步的查询和数据处理之前,缓存中间结果,减少重复查询。

function cacheOrdersInRedis($redis, $orders, $batchSize) {foreach ($orders as $order) {$redis->rpush('orders_cache', json_encode($order));}
}function getOrdersFromRedis($redis, $batchSize) {return array_map('json_decode', $redis->lrange('orders_cache', 0, $batchSize - 1));
}

3. 使用 yield 优化内存使用

通过 yield 逐条处理数据,避免内存占用过多。

function orderGenerator($redis, $batchSize) {while (true) {$orders = getOrdersFromRedis($redis, $batchSize);if (empty($orders)) {break;}foreach ($orders as $order) {yield $order;}// 删除已经处理的数据$redis->ltrim('orders_cache', $batchSize, -1);}
}

4. 分批导出到 Excel

使用 PhpSpreadsheet 分批写入数据到 Excel 文件中。

use PhpOffice\PhpSpreadsheet\Spreadsheet;
use PhpOffice\PhpSpreadsheet\Writer\Xlsx;function exportToExcel($filename, $dataGenerator) {$spreadsheet = new Spreadsheet();$sheet = $spreadsheet->getActiveSheet();$row = 1;foreach ($dataGenerator as $dataRow) {$col = 1;foreach ($dataRow as $value) {$sheet->setCellValueByColumnAndRow($col, $row, $value);$col++;}$row++;}$writer = new Xlsx($spreadsheet);$writer->save($filename);
}

5. 综合实现

$pdo = new PDO("mysql:host=localhost;dbname=test", "user", "pass");
$redis = new Redis();
$redis->connect('127.0.0.1', 6379);$batchSize = 10000;
$cacheKey = "orders_cache";
$filename = "export.xlsx";// 假设要筛选最近一个月的订单
$conditions = "order_date >= DATE_SUB(NOW(), INTERVAL 1 MONTH)";// 清空 Redis 缓存
$redis->del($cacheKey);$offset = 0;
while ($orders = fetchOrders($pdo, $batchSize, $offset, $conditions)) {// 获取关联数据$customerIds = array_column($orders, 'customer_id');$productIds = array_column($orders, 'product_id');$customers = fetchCustomers($pdo, $customerIds);$products = fetchProducts($pdo, $productIds);// 合并数据$combinedData = combineData($orders, $customers, $products);// 缓存数据到 RediscacheOrdersInRedis($redis, $combinedData, $batchSize);$offset += $batchSize;
}// 使用 `yield` 生成器逐条获取数据并导出
$dataGenerator = orderGenerator($redis, $batchSize);
exportToExcel($filename, $dataGenerator);echo "Data export completed.";

优化点

  1. 分步查询:避免直接进行多表 JOIN,减少数据库锁表风险。

  2. Redis 缓存:中间结果缓存到 Redis,减少重复的数据库查询,提高效率。

  3. yield 生成器:逐条处理数据,避免一次性加载大量数据到内存中,优化内存使用。

  4. 分批导出:通过 PhpSpreadsheet 分批写入 Excel,控制内存消耗。

这样可以有效避免大规模联表查询带来的锁表问题,同时保持数据处理的效率和内存的合理使用。

 

这篇关于千万级别的数据导出Redis、php的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1094644

相关文章

Redis 基本数据类型和使用详解

《Redis基本数据类型和使用详解》String是Redis最基本的数据类型,一个键对应一个值,它的功能十分强大,可以存储字符串、整数、浮点数等多种数据格式,本文给大家介绍Redis基本数据类型和... 目录一、Redis 入门介绍二、Redis 的五大基本数据类型2.1 String 类型2.2 Hash

Redis中Hash从使用过程到原理说明

《Redis中Hash从使用过程到原理说明》RedisHash结构用于存储字段-值对,适合对象数据,支持HSET、HGET等命令,采用ziplist或hashtable编码,通过渐进式rehash优化... 目录一、开篇:Hash就像超市的货架二、Hash的基本使用1. 常用命令示例2. Java操作示例三

Redis中Set结构使用过程与原理说明

《Redis中Set结构使用过程与原理说明》本文解析了RedisSet数据结构,涵盖其基本操作(如添加、查找)、集合运算(交并差)、底层实现(intset与hashtable自动切换机制)、典型应用场... 目录开篇:从购物车到Redis Set一、Redis Set的基本操作1.1 编程常用命令1.2 集

Linux下利用select实现串口数据读取过程

《Linux下利用select实现串口数据读取过程》文章介绍Linux中使用select、poll或epoll实现串口数据读取,通过I/O多路复用机制在数据到达时触发读取,避免持续轮询,示例代码展示设... 目录示例代码(使用select实现)代码解释总结在 linux 系统里,我们可以借助 select、

Redis中的有序集合zset从使用到原理分析

《Redis中的有序集合zset从使用到原理分析》Redis有序集合(zset)是字符串与分值的有序映射,通过跳跃表和哈希表结合实现高效有序性管理,适用于排行榜、延迟队列等场景,其时间复杂度低,内存占... 目录开篇:排行榜背后的秘密一、zset的基本使用1.1 常用命令1.2 Java客户端示例二、zse

Redis中的AOF原理及分析

《Redis中的AOF原理及分析》Redis的AOF通过记录所有写操作命令实现持久化,支持always/everysec/no三种同步策略,重写机制优化文件体积,与RDB结合可平衡数据安全与恢复效率... 目录开篇:从日记本到AOF一、AOF的基本执行流程1. 命令执行与记录2. AOF重写机制二、AOF的

使用EasyPoi快速导出Word文档功能的实现步骤

《使用EasyPoi快速导出Word文档功能的实现步骤》EasyPoi是一个基于ApachePOI的开源Java工具库,旨在简化Excel和Word文档的操作,本文将详细介绍如何使用EasyPoi快速... 目录一、准备工作1、引入依赖二、准备好一个word模版文件三、编写导出方法的工具类四、在Export

前端导出Excel文件出现乱码或文件损坏问题的解决办法

《前端导出Excel文件出现乱码或文件损坏问题的解决办法》在现代网页应用程序中,前端有时需要与后端进行数据交互,包括下载文件,:本文主要介绍前端导出Excel文件出现乱码或文件损坏问题的解决办法,... 目录1. 检查后端返回的数据格式2. 前端正确处理二进制数据方案 1:直接下载(推荐)方案 2:手动构造

C#使用iText获取PDF的trailer数据的代码示例

《C#使用iText获取PDF的trailer数据的代码示例》开发程序debug的时候,看到了PDF有个trailer数据,挺有意思,于是考虑用代码把它读出来,那么就用到我们常用的iText框架了,所... 目录引言iText 核心概念C# 代码示例步骤 1: 确保已安装 iText步骤 2: C# 代码程

Pandas处理缺失数据的方式汇总

《Pandas处理缺失数据的方式汇总》许多教程中的数据与现实世界中的数据有很大不同,现实世界中的数据很少是干净且同质的,本文我们将讨论处理缺失数据的一些常规注意事项,了解Pandas如何表示缺失数据,... 目录缺失数据约定的权衡Pandas 中的缺失数据None 作为哨兵值NaN:缺失的数值数据Panda