千万级别的数据导出Redis、php

2024-08-21 23:52

本文主要是介绍千万级别的数据导出Redis、php,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

要处理千万级别数据涵盖了多表联查、条件筛选、Redis缓存优化、yield生成器优化内存,以及将数据导出到Excel文件。

方案概述

  1. 多表分步查询:避免直接的多表联查,通过逐表查询并在应用层进行数据组合,以减少数据库的锁定风险

  2. Redis 缓存:在多表联查过程中使用 Redis 进行中间结果的缓存,减少数据库查询次数。

  3. yield生成器:通过 PHP 的 yield 生成器逐条处理数据,减少内存占用。

  4. 分批导出:使用 PhpSpreadsheet 进行数据的分批写入,控制内存占用。

MySQL 表结构示例

假设有三张表 orderscustomers, 和 products,分别存储订单信息、客户信息和商品信息。

CREATE TABLE customers (id BIGINT PRIMARY KEY,name VARCHAR(255),email VARCHAR(255)
);CREATE TABLE products (id BIGINT PRIMARY KEY,name VARCHAR(255),price DECIMAL(10, 2)
);CREATE TABLE orders (id BIGINT PRIMARY KEY,customer_id BIGINT,product_id BIGINT,quantity INT,order_date DATETIME,FOREIGN KEY (customer_id) REFERENCES customers(id),FOREIGN KEY (product_id) REFERENCES products(id)
);

1. 分步查询与数据组合

首先分步查询每个表的数据,然后在应用层面合并这些数据,避免复杂的 SQL JOIN 操作

function fetchOrders($pdo, $batchSize, $offset, $conditions) {$sql = "SELECT * FROM orders WHERE $conditions LIMIT :limit OFFSET :offset";$stmt = $pdo->prepare($sql);$stmt->bindValue(':limit', $batchSize, PDO::PARAM_INT);$stmt->bindValue(':offset', $offset, PDO::PARAM_INT);$stmt->execute();return $stmt->fetchAll(PDO::FETCH_ASSOC);
}function fetchCustomers($pdo, $customerIds) {$inQuery = implode(',', array_fill(0, count($customerIds), '?'));$sql = "SELECT * FROM customers WHERE id IN ($inQuery)";$stmt = $pdo->prepare($sql);$stmt->execute($customerIds);return $stmt->fetchAll(PDO::FETCH_ASSOC);
}function fetchProducts($pdo, $productIds) {$inQuery = implode(',', array_fill(0, count($productIds), '?'));$sql = "SELECT * FROM products WHERE id IN ($inQuery)";$stmt = $pdo->prepare($sql);$stmt->execute($productIds);return $stmt->fetchAll(PDO::FETCH_ASSOC);
}function combineData($orders, $customers, $products) {$customerMap = array_column($customers, null, 'id');$productMap = array_column($products, null, 'id');foreach ($orders as &$order) {$order['customer_name'] = $customerMap[$order['customer_id']]['name'] ?? '';$order['product_name'] = $productMap[$order['product_id']]['name'] ?? '';$order['price'] = $productMap[$order['product_id']]['price'] ?? 0.0;}return $orders;
}

2. 使用 Redis 缓存中间数据

在进行下一步的查询和数据处理之前,缓存中间结果,减少重复查询。

function cacheOrdersInRedis($redis, $orders, $batchSize) {foreach ($orders as $order) {$redis->rpush('orders_cache', json_encode($order));}
}function getOrdersFromRedis($redis, $batchSize) {return array_map('json_decode', $redis->lrange('orders_cache', 0, $batchSize - 1));
}

3. 使用 yield 优化内存使用

通过 yield 逐条处理数据,避免内存占用过多。

function orderGenerator($redis, $batchSize) {while (true) {$orders = getOrdersFromRedis($redis, $batchSize);if (empty($orders)) {break;}foreach ($orders as $order) {yield $order;}// 删除已经处理的数据$redis->ltrim('orders_cache', $batchSize, -1);}
}

4. 分批导出到 Excel

使用 PhpSpreadsheet 分批写入数据到 Excel 文件中。

use PhpOffice\PhpSpreadsheet\Spreadsheet;
use PhpOffice\PhpSpreadsheet\Writer\Xlsx;function exportToExcel($filename, $dataGenerator) {$spreadsheet = new Spreadsheet();$sheet = $spreadsheet->getActiveSheet();$row = 1;foreach ($dataGenerator as $dataRow) {$col = 1;foreach ($dataRow as $value) {$sheet->setCellValueByColumnAndRow($col, $row, $value);$col++;}$row++;}$writer = new Xlsx($spreadsheet);$writer->save($filename);
}

5. 综合实现

$pdo = new PDO("mysql:host=localhost;dbname=test", "user", "pass");
$redis = new Redis();
$redis->connect('127.0.0.1', 6379);$batchSize = 10000;
$cacheKey = "orders_cache";
$filename = "export.xlsx";// 假设要筛选最近一个月的订单
$conditions = "order_date >= DATE_SUB(NOW(), INTERVAL 1 MONTH)";// 清空 Redis 缓存
$redis->del($cacheKey);$offset = 0;
while ($orders = fetchOrders($pdo, $batchSize, $offset, $conditions)) {// 获取关联数据$customerIds = array_column($orders, 'customer_id');$productIds = array_column($orders, 'product_id');$customers = fetchCustomers($pdo, $customerIds);$products = fetchProducts($pdo, $productIds);// 合并数据$combinedData = combineData($orders, $customers, $products);// 缓存数据到 RediscacheOrdersInRedis($redis, $combinedData, $batchSize);$offset += $batchSize;
}// 使用 `yield` 生成器逐条获取数据并导出
$dataGenerator = orderGenerator($redis, $batchSize);
exportToExcel($filename, $dataGenerator);echo "Data export completed.";

优化点

  1. 分步查询:避免直接进行多表 JOIN,减少数据库锁表风险。

  2. Redis 缓存:中间结果缓存到 Redis,减少重复的数据库查询,提高效率。

  3. yield 生成器:逐条处理数据,避免一次性加载大量数据到内存中,优化内存使用。

  4. 分批导出:通过 PhpSpreadsheet 分批写入 Excel,控制内存消耗。

这样可以有效避免大规模联表查询带来的锁表问题,同时保持数据处理的效率和内存的合理使用。

 

这篇关于千万级别的数据导出Redis、php的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!


原文地址:
本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:http://www.chinasem.cn/article/1094644

相关文章

Redis指南及6.2.x版本安装过程

《Redis指南及6.2.x版本安装过程》Redis是完全开源免费的,遵守BSD协议,是一个高性能(NOSQL)的key-value数据库,Redis是一个开源的使用ANSIC语言编写、支持网络、... 目录概述Redis特点Redis应用场景缓存缓存分布式会话分布式锁社交网络最新列表Redis各版本介绍旧

Java如何从Redis中批量读取数据

《Java如何从Redis中批量读取数据》:本文主要介绍Java如何从Redis中批量读取数据的情况,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一.背景概述二.分析与实现三.发现问题与屡次改进3.1.QPS过高而且波动很大3.2.程序中断,抛异常3.3.内存消

Redis中的Lettuce使用详解

《Redis中的Lettuce使用详解》Lettuce是一个高级的、线程安全的Redis客户端,用于与Redis数据库交互,Lettuce是一个功能强大、使用方便的Redis客户端,适用于各种规模的J... 目录简介特点连接池连接池特点连接池管理连接池优势连接池配置参数监控常用监控工具通过JMX监控通过Pr

解决mysql插入数据锁等待超时报错:Lock wait timeout exceeded;try restarting transaction

《解决mysql插入数据锁等待超时报错:Lockwaittimeoutexceeded;tryrestartingtransaction》:本文主要介绍解决mysql插入数据锁等待超时报... 目录报错信息解决办法1、数据库中执行如下sql2、再到 INNODB_TRX 事务表中查看总结报错信息Lock

使用C#删除Excel表格中的重复行数据的代码详解

《使用C#删除Excel表格中的重复行数据的代码详解》重复行是指在Excel表格中完全相同的多行数据,删除这些重复行至关重要,因为它们不仅会干扰数据分析,还可能导致错误的决策和结论,所以本文给大家介绍... 目录简介使用工具C# 删除Excel工作表中的重复行语法工作原理实现代码C# 删除指定Excel单元

Linux lvm实例之如何创建一个专用于MySQL数据存储的LVM卷组

《Linuxlvm实例之如何创建一个专用于MySQL数据存储的LVM卷组》:本文主要介绍使用Linux创建一个专用于MySQL数据存储的LVM卷组的实例,具有很好的参考价值,希望对大家有所帮助,... 目录在Centos 7上创建卷China编程组并配置mysql数据目录1. 检查现有磁盘2. 创建物理卷3. 创

Nacos日志与Raft的数据清理指南

《Nacos日志与Raft的数据清理指南》随着运行时间的增长,Nacos的日志文件(logs/)和Raft持久化数据(data/protocol/raft/)可能会占用大量磁盘空间,影响系统稳定性,本... 目录引言1. Nacos 日志文件(logs/ 目录)清理1.1 日志文件的作用1.2 是否可以删除

使用Python获取JS加载的数据的多种实现方法

《使用Python获取JS加载的数据的多种实现方法》在当今的互联网时代,网页数据的动态加载已经成为一种常见的技术手段,许多现代网站通过JavaScript(JS)动态加载内容,这使得传统的静态网页爬取... 目录引言一、动态 网页与js加载数据的原理二、python爬取JS加载数据的方法(一)分析网络请求1

Mac备忘录怎么导出/备份和云同步? Mac备忘录使用技巧

《Mac备忘录怎么导出/备份和云同步?Mac备忘录使用技巧》备忘录作为iOS里简单而又不可或缺的一个系统应用,上手容易,可以满足我们日常生活中各种记录的需求,今天我们就来看看Mac备忘录的导出、... 「备忘录」是 MAC 上的一款常用应用,它可以帮助我们捕捉灵感、记录待办事项或保存重要信息。为了便于在不同

python操作redis基础

《python操作redis基础》Redis(RemoteDictionaryServer)是一个开源的、基于内存的键值对(Key-Value)存储系统,它通常用作数据库、缓存和消息代理,这篇文章... 目录1. Redis 简介2. 前提条件3. 安装 python Redis 客户端库4. 连接到 Re