一种快速生成CSV的方法

2024-09-08 07:28
文章标签 方法 快速 生成 csv 一种

本文主要是介绍一种快速生成CSV的方法,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

事情是这个样子的

在QQ群在聊把如何100万数据导出成CSV文件?会不会很慢?

俺回了一句“现在的机器性能好,没啥问题”。

然后大家开始谈论机器的配置了。哎,俺的机器配置有点差。

然后俺就进行了一个测试。

测试数据

数据定义

        public struct Rec
        {
            public int v1;
            public int v2;
        }
        private Rec[] Data;

        这里为啥不用class呢,因为这个场景struct 更简单。

测试数据生成

            Data = new Rec[200*10000];
            Random r = new Random(DateTime.Now.Millisecond);
            for(int i= 0;i < Data.Length;i++)
            {
                Data[i].v1 = r.Next();
                Data[i].v2 = r.Next();
            }

测试数据200万行,每行2个数字。

测试结果

测试程序为 .NET Framework 4.8 64 Release 版本

如果用.Net 8 版本进行测试,除了方法3之外,会快一些。方法3速度基本不变。

 开始写代码

方法一

这是最最普通的生成CSV的方法,就是一个一个数据的写入到CSV中。没啥可说的。就是用来当做参照物的,耗时0.536秒

            string fn = @"1.csv";  FileStream fs = new FileStream(fn, FileMode.Create);DateTime t1 = DateTime.Now;byte[] buff;byte[] buff_rn = ASCIIEncoding.ASCII.GetBytes("\r\n");byte[] buff_split = ASCIIEncoding.ASCII.GetBytes(",");string s ="v1,v2";buff = ASCIIEncoding.ASCII.GetBytes(s);fs.Write(buff,0,buff.Length);foreach (Rec i in Data){fs.Write(buff_rn, 0, buff_rn.Length); s = i.v1.ToString();buff = ASCIIEncoding.ASCII.GetBytes(s);fs.Write(buff, 0, buff.Length);fs.Write(buff_split, 0, buff_split.Length);s = i.v2.ToString();buff = ASCIIEncoding.ASCII.GetBytes(s);fs.Write(buff, 0, buff.Length);  }fs.Flush();fs.Close();fs.Dispose();DateTime t2 = DateTime.Now;label1.Text=("输出"+Data.Length.ToString()+"行CSV文件,耗时" +((t2 - t1).TotalMilliseconds/1000).ToString("0.000")+"秒");

方法二

在方法1上加了一个8M的缓存。其实这种写法在其他语言(c++、delphi 等)还有效果,C#效果不大,因为C#的文件流本身有优惠。耗时0.503秒

            string fn = @"2.csv"; int ms_size = 8 * 1024 * 1024;byte[] ms=new byte[ms_size + 1024];int ms_position = 0;FileStream fs = new FileStream(fn, FileMode.Create);DateTime t1 = DateTime.Now;byte[] buff;byte[] buff_rn = ASCIIEncoding.ASCII.GetBytes("\r\n");byte[] buff_split = ASCIIEncoding.ASCII.GetBytes(",");string s = "v1,v2";buff = ASCIIEncoding.ASCII.GetBytes(s);Array.Copy(buff, 0, ms, ms_position, buff.Length);ms_position+= buff.Length;foreach (Rec i in Data){Array.Copy(buff_rn, 0, ms, ms_position, buff_rn.Length);ms_position += buff_rn.Length; s = i.v1.ToString();buff = ASCIIEncoding.ASCII.GetBytes(s); Array.Copy(buff, 0, ms, ms_position, buff.Length);ms_position += buff.Length;Array.Copy(buff_split, 0, ms, ms_position, buff_split.Length);ms_position += buff_split.Length;s = i.v2.ToString();buff = ASCIIEncoding.ASCII.GetBytes(s);Array.Copy(buff, 0, ms, ms_position, buff.Length);ms_position += buff.Length;if (ms_position > ms_size){ fs.Write(ms,0, ms_position); ms_position = 0;}}if (ms_position > 0){fs.Write(ms, 0, ms_position);}fs.Flush();fs.Close();fs.Dispose();DateTime t2 = DateTime.Now;label2.Text = ("输出" + Data.Length.ToString() + "行CSV文件,耗时" + ((t2 - t1).TotalMilliseconds / 1000).ToString("0.000") + "秒");

优化

我们先分析一下,生成CSV中,主要的计算是啥?在这个测试上主要计算就是,整型转字符串。执行了400万次(200万行,每行2个数字)整型转字符串。那么我们就先测试一下执行了400万次整型转字符串多少时间。

            string s = "";DateTime t1 = DateTime.Now;foreach (Rec i in Data){s = i.v1.ToString();s = i.v2.ToString();}DateTime t2 = DateTime.Now;label4.Text = ( (Data.Length*2).ToString() + "次ToString,耗时" + ((t2 - t1).TotalMilliseconds / 1000).ToString("0.000") + "秒");

耗时是0.265秒

那么我们就像从 整型转字符串 开始优化。

方法三

  使用了 IntToString 函数,速度优化到了 耗时0.176秒。优化到这里出现了一个有趣的数据:

 只执行 整型转字符串 耗时是0.265秒,方法三的速度比只 整型转字符串 还快。为什么呢?

因为在 方法三 中,其实没有使用字符串,取消中间商赚差价。

           string fn = @"3.csv";int ms_size = 8 * 1024 * 1024;byte[] ms = new byte[ms_size + 1024];int ms_position = 0;FileStream fs = new FileStream(fn, FileMode.Create);DateTime t1 = DateTime.Now;byte[] buff;byte[] buff_rn = ASCIIEncoding.ASCII.GetBytes("\r\n");byte[] buff_split = ASCIIEncoding.ASCII.GetBytes(",");string s = "v1,v2";buff = ASCIIEncoding.ASCII.GetBytes(s);Array.Copy(buff, 0, ms, ms_position, buff.Length);ms_position += buff.Length;foreach (Rec i in Data){Array.Copy(buff_rn, 0, ms, ms_position, buff_rn.Length);ms_position += buff_rn.Length;IntToString(i.v1,ref ms, ref ms_position); Array.Copy(buff_split, 0, ms, ms_position, buff_split.Length);ms_position += buff_split.Length;IntToString(i.v2, ref ms, ref ms_position);if (ms_position > ms_size){fs.Write(ms, 0, ms_position);ms_position = 0;}}if (ms_position > 0){fs.Write(ms, 0, ms_position);}fs.Flush();fs.Close();fs.Dispose();DateTime t2 = DateTime.Now;label3.Text = ("输出" + Data.Length.ToString() + "行CSV文件,耗时" + ((t2 - t1).TotalMilliseconds / 1000).ToString("0.000") + "秒");

这个代码的功能  其实就个 int.ToString。 看上去下面这个代码有点拉胯,像是那种故意搞笑的代码,是的确实拉胯,但是它确实快。

        public static void IntToString(int n,ref byte[] buff,ref int position){int len = 0;int len_inc = 16;int p = position+ len_inc;do{buff[p] = (byte)((n % 10)+48);p += 1;len += 1;}while ((n /= 10) != 0);p -= 1;for (int i = 0; i < len;i++){buff[position]= buff[p];position += 1;p -= 1;} }

其他

Release 版本 和 Debug版本差别很大,例如 方法三 的Debug版 速度并不快,但是用Release 版本,方法3就明显快。

使用.Net 8 版本进行测试,结果如下

.NET Framework 4.8.Net 8对比
方法10.5380.257.Net 8 快很多
方法20.5030.190.Net 8 快很多
方法30.1760.178两者差不多
整型转字符串0.2650.075.Net 8 快很多

上面的数据进行时测试,不是很准确。但是可以看出 :

.Net 8 在 整型转字符串 上要快很多。方法三因为没有用 .ToString() 所以 速度在.NET Framework 4.8  和  .Net 8 下差不多。

这篇关于一种快速生成CSV的方法的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1147491

相关文章

python获取指定名字的程序的文件路径的两种方法

《python获取指定名字的程序的文件路径的两种方法》本文主要介绍了python获取指定名字的程序的文件路径的两种方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要... 最近在做项目,需要用到给定一个程序名字就可以自动获取到这个程序在Windows系统下的绝对路径,以下

Java使用Javassist动态生成HelloWorld类

《Java使用Javassist动态生成HelloWorld类》Javassist是一个非常强大的字节码操作和定义库,它允许开发者在运行时创建新的类或者修改现有的类,本文将简单介绍如何使用Javass... 目录1. Javassist简介2. 环境准备3. 动态生成HelloWorld类3.1 创建CtC

JavaScript中的高级调试方法全攻略指南

《JavaScript中的高级调试方法全攻略指南》什么是高级JavaScript调试技巧,它比console.log有何优势,如何使用断点调试定位问题,通过本文,我们将深入解答这些问题,带您从理论到实... 目录观点与案例结合观点1观点2观点3观点4观点5高级调试技巧详解实战案例断点调试:定位变量错误性能分

Python实现批量CSV转Excel的高性能处理方案

《Python实现批量CSV转Excel的高性能处理方案》在日常办公中,我们经常需要将CSV格式的数据转换为Excel文件,本文将介绍一个基于Python的高性能解决方案,感兴趣的小伙伴可以跟随小编一... 目录一、场景需求二、技术方案三、核心代码四、批量处理方案五、性能优化六、使用示例完整代码七、小结一、

Python中 try / except / else / finally 异常处理方法详解

《Python中try/except/else/finally异常处理方法详解》:本文主要介绍Python中try/except/else/finally异常处理方法的相关资料,涵... 目录1. 基本结构2. 各部分的作用tryexceptelsefinally3. 执行流程总结4. 常见用法(1)多个e

JavaScript中比较两个数组是否有相同元素(交集)的三种常用方法

《JavaScript中比较两个数组是否有相同元素(交集)的三种常用方法》:本文主要介绍JavaScript中比较两个数组是否有相同元素(交集)的三种常用方法,每种方法结合实例代码给大家介绍的非常... 目录引言:为什么"相等"判断如此重要?方法1:使用some()+includes()(适合小数组)方法2

504 Gateway Timeout网关超时的根源及完美解决方法

《504GatewayTimeout网关超时的根源及完美解决方法》在日常开发和运维过程中,504GatewayTimeout错误是常见的网络问题之一,尤其是在使用反向代理(如Nginx)或... 目录引言为什么会出现 504 错误?1. 探索 504 Gateway Timeout 错误的根源 1.1 后端

Python从Word文档中提取图片并生成PPT的操作代码

《Python从Word文档中提取图片并生成PPT的操作代码》在日常办公场景中,我们经常需要从Word文档中提取图片,并将这些图片整理到PowerPoint幻灯片中,手动完成这一任务既耗时又容易出错,... 目录引言背景与需求解决方案概述代码解析代码核心逻辑说明总结引言在日常办公场景中,我们经常需要从 W

MySQL 表空却 ibd 文件过大的问题及解决方法

《MySQL表空却ibd文件过大的问题及解决方法》本文给大家介绍MySQL表空却ibd文件过大的问题及解决方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考... 目录一、问题背景:表空却 “吃满” 磁盘的怪事二、问题复现:一步步编程还原异常场景1. 准备测试源表与数据

python 线程池顺序执行的方法实现

《python线程池顺序执行的方法实现》在Python中,线程池默认是并发执行任务的,但若需要实现任务的顺序执行,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋... 目录方案一:强制单线程(伪顺序执行)方案二:按提交顺序获取结果方案三:任务间依赖控制方案四:队列顺序消