pandas常用函数学习,从文件读取输出过程中学会处理数据

本文主要是介绍pandas常用函数学习,从文件读取输出过程中学会处理数据,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

欢迎关注微信公众号:excelwork

 上一篇文章通过一些简单的例子了解了pandas,今天将重点介绍下pandas读取数据常用的函数:read_csv,并通过to_csv函数输出数据到文件辅助理解。read_csv可用来读取url和带有分隔符csv格式文件等,参数如下:

pandas.read_csv(filepath_or_buffer:Union[str,pathlib.Path,IO[~AnyStr]],sep=',',delimiter=None,header='infer',names=None,index_col=None,usecols=None,squeeze=False,prefix=None,mangle_dupe_cols=True,dtype=None,engine=None,converters=None,true_values=None,false_values=None,skipinitialspace=False,skiprows=None,skipfooter=0,nrows=None,na_values=None,keep_default_na=True,na_filter=True,verbose=False,skip_blank_lines=True,parse_dates=False,infer_datetime_format=False,keep_date_col=False,date_parser=None,dayfirst=False,cache_dates=True,iterator=False,chunksize=None,compression='infer',thousands=None,decimal:str='.',lineterminator=None,quotechar='"',quoting=0,doublequote=True,escapechar=None,comment=None,encoding=None,dialect=None,error_bad_lines=True,warn_bad_lines=True,delim_whitespace=False,low_memory=True,memory_map=False, float_precision=None)

    充分理解读取函数的参数,有助于我们在第一步读取阶段,就可以将数据问题处理一大半。

一、数据读取看一下结构

    参数先默认,直接使用read_csv函数读取全部数据,如下图(用截图excel文件内容展示):

data=pd.read_csv(r'C:\Users\king\Desktop\示例数据.csv')
print (data)

 

二、过滤多余行,获取红框中数据内容

    除了红框内标准数据,前6行和后7行数据我们是不需要的。

2.1 先使用skiprows参数跳过前6行

data=pd.read_csv(r'C:\Users\king\Desktop\示例数据.csv',skiprows=6)
data.to_csv(r'C:\Users\king\Desktop\skiprows_1.csv')#输出到excel方便大家阅读体验

    结果如下:如红框中所示,乱码了,咱接着往后看如何解决~

2.2 输出文件中文乱码

    上面输出数据中文乱码,我们使用encoding参数将格式转成gbk,如下图黄框所示,中文内容输出后正常。

data=pd.read_csv(r'C:\Users\king\Desktop\示例数据.csv',skiprows=6)
data.to_csv(r'C:\Users\king\Desktop\skiprows_1.csv',encoding='gbk')

2.3 使用skipfooter过滤后7行​​​​​​​

data=pd.read_csv(r'C:\Users\king\Desktop\示例数据.csv',skiprows=6,skipfooter=7,encoding='utf-8',engine='python')
data.to_csv(r'C:\Users\king\Desktop\skiprows_2.csv',encoding='gbk')

    嗯~又报错了看上去还是编码问题~解决它!

UnicodeEncodeError: 'gbk' codec can't encode character '\ufffd' in position 23: illegal multibyte sequence

2.4 使用skipfooter报错解决

    我们在读取时encoding='utf-8'再次尝试,没问题,不过出现了警告,根据警告提示,我们读取时限定下engine='python'即可。

ParserWarning: Falling back to the 'python' engine because the 'c' engine does not support skipfooter; you can avoid this warning by specifying engine='python'.​​​​​​​

data=pd.read_csv(r'C:\Users\king\Desktop\示例数据.csv',skiprows=6,skipfooter=7,encoding='utf-8',engine='python')
data.to_csv(r'C:\Users\king\Desktop\kingskiprows_2.csv',encoding='gbk')

    结果如下:

 

三 修改表结构

3.1 修改表头名

    我们看到,表头还包含括号,不便于后续调用列,所以我们在读取时就处理好。

3.1.1 跳过原有标题行,自定义列名

    因为之前输出文件名skiprows_2的文件时,编码是gbk,所以读取skiprows_2文件的时候,encoding=‘gbk'。​​​​​​​

data=pd.read_csv(r'C:\Users\king\Desktop\skiprows_2.csv',skiprows=1,encoding='gbk',engine='python',names=['震级','时刻','纬度','经度','深度','位置'])
data.to_csv(r'C:\Users\king\Desktop\skiprows_3.csv',encoding='gbk'

3.2 避免每次读取增加索引列

    如上图前两列重复,我们最多需要一列这种索引列,如何去除多余列?

此次读取skiprows_2文件里,设置索引列为空,参数index_col=False即可。​​​​​​​

data=pd.read_csv(r'C:\Users\king\Desktop\skiprows_2.csv',skiprows=1,encoding='gbk',engine='python',names=['震级','时刻','纬度','经度','深度','位置'])
data.index_col=False
data.to_csv(r'C:\Users\king\Desktop\skiprows_3.csv',encoding='gbk')

四、数据处理

4.1 空值处理

    如果源文件里空值存成了NULL,想显示空即可,参数na_values​​​​​​​

data=pd.read_csv(r'C:\Users\king\Desktop\skiprows_3.csv',encoding='gbk',engine='python',na_values='')data.to_csv(r'C:\Users\king\Desktop\skiprows_4.csv',encoding='gbk')

4.2 大文件处理

    当数据过大,导致读取过慢,可通过参数chunksize限制数据块大小。

 

data=pd.read_csv(r'C:\Users\king\Desktop\skiprows_3.csv',chunksize=10000)

这篇关于pandas常用函数学习,从文件读取输出过程中学会处理数据的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/855864

相关文章

使用Java将各种数据写入Excel表格的操作示例

《使用Java将各种数据写入Excel表格的操作示例》在数据处理与管理领域,Excel凭借其强大的功能和广泛的应用,成为了数据存储与展示的重要工具,在Java开发过程中,常常需要将不同类型的数据,本文... 目录前言安装免费Java库1. 写入文本、或数值到 Excel单元格2. 写入数组到 Excel表格

Python中pywin32 常用窗口操作的实现

《Python中pywin32常用窗口操作的实现》本文主要介绍了Python中pywin32常用窗口操作的实现,pywin32主要的作用是供Python开发者快速调用WindowsAPI的一个... 目录获取窗口句柄获取最前端窗口句柄获取指定坐标处的窗口根据窗口的完整标题匹配获取句柄根据窗口的类别匹配获取句

Java 中的 @SneakyThrows 注解使用方法(简化异常处理的利与弊)

《Java中的@SneakyThrows注解使用方法(简化异常处理的利与弊)》为了简化异常处理,Lombok提供了一个强大的注解@SneakyThrows,本文将详细介绍@SneakyThro... 目录1. @SneakyThrows 简介 1.1 什么是 Lombok?2. @SneakyThrows

在 Spring Boot 中实现异常处理最佳实践

《在SpringBoot中实现异常处理最佳实践》本文介绍如何在SpringBoot中实现异常处理,涵盖核心概念、实现方法、与先前查询的集成、性能分析、常见问题和最佳实践,感兴趣的朋友一起看看吧... 目录一、Spring Boot 异常处理的背景与核心概念1.1 为什么需要异常处理?1.2 Spring B

python处理带有时区的日期和时间数据

《python处理带有时区的日期和时间数据》这篇文章主要为大家详细介绍了如何在Python中使用pytz库处理时区信息,包括获取当前UTC时间,转换为特定时区等,有需要的小伙伴可以参考一下... 目录时区基本信息python datetime使用timezonepandas处理时区数据知识延展时区基本信息

Qt实现网络数据解析的方法总结

《Qt实现网络数据解析的方法总结》在Qt中解析网络数据通常涉及接收原始字节流,并将其转换为有意义的应用层数据,这篇文章为大家介绍了详细步骤和示例,感兴趣的小伙伴可以了解下... 目录1. 网络数据接收2. 缓冲区管理(处理粘包/拆包)3. 常见数据格式解析3.1 jsON解析3.2 XML解析3.3 自定义

SpringMVC 通过ajax 前后端数据交互的实现方法

《SpringMVC通过ajax前后端数据交互的实现方法》:本文主要介绍SpringMVC通过ajax前后端数据交互的实现方法,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价... 在前端的开发过程中,经常在html页面通过AJAX进行前后端数据的交互,SpringMVC的controll

Pandas透视表(Pivot Table)的具体使用

《Pandas透视表(PivotTable)的具体使用》透视表用于在数据分析和处理过程中进行数据重塑和汇总,本文就来介绍一下Pandas透视表(PivotTable)的具体使用,感兴趣的可以了解一下... 目录前言什么是透视表?使用步骤1. 引入必要的库2. 读取数据3. 创建透视表4. 查看透视表总结前言

pandas中位数填充空值的实现示例

《pandas中位数填充空值的实现示例》中位数填充是一种简单而有效的方法,用于填充数据集中缺失的值,本文就来介绍一下pandas中位数填充空值的实现,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是中位数填充?为什么选择中位数填充?示例数据结果分析完整代码总结在数据分析和机器学习过程中,处理缺失数

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen