用pandas轻松搞定数据探索性分析(pandas参数、pandas风格、pandas-profiling)

2023-12-24 17:08

本文主要是介绍用pandas轻松搞定数据探索性分析(pandas参数、pandas风格、pandas-profiling),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

对于每个从事和数据科学有关的人来说,大部分的时间都花在了前期的数据工作中,包括清洗、处理、探索性数据分析等。前期的工作不仅关乎数据的质量,也关乎最终模型预测效果的好坏。本文介绍一些比较冷门但效果不错的pandas方法来对数据进行初步探索,已经最后介绍一个非常方便实用的库pandas-profiling。

import pandas as pd
import numpy as np

展示全部特征列 

data = pd.read_csv('loans_2020.csv')
data.head()

首先我们看到,对于一些比较大型的数据集导入时,会像上图这样将特征缩略,不能很好地直观看到所有的特征,那么此时可以将pandas的设置更改一下:

pd.set_option('display.max_columns', None)
data.head()

其中None可以改为你想要展示的具体最大列数。

展示单元格的全部内容

data1 = pd.DataFrame({'name': ['O'*80, 'X'*80]})
data1

像上图中如果一个单元格内的内容太多可能会缩略掉,若想展示全部内容的话也可以通过pandas设置来改变:

pd.set_option('display.max_colwidth', None)
data1

改变单元格中的浮点数位数

data2 = pd.DataFrame(np.random.randn(8, 5))
data2

pandas的单元格内浮点数默认为六位,我们可以通过pandas的设置来改变浮点数的位数:

pd.set_option('display.precision', 3)
data2

重置pandas设置

比如我们想要将上面的浮点数设置还原成原来的六位,那我们可以通过reset_option:

pd.reset_option('display.precision')
data2


改变单元格中浮点数的格式

pd.set_option('display.float_format', '{:.2%}'.format)
data2

还可以通过format的方法对不同的列进行不同的改变格式,首先创建一个分组数据:

pd.reset_option('display.float_format')
data.groupby('grade')['installment'].agg(['mean', 'sum', 'count']).reset_index()

然后通过.style.format的方法:

data.groupby('grade')['installment'].agg(['mean', 'sum', 'count']).reset_index().style.format({'mean':'${0:,.2f}', 'sum':'${0:,.2f}'})

 

用色条显示出列中的最大值与最小值

然后我们再尝试加入新的一列:

group_data = data.groupby('grade')['installment'].agg(['mean', 'sum', 'count']).reset_index()
group_data['count_%'] = group_data['count']/data['installment'].count()
group_data

format_dict = {'mean':'${0:,.2f}', 'sum': '${0:,.0f}', 'count_%': '{:.2%}'}(group_data.style.format(format_dict).highlight_max(subset='count_%', color='red').highlight_min(subset='count_%' ,color='lightgreen'))

 

用渐变色块展示列中数值的大小

(group_data.style.format(format_dict).background_gradient(subset=['mean', 'sum'], cmap='BuGn'))

在dataframe中我们还可以使用柱状图来展示:

(group_data.style.format(format_dict).bar(color='lightblue', vmin=0, subset=['mean'], align='left').bar(color='lightgreen', vmin=0, subset=['sum'], align='left'))

 

一行代码展示数据探索性分析

利用pandas-profiling库我们可以非常便捷有效地对pandas数据进行初步探索性分析。

首先是安装方法:

# 注意是“-”而不是“_”
pip install pandas-profiling
# 清华源
pip install -i https://pypi.tuna.tsinghua.edu.cn/simple pandas-profiling
from pandas_profiling import ProfileReport
# 两种方法,ProfileReport(data)或者下面这种
data.profile_report()

经过片刻等待后,一份清晰完整的数据探索性分析报告就展示在我们面前了,包括每个特征的属性与分布,一些警告,特征之间的相关性,以及对缺失值的统计等。 

 


数据集与代码可关注公众号“数据科学与人工智能技术”并发送“探索性分析”获取。

 

这篇关于用pandas轻松搞定数据探索性分析(pandas参数、pandas风格、pandas-profiling)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/532481

相关文章

MySQL 内存使用率常用分析语句

《MySQL内存使用率常用分析语句》用户整理了MySQL内存占用过高的分析方法,涵盖操作系统层确认及数据库层bufferpool、内存模块差值、线程状态、performance_schema性能数据... 目录一、 OS层二、 DB层1. 全局情况2. 内存占js用详情最近连续遇到mysql内存占用过高导致

解决pandas无法读取csv文件数据的问题

《解决pandas无法读取csv文件数据的问题》本文讲述作者用Pandas读取CSV文件时因参数设置不当导致数据错位,通过调整delimiter和on_bad_lines参数最终解决问题,并强调正确参... 目录一、前言二、问题复现1. 问题2. 通过 on_bad_lines=‘warn’ 跳过异常数据3

深度解析Nginx日志分析与499状态码问题解决

《深度解析Nginx日志分析与499状态码问题解决》在Web服务器运维和性能优化过程中,Nginx日志是排查问题的重要依据,本文将围绕Nginx日志分析、499状态码的成因、排查方法及解决方案展开讨论... 目录前言1. Nginx日志基础1.1 Nginx日志存放位置1.2 Nginx日志格式2. 499

C#监听txt文档获取新数据方式

《C#监听txt文档获取新数据方式》文章介绍通过监听txt文件获取最新数据,并实现开机自启动、禁用窗口关闭按钮、阻止Ctrl+C中断及防止程序退出等功能,代码整合于主函数中,供参考学习... 目录前言一、监听txt文档增加数据二、其他功能1. 设置开机自启动2. 禁止控制台窗口关闭按钮3. 阻止Ctrl +

java如何实现高并发场景下三级缓存的数据一致性

《java如何实现高并发场景下三级缓存的数据一致性》这篇文章主要为大家详细介绍了java如何实现高并发场景下三级缓存的数据一致性,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 下面代码是一个使用Java和Redisson实现的三级缓存服务,主要功能包括:1.缓存结构:本地缓存:使

小白也能轻松上手! 路由器设置优化指南

《小白也能轻松上手!路由器设置优化指南》在日常生活中,我们常常会遇到WiFi网速慢的问题,这主要受到三个方面的影响,首要原因是WiFi产品的配置优化不合理,其次是硬件性能的不足,以及宽带线路本身的质... 在数字化时代,网络已成为生活必需品,追剧、游戏、办公、学习都离不开稳定高速的网络。但很多人面对新路由器

在MySQL中实现冷热数据分离的方法及使用场景底层原理解析

《在MySQL中实现冷热数据分离的方法及使用场景底层原理解析》MySQL冷热数据分离通过分表/分区策略、数据归档和索引优化,将频繁访问的热数据与冷数据分开存储,提升查询效率并降低存储成本,适用于高并发... 目录实现冷热数据分离1. 分表策略2. 使用分区表3. 数据归档与迁移在mysql中实现冷热数据分

C#解析JSON数据全攻略指南

《C#解析JSON数据全攻略指南》这篇文章主要为大家详细介绍了使用C#解析JSON数据全攻略指南,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、为什么jsON是C#开发必修课?二、四步搞定网络JSON数据1. 获取数据 - HttpClient最佳实践2. 动态解析 - 快速

Olingo分析和实践之EDM 辅助序列化器详解(最佳实践)

《Olingo分析和实践之EDM辅助序列化器详解(最佳实践)》EDM辅助序列化器是ApacheOlingoOData框架中无需完整EDM模型的智能序列化工具,通过运行时类型推断实现灵活数据转换,适用... 目录概念与定义什么是 EDM 辅助序列化器?核心概念设计目标核心特点1. EDM 信息可选2. 智能类

Olingo分析和实践之OData框架核心组件初始化(关键步骤)

《Olingo分析和实践之OData框架核心组件初始化(关键步骤)》ODataSpringBootService通过初始化OData实例和服务元数据,构建框架核心能力与数据模型结构,实现序列化、URI... 目录概述第一步:OData实例创建1.1 OData.newInstance() 详细分析1.1.1