Datawhale《动手学数据分析》Task01:数据加载及探索性数据分析笔记1

本文主要是介绍Datawhale《动手学数据分析》Task01:数据加载及探索性数据分析笔记1,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

1 第一章:数据载入及初步观察

1.1 载入数据

数据集:kaggle泰坦尼克数据集

数据集下载 Titanic - Machine Learning from Disaster | Kaggle

任务一:导入numpy和pandas

import numpy as np
import pandas as pd

任务二:载入数据

相对路径需要以当前文件所处目录为基准,所以使用代码查看当前所处文件夹的绝对路径。

import os
path1 = os.path.abspath('.')   #所处文件夹的绝对路径
print(path1)
path2 = os.path.abspath('..')  #所处文件夹上一级的绝对路径
print(path2)
E:\emmmmmm\Analysis\jupyter-notebook
E:\emmmmmm\Analysis

(1) 使用相对路径载入数据

#相对路径三种方式
dftrain0 = pd.read_csv(r"..\titanic\train.csv")
dftrain01 = pd.read_csv("..\\titanic\\train.csv")
dftrain02 = pd.read_csv("../titanic/train.csv")

(2) 使用绝对路径载入数据

# 绝对路径三种方式
dftrain1 = pd.read_csv(r"E:\emmmmmm\Analysis\titanic\train.csv")
dftrain11 = pd.read_csv("E:\\emmmmmm\\Analysis\\titanic\\train.csv")
dftrain12 = pd.read_csv("E:/emmmmmm/Analysis/titanic/train.csv")

【思考】

知道数据加载的方法后,试试pd.read_csv()和pd.read_table()的不同

csv默认制表符为“,”,table默认制表符为“\t”

pd.read_csv()

pd.read_table()

 #一个举例

如果想让他们效果一样,需要怎么做?

#指定分隔符
pd.read_table('', sep=',')

了解一下'.tsv'和'.csv'的不同,如何加载这两个数据集?

.tsv使用\t作为分隔符,.csv使用,作为分隔符。

任务三:每1000行为一个数据模块,逐块读取

dftrain1000 = pd.read_csv(r"..\titanic\train.csv",chunksize=1000)
for chunk in dftrain1000:print(type(chunk))   #<class 'pandas.core.frame.DataFrame'>print(len(chunk))    #891print(chunk)#此数据集行为数不足1000

任务四:将表头改成中文,索引改为乘客ID

PassengerId => 乘客ID
Survived => 是否幸存
Pclass => 乘客等级(1/2/3等舱位)
Name => 乘客姓名
Sex => 性别
Age => 年龄
SibSp => 堂兄弟/妹个数
Parch => 父母与小孩个数
Ticket => 船票信息
Fare => 票价
Cabin => 客舱
Embarked => 登船港口

colnames=['乘客ID','是否幸存','乘客等级(1/2/3等舱位)','乘客姓名','性别','年龄','堂兄弟/妹个数','父母与小孩个数','船票信息','票价','客舱','登船港口']
dftrain = pd.read_csv(r"..\titanic\train.csv",names=colnames,index_col='乘客ID')
dftrain.head()

1.2 初步观察

导入数据后,你可能要对数据的整体结构和样例进行概览,比如说,数据大小、有多少列,各列都是什么格式的,是否包含null等

任务一:查看数据的基本信息

print(dftrain.describe())     #整体描述
print(dftrain.info())         #获取摘要
print(dftrain.columns)        #列标签
print(dftrain.shape)          #行列数

任务二:观察表格前10行的数据和后15行的数据

#观察表格前10行的数据
colnames=['乘客ID','是否幸存','乘客等级(1/2/3等舱位)','乘客姓名','性别','年龄','堂兄弟/妹个数','父母与小孩个数','船票信息','票价','客舱','登船港口']
dftrain = pd.read_csv(r"..\titanic\train.csv",names=colnames,index_col='乘客ID')
dftrain.head(10)

#观察表格后15行的数据
colnames=['乘客ID','是否幸存','乘客等级(1/2/3等舱位)','乘客姓名','性别','年龄','堂兄弟/妹个数','父母与小孩个数','船票信息','票价','客舱','登船港口']
dftrain = pd.read_csv(r"..\titanic\train.csv",names=colnames,index_col='乘客ID')
dftrain.tail(15)

任务三:判断数据是否为空,为空的地方返回True,其余地方返回False

dftrain.isnull().head()

1.3 保存数据

任务一:将你加载并做出改变的数据,在工作目录下保存为一个新文件train_chinese.csv

dftrain.to_csv("train_chinese.csv",encoding='GBK')

1.4 知道你的数据叫什么

任务一:pandas中有两个数据类型DateFrame和Series,通过查找简单了解他们。

DateFrame可理解为表格,Series为单独的行或列

#Series举例
sdata = {'Ohio': 35000, 'Texas': 71000, 'Oregon': 16000, 'Utah': 5000}
example_1 = pd.Series(sdata)
example_1

 

#DataFrame举例
data = {'state': ['Ohio', 'Ohio', 'Ohio', 'Nevada', 'Nevada', 'Nevada'],'year': [2000, 2001, 2002, 2001, 2002, 2003],'pop': [1.5, 1.7, 3.6, 2.4, 2.9, 3.2]}
example_2 = pd.DataFrame(data)
example_2

 

任务二:根据上节课的方法载入"train.csv"文件

colnames=['乘客ID','是否幸存','乘客等级(1/2/3等舱位)','乘客姓名','性别','年龄','堂兄弟/妹个数','父母与小孩个数','船票信息','票价','客舱','登船港口']
df = pd.read_csv(r"..\titanic\train.csv",names=colnames,index_col='乘客ID')

任务三:查看DataFrame数据的每列的名称

df.columns
 

 任务四:查看"Cabin"这列的所有值

print(df['Cabin'])
print(df.Cabin)

 

 

这篇关于Datawhale《动手学数据分析》Task01:数据加载及探索性数据分析笔记1的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/184700

相关文章

Mysql数据库中数据的操作CRUD详解

《Mysql数据库中数据的操作CRUD详解》:本文主要介绍Mysql数据库中数据的操作(CRUD),详细描述对Mysql数据库中数据的操作(CRUD),包括插入、修改、删除数据,还有查询数据,包括... 目录一、插入数据(insert)1.插入数据的语法2.注意事项二、修改数据(update)1.语法2.有

SpringBoot实现接口数据加解密的三种实战方案

《SpringBoot实现接口数据加解密的三种实战方案》在金融支付、用户隐私信息传输等场景中,接口数据若以明文传输,极易被中间人攻击窃取,SpringBoot提供了多种优雅的加解密实现方案,本文将从原... 目录一、为什么需要接口数据加解密?二、核心加解密算法选择1. 对称加密(AES)2. 非对称加密(R

详解如何在SpringBoot控制器中处理用户数据

《详解如何在SpringBoot控制器中处理用户数据》在SpringBoot应用开发中,控制器(Controller)扮演着至关重要的角色,它负责接收用户请求、处理数据并返回响应,本文将深入浅出地讲解... 目录一、获取请求参数1.1 获取查询参数1.2 获取路径参数二、处理表单提交2.1 处理表单数据三、

重新对Java的类加载器的学习方式

《重新对Java的类加载器的学习方式》:本文主要介绍重新对Java的类加载器的学习方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1、介绍1.1、简介1.2、符号引用和直接引用1、符号引用2、直接引用3、符号转直接的过程2、加载流程3、类加载的分类3.1、显示

在 PyQt 加载 UI 三种常见方法

《在PyQt加载UI三种常见方法》在PyQt中,加载UI文件通常指的是使用QtDesigner设计的.ui文件,并将其转换为Python代码,以便在PyQt应用程序中使用,这篇文章给大家介绍在... 目录方法一:使用 uic 模块动态加载 (不推荐用于大型项目)方法二:将 UI 文件编译为 python 模

Spring Validation中9个数据校验工具使用指南

《SpringValidation中9个数据校验工具使用指南》SpringValidation作为Spring生态系统的重要组成部分,提供了一套强大而灵活的数据校验机制,本文给大家介绍了Spring... 目录1. Bean Validation基础注解常用注解示例在控制器中应用2. 自定义约束验证器定义自

C#实现高性能Excel百万数据导出优化实战指南

《C#实现高性能Excel百万数据导出优化实战指南》在日常工作中,Excel数据导出是一个常见的需求,然而,当数据量较大时,性能和内存问题往往会成为限制导出效率的瓶颈,下面我们看看C#如何结合EPPl... 目录一、技术方案核心对比二、各方案选型建议三、性能对比数据四、核心代码实现1. MiniExcel

SQL常用操作精华之复制表、跨库查询、删除重复数据

《SQL常用操作精华之复制表、跨库查询、删除重复数据》:本文主要介绍SQL常用操作精华之复制表、跨库查询、删除重复数据,这些SQL操作涵盖了数据库开发中最常用的技术点,包括表操作、数据查询、数据管... 目录SQL常用操作精华总结表结构与数据操作高级查询技巧SQL常用操作精华总结表结构与数据操作复制表结

Redis中的数据一致性问题以及解决方案

《Redis中的数据一致性问题以及解决方案》:本文主要介绍Redis中的数据一致性问题以及解决方案,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录一、Redis 数据一致性问题的产生1. 单节点环境的一致性问题2. 网络分区和宕机3. 并发写入导致的脏数据4. 持

Spring框架中@Lazy延迟加载原理和使用详解

《Spring框架中@Lazy延迟加载原理和使用详解》:本文主要介绍Spring框架中@Lazy延迟加载原理和使用方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐... 目录一、@Lazy延迟加载原理1.延迟加载原理1.1 @Lazy三种配置方法1.2 @Component