Python机器学习实践(二)K近邻分类(简单鸾尾花分类)

2024-03-08 22:10

本文主要是介绍Python机器学习实践(二)K近邻分类(简单鸾尾花分类),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

Python机器学习 学习笔记与实践
环境:win10 + Anaconda3.8

例子二 源自《Python机器学习基础教程》—Andreas C.Muller

任务:鸾尾花的分类。鸾尾花有3个品种:setosa、versicolor、virginica。每种鸾尾花都有4个属性:花瓣的长度和宽度以及花萼的长度和宽度。现在要建立模型根据鸾尾花的4个属性来判断鸾尾花的种类,即分类问题。

1、获取数据

该数据集在scikit-learn的datasets模块中,我们用load_iris函数调用。

#获取鸾尾花数据集并观察键值
from sklearn.datasets import load_iris
iris_dataset=load_iris()
print(iris_dataset.keys())

iris_dataset数据类型是bunch,类似于字典,包含有键和值。运行结果如下:

dict_keys([‘data’, ‘target’, ‘frame’, ‘target_names’, ‘DESCR’, ‘feature_names’, ‘filename’])

(1)'data’是花的四个属性值,‘target’是一个一维数组,data中的每一朵花对应target中的一个数据。target中用0,1,2分别表示三种类型的花。

(2)‘target_names‘’中保存了三种花的名字,‘feature_names’则保存了花的4个属性的名字。

可以自行用print分别打印各个参数,了解数据。

2、处理,显示数据

#将数据集分为训练集和测试集
from sklearn.model_selection import train_test_split
X_train,X_test,y_train,y_test=train_test_split(iris_dataset['data'],iris_dataset['target'],random_state=0)
#观察数据,看看数据大致规律
import pandas as pd
import matplotlib.pyplot as plt
iris_dataframe=pd.DataFrame(X_train,columns=iris_dataset.feature_names)
grr=pd.plotting.scatter_matrix(iris_dataframe,c=y_train,figsize=(15,15),marker='.', hist_kwds={'bins':50},s=60,alpha=.8)
plt.show()

结果如下:
在这里插入图片描述
其中,反对角线上的图为该属性的直方图。

(1)用 train_test_split 函数将数据集分为两部分,一部分用来训练模型,另一部分用来作为测试集。默认情况下是训练集75%,测试集25%。由于有时候数据集在存储的时候是按一定顺序存储的,故在分片之前,该函数将产生伪随机序列打乱样本数据,而后进行分层。

“random_state”参数是初始化了伪随机序列的种子,从而使每一次运行结果一致。

(2)由于每个样本数据X都有4个属性,故在观察数据时绘制散点图矩阵。要注意如果不加plt.show()则图可能无法显示。

3、K近邻分类并评估

K近邻分类的思想比较简单,就是先保存训练集的结果,然后对于一个新样本过来,该算法在训练集里寻找和新样本“距离最近”的一个样本,并将它的标签进行输出。如果是K近邻,则是寻找“距离最近”的K个样本,然后输出这个样本中最多的类别标签。

例如K=1时有两个属性的样本散点图如下:
在这里插入图片描述
其中三角和圆分别训练集中表示不同的种类,五角星表示测试数据,模型找到与其最近的一个样本,并将该样本的标签给测试数据,图中用颜色表示。

同理,K=3时如下:
在这里插入图片描述
该部分代码如下:

#用K近邻算法分类
from sklearn.neighbors import KNeighborsClassifier
knn=KNeighborsClassifier(n_neighbors=1)
knn.fit(X_train,y_train)
#用测试集数据评估模型
import numpy as np
y_predict=knn.predict(X_test)
print('Test score is {:.2f}'.format(np.mean(y_predict==y_test)))
#自己输入一个样本数据,看看模型输出结果
X_me=np.array([[5,2.9,1,0.2]])
Pred=knn.predict(X_me)
print('Prediction is : {} '.format(Pred))
print('The type of X_me is : {}'.format(iris_dataset['target_names'][Pred]))

运行结果如下:
在这里插入图片描述

(1)本例在建立KNN模型时将n_neighbors设为1,即寻找“长得最像”的一个样本。

(2)Test score反映了该模型对于测试集的输出效果,即有97%的测试样本预测成功,也可以说对于接下来的新样本,我们有97%的把握认为它是正确的。

(3)在自己创建一个样本的时候,要将数据转为二维矩阵的一行,因为scikit-learn只能接受二维矩阵。

(4)尝试将K近邻改为2和5之后,发现Test score 和预测结果均没有变化。

4、完整代码

#获取鸾尾花数据集并观察键值
from sklearn.datasets import load_iris
iris_dataset=load_iris()
print(iris_dataset.keys())
#将数据集分为训练集和测试集
from sklearn.model_selection import train_test_split
X_train,X_test,y_train,y_test=train_test_split(iris_dataset['data'],iris_dataset['target'],random_state=0)
#观察数据,看看数据大致规律
import pandas as pd
import matplotlib.pyplot as plt
iris_dataframe=pd.DataFrame(X_train,columns=iris_dataset.feature_names)
grr=pd.plotting.scatter_matrix(iris_dataframe,c=y_train,figsize=(15,15),marker='.', hist_kwds={'bins':50},s=60,alpha=.8)
plt.show()
#用K近邻算法分类
from sklearn.neighbors import KNeighborsClassifier
knn=KNeighborsClassifier(n_neighbors=1)
knn.fit(X_train,y_train)
#用测试集数据评估模型
import numpy as np
y_predict=knn.predict(X_test)
print('Test score is {:.2f}'.format(np.mean(y_predict==y_test)))
#自己输入一个样本数据,看看模型输出结果
X_me=np.array([[5,2.9,1,0.2]])
Pred=knn.predict(X_me)
print('Prediction is : {} '.format(Pred))
print('The type of X_me is : {}'.format(iris_dataset['target_names'][Pred]))

这篇关于Python机器学习实践(二)K近邻分类(简单鸾尾花分类)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/788562

相关文章

使用python生成固定格式序号的方法详解

《使用python生成固定格式序号的方法详解》这篇文章主要为大家详细介绍了如何使用python生成固定格式序号,文中的示例代码讲解详细,具有一定的借鉴价值,有需要的小伙伴可以参考一下... 目录生成结果验证完整生成代码扩展说明1. 保存到文本文件2. 转换为jsON格式3. 处理特殊序号格式(如带圈数字)4

Java 的ArrayList集合底层实现与最佳实践

《Java的ArrayList集合底层实现与最佳实践》本文主要介绍了Java的ArrayList集合类的核心概念、底层实现、关键成员变量、初始化机制、容量演变、扩容机制、性能分析、核心方法源码解析、... 目录1. 核心概念与底层实现1.1 ArrayList 的本质1.1.1 底层数据结构JDK 1.7

JDK21对虚拟线程的几种用法实践指南

《JDK21对虚拟线程的几种用法实践指南》虚拟线程是Java中的一种轻量级线程,由JVM管理,特别适合于I/O密集型任务,:本文主要介绍JDK21对虚拟线程的几种用法,文中通过代码介绍的非常详细,... 目录一、参考官方文档二、什么是虚拟线程三、几种用法1、Thread.ofVirtual().start(

从基础到高级详解Go语言中错误处理的实践指南

《从基础到高级详解Go语言中错误处理的实践指南》Go语言采用了一种独特而明确的错误处理哲学,与其他主流编程语言形成鲜明对比,本文将为大家详细介绍Go语言中错误处理详细方法,希望对大家有所帮助... 目录1 Go 错误处理哲学与核心机制1.1 错误接口设计1.2 错误与异常的区别2 错误创建与检查2.1 基础

Python版本信息获取方法详解与实战

《Python版本信息获取方法详解与实战》在Python开发中,获取Python版本号是调试、兼容性检查和版本控制的重要基础操作,本文详细介绍了如何使用sys和platform模块获取Python的主... 目录1. python版本号获取基础2. 使用sys模块获取版本信息2.1 sys模块概述2.1.1

一文详解Python如何开发游戏

《一文详解Python如何开发游戏》Python是一种非常流行的编程语言,也可以用来开发游戏模组,:本文主要介绍Python如何开发游戏的相关资料,文中通过代码介绍的非常详细,需要的朋友可以参考下... 目录一、python简介二、Python 开发 2D 游戏的优劣势优势缺点三、Python 开发 3D

Python函数作用域与闭包举例深度解析

《Python函数作用域与闭包举例深度解析》Python函数的作用域规则和闭包是编程中的关键概念,它们决定了变量的访问和生命周期,:本文主要介绍Python函数作用域与闭包的相关资料,文中通过代码... 目录1. 基础作用域访问示例1:访问全局变量示例2:访问外层函数变量2. 闭包基础示例3:简单闭包示例4

Python实现字典转字符串的五种方法

《Python实现字典转字符串的五种方法》本文介绍了在Python中如何将字典数据结构转换为字符串格式的多种方法,首先可以通过内置的str()函数进行简单转换;其次利用ison.dumps()函数能够... 目录1、使用json模块的dumps方法:2、使用str方法:3、使用循环和字符串拼接:4、使用字符

Python版本与package版本兼容性检查方法总结

《Python版本与package版本兼容性检查方法总结》:本文主要介绍Python版本与package版本兼容性检查方法的相关资料,文中提供四种检查方法,分别是pip查询、conda管理、PyP... 目录引言为什么会出现兼容性问题方法一:用 pip 官方命令查询可用版本方法二:conda 管理包环境方法

基于Python开发Windows自动更新控制工具

《基于Python开发Windows自动更新控制工具》在当今数字化时代,操作系统更新已成为计算机维护的重要组成部分,本文介绍一款基于Python和PyQt5的Windows自动更新控制工具,有需要的可... 目录设计原理与技术实现系统架构概述数学建模工具界面完整代码实现技术深度分析多层级控制理论服务层控制注