《统计学习方法》第三章：k-近邻算法（K-Nearest Neighbors）

2023-12-19 14:18

文章标签 算法统计学习方法第三章近邻 nearest neighbors

本文主要是介绍《统计学习方法》第三章：k-近邻算法（K-Nearest Neighbors），希望对大家解决编程问题提供一定的参考价值，需要的开发者们随着小编来一起学习吧！

监督学习，多分类、回归

计算输入点与数据集点距离，升序排序，选取数据集里前k个点，计算这k个点对应类别（也就是label）出现的概率，最大概率的分类就是输入点的分类。

目录

一、分类问题

二、监督学习

三、KNN算法原理和流程

1、工作原理

2、一般流程

3、距离计算

4、k值的选择

1）如果选择较小的K值

2）如果选择较大的K值

三、Python代码

1、数据导入

2、算法和关键函数

1）分类算法流程和关键函数

2）文本中解析数据

3）用matplotlib绘制散点图

4）数据归一化

5）使用k-近邻算法的手写识别系统

6）测试算法

3、分类算法

1）分类算法流程

2）kNN中分类算法

四、kNN算法改进

1、KNN面临的挑战

2、算法改进

1）距离度量

2）KD树

一、分类问题

二、监督学习

三、KNN算法原理和流程

1、工作原理

存在一个样本数据集合，也称作训练样本集，并且样本集中每个数据都存在标签，即我们知道样本集中每个数据与所属分类的对应关系。
输入没有标签的新数据后，将新数据的每个特征与样本集中数据对应的特征进行比较，然后算法提取样本集中特征最相似数据（最近邻）的分类标签。
一般来说，只选择样本数据集中前N个最相似的数据。分类数K一般不大于20，最后，选择k个中出现次数最多的分类，作为新数据的分类。

2、一般流程

收集数据：可以使用任何方法
准备数据：距离计算所需要的数值，最后是结构化的数据格式。
分析数据：可以使用任何方法
训练算法:（此步骤kNN）中不适用
测试算法：计算错误率
使用算法：首先需要输入样本数据和结构化的输出结果，然后运行k-近邻算法判定输入数据分别属于哪个分类，最后应用对计算出的分类执行后续的处理。

3、距离计算

p=1对应最里面的棱形；p=2对应中间的圆；p=∞对应外面的矩形

4、k值的选择

1）如果选择较小的K值

“学习”的近似误差（approximation error)会减小，但 “学习”的估计误差（estimation error) 会增大
噪声敏感
K值的减小就意味着整体模型变得复杂，容易发生过拟合

2）如果选择较大的K值

减少学习的估计误差，但缺点是学习的近似误差会增大
K值的增大，就意味着整体的模型变得简单

三、Python代码

1、数据导入

from numpy import *
import operator
def createDataSet():group=array([[1.0,1.1],[1.0,1.0],[0,0],[0,0.1]])labels=['A','A','B','B']return group,lablesgroup,labels=kNN.createDataSet()

Python 数组和numpy矩阵的关系：

>>> a=[[1,2,3,4],[5,6,7,8],[9,10,11,12]]
>>> c=zeros((3,4))
>>> c
array([[ 0.,  0.,  0.,  0.],[ 0.,  0.,  0.,  0.],[ 0.,  0.,  0.,  0.]])
>>> c[0,:]=a[0]
>>> c
array([[ 1.,  2.,  3.,  4.],[ 0.,  0.,  0.,  0.],[ 0.,  0.,  0.,  0.]])

2、算法和关键函数

1）分类算法流程和关键函数

Shape

group,labels=kNN.createDataSet()
group.shape
group.shape[0]# shape用法
import numpy as np
x = np.array([[1,2,5],[2,3,5],[3,4,5],[2,3,6]])
#输出数组的行和列数
print x.shape  #结果： (4, 3)
#只输出行数
print x.shape[0] #结果： 4
#只输出列数
print x.shape[1] #结果： 3

Tile

tile([1.0,1.2],(4,1))
# 输出
array([[ 1. ,  1.2],[ 1. ,  1.2],[ 1. ,  1.2],[ 1. ,  1.2]])
tile([1.0,1.2],(4,1))-group
#输出
array([[ 0. ,  0.1],[ 0. ,  0.2],[ 1. ,  1.2],[ 1. ,  1.1]])
a=(tile([1.0,1.2],(4,1))-group)**2
#输出
array([[ 0.  ,  0.01],[ 0.  ,  0.04],[ 1.  ,  1.44],[ 1.  ,  1.21]])

Argsort

b=a.sum(axis=1)
c=b**0.5
d=c.argsort()
>>> d
array([0, 1, 3, 2])

字典的使用

classCount={}          #字典for i in range(k):    #列表的扩展voteIlabel = labels[sortedDistIndicies[i]]classCount[voteIlabel] = classCount.get(voteIlabel,0) + 1sortedClassCount = sorted(classCount.iteritems(), key=operator.itemgetter(1), reverse=True)return sortedClassCount[0][0]kNN.classify0([0,0.2],group,labels,3)
>>'B'

2）文本中解析数据

文件读取相关函数：Open()、Readlines、Zeros()

3）用matplotlib绘制散点图

import matplotlib
>>> import matplotlib.pyplot as plt>>> fig=plt.figure()
>>> ax=fig.add_subplot(111)
>>> ax.scatter(datingDataMat[:,1],datingDataMat[:,2])
<matplotlib.collections.PathCollection object at 0x01D8F590>
>>> plt.show()>>> fig=plt.figure()
>>> ax=fig.add_subplot(111)
>>>ax.scatter(datingDataMat[:,1],datingDataMat[:,2],15.0*array(datingLabels),15.0*array(datingLabels))
>>> plt.show()

4）数据归一化

def autoNorm(dataSet):minVals = dataSet.min(0)maxVals = dataSet.max(0)ranges = maxVals - minValsnormDataSet = zeros(shape(dataSet))m = dataSet.shape[0]normDataSet = dataSet - tile(minVals, (m,1))normDataSet = normDataSet/tile(ranges, (m,1))   #element wise dividereturn normDataSet, ranges, minVals>>> n,r,m=kNN.autoNorm(datingDataMat)
>>> n
array([[ 0.44832535,  0.39805139,  0.56233353],[ 0.15873259,  0.34195467,  0.98724416],[ 0.28542943,  0.06892523,  0.47449629],..., [ 0.29115949,  0.50910294,  0.51079493],[ 0.52711097,  0.43665451,  0.4290048 ],[ 0.47940793,  0.3768091 ,  0.78571804]])
>>> r
array([  9.12730000e+04,   2.09193490e+01,   1.69436100e+00])
>>> m
array([ 0.      ,  0.      ,  0.001156])

5）使用k-近邻算法的手写识别系统

# 准备数据，将图像转换为测试向量 32x32
def img2vector(filename):returnVect = zeros((1,1024))fr = open(filename)for i in range(32):lineStr = fr.readline()for j in range(32):returnVect[0,32*i+j] = int(lineStr[j])return returnVect

6）测试算法

def datingClassTest():hoRatio = 0.50      #hold out 10%datingDataMat,datingLabels = file2matrix('datingTestSet2.txt')       #load data setfrom filenormMat, ranges, minVals = autoNorm(datingDataMat)m = normMat.shape[0]numTestVecs = int(m*hoRatio)errorCount = 0.0for i in range(numTestVecs):classifierResult = classify0(normMat[i,:],normMat[numTestVecs:m,:],datingLabels[numTestVecs:m],3)print "the classifier came back with: %d, the real answer is: %d" % (classifierResult, datingLabels[i])if (classifierResult != datingLabels[i]): errorCount += 1.0print "the total error rate is: %f" % (errorCount/float(numTestVecs))print errorCount>>> testVector=kNN.img2vector('testDigits/0_13.txt')
>>> tesVector[0,0:31]

3、分类算法

1）分类算法流程

对未知类别的数据集中的每个点依次执行以下操作：

计算已知类别数据集众多点与当前点之间的距离
按照距离递增次序排序
选取与当前点距离最小的k个点
群定前k个点所在类别的出现频率

2）kNN中分类算法

def classify0(inX, dataSet, labels, k):dataSetSize = dataSet.shape[0]diffMat = tile(inX, (dataSetSize,1)) - dataSetsqDiffMat = diffMat**2sqDistances = sqDiffMat.sum(axis=1)distances = sqDistances**0.5sortedDistIndicies = distances.argsort()     classCount={}          for item in range(k):voteIlabel = labels[sortedDistIndicies[item]]classCount[voteIlabel] = classCount.get(voteIlabel,0) + 1sortedClassCount = sorted(classCount.iteritems(), key=operator.itemgetter(1), reverse=True)return sortedClassCount[0][0]

四、kNN算法改进

1、KNN面临的挑战

2、算法改进

1）距离度量

马氏距离(Mahalanobis Distance)：

马氏距离NUMPY示例：

import numpy
x = numpy.array([[3,4],[5,6],[2,2],[8,4]])
xT = x.T
D = numpy.cov(xT)
invD = numpy.linalg.inv(D)
tp = x[0] – x[1]
print numpy.sqrt(dot(dot(tp, invD), tp.T))

Ø 由 P.C. Mahalanobis提出

Ø 基于 样本分布 的一种距离测量

Ø 考虑到各种 特性之间的联系 （例如身高和体重），可以 消除样本间的相关性

Ø 广泛用于分类和 聚类分析

2）KD树

KD树是一种对 K 维空间中的实例点进行存储以便对其进行 快速检索 的树形数据结构。
KD树是 二叉树 ，表示对K 维空间的一个划分（ partition)，构造KD 树相当于不断地用垂直于坐标轴的超平面将 k 维空间切分，构成一系列的 k 维超矩形区域， KD 树的每个结点对应于一个 k 维超矩形区域。

构造KD树

KD树搜索

这篇关于《统计学习方法》第三章：k-近邻算法（K-Nearest Neighbors）的文章就介绍到这儿，希望我们推荐的文章对编程师们有所帮助！

http://www.chinasem.cn/article/512507。 23002807@qq.com

相关文章

Java中流式并行操作parallelStream的原理和使用方法

Java中流式并行操作parallelStream的原理和使用方法

《Java中流式并行操作parallelStream的原理和使用方法》本文详细介绍了Java中的并行流（parallelStream）的原理、正确使用方法以及在实际业务中的应用案例,并指出在使用并行流... 目录Java中流式并行操作parallelStream0. 问题的产生1. 什么是parallelS

阅读更多...

MySQL数据库双机热备的配置方法详解

MySQL数据库双机热备的配置方法详解

《MySQL数据库双机热备的配置方法详解》在企业级应用中,数据库的高可用性和数据的安全性是至关重要的,MySQL作为最流行的开源关系型数据库管理系统之一,提供了多种方式来实现高可用性,其中双机热备（M... 目录1. 环境准备1.1 安装mysql1.2 配置MySQL1.2.1 主服务器配置1.2.2 从

阅读更多...

Python版本信息获取方法详解与实战

Python版本信息获取方法详解与实战

《Python版本信息获取方法详解与实战》在Python开发中,获取Python版本号是调试、兼容性检查和版本控制的重要基础操作,本文详细介绍了如何使用sys和platform模块获取Python的主... 目录1. python版本号获取基础2. 使用sys模块获取版本信息2.1 sys模块概述2.1.1

阅读更多...

Python实现字典转字符串的五种方法

Python实现字典转字符串的五种方法

《Python实现字典转字符串的五种方法》本文介绍了在Python中如何将字典数据结构转换为字符串格式的多种方法,首先可以通过内置的str()函数进行简单转换;其次利用ison.dumps()函数能够... 目录1、使用json模块的dumps方法：2、使用str方法：3、使用循环和字符串拼接：4、使用字符

阅读更多...

Python版本与package版本兼容性检查方法总结

Python版本与package版本兼容性检查方法总结

《Python版本与package版本兼容性检查方法总结》：本文主要介绍Python版本与package版本兼容性检查方法的相关资料,文中提供四种检查方法,分别是pip查询、conda管理、PyP... 目录引言为什么会出现兼容性问题方法一：用 pip 官方命令查询可用版本方法二：conda 管理包环境方法

阅读更多...

Linux云服务器手动配置DNS的方法步骤

Linux云服务器手动配置DNS的方法步骤

《Linux云服务器手动配置DNS的方法步骤》在Linux云服务器上手动配置DNS（域名系统）是确保服务器能够正常解析域名的重要步骤,以下是详细的配置方法,包括系统文件的修改和常见问题的解决方案,需要... 目录1. 为什么需要手动配置 DNS？2. 手动配置 DNS 的方法方法 1：修改 /etc/res

阅读更多...

深入理解Mysql OnlineDDL的算法

深入理解Mysql OnlineDDL的算法

《深入理解MysqlOnlineDDL的算法》本文主要介绍了讲解MysqlOnlineDDL的算法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小... 目录一、Online DDL 是什么？二、Online DDL 的三种主要算法2.1COPY（复制法）

阅读更多...

JavaScript对象转数组的三种方法实现

JavaScript对象转数组的三种方法实现

《JavaScript对象转数组的三种方法实现》本文介绍了在JavaScript中将对象转换为数组的三种实用方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友... 目录方法1：使用Object.keys()和Array.map()方法2：使用Object.entr

阅读更多...

SpringBoot中ResponseEntity的使用方法举例详解

SpringBoot中ResponseEntity的使用方法举例详解

《SpringBoot中ResponseEntity的使用方法举例详解》ResponseEntity是Spring的一个用于表示HTTP响应的全功能对象,它可以包含响应的状态码、头信息及响应体内容,下... 目录一、ResponseEntity概述基本特点：二、ResponseEntity的基本用法1. 创

阅读更多...

java中判断json key是否存在的几种方法

java中判断json key是否存在的几种方法

《java中判断jsonkey是否存在的几种方法》在使用Java处理JSON数据时,如何判断某一个key是否存在？本文就来介绍三种方法,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的... 目http://www.chinasem.cn录第一种方法是使用 jsONObject 的 has 方法

阅读更多...