KNN和LOF两种算法对比

2023-10-14 13:50
文章标签 算法 两种 knn 对比 lof

本文主要是介绍KNN和LOF两种算法对比,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

最近在学习KNN和LOF算法,记录一下自己一些浅显的理解
1.相同点和不同点
通俗地说,KNN算法的基本思想都是:物以类聚人以群分,你的邻居是啥那么你就最有可能是啥;
LOF算法的思想是正常人都是合群的,不合群的就有可能是不正常的。
1.1相同点
都是基于K-邻近距离对样本进行分类,原理比较类似。

1.2不同点
(1)KNN通过k-邻近距离判断自己邻居是哪一类,最终选择比例最高的那一类作为该样本点的类别;

(2)LOF没有给出具体的分类,最终算出的是每个点的局部离群因子,LOF值小于1,说明该点接近密度中心,接近于1,说明和周围的点比较集中,它们为同一簇,局部离群因子越大(大于1),说明该点周围比较分散或者离集体比较远,越有可能是一个异常点。

(3)LOF貌似不存在学习和训练的过程,给一段数据直接开始算,KNN有一个训练样本作为参考。

2.有监督和无监督
KNN是一种有监督学习的算法,在训练集中会给出样本标签,距离该点最近的几个样本是什么标签(占比最高的,中间可能混进一两个相反的标签),那么该点就取对应的标签。
LOF是一种无监督学习,认为正常数据都是分布比较集中的,离群体比较远的有可能是异常值,最终计算出LOF(局部离群因子)得出远离群体的程度,通过给定一个阈值判断是正常数据还是异常数据。

3.案例尝试
用网上参加的一个还款逾期风险的比赛数据尝试了一下,数据分布情况如下图:
在这里插入图片描述
(1)用KNN算法进行对训练集测试,准确率为0.79,对验证集进行计算,准确率为0.623;
(2)用LOF算法对训练集进行测试,局部离群因子取4(这是准确率最高的情况,仅针对这个样本,其他的数据可能需要另外取),准确率为0.702,对验证集计算,准确率为0.249
案例总结:
(1)验证集给的数据分布中,信用好的数据占比较少,但是不影响KNN算法的测试,因为本来就是有标签的,有训练集作为参考,验证集的数据多少不影响KNN的计算。
(2)LOF的计算完全是依赖于所给的数据的,数据少的类别可能就比较“吃亏”,被误认为是异常值,给的这组数据可能是比赛方留了一个小小的trick

个人的一些理解,不足之处请大佬们多指正

这篇关于KNN和LOF两种算法对比的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/210943

相关文章

Python安装Pandas库的两种方法

《Python安装Pandas库的两种方法》本文介绍了三种安装PythonPandas库的方法,通过cmd命令行安装并解决版本冲突,手动下载whl文件安装,更换国内镜像源加速下载,最后建议用pipli... 目录方法一:cmd命令行执行pip install pandas方法二:找到pandas下载库,然后

MySQL中EXISTS与IN用法使用与对比分析

《MySQL中EXISTS与IN用法使用与对比分析》在MySQL中,EXISTS和IN都用于子查询中根据另一个查询的结果来过滤主查询的记录,本文将基于工作原理、效率和应用场景进行全面对比... 目录一、基本用法详解1. IN 运算符2. EXISTS 运算符二、EXISTS 与 IN 的选择策略三、性能对比

详解MySQL中JSON数据类型用法及与传统JSON字符串对比

《详解MySQL中JSON数据类型用法及与传统JSON字符串对比》MySQL从5.7版本开始引入了JSON数据类型,专门用于存储JSON格式的数据,本文将为大家简单介绍一下MySQL中JSON数据类型... 目录前言基本用法jsON数据类型 vs 传统JSON字符串1. 存储方式2. 查询方式对比3. 索引

SpringBoot中六种批量更新Mysql的方式效率对比分析

《SpringBoot中六种批量更新Mysql的方式效率对比分析》文章比较了MySQL大数据量批量更新的多种方法,指出REPLACEINTO和ONDUPLICATEKEY效率最高但存在数据风险,MyB... 目录效率比较测试结构数据库初始化测试数据批量修改方案第一种 for第二种 case when第三种

Java中的雪花算法Snowflake解析与实践技巧

《Java中的雪花算法Snowflake解析与实践技巧》本文解析了雪花算法的原理、Java实现及生产实践,涵盖ID结构、位运算技巧、时钟回拨处理、WorkerId分配等关键点,并探讨了百度UidGen... 目录一、雪花算法核心原理1.1 算法起源1.2 ID结构详解1.3 核心特性二、Java实现解析2.

k8s上运行的mysql、mariadb数据库的备份记录(支持x86和arm两种架构)

《k8s上运行的mysql、mariadb数据库的备份记录(支持x86和arm两种架构)》本文记录在K8s上运行的MySQL/MariaDB备份方案,通过工具容器执行mysqldump,结合定时任务实... 目录前言一、获取需要备份的数据库的信息二、备份步骤1.准备工作(X86)1.准备工作(arm)2.手

关于MyISAM和InnoDB对比分析

《关于MyISAM和InnoDB对比分析》:本文主要介绍关于MyISAM和InnoDB对比分析,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录开篇:从交通规则看存储引擎选择理解存储引擎的基本概念技术原理对比1. 事务支持:ACID的守护者2. 锁机制:并发控制的艺

CSS中的Static、Relative、Absolute、Fixed、Sticky的应用与详细对比

《CSS中的Static、Relative、Absolute、Fixed、Sticky的应用与详细对比》CSS中的position属性用于控制元素的定位方式,不同的定位方式会影响元素在页面中的布... css 中的 position 属性用于控制元素的定位方式,不同的定位方式会影响元素在页面中的布局和层叠关

SpringBoot服务获取Pod当前IP的两种方案

《SpringBoot服务获取Pod当前IP的两种方案》在Kubernetes集群中,SpringBoot服务获取Pod当前IP的方案主要有两种,通过环境变量注入或通过Java代码动态获取网络接口IP... 目录方案一:通过 Kubernetes Downward API 注入环境变量原理步骤方案二:通过

Linux中的more 和 less区别对比分析

《Linux中的more和less区别对比分析》在Linux/Unix系统中,more和less都是用于分页查看文本文件的命令,但less是more的增强版,功能更强大,:本文主要介绍Linu... 目录1. 基础功能对比2. 常用操作对比less 的操作3. 实际使用示例4. 为什么推荐 less?5.