机器学习Day2-机器学习算法过程没有免费午餐定理

2024-02-23 20:50

本文主要是介绍机器学习Day2-机器学习算法过程没有免费午餐定理,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

一、机器学习算法过程

大部分人认为随着大数据和深度学习的发展,只要将网上的数据随意的放进模型中,就可以实现了,其实这是一个错误的观点【笔者一开始也是这样想的】,确实有时候能得到正确的结论,但是大部分是错的

1.特征提取【Feature Extraction

  • 通过训练样本获得的,对机器学习任务有帮助的多维度数据

  • 机器学习的重点不是为了研究如何去提取特征

  • 机器学习的重点:假设在已经提取好特征的前提下,去如何构造算法获得更好的性能

  • 当然也不是提取特征不重要,如果我们提取了好的特征,那么我们机器就能获得不错的性能,相反,如果我们提取的特征很差,即使我们有非常大的机器学习的算法,也是不可能获得好的性能的,

2.为什么不以特征提取为重点?

这是因为不同的任务提取特征的方式是不同的,针对不同的煤质不同的任务,提取特征的方式是千变万化的,【例如语音、图像、视频等】,要是以此为重点,即使花费几门课也讲不完,因此机器学习注重于在假设已经获得特征的前提下,去研究合理的算法,去让学习系统获得更好的性能。

3.特征选择【Feature Selection

    • 例子

  • 我们可以发现,白细胞和红细胞在周长和面积这两个特征中的重合度很少,而其圆形度,虽然红细胞在白细胞的上方,但是重合度很大,因此如果我们采用圆形度作为区分白细胞和红细胞的特征,那么其识别率并不会很高,这两种在其他方面的重合度也很大,因此,我们会采取重合度少的周长和面积,作为区分白细胞和红细胞的特征,以此来构建机器学习的系统。

4.算法构建

那么如何以这两种特征来构建算法呢?他们采取了支持向量机【Support Vector Machine】,一共有三种内核,可以把下列的三种看做三种算法模式

  1. 线性内核

  1. 多项式内核

  1. 高斯径向基函数核

5.特征空间【Feature Space

  • 基于上述两种特征,研究者将白细胞和红细胞画到了同一个二维空间中,其中横坐标代表面积纵坐标代表周长,以此去描点,并做了一定程度的归一,将这两个特征的值归一化到【-1,1】,在这个例子中,我们把这个二维空间成为特征空间【Feature Space】,如果在其他方面,有多个特征,那么特征空间可以是多维的。

  • 那么基于之前提到的三种算法,我们在图纸上画出了三条不同的分界线,一旦我们画出这一线条,那么就代表我们机器学习的过程就已经结束了。

  • 为何这么说呢,例如,这时候来了一个新的样本,我们计算它的周长和面积,再进行一定程度上的归一,再画到这张图上,看是在这一条线的那一侧,就可以进行分类了

  • 在此有两个概念【维度和标准】,【维度】有人说,我一眼就能画出这条线,那是因为这里的维度是二维的,那么如果,维度是上万维,那么你还能看出来吗?人眼对于多维是缺乏想象力的。【标准】上述基于三种算法,画出的线,对于某些区域的划分是不一样的,例如,第二张图片和第三张图片的左下侧

  • 那么哪种算法更好呢,我们针对于不同的情况,需要去采取不同的方法,这个没有绝对意义的好和坏的标准,因为我们采取的数据是有限的,当然我们也不可能穷尽所有的样本数据,如何针对不同的应用场景,选择不同的机器学习算法,构造新的机器学习算法,解决目前无法解决的应用场景,这是一个理论和实践的科学过程

二、没有免费午餐定理【No Free Lunch Theorem

  • 针对于之前提出的哪种算法更好,我们在这给出一个初步的回答,1995年,D.H.Wolpert等人提出了没有免费午餐定理【No Free Lunch Theorem

  • 定理概述:任何一个预测函数,如果在一些训练样本上表现好,那么必然在另一些训练样本表现不好,如果不对数据在特征空间的先验分布有一定的假设,那么表现好与表现不好的情况一样多,因此不存在,任何情况下都是非常完美的机器学习算法

  • 对于先验分布概率,有如下要求

那么,这一假设有道理吗?有道理,但是也可能出错

基于没有免费午餐定理,我们如果不对特征空间的先验分布有要求,那么所以算法的表现概率都是一样的,我们不能片面的去夸大这一定理的作用,从而对开发新的算法丧失信心,但是我们要时刻牢记这一定理的提醒,

因此,再好的算法,也会有犯错的可能,【没有免费午餐定理】告诉我们,没有放之四海皆准的算法,没有人能知道先验样本的假设【就像,明天的太阳一定会升起吗】

这篇关于机器学习Day2-机器学习算法过程没有免费午餐定理的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/739891

相关文章

oracle 11g导入\导出(expdp impdp)之导入过程

《oracle11g导入导出(expdpimpdp)之导入过程》导出需使用SEC.DMP格式,无分号;建立expdir目录(E:/exp)并确保存在;导入在cmd下执行,需sys用户权限;若需修... 目录准备文件导入(impdp)1、建立directory2、导入语句 3、更改密码总结上一个环节,我们讲了

ShardingProxy读写分离之原理、配置与实践过程

《ShardingProxy读写分离之原理、配置与实践过程》ShardingProxy是ApacheShardingSphere的数据库中间件,通过三层架构实现读写分离,解决高并发场景下数据库性能瓶... 目录一、ShardingProxy技术定位与读写分离核心价值1.1 技术定位1.2 读写分离核心价值二

MyBatis-plus处理存储json数据过程

《MyBatis-plus处理存储json数据过程》文章介绍MyBatis-Plus3.4.21处理对象与集合的差异:对象可用内置Handler配合autoResultMap,集合需自定义处理器继承F... 目录1、如果是对象2、如果需要转换的是List集合总结对象和集合分两种情况处理,目前我用的MP的版本

Java Kafka消费者实现过程

《JavaKafka消费者实现过程》Kafka消费者通过KafkaConsumer类实现,核心机制包括偏移量管理、消费者组协调、批量拉取消息及多线程处理,手动提交offset确保数据可靠性,自动提交... 目录基础KafkaConsumer类分析关键代码与核心算法2.1 订阅与分区分配2.2 拉取消息2.3

AOP编程的基本概念与idea编辑器的配合体验过程

《AOP编程的基本概念与idea编辑器的配合体验过程》文章简要介绍了AOP基础概念,包括Before/Around通知、PointCut切入点、Advice通知体、JoinPoint连接点等,说明它们... 目录BeforeAroundAdvise — 通知PointCut — 切入点Acpect — 切面

Unity新手入门学习殿堂级知识详细讲解(图文)

《Unity新手入门学习殿堂级知识详细讲解(图文)》Unity是一款跨平台游戏引擎,支持2D/3D及VR/AR开发,核心功能模块包括图形、音频、物理等,通过可视化编辑器与脚本扩展实现开发,项目结构含A... 目录入门概述什么是 UnityUnity引擎基础认知编辑器核心操作Unity 编辑器项目模式分类工程

C++ STL-string类底层实现过程

《C++STL-string类底层实现过程》本文实现了一个简易的string类,涵盖动态数组存储、深拷贝机制、迭代器支持、容量调整、字符串修改、运算符重载等功能,模拟标准string核心特性,重点强... 目录实现框架一、默认成员函数1.默认构造函数2.构造函数3.拷贝构造函数(重点)4.赋值运算符重载函数

MySQ中出现幻读问题的解决过程

《MySQ中出现幻读问题的解决过程》文章解析MySQLInnoDB通过MVCC与间隙锁机制在可重复读隔离级别下解决幻读,确保事务一致性,同时指出性能影响及乐观锁等替代方案,帮助开发者优化数据库应用... 目录一、幻读的准确定义与核心特征幻读 vs 不可重复读二、mysql隔离级别深度解析各隔离级别的实现差异

Nginx添加内置模块过程

《Nginx添加内置模块过程》文章指导如何检查并添加Nginx的with-http_gzip_static模块:确认该模块未默认安装后,需下载同版本源码重新编译,备份替换原有二进制文件,最后重启服务验... 目录1、查看Nginx已编辑的模块2、Nginx官网查看内置模块3、停止Nginx服务4、Nginx

Jenkins的安装与简单配置过程

《Jenkins的安装与简单配置过程》本文简述Jenkins在CentOS7.3上安装流程,包括Java环境配置、RPM包安装、修改JENKINS_HOME路径及权限、启动服务、插件安装与系统管理设置... 目录www.chinasem.cnJenkins安装访问并配置JenkinsJenkins配置邮件通知