统计学习理论第 5 部分:破碎系数

2023-11-07 13:28

本文主要是介绍统计学习理论第 5 部分:破碎系数,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

照片由 Unsplash上的 资源数据库提供

1:背景与动机

        正如本系列之前的文章所述,统计学习理论为理解机器学习推理问题提供了一个概率框架。用数学术语来说,统计学习理论的基本目标可以表述为:

图片由作者提供

本文是统计学习理论系列的第 5 部分。前四件是:

  • 第 1 部分:Hoeffding 不等式的推导与模拟
  • 第 2 部分:贝叶斯分类器的最优性
  • 第 3 部分:学习的 ML 估计器的收敛性和一致性
  • 第 4 部分:有限函数类的一致性

在本系列的第 1 部分中,我们从第一原理推导了霍夫丁不等式,在第 2 部分中,我们证明了贝叶斯分类器的最优性,在第 3 部分中,我们开发了评估数据自适应机器学习采样估计器一致性的理论,在第4 部分中,我们推导了一致性有限大小函数类上的 ML 估计器的速率和泛化界限。在这篇文章中,我们将我们的理论扩展到无限大小函数类上的学习 ML 估计器,并利用破碎系数导出一致性率和泛化界限。

为了激发当前的兴趣问题,请考虑:

图片由作者提供

我们定义:

图片由作者提供

并回忆一下:

图片由作者提供

图片由作者提供

        但是,如果我们考虑无限大小的函数类而不是有限的函数类怎么办?比如所有线性模型的函​​数类?在这种情况下,我们还有一致性吗?

        在接下来的注释中,我们利用破碎系数推导了无限函数类上的 ML 估计器的不等式、比率和泛化界限。

图片由作者提供

 

本文的目录如下:

图片由作者提供

 

        话虽如此,让我们开始吧。

2:破碎系数

2.1:破碎系数的定义

         我们想要测量无限函数类的容量。破碎系数是此类容量测量中最简单的。

图片由作者提供

 

让我们通过一些简单的玩具示例来了解破碎系数的示例。

2.2:玩具示例#1

图片由作者提供

2.3:玩具示例#2

图片由作者提供

 

2.4:玩具示例#3

图片由作者提供

 

3:通过幽灵样本得出统计不平等

从本系列第 4 部分中的统计不平等开始:

图片由作者提供

 

我们将在本节中证明上述不等式右侧的进一步约束如下:

图片由作者提供

为了证明上述统计不等式,我们首先证明以下中间结果,稍后我们将利用:

图片由作者提供

上述中间结果的证明如下:

图片由作者提供

图片由作者提供

我们现在准备证明:

图片由作者提供

上述不等式的证明如下:

图片由作者提供

使用上面的统计不等式,在下一节中,我们利用破碎系数检查泛化界限和一致性率。

4:泛化界限和一致性率

根据上一节的结果,我们现在准备展示:

图片由作者提供

上述泛化界限的证明如下:

图片由作者提供

图片由作者提供

图片由作者提供

5:总结和结论

图片由作者提供

        请注意,虽然我们能够导出无限大小函数类上的 ML 估计器的泛化界限和一致性率,但本文中的方法存在一些缺点。主要是:

  • 除了简单的玩具示例之外,破碎系数通常很难计算或计算。
  • 破碎系数也是特定样本大小“ n ”的函数,这意味着我们需要知道该系数渐近增长的速度,以便将其用于本文中使用的目的。

        在本系列的后续第 6 部分中,我们将利用另一个工具来导出无限大小函数类的容量,即 Vapnik-Chervonenkis (VC) 维度。正如我们将在下一篇文章中看到的,对于某些用例,VC 维度比破碎系数更容易计算。与破碎系数不同,VC 维度不依赖于样本大小“ n ”。

        为了参考扎实的统计学习理论内容,我会推荐Larry Wasserman(卡内基梅隆大学统计和机器学习教授)的教科书“All of Statistics”和“All of Nonparametric Statistics”、斯坦福大学教师的“ Elements of Statistical Learning ”和“Statistical”弗拉基米尔·瓦普尼克(Vladimir Vapnik)的学习理论。

安德鲁·罗斯曼

 

这篇关于统计学习理论第 5 部分:破碎系数的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/363905

相关文章

Java学习手册之Filter和Listener使用方法

《Java学习手册之Filter和Listener使用方法》:本文主要介绍Java学习手册之Filter和Listener使用方法的相关资料,Filter是一种拦截器,可以在请求到达Servl... 目录一、Filter(过滤器)1. Filter 的工作原理2. Filter 的配置与使用二、Listen

Pandas统计每行数据中的空值的方法示例

《Pandas统计每行数据中的空值的方法示例》处理缺失数据(NaN值)是一个非常常见的问题,本文主要介绍了Pandas统计每行数据中的空值的方法示例,具有一定的参考价值,感兴趣的可以了解一下... 目录什么是空值?为什么要统计空值?准备工作创建示例数据统计每行空值数量进一步分析www.chinasem.cn处

一文详解如何在Python中从字符串中提取部分内容

《一文详解如何在Python中从字符串中提取部分内容》:本文主要介绍如何在Python中从字符串中提取部分内容的相关资料,包括使用正则表达式、Pyparsing库、AST(抽象语法树)、字符串操作... 目录前言解决方案方法一:使用正则表达式方法二:使用 Pyparsing方法三:使用 AST方法四:使用字

Mysql如何将数据按照年月分组的统计

《Mysql如何将数据按照年月分组的统计》:本文主要介绍Mysql如何将数据按照年月分组的统计方式,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录mysql将数据按照年月分组的统计要的效果方案总结Mysql将数据按照年月分组的统计要的效果方案① 使用 DA

Mysql删除几亿条数据表中的部分数据的方法实现

《Mysql删除几亿条数据表中的部分数据的方法实现》在MySQL中删除一个大表中的数据时,需要特别注意操作的性能和对系统的影响,本文主要介绍了Mysql删除几亿条数据表中的部分数据的方法实现,具有一定... 目录1、需求2、方案1. 使用 DELETE 语句分批删除2. 使用 INPLACE ALTER T

一文详解SQL Server如何跟踪自动统计信息更新

《一文详解SQLServer如何跟踪自动统计信息更新》SQLServer数据库中,我们都清楚统计信息对于优化器来说非常重要,所以本文就来和大家简单聊一聊SQLServer如何跟踪自动统计信息更新吧... SQL Server数据库中,我们都清楚统计信息对于优化器来说非常重要。一般情况下,我们会开启"自动更新

Java进阶学习之如何开启远程调式

《Java进阶学习之如何开启远程调式》Java开发中的远程调试是一项至关重要的技能,特别是在处理生产环境的问题或者协作开发时,:本文主要介绍Java进阶学习之如何开启远程调式的相关资料,需要的朋友... 目录概述Java远程调试的开启与底层原理开启Java远程调试底层原理JVM参数总结&nbsMbKKXJx

Java深度学习库DJL实现Python的NumPy方式

《Java深度学习库DJL实现Python的NumPy方式》本文介绍了DJL库的背景和基本功能,包括NDArray的创建、数学运算、数据获取和设置等,同时,还展示了如何使用NDArray进行数据预处理... 目录1 NDArray 的背景介绍1.1 架构2 JavaDJL使用2.1 安装DJL2.2 基本操

opencv实现像素统计的示例代码

《opencv实现像素统计的示例代码》本文介绍了OpenCV中统计图像像素信息的常用方法和函数,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一... 目录1. 统计像素值的基本信息2. 统计像素值的直方图3. 统计像素值的总和4. 统计非零像素的数量

如何使用 Bash 脚本中的time命令来统计命令执行时间(中英双语)

《如何使用Bash脚本中的time命令来统计命令执行时间(中英双语)》本文介绍了如何在Bash脚本中使用`time`命令来测量命令执行时间,包括`real`、`user`和`sys`三个时间指标,... 使用 Bash 脚本中的 time 命令来统计命令执行时间在日常的开发和运维过程中,性能监控和优化是不