R语言——机器学习模型h2o包与解释

2023-11-03 02:50

本文主要是介绍R语言——机器学习模型h2o包与解释,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

1.自动机器学习(AutoML)

自动机器学习(AutoML)功能实现有监督机器学习模型训练的自动化过程当前版本的AutoML训练并交叉验证了以下算法(按以下顺序):三个预先指定的XGBoost-GBM(Gradient Boosting Machine)模型、一个固定的GLMs网格、一个默认的随机林(DRF),五个预先指定的H2O GBMs、一个近似默认的深度神经网络、一个极端随机森林(XRT)、一个XGBoost GBMs的随机网格、一个H2O GBMs的随机网格和一个深度神经网络的随机网格。在某些情况下,将没有足够的时间来完成所有的算法,因此有些可能会从排行榜上消失。然后,AutoML训练两个叠加的集成模型,一个是所有模型,另一个是每种模型中最好的模型。
R语言 h2o.automl包解释
H2O AutoML: Automatic Machine Learning官网*best
R语言h2o.automl代码1*
R语言h2o.automl代码2*

2.各model的分别使用

H20监督算法的model:
广义线性回归模型 (GLM)
随机森林模型(RF)
GBM(也称GBDT)
深度学习(DL)
朴素贝叶斯(NB)
R语言 h2o.model

3.深度学习h2o.deeplearning

常用的深度学习模型框架是Python中的ensorflow和Pytorch,已经基于Kears开发的R包keras。这几种框架具有很高的灵活性,学习难度较大。基于此,我们解释一种经过包装过的深度学习方法h2o.deeplearning。

H2O是一个基于java的机器学习/深度学习平台,它支持大量无监督和有监督的模型,也支持深度学习算法;可以作为R或Python包导入,也给用户提供UI似的界面。

H2O的深度学习基于多层前馈人工神经网络,该网络使用反向传播进行随机梯度下降训练。前馈人工神经网络 (ANN) 模型,也称为深度神经网络 (DNN) 或多层感知器 (MLP),是最常见的深度神经网络类型。
R 语言深度学习模拟与评价-1
R 语言深度学习模拟与评价-2
R语言 h2o.deeplearning

4.模型解释

(1)模型效果评估指标

a.混淆矩阵(Confusion Matrix)
b.Lift( 提升指数 )

指投入与产出的比例,值越大,模型的运行效果越好。

c.ROC 曲线 & PR 曲线 & KS 曲线

实际应用中,通常是先基于训练好的分类器得出测试样本的预测概率,然后将该测试样本的预测概率与给定的阈值进行比较,若该预测概率大于给定阈值,则将该测试样本划分为正类,反之则将其划分为反类。对于不同的分类任务,该分类阈值的取值也是不一样的。
① ROC 曲线 ( The Receiver Operating Characteristic Curve ) 给出的是不同分类阈值情况下真正率 ( TPr ) 和假正率 ( FPr ) 的变化曲线。
② PR 曲线 ( Precision-Recall Curve ) 给出的是不同分类阈值情况下查准率 ( Precision ) 和查全率 ( Recall ) 的变化曲线。
在这里插入图片描述

d.个体条件期望图 ( ICE )

ICE相较PDPICE 图可以更深入地探索个体差异并识别模型输入之间的子组和相互作用。另一方面,ICE 图使得可以深入到单个观察的水平。它们可以帮助探索个体差异,并确定模型输入之间的子组和交互。可以将每个 ICE 曲线视为一种模拟,显示如果改变特定观察的一个特征,模型预测会发生什么。为避免可视化过载,ICE 图一次只显示一个模型变量。

当对大数据集分析时,则可能需要进行一些调整。例如,可以对选定的变量进行分箱,也可以对数据集进行采样或分组。这些技术可以更快地提供实际图的合理近似值。

(2)排列重要性(Permutation Importance)

排列重要性,一定是在 model 训练完成后,才可以计算的。简单来说,就是改变数据表格中某一列的数据的排列,保持其余特征不动,看其对预测精度的影响有多大。

(3)部分依赖图 ( PDP 或 PD 图 )

PDP显示特征对机器学习模型的预测结果的边际效应,可以展示一个特征是如何影响预测的。部分依赖图可以显示目标与特征之间的关系是线性的,单调的还是更复杂的。例如,当应用于线性回归模型时,部分依赖图总是显示线性关系。

(4)局部可解释不可知模型 ( LIME )

LIME是一种算法,它提供了一种新颖的技术,以可解释和可信任的方式解释任何预测模型的结果。它的工作原理是围绕想要解释的预测在本地训练可解释的模型。

(5)SHAP

一个特征的 shapley value 是该特征在所有的特征序列中的平均边际贡献。 解决了多重共线性问题;不仅考虑单个变量的影响,而且考虑变量组的影响,变量之间可能存在协同效应。

机器学习模型解释及图解*

这篇关于R语言——机器学习模型h2o包与解释的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/335071

相关文章

Go学习记录之runtime包深入解析

《Go学习记录之runtime包深入解析》Go语言runtime包管理运行时环境,涵盖goroutine调度、内存分配、垃圾回收、类型信息等核心功能,:本文主要介绍Go学习记录之runtime包的... 目录前言:一、runtime包内容学习1、作用:① Goroutine和并发控制:② 垃圾回收:③ 栈和

Go语言中泄漏缓冲区的问题解决

《Go语言中泄漏缓冲区的问题解决》缓冲区是一种常见的数据结构,常被用于在不同的并发单元之间传递数据,然而,若缓冲区使用不当,就可能引发泄漏缓冲区问题,本文就来介绍一下问题的解决,感兴趣的可以了解一下... 目录引言泄漏缓冲区的基本概念代码示例:泄漏缓冲区的产生项目场景:Web 服务器中的请求缓冲场景描述代码

Go语言如何判断两张图片的相似度

《Go语言如何判断两张图片的相似度》这篇文章主要为大家详细介绍了Go语言如何中实现判断两张图片的相似度的两种方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 在介绍技术细节前,我们先来看看图片对比在哪些场景下可以用得到:图片去重:自动删除重复图片,为存储空间"瘦身"。想象你是一个

Go语言中Recover机制的使用

《Go语言中Recover机制的使用》Go语言的recover机制通过defer函数捕获panic,实现异常恢复与程序稳定性,具有一定的参考价值,感兴趣的可以了解一下... 目录引言Recover 的基本概念基本代码示例简单的 Recover 示例嵌套函数中的 Recover项目场景中的应用Web 服务器中

Android学习总结之Java和kotlin区别超详细分析

《Android学习总结之Java和kotlin区别超详细分析》Java和Kotlin都是用于Android开发的编程语言,它们各自具有独特的特点和优势,:本文主要介绍Android学习总结之Ja... 目录一、空安全机制真题 1:Kotlin 如何解决 Java 的 NullPointerExceptio

详解如何使用Python从零开始构建文本统计模型

《详解如何使用Python从零开始构建文本统计模型》在自然语言处理领域,词汇表构建是文本预处理的关键环节,本文通过Python代码实践,演示如何从原始文本中提取多尺度特征,并通过动态调整机制构建更精确... 目录一、项目背景与核心思想二、核心代码解析1. 数据加载与预处理2. 多尺度字符统计3. 统计结果可

SpringBoot整合Sa-Token实现RBAC权限模型的过程解析

《SpringBoot整合Sa-Token实现RBAC权限模型的过程解析》:本文主要介绍SpringBoot整合Sa-Token实现RBAC权限模型的过程解析,本文给大家介绍的非常详细,对大家的学... 目录前言一、基础概念1.1 RBAC模型核心概念1.2 Sa-Token核心功能1.3 环境准备二、表结

Go语言中使用JWT进行身份验证的几种方式

《Go语言中使用JWT进行身份验证的几种方式》本文主要介绍了Go语言中使用JWT进行身份验证的几种方式,包括dgrijalva/jwt-go、golang-jwt/jwt、lestrrat-go/jw... 目录简介1. github.com/dgrijalva/jwt-go安装:使用示例:解释:2. gi

Go 语言中的 Struct Tag 的用法详解

《Go语言中的StructTag的用法详解》在Go语言中,结构体字段标签(StructTag)是一种用于给字段添加元信息(metadata)的机制,常用于序列化(如JSON、XML)、ORM映... 目录一、结构体标签的基本语法二、json:"token"的具体含义三、常见的标签格式变体四、使用示例五、使用

Go语言使用slices包轻松实现排序功能

《Go语言使用slices包轻松实现排序功能》在Go语言开发中,对数据进行排序是常见的需求,Go1.18版本引入的slices包提供了简洁高效的排序解决方案,支持内置类型和用户自定义类型的排序操作,本... 目录一、内置类型排序:字符串与整数的应用1. 字符串切片排序2. 整数切片排序二、检查切片排序状态: