R语言-评分卡模型验证(ROC,KS,AIC,BIC)

2024-01-17 07:30

本文主要是介绍R语言-评分卡模型验证(ROC,KS,AIC,BIC),希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

本文主要记录几种常用的模型检验方法,重点在R语言的使用上,暂时不包括检验方法的原理。博主刚开始使用R语言不久,因此也借此机会整理记录自己的学习过程。如有不当,欢迎指正。


1. ROC与AUC,基尼系数


混淆矩阵Confusion Matirx

计算ROC之前先介绍如何计算混淆矩阵Confusion Matrix

1.可以用table(pre, test$label)

2.caret包里的confusionMatrix(data, reference)

ROC 和AUC

用pROC包的roc函数

# validate
library(pROC)  # roc
modelroc <- roc(test$label,pre)
modelauc<- auc(modelroc) # calculate area under the curve
plot(modelroc, print.auc=TRUE, auc.polygon=TRUE, grid=c(0.1, 0.2),
grid.col=c("green", "red"), max.auc.polygon=TRUE,
auc.polygon.col="skyblue", print.thres=TRUE) # draw roc
Gini <- 2*modelauc-1

基尼系数Gini Index

基尼系数最开始为经济学指标,判断一个群体收入分配的均匀程度,基尼系数越大,说明收入分配越不均匀。国际上通常把0.4作为警戒线,当大于0.4时易出现社会动荡。

在分类模型中,基尼系数衡量的是好坏样本的均匀程度,Gini系数越大越不均匀,也意味着好坏样本分得越开,这是我们想要的。Gini系数与AUC存在如下关系:

Gini=2AUC-1

代码可直接利用pROC包计算的auc值代入公式计算gini系数,见roc代码片断。


2.KS曲线及KS值

myKS <- function(pre,label){true <- sum(label)false <- length(label)-truetpr <- NULLfpr <- NULLo_pre <- pre[order(pre)] # let the threshold in an order from small to largefor (i in o_pre){tp <- sum((pre >= i) & label)tpr <- c(tpr,tp/true)fp <- sum((pre >= i) & (1-label))fpr <- c(fpr,fp/false)}plot(o_pre,tpr,type = "l",col= "green",xlab="threshold",ylab="tpr,fpr")lines(o_pre,fpr,type="l", col = "red")KSvalue <- max(tpr-fpr)sub = paste("KS value =",KSvalue)title(sub=sub)cutpoint <- which(tpr-fpr==KSvalue)thre <- o_pre[cutpoint]lines(c(thre,thre),c(fpr[cutpoint],tpr[cutpoint]),col = "blue")cat("KS-value:",KSvalue)
}
引用自编函数myKS:

myKS(pre, test$label)


3.AIC赤池信息量准则

赤池信息量准则 (Akaike Information Criterion ( AIC ))是衡量统计模型拟合优良性的一种标准,常用与最大似然估计。AIC定量地定义了测试模型,但是如果所有的模型都不能很好的表示测试数据。AIC计算了给定模型和真实模型之间的KL值。 以下引自百度百科


AIC=2k-2ln(L)
它的假设条件是模型的误差服从独立正态分布。
其中:k是所拟合模型中参数的数量,ln(L)是对数似然值
AIC的大小取决于L和k。k取值越小,AIC越小;L取值越大,AIC值越小。k小意味着模型简洁,L大意味着模型精确。因此AIC和修正的决定系数类似,在评价模型是兼顾了简洁性和精确性。
假设条件是模型的误差服从独立正态分布。 让n为观察数,SSR(SUM SQAURE OF RESIDUE)为残差平方和,那么AIC变为:
AIC=2k+nln(SSR/n)

4.BIC(SBC,SIC)

Schwarz's Bayesian Criterion,贝叶斯信息准则

BIC = -2lnL + plnn

lnL:最大对数你似然值

p:参数个数

n:样本量


5.PSI群体稳定性指标

PSI(population stability index)





这篇关于R语言-评分卡模型验证(ROC,KS,AIC,BIC)的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/615285

相关文章

C语言中%zu的用法解读

《C语言中%zu的用法解读》size_t是无符号整数类型,用于表示对象大小或内存操作结果,%zu是C99标准中专为size_t设计的printf占位符,避免因类型不匹配导致错误,使用%u或%d可能引发... 目录size_t 类型与 %zu 占位符%zu 的用途替代占位符的风险兼容性说明其他相关占位符验证示

C语言进阶(预处理命令详解)

《C语言进阶(预处理命令详解)》文章讲解了宏定义规范、头文件包含方式及条件编译应用,强调带参宏需加括号避免计算错误,头文件应声明函数原型以便主函数调用,条件编译通过宏定义控制代码编译,适用于测试与模块... 目录1.宏定义1.1不带参宏1.2带参宏2.头文件的包含2.1头文件中的内容2.2工程结构3.条件编

Go语言并发之通知退出机制的实现

《Go语言并发之通知退出机制的实现》本文主要介绍了Go语言并发之通知退出机制的实现,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起学习学习吧... 目录1、通知退出机制1.1 进程/main函数退出1.2 通过channel退出1.3 通过cont

Go语言编译环境设置教程

《Go语言编译环境设置教程》Go语言支持高并发(goroutine)、自动垃圾回收,编译为跨平台二进制文件,云原生兼容且社区活跃,开发便捷,内置测试与vet工具辅助检测错误,依赖模块化管理,提升开发效... 目录Go语言优势下载 Go  配置编译环境配置 GOPROXYIDE 设置(VS Code)一些基本

MySQL 主从复制部署及验证(示例详解)

《MySQL主从复制部署及验证(示例详解)》本文介绍MySQL主从复制部署步骤及学校管理数据库创建脚本,包含表结构设计、示例数据插入和查询语句,用于验证主从同步功能,感兴趣的朋友一起看看吧... 目录mysql 主从复制部署指南部署步骤1.环境准备2. 主服务器配置3. 创建复制用户4. 获取主服务器状态5

深入理解Go语言中二维切片的使用

《深入理解Go语言中二维切片的使用》本文深入讲解了Go语言中二维切片的概念与应用,用于表示矩阵、表格等二维数据结构,文中通过示例代码介绍的非常详细,需要的朋友们下面随着小编来一起学习学习吧... 目录引言二维切片的基本概念定义创建二维切片二维切片的操作访问元素修改元素遍历二维切片二维切片的动态调整追加行动态

Java通过驱动包(jar包)连接MySQL数据库的步骤总结及验证方式

《Java通过驱动包(jar包)连接MySQL数据库的步骤总结及验证方式》本文详细介绍如何使用Java通过JDBC连接MySQL数据库,包括下载驱动、配置Eclipse环境、检测数据库连接等关键步骤,... 目录一、下载驱动包二、放jar包三、检测数据库连接JavaJava 如何使用 JDBC 连接 mys

Go语言中make和new的区别及说明

《Go语言中make和new的区别及说明》:本文主要介绍Go语言中make和new的区别及说明,具有很好的参考价值,希望对大家有所帮助,如有错误或未考虑完全的地方,望不吝赐教... 目录1 概述2 new 函数2.1 功能2.2 语法2.3 初始化案例3 make 函数3.1 功能3.2 语法3.3 初始化

Spring Security中用户名和密码的验证完整流程

《SpringSecurity中用户名和密码的验证完整流程》本文给大家介绍SpringSecurity中用户名和密码的验证完整流程,本文结合实例代码给大家介绍的非常详细,对大家的学习或工作具有一定... 首先创建了一个UsernamePasswordAuthenticationTChina编程oken对象,这是S

Go语言中nil判断的注意事项(最新推荐)

《Go语言中nil判断的注意事项(最新推荐)》本文给大家介绍Go语言中nil判断的注意事项,本文给大家介绍的非常详细,对大家的学习或工作具有一定的参考借鉴价值,需要的朋友参考下吧... 目录1.接口变量的特殊行为2.nil的合法类型3.nil值的实用行为4.自定义类型与nil5.反射判断nil6.函数返回的