ROC曲线和AUC值
迪丽瓦拉
2025-05-30 09:38:32
0

ROC曲线(Receiver Operating Characteristic,受试者工作特征)

评价分类模型的可视化工具,是一条横纵坐标都限制在0-1范围内的曲线

  • 横坐标是假正率FPR,错误地判断为正例的概率

  • 纵坐标是真正率TPR,正确地判断为正例的概率(也是召回率recall)

一个混淆矩阵就对应ROC曲线中的一个坐标点

TPR和FPR的分母,对于同一个测试集是固定不变的,因为P和N分别表示测试集中正负样本的数目,所以TPR和FPR仅与TP(希望尽可能大)和FP(希望尽可能小)相关

故而在左边的ROC空间内,曲线越靠近左上角,效果越好,故B好于A

对角线相当于随机猜测,ROC曲线越接近这条对角线,模型的准确率越低

曲线凸起程度越高,模型性能越好

(一)两组概念

预测概率和阈值(共同决定模型输出结果)

分类模型的输出结果中包含一个0-1的概率值,该概率代表着对应的样本被预测为某类别的可能性

再通过阈值来进行划分:概率≥阈值的为正,反之为负

TPR和FPR

ROC曲线的横坐标为FPR(False Positive Rate,错误的预测为正的概率),纵坐标为TPR(True Positive Rate,正确的预测为正的概率)

(二)ROC曲线绘制步骤

  1. 将全部样本按概率递减排序

  1. 阈值从1至0变更,计算各阈值下对应的 (FPR, TPR) 数值对

  1. 将数值对绘于直角坐标系中

阈值为1时

(三)ROC曲线解读

可以将横轴理解为代价,纵轴理解为收获

例子:某商家最近推出一款产品,找出最有可能接受该产品的客户,以推销该产品。根据历史数据训练出一个模型,对应ROC曲线如下图,假设某一个阈值对应坐标(0.2, 0.8)

即在该阈值下,模型的FPR=0.2(全部不会购买该产品的客户数量的20%),TPR=0.8(全部会购买该产品的客户数量的80%)

假设该商家客户有1000人,其中400人购买,600人不购买,则在该模型的该阈值下,商家根据预测名单进行推销,能够推销成功的有 400*0.8=320人,推销不成功的有 600*0.2=120人

(四)sklearn实现

绘制ROC曲线主要基于sklearn库中的两个函数:roc_curve和auc

roc_curve函数

roc_curve(y_true, y_score, pos_label=None, sample_weight=None,drop_intermediate=True)

(1)输入值

  • y_true :一个和样本数量一致的一维向量,数据是正确的二元标签。如果标签不是{- 1,1}或{0,1},则可以显式指定pos_label

  • y_score : 一个和样本数量一致的一维向量,目标分数可以是阳性类的概率估计、置信度值或决策的非阈值度量(在某些分类器上由“decision_function”返回,比如SVM)。简单的理解就是对测试集进行分类后得到的一个用于衡量该类是阳性还是阴性的分数度量,分类器也是根据这个分数来判断测试集是阳性样本还是阴性样本,因此通常都可以在分类器的中间过程拿到这个分数

  • pos_label:样本标签,如果y_true不满足 {0,1}, {-1,1} 标签,则需要通过该参数指定哪些是阳性样本,其余的则为阴性样本,默认不输入

  • sample_weight:一个和样本数量一致的一维向量,指定每个样本的权重,默认不输入

  • drop_intermediate:为true时(默认= True)会删除一些不会出现在ROC曲线上的次优阈值

(2)返回值

  • fpr: 假阳性率序列,数量与thresholds一致的一维向量

  • tpr: 真阳性率序列,数量与thresholds一致的一维向量

  • thresholds: 该序列是一个递减序列,在每一个阈值下对y_score进行划分,大于的视为阳性,小于的视为阴性,从而计算出该阈值下的fpr

auc函数

auc(fpr, tpr)   # 输出是一个float类型的数值

代码

from sklearn.metrics import roc_curve, auc
import matplotlib.pyplot as pltdef plot_roc(y_true, y_pred):# 计算ROC曲线和AUC值fpr, tpr, thresholds = roc_curve(y_true, y_pred, pos_label=1)    # 假正例率FPR、真正例率TPR、阈值roc_auc = auc(fpr, tpr)plt.clf()   # 清除当前figure的所有axes,但是不关闭这个window,所以能继续复用于其他的plot# 绘制ROC曲线plt.plot(fpr, tpr, color='darkorange', label='ROC curve (AUC = %0.2f)' % roc_auc)   # label为图例里的文字plt.plot([0, 1], [0, 1], color='navy', linestyle='--')   # 直线plt.xlim([0.0, 1.0])plt.ylim([0.0, 1.05])plt.xlabel('False Positive Rate')plt.ylabel('True Positive Rate')plt.title('Receiver Operating Characteristic (ROC) Curve')plt.legend(loc="lower right")plt.savefig('ROC_Curve.png',dpi=300)   # dpi是分辨率

运行效果如下:


AUC(Area under the Curve of ROC)

(一)二分类

AUC表示ROC曲线下方面积,是一个数值,大小在0-1之间,AUC越大则分类器越好

  • AUC=1,完美分类器,该模型至少存在一个阈值,可以将正负样本完美划分开

  • 0.5 < AUC < 1,优于随机猜测,数值越大,分类器越好

  • AUC=0.5,相当于随机猜测,模型没有预测价值

  • AUC < 0.5,比随机猜测要差,然而若反向预测,该模型也可优于随机猜测

(二)N分类

  1. 宏观macro-AUC

针对每一个类别都可以画一个ROC曲线,求出对应的AUC值

最后对所有AUC值求某种平均,作为整个模型所有类别的宏观AUC

  1. 微观micro-AUC

根据下面的表,来得到一个新的针对整个模型的ROC曲线,以及对应的AUC值

相关内容

热门资讯

处理大数据的最佳方式——con... css属性处理大数据 content-visibility——只需一行CSS代码,让长...
Vuex由浅入深详细讲解 目录前言一,理解Vuex1.1 Vuex是什么1.2 Vuex概述1.3 Vuex统一...
Vector - CAPL -... 摸鱼聊天、答疑解惑首选之地 --- 车载网络哪些事儿你是否还在为VT板卡系统昂贵而发愁?...
qt5.6(mingw) 编译... 具体版本和操纵参考官网win msvc版本编译,Qt5.6编译PCL环境 备注...
【论文速览】引入motion ... 文章目录研究背景解决思路实验效果思考参考资料 收录于 ECCV 2020,代码地址...
字符串 - 二进制和文本字符串... 1.应用场景 主要用于探究字符串中的二进制和文本字符串,以及它们的区别和应用场景。2....
windows下使用gitea... windows下使用gitea搭建git服务器 详细过程 1、简述 使用过好几个git服务器...
LCHub:一句话让 AI 替... LCHub 3 月 18 日消息,这几天,GPT-4 接入微软 Office 全家桶的消息传遍了互联...
STM32模拟SPI控制NRF... STM32模拟SPI控制NRF24L01发送和接收 NRF24L01是一款2.4Ghz ISM频段无...
Vue路由及状态管理 1,Vue引入路由配置 在Vue中,我们可以通过vue-router路...
Lua 开发过程中常见坑 Lua 开发过程中常见坑 Lua next return _G.next( tb ) =&#...
蓝桥c++数位排序(运用pai... 问题描述 小蓝对一个数的数位之和很感兴趣, 今天他要按照数位之和给数排序。当 两个数各个数位之和不同...
3Dmax开孔打洞圆孔洞的几种... 最常见的几种打洞方法及技巧和注意事项总结如下。除了布尔运算外其余几种都是在可编辑多边形模式下进行的&...
04 - 进程参数编程 ---- 整理自狄泰软件唐佐林老师课程 查看所有文章链接:(更新中&...
【Git使用学习】本地创建项目... 记录学习过程,一波三折。以【Vue+CesiumJS学习(1&#...
电子拣货标签1代系统简介 CK_Label_v1 ​一、产品参数 1. 电池供电版 产品型号 CK_Label_v1 尺...
为什么写分页器的时候要用当前页... 比方说总共有100条数据(编号从0起算就是0到99),每次...
古典密码学 主要划分方式及其分类按密钥方式划分:对称,非对称按明文处理方式分...
C# 项目名称为什么是xxx.... 在 C# 中,通常将项目命名为“xxx.xxx”的形式,其中第一个“xx...
【Java】UDP网络编程 文章目录前言DatagramSocketDatagramPacket注意事项与区别代码演示 前言 U...