我眼中的模型评估

眼中信用评分模型 关于信用风险 之前工作中涉及到信用风险,接下来几天就分享些我在信用风险建模领域的一些经验吧~ 推荐一本比较好的资料书-《信用风险评分卡研究-基于SAS的开发与实施》,书的核心内容为以逻辑回归为基础构建信用评分模型,如果将这本书的内... 阅读详情

                                                      模型验证样本是有要求的

      模型验证样本需要与前面建模样本进行完全相同的处理,即:

  • 模型的验证样本同样需要进行数据清洗、缺失值填充、分类变量WOE转换等处理;
  • 在缺失值进行填补时,需要使用训练集的统计量而不是验证样本的统计量。例如训练集使用年龄的均值35岁作为填补缺失值,那么验证样本也应使用35作为填补缺失值,不可以随意进行缺失值的填补。

                                                           混淆矩阵有什么用

      逻辑回归模型的几个衡量指标如洛伦兹曲线、ROC曲线、lift曲线来源于混淆矩阵,如果针对同一个问题构建不同的模型,当进行模型间效果比较时,经常会用到这三个曲线。

      不单单是逻辑回归模型具有混淆矩阵,只要因变量为离散形式的模型都具有混淆矩阵,混淆矩阵不是为逻辑回归模型设置的,而是为分类选择模型而设置的,连决策树与神经网络都会有混淆矩阵

       混淆矩阵中的数值是动态的数据,其中,A与D都是猜对的数据,理论上这两格中数据量越大越好,但是B与C的数据也是必不可少的,如果没有B与C部分的数据,则会造成过度拟合。一般,混淆矩阵会涉及到下面几个解读指数:

  • 正确率=(A+D)/(A+B+C+D),即猜对了比上总量;
  • 灵敏度=A/(A+B),即所有真实1中猜对的比例;

  • 特异度=D/(C+D),即所有真实0中猜对的比例;

  • 命中率=A/(A+C),即猜为1的数据中猜对的比例。

                                                    没人用决策树做信用评分模型

       从模型稳定性角度来看,决策树不能做信用评分模,原因涉及到决策树算法背后的搜索逻辑。决策树进行拆分时,其算法会以搜索的形式去寻找最优值,搜索的方式有穷举搜索与启发式搜索两种:

  • 穷举搜索即设置一个很小的间隔,进行逐值扫描,速度较慢,R和SAS中一般会先设置5000次穷举;
  • 启发式搜索为一种区间搜索,即将值分为不同区间,在区间内进行搜索。例如质数的搜索形式即为启发式搜索。

      上面两种搜索形式,无论使用哪一种,都极有可能错过最优值,并非算法有问题,而是计算的方式存在问题,因此任何的统计软件都必须考虑截断误差,如果截断误差控制的不好,便很有可能会出现漏掉最优值的情况。

       决策树最大的问题在于,每次计算规则都会发生变动,所以我经常在信用评分建模前用决策树进行风险分池,而绝不会用决策树去主导构建信用评分模型何谓风险分池,举个例子,例如某个客户信用卡逾期,但是经查询发现该人为本地首富,那么可以断定该人违约可能并非出于本意,很可能是发生了意外的情况导致违约,风险分池就是将这样的人与老百姓分池分开

                                                          我眼中的ROC曲线

      衡量模型效果的指标之一为ROC曲线,一般,ROC曲线的取值在[0.5,1]之间,如果:

  • [0.5,0.7)表示模型效果较低
  • [0.7,0.85)表示模型效果一般

  • [0.85,0.95)表示模型效果良好

  • [0.95,1)好到这种程度的模型一般不会存在,至少我从来没有遇到过

       一般,ROC曲线还会出现如下两种不同的情况,分别适用于不同的业务场景:

  • 违约分值高处敏感

       如果建模后ROC曲线是这样的形态,说明模型在违约风险高人群中的预测能力很强,而对于违约风险低的人员预测能力较差。很多的业务场景会专门要求做出这样的模型,例如汽车金融,因为业务的特点会要求筛选出极高风险的客户,而对于大部分客户还是予以分期贷款的

  • 违约分值低处敏感

       如果建模后ROC曲线是这样的形态,说明模型在违约风险低的人群中预测能力很强,在高风险人群中的预测能力很弱,例如银行的信用卡中心,业务需要明确授予低风险的优质客户较高的额度,所以需要明确哪些客户的违约风险较低

                                                    营销场景最看重提升度曲线

      提升度曲线也是衡量分类模型效果的指标之一,它衡量的是与随机选择相比,模型对于响应的预测能力的好坏程度。一般,提升度曲线越往上、下降越慢表示模型越好

      通常,营销场景中会更多的用到提升度曲线,即可以先找找准最有可能是目标的客户进行电话推销,可以较为节约成本。而风险行业处于成本的考虑则不太使用提升度曲线。所以做互联网金融更为关注ROC曲线与KS曲线,而业务营销场景会更为关注Lift曲线。SAS EM中可以提供lift曲线。

                                                  信用评分模型最看重KS

       一般,信用评分模型最为看中的模型指标不是ROC曲线、不是洛伦兹曲线,也不是lift曲线,而是KS。KS曲线用于表示模型对于好坏样本的区分程度。通常:

  • KS小于20,表明模型没有区分好坏的能力;
  • KS介于20-40之间,表明模型勉强接受;

  • KS介于41-50之间,表明模型有的区分能力;

  • KS介于51-60之间,表明模型有很好的区分能力;

  • KS介于61-75之间,表明模型有非常好的区分能力;

  • KS大于75,很可能建模出错,不太可能出现这么高的情况。

       通常模型的监控工作只需要使用KS曲线进行监控即可,如果事后监控发现好坏样本之间的差异已经不太明显的时候,则说明模型已失效,需要重新进行模型修正、调整。

我的公众号:Data Analyst

个人网站:https://www.datanalyst.net/

眼中的逻辑回归模型 分类选择模型 当被解释变量Y为 取有限个可能值的分类变量时,需要建立分类选择模型。分类选择模型大约有十几个左右,例如: 线性概率模型 对数线性模型 逻辑回归模型 条件逻辑回归模型... 阅读详情

相关推荐

Vitalik Buterin眼中的区块链信任模型

大多区块链应用最有价值的属性之一就是“免信任” (trustlessness),即应用能够以预期的方式保持运行而无需依赖特定参与者以特定形式行事,即使他们将来的相关利益可能产生变化并使其做出意料之外的举动。区块链应用从来都不是完全的免信任化,但是某些应用确实比其他应用的免信任程度更高。如果我们想要朝着信任最小化的目标前进,就需要首先具备辨别信任程度的高低。 首先,我个人对“信任”的简单定义是:信任就是对他人行为进行假设。在疫情爆发前,你走在街上不会因为防止有人突然捅你一刀而刻意跟他人保持两米的距离,这就是一

CECBC的博客 526

2019年“深圳杯”数学建模挑战赛A题-深圳居民健康水平评估与测控模型研究.pdf

2019年深圳杯数学建模A题,深圳居民健康水平评估与测控模型研究

技术人必读:百度面试官眼中的优秀程序员成长模型

在互联网行业人才竞争白热化的今天,企业对程序员的能力评估早已超越单一技术维度。百度作为国内技术领先企业,其面试官在数万次技术面试中总结出一套科学的成长评估模型。本文旨在解析这套模型的核心要素,为0-10年经验的技术人提供可落地的能力提升指南,涵盖技术深度、知识广度、软技能职业素养四大维度,包含具体评估标准、成长路径实战建议。能力模型总览:三维度构建成长框架,解析T型能力结构本质技术能力矩阵:从基础到专家的五层技术能力图谱,附量化评估表软技能体系:揭秘技术人必备的沟通协作、需求分析项目管理能力。

AI天才研究院 1823

深圳居民健康水平评估与测控模型研究及MATLAB代码

深圳居民健康水平评估与测控模型研究及MATLAB代码

模型评估

模型评估模型开发过程不可或缺的一部分。它有助于发现表达数据的最佳模型所选模型将来工作的性能如何。 按照数据集的目标值不同,可以把模型评估分为分类模型评估回归模型评估。 1 分类模型评估 准确率:预测正确的数占样本总数的比例https://blog.csdn.net/weixin_48135624/article/details/114887146 精准率:正确预测为正占全部预测为正的比例 召回率:正确预测为正占全部正校本的比例 F1-score:主...

缘 源 园 2154

机器学习之模型评估

模型评估

Annaaphq的博客 1946

又到一年“粽子节”,快来测测你包的粽子颜值几分

摘要:华为云ModelArts粽子颜值测评神器来了,那到底你包的粽子颜值有几分呢?

华为云官方博客 1608

手把手教你用RetinaFace实现人脸关键点检测

本文介绍了如何在星图GPU平台上自动化部署RetinaFace人脸检测关键点模型镜像,快速实现人脸定位与5点关键点检测。用户无需配置复杂环境,即可通过简单脚本对图片或视频帧进行人脸分析,其结果可直接应用于人脸校正、美颜特效等图像处理场景,提升开发效率。

weixin_35307279的博客 294

模型评估第四层:评测维度与方法(我们怎么评分?)

构建这个法庭,需要我们精心设计“法律条文”(评估维度)、制定“量刑标准”(评分标准),并选择合适的“法官”(评估方式)。是简单地在旁边打上一个“√”或“×”,还是像一位经验丰富的法官,依据严谨的法典,从多个角度审视证据,最终给出一个公正、深刻且令人信服的裁决?:制定评分量规的过程,本身就是一次深刻的“战略对齐”。一个优秀的评估体系,应该像一个棱镜,将模型的输出分解成一道光谱,让我们看清其能力的每一个维度。一个在“创造性”上满分但在“事实性”上低分的模型,可能是优秀的营销文案助手,但却是灾难性的法律顾问。

m0_59598970的博客 1368

2017年深圳杯建模挑战赛C题决赛论文(独家)

本人2017年入选了深圳杯建模决赛,这是正式答辩时的论文。仅供各位建模的同学学习参考。

论文研究-状态表驱动复用模型.pdf

在有关状态变迁的MIS开发中,由于状态变迁的特殊性,其管理流程及实现代码基本无法通用。提出一种可进行状态扩充且可复用的模型:状态表驱动复用模型,该模型使用扩充的Petri网S图进行需求分析,再用得到的状态表驱动状态关系管理引擎,实现系统开发。通过实际项目的应用,该模型提高了开发效率,并体现了良好的动态扩展性。

一文读懂!提示工程架构师眼中提示工程成功的评估准则

提示工程的核心目标是通过输入空间的设计,让大语言模型(LLM)输出符合预期的结果。但“成功”的定义从未标准化——是“测试集准确率95%”?还是“用户满意度提升30%”?或是“系统故障减少50%”?本文将构建一套从“基础指标”到“系统影响”的分层评估框架提示工程的“成功”本质是什么?如何用可量化的指标衡量提示的有效性?如何将评估结果转化为提示优化的 actionable insights?无论是入门者还是资深提示架构师,都能从本文获得“精准评估提示效果”的系统性方法。

AI Agent Harness Engineering 961

基于DeepPupil Net的眼中心定位算法

本文介绍了一种基于DeepPupil Net的眼中心定位算法,其通过神经网络模型学习从眼部图像中提取眼中心位置信息,在实验中表现出了良好的性能准确度。DeepPupil Net算法是一种基于深度学习的眼中心定位算法,其核心思路是通过神经网络模型学习从眼部图像中提取眼中心位置的特征信息。使用准备好的眼部图像数据集,我们可以对上述神经网络模型进行训练,以学习从眼部图像中提取眼中心位置的特征信息。特征融合:将提取出的眼部图像特征外部的人脸特征进行融合,得到一个更为准确的眼中心位置估计值。

带你成为别人眼中的大佬! 626

模型眼中的世界是黑白的吗?GPT-4竟不如开源模型?颜色理解成模型新短板

人类通过颜色感知世界——比如红灯停绿灯行、通过皮肤颜色判断健康状态,甚至艺术品中的情感表达都依赖颜色。:在基础颜色识别任务上表现尚可(60%以上准确率),但在需要推理的任务(如计算颜色占比)中,准确率接近随机猜测(55%)。:在“颜色幻觉”任务中(比如背景色干扰物体颜色判断),AI表现反而在图片变黑白后提升!:当图片颜色被篡改时,多数模型表现大幅下降。:在色盲测试任务中,多数模型表现极差(准确率<30%),甚至不如人类色盲患者。:当前模型的视觉编码器规模普遍较小(3-4亿参数),需探索更大规模的视觉模型

zenRRan的博客 1024

Moondream视觉AI模型7个实用技巧让你轻松理解AI眼中的世界

Moondream是一个开源的视觉语言模型,它能够像人类一样"看"懂图像并回答相关问题。这个强大的AI模型拥有2B0.5B两个版本,可以在各种设备上运行,从高端GPU到边缘设备都能胜任。🎯 作为一款轻量级但功能强大的视觉AI工具,Moondream能够实现图像描述、视觉问答、物体检测等多种任务,让你真正理解AI模型是如何"思考""观察"的。 ## 🌟 快速开始:一键安装Moondrea

gitblog_00804的博客 455
上一篇: 我眼中的变量聚类
下一篇: 客户画像中的聚类分析
聋聋聋聋呀
博客等级 码龄10年 52粉丝 45原创
评论
添加红包

请填写红包祝福语或标题

红包个数最小为10个

红包金额最低5元

当前余额3.43前往充值 >
需支付:10.00
成就一亿技术人!
领取后你会自动成为博主和红包主的粉丝 规则
hope_wisdom
发出的红包
实付
使用余额支付
点击重新获取
扫码支付
钱包余额 0

抵扣说明:

1.余额是钱包充值的虚拟货币,按照1:1的比例进行支付金额的抵扣。
2.余额无法直接购买下载,可以购买VIP、付费专栏及课程。

余额充值