
如何轻松应对机器学习中的样本不平衡问题?
本文共计3679个文字,预计阅读时间需要15分钟。在银行业,判断一个新客户是否会违约,通常不违约的人与违约的人的比例是99:1。真正违约的人其实是非常少数的。在这种分类状态下,即便是最简便的模型也不做什么,全都将所有人当作不违约的。在银行要
共收录篇相关文章

本文共计3679个文字,预计阅读时间需要15分钟。在银行业,判断一个新客户是否会违约,通常不违约的人与违约的人的比例是99:1。真正违约的人其实是非常少数的。在这种分类状态下,即便是最简便的模型也不做什么,全都将所有人当作不违约的。在银行要

本文共计3763个文字,预计阅读时间需要16分钟。在银行,需判断新客户是否会违约,通常不违约的人VS违约的人比例是99:1,真正违约的人其实相当少。在这种分类状态下,即使便利模型什么也不做,也将所有的人都当作违约者。在银行要判断一个&quo

本文共计2352个文字,预计阅读时间需要10分钟。1.+ 数据不均衡:所谓的数据不均衡(imbalanced data)是指数据集中各个类别的数量分布不均衡;数据不均衡在现实业务中十分常见。例如,信用卡欺诈数据:99%都是正常数据,1%是欺