信息熵、信息增益、信息增益率、gini、woe、iv、VIF

整理一下这几个量的计算公式,便于记忆

 

 

采用信息增益率可以解决ID3算法中存在的问题,因此将采用信息增益率作为判定划分属性好坏的方法称为C4.5。需要注意的是,增益率准则对属性取值较少的时候会有偏好,为了解决这个问题,C4.5并不是直接选择增益率最大的属性作为划分属性,而是之前先通过一遍筛选,先把信息增益低于平均水平的属性剔除掉,之后从剩下的属性中选择信息增益率最高的,这样的话,相当于两方面都得到了兼顾。
参考资料:信息熵、信息增益、信息增益率

                  woe和iv的计算

 多重共线性:多重共线性是指多变量线性回归中,变量之间由于存在高度相关关系而使回归估计不准确。比如虚拟变量陷阱(英语:Dummy variable trap)即有可能触发多重共线性问题。

 

 

 

 

posted on 2019-10-31 08:48  静静的白桦林_andy  阅读(4019)  评论(0编辑  收藏  举报

导航