第四讲
模型误差的来源
使用非线性模型:
生成:从根节点开始,选择节点对应特诊,选择节点特征分割点,根据分割点分裂节点
不纯度:表示落在当前节点的样本类别分布的均衡程度
节点分裂后,节点不纯度应该更低
选择特征及对应分割点,使得分类前后的不纯度下降最大
节点不纯度的度量:
Gini指数:
信息熵
误分率
随机森林:
算法流程: