信息增益近似 使用指南
决策树信息增益计算器,用基尼指数或熵评估二分类节点分裂前后的不纯度下降,辅助特征选择与树结构构建。
计算公式与原理
基尼 = 2p(1 − p);加权子基尼 = w_L·2p_L(1 − p_L) + (1 − w_L)·2p_R(1 − p_R);基尼增益 = 根基尼 − 加权子基尼;熵 = −p·log₂p − (1 − p)·log₂(1 − p)
决策树分裂准则:基尼与熵都衡量节点纯度,取值越小越纯。基尼计算更快(无对数)是 CART 默认;熵对纯度变化略敏感。二者选出的分裂在绝大多数数据集上差异极小。
使用步骤
- 填写「根节点正例比例」。
- 填写「左子树正例比例」。
- 填写「左子树权重」。
- 填写「右子树正例比例」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 信息熵 H=−Σpᵢlog₂pᵢ;基尼不纯度 G=1−Σpᵢ²,均衡量节点混杂度。
- 信息增益=父节点不纯度−Σ(子节点样本占比×子节点不纯度),用于决策树分裂特征选择。
- 基尼计算更快且对错误分类敏感,CART 默认用基尼,ID3/C4.5 用熵。
算例参考
- 二分类节点分裂:父节点正类 6/负类 6,熵=1.0;按某特征分为左(5正1负)右(1正5负)。左熵≈0.65、右熵≈0.65,加权=0.5×0.65+0.5×0.65=0.65,信息增益=1.0−0.65=0.35。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 信息增益和基尼该用哪个?
- 两者结论常一致。基尼计算免对数更快,对多数类错误更敏感;熵对不纯度变化更敏感、偏向多值特征,需用增益率修正偏置。
- 为什么信息增益偏向取值多的特征?
- 取值越多越容易把样本分得更纯,增益天然偏大。C4.5 用增益率(增益/分支熵)惩罚多值特征以纠偏。