信息增益近似 使用指南

决策树信息增益计算器,用基尼指数或熵评估二分类节点分裂前后的不纯度下降,辅助特征选择与树结构构建。

计算公式与原理

基尼 = 2p(1 − p);加权子基尼 = w_L·2p_L(1 − p_L) + (1 − w_L)·2p_R(1 − p_R);基尼增益 = 根基尼 − 加权子基尼;熵 = −p·log₂p − (1 − p)·log₂(1 − p)

决策树分裂准则:基尼与熵都衡量节点纯度,取值越小越纯。基尼计算更快(无对数)是 CART 默认;熵对纯度变化略敏感。二者选出的分裂在绝大多数数据集上差异极小。

使用步骤

  1. 填写「根节点正例比例」。
  2. 填写「左子树正例比例」。
  3. 填写「左子树权重」。
  4. 填写「右子树正例比例」。
  5. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

信息增益和基尼该用哪个?
两者结论常一致。基尼计算免对数更快,对多数类错误更敏感;熵对不纯度变化更敏感、偏向多值特征,需用增益率修正偏置。
为什么信息增益偏向取值多的特征?
取值越多越容易把样本分得更纯,增益天然偏大。C4.5 用增益率(增益/分支熵)惩罚多值特征以纠偏。
→ 打开信息增益近似工具