信息增益近似

📡 Information Gain (Gini / Entropy) Calculator

Measure the impurity drop before and after a binary split using the Gini index or entropy, to compare candidate features when building a decision tree.

📐 计算公式 / 原理
基尼 = 2p(1 − p);加权子基尼 = w_L·2p_L(1 − p_L) + (1 − w_L)·2p_R(1 − p_R);基尼增益 = 根基尼 − 加权子基尼;熵 = −p·log₂p − (1 − p)·log₂(1 − p)
决策树分裂准则:基尼与熵都衡量节点纯度,取值越小越纯。基尼计算更快(无对数)是 CART 默认;熵对纯度变化略敏感。二者选出的分裂在绝大多数数据集上差异极小。

📐 计算公式与说明

基尼 = 2p(1−p)
熵 = −p·log₂p − (1−p)·log₂(1−p)
增益 = 父不纯度 − 加权子不纯度

决策树分裂选择增益最大的特征。

📚 深度解析:信息增益近似

💡 常见使用场景

二分类节点分裂
父节点正类 6/负类 6,熵=1.0;按某特征分为左(5正1负)右(1正5负)。左熵≈0.65、右熵≈0.65,加权=0.5×0.65+0.5×0.65=0.65,信息增益=1.0−0.65=0.35。

❓ 常见问题(FAQ)

信息增益和基尼该用哪个?
两者结论常一致。基尼计算免对数更快,对多数类错误更敏感;熵对不纯度变化更敏感、偏向多值特征,需用增益率修正偏置。
为什么信息增益偏向取值多的特征?
取值越多越容易把样本分得更纯,增益天然偏大。C4.5 用增益率(增益/分支熵)惩罚多值特征以纠偏。

如何使用信息增益近似

  1. 按页面提示逐项填写或选择所需参数。
  2. 点击「计算」或「生成」按钮运行。
  3. 在结果区查看输出,可复制结果或导出使用。

参数说明

适用场景

信息熵 H=−Σpᵢlog₂pᵢ;基尼不纯度 G=1−Σpᵢ²,均衡量节点混杂度。

常见问题

信息增益和基尼该用哪个?
两者结论常一致。基尼计算免对数更快,对多数类错误更敏感;熵对不纯度变化更敏感、偏向多值特征,需用增益率修正偏置。
为什么信息增益偏向取值多的特征?
取值越多越容易把样本分得更纯,增益天然偏大。C4.5 用增益率(增益/分支熵)惩罚多值特征以纠偏。