資訊增益近似 使用指南
決策樹資訊增益計算器,用基尼指數或熵評估二分類節點分裂前後的不純度下降,輔助特徵選擇與樹結構構建。
計算公式與原理
基尼 = 2p(1 − p);加權子基尼 = w_L·2p_L(1 − p_L) + (1 − w_L)·2p_R(1 − p_R);基尼增益 = 根基尼 − 加權子基尼;熵 = −p·log₂p − (1 − p)·log₂(1 − p)
決策樹分裂準則:基尼與熵都衡量節點純度,取值越小越純。基尼計算更快(無對數)是 CART 預設;熵對純度變化略敏感。二者選出的分裂在絕大多數資料集上差異極小。
使用步驟
- 填寫「根節點正例比例」。
- 填寫「左子樹正例比例」。
- 填寫「左子樹權重」。
- 填寫「右子樹正例比例」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 資訊熵 H=−Σpᵢlog₂pᵢ;基尼不純度 G=1−Σpᵢ²,均衡量節點混雜度。
- 資訊增益=父節點不純度−Σ(子節點樣本佔比×子節點不純度),用於決策樹分裂特徵選擇。
- 基尼計算更快且對錯誤分類敏感,CART 預設用基尼,ID3/C4.5 用熵。
算例參考
- 二分類節點分裂:父節點正類 6/負類 6,熵=1.0;按某特徵分為左(5正1負)右(1正5負)。左熵≈0.65、右熵≈0.65,加權=0.5×0.65+0.5×0.65=0.65,資訊增益=1.0−0.65=0.35。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 資訊增益和基尼該用哪個?
- 兩者結論常一致。基尼計算免對數更快,對多數類錯誤更敏感;熵對不純度變化更敏感、偏向多值特徵,需用增益率修正偏置。
- 為什麼資訊增益偏向取值多的特徵?
- 取值越多越容易把樣本分得更純,增益天然偏大。C4.5 用增益率(增益/分支熵)懲罰多值特徵以糾偏。