資訊增益近似 使用指南

決策樹資訊增益計算器,用基尼指數或熵評估二分類節點分裂前後的不純度下降,輔助特徵選擇與樹結構構建。

計算公式與原理

基尼 = 2p(1 − p);加權子基尼 = w_L·2p_L(1 − p_L) + (1 − w_L)·2p_R(1 − p_R);基尼增益 = 根基尼 − 加權子基尼;熵 = −p·log₂p − (1 − p)·log₂(1 − p)

決策樹分裂準則:基尼與熵都衡量節點純度,取值越小越純。基尼計算更快(無對數)是 CART 預設;熵對純度變化略敏感。二者選出的分裂在絕大多數資料集上差異極小。

使用步驟

  1. 填寫「根節點正例比例」。
  2. 填寫「左子樹正例比例」。
  3. 填寫「左子樹權重」。
  4. 填寫「右子樹正例比例」。
  5. 結果區會即時更新;可一鍵複製結果用於記錄或彙報。

典型使用場景

算例參考

注意事項

結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。

資訊增益和基尼該用哪個?
兩者結論常一致。基尼計算免對數更快,對多數類錯誤更敏感;熵對不純度變化更敏感、偏向多值特徵,需用增益率修正偏置。
為什麼資訊增益偏向取值多的特徵?
取值越多越容易把樣本分得更純,增益天然偏大。C4.5 用增益率(增益/分支熵)懲罰多值特徵以糾偏。
→ 開啟資訊增益近似工具