Dropout 保留期望 使用指南
Dropout 期望輸出計算器,輸入保留機率求 dropout 後的期望輸出與推理期縮放因子,輔助神經網路正則化引數理解。
計算公式與原理
保留機率 p = 1 − rate;訓練期望 E[x] = p·x;縮放因子 = 1/p(inverted dropout)
訓練時按 rate 隨機置零並在保留分支乘 1/p,使期望與推理一致,推理階段不做任何丟棄也不縮放。這相當於對大量稀疏子網路做隱式整合,抑制神經元共適應;rate 常取 0.1–0.5,過大反而欠擬合。
使用步驟
- 填寫「Dropout 率」。
- 填寫「輸入值」。
- 填寫「神經元數」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 訓練期以機率 p 隨機丟棄神經元,期望輸出 E[out]=p·x,破壞 co-adaptation 起正則作用。
- 推理期若不做縮放,需將權重乘 p(或訓練期除以 p)使期望一致,即 inverted dropout。
- 常用 p=0.5 於隱藏層、0.0~0.2 於輸入層;過大 p 會欠擬合。
算例參考
- 期望與縮放:輸入 x=2.0, p=0.5:訓練期期望輸出=0.5×2=1.0。推理期若保留全部神經元,須把權重×0.5 使輸出期望仍為 1.0( inverted dropout 在訓練時先除 p)。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 為什麼推理時要縮放?
- 訓練丟棄使啟用期望變為 p·x,若不縮放推理輸出會比訓練期望大 1/p 倍,分佈錯位導致效能下降;縮放恢復一致期望。
- dropout 現在還常用嗎?
- 在 Transformer 等大模型中常被 LayerNorm/BatchNorm 與權重衰減部分替代,但仍是有效正則;現代多用 dropout 配合注意力 dropout 與隨機深度。