Dropout 保留期望

🤖 Dropout Expected Output Calculator

Compute the expected output after dropout from the keep probability, plus the inference-time scaling factor that keeps train and test expectations aligned.

📐 计算公式 / 原理
保留概率 p = 1 − rate;训练期望 E[x] = p·x;缩放因子 = 1/p(inverted dropout)
训练时按 rate 随机置零并在保留分支乘 1/p,使期望与推理一致,推理阶段不做任何丢弃也不缩放。这相当于对大量稀疏子网络做隐式集成,抑制神经元共适应;rate 常取 0.1–0.5,过大反而欠拟合。

📐 计算公式与说明

期望输出 = x · (1 − p)
推理时缩放 1/(1−p)

Dropout 率通常取 0.2-0.5。

📚 深度解析:Dropout 保留期望

💡 常见使用场景

期望与缩放
输入 x=2.0, p=0.5:训练期期望输出=0.5×2=1.0。推理期若保留全部神经元,须把权重×0.5 使输出期望仍为 1.0( inverted dropout 在训练时先除 p)。

❓ 常见问题(FAQ)

为什么推理时要缩放?
训练丢弃使激活期望变为 p·x,若不缩放推理输出会比训练期望大 1/p 倍,分布错位导致性能下降;缩放恢复一致期望。
dropout 现在还常用吗?
在 Transformer 等大模型中常被 LayerNorm/BatchNorm 与权重衰减部分替代,但仍是有效正则;现代多用 dropout 配合注意力 dropout 与随机深度。