Dropout 保留期望 使用指南
Dropout 期望输出计算器,输入保留概率求 dropout 后的期望输出与推理期缩放因子,辅助神经网络正则化参数理解。
计算公式与原理
保留概率 p = 1 − rate;训练期望 E[x] = p·x;缩放因子 = 1/p(inverted dropout)
训练时按 rate 随机置零并在保留分支乘 1/p,使期望与推理一致,推理阶段不做任何丢弃也不缩放。这相当于对大量稀疏子网络做隐式集成,抑制神经元共适应;rate 常取 0.1–0.5,过大反而欠拟合。
使用步骤
- 填写「Dropout 率」。
- 填写「输入值」。
- 填写「神经元数」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 训练期以概率 p 随机丢弃神经元,期望输出 E[out]=p·x,破坏 co-adaptation 起正则作用。
- 推理期若不做缩放,需将权重乘 p(或训练期除以 p)使期望一致,即 inverted dropout。
- 常用 p=0.5 于隐藏层、0.0~0.2 于输入层;过大 p 会欠拟合。
算例参考
- 期望与缩放:输入 x=2.0, p=0.5:训练期期望输出=0.5×2=1.0。推理期若保留全部神经元,须把权重×0.5 使输出期望仍为 1.0( inverted dropout 在训练时先除 p)。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 为什么推理时要缩放?
- 训练丢弃使激活期望变为 p·x,若不缩放推理输出会比训练期望大 1/p 倍,分布错位导致性能下降;缩放恢复一致期望。
- dropout 现在还常用吗?
- 在 Transformer 等大模型中常被 LayerNorm/BatchNorm 与权重衰减部分替代,但仍是有效正则;现代多用 dropout 配合注意力 dropout 与随机深度。