L1 L2 正则化惩罚 使用指南
L1/L2 正则化惩罚计算器,输入权重与正则系数求对损失函数的惩罚项,对比 Lasso 与 Ridge 两种正则化差异。
计算公式与原理
L1 = λ₁·Σ|wᵢ|;L2 = λ₂·Σwᵢ²;总惩罚 = L1 + L2
L1 在 0 处不可导且梯度恒为 ±λ,会把不重要权重精确压到 0,产生稀疏解可用于特征选择;L2 惩罚与权重成正比,越接近 0 推力越弱,只做均匀收缩、保留小权重,泛化通常更稳。二者混用即 Elastic Net。
使用步骤
- 填写「权重1」。
- 填写「权重2」。
- 填写「权重3」。
- 填写「L1 系数」。
- 填写「L2 系数」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 惩罚项加入损失:L_total=Loss+λ₁‖w‖₁+λ₂‖w‖₂²,统称弹性网络(Elastic Net)。
- L1 促稀疏(特征选择),L2 促平滑(权重衰减),二者互补。
- 权重衰减(weight decay)本质是 L2,深度学习常用之稳定训练。
算例参考
- 组合惩罚:Loss=0.2, w=[3,−4], λ₁=0.01, λ₂=0.01:L1 惩罚=0.01×7=0.07,L2 惩罚=0.01×25=0.25,总损失=0.2+0.07+0.25=0.52。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- Elastic Net 比单独 L1/L2 好在哪?
- 同时获得稀疏性与分组稳定性,尤其特征高度相关时比纯 L1 更稳健;代价是多一个超参,需用交叉验证调。
- 权重衰减和 L2 完全等价吗?
- 在标准 SGD 下等价;但用 AdamW 时权重衰减与梯度解耦,实现不同、效果更优,不能简单当作 L2 代入。