L1 L2 正则化惩罚

🔍 L1 / L2 Regularization Penalty Calculator

Compute the L1 or L2 penalty added to the loss from your weights and regularization strength, and compare Lasso sparsity with Ridge shrinkage.

📐 计算公式 / 原理
L1 = λ₁·Σ|wᵢ|;L2 = λ₂·Σwᵢ²;总惩罚 = L1 + L2
L1 在 0 处不可导且梯度恒为 ±λ,会把不重要权重精确压到 0,产生稀疏解可用于特征选择;L2 惩罚与权重成正比,越接近 0 推力越弱,只做均匀收缩、保留小权重,泛化通常更稳。二者混用即 Elastic Net。

📐 计算公式与说明

L1 = λ₁Σ|w|
L2 = λ₂Σw²

L1 产生稀疏权重,L2 使权重平滑。

📚 深度解析:L1 L2 正则化惩罚

💡 常见使用场景

组合惩罚
Loss=0.2, w=[3,−4], λ₁=0.01, λ₂=0.01:L1 惩罚=0.01×7=0.07,L2 惩罚=0.01×25=0.25,总损失=0.2+0.07+0.25=0.52。

❓ 常见问题(FAQ)

Elastic Net 比单独 L1/L2 好在哪?
同时获得稀疏性与分组稳定性,尤其特征高度相关时比纯 L1 更稳健;代价是多一个超参,需用交叉验证调。
权重衰减和 L2 完全等价吗?
在标准 SGD 下等价;但用 AdamW 时权重衰减与梯度解耦,实现不同、效果更优,不能简单当作 L2 代入。