L1 L2 正則化懲罰 使用指南
L1/L2 正則化懲罰計算器,輸入權重與正則係數求對損失函式的懲罰項,對比 Lasso 與 Ridge 兩種正則化差異。
計算公式與原理
L1 = λ₁·Σ|wᵢ|;L2 = λ₂·Σwᵢ²;總懲罰 = L1 + L2
L1 在 0 處不可導且梯度恆為 ±λ,會把不重要權重精確壓到 0,產生稀疏解可用於特徵選擇;L2 懲罰與權重成正比,越接近 0 推力越弱,只做均勻收縮、保留小權重,泛化通常更穩。二者混用即 Elastic Net。
使用步驟
- 填寫「權重1」。
- 填寫「權重2」。
- 填寫「權重3」。
- 填寫「L1 係數」。
- 填寫「L2 係數」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 懲罰項加入損失:L_total=Loss+λ₁‖w‖₁+λ₂‖w‖₂²,統稱彈性網路(Elastic Net)。
- L1 促稀疏(特徵選擇),L2 促平滑(權重衰減),二者互補。
- 權重衰減(weight decay)本質是 L2,深度學習常用之穩定訓練。
算例參考
- 組合懲罰:Loss=0.2, w=[3,−4], λ₁=0.01, λ₂=0.01:L1 懲罰=0.01×7=0.07,L2 懲罰=0.01×25=0.25,總損失=0.2+0.07+0.25=0.52。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- Elastic Net 比單獨 L1/L2 好在哪?
- 同時獲得稀疏性與分組穩定性,尤其特徵高度相關時比純 L1 更穩健;代價是多一個超參,需用交叉驗證調。
- 權重衰減和 L2 完全等價嗎?
- 在標準 SGD 下等價;但用 AdamW 時權重衰減與梯度解耦,實現不同、效果更優,不能簡單當作 L2 代入。