資料增強有效量 使用指南
按增強變換組合與重複次數,估算資料增強後的等效訓練樣本量,輔助判斷樣本是否充足,適用於小資料集訓練、過擬合緩解與增強策略設計。
計算公式與原理
理論擴充量 = 基數 × 增強倍數;有效等效量 = 基數 × [1 + (倍數 − 1) × 多樣性係數]
資料增強的收益取決於"新增樣本帶來多少新資訊":若變換高度相似(旋轉 1°),多樣性係數趨近 0,擴得再多也只是重複;係數接近 1 才算真正等效的新資料。有效量超過數千後邊際收益迅速下降。
使用步驟
- 填寫「原始樣本數」。
- 填寫「每種樣本增強次數」。
- 填寫「增強多樣性係數 0-1」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- 等效樣本量≈原始樣本×增強變換組合數×重複係數,但重複變換會帶來相關性。
- 增強主要緩解過擬合而非憑空創造獨立資訊,組合越多樣增益越實在。
- 小資料集應優先幾何/顏色增強與混合策略(Mixup/CutMix)提升多樣性。
算例參考
- 增強組合估算:原始 1000 張,施加翻轉/旋轉/色彩 3 類各 2 檔共 8 種組合 → 等效≈1000×8=8000 張。若同一變換重複 3 次,有效增益遠低於 3 倍,因樣本高度相關。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- 增強越多越好嗎?
- 否。過度或不當增強(如旋轉破壞方向語義)會引入噪聲甚至錯誤標籤,反而損害訓練。應以驗證集表現而非數量為準。
- 增強樣本算獨立樣本嗎?
- 不算。它們與原始高度相關,對泛化的貢獻低於等量真實標註資料;擴增主要起正則化作用。