数据增强有效量

🤖 Data Augmentation Effective Sample Size

Estimate how many effective training samples a set of augmentation transforms actually adds, from the number of transforms and repeat factor. Use it to judge whether your dataset is large enough.

📐 计算公式 / 原理
理论扩充量 = 基数 × 增强倍数;有效等效量 = 基数 × [1 + (倍数 − 1) × 多样性系数]
数据增强的收益取决于"新增样本带来多少新信息":若变换高度相似(旋转 1°),多样性系数趋近 0,扩得再多也只是重复;系数接近 1 才算真正等效的新数据。有效量超过数千后边际收益迅速下降。

📐 计算公式与说明

有效量 ≈ 原始样本 × [1 + (aug − 1) × 多样性系数]

过度增强可能引入噪声。

📚 深度解析:数据增强有效量

💡 常见使用场景

增强组合估算
原始 1000 张,施加翻转/旋转/色彩 3 类各 2 档共 8 种组合 → 等效≈1000×8=8000 张。若同一变换重复 3 次,有效增益远低于 3 倍,因样本高度相关。

❓ 常见问题(FAQ)

增强越多越好吗?
否。过度或不当增强(如旋转破坏方向语义)会引入噪声甚至错误标签,反而损害训练。应以验证集表现而非数量为准。
增强样本算独立样本吗?
不算。它们与原始高度相关,对泛化的贡献低于等量真实标注数据;扩增主要起正则化作用。