数据增强有效量 使用指南

按增强变换组合与重复次数,估算数据增强后的等效训练样本量,辅助判断样本是否充足,适用于小数据集训练、过拟合缓解与增强策略设计。

计算公式与原理

理论扩充量 = 基数 × 增强倍数;有效等效量 = 基数 × [1 + (倍数 − 1) × 多样性系数]

数据增强的收益取决于"新增样本带来多少新信息":若变换高度相似(旋转 1°),多样性系数趋近 0,扩得再多也只是重复;系数接近 1 才算真正等效的新数据。有效量超过数千后边际收益迅速下降。

使用步骤

  1. 填写「原始样本数」。
  2. 填写「每种样本增强次数」。
  3. 填写「增强多样性系数 0-1」。
  4. 结果区会即时更新;可一键复制结果用于记录或汇报。

典型使用场景

算例参考

注意事项

结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。

增强越多越好吗?
否。过度或不当增强(如旋转破坏方向语义)会引入噪声甚至错误标签,反而损害训练。应以验证集表现而非数量为准。
增强样本算独立样本吗?
不算。它们与原始高度相关,对泛化的贡献低于等量真实标注数据;扩增主要起正则化作用。
→ 打开数据增强有效量工具