数据增强倍数 使用指南
按增强变换数量与重复系数,计算数据增强后的样本总量倍数,辅助训练集扩容规划,适用于图像分类、样本均衡与增强强度设定。
计算公式与原理
增强后总量 = 原始样本数 × (1 + 系数 × 变换种类数)
按每种变换贡献的增量线性外推总量,系数反映单次变换的等效增益(通常 <1)。这是上界估计:变换间高度相关时实际有效量远小于此,且增强样本不能完全替代真实数据的分布覆盖。
使用步骤
- 填写「原始样本数」。
- 填写「变换种类」。
- 填写「每种倍数」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 增强后样本总量≈原始量×变换组合数×重复系数,用于训练集扩容规划。
- 倍数高不等于信息量等比例增长,重复/相似变换带来相关性。
- 应结合验证集表现设定增强强度,避免过度失真。
算例参考
- 增强倍数估算:原始 5000 张,旋转/翻转/色彩 3 类各 3 档共 9 组合 → 总量≈5000×9=45000 张。若叠加 2 次重复则≈90000,但有效增益低于 18 倍。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 倍数和'有效量'有什么区别?
- 倍数只算变换乘积,有效量还扣减相关性带来的信息折损;本工具给倍数,是否等效需结合增强多样性判断。
- 增强强度设多大?
- 以验证集指标为准:增强不足仍过拟合则加强,过强导致训练误差难降则回撤;图像常用轻几何+色彩抖动。