聚类 K-Means 代价 使用指南
K-Means 代价估算器,输入样本与簇中心估算聚类惯性 inertia(簇内平方和),用于评估聚类紧致度与 k 选择。
计算公式与原理
Inertia 估算 ≈ n·dim·spread²/k;每簇样本 ≈ ⌈n/k⌉
在样本近似均匀分布的假设下,簇内平方和随 K 增大按 1/k 衰减,可用于快速预判需要多少簇。实际数据有簇密度差异时,应结合业务含义定 K,而不是只看指标拐点。
使用步骤
- 填写「样本数」。
- 填写「聚类数」。
- 填写「维度」。
- 填写「簇内散布」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 惯性 inertia=Σ‖x−μ_k‖²(簇内平方和 WCSS),越小聚类越紧致。
- inertia 随 k 增大单调下降,需用拐点(手肘)或轮廓系数选 k。
- K-Means 对初始中心与异常值敏感,常多次初始化取最优。
算例参考
- 代价比较:k=2 时 inertia=500, k=3 时=300, k=4 时=220。inertia 持续下降,k=3→4 降幅(80)明显小于 2→3(200),结合业务选 k=3 或 4。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- inertia 越小越好吗?
- 不是。k 越大 inertia 越小,k=样本数时为 0 但失去聚类意义;应兼顾紧致性与簇数简洁,用手肘/轮廓系数平衡。
- 异常值怎么处理?
- 异常值会大幅拉高 inertia 并偏移质心,可先做离群检测或用 K-Medoids(基于距离中位数)更稳健。