特徵縮放 Min-Max 使用指南
Min-Max 特徵縮放器,將特徵值線性縮放到 [0,1] 或 [−1,1] 區間,用於機器學習歸一化預處理,注意 max≠min。
計算公式與原理
x′ = (x − min)/(max − min);[-1,1] 對映 x″ = 2x′ − 1;Z-score 近似 (x − x̄)/((max − min)/2)
Min-Max 把特徵線性壓到固定區間,保留原始分佈形狀但不改變相對關係;缺點是受離群點支配(一個極大值會把其餘樣本擠到窄區間)。樹模型不需要縮放,而梯度下降類與距離類模型通常必須做。
使用步驟
- 填寫「原始值」。
- 填寫「最小值」。
- 填寫「最大值」。
- 填寫「目標範圍 1=[0,1] 2=[-1,1]」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- [0,1] 縮放 x'=(x−min)/(max−min);[−1,1] 縮放 x'=2(x−min)/(max−min)−1。
- 要求 max≠min,否則分母為零;異常值會壓縮正常樣本區間。
- 縮放到固定區間利於梯度下降與距離類演算法(如 KNN、K-Means)收斂。
算例參考
- 歸一化計算:特徵取值 10~40,x=25 → [0,1]:(25−10)/30=0.5;[−1,1]:2×0.5−1=0.0,恰為區間中點。若含異常值 1000 則正常樣本全擠在 0 附近。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- Min-Max 和 StandardScaler 怎麼選?
- Min-Max 固定邊界、對異常值敏感,適合已知範圍(如影像 0~255);StandardScaler(均值0方差1)對異常更穩健,適合多數建模。
- 測試集怎麼縮放?
- 必須用訓練集的 min/max 縮放測試集,不能用測試集自身統計量,否則引入資料洩露、誇大泛化效果。