ROC AUC 近似 使用指南
輸入正負樣本預測得分,估算 ROC 曲線下面積 AUC,評估分類器排序能力,適用於模型選型、閾值無關效能對比與報告。
計算公式與原理
AUC ≈ 0.5 + 0.5·erf[(μ₊ − μ₋)/√(2(σ₊² + σ₋²))];分離度 d' = (μ₊ − μ₋)/√[(σ₊² + σ₋²)/2]
在正負樣本得分各自近似正態的假設下,AUC 可由兩分佈的均值差與方差直接算出,無需逐對比較,適合只有彙總統計量的快速估算。若真實分佈長尾或嚴重偏態,該近似會偏離實測 AUC,此時應改用秩次法。
使用步驟
- 填寫「正例平均得分」。
- 填寫「負例平均得分」。
- 填寫「正例標準差」。
- 填寫「負例標準差」。
- 結果區會即時更新;可一鍵複製結果用於記錄或彙報。
典型使用場景
- AUC 為 ROC 曲線下面積,等價於隨機正樣本得分高於隨機負樣本的機率。
- AUC=0.5 為隨機分類,1 為完美;對類別不平衡與閾值選擇不敏感。
- 近似可用梯形法逐點算 ROC 下面積,或 Mann-Whitney 由秩和估算。
算例參考
- AUC 解讀:某模型 AUC=0.85:隨機抽取一正一負樣本,正樣本得分更高機率 85%。相比準確率需固定閾值,AUC 給出整體排序質量。
注意事項
結果為按上述公式得到的理論估算值,實際表現受資料分佈、實現細節與執行環境影響,落地決策請以實測為準;本工具純前端執行,輸入不上傳伺服器。
- AUC 高但線上效果差?
- AUC 只反映排序能力,不保證某業務閾值下的準確率/召回;且訓練/驗證分佈若與線上偏移,AUC 高也可能落地差。
- 樣本極不平衡 AUC 還準嗎?
- AUC 本身對不平衡穩健(基於排序),但正類極少時估計方差大、且業務更關心正類召回,應輔以 PR-AUC。