温度缩放 Softmax 使用指南
温度缩放 Softmax 观察器,输入 logits 与温度参数观察分布尖锐程度变化,理解温度对概率平滑度的影响。
计算公式与原理
Pᵢ(T) = e^{zᵢ/T} / Σⱼ e^{zⱼ/T};分布熵 H = −Σ Pᵢ ln Pᵢ
温度 T 控制分布锐度:T→0 趋近 one-hot(更确定),T→∞ 趋近均匀分布。训练时用高温做知识蒸馏可暴露类别间关系;但温度缩放只改变锐度不改变排序,不能修复模型本身的排序错误。
使用步骤
- 填写「Logit 1」。
- 填写「Logit 2」。
- 填写「Logit 3」。
- 填写「温度 T」。
- 结果区会即时更新;可一键复制结果用于记录或汇报。
典型使用场景
- 温度缩放 y_i=exp(z_i/T)/Σexp(z_j/T),T>1 使分布更平滑(更不确定),T<1 更尖锐。
- T→∞ 趋近均匀分布,T→0 趋近 one-hot(argmax)。
- 温度常用于调节生成多样性与模型校准,不改变 argmax 类别。
算例参考
- 温度影响分布:logits=[2,1,0.5],T=1 → 概率≈[0.56,0.21,0.23];T=2 → [0.46,0.30,0.24] 更平滑;T=0.5 → [0.76,0.17,0.07] 更尖锐。argmax 始终为第 1 类。
注意事项
结果为按上述公式得到的理论估算值,实际表现受数据分布、实现细节与运行环境影响,落地决策请以实测为准;本工具纯前端运行,输入不上传服务器。
- 温度能校准模型吗?
- 温度缩放是最简单的后校准方法,调 T 使输出置信度匹配实际准确率;但它只缩放分布、不能修正错误预测的方向。
- 生成时温度设多高?
- 创意写作用较高 T(0.7~1.0)增多样性,事实问答用低 T(0~0.3)增确定性;过高会胡言乱语,过低则重复僵化。