Q1 为什么分类用交叉熵不用均方误差?
MSE 对 softmax 输出梯度会出现"错得越离谱学得越慢"的问题;交叉熵梯度 = 预测 − 标签,错误越大更新越猛 ✅
Q2 softmax 和 sigmoid 什么关系?
sigmoid 是二分类特例(2类softmax),softmax 是 sigmoid 在多类上的自然推广
Q3 为什么不能用准确率当损失函数?
准确率是阶跃函数、不可导、梯度几乎处处为 0,无法指导优化;它只能做评估指标 📏
Q4 学习率/批量大小怎么调?
先调学习率(影响最大),批量受显存限制;两个都调等于调不准,一次动一个
Q5 类别不平衡怎么办?
准确率会骗人(99%负样本全猜负也有99%);可按类别加权损失或看精确率/召回率/F1