李沐深度学习 · 第25-26集 双集知识卡
第25-26集:损失函数 + 图片分类数据集
分类四件套 · 中
25 · 06:25
交叉熵(理论)
26 · 09:26
Fashion-MNIST(实操)
26 / 191
课程进度 13.6%
下一站
27集 从零实现 18:44
📉 第25集:交叉熵损失
为什么分类不用均方误差
l(y, ŷ) = −Σ yᵢ·log ŷᵢ = −log ŷ_y (one-hot 下只剩真实类)
🎯 推导来源
最大似然估计:最大化"预测给真实类的概率",取负对数变最小化
✨ 梯度极简
∂l/∂oᵢ = softmax(o)ᵢ − yᵢ,预测概率减标签,反向传播一行搞定
⚠️ 数值稳定
exp 易溢出,实现时 log+softmax 合并计算(log_softmax)
🖼️ 第26集:Fashion-MNIST 数据集
CV 界的 "Hello World"
属性
规格
说明
类别数
10 类服饰
T恤/裤子/裙子/鞋/包…
图片规格
28×28 灰度图
每张 784 像素 = 输入维度
数据量
训练 60000 / 测试 10000
小数据,CPU 也能跑 ✅
为何不用 MNIST
手写数字太简单
98%+ 准确率,分不出模型好坏
🔗 数据加载流水线(torchvision)
datasets.FashionMNIST
→
ToTensor 归一化
→
DataLoader
→
batch 迭代训练
Generated with
Tabbit.