李沐《动手学深度学习》第 129–131 集摘要
🍃 树叶分类竞赛复盘 → 🎯 目标检测 → ❓ 目标检测 QA
第129集 · 26:29

🍃 树叶分类竞赛技术总结

小数据分类制胜公式 = 预训练微调 + 数据增广 + 模型集成
  • ImageNet 预训练 ResNet,只替换分类头
  • 翻转 / 裁剪 / 变色增广,对抗过拟合
  • 更大模型、更高分辨率稳定涨点
  • TTA + 多模型集成榨干精度
第130集 · 42:05

🎯 目标检测

锚框铺候选,IoU 量重合,NMS 去重复
  • 检测 = 多目标的类别 + 边界框
  • 锚框:多尺度 × 多高宽比候选框
  • R-CNN 家族:两阶段,精度派
  • SSD / YOLO:单阶段,速度派
第131集 · 16:24

❓ 目标检测 QA

锚框设计、样本失衡、速度精度的取舍
  • 锚框越多越准,但计算量激增
  • 正负样本不均衡是训练常态
  • 多尺度特征图拯救小目标
  • 精度选两阶段,实时选单阶段
🧭 视觉任务进阶地图
目标检测承上启下:既要「认得出」,也要「框得准」
🐱 图像分类 一张图一个类别 🐱 分类 + 定位 单目标边界框 🐱 猫 0.97 🐶 狗 0.91 目标检测 多目标 类别+位置 🐱 🐶 实例分割 掩码精确到像素
🚀 目标检测两大门派
两阶段先提「候选区域」再分类;单阶段省掉提议、一步到位
2014R-CNN

选择性搜索提候选区域,逐块过 CNN + SVM,准但极慢

2015Fast R-CNN

整图共享特征 + RoI 池化,速度大幅提升

2015Faster R-CNN

RPN 网络学习候选框,真正端到端

2017Mask R-CNN

增加掩码分支,扩展到实例分割

⚡ 另一门派 · 单阶段检测器:SSD 在多尺度特征图上直接预测锚框的类别与偏移,YOLO 把检测整体化为一次回归。省掉区域提议,速度快、适合实时场景;两阶段则精度更高。
🧩 核心三件套
锚框铺候选 · IoU 量重合 · NMS 去重复

锚框 Anchor

以每个像素为中心,按「多尺度 × 多高宽比」撒下一簇候选框;训练时给锚框分配真实框,预测其类别与位置偏移。

IoU 交并比

IoU = 交集面积 ÷ 并集面积,取值 0~1,越大重合度越高;用于划分正负样本、评估预测框质量。

按置信度排序 保留最高分 抑制 IoU 超标框 重复至清空

NMS 非极大值抑制

按置信度排序后反复「留最高、删高重叠」,让每个目标最终只剩一个预测框。

Tabbit 制作 · 李沐《动手学深度学习》课程摘要
Generated with Tabbit.