李沐深度学习 · 第36-38集 三合集知识卡
第36-38集:模型选择与过拟合
调参方法论三连 🎯
36 · 03:20
引导:10行代码
37 · 18:37
模型选择
38 · 16:47
过拟合/欠拟合
38 / 191
进度 19.9%
⚡ 第36集:10行代码战胜90%数据科学家?
模板化思想
🧰 模板思维
训练/评估流程写成模板,换任务只改模型定义——高效实战的秘密
📊 现实残酷
调参实验占数据科学工作大头,剩余时间才用来提点数
🔍 第37集:模型选择
验证集是生命线
训练误差 ≠ 泛化误差 (只优化前者 → 过拟合陷阱)
数据集
用途
铁律
训练集
学参数
随便用
验证集
选模型/调超参
间接影响训练,选完即弃
测试集
最终成绩
绝不能碰!只许碰一次
🔁 K 折交叉验证
数据少时:切 K 份轮流当验证集取平均(K 常取 5 或 10)
💰 成本权衡
K 折 = 训练 K 次,准但贵;深度学习数据多时可直接留验证集
⚖️ 第38集:过拟合与欠拟合
容量与数据的博弈
状态
训练误差
泛化误差
处方 💊
欠拟合
高
高
加容量 / 训久一点 / 换模型
过拟合
低
高
更多数据 / 正则化 / 减容量
刚刚好 ⭐
低
低
容量≈数据复杂度
📦 模型容量
由参数个数+参数取值范围决定;容量低→欠拟合,容量高→过拟合
📉 数据复杂度
样本数、特征维度、类别数;数据越复杂需要容量越大的模型
Generated with
Tabbit.