为什么深度学习火了之后这句话变了?
计算机原理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
为什么不能用训练数据评估?
三份数据各干什么?
房价随面积变化,能用它吗?
回归常用什么损失?
用绝对值可以吗?
为什么要"小步"?
发现损失来回跳动说明什么?
梯度为零意味着什么?
小批量的好处是什么?
参考答案(家长):模型可能只是背下来了,测不出泛化能力。
参考答案(家长):神经网络能自己学出特征,省掉了大量人工设计。
参考答案(家长):能,作为起点很合适。
参考答案(家长):训练学参数、验证调超参、测试只用一次报成绩。
参考答案(家长):可以,对异常值更稳健,但在零点不可导要特殊处理。
参考答案(家长):均方误差,差的平方的平均。
参考答案(家长):学习率太大了,该调小。
参考答案(家长):步子太大会跨过最低点甚至越走越高。
参考答案(家长):兼顾速度和稳定,还能利用硬件并行。
参考答案(家长):到了平坦处,可能是最低点也可能是鞍点。
动手实现并画出损失曲线。
面积(百)和房间数(个)不缩放会怎样?
为什么不直接用线性回归做分类?
它和信息论有关系吗?
什么数据线性模型分不开?
怎么发现过拟合?
怎么区分欠拟合和过拟合?
这为什么能减轻过拟合?
没有更多数据怎么办?
过拟合是哪个高?
参考答案(家长):收敛很慢,要走很多步才能到最优。
参考答案(家长):损失应该单调下降并逐渐平缓。
参考答案(家长):有,交叉熵正是衡量两个分布差异的信息量。
参考答案(家长):输出会跑到 0 到 1 之外,没法解释成概率。
参考答案(家长):训练损失一直降但验证损失开始上升。
参考答案(家长):如同心圆分布,需要非线性边界。
参考答案(家长):限制了模型的复杂度,让它更平滑。
参考答案(家长):看训练损失 —— 训练就差是欠拟合,训练好验证差是过拟合。
参考答案(家长):方差高。
参考答案(家长):数据增强 —— 对已有数据做旋转、裁剪、加噪等变换。
它的代价是什么?
这种情况该看什么指标?
癌症筛查更该重视哪个?
把阈值调高,两个指标怎么变?
画出它并标出四个格子的含义。
怎么决定先问哪个问题?
这又用到了信息论的什么?
剪枝怎么做?
为什么比单棵树好?
全部一样的模型集成有用吗?
参考答案(家长):查准率和查全率。
参考答案(家长):要训练 k 次,计算量大 k 倍。
参考答案(家长):查准升、查全降。
参考答案(家长):查全,漏掉病人的代价远大于误报。
参考答案(家长):选能把数据分得最"纯"的那个特征。
参考答案(家长):行是真实类别,列是预测类别。
参考答案(家长):把对验证集没帮助的分支砍掉,换成叶子。
参考答案(家长):熵,衡量不确定性的减少。
参考答案(家长):没用,错的地方也完全一样。
参考答案(家长):各棵树的错误不相关,投票能抵消掉。