它和随机森林的区别是什么?
计算机原理 · 小纸条
选一章打印。双面打印(按长边翻页)后沿虚线剪开,每张卡片正面题目、背面答案。
为什么间隔大更好?
同心圆怎么用它分开?
它的代价在哪?
"朴素"指的是什么?
这说明什么?
这属于哪一类学习?
它一定收敛吗?
k 取样本数会怎样?
它用了线性代数的什么?
参考答案(家长):对数据的小扰动更不敏感。
参考答案(家长):森林是并行独立训练,提升是串行逐步纠错。
参考答案(家长):预测时要和所有样本比较,数据大了很慢。
参考答案(家长):加一维"到原点的距离",就能用平面切开。
参考答案(家长):模型的价值看实际效果,不只看假设是否严格成立。
参考答案(家长):指那个通常不成立的独立性假设。
参考答案(家长):一定收敛,但可能收敛到局部最优。
参考答案(家长):无监督学习。
参考答案(家长):特征值与特征向量。
参考答案(家长):每点自成一类,损失为零但毫无意义。
这对最近邻有什么影响?
去掉非线性会怎样?
为什么简单反而好?
为什么深比宽好?
这说明理论和实践的什么关系?
它本质上是什么?
这和你学过的什么像?
动手推一遍。
动手实现。
怎么缓解?
参考答案(家长):多层叠起来还是线性的,等于白叠。
参考答案(家长):所有点的距离都差不多,"最近"失去意义。
参考答案(家长):深层能复用底层特征,参数效率高得多。
参考答案(家长):计算快、梯度不容易消失。
参考答案(家长):求导的链式法则加上动态规划式的复用。
参考答案(家长):存在性定理不告诉你怎么找到它。
参考答案(家长):推过一次,后面用框架时才知道它在做什么。
参考答案(家长):记忆化搜索,避免重复计算子问题。
参考答案(家长):换激活函数、加归一化、用残差连接。
参考答案(家长):几十行就能到 90% 以上准确率。
这个想法简单吗?
这解决了什么问题?
这属于什么手段?
为什么参数少?
这体现了什么思想?
为什么要容忍位置变化?
为什么顺序重要?
它的问题是什么?
它怎么算"关注多少"?
这带来什么限制?
参考答案(家长):层与层之间输入分布不断漂移导致的训练困难。
参考答案(家长):极简单,但它让网络从几十层做到了上百层。
参考答案(家长):同一个窗口在全图共享,不用每个位置一套参数。
参考答案(家长):正则化,防止过拟合。
参考答案(家长):猫在图片左边还是右边,都还是猫。
参考答案(家长):分层抽象,你在软件工程里也见过。
参考答案(家长):太长的依赖记不住,且没法并行训练。
参考答案(家长):"狗咬人"和"人咬狗"字一样意思完全不同。
参考答案(家长):序列太长时计算和显存都吃不消。
参考答案(家长):算相似度再归一化成权重,本质是点积加权。