深度学习入门

能力边界与开放问题

14 分钟

本章最后一节,也是这门课的收口:今天的大模型还有哪些真问题没解决? 这些正是可以投身其中的科研方向。


一、幻觉:机制上的必然

模型会生成流畅、自信、但完全错误的内容。

为什么难以根除:训练目标是「生成最可能的下一个词」,从来就不是「说真话」。当模型不知道答案时,它不会沉默——它会生成一个「看起来最像答案的东西」,因为那才是训练目标下的最优解。

换句话说:幻觉不是 bug,是训练目标的直接推论。

现有缓解手段(都不能根治):

手段 局限
RAG 检索增强 依赖检索质量,检索错了照样编
让模型输出置信度 模型的自我评估本身也不可靠
多次采样投票 成本高,且系统性错误不会被投票纠正
训练时强化「不知道就说不知道」 容易矫枉过正,变得什么都不敢答

这是一个开放问题。


二、推理能力的真假之争

核心争议:模型是在推理,还是在做非常复杂的模式匹配?

支持「不是真推理」的证据

  • 换个无关的表述方式,同一道题的正确率可能大幅波动
  • 在题目里加入无关但看似相关的信息,会显著干扰结果
  • 需要多步严格推导的问题上,错误率随步数快速上升

支持「有某种推理」的证据

  • 能解决训练数据中不可能出现的组合性新问题
  • 思维链的中间步骤常常是有效且可检验的

目前没有定论。 这个问题的答案会深刻影响我们对这项技术的判断——它也是当前最值得研究的问题之一。


三、评测危机

怎么知道一个模型真的更好? 这件事比想象中难得多:

问题 说明
数据污染 测试题可能已在训练数据里,分数虚高
基准饱和 经典测试集分数逼近上限,区分不出差异
指标失真 高分不等于好用,用户体验难以量化
主观任务无标准答案 写作、对话的质量怎么打分

现在常用「模型当裁判」(用强模型给回答打分),但它自带偏见——比如偏好更长的回答、偏好和自己风格相近的回答。

「怎么科学地评价一个大模型」本身就是一个活跃的研究领域。


四、可解释性:黑箱问题

几千亿参数为什么产生了这个输出?目前基本无法回答。

机制可解释性(mechanistic interpretability)试图逆向工程模型内部的计算电路,已经取得一些进展——比如识别出负责特定功能的注意力头、找到表示特定概念的方向。

但离「完整理解一个大模型」还非常远。 这个方向对安全性至关重要:你无法保证一个你不理解的系统。


五、其他重要的开放问题

问题 说明
持续学习 学新知识会灾难性遗忘旧知识
长期记忆 上下文之外的信息无法真正「记住」
能耗与环境成本 训练和推理的碳排放
数据版权与归属 训练数据的合法性与创作者权益
偏见放大 模型会学到并放大训练数据中的社会偏见
安全与滥用 越狱攻击、深度伪造、自动化欺诈

这门课到这里结束了

回头看这条路线走过的地方:

感知机 → 多层网络 → 反向传播 → CNN / RNN
   → 注意力 → 自注意力 → Transformer
   → 预训练 → 缩放 → 对齐 → 部署

一个值得注意的事实:这条链上的核心思想——梯度下降、反向传播、注意力——没有一个是最近几年发明的。过去几年真正变化的,是规模、数据和工程

这对学习者意味着什么

不要只追最新的模型名字,要理解不变的部分。 架构会换,公式会改,但「用梯度下降优化一个可微目标」「用注意力在序列中搬运信息」「用大量数据学习压缩世界的规律」这些东西会长期有效。


接下来往哪走

方向 下一步
动手实现 《动手学深度学习》导读(本路线的下一门课)
打基础 回补线性代数、概率统计
做研究 从上面的开放问题里挑一个,读它的近期论文
做应用 RAG、微调、Agent 是当前最实用的三块

最后一句:这个领域最有价值的能力,不是记住多少术语,而是能判断一个说法是否可信、一个结果是否可复现。带着怀疑读论文,带着实验验证结论——这才是科研的起点。

练习:从本节列出的开放问题里挑一个你最感兴趣的,用一段话说明它为什么难,以及你会从哪里入手了解它。

小纸条

为什么说「幻觉是训练目标的直接推论而不是 bug」?大模型评测面临的四个问题是什么?

登录 后可看答案