能力边界与开放问题
约 14 分钟
本章最后一节,也是这门课的收口:今天的大模型还有哪些真问题没解决? 这些正是可以投身其中的科研方向。
一、幻觉:机制上的必然
模型会生成流畅、自信、但完全错误的内容。
为什么难以根除:训练目标是「生成最可能的下一个词」,从来就不是「说真话」。当模型不知道答案时,它不会沉默——它会生成一个「看起来最像答案的东西」,因为那才是训练目标下的最优解。
换句话说:幻觉不是 bug,是训练目标的直接推论。
现有缓解手段(都不能根治):
| 手段 | 局限 |
|---|---|
| RAG 检索增强 | 依赖检索质量,检索错了照样编 |
| 让模型输出置信度 | 模型的自我评估本身也不可靠 |
| 多次采样投票 | 成本高,且系统性错误不会被投票纠正 |
| 训练时强化「不知道就说不知道」 | 容易矫枉过正,变得什么都不敢答 |
这是一个开放问题。
二、推理能力的真假之争
核心争议:模型是在推理,还是在做非常复杂的模式匹配?
支持「不是真推理」的证据:
- 换个无关的表述方式,同一道题的正确率可能大幅波动
- 在题目里加入无关但看似相关的信息,会显著干扰结果
- 需要多步严格推导的问题上,错误率随步数快速上升
支持「有某种推理」的证据:
- 能解决训练数据中不可能出现的组合性新问题
- 思维链的中间步骤常常是有效且可检验的
目前没有定论。 这个问题的答案会深刻影响我们对这项技术的判断——它也是当前最值得研究的问题之一。
三、评测危机
怎么知道一个模型真的更好? 这件事比想象中难得多:
| 问题 | 说明 |
|---|---|
| 数据污染 | 测试题可能已在训练数据里,分数虚高 |
| 基准饱和 | 经典测试集分数逼近上限,区分不出差异 |
| 指标失真 | 高分不等于好用,用户体验难以量化 |
| 主观任务无标准答案 | 写作、对话的质量怎么打分 |
现在常用「模型当裁判」(用强模型给回答打分),但它自带偏见——比如偏好更长的回答、偏好和自己风格相近的回答。
「怎么科学地评价一个大模型」本身就是一个活跃的研究领域。
四、可解释性:黑箱问题
几千亿参数为什么产生了这个输出?目前基本无法回答。
机制可解释性(mechanistic interpretability)试图逆向工程模型内部的计算电路,已经取得一些进展——比如识别出负责特定功能的注意力头、找到表示特定概念的方向。
但离「完整理解一个大模型」还非常远。 这个方向对安全性至关重要:你无法保证一个你不理解的系统。
五、其他重要的开放问题
| 问题 | 说明 |
|---|---|
| 持续学习 | 学新知识会灾难性遗忘旧知识 |
| 长期记忆 | 上下文之外的信息无法真正「记住」 |
| 能耗与环境成本 | 训练和推理的碳排放 |
| 数据版权与归属 | 训练数据的合法性与创作者权益 |
| 偏见放大 | 模型会学到并放大训练数据中的社会偏见 |
| 安全与滥用 | 越狱攻击、深度伪造、自动化欺诈 |
这门课到这里结束了
回头看这条路线走过的地方:
感知机 → 多层网络 → 反向传播 → CNN / RNN
→ 注意力 → 自注意力 → Transformer
→ 预训练 → 缩放 → 对齐 → 部署
一个值得注意的事实:这条链上的核心思想——梯度下降、反向传播、注意力——没有一个是最近几年发明的。过去几年真正变化的,是规模、数据和工程。
这对学习者意味着什么:
不要只追最新的模型名字,要理解不变的部分。 架构会换,公式会改,但「用梯度下降优化一个可微目标」「用注意力在序列中搬运信息」「用大量数据学习压缩世界的规律」这些东西会长期有效。
接下来往哪走
| 方向 | 下一步 |
|---|---|
| 动手实现 | 《动手学深度学习》导读(本路线的下一门课) |
| 打基础 | 回补线性代数、概率统计 |
| 做研究 | 从上面的开放问题里挑一个,读它的近期论文 |
| 做应用 | RAG、微调、Agent 是当前最实用的三块 |
最后一句:这个领域最有价值的能力,不是记住多少术语,而是能判断一个说法是否可信、一个结果是否可复现。带着怀疑读论文,带着实验验证结论——这才是科研的起点。
练习:从本节列出的开放问题里挑一个你最感兴趣的,用一段话说明它为什么难,以及你会从哪里入手了解它。
为什么说「幻觉是训练目标的直接推论而不是 bug」?大模型评测面临的四个问题是什么?
登录 后可看答案