预训练与大模型时代
约 10 分钟
先读万卷书,再学一门手艺
第一章讲了注意力催生了 Transformer,这一讲讲它如何长成今天的大模型。核心思路就八个字:预训练 + 微调。先用互联网规模的文本让模型「读书」——任务是猜下一个词,读到「今天天气真」就猜「好」,猜错就反向传播调权重。这个过程不挑数据、不要人工标注,几十亿本书喂下去,模型把语法、常识、甚至推理模式都压缩进了权重。然后再用少量人工整理的高质量问答微调,教它「像助手一样说话」。
规模带来的惊喜
2018 年的 BERT 有 3.4 亿参数,2020 年的 GPT-3 涨到 1750 亿。人们发现:参数和数据过了一个门槛,模型会突然「解锁」新能力——没专门学过数学的模型会做算术,没见过翻译任务的模型能翻译。这种「量变到质变」叫涌现,是大模型时代最重要的现象,至今也没被完全解释清楚。
回到起点:都是老朋友
有意思的是,大模型里没有新魔法:分词用到第一章的词嵌入,主干是注意力和 Transformer 堆叠,训练靠反向传播和 Adam,层与层之间是残差连接——全是这门课讲过的概念,只是规模放大了一万倍。这正是先学原理的意义:外面再热闹,你看到的都是「老朋友」。
常见误区
大模型不是「什么都知道的数据库」,它是概率式地生成最可能的下文,所以会一本正经地编造事实(幻觉);重要内容一定要核实来源。
练一练:任选一个 AI 助手,问它一个你知道答案的冷门问题,检验它答对还是「一本正经地编」。
小纸条
用一个你确知答案的冷门问题测试 AI 助手,记录它答对还是编造,并说明什么是幻觉。
登录 后可看答案