大语言模型:GPT 怎么工作
约 8 分钟
GPT、GLM、Claude... 这些大语言模型是怎么工作的?它们为什么能写文章、写代码、回答问题?
大语言模型的核心:预测下一个词。
听起来太简单了?但这就是全部原理。给定前面的词,模型预测下一个最可能的词。然后把这个词加进去,再预测下一个。如此循环,就生成了整篇文章。
为什么能这么强:当你用海量文本训练这个「预测下一个词」的任务时,模型被迫学会了:
- 语法(什么样的句子通顺)
- 知识(巴黎是法国的首都)
- 推理(如果 A>B, B>C,则 A>C)
- 代码(Python 的 for 循环怎么写)
- 对话风格(问答、讲故事、写诗)
训练过程(简化版):
预训练:用互联网上的海量文本(维基百科、书籍、网页)训练。目标就是预测下一个词。训练完后,模型学会了语言的基本规律和大量知识
微调:用人工标注的高质量问答数据训练,让模型学会「按指令做事」
人类反馈强化学习(RLHF):让人类评价模型的回答质量,用这些反馈进一步优化模型,让它更安全、更有用
大模型的关键参数:
- 参数量:模型的「脑容量」。GPT-3 有 1750 亿参数,GPT-4 更多。但参数不是越大越好,训练数据和方法同样重要
- 上下文窗口:模型一次能「记住」多少文字。早期模型只能看几千词,现在可以看几十万词
- 训练数据:模型的「学识」。数据越多越杂,模型知道得越多,但也可能学到错误和偏见
大模型能做什么:
- 写作:文章、邮件、小说
- 编程:写代码、调试、解释
- 翻译:多语言互译
- 推理:数学、逻辑
- 创意:写诗、起名字、头脑风暴
大模型不能做什么:
- 不可能 100% 正确(会「幻觉」)
- 没有真正的理解(只是模式匹配)
- 没有实时信息(除非联网)
- 没有情感和意识
练习:问大模型一个问题,然后追问「你为什么这么回答」。它的解释能帮你理解它是怎么「思考」的。
小纸条
大语言模型的核心原理是什么?训练过程是怎样的?
登录 后可看答案