语言思辨前沿

大语言模型:GPT 怎么工作

8 分钟

GPT、GLM、Claude... 这些大语言模型是怎么工作的?它们为什么能写文章、写代码、回答问题?

大语言模型的核心:预测下一个词。

听起来太简单了?但这就是全部原理。给定前面的词,模型预测下一个最可能的词。然后把这个词加进去,再预测下一个。如此循环,就生成了整篇文章。

为什么能这么强:当你用海量文本训练这个「预测下一个词」的任务时,模型被迫学会了:

  • 语法(什么样的句子通顺)
  • 知识(巴黎是法国的首都)
  • 推理(如果 A>B, B>C,则 A>C)
  • 代码(Python 的 for 循环怎么写)
  • 对话风格(问答、讲故事、写诗)

训练过程(简化版):

  1. 预训练:用互联网上的海量文本(维基百科、书籍、网页)训练。目标就是预测下一个词。训练完后,模型学会了语言的基本规律和大量知识

  2. 微调:用人工标注的高质量问答数据训练,让模型学会「按指令做事」

  3. 人类反馈强化学习(RLHF):让人类评价模型的回答质量,用这些反馈进一步优化模型,让它更安全、更有用

大模型的关键参数

  • 参数量:模型的「脑容量」。GPT-3 有 1750 亿参数,GPT-4 更多。但参数不是越大越好,训练数据和方法同样重要
  • 上下文窗口:模型一次能「记住」多少文字。早期模型只能看几千词,现在可以看几十万词
  • 训练数据:模型的「学识」。数据越多越杂,模型知道得越多,但也可能学到错误和偏见

大模型能做什么

  • 写作:文章、邮件、小说
  • 编程:写代码、调试、解释
  • 翻译:多语言互译
  • 推理:数学、逻辑
  • 创意:写诗、起名字、头脑风暴

大模型不能做什么

  • 不可能 100% 正确(会「幻觉」)
  • 没有真正的理解(只是模式匹配)
  • 没有实时信息(除非联网)
  • 没有情感和意识

练习:问大模型一个问题,然后追问「你为什么这么回答」。它的解释能帮你理解它是怎么「思考」的。

小纸条

大语言模型的核心原理是什么?训练过程是怎样的?

登录 后可看答案