大模型是怎么工作的?看懂 Transformer 与「预测下一个词」
ChatGPT 背后到底在做什么?用最直白的方式讲清大模型的核心:它其实只是在「预测下一个词」,以及 Transformer、注意力机制、训练两阶段。
ChatGPT 能聊天、写代码、答问题,看起来很「智能」。但它内部到底在做什么?剥开外壳,核心其实简单得出人意料。这篇用最直白的方式讲清大模型是怎么工作的。
核心只有一件事:预测下一个词
大模型的本质,就是「根据前面的内容,预测下一个最可能出现的词」,然后一个词一个词地往外接。
你输入「今天天气真」,它算出下一个最可能是「好」;接上「好」之后,再预测下一个……如此循环,一个字一个字地「续写」出整段回答。
就这么简单?是的。它不是在「查答案」,而是在不停地做接龙——只不过它见过的文本太多、太会接,接出来的东西就像懂了一样。
为什么「接龙」能变成「会聊天」
一个只会预测下一个词的东西,怎么会写代码、会推理?答案是两个字:规模。
- 海量数据:它读过几乎整个互联网的文本,语言规律、事实、代码模式都藏在里面
- 巨大参数:模型有成百上千亿个参数来记住这些模式
- 涌现能力:当规模大到一定程度,一些没被专门训练的能力(推理、翻译、写代码)会「自己冒出来」
所以「预测下一个词」只是机制,真正的魔力来自在超大规模下,这个简单机制学到了极其丰富的模式。
Transformer:让这一切成立的架构
现代大模型几乎都基于 Transformer(2017 年提出的架构)。它解决了一个关键问题:如何让模型在读一句话时,理解词与词之间的关系。
在 Transformer 之前,模型是一个词一个词按顺序读的,容易「读到后面忘了前面」。Transformer 换了个思路,靠的是——
注意力机制:读一个词,同时「看」相关的词
注意力(Attention) 是 Transformer 的灵魂。一句话概括:
模型在处理每个词时,会同时「关注」句子里与它相关的其他词,据此理解含义。
比如「小明把书给了小红,因为他读完了」——模型靠注意力判断「他」指的是小明。正是这种「全局关注」,让它能理解长句、上下文和指代关系。
(模型一次能「同时关注」多少内容是有上限的,这就是上下文窗口。)
它是怎么「学」出来的:两个阶段
- 预训练:喂进海量文本,让它反复做「预测下一个词」的练习,把语言规律和知识压进参数里
- 对齐 / 微调:再用人类示范和反馈训练它「听懂指令、回答有用、不说有害内容」——让一个「会接龙的模型」变成一个「好用的助手」
把概念串起来
理解了「预测下一个词」,很多现象就通了:
- 文字先被切成 Token 再处理,模型算的是「下一个 Token」
- 它追求「像」而非「对」,所以会产生 幻觉——编得通顺却不真实
- 词与词的语义关系,靠 Embedding 向量来表示
- 想让它接得更符合你的意图,就要靠提示词把「前文」给好
小结
大模型没有魔法,它的核心就是在超大规模下,反复预测下一个词;Transformer 和注意力机制让它能真正理解上下文,两阶段训练让它从「会接龙」变成「好助手」。看懂了这一层,你再用 AI 时就会更有分寸——知道它强在哪、也知道它为什么会出错。