是什么
Transformer 是 Google 在 2017 年论文《Attention Is All You Need》中提出的模型架构。今天你听过的几乎所有大模型(GPT、Claude、文心、通义等)底层都是它。
在它之前,序列建模主要靠 RNN / LSTM:像流水线一样,一个字一个字地串行处理,第 N 个字要等前面 N-1 个字处理完。
自注意力机制(Self-Attention)直觉
Transformer 的核心是自注意力:让一句话里的每个 Token 都能”直接看到”其他所有 Token,并算出一个”关联权重”。
打个比方:
- RNN 像接力跑:信息从第一个人传到最后一个人,传着传着(长句子)前面的内容就忘了。
- Transformer 像圆桌会议:所有人同时开口,每个人都能直接看向任何其他人,一眼就建立起全局关联,不存在”传丢了”。
为什么重要
- 可并行:RNN 必须串行,Transformer 可以一次性算整句话,能充分利用 GPU,这是它能”大力出奇迹”(堆参数、堆数据)的前提。
- 长程依赖:再长的句子,任意两个词之间也是”一步直达”,不会遗忘远处信息。
- 成为基石:因为它好并行、好扩展,才有了后来几百亿参数的预训练大模型。
与 Token / 上下文窗口的关系
- Transformer 处理的对象就是 Token 序列。
- 它一次能”同时看”的 Token 数量上限,就是所谓的上下文窗口(Context Window),比如 8K / 32K / 128K Token。窗口越大,能塞进的对话历史和文档越多。
- 注意力计算量随 Token 数平方增长,所以窗口不是越大越好,这也是后面 RAG(只塞相关片段)出现的动机之一。