基础概念

Transformer(变换器)

2017 年提出的神经网络架构,正是它让现代大语言模型成为可能。

在 Transformer 出现之前,语言模型大多按顺序逐词处理文本,这使得捕捉远距离的词语关系很困难,训练速度也慢。2017 年论文《Attention Is All You Need》提出的 Transformer 架构引入了自注意力机制(self-attention),让模型能同时衡量一段文字中每个词与其他所有词之间的相关性。

正是这种并行性让今天的规模成为可能: Transformer 可以同时在数千块 GPU 上高效训练。从 GPT 到 Claude 再到 Gemini,如今几乎所有主流 LLM 都是 Transformer 的变体。