模型生命周期

训练/预训练(Training / Pretraining)

让模型在海量数据集上不断预测下一段文本,从而学到基础知识和语言能力的过程。

在预训练阶段,模型会反复预测从书籍、网站、代码等来源抽取的文本中的下一个 token,每次预测错误都会调整内部数十亿个参数(权重)。这是构建 LLM 中计算量最密集的阶段,需要在数千块 GPU 或 TPU 上运行数周到数月。

预训练赋予模型通用能力,但还不能让它擅长听从指令或保证对话安全——那要靠之后的微调(fine-tuning)来实现。