基础概念
上下文窗口(Context Window)
模型一次能"看到"的最大文本量(包括你的提示词和它自己的回复),以 token 数衡量。
上下文窗口的作用类似短期记忆:超出这个范围的内容,在对话被裁剪或总结之前,模型根本无法引用。窗口大小已经从 2020 年前后模型的几千 token,增长到 2026 年部分顶尖模型的百万 token 以上,使得一次性通读整个代码库或一小时长的文档、并据此推理成为可能。
上下文窗口越大,每次请求的运行成本也越高,因为在最初的 Transformer 设计中,注意力计算量会随序列长度急剧增加——这也是为什么提示词越长,服务商往往按 token 收取更高单价的原因之一。