基础概念
LLM(大语言模型)
通过海量文本训练、用来预测和生成类人语言的 AI 系统。
GPT、Claude、Gemini 这类模型的构建方式,是用神经网络(通常是 Transformer 结构)在数万亿词的文本、代码等数据上进行训练。模型并不是从某处"查找"答案,而是学习语言运作的统计规律,从而一次生成一个 token,拼出连贯、往往也有用的文本。
规模很重要:用更多数据、更多算力训练出的更大模型往往表现更好,这也是顶尖实验室愿意为训练所需的 GPU 和数据中心投入数十亿美元的原因之一——而这笔支出,正是"AI 估值是否已经跑在营收前面"这场争论的核心。