模型生命周期 相关分析 →
量化(Quantization)
把模型内部数值的精度降低,使其运行更快、占用的内存也大幅减少——这往往决定了一个模型是必须跑在数据中心,还是能装进一部手机。
一个用高精度数值(32位)训练出来的模型,在训练完成后可以被转换成使用更低精度的数值(16位、8位甚至4位)。每个数字占用的内存和计算时间都变少了,于是同一个模型运行得更快,也能塞进更便宜的硬件里——代价通常很小,精度损失往往几乎察觉不到。
量化是如今一个能力尚可的 AI 模型能够完全脱离服务器往返、直接在手机或笔记本电脑上运行的主要原因。它和蒸馏、混合专家(MoE)一样,都是缩小"小型本地模型"与"庞大云端模型"实际能力差距的效率手段之一,而这也直接关系到支撑 HBM 需求的那场内存供应紧张。