モデルのライフサイクル

量子化(Quantization)

モデル内部の数値の精度を下げて、より速く動作し、はるかに少ないメモリで済むようにする手法 — データセンターが必要か、スマートフォンで動くかを分けることも多い。

高精度(32ビット)の数値で学習されたモデルは、学習後により低精度(16ビット、8ビット、時には4ビット)へ変換できます。数値一つあたりのメモリと計算時間が減るため、同じモデルがより速く動作し、より安価なハードウェアにも収まります — 精度の低下は通常わずかで、ほとんど気づかない程度です。

量子化は、まともな性能のAIモデルがサーバーとの往復なしにスマートフォンやノートPCだけで完全に動作できるようになった主な理由です。蒸留や専門家混合(MoE)と並び、こうした効率化技術は小さなローカルモデルと巨大なクラウドモデルの間で実際にできることの差を縮めてきました。これはHBM需要を支えるメモリ供給の逼迫にも直接関わってきます。

関連分析