Cuantización (Quantization)
Reducir la precisión de los números internos de un modelo para que se ejecute más rápido y ocupe mucha menos memoria — a menudo la diferencia entre necesitar un centro de datos o funcionar en un teléfono.
Un modelo entrenado con números de alta precisión (32 bits) puede convertirse, después del entrenamiento, para usar números de menor precisión (16, 8 o incluso 4 bits). Cada número ocupa menos memoria y requiere menos tiempo de cómputo, así que el mismo modelo se ejecuta más rápido y cabe en hardware más barato — normalmente a un costo pequeño, a menudo casi imperceptible, en precisión.
La cuantización es la razón principal por la que un modelo de IA capaz puede ahora ejecutarse enteramente en un teléfono o portátil sin ninguna conexión a un servidor, y es una de varias técnicas de eficiencia —junto con la destilación y la mezcla de expertos— que han reducido la brecha entre lo que un modelo local pequeño y un modelo gigante en la nube pueden hacer realmente, algo que incide directamente en la escasez de memoria sobre la que se sostiene la demanda de HBM.