Fundamentos

Parámetro

Uno de los números internos que una red neuronal ajusta durante el entrenamiento — el '70B' o '400B' que aparece en el nombre de un modelo es un recuento de estos.

Piensa en los parámetros como millones o miles de millones de diales, cada uno ajustado ligeramente durante el entrenamiento hasta que el modelo mejora en predecir el siguiente fragmento de texto. Ningún dial individual significa algo por sí solo; el comportamiento del modelo surge de todos ellos actuando juntos. El recuento de parámetros ha servido durante mucho tiempo como un indicador aproximado, aunque tosco, de cuánto puede potencialmente aprender y retener un modelo.

Pero 'más parámetros' ha dejado de ser un atajo fiable para 'mejor modelo'. Técnicas como la mezcla de expertos, la cuantización y la destilación permiten ahora que modelos más pequeños y baratos igualen o superen a otros mucho más grandes en tareas reales — exactamente el tipo de ganancia de eficiencia que alimenta los argumentos en ambos lados del debate sobre si el gasto de capital de la industria se ha adelantado a lo que la tecnología subyacente realmente requiere.

Análisis relacionado