Ciclo de vida del modelo
Entrenamiento (Preentrenamiento)
El proceso de enseñar a un modelo su conocimiento base y capacidad de lenguaje haciéndole predecir texto sobre un enorme conjunto de datos.
Durante el preentrenamiento, un modelo predice repetidamente el siguiente token en texto extraído de libros, sitios web, código y más, ajustando miles de millones de parámetros internos (pesos) cada vez que se equivoca. Es la fase más intensiva en cómputo de construir un LLM, ejecutada en miles de GPU o TPU durante semanas o meses.
El preentrenamiento da al modelo capacidad general, pero todavía no lo hace bueno siguiendo instrucciones ni seguro para conversar — eso llega después, con el ajuste fino (fine-tuning).