Transformer
La arquitectura de red neuronal, presentada en 2017, que hizo posibles los modelos de lenguaje actuales.
Antes de los Transformers, los modelos de lenguaje procesaban el texto casi siempre en orden, palabra por palabra, lo que dificultaba capturar relaciones a larga distancia y hacía el entrenamiento lento. La arquitectura Transformer — del artículo de 2017 “Attention Is All You Need” — introdujo la autoatención (self-attention), permitiendo al modelo sopesar la relevancia de cada palabra de un pasaje frente a todas las demás a la vez.
Ese paralelismo es lo que hizo posible la escala actual: los Transformers pueden entrenarse de forma eficiente en miles de GPU simultáneamente. Casi todos los grandes LLM en producción, de GPT a Claude y Gemini, son variantes de Transformer.