Fundamentos

Ventana de contexto

La cantidad máxima de texto — medida en tokens — que un modelo puede “ver” a la vez, incluyendo tu prompt y su propia respuesta.

Una ventana de contexto funciona como memoria a corto plazo: todo lo que quede fuera de ella, el modelo simplemente no puede referenciarlo, hasta que la conversación se recorta o se resume. Las ventanas han crecido de unos pocos miles de tokens en modelos de 2020 a más de un millón de tokens en algunos modelos punteros de 2026, lo que permite razonar sobre una base de código entera o un documento de una hora en una sola pasada.

Las ventanas de contexto más grandes cuestan más por petición, ya que el cálculo de atención escala de forma pronunciada con la longitud de la secuencia en el diseño original del Transformer — una razón por la que los proveedores cobran más por token cuando el prompt es más largo.