Fundamentos
Token
Los pequeños fragmentos de texto — a menudo trozos de palabras — que un modelo de lenguaje realmente lee y genera, uno a la vez.
Los modelos no procesan letras ni palabras completas tal cual; dividen el texto en tokens — en inglés, unos 3-4 caracteres en promedio — usando un vocabulario fijo aprendido durante el entrenamiento. La “tokenización” es el proceso de convertir texto en estas unidades, y de vuelta a texto cuando el modelo responde.
Los tokens también importan comercialmente: casi toda API de IA cobra por token, y la ventana de contexto de un modelo se mide en tokens, no en palabras ni caracteres — por eso “cuántos tokens” es la primera pregunta al estimar el coste de operar una función de IA.