Tokenización
El proceso por el que un modelo de IA descompone el texto en unidades más pequeñas (tokens) antes de procesarlo.
Los modelos de lenguaje no leen palabras completas, sino tokens: fragmentos de texto que pueden ser una palabra, parte de una palabra o incluso un solo carácter. "Marketing" puede ser un único token, mientras que una palabra poco común puede dividirse en varios.
Entender la tokenización importa en la práctica porque el coste de uso de muchas APIs de IA (y el límite de la ventana de contexto) se mide en tokens, no en palabras ni caracteres.
Ejemplo práctico
Un texto de 1.000 palabras en español suele traducirse en aproximadamente 1.300-1.500 tokens, dependiendo del modelo.