Token

Un modelo de lenguaje no lee palabras completas de la misma forma que una persona: las descompone en unidades más pequeñas antes de procesarlas. Un token es precisamente esa unidad mínima de texto que un modelo de IA procesa y genera, que puede ser una palabra completa, parte de una palabra, o incluso un solo signo de puntuación, según cómo el modelo haya aprendido a dividir el lenguaje.

Cómo se divide un texto en tokens, con un ejemplo

La palabra «hablando» podría dividirse en dos tokens, algo como «habl» y «ando», mientras que una palabra muy común como «el» o «de» suele ser un único token completo. Esta división no sigue reglas gramaticales tradicionales, sino patrones estadísticos aprendidos durante el entrenamiento sobre qué fragmentos de texto aparecen con más frecuencia juntos en el idioma.

Por qué esta unidad importa más allá de lo puramente técnico

  • El coste de usar muchas APIs de IA se calcula precisamente por número de tokens procesados, tanto en la pregunta como en la respuesta generada.
  • Cada modelo tiene un límite máximo de tokens que puede procesar de una vez (su ventana de contexto), lo que condiciona cuánto texto se le puede enviar o pedir en una sola interacción.
  • Idiomas distintos al inglés, como el español, suelen requerir más tokens para expresar la misma idea, debido a cómo se entrenaron originalmente muchos de estos modelos con predominancia de texto en inglés.

Una aproximación práctica para estimar tokens sin herramientas especializadas

Como regla general y aproximada, en español un token equivale, de media, a algo menos de una palabra completa, por lo que un texto de 1.000 palabras puede rondar entre 1.300 y 1.500 tokens, aunque esta cifra varía según el vocabulario concreto usado y el modelo específico que se esté utilizando para procesarlo.

Por qué conocer este concepto ayuda a usar mejor cualquier herramienta de IA

Entender que cada palabra tiene un coste computacional asociado explica por qué las respuestas muy largas cuestan más que las breves, por qué existen límites en cuánto texto se puede pegar de una vez en una conversación, y por qué optimizar la longitud de las instrucciones (prompts) puede tener un impacto real en el coste de usar estas herramientas a gran escala, especialmente en aplicaciones que procesan grandes volúmenes de texto de forma constante.

Términos relacionados.

Lead magnet

Nadie deja su email a cambio de nada, pero muchos lo hacen a cambio de una guía útil, una plantilla lista para usar, o un descuento concreto. Un lead magnet

Leer más

RAG

Preguntar algo a un LLM entrenado hace meses tiene un problema evidente: no sabe nada de lo que ha pasado después de su entrenamiento, ni conoce datos privados de una

Leer más

Nofollow-Dofollow

No todos los enlaces transmiten el mismo mensaje a Google. Un enlace dofollow es el enlace normal, sin ninguna instrucción especial, que permite a Google seguirlo y considerarlo como una

Leer más
0%