Todo sobre tokens, ¿qué son los tokens detrás de la IA?

Cualquiera que haya abierto una cuenta en una plataforma de inteligencia artificial para probar un asistente virtual, un generador de texto o un sistema automático de análisis de documentos, tarde o temprano se ha encontrado con una pantalla de facturación que dice «simbólico«. En las suscripciones planas, la referencia a los tokens suele estar oculta detrás de un genérico «porcentaje de uso«, pero el token sigue siendo la unidad fundamental y, muy a menudo, la más incomprendida. La perspectiva que tomamos desde aquí, sin embargo, es la de aquellos que están haciendo cosas más avanzadas, tal vez creando un servicio basado en IA para revender a terceros, o para uso interno, y descubren que el consumo de tokens se vuelve loco: hay hambre de fichas, en definitiva.

Pero ¿por qué se llaman así y qué son? ¿Realmente tokens para hacer funcionar la «máquina» o es un error de traducción? No es un error, no es una jerga técnica oscura: es la materia prima de inteligencia artificial generativa, el equivalente al kilovatio hora de una central eléctrica o al barril de una refinería. Entendiendo lo que es simbólico es el primer paso para no tomar decisiones equivocadas y no sorprenderse con la primera factura cuando abandona los servicios prepago y pasa al modo «pago por uso».

No es una palabra, no es una sílaba.

Un token no corresponde a ninguna unidad lingüística tradicional. No es una palabra no es una sílabano es un carácter: es un fragmento de texto de longitud variable que los modelos de lenguaje han aprendido a utilizar por razones estadísticas y computacionales.

La regla general más utilizada dice que en inglés una ficha vale aproximadamente 0,75 palabras; en italiano la relación es menos favorable, porque nuestra lengua tiene terminaciones más ricas y formas verbales más numerosas: cada palabra italiana consume una media de 1,3 o 1,4 tokens. La palabra «hogar» es sólo una muestra; La “optimización” probablemente requiera tres o cuatro, porque el modelo la divide en segmentos estadísticamente más frecuentes.

Esto tiene consecuencias prácticas inmediatas. Un documento de diez páginas en italiano puede generar una número de fichas significativamente mayor que el mismo documento traducido al inglés. Quien construye un producto a medida para el mercado italiano debe tener en cuenta esta variable desde la fase de diseño, no en la fase final.

Entrada y salida: dos precios, una lógica

Cuando consulta un modelo, suceden dos cosas distintas: el texto de entrada (el mensaje, el documento, el historial de conversación) se convierte en tokens de aporte; la respuesta generada por el modelo produce tokens de producción.

Ambos reciben pago, pero un diferentes tarifas. El producto cuesta sistemáticamente más: normalmente de tres a cinco veces más que el insumo. La razón técnica es que generar texto requiere un procesamiento secuencial, mientras que leer un documento es mucho más rápido para el sistema.

Con Soneto de Claudio 4.6 de Anthropic los precios actuales son de tres dólares por millón de tokens para entrada y quince para salida. Claude Haiku 4.5el modelo más ligero de la misma familia, baja a un dólar por millón en entrada y cinco en producción. En el frente de OpenAI, GPT-5 se sitúa en torno a 1,25 dólares por millón de insumos y diez de producción.

Apple, que ha abierto sus modelos de lenguaje a los desarrolladores, también se está volviendo un tercer polo relevante en este mercado. Son cifras que parecen insignificantes hasta que se multiplican por los volúmenes reales de un producto en producción.

servicio de chat gpt

La cuenta del servidor funciona mal con tokens.

Un ejemplo aclara el problema. Una empresa que quiere construir un asistente para análisis de contrato debe hacer que el modelo lea cada documento (digamos 30 mil tokens de entrada) y produzca un resumen estructurado (digamos tres mil tokens de salida).

Con Claude Sonnet 4.6 cada respuesta cuesta alrededor de 13 céntimos. Parece poco. Si el sistema responde a mil solicitudes Por día, el gasto en materias primas supera los 47 mil dólares al año, incluso antes de pagar infraestructura, personal y marketing.

Cambiar el modelo sin hacer los cálculos correctamente puede destruir el margen. Elegir un modelo más capaz pero dos veces más caro duplica ese costo, convirtiendo un plan de negocios sustentable en un ejercicio de pérdida sistemática. Es un mecanismo que también concierne a las grandes suites corporativas: Microsoft 365 Copilot con su Modo Agente muestra cómo fichas convertirse en un costo real incluso dentro de las herramientas que ya se pagan mediante suscripción. La elección del modelo no es una decisión técnica: es una decisión industrial.

Las palancas para reducir costes

Quienes gestionan un producto de IA en producción tienen algunas palancas concretas para reducir el coste de los tokens. El primero es el enrutamiento: No todas las tareas requieren el modelo más sofisticado. Ordenar correos electrónicos, clasificar solicitudes, extraer datos de un formulario son operaciones que un modelo liviano como Haiku 4.5 maneja muy bien a una quinta parte del costo de Sonnet.

Las empresas más maduras construyen un nivel lógico que asigna cada solicitud al modelo más económico capaz de solucionarla.

La segunda palanca es la almacenamiento en caché rápido. Si cada llamada modelo incluye las mismas instrucciones iniciales, los mismos ejemplos, la misma documentación comercial, pagar por ellos cada vez es un desperdicio. Antrópico y OpenAI te permiten almacenar en caché esa porción fija con descuentos de hasta el 90%; Vale la pena señalar que herramientas avanzadas como ChatGPT Deep Research también aprovechan mecanismos similares para mantener bajos los costos de sesiones de investigación prolongadas.

Exactamente la misma arquitectura, bien o mal gestionada, puede tener un coste tres o cuatro veces diferente. La tercera palanca es la procesamiento por lotes: si la tarea no requiere una respuesta inmediata, poner las solicitudes en cola y recibirlas dentro de las veinticuatro horas garantiza un descuento del 50% respecto a las llamadas en tiempo real.

La ventana de contexto no es gratuita.

Los modelos actuales manejan ventanas de contexto muy grandes: Claude Opus 4.6 llega al millón de fichas, el equivalente a una novela entera. Esta capacidad es útil para leer documentos largos sin dividirlos, pero no es gratuita.

Cada token presente en la ventana de contexto es procesado y facturadoincluidos mensajes anteriores de la conversación. Cualquiera que arrastre toda la historia de una operación larga en cada llamada puede multiplicar el costo por un factor significativo.

Las empresas más atentas aprenden a resumir el historial de la conversación, a eliminar partes irrelevantes y a no incluir documentos ya elaborados en llamadas posteriores. Cada token guardado en entrada es puro margen. La duración del resultado también es una variable manejable: un modelo entrenado para responder de manera concisa en lugar de ser detallado genera menos tokens de resultado, que cuestan más, mejorando el margen para la misma calidad percibida; Las aplicaciones de productividad como Evernote son muy conscientes de esto, ya que han integrado la IA en la versión 11 en un intento de equilibrar los costos de utilidad y procesamiento.

El riesgo de dependencia de un proveedor

Los precios de los tokens han caído significativamente en los últimos años, pero no se puede elaborar un plan de negocios asumiendo que eso el declive es lineal e infinito. Los proveedores cambian las listas de precios, retiran los modelos económicos, introducen variantes más caras.

¿Quién construye un producto con dependencia exclusiva de un solo proveedor se expone a un riesgo en la cadena de suministro similar al de un productor manufacturero que compra todo su suministro de materia prima de un solo país.

Las empresas más fuertes construyen una capa de abstracción lo que permite sustituir al proveedor en unos días y vigila los modelos de código abierto que, una vez superado un determinado umbral de volumen, es mejor alojarlo internamente.

No es sólo un problema para los desarrolladores de software: como ha demostrado el análisis de cómo la IA podría transformar toda la economía de las aplicaciones, la dependencia de un único ecosistema es el riesgo estructural de esta fase. no es paranoia: es gestión industrial elemental, aplicada a una nueva materia prima. las fichasDespués de todo, son simplemente el acero de esta economía.

Todas las noticias y conocimientos sobre inteligencia artificial están disponibles en la sección dedicada de aatma.