Tokens, contexto y coste: lo que de verdad pagas cuando usas IA en la empresa

La reunión de seguimiento de presupuesto de abril. El CFO abre el Excel, llega a la línea de «API IA» y frunce el ceño. «Esto ha subido un 40% respecto al mes pasado. ¿Qué ha cambiado?» Nadie en la sala sabe responder con precisión. Alguien dice que se han incorporado dos departamentos más. Alguien dice que quizá es que se usa más. Y el CFO anota: «revisar». Esa reunión la he vivido, o me la han contado, más veces de las que me gustaría.

Cuánto cuesta usar IA en la empresa depende casi siempre de dos conceptos que se entienden mal: el token y el contexto. El problema no es que la IA sea cara. El problema es que casi nadie en la empresa entiende qué es lo que genera el coste, y sin eso no puedes controlarlo ni explicarlo.

Qué es un token y por qué importa

No voy a ponerte a hacer linguística. Solo necesitas saber esto: un token es la unidad mínima de texto que procesa un modelo de IA —a veces una sílaba, a veces una palabra completa, a veces un signo de puntuación— y es la unidad sobre la que se calcula el coste. De media, en español, puedes calcular que mil palabras equivalen a unos 1.300 o 1.400 tokens. Es una aproximación suficiente para presupuestar.

Lo importante es que los proveedores de IA cobran por token. Y cobran dos veces: por los tokens que entran (lo que tú mandas al modelo) y por los tokens que salen (lo que el modelo te devuelve). Ambos tienen precio. El de salida suele ser más caro.

Formación presencial · Madrid

¿Quieres salir de aquí sabiendo hacer esto en tu empresa el próximo 14 de noviembre?

En un día presencial montas tus departamentos agénticos con IA y construyes tu propia app. Sin conocimientos técnicos. Máx. 16 plazas.

Ver el curso → 990€ + IVA

Si mandas un mensaje corto y recibes una respuesta corta, pagas poco. Si mandas un documento de 30 páginas y recibes un informe largo, pagas bastante más. Hasta aquí, lógico.

Cuánto cuesta la IA en la empresa: el contexto es el principal disparador

Aquí viene la parte que sorprende a casi todos los directivos la primera vez que la entienden.

Cuando usas un agente o una aplicación basada en IA, el modelo no tiene «memoria» entre llamadas. Cada vez que le preguntas algo, hay que mandarle de nuevo todo el contexto necesario para que entienda quién eres, qué estás haciendo y qué te ha dicho antes. El contexto es el conjunto de tokens que se envían al modelo en cada llamada —instrucciones, historial, documentos, pregunta—, y tú pagas por todos ellos en cada interacción. Eso se llama ventana de contexto.

Imagínate que tienes un agente que revisa contratos. Cada vez que analiza un contrato, se le manda: las instrucciones del sistema (500 tokens), el historial de la conversación (2.000 tokens), el contrato en sí (8.000 tokens), y la pregunta del usuario (50 tokens). Son más de 10.000 tokens de entrada solo para una consulta. Si ese agente lo usan diez personas y hacen cinco consultas al día cada una, ya son medio millón de tokens diarios. Empieza a tener sentido el Excel del CFO.

El contexto crece, además, con el tiempo. Un chat que llevas usando una hora tiene más historial que uno que acabas de abrir, y ese historial se manda entero con cada mensaje. Algunos sistemas lo truncan, otros no. En mi experiencia, la mayoría de los que empiezan a desplegar IA en la empresa no revisan este parámetro hasta que llega la factura.

La mentalidad de los 40 KB

Tengo una analogía que me gusta usar. Los primeros videojuegos —Super Mario Bros, por ejemplo— cabían en cartuchos de 40 kilobytes. No porque los desarrolladores fueran torpes, sino porque el espacio era limitado y caro, y eso les obligaba a ser extraordinariamente precisos: cada byte contaba, cada sprite se optimizaba, no había nada que no fuera estrictamente necesario. Era artesanía de la escasez.

Con los tokens conviene recuperar esa mentalidad. No porque los modelos no puedan manejar ventanas grandes —ahora mismo pueden leer cientos de miles de tokens de un tirón— sino porque cada token innecesario que mandas es dinero que estás tirando. Instrucciones repetidas, documentos completos cuando solo necesitas un fragmento, historiales de conversación kilométricos que no aportan nada al análisis actual.

Un buen diseño de agente es parco. Manda lo que necesita, nada más.

Cuatro palancas para controlar el gasto

1. No mandes contexto que no necesitas

Esta es la más obvia y la más ignorada. Si tu agente de atención al cliente solo necesita el nombre del cliente y su última incidencia, no le mandes el historial completo de los últimos tres años. Si estás analizando un contrato, recorta el documento a las cláusulas relevantes antes de mandarlo.

Requiere diseño, no es gratis. Pero el retorno es inmediato.

2. Usa el modelo justo para cada tarea

Existe una jerarquía de modelos. Los más potentes y los que mejor razonan son también los más caros. Pero muchas tareas que se hacen en una empresa no necesitan el modelo más avanzado: clasificar un correo, extraer un dato de una factura, generar un resumen estándar. Para esas tareas, un modelo más pequeño y más barato hace el mismo trabajo a una fracción del coste.

El error frecuente es usar el modelo «premium» para todo porque es el que da mejores resultados en el benchmark. En la práctica, reserva el modelo potente para las tareas que lo justifican —análisis complejos, redacción de documentos críticos, razonamiento en varias etapas— y usa modelos más ligeros para el volumen.

3. Reutiliza contexto cuando puedas

Algunos proveedores ofrecen mecanismos de caché de contexto: si el principio de tu prompt es siempre el mismo —las instrucciones del sistema, por ejemplo— ese fragmento se puede cachear y no se recarga cada vez. El ahorro puede ser considerable si tienes un agente con instrucciones largas que se lanza muchas veces al día.

No todos los proveedores lo implementan igual, y hay que configurarlo. Pero si tu equipo técnico no lo ha mirado, vale la pena que lo revise.

4. Mide el consumo por caso de uso

No es lo mismo saber que has gastado X euros en IA el mes pasado que saber cuánto has gastado por departamento, por agente, por tipo de tarea. Sin esa granularidad, no puedes priorizar ni optimizar.

Cualquier implementación seria debería tener logs de uso con etiquetas: quién llama, qué modelo usa, cuántos tokens consume. Con eso puedes ir a la junta con un dato real, no con una estimación.

Cómo estimar cuánto cuesta usar IA en tu empresa antes de lanzar

Si te piden que presupuestes el coste de la IA en tu empresa antes de lanzar un proyecto, este es el esquema que yo uso:

Paso 1. Estima el número de llamadas al día por caso de uso. Un agente de clasificación de correos que procesa 200 mails al día son 200 llamadas.

Paso 2. Estima los tokens por llamada: entrada (instrucciones + documento + historial) y salida (respuesta esperada). Para orientarte: un párrafo de texto son unos 150-200 tokens.

Paso 3. Multiplica: llamadas × tokens × precio por token × 30 días. No necesitas precisión de dos decimales; un orden de magnitud ya te sirve para decidir si el caso de uso tiene sentido económico.

Paso 4. Añade un margen del 30-40% para picos, pruebas y el inevitable crecimiento de uso en los primeros meses.

El resultado no será exacto, pero será suficiente para que el CFO no se lleve una sorpresa. Y eso, en muchas organizaciones, vale más que cualquier benchmark de rendimiento.

Lo que no te dicen en el pitch

Cuando un proveedor de software con IA te presenta su herramienta, el coste de los tokens suele estar en la letra pequeña o directamente no aparece. Preguntas que conviene hacer antes de firmar:

  • ¿El coste de la API está incluido en la licencia o va aparte?
  • ¿Qué modelo usa por defecto y cuál es su precio por token?
  • ¿Hay mecanismos de control de gasto o alertas?
  • ¿Puedo ver el detalle de consumo por usuario o por función?

Si no pueden responderte estas preguntas con claridad, ya tienes una señal de alerta.

Leer también: Cuánto cuestan los agentes de IA y Cómo construir tu primer agente.

—

Preguntas frecuentes

¿Cómo sé cuántos tokens estoy usando exactamente? La mayoría de proveedores —Anthropic, OpenAI, Google— tienen dashboards en sus consolas donde puedes ver el consumo histórico. Si usas sus APIs directamente, cada respuesta incluye un campo con el número de tokens de entrada y salida de esa llamada. Si usas una herramienta de terceros que consume la API, tendrás que preguntar al proveedor si expone esa información.

¿El coste de la IA escala de forma lineal con el número de usuarios? Aproximadamente sí, pero depende del diseño del sistema. Si cada usuario genera un número similar de llamadas con un contexto similar, el coste escala de forma bastante lineal. Lo que puede romper esa linealidad es un agente mal configurado que manda contextos muy grandes, o un proceso que se lanza en batch sobre miles de registros.

¿Tiene sentido montar infraestructura propia para reducir costes? Para la gran mayoría de empresas de 10 a 200 personas: no. Los modelos que puedes ejecutar localmente con coste razonable no alcanzan la calidad de los modelos frontier para tareas de negocio. La ecuación cambia si tienes requisitos estrictos de privacidad de datos o volúmenes muy elevados, pero ese es un análisis que hay que hacer caso por caso, no una decisión genérica.

Fuente: Precios oficiales de la API de Anthropic.

Publicaciones Similares