La arquitectura del desperdicio de tokens y su impacto en el valor de las inteligencias artificiales

3.116 Visitas Totales , 3.116 Visitas Hoy

Buena parte del debate sobre la economía de la IA corporativa se concentró, en los últimos años, en una sola variable: el precio de la inferencia. El costo por millón de tokens de los modelos líderes del mercado se redujo más del 90% en dos años, un dato que llevó a muchos líderes empresariales a asumir que el gasto en inteligencia artificial generativa estaba, finalmente, bajo control.

Sin embargo, un número creciente de organizaciones está comprobando lo contrario: los precios más bajos por token no se están traduciendo en facturas más bajas. Así lo plantea Avichay Har-Tuv, líder de equipo de FinOps en CloudZone, en un análisis publicado en Unite.AI, donde sostiene que mientras el costo unitario de la inteligencia de máquina se desploma, el volumen agregado de consumo de datos crece de forma exponencial.

El verdadero responsable no son los prompts humanos

Según el análisis, directores financieros y equipos de FinOps observan una paradoja en sus facturas mensuales: los modelos nunca fueron tan baratos, pero el presupuesto total de IA generativa sigue en aumento. La causa no estaría en empleados que escriben instrucciones cada vez más largas, sino en el auge de los flujos de trabajo agénticos: sistemas autónomos que actúan en nombre de desarrolladores o procesos de automatización, y que interactúan con el software de forma muy distinta a como lo hace un humano.

A diferencia de un intercambio humano con un modelo —típicamente lineal y acotado, con un prompt corto que genera una respuesta puntual—, un agente autónomo que asume una tarea de desarrollo o resolución de problemas opera en un bucle continuo de múltiples turnos entre máquinas. El ejemplo que usa Har-Tuv es el de un asistente de ingeniería que debe corregir un error: ejecuta una compilación, detecta la falla, invoca herramientas locales para investigar y, para poder decidir, traslada miles de líneas de registros de contenedores, cargas JSON y esquemas de bases de datos hacia la ventana de contexto del modelo en la nube.

Si la primera corrección falla, el ciclo se repite: el agente vuelve a extraer los mismos registros, reempaqueta los mismos esquemas y retransmite metadatos idénticos a un endpoint de API remoto, potencialmente decenas de veces por hora. Según el autor, la mayor parte de esos datos no es código de alto valor ni propiedad intelectual, sino lo que describe como «ruido de infraestructura»: telemetría de baja señal y repetitiva que las empresas terminan pagando como si fuera tráfico de alto valor.

De optimizar el código a optimizar la carga de trabajo

Frente a este problema, el análisis identifica un cambio de enfoque en la gestión de infraestructura de IA: la optimización empresarial estaría dejando atrás la etapa de simplemente negociar contratos de API más baratos o reemplazar modelos grandes por otros más pequeños, para pasar a intervenir en la capa de carga de trabajo, filtrando los datos antes de que generen costo de transporte.

Como ejemplo de esta tendencia, Har-Tuv menciona Project Headroom, una capa de optimización de contexto de código abierto impulsada por Tejas Chopra, ingeniero senior de Netflix, diseñada para interceptar de forma local las cargas pesadas que generan los agentes antes de que lleguen a los proveedores de nube externos. El sistema recurre a compresión local, caché y recuperación bajo demanda para aislar registros, eliminar sintaxis redundante y reemplazar grandes bloques de texto por hashes criptográficos livianos. Según cifras del propio proyecto citadas en el artículo, este enfoque procesó más de 200.000 millones de tokens y generó un ahorro estimado de 700.000 dólares en costos de transporte de API evitados.

Hacia una nueva disciplina: la gobernanza del contexto

El artículo enmarca este fenómeno dentro de un patrón conocido en infraestructura tecnológica: un recurso pasa de ser un costo fijo a uno variable, el gasto se dispara y surge una disciplina específica para gestionarlo. Es lo que ocurrió, señala el autor, con la migración del hardware on-premise a la nube pública —que dio origen al FinOps— o con la multiplicación de microservicios, que impulsó las plataformas modernas de observabilidad sobre infraestructura Kubernetes.

Hoy, sostiene Har-Tuv, el volumen generado por la IA agéntica estaría empujando una evolución equivalente hacia lo que llama «gobernanza del contexto» a nivel de carga de trabajo. El artículo cita proyecciones de Gartner según las cuales al menos el 50% de los proyectos de IA generativa excederán su presupuesto hasta 2028, como consecuencia de decisiones arquitectónicas deficientes y falta de control operativo en tiempo de ejecución.

Para las empresas que despliegan múltiples sistemas multiagente, el análisis plantea la necesidad de un enfoque de gestión en varias capas: una caché compartida de prompts corporativos que evite que distintos equipos paguen de forma independiente por analizar las mismas bibliotecas y tablas de datos internas; límites presupuestarios automáticos que frenen a un agente si queda atrapado en un bucle de resolución de problemas; y una auditoría de uso de tokens a nivel granular, que permita identificar qué repositorios o canalizaciones automatizadas concentran el mayor desperdicio.

Ventanas de contexto más grandes no resuelven el problema de fondo

El artículo concluye que ventanas de contexto más amplias y precios de token más bajos podrían aliviar parte de la fricción inmediata, pero no atacan el problema estructural: la ineficiencia de retransmitir de forma repetida información idéntica a través de flujos de trabajo autónomos. Para Har-Tuv, el próximo gran desafío de costos en IA empresarial no estará en el precio del modelo, sino en el costo de mover el contexto a través de sistemas cada vez más autónomos, y las organizaciones que logren gestionar activamente esa arquitectura de transporte de contexto serán las que mejor naveguen la próxima etapa de la automatización.

(unite.ai)

Seguiremos brindándote más información sobre este tema en las siguientes presentaciones físicas y digitales de Channel News Perú

Mantente conectado a nuestra plataforma de negocios y revista, haciendo clic aquí y suscribiéndote a nuestro newsletter para contenido de valor diario

Digiqole Ad
...

Notas Relacionadas