// INTELIGENCIA ARTIFICIAL

¿Cuántos modelos, cuánto dinero? Calcular el coste de la IA

6 min de lecturanijitech

El coste por operación es pequeño e invisible en un piloto; multiplicado por el volumen decide toda la factura. Una forma práctica de medirlo y de bajarlo.

Artículo completo

El coste de la IA es una de las líneas peor estimadas de un presupuesto. No porque la fórmula sea complicada, sino por una ilusión simple: lo que se paga durante un piloto es tan poco que nadie se detiene en ello. Cuando el sistema llega a producción, ese mismo número pequeño se multiplica por el volumen y se convierte en toda la factura.

Tres números deciden el coste

El coste de modelo de un sistema de IA es en realidad el producto de tres números: llamadas por operación, texto procesado por llamada y precio unitario del modelo elegido. Duplique cualquiera y la factura se duplica; duplique los tres y se multiplica por ocho.

Preguntas que hacer al presupuestar

  • ¿Cuántas llamadas al modelo necesita un trabajo: una, o cinco encadenadas?
  • ¿Cuánto contexto se envía por llamada, y hace falta todo?
  • ¿Este trabajo quiere de verdad el modelo más potente, o va ahí por costumbre?
  • Si el volumen se multiplica por diez, ¿cuál de los tres números crece?

Mandar cada trabajo al modelo más potente

Clasificar un texto en una de dos categorías y hacer un análisis de varios pasos no exigen la misma capacidad. Pero si en el código de la aplicación está escrito un solo nombre de modelo, ambos van al mismo sitio. Los trabajos simples como la clasificación suelen ser el grueso de las llamadas; enrutarlos a un modelo más pequeño borra de entrada una parte notable de la factura.

La latencia es la mitad invisible del coste

El coste se acumula en el tiempo de espera tanto como en la factura. Cada segundo que un usuario espera una respuesta reduce la frecuencia con que se usa esa función. Un modelo más pequeño suele ser a la vez más barato y más rápido, así que estas dos mejoras salen a menudo de la misma decisión.

Ejecutar parte del trabajo cerca del usuario cambia la misma ecuación. Una operación que nunca llega a un servidor central no produce ni latencia ni cargo por llamada.

Importa dónde escribe la decisión

Si el saber de qué trabajo va a qué modelo está enterrado en el código de la aplicación, cada cambio de precio y cada modelo nuevo se vuelve una tarea de desarrollo. Si esa misma decisión viviera en una capa de enrutado, sería una tarea de configuración. Los modelos envejecen; la cadena se queda.

En resumen

Cuatro formas prácticas de bajar el coste

  • Enrute los trabajos simples a un modelo pequeño: el volumen está ahí
  • Recorte el contexto que envía; rara vez hace falta entero
  • Cuente la latencia como línea de coste, no como asunto aparte
  • Escriba la elección de modelo en la configuración, no en el código

Aplicadas juntas, la ganancia no es de unos puntos porcentuales sino de un factor, y ninguna de las cuatro exige renunciar a la precisión.

Productos mencionados en este artículo

Del glosario: Orquestación de modelos · Escalado en el borde

← Todos los artículos