La mayoría de las evaluaciones de proveedores de IA se deciden por una demo, que es casi la peor señal disponible. Una demo demuestra que un modelo puede hacer una tarea una vez, en condiciones que eligió el proveedor. Lo que usted compra es algo que la hace diez mil veces, en condiciones que el proveedor no eligió. Estas son las nueve preguntas que de verdad separan una cosa de la otra, qué evalúa cada una en el fondo y cómo suena la versión evasiva.
Importan porque el punto de partida es malo: el 95 % de los pilotos de IA generativa en empresas no produce ningún impacto medible en los resultados financieros (MIT Project NANDA, 2025). El mismo estudio encontró el patrón que lo supera: comprar a proveedores especializados o asociarse con ellos tuvo éxito cerca del 67 % de las veces, aproximadamente el triple que los desarrollos internos. Trabajar con un socio funciona. Hacerlo mal explica la mayor parte de ese 95 %.
1. ¿Qué han puesto en producción y qué hace hoy?
No lo que han desarrollado, sino lo que está funcionando hoy, con usuarios que dependen de ello. Pida el flujo de trabajo, el volumen y cuánto tiempo lleva en servicio.
Mala respuesta: un portafolio de pilotos, prototipos y pruebas de concepto contados en pasado. Cualquiera puede hacer una demo. Poner algo en producción y mantenerlo en marcha es todo el oficio, y un proveedor que lo ha hecho tendrá datos concretos. Los nuestros están en la página de casos de éxito, con la inversión y el retorno de cada uno.
2. ¿Quién hará exactamente el trabajo, y conoceré a esas personas antes de firmar?
La distancia entre las personas de la presentación comercial y las que escriben el código es donde se tuerce la mayoría de los proyectos. Pida nombres, nivel de experiencia y si están asignadas a otras cuentas.
Mala respuesta: «nuestro equipo», un organigrama o un socio que «seguirá el proyecto de cerca». Si quienes definen el alcance no son quienes lo desarrollan, cada dato de contexto que usted transmite tiene que transmitirse una segunda vez. Ese es todo el argumento a favor de trabajar con ingenieros integrados en su equipo (forward-deployed), un modelo que explicamos para compradores (en inglés).
3. ¿Cuál es el precio total y quién asume un sobrecosto?
Una sola cifra, por escrito, con la respuesta a qué pasa cuando el proyecto se alarga. Es la pregunta de la lista que más rápido distingue los modelos de contratación.
Mala respuesta: una tabla de tarifas, un rango o «depende del alcance». Siempre depende del alcance. La pregunta es quién carga con ese riesgo. Describimos el mecanismo en Bait-and-Bill (en inglés), y nuestros precios están publicados para que pueda exigirnos lo mismo.
4. ¿Cómo sabremos que funciona?
Usted busca una métrica y un método de medición, a ser posible acordados antes del desarrollo. ¿Precisión sobre qué conjunto de pruebas? ¿Tasa de resolución frente a qué línea de base? ¿Medida por quién y con qué frecuencia?
Mala respuesta: resultados cualitativos, cifras de adopción o «definiremos el éxito juntos en la fase de descubrimiento». Un proveedor que se dedica a desarrollar IA tiene opiniones sobre cómo medirla. Para eso sirve un conjunto de evaluaciones (en inglés), y no tener una opinión sobre el suyo es una señal reveladora.
5. ¿Qué pasa cuando el modelo se equivoca?
Todo sistema probabilístico falla. Usted comprueba si pensaron en los modos de fallo antes de que se lo preguntara: salvaguardas, vías de escalamiento, puntos de control humano y el alcance del daño en un mal día.
Mala respuesta: «el modelo es muy preciso», o cualquier respuesta que trate la fiabilidad como una propiedad del modelo y no del sistema que lo rodea. La respuesta real describe restricciones escritas en el código, no confianza en los benchmarks de un proveedor.
6. ¿Qué pasa cuando cambia el modelo subyacente?
Los proveedores de modelos retiran versiones, las reajustan y publican cambios de comportamiento según su propio calendario. Pregunte qué se rompe, cómo se enterarían y con qué rapidez podrían volver atrás.
Mala respuesta: una mirada en blanco, o una supuesta independencia del modelo sin nada que la respalde. La versión creíble incluye versiones de modelo fijadas, prompts versionados, un conjunto de pruebas de regresión y un camino de vuelta a un estado conocido y estable. Son las capas que describimos en el stack de un agente en producción (en inglés).
7. ¿De quién son el código, los prompts y las evaluaciones?
Pregunte expresamente por los tres, y también por la infraestructura y los datos. Los prompts y los conjuntos de evaluaciones son el conocimiento acumulado del proyecto, y son la parte que con más probabilidad se queda el proveedor sin decirlo.
Mala respuesta: la propiedad de los «entregables», o la propiedad del código con la orquestación alojada en la plataforma del proveedor. Si irse implica reconstruirlo todo, el precio del proyecto incluye no irse nunca.
8. ¿Cuánto cuesta operarlo después del lanzamiento y quién lo opera?
Los sistemas de IA en producción derivan, y alguien tiene que vigilarlos. Pida la cifra mensual y quién responde por ella.
Mala respuesta: tratar la operación como algo opcional o como un simple plan de soporte. La inferencia en sí es barata, centavos por transacción, y su precio baja rápido. La supervisión, las regresiones en las evaluaciones y la gestión de la deriva sí son trabajo real. El nuestro cuesta 3000 a 20 000 USD al mes según cuántos sistemas estén bajo gestión, y preferimos darle la cifra desde el principio antes que dejar que la descubra más tarde.
9. ¿Cuándo nos dirían que no desarrolláramos esto?
Es la pregunta más reveladora de la lista, y la que casi nadie hace. Usted comprueba si el proveedor tiene algún criterio sobre el encaje del proyecto, o si casualmente todos los problemas se resuelven con lo que vende.
Mala respuesta: entusiasmo. Un proveedor que merece ser contratado nombra las condiciones en las que no conviene seguir adelante: faltan los datos, el flujo de trabajo tiene muy poco volumen, la respuesta correcta no se puede conocer, nadie es responsable de la métrica. Si nunca ha disuadido a un cliente de algo, usted no es su cliente: es una oportunidad más en su embudo de ventas.
Cómo usar las respuestas
Haga las nueve preguntas a cada proveedor, incluidos nosotros, y anote las respuestas una al lado de la otra. El patrón importa más que cualquier respuesta aislada: los proveedores que ponen sistemas en producción dan respuestas concretas, algo aburridas y con cifras, y los que hacen demos dan respuestas seguras sobre lo que la tecnología puede hacer. Si quiere la versión estructurada de esta comparación, detallamos las ventajas y desventajas frente a las consultoras tradicionales y las agencias de automatización, incluidos los casos en que cada una es de verdad la mejor opción.



