Voici le chiffre que la plupart des prestataires n’écrivent pas : un agent IA en production se paie au forfait, à partir de 8 000 $ pour un agent standard et jusqu’à environ 150 000 $ (dollars américains) pour un projet complexe à forte exigence de fiabilité, avec une mise en production en 90 jours environ. Ce sont nos tarifs publiés. Quant à la facture du modèle, celle qui inquiète tout le monde, c’est la ligne la moins chère de tout le budget. Traiter dix mille conversations de support avec un modèle rapide coûte environ 37 $ de tokens (tarifs publiés par Anthropic). L’argent part ailleurs. Savoir où fait la différence entre un agent qui se rembourse et un agent qui finit au cimetière des projets abandonnés.
Car l’essentiel des dépenses en IA est aujourd’hui gaspillé. 95 % des pilotes d’IA générative en entreprise n’ont aucun effet mesurable sur le compte de résultat (MIT Project NANDA, 2025), et Gartner prévoit que plus de 40 % des projets d’IA agentique seront abandonnés d’ici fin 2027, principalement à cause de coûts qui dérapent et d’une valeur mal établie (Gartner, 2025). L’adoption, elle, est presque générale : 91 % des entreprises de taille intermédiaire interrogées par RSM utilisent l’IA générative, mais seulement 25 % l’ont intégrée au cœur de leurs opérations (RSM, 2025). L’écart entre utiliser l’IA et gagner de l’argent grâce à elle est un problème d’ingénierie, et c’est là que se trouve le vrai coût.
Combien coûte le développement d’un agent IA ?
Un agent IA en production, c’est-à-dire un agent sur un workflow à forte valeur, déployé dans votre environnement technique avec ses évaluations (evals) et son observabilité, se paie au forfait : à partir de 8 000 $ pour un agent standard et jusqu’à environ 150 000 $ pour les projets les plus complexes. Comptez environ 90 jours. Un diagnostic à prix fixe qui se termine par un pilote déployé coûte 25 000 $. Ce sont nos tarifs publiés, et ils reflètent ce que coûtent les projets sérieux dans les ETI et les PME.
L’écart entre 8 000 $ et 150 000 $ n’est pas une marge de confort. Quatre facteurs le déterminent :
- L’étendue des intégrations. Un agent qui lit dans un système et écrit dans un autre, c’est le plancher. Un agent qui orchestre cinq outils avec des étapes de validation humaine, c’est le plafond.
- L’état des données. Si les connaissances dont l’agent a besoin se trouvent dans des systèmes propres et interrogeables, vous gagnez des semaines. Si elles sont dans des boîtes mail et des PDF, prévoyez le budget du pipeline de données. La mauvaise qualité des données est le premier obstacle que citent les responsables data pour faire passer les pilotes en production (Informatica CDO Insights, 2025).
- Le profil de risque. Un agent en contact avec vos clients a besoin de garde-fous, d’évaluations et de circuits d’escalade dont un outil interne peut se passer.
- Le niveau d’exigence en exploitation. « Ça marche en démo » et « ça tourne sans surveillance à 2 heures du matin » sont deux produits différents.
Combien coûte l’exploitation une fois l’agent en production ?
Moins que vous ne le pensez. Pour un workflow d’ETI ou de PME, l’inférence se compte le plus souvent en centimes par transaction, pas en dollars. Voici les prix d’API publiés actuellement par les grands fournisseurs de modèles, par million de tokens :
| Gamme de modèle | Entrée / 1 M de tokens | Sortie / 1 M de tokens |
|---|---|---|
| Claude Haiku 4.5 (gros volumes) | 1 $ | 5 $ |
| Gemini 2.5 Pro | 1,25 $ | 10 $ |
| GPT-5.6 (modèle phare) | 2,50 $ | 15 $ |
| Claude Sonnet 5 (choix par défaut en production) | 3 $ | 15 $ |
Sources : pages tarifaires d’Anthropic, de Google et d’OpenAI, 2026. À raison d’environ 3 700 tokens par conversation, traiter 10 000 tickets de support avec Haiku coûte environ 37 $ (Anthropic). Deux leviers intégrés réduisent encore la note : la mise en cache des prompts ramène la relecture d’un contexte répété à un dixième du prix, et le traitement par lots le divise par deux.
Cette ligne de budget est en outre en chute libre. Selon une mesure indépendante, le prix à payer pour atteindre un niveau de capacité donné a été divisé par environ 40 chaque année (Epoch AI, 2025). Quel que soit le coût de l’inférence aujourd’hui, il sera plus bas le trimestre prochain. C’est précisément pourquoi il est faux de budgéter un agent autour de la facture de tokens : le coût durable, c’est l’ingénierie, l’intégration et l’exploitation autour du modèle, pas l’appel au modèle.
Après la mise en production, les modèles dérivent, les fournisseurs publient des changements qui cassent l’existant et les cas limites s’accumulent. Un agent dont personne n’assure l’exploitation et la supervision se dégrade en silence, jusqu’au jour où quelqu’un découvre un mois de résultats erronés. Prévoyez ce forfait récurrent, de 3 000 à 20 000 $ par mois, comme vous prévoyez l’hébergement d’un logiciel : c’est le coût de possession du système, pas une option.
Où les équipes dépensent vraiment trop
Pas dans les tokens : dans les projets qui échouent. Quand 95 % des pilotes ne rapportent rien (MIT, 2025) et que plus de 40 % des projets agentiques devraient être abandonnés (Gartner, 2025), le premier poste de coût du marché est l’argent dépensé pour une IA qui n’est jamais arrivée en production. La même étude du MIT décrit ce qui permet de l’éviter : acheter auprès de prestataires spécialisés ou s’associer à eux a réussi dans environ 67 % des cas, alors que les développements internes ont réussi à peu près trois fois moins souvent. La voie coûteuse, c’est le développement de niveau démo qui s’effondre sous la charge réelle et qu’il faut refaire : vous payez deux fois. Nous en avons écrit la version ingénierie dans Pourquoi les pilotes IA n’arrivent pas en production.
Un agent IA est-il rentable pour une ETI ou une PME ?
Si un workflow absorbe 15 heures ou plus de temps rémunéré par semaine, la réponse est généralement oui. Faites tout de même le calcul avant de vous engager. Notre calculateur de ROI de l’IA (en anglais) convertit des heures par semaine et un coût horaire chargé en fourchette d’économies annuelles et en délai de retour sur investissement. Un workflow qui consomme 20 heures par semaine à 75 $ de l’heure coûte environ 78 000 $ par an. Si 50 à 70 % de ce travail est automatisable, un agent à 90 000 $ est amorti en moins de deux ans. Pour donner un ordre de grandeur, IDC chiffre le rendement moyen en entreprise à 3,70 $ pour 1 $ investi dans l’IA générative. Il s’agit toutefois d’une étude financée par Microsoft : prenez ce chiffre comme un plafond optimiste, pas comme un plancher.
Comment contenir le coût
- Limitez le périmètre à un seul workflow. Le coût et le risque d’échec augmentent tous deux avec la surface couverte. Un agent, un workflow qui vous coûte cher, en production. Vous étendez ensuite.
- Choisissez le modèle selon la tâche. La plupart des étapes n’ont pas besoin du modèle phare. Une gamme moins chère traite la classification et l’extraction à gros volume pour une fraction du prix (voir le tableau ci-dessus).
- Achetez ce qui est éprouvé, développez ce qui vous distingue. Les partenariats ont réussi environ deux fois plus souvent que les développements internes (MIT, 2025). Réservez l’ingénierie spécifique à ce qui vous différencie réellement.
- Faites des évaluations une condition de mise en production. Un jeu d’évaluations est l’assurance la moins chère contre le fait de payer deux fois : il repère les régressions avant qu’elles n’atteignent la production. Voir comment nous les construisons (en anglais).
- Réduisez d’abord le risque avec un diagnostic à prix fixe. Un Sprint de deux semaines vous donne le vrai chiffre avant que vous ne vous engagiez, et son prix est déduit du développement qu’il cadre.
En résumé : la facture de tokens est une erreur d’arrondi, et elle baisse encore. Le développement représente un vrai budget. Et le projet raté est ce que vous pouvez acheter de plus cher. Payez pour la discipline qui l’évite. Si l’IA est le cœur de votre produit et que vous pouvez recruter des ingénieurs IA seniors, développer en interne est le meilleur choix à long terme. Nous l’écrivons dans notre comparatif développer, acheter ou intégrer une équipe. Sinon, la bonne décision est un agent en production sur le workflow qui vous coûte de l’argent aujourd’hui, et le calculateur de ROI (en anglais) vous dira si le calcul tient avant que vous ne dépensiez un dollar.



