Pendant trois décennies, acheter du logiciel d'entreprise voulait dire signer un contrat, compter des sièges et inscrire une ligne stable au budget. L'intelligence artificielle générative a brisé ce réflexe. La dépense ne dépend plus du nombre d'employés autorisés à ouvrir une application, mais du nombre de jetons — ces unités de texte découpé que les modèles consomment pour lire une question et rédiger une réponse — que l'organisation brûle chaque jour. Et depuis que les « agents » se mettent à enchaîner des tâches sans qu'un humain appuie sur un bouton à chaque étape, la courbe de consommation échappe largement aux prévisions.
C'est l'avertissement central relayé cette semaine par Business Insider, qui rapporte une mise en garde de McKinsey : l'adoption d'agents autonomes risque de faire grimper les dépenses d'IA des entreprises tout en les rendant nettement moins prévisibles. Le même cabinet estime, selon un communiqué diffusé sur PR Newswire par la firme singapourienne Accels, que les dépenses des entreprises en modèles de langage ont triplé en douze mois — plus vite que la capacité des systèmes internes à les suivre.
Du siège mensuel au compteur qui tourne
Le basculement est structurel. Un abonnement à une suite bureautique coûte le même prix qu'un employé l'utilise deux heures ou trente secondes. Un assistant conversationnel branché sur les documents internes, lui, facture à l'usage : chaque prompt, chaque document injecté en contexte, chaque réponse générée a un coût unitaire. Tant que l'usage restait limité à quelques équipes curieuses, la facture demeurait anecdotique. Elle cesse de l'être dès que l'outil est intégré au service à la clientèle, à la révision de contrats ou au développement logiciel.
Plusieurs dynamiques se superposent. D'abord, les modèles dits « de raisonnement », qui décomposent un problème en étapes intermédiaires avant de répondre, consomment beaucoup plus de jetons qu'un modèle classique pour une même question. Ensuite, les architectures de type RAG, qui vont chercher des extraits de documents internes pour nourrir le contexte, gonflent mécaniquement le volume d'entrée. Enfin, les agents multiplient les allers-retours : un seul ordre humain peut déclencher des dizaines d'appels successifs au modèle, des recherches, des tentatives ratées, des reprises.
Le paradoxe est connu des économistes sous le nom d'effet Jevons : le prix par million de jetons a fortement chuté depuis 2023 chez les grands fournisseurs, mais la consommation a augmenté plus vite encore. Résultat, la facture globale monte pendant que le coût unitaire descend — une combinaison particulièrement désorientante pour un contrôleur de gestion habitué à négocier des rabais de volume.
Les agents, machines à consommer
L'agent est présenté comme la prochaine étape de l'IA d'entreprise : un système qui ne se contente pas de répondre, mais qui exécute. Il consulte une base de données, remplit un formulaire, appelle une API, vérifie son propre travail, recommence. Chacune de ces opérations est facturée.
Ce qui rend la prévision difficile, ce n'est pas seulement le volume, c'est la variance. Deux demandes en apparence identiques peuvent coûter dix fois plus cher l'une que l'autre selon la complexité du dossier, la qualité des données trouvées, le nombre de tentatives nécessaires. Un agent qui boucle sur une tâche mal définie peut consommer en une nuit l'équivalent d'un mois d'usage normal. Les fournisseurs infonuagiques ont introduit des plafonds, des quotas et des alertes, mais l'essentiel de la discipline reste à la charge du client.
S'ajoute une autre couche, celle-là invisible dans les tableaux de tarification : la supervision humaine. Plus un agent agit de façon autonome sur des processus sensibles — facturation, conformité, relation client —, plus l'entreprise doit prévoir des points de contrôle, des relectures, des journaux d'audit, des procédures de reprise en cas d'erreur. Ce travail humain ne figure nulle part dans la facture du fournisseur, mais il pèse dans le coût total de possession. Dans bien des cas, il constitue même le poste dominant.
Le jeton devient un actif à gérer
Un petit écosystème se construit autour de ce problème. Le communiqué d'Accels diffusé par PR Newswire parle explicitement du jeton comme d'un « actif géré » et d'une économie de l'IA qui entre dans une nouvelle phase. L'entreprise, qui a commencé par du routage — diriger automatiquement chaque requête vers le modèle le moins cher capable de la traiter correctement —, annonce vouloir aller au-delà. Il faut lire ce genre de texte pour ce qu'il est, un document promotionnel, mais il illustre une tendance réelle : l'apparition d'une couche d'intermédiation entre les entreprises et les fournisseurs de modèles.
Cette couche emprunte son vocabulaire au FinOps, cette discipline née avec l'infonuagique pour reprendre le contrôle des factures Amazon Web Services, Azure ou Google Cloud. Les mêmes recettes reviennent : attribution des coûts par équipe et par cas d'usage, mise en cache des requêtes répétitives, réduction de la taille des contextes, arbitrage entre un grand modèle coûteux et un modèle plus petit suffisant pour la tâche, voire exécution locale de certaines charges. La Fondation FinOps a d'ailleurs commencé à étendre ses cadres de référence à l'IA, signe que le sujet est passé du laboratoire à la salle du conseil.
Le retour sur investissement reste la question embarrassante
Le débat sur les coûts n'aurait pas la même intensité si les gains étaient évidents. Or ils tardent à se matérialiser de façon mesurable. Une étude du MIT, largement commentée en 2025, concluait que la grande majorité des projets pilotes d'IA générative en entreprise ne produisaient aucun effet détectable sur les résultats financiers — non pas parce que la technologie échoue, mais parce que les organisations l'insèrent mal dans leurs processus.
Les réussites documentées partagent souvent un trait : elles visent un processus étroit, répétitif et chiffrable. Au Brésil, l'assureur santé SulAmérica affirme avoir bloqué environ 6,19 millions de reais de fraudes grâce à des systèmes d'IA appliqués à la détection d'anomalies dans les demandes de remboursement et les paiements à des prestataires non accrédités, selon la Folha de S.Paulo. C'est le type de dossier où la valeur se calcule sans acrobaties comptables : des sommes détectées, une facture technologique, une différence.
À l'inverse, les déploiements généralistes — « mettons un assistant entre les mains de tout le monde » — produisent une consommation diffuse et des bénéfices difficiles à attribuer. C'est précisément dans cette zone grise que les factures surprennent.
Ce qui change pour les acheteurs
Trois évolutions se dessinent. La première est contractuelle : les directions des achats commencent à exiger des engagements de volume avec plafonds, des tarifs planchers et des clauses de portabilité pour éviter l'enfermement chez un seul fournisseur de modèles. La deuxième est architecturale : on ne branche plus systématiquement le modèle le plus puissant, on hiérarchise. La troisième est organisationnelle : l'apparition de responsables chargés d'arbitrer entre équipes techniques, finance et conformité sur ce que l'entreprise accepte de dépenser, et pour quel résultat.
La comparaison avec l'infonuagique des années 2010 est tentante, et elle est utile jusqu'à un certain point. Mais une différence compte : une machine virtuelle mal éteinte coûte cher de façon linéaire et prévisible. Un agent mal cadré, lui, peut à la fois coûter cher et produire une erreur qu'il faudra corriger en aval. La dépense variable s'accompagne d'un risque opérationnel variable. C'est ce couplage, plus que le prix du jeton, qui donne du fil à retordre aux directions financières.
