Stratégie
FinOps de l'IA : pourquoi le coût des agents échappe aux budgets, et comment le maîtriser
Le prix du jeton baisse, mais un agent enchaîne dix à vingt appels par tâche. Le coût par tâche, pas le prix par jeton, devient l'indicateur que le CTO doit piloter.
Un paradoxe revient dans les études de coûts de l'IA en 2026 : le prix du jeton chute d'une année sur l'autre, et pourtant les factures montent. Selon plusieurs synthèses sectorielles, une large majorité d'entreprises dépasse ses prévisions de coûts IA, et la quasi-totalité des équipes FinOps se voit désormais confier le sujet. Ces chiffres proviennent d'enquêtes et de compilations de qualité inégale ; retenez l'ordre de grandeur et la direction, pas la décimale.
Pourquoi la baisse du prix unitaire ne suffit pas
Une requête de chatbot, c'est un appel. Une tâche d'agent, c'est une boucle : planification, appel d'outil, lecture du résultat, nouvel essai en cas d'échec, vérification. Les analyses sectorielles évoquent dix à vingt appels par tâche au lieu d'un seul, avec des contextes de plus en plus longs au fil des étapes. Le coût par tâche dépend alors de ce que le modèle décide de faire, et il peut varier d'un ordre de grandeur entre deux exécutions qui paraissent identiques. Les méthodes de prévision budgétaire classiques — nombre d'utilisateurs × coût moyen — ne fonctionnent plus.
Cinq leviers d'architecture
- Router par difficulté. Envoyer les tâches simples vers des modèles petits et peu coûteux, réserver les modèles puissants aux étapes qui le justifient. Un routeur bien réglé change l'économie du système davantage que la négociation d'un tarif.
- Mettre en cache. Prompts système et contextes stables, réponses fréquentes : la mise en cache des préfixes et des résultats réduit à la fois coût et latence.
- Plafonner les boucles. Nombre maximal d'étapes, budget de jetons par tâche, arrêt avec escalade humaine au-delà. Un agent sans plafond est une facture sans plafond.
- Réduire le contexte. Ne pas renvoyer à chaque étape l'historique complet : résumer, ne récupérer que le nécessaire. C'est aussi un sujet de qualité des réponses.
- Évaluer l'auto-hébergement ou les modèles ouverts pour les volumes stables et prévisibles, avec les coûts cachés : exploitation, GPU, sécurité, compétences. Le raisonnement sur la souveraineté peut rejoindre celui du coût, mais il faut calculer les deux.
Mesurer la bonne chose
L'indicateur utile n'est pas le coût mensuel total, mais le coût par tâche réussie, rapporté à la valeur de la tâche. Il suppose trois choses : attribuer chaque appel à un agent, un cas d'usage et une équipe (étiquetage et journalisation dès la conception) ; mesurer le taux de réussite, car une tâche ratée coûte autant qu'une tâche réussie ; et comparer au coût de l'alternative, humaine ou logicielle classique. Certains cas d'usage ne passeront pas ce test — et c'est l'information que le CTO doit avoir avant la production, pas après.
Le lien avec la gouvernance
Gartner cite l'escalade des coûts parmi les trois causes principales d'annulation des projets agentiques (voir notre article sur les agents en production). Le FinOps de l'IA n'est donc pas un sujet de finance périphérique : c'est une exigence d'architecture, au même titre que l'observabilité. Il se met en place avec elle — mêmes traces, mêmes étiquettes.
- Le prix par jeton baisse, mais les agents multiplient les appels : le coût total peut monter même si le tarif unitaire diminue.
- Routage par difficulté, cache, plafonds de boucle, contexte réduit et modèles ouverts sont les leviers d'architecture.
- L'indicateur à piloter est le coût par tâche réussie, rapporté à sa valeur.
- Étiquetage et traces se conçoivent dès le départ : c'est la même infrastructure que l'observabilité.
Sources
À lire aussi
Cet enjeu vous concerne ?
Un premier échange gratuit pour l'évaluer ensemble.