Article

Coût d’un agent IA : optimiser la session, pas seulement le prompt

Une instruction plus précise peut éviter des recherches et des essais inutiles. Pour réduire le coût d’un agent, comparez les sessions complètes et le cache.

Vous retirez une consigne de 500 jetons pour alléger le prompt. L'agent doit alors chercher le bon fichier, comprendre son format et corriger un premier essai. L'économie de départ peut être dépassée par ces appels supplémentaires. Pour choisir ce qu'il faut fournir, il faut mesurer le parcours complet jusqu'au résultat attendu.

Un agent appelle souvent le modèle plusieurs fois

À chaque étape, le modèle reçoit un contexte et produit une réponse ou demande un outil. Le résultat de cet outil peut alimenter l'appel suivant.

Le contexte retenu comprend généralement les instructions, des échanges précédents et les informations utiles au travail. L'application peut le renvoyer, ou une interface peut en gérer une partie côté serveur. Cette conservation ne rend pas nécessairement le contexte gratuit.

Il ne grandit pas toujours sans limite : des systèmes résument, retirent ou sélectionnent des éléments. Le coût dépend donc du fonctionnement réel de la session, pas d'une règle unique applicable à tous les agents.

Comprendre pourquoi les tours supplémentaires comptent

Prenons un exemple simplifié : chaque tour ajoute une unité de texte, et tout l'historique est conservé. Les appels successifs traitent une, puis deux, puis trois unités.

Cinq tours successifs d'une boucle d'agent : à chaque tour, le préfixe accumulé repart en entier, augmenté du nouvel élément. Le volume cumulé sur cinq tours vaut quinze fois un tour, et non cinq.
Exemple sans réduction de l'historique, avec une unité ajoutée par tour : cinq appels cumulent quinze unités d'entrée. Le cache peut réduire le coût du traitement répété.

Sur dix tours, le total vaut 1 + 2 + … + 10 = 55 unités d'entrée. La formule est N × (N + 1) / 2. Elle décrit ce scénario précis, sans compression et avec un ajout constant à chaque tour.

Le volume et le prix restent deux choses différentes. Si chaque nouvelle unité coûte 1 et que les unités déjà vues sont toutes facturées à 0,1 grâce au cache, le même exemple coûte 10 + 45 × 0,1 = 14,5 unités de prix. Ce calcul illustratif exclut les sorties, les outils et un éventuel supplément d'écriture du cache.

Fournir ce qui évite une recherche inutile

Une consigne courte et précise peut indiquer le fichier de référence, le format attendu et la manière de vérifier le résultat. Si presque toutes les tâches en ont besoin, la fournir dès le départ peut éviter plusieurs essais.

À l'inverse, inclure toute une documentation rarement utilisée encombre les sessions ordinaires. Un chemin, un lien ou un index peut permettre de charger le détail seulement lorsqu'il devient pertinent.

InformationApproche à essayer
Procédure utile dans presque toutes les tâchesLa fournir dans les instructions stables.
Documentation volumineuse utile dans certains casDonner un index et charger les passages nécessaires.
État courant d'un systèmeLe consulter au moment où la décision en dépend.
Piège fréquent qui provoque des essais inutilesAjouter une explication brève et un moyen de contrôle.

La fréquence d'usage compte, mais aussi la taille, la fraîcheur et le coût de récupération. Une information utilisée souvent peut rester trop volumineuse pour être chargée intégralement.

Le cache réduit une partie du travail répété

Le cache de préfixe permet de réutiliser le traitement d'un début de requête déjà vu. Il peut réduire le prix et le délai de réponse lorsque le contenu et les conditions du fournisseur permettent cette réutilisation.

L'étude Don't Break the Cache rapporte des réductions de coûts de 41 à 80 % dans les configurations évaluées. Ces résultats ne constituent pas une remise garantie pour chaque application.

Les durées de conservation, les minimums de taille et les tarifs varient. Certaines API activent le cache automatiquement ; d'autres demandent une configuration. Les compteurs d'usage permettent de vérifier ce qui a réellement été réutilisé.

Stabiliser les éléments qui doivent être réutilisés

Dans un cache fondé sur un préfixe identique, une modification placée tôt peut empêcher la réutilisation de la suite. Évitez donc de mélanger inutilement les instructions stables avec une date ou un identifiant qui change à chaque appel.

Les descriptions d'outils peuvent aussi faire partie de ce préfixe. Les modifier ou les réordonner peut réduire la réutilisation, selon le fournisseur et le mécanisme utilisé. La documentation du cache précise ces conditions.

Un contenu mis en cache occupe toujours une place dans le contexte présenté au modèle. Une facture plus faible ne prouve donc pas que les informations sont mieux sélectionnées.

Comparer deux consignes sur les mêmes tâches

Gardez le modèle et les outils identiques, puis testez une consigne minimale et une consigne plus explicite. Relevez la réussite finale, le nombre d'appels, les jetons d'entrée et de sortie, la part réutilisée et le coût des outils.

Ajoutez le temps nécessaire pour corriger un résultat incomplet. Une session moins chère qui demande beaucoup de reprises humaines peut être moins intéressante au total.

Le bon prompt donne assez d'informations pour avancer correctement, tout en laissant les détails occasionnels accessibles. L'article sur la sélection des outils applique ce même raisonnement au catalogue de capacités.

Sources

Explorer

Sur le même sujet

Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.

Laisser un commentaire

Elle n'est jamais affichée ni publiée. Elle sert à regrouper vos commentaires et, si vous vous inscrivez un jour avec elle, à vous les rendre.

Votre commentaire sera relu avant d'être publié.