Quand utiliser un LLM plutôt qu’un programme classique ?
Un modèle de langage aide à interpréter une demande floue. Pour des règles explicites, comparez-le à du code simple et mesurez le coût de ses erreurs.
Article
Une instruction plus précise peut éviter des recherches et des essais inutiles. Pour réduire le coût d’un agent, comparez les sessions complètes et le cache.
Vous retirez une consigne de 500 jetons pour alléger le prompt. L'agent doit alors chercher le bon fichier, comprendre son format et corriger un premier essai. L'économie de départ peut être dépassée par ces appels supplémentaires. Pour choisir ce qu'il faut fournir, il faut mesurer le parcours complet jusqu'au résultat attendu.
À chaque étape, le modèle reçoit un contexte et produit une réponse ou demande un outil. Le résultat de cet outil peut alimenter l'appel suivant.
Le contexte retenu comprend généralement les instructions, des échanges précédents et les informations utiles au travail. L'application peut le renvoyer, ou une interface peut en gérer une partie côté serveur. Cette conservation ne rend pas nécessairement le contexte gratuit.
Il ne grandit pas toujours sans limite : des systèmes résument, retirent ou sélectionnent des éléments. Le coût dépend donc du fonctionnement réel de la session, pas d'une règle unique applicable à tous les agents.
Prenons un exemple simplifié : chaque tour ajoute une unité de texte, et tout l'historique est conservé. Les appels successifs traitent une, puis deux, puis trois unités.
Sur dix tours, le total vaut 1 + 2 + … + 10 = 55 unités d'entrée. La formule est N × (N + 1) / 2. Elle décrit ce scénario précis, sans compression et avec un ajout constant à chaque tour.
Le volume et le prix restent deux choses différentes. Si chaque nouvelle unité coûte 1 et que les unités déjà vues sont toutes facturées à 0,1 grâce au cache, le même exemple coûte 10 + 45 × 0,1 = 14,5 unités de prix. Ce calcul illustratif exclut les sorties, les outils et un éventuel supplément d'écriture du cache.
Une consigne courte et précise peut indiquer le fichier de référence, le format attendu et la manière de vérifier le résultat. Si presque toutes les tâches en ont besoin, la fournir dès le départ peut éviter plusieurs essais.
À l'inverse, inclure toute une documentation rarement utilisée encombre les sessions ordinaires. Un chemin, un lien ou un index peut permettre de charger le détail seulement lorsqu'il devient pertinent.
| Information | Approche à essayer |
|---|---|
| Procédure utile dans presque toutes les tâches | La fournir dans les instructions stables. |
| Documentation volumineuse utile dans certains cas | Donner un index et charger les passages nécessaires. |
| État courant d'un système | Le consulter au moment où la décision en dépend. |
| Piège fréquent qui provoque des essais inutiles | Ajouter une explication brève et un moyen de contrôle. |
La fréquence d'usage compte, mais aussi la taille, la fraîcheur et le coût de récupération. Une information utilisée souvent peut rester trop volumineuse pour être chargée intégralement.
Le cache de préfixe permet de réutiliser le traitement d'un début de requête déjà vu. Il peut réduire le prix et le délai de réponse lorsque le contenu et les conditions du fournisseur permettent cette réutilisation.
L'étude Don't Break the Cache rapporte des réductions de coûts de 41 à 80 % dans les configurations évaluées. Ces résultats ne constituent pas une remise garantie pour chaque application.
Les durées de conservation, les minimums de taille et les tarifs varient. Certaines API activent le cache automatiquement ; d'autres demandent une configuration. Les compteurs d'usage permettent de vérifier ce qui a réellement été réutilisé.
Dans un cache fondé sur un préfixe identique, une modification placée tôt peut empêcher la réutilisation de la suite. Évitez donc de mélanger inutilement les instructions stables avec une date ou un identifiant qui change à chaque appel.
Les descriptions d'outils peuvent aussi faire partie de ce préfixe. Les modifier ou les réordonner peut réduire la réutilisation, selon le fournisseur et le mécanisme utilisé. La documentation du cache précise ces conditions.
Un contenu mis en cache occupe toujours une place dans le contexte présenté au modèle. Une facture plus faible ne prouve donc pas que les informations sont mieux sélectionnées.
Gardez le modèle et les outils identiques, puis testez une consigne minimale et une consigne plus explicite. Relevez la réussite finale, le nombre d'appels, les jetons d'entrée et de sortie, la part réutilisée et le coût des outils.
Ajoutez le temps nécessaire pour corriger un résultat incomplet. Une session moins chère qui demande beaucoup de reprises humaines peut être moins intéressante au total.
Le bon prompt donne assez d'informations pour avancer correctement, tout en laissant les détails occasionnels accessibles. L'article sur la sélection des outils applique ce même raisonnement au catalogue de capacités.
Explorer
Choisis dans l’index d’après les étiquettes de cet article — les plus proches d’abord, hors de sa série. Rien n’est écrit à la main : un article publié demain avec les mêmes étiquettes y prendra place.
Un modèle de langage aide à interpréter une demande floue. Pour des règles explicites, comparez-le à du code simple et mesurez le coût de ses erreurs.
Un agent doit agir dans un périmètre explicite, avec des droits limités à sa mission. Les consignes du prompt ne remplacent pas les contrôles des services.
Un agent combine des appels d’API dans un script au lieu de multiplier les échanges avec le modèle. Bénéfices, limites et place de MCP dans cette approche.
Laisser un commentaire
Votre commentaire sera relu avant d'être publié.