← L'édition
IANouveau3 min de lecture

Pourquoi vos agents IA échouent en réexécutant la même tâche

Un agent IA capable de résoudre une demande complexe peut échouer dès la tentative suivante sans que la consigne n'ait changé. IBM Research et Hugging Face dévoilent le Consistency Analyzer au sein du projet ALTK-Evolve, un outil capable de diviser par deux cet écart d'instabilité sans dégrader les performances.

Fil « Mesure de la consistance et de la récurrence des résultats des agents IA »

Illustration de l'article — huggingface.co
Image : huggingface.co

Lorsqu'un développeur évalue un agent basé sur un grand modèle de langage, il se fie habituellement à la précision moyenne, mesurée par la métrique Mean@k (taux de réussite moyen mesuré sur k exécutions). Mais ce chiffre dissimule une instabilité problématique pour une mise en production : un agent ReAct (Reasoning and Acting, une architecture combinant réflexion et prise d'action) basé sur GPT-4.1 affiche 77,4 % de succès moyen sur le benchmark d'applications AppWorld, mais ne réussit la totalité des 5 essais consécutifs que dans 53,0 % des cas. Cet écart de 24,4 points, appelé écart de consistance, montre que près d'un quart des tâches réussies relèvent parfois du simple coup de chance.

L'origine physique de l'incertitude

Cette volatilité ne provient pas d'un manque de capacités, mais de la forme des distributions de probabilités générées par le modèle lors de chaque décision. Lorsque plusieurs choix de code ou d'arguments d'API ont des probabilités quasi égales, la décision devient instable. Même avec une température réglée à 0.0 (le paramètre d'inférence censé rendre les réponses déterministes), des variations minimes d'infrastructure — comme le regroupement des requêtes en lots (request batching) ou la non-associativité des calculs en virgule flottante sur GPU — suffisent à faire basculer le résultat.

« Un agent peut être capable et inconstant à la fois. Ce n'est pas un problème de capacité que l'on résout en passant simplement à un modèle plus grand. »

Diagnostiquer sans rejouer toute la séquence

Pour cibler ces moments d'hésitation, les chercheurs ont mis au point le Consistency Analyzer, intégré à la bibliothèque ALTK-Evolve (Agent Learning Toolkit). À partir d'une seule trace d'exécution enregistrée, l'outil rejoue chaque étape de décision en demandant 5 générations simultanées (resampling) sans réexécuter les actions dans l'environnement ni nécessiter de réponse de référence. Les points de décision instables sont automatiquement traduits en consignes (guidelines) textuelles injectées dans le contexte du modèle lors des exécutions futures.

[
  {
    "guideline": "Lors du comptage de cases à cocher dans une note, utiliser un filtre par expression régulière ancré sur la ligne plutôt qu'un simple décompte de sous-chaîne de caractères."
  }
]

Des résultats probants en production

L'application de ces règles permet de diviser l'écart d'instabilité par deux sur le jeu de données AppWorld. Le taux de succès systématique sur 5 essais (Pass^k) grimpe de 53,0 % à 69,0 %, tandis que la précision moyenne (Mean@k) augmente légèrement pour atteindre 81,0 %. Les bénéfices se transfèrent également sur des tâches similaires non vues précédemment, avec un gain de +13,0 points de consistance, et se vérifient sur d'autres modèles comme gpt-oss-120b.

Ce que cela change pour vos équipes

Pour les équipes de développement qui déploient des assistants et des agents autonomes, cette étude apporte plusieurs principes d'ingénierie :

  • Mesurer systématiquement le score Pass^k (réussite à 100 % des essais) en plus de la moyenne Mean@k pour repérer la volatilité réelle de vos agents.
  • Ne pas chercher à remplacer immédiatement le modèle par un plus volumineux, car la consistance est une dimension indépendante de la puissance brute.
  • Analyser les traces d'exécution hors ligne à l'aide d'outils comme ALTK-Evolve pour repérer les décisions à risque et enrichir le contexte dynamiquement.