Quelle quantité de mémoire donner à un agent IA
Injecter l'expérience passée d'un agent IA dans son contexte améliore ses performances, mais donner trop de directives peut surcharger les modèles les moins puissants. Une étude d'IBM Research publiée le 18 août 2026 montre que la mémoire d'un agent doit être dosée selon les capacités du modèle. Grâce à une sélection ciblée de règles, certains modèles gagnent en précision tout en ne consommant que 5 % de jetons supplémentaires.
Fil « Dimensionnement de la mémoire des agents IA »

L'équipe d'IBM Research a publié le 18 août 2026 une étude évaluant le comportement de huit modèles de langage lorsqu'on leur fournit une mémoire agentique. Cette mémoire prend la forme d'un ensemble de directives comportementales tirées de leurs propres exécutions passées, sans modifier les poids du modèle ni nécessiter d'annotation humaine. En testant ces systèmes sur le benchmark AppWorld (un environnement de 585 tâches réparties sur 9 applications simulées comme la gestion de paiements ou de calendriers), les chercheurs ont constaté que la mémoire n'est pas une simple option binaire à activer, mais un dosage à ajuster.
Trois profils de modèles face à la mémoire
L'étude révèle que l'efficacité de la mémoire dépend directement du profil du modèle :
- Les modèles puissants disposant d'une marge de progression (comme DeepSeek-V3.2, un modèle MoE ou Mixture of Experts, une architecture découpée en sous-réseaux spécialisés de 671B de paramètres) tirent profit de l'intégralité des directives. DeepSeek-V3.2 enregistre ainsi une hausse de +9,5 points de pourcentage sur le taux d'accomplissement de tâches (TGC, pour Task Goal Completion) et +16,1 points sur la réussite complète de scénarios (SGC, ou Scenario Goal Completion, la mesure de fiabilité la plus stricte qui exige de réussir toutes les variantes d'un scénario).
- Les modèles plus modestes (tel que gpt-oss-120b, un MoE de 117B) sont submergés par un pavé de directives complet. Ils obtiennent leurs meilleurs résultats avec une récupération ciblée (curated retrieval), combinant un cœur fixe de directives à forte confiance et quelques règles extraites spécifiquement pour la tâche. Le modèle gpt-oss-120b gagne alors +16,1 points en TGC et en SGC.
- Les modèles saturés (comme GLM-5, un MoE de 745B) n'affichent aucun gain mesurable (0,0 point), plafonnant déjà à leur niveau maximal sur ces tâches.
Coût en jetons et optimisation en production
L'un des enseignements majeurs pour les équipes de développement concerne le coût d'inférence (la phase d'exécution du modèle). Injecter l'ensemble des directives à chaque étape de la boucle ReAct (un schéma de fonctionnement où l'agent alterne entre réflexion et action) fait gonfler le nombre de jetons d'entrée (tokens). Pour DeepSeek-V3.2, l'ensemble complet fait passer la consommation moyenne de 148K à 263K jetons par tâche, soit +78 % de surcoût.
À l'inverse, l'approche par récupération ciblée sur gpt-oss-120b ne génère que +5 % de jetons supplémentaires (116K contre 110K à l'état initial), tout en offrant le gain de précision le plus élevé. Pour rendre ces mémoires abordables en production, les chercheurs recommandent d'exploiter le prompt caching (la mise en cache des parties fixes des instructions système). En conservant une structure de directives stable, le surcoût financier lié à la réinjection des règles devient négligeable.
Voici un exemple schématique de configuration d'un agent utilisant le framework ALTK-Evolve d'IBM pour charger cette mémoire :
{
"agent_id": "payment-agent",
"memory_strategy": "curated_retrieval",
"fixed_core_guidelines": [
"Valider l'ID utilisateur avant toute transaction",
"Gérer le délai d'expiration des jetons d'API"
],
"retrieved_guidelines_limit": 3
}
En résumé, accumuler de l'expérience ne sert à rien si l'agent ne peut pas la traiter efficacement. Ajuster la quantité de directives injectées selon la taille et la maturité du modèle utilisé permet d'optimiser à la fois la fiabilité du code exécuté et la consommation de jetons en production.