L'évolution des agents de code et des LLM en 2026 selon Simon Willison
Lors du congrès WeAreDevelopers, Simon Willison a retracé l'évolution des modèles de langage au cours de l'année 2026. De la fiabilisation des assistants de programmation à l'explosion des agents personnels autonomes, le quotidien des équipes de développement a connu des mutations profondes. Synthèse des faits marquants et des nouveaux modes de travail.
Fil « Rétrospective des évolutions des modèles de langage en 2026 par Simon Willison »

La bascule vers des agents de code fiables
À la fin de l'année 2025, les sorties de Claude Opus 4.5 et de GPT-5.1 ont marqué un tournant décisif. Bien qu'il s'agisse d'améliorations incrémentales, l'association de ces LLM (Large Language Models, grands modèles de langage) avec leurs environnements d'agents comme Claude Code ou Codex a permis de franchir un cap critique. Les assistants sont passés d'outils générant fréquemment des erreurs à des systèmes suffisamment fiables pour être intégrés au quotidien des ingénieurs.
L'émergence d'OpenClaw et des agents personnels
Initié sous le nom de dépôt Warelay, le projet est devenu OpenClaw et a dépassé les 100 000 commits (commits, enregistrements de modifications dans un code source). Ce projet a défini la catégorie des Claws (des agents personnels autonomes capables d'écrire et d'exécuter du code localement sur votre machine pour réaliser des tâches). La demande pour cette technologie a été telle que les magasins Apple de la région de San Francisco ont été en rupture de stock de Mac Mini, achetés pour servir d'infrastructures d'accueil dédiées à ces agents.
La « Dark Factory » et le spleen des développeurs
La poussée de l'automatisation a mené l'entreprise StrongDM à formaliser le concept de Dark Factory (l'usine sombre, une méthode de développement totalement automatisée où il n'est plus nécessaire d'éclairer les locaux faute d'intervention humaine directe). L'entreprise a fonctionné selon deux règles strictes :
Le code ne doit pas être écrit par des humains. Le code ne doit pas être revu par des humains.
Cette transition rapide génère également des répercussions psychologiques dans les équipes, résumées sous le terme de Deep Blue (un sentiment de lassitude ou d'ennui chez le développeur lorsque l'IA devient capable de tout coder à sa place).
Du « Tokenmaxxing » au contrôle des budgets
L'année a aussi été marquée par le phénomène de Tokenmaxxing (une incitation massive à consommer des jetons d'IA, les unités de calcul mesurant les requêtes soumises aux modèles). Des entreprises comme Uber ont annoncé 90 % d'utilisation chez leurs ingénieurs, tandis que Meta intégrait l'usage des assistants dans les évaluations de performance. La réalité économique a toutefois tempéré cet engouement : un agent autonome pouvant consommer jusqu'à 1 000 dollars par jour en jetons, les directions informatiques ont rapidement instauré des plafonds de dépense pour encadrer l'usage.