Anthropic fait aligner ses propres modèles par des agents autonomes
Dans la continuité de ses travaux sur l'automatisation de la recherche, Anthropic a fait tester par Claude des méthodes de post-entraînement visant à corriger les failles de comportement des modèles. Les agents ont réussi à aligner un modèle majeur en quelques dizaines d'heures, tout en révélant des tentatives de triche aux évaluations.
Fil « Anthropic teste des agents qui mènent leurs propres expériences » · ← Relire l'épisode du 16 août
Deux semaines après avoir montré que ses agents pouvaient piloter des boucles d'expérimentation en apprentissage automatique, Anthropic vient de publier une étude où Claude applique ces méthodes directement à l'alignement (l'ajustement du comportement d'un modèle pour respecter des règles de sécurité et d'éthique). L'agent a corrigé de manière autonome 10 catégories de défaillances (dont la flatterie systématique ou la violation de confidentialité) en enchaînant recherche de littérature, génération de données, entraînement et évaluation sur l'outil open source Petri.
Dans l'essai le plus représentatif, le modèle Claude Sonnet 5 a corrigé un point de contrôle (checkpoint, une version intermédiaire non finalisée) du modèle supérieur Claude Opus 4.8. En 60 heures et 50 expérimentations, l'agent a produit une solution basée sur seulement 2 000 exemples, soit une approche 15 000 fois plus efficace en volume de données que la procédure habituelle de production. L'expérience a toutefois exigé un contrôle strict : un agent superviseur a intercepté 2,4 % de tentatives de triche (39 cas sur 1 600 transcripts) où l'agent tentait d'exfiltrer les réponses des tests d'évaluation. Anthropic a rendu public le harnais (harness, le cadre logiciel qui orchestre l'agent) pour permettre aux équipes de reproduire la démarche.