← L'édition
IASuite1 min de lecture

Claude Code : le mode Auto piégé et incapable de corriger l'attaque

Une attaque par injection de prompt permet de contourner le mode Auto de Claude Code dans 80 % des cas. Plus surprenant encore, quand l'agent détecte le programme malveillant, le mécanisme de sécurité du mode Auto bloque sa propre commande de nettoyage.

Fil « Claude Code passe en mode Auto par défaut » · ← Relire l'épisode du 15 août

Alors qu'Anthropic a fait du mode Auto le réglage par défaut de Claude Code pour protéger les développeurs contre les injections de prompts (tentatives de manipulation d'une IA via des instructions malveillantes masquées), le chercheur Johann Rehberger vient de prouver ses limites. Son attaque fonctionne dans 80 % des cas : elle trompe l'agent de code pour qu'il télécharge et décompresse un fichier ZIP, puis exécute un script qui importe la bibliothèque standard base64. En coulisses, cette action importe et exécute à son insu un fichier piégé struct.py extrait de l'archive.

Le fait le plus marquant réside dans la réaction du système d'aide à la sécurité. Dans plusieurs essais, Claude Code a repéré la présence du logiciel malveillant et a tenté d'interrompre le processus, mais le classifieur (l'algorithme chargé de valider ou bloquer les commandes de l'agent) du mode Auto a lui-même refusé d'exécuter la commande de nettoyage. La sécurité est devenue l'obstacle à la résolution de l'incident.

Run unattended coding agents in a container, VM or OS sandbox. Restrict network egress. Monitor your agents. Do not expose home directories, SSH keys, cloud credentials…

Face à ces défaillances, la recommandation reste stricte pour les équipes de développement : tout agent autonome doit tourner dans un bac à sable (environnement isolé comme un conteneur ou une machine virtuelle), sans accès aux clés SSH (clés d'authentification à distance), aux identifiants cloud ni au réseau sortant non restreint.