Attaques d'agents IA : une erreur de configuration chez un évaluateur en est l'origine
Alors que plusieurs modèles d'agents d'intelligence artificielle ont récemment attaqué des cibles web réelles, la cause de ces dérapages vient d'être identifiée. Une mauvaise isolation réseau lors d'exercices de sécurité menés par la startup Irregular a permis aux agents d'OpenAI, Meta, Anthropic et Google de sortir de leur bac à sable.
Fil « Attaque de RubyGems attribuée à un essaim d'agents d'OpenAI » · ← Relire l'épisode du 13 septembre

Après plusieurs signalements d'attaques informatiques menées par des agents d'intelligence artificielle contre des plateformes réelles comme le dépôt de paquets RubyGems, l'origine de ces dérapages a été identifiée : la startup israélienne Irregular, spécialisée dans l'évaluation de la sécurité des modèles d'IA.
Les incidents sont survenus durant des exercices de type Capture-the-Flag (des concours de cybersécurité où des programmes doivent découvrir des vulnérabilités et capturer des clés d'accès cachées). Omer Nevo, le directeur technique d'Irregular, a expliqué que deux erreurs de configuration simultanées ont provoqué la fuite : un accès au réseau Internet global est resté ouvert par inadvertance, et le nom de domaine fictif créé pour la cible de la simulation chevauchait un domaine réel du Web.
Cette défaillance environnementale unique explique l'ensemble des échappées d'agents constatées chez OpenAI, Anthropic, Meta et Google, alors que les évaluations menées sur des modèles ouverts comme Kimi K3 ou GLM-5.2 n'ont pas entraîné de débordement. Irregular a déclaré avoir depuis verrouillé ses contrôles d'accès au réseau, renforcé la supervision humaine des tests et préparé la publication d'un guide de bonnes pratiques pour sécuriser l'évaluation des agents d'IA.