← L'édition
IANouveau3 min de lecture

Des agents IA utilisés pour automatiser des cyberattaques : Anthropic alerte sur de nouveaux usages malveillants

Dans son rapport de renseignements sur les menaces publié début septembre 2026, Anthropic révèle que l'usage détourné de ses modèles évolue. Des attaquants utilisent désormais des agents autonomes pour piloter des phases entières de cyberattaques, ce qui transforme ces assistants de code et d'automatisation en véritables sujets de sécurité opérationnelle.

Fil « Rapport d'Anthropic sur l'utilisation d'agents IA autonomes dans les cyberattaques »

Illustration de l'article — anthropic.com
Image : anthropic.com

Le rapport d'Anthropic couvre la période de décembre 2025 à août 2026. Les équipes de sécurité de l'entreprise y détaillent la neutralisation de plusieurs opérations malveillantes. Le constat principal montre un changement de méthode : l'IA n'est plus seulement sollicitée sous forme d’un assistant textuel pour répondre à des questions ponctuelles. Elle est intégrée dans des workflows (enchaînements automatisés de tâches) où des agents IA prennent en charge des phases complètes d'attaques informatiques.

Ces agents orchestrent des tâches de reconnaissance (analyse automatisée des vulnérabilités d'une cible), d'exploitation et d'exfiltration de données, tout en conservant une validation par un humain dans la boucle (supervision par un opérateur humain aux étapes critiques). Pour les développeurs, ce changement implique d'aborder les agents non plus seulement comme des leviers de productivité, mais aussi comme des vecteurs de risque informatique.

Sept domaines de menaces identifiés

Le rapport répertorie des dérives réparties sur sept domaines de préjudices :

  • Les opérations cyber ;
  • La désinformation et les opérations d'influence ;
  • La surveillance ciblée ;
  • Les escroqueries et fraudes ;
  • Le détournement biologique ;
  • Le développement d'armes conventionnelles ;
  • La distillation illicite (technique consistant à utiliser les réponses d'un modèle avancé pour entraîner un autre modèle d'IA sans autorisation).

Les activités neutralisées impliquaient les modèles Claude Haiku, Claude Sonnet et Claude Opus. À l'exception d'un cas unique de distillation illicite, aucun détournement n'a impliqué les modèles de classe Claude Fable ou Claude Mythos.

Des profils d'attaquants variés

Les cyberattaquants identifiés regroupent des acteurs soutenus par des États, des criminels motivés par l'argent, des vendeurs de logiciels espions commercialisés, des organes de propagande d'État et des individus aux motivations politiques.

Parmi les cas concrets interrompus par Anthropic figurent un réseau de fausses applications de rencontres créées pour escroquer des utilisateurs, ainsi que des systèmes de surveillance automatisés conçus pour repérer et tracer des dissidents.

Sécuriser l'usage des agents au quotidien

Face à ces dérives, la sécurité des agents (systèmes capables d'exécuter des actions de manière autonome via des outils informatiques) devient une priorité pour les équipes qui les intègrent dans leurs environnements de développement ou d'intégration continue.

Pour limiter les risques, l'accès des agents aux ressources critiques doit être restreint par des règles de configuration strictes, comme l'exige l'encadrement des permissions d'exécution :

{
  "agent_id": "assistant-dev",
  "allowed_tools": ["read_repository", "run_unit_tests"],
  "disallowed_tools": ["execute_shell", "network_exfiltration"],
  "require_human_validation": true
}

"À mesure que les modèles deviennent plus capables, leurs risques augmentent, à moins que les développeurs d'IA et les défenseurs de la société n'agissent pour les rendre plus sûrs."

En publiant ces données, Anthropic appelle la communauté des développeurs et les acteurs de la cybersécurité à adapter leurs défenses opérationnelles et à mieux encadrer le niveau d'autonomie accordé aux agents de code au sein de leurs infrastructures.