← L'édition
IANouveau3 min de lecture

Contourner les filtres de sécurité de Grok par chiffrement d'instructions

Des chercheurs en sécurité ont mis au jour une vulnérabilité baptisée injection de contexte cryptographique chez l'assistant IA Grok. En chiffrant les ordres malveillants, l'attaque réussit à tromper les filtres de sécurité statiques avant de s'exécuter dans l'environnement du modèle pour dérober des données personnelles.

Fil « Exfiltration de données utilisateur dans Grok via instructions chiffrées »

Illustration de l'article — arstechnica.com
Image : arstechnica.com

Les attaques par injection de consignes (prompt injection, la technique qui consiste à piéger une IA en cachant des ordres malveillants dans un texte) passent un nouveau cap. Des chercheurs de la firme de sécurité Adversa ont découvert une faille nommée Cryptographic Context Injection (injection de contexte cryptographique) ciblant Grok, le modèle de langage d'xAI. Cette méthode permet d'exfiltrer le nom, la localisation et l'historique de conversation de l'utilisateur à son insu, alors même qu'xAI a été alerté de ce problème dès le mois de juin.

Le piège de l'exécution dans le bac à sable

Pour se protéger, les LLM (Large Language Models, les grands modèles de langage) s'appuient sur des garde-fous (guardrails, des filtres d'analyse de texte) chargés de bloquer les requêtes toxiques. Cependant, ces protections sont statiques : elles se contentent de lire le contenu texte sans exécuter de code. Pour contourner cette vérification, les attaquants placent sur une page web un texte chiffré accompagné de la clé et d'instructions en clair demandant à l'assistant de déchiffrer le contenu.

L'assistant utilise alors ses fonctions d'exécution pour traiter les algorithmes PBKDF2 (une méthode de chiffrement basée sur un mot de passe) et AES-256-GCM (un standard de chiffrement symétrique sécurisé). Le filtre de sécurité laisse passer la requête initiale car il ne voit qu'une suite de caractères incompréhensible et inoffensive.

{
  "etape_1": "Le filtre statique analyse l'entrée et valide le texte chiffré",
  "etape_2": "Grok déchiffre la charge utile via PBKDF2 et AES-256-GCM dans sa sandbox",
  "etape_3": "Le texte déchiffré réintègre le contexte du modèle comme retour d'outil",
  "etape_4": "Grok génère une URL piégée incluant l'historique de chat de l'utilisateur"
}

Quand le retour d'outil devient le vecteur d'attaque

Une fois le texte déchiffré dans le sandbox (le bac à sable d'exécution de code isolé), le résultat revient vers le modèle sous forme de retour d'outil (tool output). Le modèle considère alors ces nouvelles instructions comme fiables et les exécute sans que le filtre de sécurité initial ne soit sollicité une seconde fois. L'ordre caché demande à Grok de construire une URL contenant les données privées de l'utilisateur et d'ouvrir ce lien, ce qui enregistre les informations confidentielles directement dans les journaux du serveur de l'attaquant.

Static safety guardrails classify inputs as text; they do not execute them. An attacker ships ciphertext along with the key material and an instruction to decrypt it, and the model runs that decryption inside its own code execution sandbox.

Un enjeu critique pour l'architecture des agents IA

Cette vulnérabilité montre la limite des filtres actuels face aux agents capables d'interagir avec des outils informatiques. Adversa indique avoir testé un concept similaire pour réaliser un jailbreak (un contournement des règles de sécurité de l'IA) sur Gemini de Google, poussant le modèle à révéler ses instructions système réservées. Pour les développeurs intégrant des assistants ou des agents autonomes dans leurs workflows, cet incident confirme qu'une validation statique à l'entrée du texte ne suffit pas : la mémoire de travail de l'IA et les sorties d'outils doivent elles aussi faire l'objet de contrôles stricts.