← L'édition
IANouveau2 min de lecture

Google DeepMind teste des évaluations en double aveugle contre la contamination des benchmarks

Pour garantir que les performances affichées par les modèles d'IA soient réelles et non biaisées, Google DeepMind introduit un système d'évaluation en double aveugle. Grâce à un environnement cryptographique étanche, le modèle est évalué sans qu'aucune partie n'accède aux données sensibles de l'autre.

Fil « Évaluations en double aveugle par DeepMind contre la contamination des benchmarks »

On voit régulièrement passer des scores impressionnants lors du lancement d'un nouveau modèle d'IA. Pourtant, l'écosystème fait face à une crise de confiance liée à la contamination des benchmarks (le fait qu'un modèle ait déjà absorbé les questions d'un test d'évaluation pendant son entraînement). Lorsqu'un modèle a déjà « vu » les épreuves, ses résultats sont artificiellement gonflés et ne reflètent plus sa réelle capacité à résoudre des problèmes inédits.

Pour répondre à ce défi, Google DeepMind a annoncé le 27 août 2026 un projet pilote menant la première évaluation en double aveugle sur un modèle propriétaire. Cette initiative réunit plusieurs acteurs de l'écosystème :

  • Modèle évalué : Gemini Flash Lite.
  • Partenaires d'évaluation : Singapore AI Safety Institute, OpenMined, AVERI et MLCommons.
  • Infrastructure : Confidential Space (solution de calcul sécurisé sur Google Cloud).

Un environnement cryptographique sans compromis

Jusqu'à présent, évaluer un modèle par un tiers exigeait un compromis technique. Soit l'évaluateur transmettait ses questions de test (au risque que le fournisseur du modèle ne les voie et ne s'en serve pour entraîner ses futures versions), soit le fournisseur donnait accès aux poids du modèle (les paramètres internes issus de l'entraînement), prenant le risque de divulguer sa propriété intellectuelle.

La méthode retenue isole les tests dans une « boîte » cryptographique. Grâce au Confidential Computing (l'isolation matérielle des données pendant leur traitement), l'évaluateur ne peut pas extraire la structure du modèle, et Google ne peut pas lire les invites de test soumises.

{
  "evaluation_run": "double_blind_pilot",
  "model": "gemini-flash-lite",
  "environment": "confidential-space-gcp",
  "privacy_protections": {
    "weights_exposed_to_evaluator": false,
    "prompts_exposed_to_provider": false
  }
}

Quel impact pour la pratique du développement ?

Pour une équipe de développement, cette avancée est essentielle. Nous nous basons en permanence sur ces comparatifs pour sélectionner des assistants de code ou orchestrer des agents autonomes. Si les métriques sont faussées par de la mémorisation passée, le comportement de l'assistant sur notre propre code risque d'être bien inférieur aux promesses.

Policymakers, researchers, and enterprises need to trust that AI benchmarks accurately reflect a model's true capabilities and safety.

En empêchant la fuite des données de test avant l'examen, ce protocole promet de restaurer la fiabilité des classements. À terme, cela permettra aux développeurs de choisir leurs outils sur la base de performances mesurées de manière transparente et impartiale.