Les robots de collecte d'IA saturent les serveurs de git.kernel.org
L'infrastructure officielle du noyau Linux subit une pression massive due aux robots de collecte automatisée de données. La génération de pages pour ces outils consomme désormais plus de puissance processeur que l'ensemble des requêtes légitimes des développeurs.
Fil « Surcharge des serveurs Git par les scrapers d'IA »
Une consommation processeur disproportionnée
L'infrastructure du dépôt officiel du noyau Linux, git.kernel.org, fait face à une augmentation critique du trafic généré par des scrapers (outils automatisés de collecte de données sur le web). Selon Konstantin Ryabitsev, responsable de cette infrastructure, la charge calculatoire demandée par ces robots dépasse aujourd'hui tous les usages habituels cumulés.
Sur l'ensemble des 5 nœuds (serveurs hébergés à différents endroits du globe) de la plateforme, 14 cœurs CPU (unités de traitement des processeurs) fonctionnent en continu uniquement pour convertir et afficher des commits (historiques de modifications de code) au format HTML (langage d'affichage des pages web) destinés à ces collecteurs. Cette tâche consomme désormais plus de cycles processeur que toutes les autres formes d'accès légitimes réunies, y compris les git clones (opérations de téléchargement intégral d'un dépôt de code) réalisés par les équipes de développement.
« Nous dépensons plus de cycles CPU à afficher des commits pour les scrapers que pour toutes les autres formes d'accès légitimes réunies, y compris les clones git. » — Konstantin Ryabitsev
Des inquiétudes partagées pour l'écosystème web
Ce phénomène de surconsommation de ressources inquiète largement le monde du logiciel libre et des outils web. Simon Willison souligne ainsi ses craintes pour le projet Datasette (un outil servant à exposer et explorer des bases de données sur le web), qui génère lui aussi un nombre très élevé de pages web indexables et vulnérables à cette exploration intensive.
Pour les équipes de développement, ce constat met en lumière la nécessité de surveiller l'impact du trafic robotique sur leurs propres infrastructures. Sans restriction, la collecte automatisée peut restreindre la capacité de calcul disponible pour les véritables utilisateurs.
# Exemple de directive Nginx pour limiter le débit des robots d'exploration
limit_req_zone $binary_remote_addr zone=crawler_limit:10m rate=1r/s;