Claude Opus 5 : ce que révèle vraiment la publication d’un extrait de son prompt système
Un billet de Simon Willison met en lumière un extrait du prompt système de Claude Opus 5, c’est-à-dire les consignes invisibles injectées par Anthropic au début d’une conversation. Au-delà de la curiosité, cela montre comment l’éditeur encode des faits récents, impose des comportements de réponse et sépare clairement l’interface Claude de l’API.
Fil « Claude Opus 5 : extrait de system prompt »
Le point de départ est simple : Simon Willison a publié, le 9 août 2026, un court extrait du prompt système de Claude Opus 5. On y voit Anthropic ajouter noir sur blanc un rappel factuel sur la chronologie de Claude Fable 5 et Claude Mythos 5 : sortie le 9 juin 2026, suspension d’accès le 12 juin pour se conformer à une directive américaine de contrôle des exportations, levée de ces contrôles le 30 juin, puis rétablissement de l’accès le 1er juillet 2026. Le texte précise aussi que ces événements sont postérieurs à la date de fin des données d’entraînement du modèle, donc connus du modèle uniquement parce qu’ils ont été injectés dans ce prompt système. (simonwillison.net)
Ce que ce prompt dit concrètement sur le fonctionnement du produit
Ce passage rappelle une réalité utile pour les développeurs : dans claude.ai et les apps mobiles, Anthropic envoie au modèle un prompt système (instruction interne prioritaire, non écrite par l’utilisateur) qui fournit des informations à jour comme la date et des règles de comportement. La documentation d’Anthropic dit explicitement que ces mises à jour de prompt ne s’appliquent pas à l’API Claude. Elle indique aussi qu’à partir de la génération Claude 4.6, chaque identifiant de modèle correspond à un instantané figé (une version fixe du modèle), ce qui rend d’autant plus visible le rôle du prompt système pour injecter du contexte récent sans réentraîner le modèle. La page officielle liste par ailleurs Claude Opus 5 avec une entrée datée du 24 juillet 2026. (platform.claude.com)
Pourquoi c’est important pour les outils IA de développement
Pour une équipe qui utilise des assistants de code ou des agents, la leçon est pratique : ce que « sait » le modèle dépend non seulement de ses poids (les paramètres appris pendant l’entraînement), mais aussi de l’enveloppe produit autour. Ici, Anthropic encode une politique précise : si on l’interroge sur l’épisode des contrôles à l’export, Claude doit répondre de façon factuelle, sans nier l’incident, et renvoyer vers la déclaration officielle pour plus de détails. Cela illustre que le comportement d’un assistant en production vient d’un empilement de couches : modèle, prompt système, classifieurs de sécurité (filtres automatiques), et parfois recherche web. Anthropic explique justement que, lors du rétablissement de Fable 5, il a ajouté un nouveau classifieur de sécurité bloquant la technique signalée dans plus de 99 % des cas, avec un coût assumé : davantage de faux positifs (requêtes bénignes bloquées par erreur) pendant des tâches de code et de débogage. (simonwillison.net)
Ce qui a changé après la suspension de Fable et Mythos
La chronologie officielle est importante car elle éclaire le contenu même du prompt cité. Anthropic a annoncé le 12 juin 2026 que le gouvernement américain exigeait la suspension de Fable 5 et Mythos 5 pour tous les clients, faute de pouvoir vérifier en temps réel la nationalité des utilisateurs visés par la directive. Puis, dans son billet du 30 juin mis à jour le 1er juillet, Anthropic indique que l’accès à Fable 5 est redevenu disponible globalement sur Claude Platform, Claude.ai, Claude Code et Claude Cowork, tandis que Mythos 5 a été rouvert à un ensemble d’organisations américaines approuvées. Le même billet explique aussi que Fable 5 et Mythos 5 partagent le même modèle de base, Fable étant la variante avec garde-fous renforcés pour l’usage général. (anthropic.com)
Ce que vous pouvez en tirer dans vos propres agents
La conséquence la plus utile, côté ingénierie, est de ne pas traiter un modèle comme une boîte noire unique. Si vous construisez un agent interne, séparez explicitement :
- les faits dynamiques (date, incidents récents, état d’un service),
- les règles de comportement (quand répondre, quand refuser, quand citer une source),
- les outils externes (recherche web, base documentaire, dépôt Git),
- et les filtres de sécurité qui peuvent dégrader certaines tâches légitimes.
Un squelette minimal ressemble à ceci :
{
"system": [
"Tu es l'assistant de l'équipe plateforme.",
"Si un fait est postérieur aux données d'entraînement, vérifie-le via un outil.",
"Si une demande touche à la sécurité offensive, refuse et propose une alternative défensive."
],
"context": {
"date": "2026-08-10",
"incident_notes": [
"Fable 5 et Mythos 5 suspendus le 2026-06-12",
"accès rétabli à partir du 2026-07-01"
]
},
"tools": ["web_search", "docs_search", "repo_search"]
}
La publication relayée par Simon Willison n’apprend donc pas seulement « ce que Claude a dans sa tête ». Elle montre surtout comment un fournisseur d’IA produit un comportement exploitable en combinant instructions système, mise à jour manuelle des faits récents et couches de sécurité. Pour un développeur, c’est le rappel le plus utile du moment : quand un assistant paraît cohérent, il faut se demander quelle part vient du modèle lui-même, et quelle part vient de l’orchestration autour. (simonwillison.net)