Le tool calling programmatique s'officialise avec GPT-5.6
OpenAI met à jour la documentation de ses modèles et introduit l'exécution de code JavaScript hébergé pour orchestrer les outils de manière autonome. Cette approche réduit le volume de données échangées et rationalise le fonctionnement des agents de développement.
Fil « OpenAI formalise le tool calling programmatique en JavaScript »

OpenAI officialise la prise en charge du programmatic tool calling (appel d'outil programmatique) avec la famille de modèles GPT-5.6 (gpt-5.6-sol, gpt-5.6-terra et gpt-5.6-luna). Désormais, le modèle peut générer du code JavaScript exécuté dans un runtime hébergé (environnement d'exécution du code) pour enchaîner lui-même plusieurs appels d'outils et traiter leurs résultats intermédiaires. Cette méthode vise les flux de travail délimités et très orientés outils qui ne nécessitent pas une nouvelle décision du modèle à chaque étape.
Concrètement, cette orchestration déléguée au code réduit la quantité de données échangées dans la fenêtre de contexte et limite la latence. Le dispositif est compatible avec la politique ZDR (Zero Data Retention, ou rétention zéro des données) sans surcoût de conteneur d'exécution. Pour l'activer, il faut fournir l'outil programmatic_tool_calling et autoriser les fonctions cibles via le champ allowed_callers dans l'API Responses (l'interface de programmation d'OpenAI pour la gestion des interactions complexes).
Configuration API et gestion des fonctionnalités
{
"model": "gpt-5.6-sol",
"tools": [
{ "type": "programmatic_tool_calling" },
{
"type": "function",
"name": "get_logs",
"allowed_callers": ["programmatic_tool_calling"]
}
],
"reasoning": {
"effort": "medium",
"context": "all_turns"
}
}
En parallèle, la documentation introduit un mode multi-agent en version bêta, qui permet à une instance de GPT-5.6 d'orchestrer plusieurs sous-agents en parallèle. Côté tarification et optimisation, la gestion du prompt caching (mise en mémoire tampon des instructions répétitives) évolue : la mise en cache initiale est désormais facturée 1,25× le prix de l'entrée standard non cachée, tandis que la lecture reste à tarif réduit.
Pour tirer le meilleur parti de ces modèles, OpenAI conseille de réduire fortement la taille des prompts (instructions textuelles fournies à l'IA). Lors d'évaluations internes sur des agents de code, l'allègement des consignes a permis d'améliorer la qualité des réponses de 10 à 15 %, tout en réduisant le nombre total de tokens (unités de texte traitées par le modèle) de 41 à 66 % et les coûts globaux de 33 à 67 %.
Enfin, GPT-5.6 intègre des garde-fous en temps réel pour prévenir les utilisations malveillantes en matière cyber et biologique, ce qui peut parfois interrompre temporairement la génération. Pour faciliter le passage depuis GPT-5.5 ou GPT-5.4, OpenAI fournit une commande Codex dédiée : $openai-docs migrate this project to the GPT-5.6 model family.