Modèles d’IA
OpenAI publie un guide GPT-5.6 alors que l’économie des agents bascule vers des mélanges de modèles moins coûteux
OpenAI affirme que GPT-5.6 permet de combiner sélection de modèles, raisonnement conservé, orchestration multi-agent et appels programmatiques d’outils pour réduire le coût des agents en production.
OpenAI a publié un guide destiné aux développeurs autour de GPT-5.6. Le document du 13 août présente la nouvelle famille de modèles non comme une simple mise à niveau phare, mais comme un ensemble de choix d’ingénierie pour les agents en production. Il s’agit de mélanger les modèles, d’ajuster l’effort de raisonnement, de conserver le travail utile entre les tours et de sortir du contexte du modèle les traitements déterministes.
Selon le guide, GPT-5.6 poursuit la trajectoire engagée avec GPT-5: gérer des tâches plus longues avec moins de tokens et moins de changements dans les harness existants. OpenAI cite Agents’ Last Exam, où GPT-5.6 Sol en low reasoning a dépassé GPT-5.5 en high reasoning avec le même harness. Le message opérationnel est clair: toutes les tâches importantes n’ont pas forcément besoin du réglage le plus coûteux.
La sélection de modèles est la partie la plus concrète. OpenAI indique que GPT-5.6 Luna conserve 98% de la précision d’extraction de GPT-5.5 dans le flux documentaire de Hypha, pour un dix-huitième du coût. Browser Use a indiqué que Luna avait accompli 78% de 106 tâches de navigation difficiles pour environ 14 dollars, contre 80% pour environ 235 dollars avec un modèle de pointe.
OpenAI associe cette économie à de nouvelles primitives de Responses API. Le raisonnement conservé et la compaction native aident le modèle à garder le travail utile sur des tâches longues sans reconstruire le contexte. L’orchestration multi-agent native permet à un agent principal de coordonner des sous-agents parallèles. Les appels programmatiques d’outils laissent GPT-5.6 écrire du JavaScript pour traiter les résultats hors de la fenêtre de contexte.
L’exemple ARC-AGI-3 illustre l’enjeu. OpenAI affirme que GPT-5.6 Sol a obtenu 13,3% avec un harness standard, puis 38,3% avec raisonnement conservé et compaction, tout en utilisant environ six fois moins de tokens de sortie. Le résultat ne se généralisera pas automatiquement, mais il montre qu’une meilleure architecture d’agent peut parfois apporter plus qu’une dépense d’inférence plus élevée.
Le cache des prompts reçoit aussi une amélioration pratique. OpenAI dit que le TTL minimal de cache de toute la famille de modèles passe à 30 minutes et que les points de cache peuvent être définis de façon déterministe dans la fenêtre de contexte. Ploy rapporte qu’un prompt partagé de 29.000 tokens avec points de cache et clés par espace de travail a réduit de 28% l’entrée non mise en cache.
L’annonce montre que le développement d’agents devient une discipline de systèmes. Recherche juridique, automatisation web, analyse financière et workflows de code exigent de choisir où utiliser le raisonnement frontière, où employer de petits modèles et quand paralléliser. Les équipes capables de mesurer qualité, coût et fiabilité seront les mieux placées pour transformer ces options en gains réels.