Le 22 septembre 2026, OpenAI a annoncé deux nouveaux modèles — GPT-6 Sol et GPT-6 Luna — et, dans la foulée, une refonte de son prompt caching. Le message est inhabituel pour un labo frontier : cette fois, la nouveauté n’est pas la puissance brute, mais le prix.
Trois semaines après GPT-6 Astra, Sol et Luna portent ses avancées (travail professionnel, factualité, code, computer use) sur des modèles plus rapides et moins chers. OpenAI annonce une baisse de 50 % des prix API par rapport aux tarifs promotionnels de la génération GPT-5.6.
Les nouveaux tarifs
Prix par million de tokens, donnés par OpenAI :
| Modèle | Entrée | Sortie |
|---|---|---|
| GPT-5.6 Sol → GPT-6 Sol | 4 $ → 2 $ | 20 $ → 10 $ |
| GPT-5.6 Luna → GPT-6 Luna | 0,20 $ → 0,10 $ | 1,20 $ → 0,50 $ |
Les deux modèles sont disponibles dans ChatGPT Work et Codex (Plus, Pro, Business, Enterprise, Edu) ; les comptes Free et Go ont accès à Luna dans l’app desktop, et le déploiement se fait progressivement. Dans l’API : gpt-6-sol et gpt-6-luna.
Les chiffres avancés par OpenAI
Sur AutomationBench 1.0.6 (workflows métier sur 47 outils, benchmark Zapier), GPT-6 Sol en effort « xhigh » marque 33,2 % pour 0,27 $ par tâche, contre 26,9 % pour Claude Opus 5 au maximum, à 11 fois le coût. Sur Agents’ Last Exam V1, Sol atteint 56,4 %, au-dessus du meilleur score d’Opus 5 pour 60 % de coût en moins. Sur DeepSWE v1.1, il plafonne à 68,8 % contre 69,9 % pour Claude Fable 5 en xhigh, mais à environ 80 % de coût en moins par tâche.
Nuance importante : ces comparaisons visent la génération précédente. Le même jour, Anthropic sortait Claude Opus 5.5, premier modèle de la famille Claude 5.5, présenté au niveau de Fable 5.1 sur la plupart des tâches pour 40 % de coût d’exécution en moins qu’Opus 5 (4 $/20 $ le million de tokens, cache reads à 0,20 $). Les deux labos revendiquent d’ailleurs le leadership sur le même benchmark Zapier, avec des protocoles et des générations de modèles différents.
Le vrai sujet pour les devs : le cache
OpenAI annonce de meilleurs taux de cache par défaut, des remises sur les préfixes partagés réutilisés dans une fenêtre de 30 minutes, et jusqu’à 90 % de réduction sur les tokens d’entrée relus. Concrètement :
- un dashboard de prompt caching pour suivre le taux de hit, et un outil de diagnostic des cache miss qui remonte le motif (ex.
tools_changed) et les tokens concernés ; - des breakpoints explicites pour choisir où se termine le préfixe mis en cache ;
- la possibilité de changer le niveau d’effort de raisonnement en cours de conversation via un
configuration_update, sans casser le cache ; - la conservation du cache quand les outils changent, à condition de garder les définitions stables et d’utiliser
allowed_toolsplutôt que d’en supprimer ; - le prewarming du cache, pour sortir le calcul du temps d’attente utilisateur.
GitHub rapporte que ces optimisations ont réduit de plus de 50 % la part de tokens nécessitant un traitement frais sur des milliards de requêtes vers les modèles OpenAI. Manus dit être passé d’environ 85 % à plus de 90 % de taux de hit en moins d’une semaine.
Ce que ça change pour nous
Pour un agent qui tourne des heures — refactoring, documents, recherche longue — le coût dominant est le contexte rejoué à chaque tour. Diviser les tarifs par deux et améliorer le cache par défaut change l’économie d’un produit : ce qui restait réservé à des tâches ponctuelles devient viable en continu, et le diagnostic transforme une optimisation devinée en métrique mesurable. Côté web : des fonctionnalités IA qui passent du mode « démo » au mode « par défaut ».