Auteurs : @0xSero et Zhenwei Gao (@zhennydez
Votre abonnement Codex inclut désormais 3 modèles principaux : Sol, Terra et Luna, chacun entraîné et servi indépendamment, avec des curseurs de raisonnement. Ensemble, ils vous permettent de choisir un équilibre entre vitesse, coût et intelligence pour chaque tâche.
Comparaison des prix en un coup d'œil (Tarifs développeur OpenAI du 21 juillet 2026
Côté prix, Terra coûte 2 fois moins cher que Sol, tandis que Luna coûte cinq fois moins cher, que ce soit en contexte court ou long.

Cette tarification suit de près l'intelligence et la vitesse. En pratique, chaque modèle est le mieux adapté à un type de travail différent :
- Sol est le plus intelligent de la bande. Il est idéal pour les tâches de longue durée, les défis techniques complexes et l'assistance personnelle. Cette capacité supplémentaire s'accompagne d'une latence et d'un coût plus élevés, mais Sol excelle dans la coordination de sous-agents et la gestion de grands projets sur des workflows étendus.
- Terra se situe confortablement au milieu, offrant la majeure partie de l'intelligence à la moitié du prix de Sol. Il est aussi modérément plus rapide. Associé à Sol, Terra peut être un sous-agent performant : Sol peut peser les options et définir la direction, puis confier l'exécution au Terra, plus rapide et moins cher.
- Luna est le plus rapide et le plus abordable des trois, tout en surpassant la plupart des modèles du marché, pour un cinquième du prix de Sol. Pour la plupart des tâches d'IA quotidiennes, Luna est plus que capable, offrant des performances fiables à un coût incroyablement bas. Au 17 juillet 2026, il se classe 16/576 de tous les modèles sur l'indice d'intelligence des modèles d'Artificial Intelligence.

Choisir le meilleur modèle pour la tâche
Comment décider quel modèle doit traiter une requête et quel niveau de raisonnement appliquer ? Ce choix doit être fait avant la génération de tout token.
Commencez par Luna, puis montez en gamme.
Une approche simple pour toute tâche consiste à choisir le modèle offrant le meilleur équilibre entre vitesse et intelligence au prix que vous êtes prêt à payer. Au sein de la famille GPT-5.6 :
1. GPT-5.6-Sol : Plancher et plafond d'intelligence les plus élevés
2. GPT-5.6-Luna : Plancher et plafond de vitesse les plus élevés
Une bonne pratique par défaut est de commencer la plupart des tâches avec Luna, puis de passer à Terra ou Sol lorsque la progression stagne, par exemple quand les agents se bloquent, que les correctifs cessent de fonctionner ou que le modèle perd le fil. Si vous êtes prêt à payer plus pour à la fois la vitesse et l'intelligence, vous pouvez exécuter Sol sur Cerebras à 750 tokens par seconde, ce qui représente un avantage de vitesse jusqu'à 10 fois supérieur par rapport au mode normal de Sol.

Temps de calcul / Raisonnement à l'exécution
Une autre façon d'adapter la manière dont le modèle traite une tâche consiste à ajuster son niveau de raisonnement. Dans Codex, vous pouvez choisir parmi cinq options : « Léger », « Moyen », « Élevé », « Très élevé » et « Ultra ».
En utilisant davantage de temps de calcul pour augmenter la précision de la sortie, le modèle générera des tokens où il se contredit et se questionne avant de donner une réponse à l'utilisateur.
- Léger : Idéal pour accomplir rapidement des tâches de base : trouver des fichiers, cloner et configurer un dépôt, organiser vos téléchargements, etc. C'est le niveau de raisonnement à choisir pour pratiquement tout ce que le modèle sait faire et où la probabilité d'échec est faible.
- Moyen : Un bon paramètre par défaut au quotidien pour les tâches nécessitant une certaine interprétation, planification ou débogage, mais pas d'exploration approfondie. Cela peut inclure la synthèse de plusieurs fichiers, l'implémentation d'une petite fonctionnalité ou le dépannage d'un problème familier.
- Élevé et Très élevé : Les meilleurs pour les tâches STEM et de codage difficiles, comme le débogage complexe, les décisions architecturales, les grosses refontes ou les problèmes avec plusieurs approches plausibles. La plupart des tâches d'assistance courantes n'ont pas besoin d'autant de raisonnement, voire pas du tout.
- Ultra : Utilisez le mode de raisonnement le plus élevé si vous savez vraiment ce que vous voulez et avez des contraintes détaillées, en particulier pour un travail qui s'étend sur plusieurs systèmes indépendants. Par exemple, créer des interfaces et des API pour connecter 2 API d'une manière très spécifique.
Nous réservons généralement le mode Ultra à nos plus grandes questions de recherche et à nos défis inédits. Le mode Ultra a tendance à épuiser très rapidement vos limites d'utilisation, mais vous pouvez être assuré que le modèle a utilisé tout le budget de raisonnement disponible pour explorer, vérifier et affiner sa réponse.
Dans les tests d'Artificial Analysis du 17 juillet, chaque niveau supérieur de raisonnement de GPT-5.6 Sol augmentait le coût moyen par tâche d'environ 50 %. Les graphiques ci-dessous montrent comment un raisonnement supplémentaire affecte à la fois l'intelligence et le coût.

Profitez des lectures de cache.
L'entrée en cache est 90 % moins chère que l'entrée fraîche. Les tâches Codex qui traitent de manière répétée la même base de code ou le même contexte en bénéficient énormément.
Chacun des modèles GPT-5.6 a une TTL de cache d'environ 30 minutes. Cela signifie que maintenir une session unique dans laquelle vous travaillez sera plus avantageux que de démarrer une nouvelle session pour chaque tâche.
La compaction de Codex est également devenue suffisamment performante pour que vous puissiez exécuter une seule session sur des centaines de millions de tokens sans rencontrer de problème.
Si vous gardez la session active, vous bénéficierez d'un traitement de prompt beaucoup moins cher. Vous pouvez configurer des automatisations Codex planifiées toutes les 20 minutes pour maintenir votre cache en vie et utiliser ces automatisations pour piloter des processus de longue durée.

Utiliser efficacement les workflows multi-agents.
Différents modèles sont entraînés sur des données différentes et optimisés pour des objectifs différents, ce qui signifie que chacun sera légèrement meilleur ou moins bon pour certaines tâches.
Le workflow Conseiller donne à un agent une tâche restreinte : lire l'intégralité de la session, garder une trace de l'objectif et des contraintes, et intervenir chaque fois que l'agent de travail commence à dériver. Cela aide à orienter automatiquement l'agent de travail et à améliorer la fiabilité des tâches plus longues.
Codex Local vous permet également d'intégrer d'autres fournisseurs dans l'application. Cela signifie que vous pouvez expérimenter avec des modèles à moindre coût et à poids ouvert comme Kimi K2.7 Code, ou des modèles avec des forces différentes, comme GLM-5.2 pour le raisonnement et le codage à long horizon, tout en restant dans l'environnement familier de Codex.
Vous pouvez ensuite utiliser ces modèles externes pour un travail de sous-agent limité, afin de réduire les coûts ou de tirer parti des différentes forces de chaque modèle.
Une nuance importante : cela se fait via la configuration Codex et des fichiers d'agents personnalisés, plutôt qu'un simple sélecteur de modèle intégré à l'application. Codex prend en charge les fournisseurs locaux tels qu'Ollama et LM Studio, ainsi que les fournisseurs personnalisés compatibles avec Responses.

Conclusion
Les limites d'utilisation de l'abonnement sont assez généreuses, mais à mesure que les agents IA deviennent plus utiles pour davantage de personnes, beaucoup repoussent ces limites bien au-delà de ce qu'un seul abonnement peut offrir.
Et même si vous avez de l'argent à dépenser, tous les modèles « frontière » ne se situent pas à la frontière pour tous les cas d'usage. Souvent, un petit modèle peut complètement écraser un consortium des meilleurs modèles mondiaux sur quelques benchmarks.
La vitesse est un levier important : pendant la journée, lorsque vous interagissez avec vos agents, un taux de tok/s élevé peut considérablement améliorer votre expérience. Pendant les heures creuses, un /goal avec un modèle lent et à raisonnement supplémentaire peut faire une différence énorme.
Et enfin, gardez un œil sur Artificial Analysis, c'est rempli de benchmarks de vitesse de modèles de haute qualité et d'indices d'intelligence.
Merci à Sarah Chieng (@MilksandMatcha), Joyce Er et Hai-Ching pour votre relecture et vos contributions, et à Halley Change (@halleychangg) pour la conception des graphiques illustrant ce blog.





