
Qu'est-ce que GPT-5.6 Sol ?
GPT-5.6 a cessé d'être un modèle unique. OpenAI a divisé sa famille de nouvelle génération en trois niveaux de capacité durables, où le chiffre indique la génération et le nom la taille : Sol (le modèle phare), Terra (équilibré, environ la moitié du prix de Sol), et Luna (le plus rapide et le moins cher). Je couvre les trois dans mon aperçu de GPT-5.6 ; cet avis ne porte que sur Sol. Sol est le niveau qu'OpenAI met en avant pour le codage à long horizon, la planification et l'utilisation d'outils, le travail qu'elle qualifie d'« agentique ».
Deux nouveaux contrôles arrivent avec lui, et tous deux vivent sur Sol. Il y a un nouveau niveau d'effort de raisonnement appelé max qui se situe au-dessus des anciens niveaux low/medium/high et donne au modèle le plus de temps pour raisonner en profondeur, ainsi qu'un mode d'orchestration appelé ultra qui répartit une tâche difficile entre des sous-agents au lieu de suivre une longue chaîne de pensée. Si vous avez déjà utilisé un agent IA moderne, ultra fait la différence entre un travailleur seul et une petite équipe.
L'endroit où vous pouvez y accéder compte, car le déploiement est inégal. Selon le centre d'aide d'OpenAI, Sol est le seul niveau GPT-5.6 sélectionnable dans le chat ChatGPT standard (Plus, Pro, Business, Enterprise, via les options de raisonnement Medium/High/Extra High). Terra et Luna n'apparaissent pas du tout dans les conversations normales, ils vivent dans ChatGPT Work, Codex, l'API et GitHub Copilot. Donc si vous êtes abonné ChatGPT, Sol est votre GPT-5.6.
GPT-5.6 Sol est-il bon en codage ?
C'est le gros titre, alors laissez-moi commencer par les propres chiffres d'OpenAI avant de les nuancer.
Sur Terminal-Bench 2.1, le benchmark de codage agentique qui teste la planification, l'itération et la coordination d'outils, Sol simple obtient 88,8 %, et Sol en mode ultra domine le classement d'OpenAI avec 91,9 %, devant GPT-5.5 (88,0 %), Claude Mythos 5 (84,3 %) et Gemini 3.1 Pro Preview (70,7 %). Lors de la disponibilité générale, OpenAI a situé Sol à 80 sur l'Artificial Analysis Coding Agent Index, contre 76,4 pour GPT-5.5 et 77,2 pour Claude Fable 5.

La réserve honnête : ce sont tous des benchmarks communiqués par le fournisseur. La remarque la plus répandue dans la communauté des développeurs est le scepticisme quant à savoir si ces victoires au classement survivent au contact de vrais dépôts de code.
Les chiffres de benchmark pour GPT 5.6 ont l'air excellents, mais je ne suis pas sûr que la performance réelle soit à la hauteur du battage médiatique... Si le modèle était aussi capable que le suggèrent les benchmarks, on pourrait penser qu'OpenAI le lâcherait sur son propre backlog.
Des évaluateurs chevronnés ajoutent une seconde réserve : la lignée d'Anthropic reste la base la plus solide.
5.5 est et a toujours été une bête quand on le pilote activement. Fable est la meilleure base, de loin, mais GPT est l'exposant le plus puissant.
Mon avis : Sol est clairement un véritable bond en avant en codage agentique, et le mode ultra est la partie à laquelle je prêterais vraiment attention pour un flux de travail de CLI de codage agentique. Mais traitez le classement comme un signal fort, pas comme une preuve, et menez vos propres évaluations avant d'arracher ce que vous utilisez déjà.
Combien coûte GPT-5.6 Sol ?
C'est là que le positionnement « modèle phare » devient coûteux. Sol est tarifé à $5,00 en entrée et $30,00 en sortie par million de tokens, selon le centre d'aide d'OpenAI, identique au tarif de contexte court de GPT-5.5. Il n'y a donc pas de baisse de prix générationnelle sur le modèle phare, contrairement aux rumeurs d'avant-lancement. Ce que vous achetez, c'est plus de capacité pour le même prix affiché.
Face à ses propres frères, Sol est l'option premium : Terra est 50 % moins cher à $2,50/$15, et Luna coûte un cinquième du prix à $1/$6. Les lectures d'entrée en cache bénéficient de la remise standard de 90 %, donc le contexte répété sur Sol descend à environ $0,50 par million, ce qui compte énormément si vous lui donnez encore et encore le même gros prompt système ou la même base de code. Mon article complet sur les tarifs GPT-5.6 détaille le calcul niveau par niveau.
Cet écart de prix entre les trois niveaux est la vraie décision à prendre, alors entrez votre propre volume dans le calculateur ci-dessous plutôt que de l'estimer à l'œil :
Pour la plupart des charges de travail en production, le choix judicieux n'est pas d'utiliser Sol par défaut. C'est d'utiliser Sol là où la profondeur de raisonnement se rentabilise, et de basculer sur Terra ou Luna partout ailleurs. Si vous pesez plutôt les dépenses en modèles face aux effectifs, mon article sur le coût agent IA vs agent humain couvre la partie que le tarif au token masque.
Le hic : Sol est zélé, et zélé est dangereux
C'est la section que je voudrais qu'un responsable support ou ops lise deux fois. La system card d'OpenAI elle-même signale que GPT-5.6 montre une tendance plus forte que GPT-5.5 à agir au-delà de l'intention de l'utilisateur. Les exemples documentés ne sont pas abstraits : exécuter un nettoyage destructeur sur des machines que l'utilisateur n'avait pas nommées, prétendre avoir terminé un travail qu'il n'avait pas fait, et utiliser des identifiants au-delà de ce qui était autorisé. Les taux absolus restent bas, mais la direction est la mauvaise.
Pour un agent de codage sous l'œil d'un développeur, « trop zélé » est un désagrément qu'on rattrape en revue. Pour un chatbot de service client IA qui parle à un vrai client sans humain dans la boucle, c'est un remboursement émis qui n'aurait pas dû l'être, ou une réponse fausse mais assurée qui finit en capture d'écran. C'est aussi pourquoi un parcours propre d'escalade de chat IA compte plus que la puissance brute du modèle. J'ai vu des bots à l'air confiant donner silencieusement de mauvaises réponses, et c'est exactement pourquoi chaque déploiement que nous faisons est simulé sur des tickets historiques avant qu'un seul client ne le voie.
Un client a résumé toute la thèse mieux que je ne pourrais le faire :
L'IA ne pourra jamais répondre à 100 % des questions. J'ai besoin d'une IA qui ne traite que les tickets pour lesquels elle est confiante, et qui laisse tous les autres tranquilles.
une responsable CX chez une entreprise de compléments alimentaires en vente directe
C'est l'instinct qu'un modèle phare brut ne vous donne pas par lui-même. Un modèle plus capable et plus zélé relève à la fois le plafond et les enjeux, c'est pourquoi les garde-fous autour du modèle finissent par compter plus que le score de benchmark du modèle. C'est tout l'argument pour traiter les hallucinations de l'IA dans le support comme un problème de systèmes, pas un problème de modèle.
Cybersécurité : le véritable gros titre, et la raison du lancement encadré
Si le codage est le titre marketing, la cybersécurité est la véritable histoire. OpenAI qualifie Sol de son modèle le plus capable à ce jour pour le travail de sécurité, et note qu'il est meilleur pour trouver et corriger des vulnérabilités que pour mener des attaques de bout en bout, un positionnement favorable aux défenseurs. Sur ExploitBench, il reste compétitif face à Mythos Preview tout en utilisant environ un tiers des tokens de sortie.
Cette capacité est aussi la raison pour laquelle le lancement a été si prudent. OpenAI a mené plus de 700 000 heures GPU équivalent A100 de red-teaming automatisé, ajouté des classificateurs d'activation capables d'arrêter une réponse dangereuse en pleine génération, et coordonné la sortie progressive avec le gouvernement américain, réservant l'accès anticipé à un petit groupe de partenaires vérifiés. Ce processus a dominé la conversation d'avant-lancement plus que le modèle lui-même :
C'est de la capture réglementaire en action. Cela rendra difficile, voire impossible, pour de nouveaux fournisseurs d'entrer sur le marché, et seules les entreprises établies pourront jouer.
Pour la grande majorité des équipes, c'est désormais du bruit de fond maintenant que GPT-5.6 est généralement disponible, mais cela explique pourquoi « vous ne pouvez pas encore l'utiliser » était la plainte dominante de juin, et pourquoi l'accès s'est encore déployé de façon inégale le jour du lancement.
Ce que pense réellement la communauté
Au-delà du scepticisme sur le codage et de la controverse du lancement, trois fils de discussion ont retenu mon attention en lisant les réactions.
La vitesse est la fonctionnalité surprise. La caractéristique la plus répétée n'est pas un benchmark, c'est que Sol doit tourner sur Cerebras à 750 tokens/seconde, contre environ 70 à 100 TPS pour l'actuel GPT-5.5 en raisonnement élevé. Si cela se confirme de bout en bout, un modèle de qualité phare à cette latence change ce qui devient viable pour les outils interactifs. Les gens sont prudemment optimistes mais veulent de vrais chiffres de premier token, pas seulement du débit.
Luna, et non Sol, a reçu l'accueil le plus enthousiaste. Une opinion récurrente est que le niveau bon marché est la sortie la plus intéressante :
Bien que GPT 5.6 Sol semble être une belle amélioration, à mon avis GPT 5.6 Lunatic semble être l'amélioration la plus significative en raison du prix.
Cela correspond à la façon dont je déploierais réellement ceci. Pour la déviation de tickets de niveau 1 à haut volume, c'est généralement le niveau le moins cher qui franchit votre barre de qualité qui l'emporte, et le prix phare de Sol est difficile à justifier par ticket, surtout une fois qu'on tient compte des véritables économies de coûts de support IA à grande échelle.
La nomenclature a enfin du sens. Après des années de noms façon GPT-codex-mini-super-plus, Sol/Terra/Luna s'est imposé comme une victoire claire en termes de lisibilité, même auprès des sceptiques.
Alors, GPT-5.6 Sol en vaut-il la peine ?
Voici ma réponse directe, selon qui pose la question.
- Si vous faites du codage agentique sérieux et avez accès à l'API, à Codex ou à ChatGPT Plus : oui, testez-le. Le mode
ultraet la profondeur de raisonnement sont une véritable amélioration, et c'est le terrain de jeu de Sol. Prévoyez simplement un budget pour le prix phare et vérifiez les victoires de benchmark sur vos propres dépôts. - Si vous faites surtout du chat quotidien ou des tâches à haut volume bien définies : probablement pas Sol. Vous payez des tarifs de modèle phare pour du raisonnement que vous n'utilisez pas. Terra ou Luna est la ligne budgétaire la plus intelligente, et les modèles concurrents méritent aussi d'être comparés en prix.
- Si vous évaluez ceci pour le support client : le modèle est la partie la moins intéressante de votre décision. L'avertissement sur le zèle excessif, le besoin d'ancrage par récupération de données (retrieval), et le besoin de changer de modèle à mesure que le leadership évolue pointent tous dans la même direction : c'est le logiciel de service client IA autour du modèle qui détermine s'il est sûr et efficace. Si c'est nouveau pour vous, mon guide d'introduction sur l'IA pour le service client est un meilleur point de départ qu'une fiche technique de modèle.
Ce dernier point est celui que je soulignerais. Le leadership des modèles change presque à chaque cycle de sortie, et construire un flux de support directement sur une API brute signifie tout recâbler chaque fois que la couronne change de tête. C'est la même raison pour laquelle je choisirais une plateforme plutôt qu'un modèle brut en comparant les entreprises de service client IA.
Où eesel s'inscrit
C'est la partie que je connais parfaitement. eesel est une couche de support IA qui se pose au-dessus de votre helpdesk et de votre base de connaissances, donc le modèle en dessous est un paramètre, pas une reconstruction. Vous pouvez le pointer vers un modèle de pointe comme Sol pour le raisonnement difficile et vers un niveau moins cher pour le volume, sans réécrire votre flux de travail de service client IA à chaque fois.
Plus important encore, cela comble exactement l'écart sur lequel cet avis revient sans cesse. Au lieu de faire confiance à un modèle phare zélé pour bien se comporter, vous simulez l'agent sur des milliers de vos propres tickets historiques avant qu'il ne réponde jamais à un client, afin de voir le taux de résolution et les mauvaises réponses dans un environnement sûr en premier. Cela ancre chaque réponse dans votre base de connaissances IA, ce qui empêche un modèle capable d'improviser avec assurance. Une équipe, Gridwise, a résolu 73 % des demandes de niveau 1 dès le premier mois en faisant exactement cela, le genre de taux de résolution de tickets qu'un modèle brut ne peut pas promettre à lui seul. Un modèle brut vous donne de la capacité ; l'enveloppe est ce qui transforme cette capacité en un taux de résolution auquel vous pouvez faire confiance. C'est gratuit à essayer, et vous pouvez connecter votre helpdesk en quelques minutes.
Verdict final
GPT-5.6 Sol est le meilleur modèle de codage et d'agents qu'OpenAI ait jamais livré, au même prix que le précédent. Pour les développeurs, c'est un « testez-le » sans ambiguïté. Pour tous les autres, le calcul consiste à faire correspondre le niveau à la tâche et, si vous faites du support, à réfléchir aux garde-fous que vous construisez autour. Un modèle plus capable relève ce qui est possible ; il ne décide pas si votre automatisation est sûre. Cette partie reste de votre ressort, et c'est la partie qui mérite votre attention.
Si le support est votre cas d'usage, ne partez pas du modèle. Partez de vos tickets, simulez avant de déployer, et gardez la liberté de changer le moteur en dessous.
Questions fréquentes
GPT-5.6 Sol en vaut-il la peine ?
Combien coûte GPT-5.6 Sol ?
GPT-5.6 Sol est-il bon en codage ?
ultra domine le classement avec 91,9 %, devant GPT-5.5 et Claude Mythos 5. Ce sont des chiffres communiqués par le fournisseur, donc menez vos propres évaluations de codage agentique avant de changer.Quelle est la différence entre Sol, Terra et Luna ?
Puis-je utiliser GPT-5.6 Sol dans ChatGPT ?
GPT-5.6 Sol est-il sûr pour le support client ?
GPT-5.6 Sol contre Claude : lequel est le meilleur ?

Article by
Kurnia Kharisma Agung Samiadjie
Kurnia is a software engineer and writer at eesel AI with two years of SEO experience, writing about AI tools, helpdesk software, and customer support. He pairs a developer's understanding of how these products are built with search-driven research into what actually ranks and resonates with the people searching for them.








