- OpenAI améliore le rapport performance par dollar de l’IA d’entreprise en répercutant les gains d’efficacité des modèles, des systèmes d’inférence et des harnais d’agents sur les prix et les vitesses de traitement
- À partir du 30 juillet, le prix de Luna baisse de 80 % et celui de Terra de 20 % ; par million de tokens via l’API, Luna coûtera 0,20 $ en entrée et 1,20 $ en sortie, tandis que Terra coûtera 2 $ en entrée et 12 $ en sortie
- Luna offre des performances comparables à celles d’un modèle de pointe d’il y a un an pour environ 6 % du coût par tâche et à une vitesse près de 9 fois supérieure ; dans Agents’ Last Exam, il affiche de meilleures performances que Fable 5 et un coût estimé par tâche inférieur d’environ 99 %
- Le Fast mode de GPT‑5.6 Sol remplace l’ancien Priority Processing et offre, sans changer le niveau d’intelligence, une vitesse jusqu’à 2,5 fois supérieure à celle du mode Standard, pour un prix 2 fois plus élevé
- Les entreprises peuvent ajuster l’équilibre entre intelligence, vitesse et coût par des évaluations étape par étape, par exemple en utilisant Sol pour la planification et la levée d’incertitudes, et Luna pour les implémentations et les tests clairement définis
Baisse des prix de Luna et Terra, et amélioration de la vitesse de Sol
- Les gains d’efficacité d’exécution de GPT‑5.6 se traduisent par des baisses de prix pour Luna et Terra, ainsi que par une amélioration de la vitesse de traitement de l’API pour Sol
- Luna, le modèle le plus rapide et le moins cher, baisse de 80 %, tandis que Terra, le modèle équilibré pour les tâches quotidiennes, baisse de 20 %
- Dans les abonnements payants Codex et ChatGPT Work, l’utilisation de ces deux modèles comptera aussi pour moins de crédits
- Le prix des abonnements et les budgets d’allocation eux-mêmes ne changent pas
- Luna peut utiliser des outils pour mener à bien des workflows en plusieurs étapes, ce qui réduit les coûts d’exploitation des tâches à grand volume nécessitant une qualité élevée
- Le prix de Sol ne change pas
Choisir le modèle en fonction du résultat attendu
- Pour utiliser efficacement l’IA, il faut équilibrer intelligence, vitesse, fiabilité et coût selon l’importance de la tâche, le coût des erreurs, l’urgence et l’échelle
- Même au sein d’un même workflow, le point optimal peut varier d’une étape à l’autre
- Luna offre des performances comparables à celles d’un modèle qui était de pointe il y a un an, pour environ 6 % du coût par tâche et à une vitesse près de 9 fois supérieure
- Sur Agents’ Last Exam, qui mesure des tâches professionnelles, il dépasse Fable 5 tout en réduisant le coût estimé par tâche d’environ 99 %
- Les entreprises peuvent d’abord définir les résultats nécessaires et les critères de qualité, puis utiliser des évaluations pour distinguer les cas où une intelligence supplémentaire améliore réellement le résultat de ceux où un traitement à moindre coût produit la même qualité
- Dans un workflow de codage, Sol peut lever les incertitudes et établir le plan
- Luna peut prendre en charge l’implémentation de changements clairement définis, la rédaction et l’exécution de tests, ainsi que l’évaluation des résultats
- La gamme GPT‑5.6 élargit les options permettant d’appliquer le niveau d’intelligence nécessaire à chaque étape et de payer les coûts en fonction de la valeur créée
Des gains d’efficacité du modèle jusqu’aux agents
- Les gains d’efficacité concernent à la fois les modèles, les systèmes d’inférence qui les exécutent et les harnais d’agents qui relient les outils et le contexte
- Les modèles GPT‑5.6 traitent les tâches par des chemins plus directs
- Un routage amélioré accroît l’utilisation du matériel
- Des logiciels de production optimisés génèrent les tokens plus efficacement
- Une meilleure gestion du contexte aide les agents à ne pas répéter des tâches déjà terminées
- Avec les mêmes ressources de calcul, davantage de travail utile est accompli, ce qui réduit le temps, les tokens et les coûts par résultat
Optimisations supplémentaires prises en charge par Sol
- Dans un processus piloté par des humains, GPT‑5.6 Sol a réécrit et optimisé de manière autonome des kernels de production
- Il a conçu et exécuté des centaines d’expériences pour améliorer la génération de tokens, surveillé l’apprentissage et intervenu en cas de problème
- Le travail sur les kernels a réduit le coût de bout en bout de la fourniture du modèle de 20 %, et les expériences ont amélioré l’efficacité de génération des tokens de plus de 15 %
- À mesure que les performances et l’autonomie des modèles augmentent, une boucle de rétroaction se met en place, accélérant la recherche des prochains gains d’efficacité
- Le processus d’ingénierie associé est présenté dans l’introduction aux gains d’efficacité de GPT‑5.6
Une stratégie de calcul au service de l’échelle
- Pour répondre à une forte demande d’intelligence, il faut non seulement davantage de ressources de calcul, mais aussi un calcul à forte productivité
- OpenAI construit un portefeuille d’infrastructures résilient et place chaque workload sur le système le mieux adapté à son exécution
- Les baisses de prix de Luna et Terra permettent d’exécuter économiquement des tâches à grand volume à plus grande échelle
- Le Fast mode fournit un accès API plus rapide pour les tâches Sol où le temps de réponse compte
- L’analyse de grands volumes de documents, la classification des interactions clients et les tâches d’implémentation répétitives deviennent plus économiques à grande échelle
- Les workloads Sol complexes peuvent être traités plus rapidement lorsque la vitesse est suffisamment importante pour justifier le coût supplémentaire
- Des modèles plus puissants aidant les équipes techniques à réaliser les améliorations suivantes, le délai nécessaire pour accroître les performances et réduire les coûts diminue
Fonctionnement et compatibilité du Fast mode
- Le Fast mode de l’API remplace Priority Processing et correspond à
/fastdans Codex - Sur GPT‑5.6 Sol, il offre une vitesse jusqu’à 2,5 fois supérieure au traitement Standard, sans modifier le niveau d’intelligence, pour un prix 2 fois plus élevé
- La compatibilité ascendante est maintenue : les requêtes API existantes portant le tag
prioritycontinuent de fonctionner
Disponibilité et tarifs de l’API
- GPT‑5.6 Terra et Luna restent disponibles dans ChatGPT Work, Codex et l’API OpenAI
- Les utilisateurs Free et Go de ChatGPT Work et Codex peuvent accéder à Terra
- Les utilisateurs Plus, Pro, Business et Enterprise peuvent choisir Terra et Luna
- À partir du 30 juillet, les prix de l’API par million de tokens sont les suivants
- Terra : entrée 2 $, sortie 12 $
- Luna : entrée 0,20 $, sortie 1,20 $
- Les prix des abonnements ChatGPT et Codex ainsi que les budgets d’allocation restent inchangés, mais l’utilisation de Terra et Luna consommera moins de crédits
- Sur AWS, le changement de prix sera déployé progressivement à partir de la fin de journée du 30 juillet
- Les tarifs complets sont disponibles dans les informations de tarification de l’API
1 commentaires
Commentaires sur Hacker News
La phrase de John Wanamaker, « la moitié de l’argent dépensé en publicité est gaspillée, mais on ne sait pas laquelle », s’applique encore mieux au choix du modèle. On sait que la plupart des tâches n’ont pas besoin d’un modèle puissant, mais distinguer les tâches simples des tâches difficiles est en soi un problème ardu, voire indécidable
HN pourrait fonctionner comme un BBS avec du matériel des années 1970, mais en pratique on fait quasiment la même chose avec des CPU d’environ 10 milliards de transistors au lieu d’environ 10 000, sans vraiment s’en soucier
« À partir d’aujourd’hui, nous réduisons de 80 % le coût du modèle le plus rapide et le moins cher, GPT‑5.6 Luna » : ça laisse sans voix. Je pensais qu’on était entré dans une phase de stagnation avec des améliorations de 5 à 10 % sur plusieurs mois, mais un changement aussi brutal fait se demander où se situe le plancher des prix
Les clusters GPU dynamiques serviront pour les 5 % restants et pour étendre la frontière de pointe, et ils commenceront aussi à traiter de nouvelles tâches aujourd’hui trop difficiles pour la plupart des travailleurs du savoir
S’il s’agit d’un vrai gain d’efficacité, il y a probablement une contrepartie, comme une quantification agressive ou une compression du cache KV qui dégrade la qualité
À mesure que les tokens deviennent chaque année plus rapides et moins chers, des usines d’IA imitant des équipes d’experts et une parallélisation bien plus poussée deviendront une réalité
Rendre Luna, déjà bon marché et performant, 5 fois moins cher est étonnant. Au travail, j’utilise Sol, et chez moi Luna ; la différence est nette, mais pas écrasante. Après une année de hausses de prix continues, on a l’impression qu’ils repartent à la baisse avec Luna, Kimi K3 et GLM 5.2
OpenAI et Anthropic ont aussi augmenté leurs prix pendant plusieurs mois, puis un labo américain a fortement baissé ses prix ; cela ressemble plutôt à la dynamique inverse
Ils disent avoir « réduit de 20 % le coût de bout en bout de fourniture du modèle grâce à un travail sur le kernel, et augmenté de plus de 15 % l’efficacité de génération de tokens grâce à l’expérimentation ». Si le coût de fourniture de GPT‑5.6 a baissé de 20 %, est-ce que cela représente des économies de plusieurs milliards de dollars par mois ?
D’après les documents d’IPO de SpaceX, Anthropic a dépensé 1,25 milliard de dollars pour louer la capacité d’inférence de deux datacenters Colossus, mais en tenant compte de la capacité existante chez AWS et ailleurs, on ne sait pas quelle part cela représente du total. Le coût mensuel d’inférence d’OpenAI se chiffre probablement lui aussi en milliards, donc une réduction de 20 % est énorme
Ce changement donne l’impression d’une transition du bas débit vers le haut débit. Je recommandais déjà fortement Luna pour la recherche approfondie, et pouvoir l’exécuter 5 fois plus au même coût est énorme
Même aujourd’hui, je lance 10 agents en parallèle pour générer des hypothèses, et j’ai du mal à imaginer 50. Si le coût devient suffisamment faible pour exécuter des dizaines de fois le même prompt avec le même modèle, les statistiques deviennent bien plus intéressantes et puissantes
Le nouveau prix de Luna est inattendu, et rien sur le marché ne semble pouvoir rivaliser avec ce rapport qualité-prix
Pour les applications en production, OpenAI est désormais clairement le meilleur fournisseur. L’API est stable, riche en fonctionnalités, et le rapport qualité-prix est excellent sur l’ensemble de la gamme de modèles. J’ai longtemps utilisé des modèles à poids ouverts comme Kimi K2.5 via Fireworks, mais il y avait des problèmes intermittents, idem chez Anthropic et Google. OpenAI est rapide et offre un meilleur rapport qualité-prix à presque tous les niveaux d’intelligence
En général, je regarde le graphique de rapport qualité-prix d’OpenRouter et j’active
"Show Pareto"à droite. Pour mes projets personnels, j’utilisais encore GLM-5.2, mais maintenant Luna devient le choix évidentLa baisse de prix de 80 % de Luna est très agressive. Pour la plupart des tâches qui n’exigent pas une intelligence de pointe, c’est un choix écrasant, et Luna peut parfois rivaliser avec Opus 5
xhighde Sol etmaxde Luna. Sol comprend mieux les prompts, alors qu’avec Luna il faut donner des instructions plus spécifiques et plus clairesJ’ai déjà préacheté beaucoup de tokens DeepSeek v4 flash, et une fois épuisés, j’aimerais essayer d’acheter des tokens Luna pendant un moment. Je préfère les modèles bon marché et rapides, et comme je suis à la retraite, cela ne me dérange pas de perdre un peu de temps à basculer manuellement vers un modèle plus puissant quand c’est nécessaire
Le fait que Luna soit 80 % moins cher est étonnant. Comme le coût du calcul continue de baisser, il se pourrait que l’an prochain les frais d’utilisation de l’API pour des modèles puissants deviennent inférieurs au prix d’un abonnement