1 points par GN⁺ 3 시간 전 | 1 commentaires | Partager sur WhatsApp
  • OpenAI améliore le rapport performance par dollar de l’IA d’entreprise en répercutant les gains d’efficacité des modèles, des systèmes d’inférence et des harnais d’agents sur les prix et les vitesses de traitement
  • À partir du 30 juillet, le prix de Luna baisse de 80 % et celui de Terra de 20 % ; par million de tokens via l’API, Luna coûtera 0,20 $ en entrée et 1,20 $ en sortie, tandis que Terra coûtera 2 $ en entrée et 12 $ en sortie
  • Luna offre des performances comparables à celles d’un modèle de pointe d’il y a un an pour environ 6 % du coût par tâche et à une vitesse près de 9 fois supérieure ; dans Agents’ Last Exam, il affiche de meilleures performances que Fable 5 et un coût estimé par tâche inférieur d’environ 99 %
  • Le Fast mode de GPT‑5.6 Sol remplace l’ancien Priority Processing et offre, sans changer le niveau d’intelligence, une vitesse jusqu’à 2,5 fois supérieure à celle du mode Standard, pour un prix 2 fois plus élevé
  • Les entreprises peuvent ajuster l’équilibre entre intelligence, vitesse et coût par des évaluations étape par étape, par exemple en utilisant Sol pour la planification et la levée d’incertitudes, et Luna pour les implémentations et les tests clairement définis

Baisse des prix de Luna et Terra, et amélioration de la vitesse de Sol

  • Les gains d’efficacité d’exécution de GPT‑5.6 se traduisent par des baisses de prix pour Luna et Terra, ainsi que par une amélioration de la vitesse de traitement de l’API pour Sol
  • Luna, le modèle le plus rapide et le moins cher, baisse de 80 %, tandis que Terra, le modèle équilibré pour les tâches quotidiennes, baisse de 20 %
    • Dans les abonnements payants Codex et ChatGPT Work, l’utilisation de ces deux modèles comptera aussi pour moins de crédits
    • Le prix des abonnements et les budgets d’allocation eux-mêmes ne changent pas
  • Luna peut utiliser des outils pour mener à bien des workflows en plusieurs étapes, ce qui réduit les coûts d’exploitation des tâches à grand volume nécessitant une qualité élevée
  • Le prix de Sol ne change pas

Choisir le modèle en fonction du résultat attendu

  • Pour utiliser efficacement l’IA, il faut équilibrer intelligence, vitesse, fiabilité et coût selon l’importance de la tâche, le coût des erreurs, l’urgence et l’échelle
    • Même au sein d’un même workflow, le point optimal peut varier d’une étape à l’autre
  • Luna offre des performances comparables à celles d’un modèle qui était de pointe il y a un an, pour environ 6 % du coût par tâche et à une vitesse près de 9 fois supérieure
  • Sur Agents’ Last Exam, qui mesure des tâches professionnelles, il dépasse Fable 5 tout en réduisant le coût estimé par tâche d’environ 99 %
  • Les entreprises peuvent d’abord définir les résultats nécessaires et les critères de qualité, puis utiliser des évaluations pour distinguer les cas où une intelligence supplémentaire améliore réellement le résultat de ceux où un traitement à moindre coût produit la même qualité
    • Dans un workflow de codage, Sol peut lever les incertitudes et établir le plan
    • Luna peut prendre en charge l’implémentation de changements clairement définis, la rédaction et l’exécution de tests, ainsi que l’évaluation des résultats
  • La gamme GPT‑5.6 élargit les options permettant d’appliquer le niveau d’intelligence nécessaire à chaque étape et de payer les coûts en fonction de la valeur créée

Des gains d’efficacité du modèle jusqu’aux agents

  • Les gains d’efficacité concernent à la fois les modèles, les systèmes d’inférence qui les exécutent et les harnais d’agents qui relient les outils et le contexte
    • Les modèles GPT‑5.6 traitent les tâches par des chemins plus directs
    • Un routage amélioré accroît l’utilisation du matériel
    • Des logiciels de production optimisés génèrent les tokens plus efficacement
    • Une meilleure gestion du contexte aide les agents à ne pas répéter des tâches déjà terminées
  • Avec les mêmes ressources de calcul, davantage de travail utile est accompli, ce qui réduit le temps, les tokens et les coûts par résultat

Optimisations supplémentaires prises en charge par Sol

  • Dans un processus piloté par des humains, GPT‑5.6 Sol a réécrit et optimisé de manière autonome des kernels de production
  • Il a conçu et exécuté des centaines d’expériences pour améliorer la génération de tokens, surveillé l’apprentissage et intervenu en cas de problème
  • Le travail sur les kernels a réduit le coût de bout en bout de la fourniture du modèle de 20 %, et les expériences ont amélioré l’efficacité de génération des tokens de plus de 15 %
  • À mesure que les performances et l’autonomie des modèles augmentent, une boucle de rétroaction se met en place, accélérant la recherche des prochains gains d’efficacité
  • Le processus d’ingénierie associé est présenté dans l’introduction aux gains d’efficacité de GPT‑5.6

Une stratégie de calcul au service de l’échelle

  • Pour répondre à une forte demande d’intelligence, il faut non seulement davantage de ressources de calcul, mais aussi un calcul à forte productivité
  • OpenAI construit un portefeuille d’infrastructures résilient et place chaque workload sur le système le mieux adapté à son exécution
    • Les baisses de prix de Luna et Terra permettent d’exécuter économiquement des tâches à grand volume à plus grande échelle
    • Le Fast mode fournit un accès API plus rapide pour les tâches Sol où le temps de réponse compte
  • L’analyse de grands volumes de documents, la classification des interactions clients et les tâches d’implémentation répétitives deviennent plus économiques à grande échelle
  • Les workloads Sol complexes peuvent être traités plus rapidement lorsque la vitesse est suffisamment importante pour justifier le coût supplémentaire
  • Des modèles plus puissants aidant les équipes techniques à réaliser les améliorations suivantes, le délai nécessaire pour accroître les performances et réduire les coûts diminue

Fonctionnement et compatibilité du Fast mode

  • Le Fast mode de l’API remplace Priority Processing et correspond à /fast dans Codex
  • Sur GPT‑5.6 Sol, il offre une vitesse jusqu’à 2,5 fois supérieure au traitement Standard, sans modifier le niveau d’intelligence, pour un prix 2 fois plus élevé
  • La compatibilité ascendante est maintenue : les requêtes API existantes portant le tag priority continuent de fonctionner

Disponibilité et tarifs de l’API

  • GPT‑5.6 Terra et Luna restent disponibles dans ChatGPT Work, Codex et l’API OpenAI
    • Les utilisateurs Free et Go de ChatGPT Work et Codex peuvent accéder à Terra
    • Les utilisateurs Plus, Pro, Business et Enterprise peuvent choisir Terra et Luna
  • À partir du 30 juillet, les prix de l’API par million de tokens sont les suivants
    • Terra : entrée 2 $, sortie 12 $
    • Luna : entrée 0,20 $, sortie 1,20 $
  • Les prix des abonnements ChatGPT et Codex ainsi que les budgets d’allocation restent inchangés, mais l’utilisation de Terra et Luna consommera moins de crédits
  • Sur AWS, le changement de prix sera déployé progressivement à partir de la fin de journée du 30 juillet
  • Les tarifs complets sont disponibles dans les informations de tarification de l’API

1 commentaires

 
GN⁺ 3 시간 전
Commentaires sur Hacker News
  • La phrase de John Wanamaker, « la moitié de l’argent dépensé en publicité est gaspillée, mais on ne sait pas laquelle », s’applique encore mieux au choix du modèle. On sait que la plupart des tâches n’ont pas besoin d’un modèle puissant, mais distinguer les tâches simples des tâches difficiles est en soi un problème ardu, voire indécidable

    • Ce n’est pas très difficile. Il suffit d’abord de trouver une bibliothèque qui résout à peu près correctement le problème de l’arrêt, et on peut s’y mettre tout de suite
    • On n’en est pas encore au stade où l’on fait tourner 1 000 agents en parallèle. Pour l’instant, on supervise encore de près les tâches importantes effectuées par les agents, donc il n’y a pas vraiment de raison de choisir un modèle inférieur à l’état de l’art. Hors des tâches de code, cela peut être différent
    • Si l’on dispose d’agents et d’utilisateurs, on peut lancer des évaluations pour vérifier les limites du modèle. Luna n’est pas le meilleur en appel d’outils, mais si l’on définit clairement le problème et les outils, il peut rivaliser avec Gemini 4 Flash pour bien moins cher
    • Le point de vue de https://news.ycombinator.com/item?id=49113236 est pertinent
      HN pourrait fonctionner comme un BBS avec du matériel des années 1970, mais en pratique on fait quasiment la même chose avec des CPU d’environ 10 milliards de transistors au lieu d’environ 10 000, sans vraiment s’en soucier
  • « À partir d’aujourd’hui, nous réduisons de 80 % le coût du modèle le plus rapide et le moins cher, GPT‑5.6 Luna » : ça laisse sans voix. Je pensais qu’on était entré dans une phase de stagnation avec des améliorations de 5 à 10 % sur plusieurs mois, mais un changement aussi brutal fait se demander où se situe le plancher des prix

    • Quand l’intelligence des modèles prendra en charge de façon fiable 90 à 95 % du travail du savoir actuel, on gravera les poids dans le silicium et le rapport qualité-prix sera à nouveau multiplié par 10
      Les clusters GPU dynamiques serviront pour les 5 % restants et pour étendre la frontière de pointe, et ils commenceront aussi à traiter de nouvelles tâches aujourd’hui trop difficiles pour la plupart des travailleurs du savoir
    • On ne sait pas quelle part du prix actuel correspond au coût réel et quelle part relève d’une stratégie de conquête du marché subventionnée par les investisseurs. Si OpenAI a confiance dans sa trésorerie, cela peut être une tentative de mettre la pression sur Anthropic, qui détient le produit phare
    • Les chiffres sont impressionnants au point d’être difficiles à croire. Même avec quelques pourcents de performances en moins, si c’est plus de 80 % moins cher que la concurrence et proposé par une entreprise américaine sur un hyperscaler américain, la plupart des entreprises auront du mal à justifier un autre choix
    • Cela signifie que le coût a baissé de 80 %, pas que l’efficacité s’est améliorée de 80 %. Luna était peut-être cher dès le départ, et on manque aussi d’informations sur le modèle lui-même
      S’il s’agit d’un vrai gain d’efficacité, il y a probablement une contrepartie, comme une quantification agressive ou une compression du cache KV qui dégrade la qualité
    • Même des améliorations de 5 à 10 % tous les quelques mois sont déjà remarquables. Je me demande quelle pression Kimi 3 exerce en interne sur Anthropic, OpenAI et Google
      À mesure que les tokens deviennent chaque année plus rapides et moins chers, des usines d’IA imitant des équipes d’experts et une parallélisation bien plus poussée deviendront une réalité
  • Rendre Luna, déjà bon marché et performant, 5 fois moins cher est étonnant. Au travail, j’utilise Sol, et chez moi Luna ; la différence est nette, mais pas écrasante. Après une année de hausses de prix continues, on a l’impression qu’ils repartent à la baisse avec Luna, Kimi K3 et GLM 5.2

    • Il est difficile de voir cela comme la même dynamique que Kimi ou GLM. GLM 5.2 a été une forte hausse selon les standards des modèles chinois, et Kimi K3 est encore monté au-dessus, en se rapprochant des prix d’OpenAI
      OpenAI et Anthropic ont aussi augmenté leurs prix pendant plusieurs mois, puis un labo américain a fortement baissé ses prix ; cela ressemble plutôt à la dynamique inverse
    • Les entreprises se battent jour et nuit pour prendre le marché, donc ce n’est au fond qu’une question de temps
    • Je doute que Kimi soit vraiment bon marché ; c’est même plutôt un modèle assez coûteux
    • Pour des tâches comme la correction de bugs, où l’on peut vérifier le résultat, on peut exploiter n’importe quel modèle à condition d’écrire une procédure de validation appropriée
  • Ils disent avoir « réduit de 20 % le coût de bout en bout de fourniture du modèle grâce à un travail sur le kernel, et augmenté de plus de 15 % l’efficacité de génération de tokens grâce à l’expérimentation ». Si le coût de fourniture de GPT‑5.6 a baissé de 20 %, est-ce que cela représente des économies de plusieurs milliards de dollars par mois ?
    D’après les documents d’IPO de SpaceX, Anthropic a dépensé 1,25 milliard de dollars pour louer la capacité d’inférence de deux datacenters Colossus, mais en tenant compte de la capacité existante chez AWS et ailleurs, on ne sait pas quelle part cela représente du total. Le coût mensuel d’inférence d’OpenAI se chiffre probablement lui aussi en milliards, donc une réduction de 20 % est énorme

    • Il y a environ deux ans, Gemini 2.5 avait aidé à améliorer ses propres kernels pour parvenir à peine à 1 % de gain d’efficacité ; aujourd’hui, on est à 20 %
    • J’imagine ce que ça ferait d’écrire sur son CV : « réduction de 20 % du coût d’inférence, permettant à l’entreprise d’économiser plusieurs milliards de dollars par mois »
  • Ce changement donne l’impression d’une transition du bas débit vers le haut débit. Je recommandais déjà fortement Luna pour la recherche approfondie, et pouvoir l’exécuter 5 fois plus au même coût est énorme
    Même aujourd’hui, je lance 10 agents en parallèle pour générer des hypothèses, et j’ai du mal à imaginer 50. Si le coût devient suffisamment faible pour exécuter des dizaines de fois le même prompt avec le même modèle, les statistiques deviennent bien plus intéressantes et puissantes

    • Je serais curieux de savoir concrètement comment la « recherche approfondie » est mise en œuvre
    • J’aimerais en savoir plus sur la génération d’hypothèses et la méthode de recherche. Pour les bonnes idées, j’ai considéré que Sol demandait davantage de capacité de raisonnement, mais à partir d’un certain point, la quantité peut sembler préférable à la qualité
    • Je me demande quelles tâches bénéficient de l’augmentation du nombre d’agents et lesquelles n’en profitent pas
  • Le nouveau prix de Luna est inattendu, et rien sur le marché ne semble pouvoir rivaliser avec ce rapport qualité-prix
    Pour les applications en production, OpenAI est désormais clairement le meilleur fournisseur. L’API est stable, riche en fonctionnalités, et le rapport qualité-prix est excellent sur l’ensemble de la gamme de modèles. J’ai longtemps utilisé des modèles à poids ouverts comme Kimi K2.5 via Fireworks, mais il y avait des problèmes intermittents, idem chez Anthropic et Google. OpenAI est rapide et offre un meilleur rapport qualité-prix à presque tous les niveaux d’intelligence

    • L’API d’OpenAI est très stable ; je ne me souviens même plus de la dernière panne ou interruption
  • En général, je regarde le graphique de rapport qualité-prix d’OpenRouter et j’active "Show Pareto" à droite. Pour mes projets personnels, j’utilisais encore GLM-5.2, mais maintenant Luna devient le choix évident

    • Je me demande si OpenRouter ne proposait pas déjà Luna et Terra avec 50 % de réduction dès leur lancement. Je ne sais pas ce qu’il adviendra de cette remise après cette baisse de prix
    • D’après la documentation officielle, Luna semble plus proche de l’ancienne famille de modèles Nano ; je me demande si ses performances en code sont vraiment aussi bonnes
  • La baisse de prix de 80 % de Luna est très agressive. Pour la plupart des tâches qui n’exigent pas une intelligence de pointe, c’est un choix écrasant, et Luna peut parfois rivaliser avec Opus 5

    • Luna est un modèle conçu pour concurrencer Haiku ; je me demande sur quelles tâches il est au niveau d’Opus
    • Il y avait une différence notable entre xhigh de Sol et max de Luna. Sol comprend mieux les prompts, alors qu’avec Luna il faut donner des instructions plus spécifiques et plus claires
  • J’ai déjà préacheté beaucoup de tokens DeepSeek v4 flash, et une fois épuisés, j’aimerais essayer d’acheter des tokens Luna pendant un moment. Je préfère les modèles bon marché et rapides, et comme je suis à la retraite, cela ne me dérange pas de perdre un peu de temps à basculer manuellement vers un modèle plus puissant quand c’est nécessaire

  • Le fait que Luna soit 80 % moins cher est étonnant. Comme le coût du calcul continue de baisser, il se pourrait que l’an prochain les frais d’utilisation de l’API pour des modèles puissants deviennent inférieurs au prix d’un abonnement

    • Les abonnements ont une grande valeur pour les entreprises, car ils permettent de retenir les utilisateurs, donc l’API ne deviendra probablement pas moins chère qu’un abonnement