3 points par GN⁺ 13 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Le Kimi K3 de Moonshot Labs et le Qwen 3.8 d’Alibaba afficheraient des performances proches de Fable 5 d’Anthropic, et leurs poids devraient être publiés d’ici quelques semaines, ce qui étend la course aux modèles de pointe aux modèles ouverts
  • Le développement des modèles exige des chercheurs, du calcul et de l’électricité, mais après le déploiement, le coût marginal de l’inférence provient surtout du calcul et de l’énergie. Posséder des datacenters et des moyens de production électrique permet de les transformer en coûts fixes et d’élargir les marges à mesure que l’usage augmente
  • Les entreprises entièrement spécialisées dans les modèles, sans infrastructure, doivent miser soit sur les meilleures performances, soit sur une qualité suffisante à bas coût. Les percées possibles se réduisent à l’auto-amélioration récursive, à la fermeture du marché par la régulation, ou à la création de produits difficiles à copier
  • Chez Anthropic, Fable 5 coûte environ 3 fois plus cher par tâche complétée, et des harnais comme Claude Code et Cowork sont aussi en concurrence avec OpenCode, OpenClaw et Hermes. Le modèle, le produit et la structure de coûts sont simultanément remis en cause, ce qui accroît le risque de dégroupage
  • Avec l’arrivée successive de GLM 5.2, Kimi K3 et Qwen 3.8 en juin-juillet 2026, la capacité de rattrapage de plusieurs labos de recherche s’est confirmée. Cela affaiblit la défensibilité des acteurs centrés sur les modèles comme Anthropic, Moonshot Labs et Knowledge Atlas

La course aux modèles de pointe s’étend aux modèles ouverts

  • Kimi K3 a été lancé le 16 juillet 2026, et Qwen 3.8 a été annoncé le 19 juillet
    • Les deux modèles afficheraient des performances proches de Fable 5 d’Anthropic
    • Les poids des modèles devraient être publiés d’ici quelques semaines
  • Le GLM 5.2 de Knowledge Atlas est également un modèle ouvert de tout premier plan, lancé à la mi-juin
  • Cette dynamique est plus large que le seul « moment DeepSeek » de 2025
    • Elle montre que plusieurs labos peuvent rattraper non seulement des acteurs bien capitalisés comme Anthropic et OpenAI, mais aussi Meta et Grok de SpaceX
    • La compétition et le rattrapage se répètent, et en tenant compte des coûts, un renversement des performances reste possible à l’avenir

La structure de coûts des foundation models

  • Construire un modèle nécessite des chercheurs, des ressources de calcul comme des puces et des datacenters, ainsi que l’électricité nécessaire à leur fonctionnement
  • Une fois le modèle terminé, le coût principal vient de l’inférence, c’est-à-dire de l’utilisation du modèle par les utilisateurs
    • L’étape d’inférence mobilise elle aussi du personnel, du calcul et de l’électricité
    • Comme le modèle n’est pas continuellement réentraîné, la part du coût salarial y est plus faible qu’à l’entraînement, et l’essentiel du coût marginal se concentre sur le calcul et l’énergie
  • L’activité d’inférence doit optimiser les coûts d’électricité et de datacenter, et plus un acteur possède la chaîne de valeur, plus il peut convertir des coûts variables en coûts fixes

L’étendue de l’infrastructure possédée détermine la marge

  • Anthropic, Knowledge Atlas et Moonshot Labs s’approvisionnent en datacenters et en électricité auprès d’acteurs externes, sans posséder leurs propres datacenters ni centrales
  • Meta et Alibaba construisent directement leurs datacenters, mais achètent l’électricité à d’autres fournisseurs
  • SpaceX a choisi de posséder à la fois les moyens de production électrique et les datacenters
  • Les entreprises dépendantes de datacenters et d’électricité externes gagnent de l’argent en ajoutant une marge au coût d’inférence facturé aux clients
    • Comme les coûts augmentent avec le chiffre d’affaires, il est difficile d’élargir les marges même si l’usage progresse
  • Posséder une centrale ou un datacenter transforme une part importante du coût d’inférence en coût fixe, ce qui permet d’augmenter les marges à mesure que l’utilisation client augmente

L’infrastructure élargit les options stratégiques

  • Plus une entreprise possède d’éléments de la stack d’infrastructure, plus elle peut monétiser cette infrastructure elle-même
    • Même si son propre modèle n’est pas le meilleur, elle peut héberger un modèle open source performant
    • Elle peut aussi louer son matériel à d’autres entreprises
  • Meta discuterait d’un contrat de 10 milliards de dollars pour fournir de la capacité serveur à Anthropic
  • SpaceX a signé un accord cloud avec Google et discuterait aussi de la fourniture de puissance de calcul au département américain de la Défense
  • Sans datacenter ni moyens de production électrique, le succès dépend de la demande pour le modèle
    • Le modèle doit soit être le meilleur en performance, soit être peu cher tout en restant suffisamment bon
    • L’entreprise se retrouve dans une compétition où elle doit continuer à baisser le prix de l’inférence ou conserver sa place de meilleur fournisseur de modèles

Les trois voies de survie des entreprises spécialisées dans les modèles

  • Anthropic, OpenAI, DeepSeek, Moonshot Labs et Knowledge Atlas auront du mal à survivre dans le marché hyperconcurrentiel des foundation models s’ils ne parviennent pas à rester en tête
  • Il existe trois voies permettant à une entreprise centrée sur les modèles de l’emporter
    1. Atteindre en premier une auto-amélioration récursive grâce à des ressources de calcul suffisantes et distancer nettement les concurrents
    2. Fermer le marché par la régulation
    3. Construire un produit suffisamment unique pour être impossible à copier, ou capable de retenir fortement les utilisateurs

La stratégie de coûts et de régulation d’Anthropic

  • Parmi les laboratoires de pointe, Anthropic est celui qui s’appuie le plus sur une stratégie réglementaire et sur l’auto-amélioration récursive
  • L’approche centrée sur l’éthique révélée par l’autocensure de Fable et Mythos est liée à cette stratégie réglementaire
    • Par la suite, des mesures du gouvernement américain ont aussi limité de futurs lancements
  • Sur le plan des performances, Anthropic reste en tête, mais ses prix sont bien plus élevés que ceux d’OpenAI et des modèles ouverts
    • Dans les comparaisons d’Artificial Analysis, le coût par tâche complétée de Fable 5 atteint presque 3 fois celui des concurrents
    • On ne sait pas encore si les utilisateurs accepteront de payer ce prix pour un meilleur modèle
  • Certains chercheurs et fondateurs s’attendent à une guerre des prix, en raison de la diffusion de la concurrence et de la saturation des benchmarks IA qui ne reflètent pas les prix

Concurrence sur les harnais et pression de dégroupage

  • Anthropic a investi dans des produits comme Claude Code et Cowork, mais une stratégie centrée sur les harnais d’agents comporte des risques
  • OpenCode, OpenClaw, Hermes et plusieurs startups de harnais innovent dans le même domaine
  • Les barrières à l’entrée pour construire un foundation model sont très élevées, mais celles pour lancer son propre harnais IA sont presque nulles
  • Anthropic subit une pression de dégroupage dans trois directions
    • Le modèle devient la référence que les concurrents doivent dépasser
    • Le produit fait face à des défis de plus en plus forts de la part d’acteurs fermés comme open source
    • Le modèle économique sans infrastructure en propre est défavorable sur le plan des coûts
  • En l’absence d’intervention réglementaire ou d’invention effective de l’AGI, Anthropic pourrait avoir du mal à conserver sa place de numéro un des fournisseurs de foundation models

La stratégie de défense différente choisie par OpenAI

  • Les modèles d’OpenAI sont en retrait par rapport à Anthropic depuis quelques mois, mais l’entreprise investit dans le produit, l’expérience grand public, la publication sur son site, la voix et le hardware
  • Dans ces domaines, la base défendable apparaît plus clairement que dans les produits d’Anthropic centrés sur les harnais
  • OpenAI est aussi plus ouvert à la possession de datacenters et à l’investissement dans la production électrique
  • Certains estiment que cette stratégie dilue la concentration, mais elle pourrait renforcer la résilience à long terme
    • L’entreprise montre une flexibilité et un goût du risque pour tenter des produits dotés d’effets de réseau et de défensibilité
    • Elle peut optimiser ses marges à long terme

La défensibilité en baisse des acteurs centrés sur les modèles

  • Kimi K3 et Qwen 3.8 montrent que les modèles ouverts peuvent eux aussi atteindre la frontière des performances
  • À long terme, selon le critère d’un modèle économique durable, les entreprises qui ne fournissent que des modèles sont particulièrement exposées
  • Knowledge Atlas, Moonshot Labs et Anthropic ont plus de mal à construire une défensibilité qu’OpenAI, Alibaba, SpaceX, Meta et Google, qui disposent d’infrastructures et d’autres actifs produits

1 commentaires

 
Avis de Hacker News
  • Vu l’avalanche de modèles à poids ouverts et à architectures ouvertes ces derniers jours, il semble de plus en plus probable que le vainqueur sera finalement celui qui gravera le plus vite un modèle en ASIC
    Comme l’a montré l’annonce de K3, les LLM eux-mêmes peuvent aussi effectuer une partie de la conception de puces, et les modèles de pointe sont déjà suffisants pour un large éventail de tâches ; ils atteindront bientôt ce niveau pour une bonne partie du développement logiciel
    Si Fable 5 tournait sur un ASIC à 9 000 tokens par seconde au lieu de 150 tokens par seconde sur GPU Nvidia, cela couvrirait la majeure partie de la demande
    Les entreprises aussi pourraient traiter divers usages de manière plus sûre avec quelques ASIC on-premise, plutôt que de transmettre leurs données à OpenAI ou Anthropic

    • Les ASIC pour cryptomonnaies concernaient des algorithmes qui évoluaient lentement et dont le contenu était bien connu, mais les architectures de LLM changent beaucoup plus vite
      Je ne voudrais pas prendre le risque qu’un nouvel article ou une nouvelle approche plusieurs fois plus rapide apparaisse pendant que l’on peaufine les détails de sortie d’une puce
      Les développeurs ont très peu de fidélité à une marque et migrent directement vers le meilleur modèle ; tant que le meilleur modèle tourne sur des GPU programmables, les GPU resteront dominants, à mon avis
    • Ça sonne comme un jugement du type « 640 Ko devraient suffire à tout le monde »
    • Même les derniers modèles d’OpenAI et d’Anthropic sont très mauvais pour planifier des itinéraires de voyage
      Je les utilise souvent, mais ils enfreignent complètement les contraintes demandées, et environ la moitié des étapes recommandées ne respectent pas les filtres
    • Fable et Mythos ressemblent à d’énormes Xeon, tandis que les petits modèles légers ressemblent à de nombreuses puces ARM peu gourmandes en énergie ; on a l’impression de voir se rejouer le duel Intel contre ARM
      Si l’on suit les clients qui demandent de créer des modèles toujours plus gros comme si les ressources étaient illimitées, on gagne beaucoup d’argent à court terme, mais on risque de se faire dépasser par un équivalent d’Apple Silicon, porté par l’efficacité et l’amélioration continue
    • Le matériel sur mesure existe déjà, comme chez Cerebras
      Un laboratoire a fait passer un modèle de 8 milliards de paramètres, qui générait environ 100 tokens par seconde sur une pile logicielle classique, à environ 3 000 tokens par seconde sur une seule MI300X
      De la mémoire flash à haute bande passante de plusieurs To, capable de lire plus de 1 To par seconde, est également en développement ; dans quelques années, il sera donc peut-être possible de faire tourner localement un modèle de 3 000 milliards de paramètres sur une carte dotée de 40 à 90 Go de HBM et de 4 To de HBF, pour environ 10 000 à 20 000 dollars
  • Le cas Figma me revient sans cesse à l’esprit
    Mike Krieger, CPO d’Anthropic et cofondateur d’Instagram, siégeait au conseil de Figma, mais a démissionné juste avant la présentation de Claude Design ; Figma, tout en s’appuyant sur les modèles d’Anthropic et sur une intégration commune « Code to Canvas », n’aurait pas été informée à l’avance de l’étendue de Claude Design
    Juste après l’annonce, l’action Figma a chuté de 7 %, concrétisant le scénario de fin du SaaS dans lequel les entreprises de modèles de fondation grignotent la couche applicative de leurs partenaires SaaS
    Il faut être prudent lorsqu’on fournit des données à des entreprises de LLM ou que l’on dépend d’elles : si l’idée d’une startup IA réussit, elles peuvent entrer directement en concurrence ou contrôler les prix de l’API

    • Cela rappelle les développeurs qui avaient créé des apps sur FB et Twitter, puis plus tard sur l’API Reddit, avant de se faire un jour retirer le socle sous les pieds
    • Les revenus des outils de codage comptent aujourd’hui, mais ce n’est pas l’objectif final ; pour justifier leurs valorisations gigantesques, les entreprises d’IA doivent devenir des super-apps grand public
      OpenAI conçoit même son propre matériel pour s’affranchir de sa dépendance à Apple et Android, et mise gros sur un super-appareil grand public
      La bataille de long terme n’est pas IA contre SaaS, mais une compétition avec de grandes marques grand public comme Apple, Google, Meta et Amazon ; si quelqu’un parvient le premier à créer l’assistant numérique ultime, capable d’accepter n’importe quelle tâche et de générer instantanément le code et l’interface, même Apple pourrait paraître dépassée
    • Le capitalisme actuel tourne autour de comportements monopolistiques ; si les entreprises de LLM atteignent le niveau où elles peuvent remplacer des employés, on peut s’attendre à ce qu’elles aillent elles-mêmes chercher l’or plutôt que de vendre des pelles
      Les produits construits au-dessus d’autres services sont faciles à racheter ou à absorber par le service de base, et Apple a elle aussi discrètement intégré à iOS les fonctionnalités de nombreuses apps populaires
    • Vers la sortie de GPT 5, j’avais créé une app de personnalisation de CV, mais au moment où GPT 5.5 est arrivé, il était déjà possible de générer directement des CV PDF et Word parfaits en conservant la mise en forme d’origine
      Créer un simple wrapper tout en concurrençant les labos est risqué, mais c’est aussi une nouvelle ère du logiciel : si l’on construit un produit de valeur qu’un chatbot ne peut pas simplement répliquer, il n’y a pas de quoi s’inquiéter
    • Anthropic et OpenAI subissent une pression concurrentielle trop forte pour poursuivre toutes les idées de produits imprudentes avec du capital et des développeurs ; j’estime donc que l’époque où les grandes entreprises copiaient les startups à coups d’argent est terminée
  • Je pense que le risque est exagéré
    Il existe une demande prête à payer davantage pour de meilleurs modèles, et la valeur que j’en tire dans mon flux de travail est bien supérieure aux 200 dollars par mois versés à un labo de pointe, donc je n’envisage pas vraiment de réduire un peu les coûts
    La valeur vient davantage de l’environnement d’exécution fourni par Claude Code ou Codex que du LLM lui-même, et les implémentations open source comme OpenCode sont encore très loin derrière
    Excel a bien Google Sheets, presque équivalent et offrant plus de 90 % de ses fonctionnalités, mais la valeur créée par un tableur dépasse largement 100 dollars par an, ce qui maintient le puissant moat de Microsoft

    • L’argent de Claude et d’OpenAI vient des clients entreprises, et celles-ci sont sensibles aux coûts au point d’avoir des postes dédiés à l’optimisation des coûts d’infrastructure
      Ces deux sociétés ne sont pas non plus valorisées à 1 000 milliards de dollars à cause de leur environnement d’exécution
      Excel en entreprise coûte environ 50 dollars par mois, mais les laboratoires fermés facturent plusieurs fois plus par utilisateur, et même moi, qui ne code pas beaucoup, j’en consomme au moins pour environ 50 dollars par jour
    • Les entreprises ne peuvent pas utiliser les abonnements grand public fortement subventionnés, et je connais une organisation d’environ 100 développeurs utilisant activement l’IA qui dépense 500 000 dollars par mois
    • Considérer 200 dollars par mois comme négligeables relève d’un point de vue de pays développé riche
      Là où je vis, un salaire mensuel de 200 dollars n’est pas rare, et un développeur gagne environ 1 000 dollars ; quelle que soit la valeur apportée, on ne peut pas l’utiliser si l’on ne peut pas payer son loyer et sa nourriture
      Même dans les pays développés, 200 dollars par mois sont difficiles à assumer pour des étudiants ou des entrepreneurs qui ne sont pas aisés
    • Codex lui-même est aussi publié en open source : https://github.com/openai/codex
    • L’écart de performance justifiant de payer plus pour un meilleur modèle se réduit rapidement
      Jusqu’à il y a une semaine, cela valait la peine de payer pour Fable, mais avec l’arrivée de K3, l’écart s’est tellement resserré pour moi que je ne peux plus justifier le coût
      Si le résultat réel est 10 % meilleur, on peut payer 5 fois plus, mais beaucoup moins de gens paieront 5 fois plus pour une amélioration de 2 %
      En outre, être forcé d’utiliser Claude Code au lieu de son environnement d’exécution préféré n’est pas un avantage d’Anthropic, mais un inconvénient
  • La vitesse à laquelle Fable est passé de « modèle qui change la donne et qu’il faudrait interdire » à « correct, mais OpenAI fait aussi quelque chose de similaire et il existe des alternatives à poids ouverts » est étonnante
    Le cycle de la hype s’est raccourci, et cette fois nous avons peut-être réellement atteint un plateau

    • Fable reste le même excellent modèle, et les textes qui spéculent sur l’avenir de l’industrie des LLM ne sont ni très éclairants ni très intéressants ; mieux vaut donc ne pas trop s’en soucier
    • En début d’année, les modèles à poids ouverts avaient 4 mois de retard sur OpenAI et Anthropic, mais l’écart n’est plus que de 4 à 6 semaines
    • Les méthodes d’entraînement avides qui ne sont possibles qu’en l’absence de garde-fous finissent par atteindre leurs limites
      L’information change constamment, ce qui oblige à mettre les modèles à jour, mais les données disponibles gratuitement vont devenir de plus en plus rares
  • OpenAI, comme Anthropic, est de fait un fournisseur quasi exclusivement centré sur les modèles ; je me demande donc pourquoi elle ne serait pas vulnérable de la même manière

    • ChatGPT est devenu synonyme de LLM pour les usages non techniques et non professionnels, et accumule un énorme historique utilisateur
      Cet historique apporte du contexte personnel, améliore le produit et peut aussi servir à l’entraînement des modèles et à la publicité
      Dans un futur où, lorsqu’on saisit « planifie mes vacances », tout le processus est orchestré, les utilisateurs ne passeront pas facilement à un autre modèle 10 % moins cher ou meilleur
    • OpenAI se diversifie dans le matériel grand public tout en possédant aussi davantage de datacenters en propre
      Si le produit sort réellement et rencontre un certain succès, l’entreprise pourrait occuper une position unique qui la distingue des autres laboratoires de pointe
    • Le texte distingue les produits, l’expérience consommateur, la publication sur site, la voix et les investissements matériels comme des moats plus clairs
      Cela dit, ces différenciateurs sont actuellement en dessous des attentes ou, comme le hardware, totalement non éprouvés
    • Elle développe aussi non seulement des wearables grand public, mais surtout des puces d’inférence
      Créer un bon modèle et le fournir rapidement tout en absorbant la demande sont deux choses différentes
      Anthropic a rencontré ce problème il y a environ 6 mois, et Moonshot n’a pas non plus réussi à absorber la demande, au point d’avoir déjà interrompu les abonnements à son offre de codage
  • Si la limite supérieure du progrès de l’IA est l’auto-amélioration récursive, alors l’IA fabriquera de meilleurs modèles et les propriétaires de datacenters gagneront, ce qui signe la fin d’Anthropic et d’OpenAI
    Si la limite inférieure est la stagnation, la concurrence portera sur la fourniture de performances maximales constantes au prix le plus bas
    L’annonce selon laquelle Google fabriquerait une puce Gemini avec les poids gravés dans le silicium signifie, compte tenu d’une durée de vie des puces d’au moins 2 à 3 ans, qu’il ne s’attend pas à des progrès comparables dans les trois prochaines années ; au bout du compte, ce sera une concurrence aux marges minimales, ce qui désavantage à nouveau ces deux entreprises
    Pour survivre, le progrès de l’IA doit rester entre ces deux extrêmes

    • Pour les modèles à poids ouverts, il faut dès maintenant du calcul distribué à la SETI@home
    • Graver les poids dans les puces améliore la vitesse d’inférence et l’efficacité énergétique, avec comme effet secondaire de placer les utilisateurs finaux dans un cycle continu de renouvellement matériel
  • OpenAI paraît beaucoup plus en danger qu’Anthropic
    Le fait que l’une prépare une IPO tandis que l’autre évite de publier ses comptes en dit long

  • Le point essentiel est de savoir si d’autres laboratoires peuvent créer des modèles plus avancés que ceux d’Anthropic et d’OpenAI
    Il est aussi important de savoir dans quelle mesure ils dépendent des API de ces deux entreprises, par distillation ou autre ; s’il s’agit de modèles dérivés, je m’attends à une plage de performance étroite et à un progrès limité

    • Il n’est pas nécessaire d’être en tête en performance brute ; l’important est la valeur par rapport au coût
      Chez les entreprises qui achètent des tokens, il apparaît déjà clairement qu’un gain d’intelligence ne se traduit pas par une hausse du chiffre d’affaires, et au final ce sont les finances qui guideront les décisions
      Si j’étais OpenAI ou Anthropic, je serais extrêmement inquiet
  • Dario peut inverser la tendance s’il refait la tournée des podcasts en menaçant que son IA fera disparaître 75 % des emplois
    Si ça ne marche pas, il peut monter à 85 %, puis à 100 % si besoin

  • En novembre 2025, Anthropic Opus 4.5 et Claude Code étaient les seuls systèmes capables d’implémenter correctement du premier coup une fonctionnalité clairement définie, mais aujourd’hui je suis presque aussi satisfait de Claude que de Codex
    Si les deux entreprises mettent la pression sur les prix ou durcissent excessivement leurs politiques de sécurité, il devrait y avoir de plus en plus d’options pour passer à des modèles à poids ouverts performants et à de véritables environnements d’exécution open source
    Gemini 3.1 Pro a l’air puissant, mais la dernière fois que j’ai essayé Antigravity, il était incompétent
    C’est une bonne chose qu’Anthropic survive comme l’un des concurrents solides, mais sa philosophie axée sur la sécurité accroît les refus et l’ignorance délibérée de ses modèles les plus récents
    À long terme, l’entreprise pourrait être retenue comme celle qui a accéléré le développement logiciel pour que d’autres construisent des outils moins timorés

    • Je préférerais carrément qu’Anthropic décline et qu’une autre entreprise prenne sa place