1 commentaires

 
GN⁺ 3 시간 전
Réactions sur Hacker News
  • Le titre actuel, « DeepSeek pause fundraise after comments on compute gap to US leaked (transcript) [pdf] », peut se lire comme si une fuite révélait que DeepSeek suspend sa levée de fonds après avoir pris conscience de son retard en ressources de calcul face aux États-Unis
    Pourtant, la plupart des lecteurs comprendront plutôt que la levée de fonds est suspendue parce que des propos sur cet écart de ressources de calcul ont fuité, et cette interprétation n’est pas fausse

    • Quelque chose comme « Leaked DeepSeek transcripts reveal plan to pause fundraising due to compute gap » serait peut-être mieux
      Cela dit, on ne sait toujours pas clairement ce que désigne exactement cet écart de ressources de calcul, ni s’il est bien la cause de l’arrêt de la levée, donc le titre donne l’impression de fusionner plusieurs idées distinctes
    • En parcourant le document, la deuxième interprétation semble au contraire plus juste, c’est-à-dire la suspension de la recherche d’investisseurs en réaction à la fuite
      Il contient pas mal d’informations confidentielles sur l’entreprise ainsi que sur sa stratégie future pour rivaliser avec les labos américains, donc ils ont probablement très mal pris cette fuite et semblent avoir gelé les investissements à titre punitif. Si leur conclusion avait vraiment été qu’ils manquaient de ressources par rapport à la concurrence, il serait illogique d’arrêter la levée de fonds
    • Tous les articles en chinois pointent vers la deuxième interprétation. Le point central est qu’une discussion privée de Liang Wenfeng avec des investisseurs a fuité en ligne, ce qui l’a mis hors de lui
      Par exemple : https://x.com/_FORAB/status/2081034500101017616?s=20
    • J’ai envisagé de poster un article expliquant la formulation du titre, mais j’ai jugé la transcription plus intéressante. Ce serait bien de pouvoir l’ajouter comme lien complémentaire
      https://www.bloomberg.com/news/articles/2026-07-25/deepseek-...
      Une copie pratiquement identique avec un paywall moins contraignant est consultable sur https://fortune.com/2026/07/25/deepseek-liang-wenfeng-backer... et https://archive.ph/zpIrG
  • Un article apportant un peu plus de contexte est https://www.cyberkendra.com/2026/07/deepseek-pauses-fundrais...
    Selon Bloomberg, quelques jours après que des propos de Liang Wenfeng sur la compétition IA entre les États-Unis et la Chine ont circulé en ligne, DeepSeek a informé les investisseurs potentiels de son tour de table de série B que l’opération était suspendue. Les 118 points publiés par un média tech affilié à Tencent couvrent la stratégie AGI, l’approvisionnement en puces, les prix et la rétention des talents, et Liang y présente la faiblesse de la Chine comme un problème arithmétique de ressources plutôt qu’un manque de talents
    Il a notamment indiqué qu’il fallait 200 000 puces Huawei 950 pour entraîner des modèles de pointe, mais que l’entreprise n’en avait obtenu que 16 000, et que l’insuffisance des capacités de production de Huawei devrait durer au moins trois ans. Il a aussi exposé un plan visant à réduire l’écart à 3 à 6 mois avec les labos américains malgré des ressources de calcul bien moindres

    • Je me demande aussi si la Chine pourrait adopter une stratégie d’expansion massive de fabs de puces logiques moins sophistiquées. Les GPGPU et l’IA semblent bien plus dépendants de la bande passante mémoire que le graphisme, avec une intensité de calcul plus faible
      On lit souvent que réduire l’amortissement pour prolonger la durée de vie des GPU est une « astuce comptable », mais il est aussi possible que leur durée de vie réelle soit plus longue, car les gains de bande passante des nouveaux GPU ne sont pas énormes. Le fait que les actions des fabricants de mémoire aient explosé alors que NVIDIA stagne reflète peut-être cela. Comme l’écart entre la Chine et les États-Unis est plus faible sur la fabrication de mémoire de pointe, son désavantage est peut-être exagéré
    • Cela augmente aussi la probabilité de voir se poursuivre l’amélioration des petits modèles et leur passage en open source
      Il existe une illusion selon laquelle l’approche des entreprises américaines de l’IA serait la meilleure, mais les modèles de pointe sont énormes, et il reste peut-être des centaines d’optimisations possibles. Si l’on pousse les poids ouverts, ces inefficacités pourront continuer à être réduites
  • Si les modèles chinois à poids ouverts rattrapent les États-Unis et atteignent des performances de pointe pour une fraction du coût, alors les modèles d’IA deviennent au final des produits génériques, et les investissements de dizaines de milliards, voire de milliers de milliards de dollars des laboratoires américains ne produisent-ils pas seulement des rendements décroissants, avec un avantage qui n’est même pas durable ?
    Dans ce cas, on peut aussi se demander pourquoi DeepSeek suit la même voie : si l’écart de performance est temporaire et le coût énorme, est-il vraiment si important d’être absolument à la frontière ultime ?

    • Les décideurs politiques américains pensent que même si l’écart n’est que de 6 mois à 1 an, le camp qui atteindra l’AGI en premier pourrait obtenir un avantage suffisant pour neutraliser de fait un adversaire. On peut en deviner la portée quand ils évoquent la cyberguerre et les armes de destruction massive. Jensen Huang, lui, considère l’IA comme un marathon
    • DeepSeek est financé par le hedge fund High-Flyer, et limite volontairement le prix des tokens à un niveau qui permet seulement de couvrir les coûts de serveurs
      Dans l’enregistrement, cela est présenté comme un devoir moral ; ils disent ne pas s’intéresser à la surchauffe autour de la génération d’images, de vidéos ou des world models, et se concentrer uniquement sur le raisonnement, le processus de pensée et l’apprentissage continu
    • Le document traite ce point avec franchise et dit que DeepSeek ne s’attend pas, ni ne vise, à devenir un acteur de tout premier plan
      Au lieu de viser une domination mondiale, l’entreprise cherche à continuer d’apporter sa contribution au progrès des grands modèles de langage, et la commercialisation n’est qu’un objectif lointain. Étant donné que le service existe déjà, la commercialisation semble ici signifier la génération de profits substantiels. Dans cette optique, il est compréhensible qu’ils aient annulé une levée de fonds en réponse à la fuite
    • À voir ses propos lors de la réunion avec les investisseurs, Liang semble convaincu de l’AGI et prêt à tout miser dessus. Il semble penser que l’arrivée de l’AGI rebattrait complètement les cartes, mais les effets sur le travail et la consommation seraient tels que l’impact économique réel reste difficile à prévoir
      Il reconnaît qu’il reste encore beaucoup de chemin et qu’il faudra aussi récupérer les coûts en cours de route, mais estime que se focaliser sur les profits à court terme réduit les chances de réussir l’AGI, et que cela reste insignifiant face à la valeur que l’AGI pourrait apporter. Il met l’accent sur la retenue comme culture d’entreprise et continue d’investir dans l’IA parce qu’il croit à des percées, pas à de simples gains de performance
    • Vu la quantité de propagande émanant d’entreprises chinoises soutenues par l’État, l’affirmation selon laquelle cela a été développé pour une fraction du coût est sujette à controverse. Il existe des indices d’une contrebande massive de GPU via des pays tiers comme Singapore, mais la Chine ne peut pas l’admettre publiquement
      S’il s’agit de distillation, ce sera de toute façon bien moins coûteux qu’un entraînement depuis zéro, et le coût du travail en Chine est aussi inférieur à celui des États-Unis. Anthropic a affirmé qu’Alibaba avait interagi 28,8 millions de fois avec Claude entre avril et juin 2026 via environ 25 000 faux comptes, mais il est aussi possible qu’une partie, voire la totalité, ait été automatisée par des agents
  • Le dépôt a été réécrit par force push, donc les anciens liens sont cassés, mais le fichier reste consultable sur https://github.com/demo-zexuan/liang-wenfeng-investor-meetin...

    • Ces documents sont particulièrement précieux pour comprendre la manière de penser en interne chez DeepSeek. Le passage expliquant qu’ils veulent fixer le prix du raisonnement à un niveau permettant de récupérer les dépenses d’investissement en 10 mois — et pas davantage — est intéressant
      Les motivations de Liang Wenfeng sont très différentes de celles des entrepreneurs auxquels on est habitué en Occident
  • Cette transcription se lit très différemment des propos de dirigeants mégalomanes à la tête d’Anthropic ou d’OpenAI

    • On peut se demander si la personne a déjà lu des transcriptions de réunions avec investisseurs d’Anthropic ou d’OpenAI. Pour voir comment sont rédigés les documents officiels d’une entreprise, il faut lire un dossier d’introduction en bourse ; à défaut, on peut consulter la section « CAUTIONARY STATEMENT REGARDING FORWARD-LOOKING STATEMENTS » des documents de SpaceX
      https://www.sec.gov/Archives/edgar/data/1181412/000162828026...
    • Je ne comprends pas pourquoi on continue à mettre OpenAI et Anthropic dans la même catégorie. On peut aussi considérer qu’OpenAI est mauvais, mais Anthropic est bien pire, au point de ne même pas être comparable
      Dans la récente lettre sur les poids ouverts et l’open source, les grands groupes technologiques, dont OpenAI, ont signé, mais Anthropic était le seul absent, et ses employés subissent de vives critiques sur X à cause de propos comme https://x.com/Mononofu/status/2080937562739531837. Ils semblent penser que tout le monde sauf eux est stupide, facilement manipulable, et qu’on ne peut pas lui confier l’IA ; eux seuls devraient garder le contrôle. Une culture de type sectaire s’est formée, où les employés portent idéologiquement aux nues des dirigeants en quête de pouvoir et de richesse, et les dépenses politiques publiques sont déjà passées de 20 millions de dollars à 40 millions de dollars
  • L’objectif central est l’AGI, et son préalable est l’apprentissage continu. Tout le monde cherche comment l’implémenter, et à ce stade une base fondée sur l’exécution d’agents semble la piste la plus crédible
    Moi aussi, je travaille sur le même problème avec https://github.com/rush86999/atom

  • Le document semble avoir été supprimé à nouveau, mais on peut retrouver les propos de Liang ailleurs
    [1] https://aiproem.substack.com/p/must-read-deepseek-liang-wenf...

  • L’essentiel des propos semble être un manque de ressources pour acheter des NVIDIA H200. Liang indique que si l’entreprise pouvait dépenser 2 milliards de dollars cette année, cela signifierait que l’équipe des achats a fait un travail exceptionnel, que l’écart principal avec les États-Unis ne tient pas aux talents humains mais aux ressources, et qu’elle ne peut actuellement pas supporter le coût d’entraînement de ses plus grands modèles
    Trump a lancé durant son premier mandat une guerre commerciale axée sur le blocage du développement de l’industrie chinoise des semi-conducteurs, et la Chine a réagi par une forte montée en puissance dans des secteurs avancés comme les véhicules électriques, le LiDAR et le solaire. Lors de son second mandat, il a empêché NVIDIA de vendre des puces à la Chine, mais face aux progrès remarquables de l’industrie chinoise des semi-conducteurs, il a reculé ; ensuite, la Chine a au contraire interdit aux entreprises nationales d’acheter du NVIDIA afin de soutenir son industrie locale. Il faudra encore des années avant l’EUV, mais le pays produit déjà lui-même la plupart des puces gravées au-delà de 14 nm et continue de croître rapidement

    • Il est intéressant que la Chine bloque désormais les puces étrangères. Ce n’est pas un indicateur décisif, mais si elle considère qu’utiliser des ressources américaines aiderait davantage les États-Unis que son propre camp, ce n’est pas un bon signe pour la domination américaine
  • Je me demande quel est le facteur fondamental qui limite la capacité de production de Huawei. La Chine a déjà montré sa capacité à monter rapidement en puissance quand c’est nécessaire, donc si le problème se résumait à construire davantage d’installations avec une technologie déjà maîtrisée, l’expansion aurait sans doute eu lieu depuis longtemps

    • Le rendement des puces hautes performances utilisables pour l’entraînement est très faible, et l’entreprise ne parvient pas non plus à obtenir davantage d’équipements ASML d’ancienne génération, nécessaires pour augmenter les volumes malgré ce faible rendement
      Il pourrait encore falloir plusieurs années, voire une décennie, pour disposer de la base technologique permettant de produire de manière économiquement viable des puces hautes performances en interne
    • Pour que les puces de Huawei restent compétitives, un packaging 3D avancé est nécessaire, mais le procédé est si complexe que le rendement reste faible. La demande est forte, non seulement chez DeepSeek mais aussi ailleurs, et Huawei est lui-même un grand consommateur