1 points par GN⁺ 3 시간 전 | 1 commentaires | Partager sur WhatsApp

1 commentaires

 
GN⁺ 3 시간 전
Commentaires sur Hacker News
  • Pour une grande entreprise qui dépense plusieurs millions de dollars par mois en coûts d’inférence, acheter directement un rack GB300 à environ 6 millions de dollars peut avoir du sens
    Sur les 20,7 To de mémoire, il ne faut même pas 10 % pour charger l’ensemble du modèle MXFP4, et avec une bande passante HBM totale de 576 To/s, il est possible d’exécuter en parallèle plus de 6 000 tâches d’agents avec un contexte moyen de 100 000 tokens à environ 30 tokens/s
    En supposant 1,5 million de dollars par an d’amortissement et d’électricité, ainsi qu’un taux d’utilisation moyen de 50 %, le coût tombe à moins de 0,6 dollar par million de tokens en sortie ; les données restent en interne et cela revient à plus de 10 fois moins cher qu’un service hébergé
    Pour les entreprises convaincues que les modèles à poids ouverts vont continuer à progresser et que l’IA va durer, c’est la première vraie justification claire pour décider d’acheter le rack soi-même

    • Ils font tourner Kimi 2.8 sur un serveur à 107 000 dollars et traitent plus de 50 000 tokens par seconde sur la plupart des tâches
      Les économies dépassent déjà ce qu’ils avaient dépensé en tokens pour Claude et Gemini l’an dernier
    • Embaucher 2 à 3 personnes DevOps pour l’exploitation ajoute encore 400 000 à 700 000 dollars, et les pannes comme la maintenance deviennent entièrement à la charge de l’entreprise
      Malgré cela, ils ne font pas confiance aux LLM hébergés pour les données qui doivent rester confidentielles
    • Il faut aussi un espace avec refroidissement liquide et alimentation électrique ultra-dense, donc un site de colocation classique ou une simple salle serveurs interne aura du mal à suivre
    • Une entreprise capable d’acheter un rack et l’infrastructure associée à 6 millions de dollars doit aussi prendre en compte les conditions de licence commerciale applicables, donc le calcul n’est pas si simple
  • Plusieurs infrastructures open source ont aussi été publiées avec le modèle
    https://github.com/MoonshotAI/MoonEP
    https://github.com/kvcache-ai/AgentEnv
    https://github.com/MoonshotAI/FlashKDA
    Il est difficile de comprendre l’idée selon laquelle les modèles à code source et poids ouverts ralentiraient les progrès de l’IA

    • J’y voyais au contraire un frein au progrès
      D’autres labos peuvent rattraper les plus avancés en distillant leurs modèles, ce qui prive ces derniers d’une partie des revenus qu’ils pourraient réinvestir dans la génération suivante
      Si l’on voulait une accélération totale, il faudrait selon moi nationaliser les deux grands labos et les fermer sur le modèle du projet Manhattan jusqu’à atteindre l’auto-amélioration récursive (RSI), mais les contre-arguments dans les réponses m’ont fait fortement évoluer sur ce point
  • La licence de Kimi-K3 peut être consultée ici : https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
    Les prestataires de Model as a Service dont le chiffre d’affaires consolidé avec les filiales dépasse 20 millions de dollars sur 12 mois consécutifs doivent conclure un accord distinct avec Moonshot AI avant tout usage commercial
    Les conditions existantes comprennent aussi une clause imposant d’afficher le nom Kimi si l’on compte plus de 100 millions d’utilisateurs actifs mensuels ou si le chiffre d’affaires du produit commercial dépasse 20 millions de dollars

    • Kimi 2.6 utilisait déjà une licence du même type, https://huggingface.co/moonshotai/Kimi-K2.6/blob/main/LICENS..., et cela semble remonter jusqu’à K2
      Les modèles publiés en 2025 étaient sous une licence MIT propre, mais à partir de moonshotai/Kimi-K2-Thinking en janvier 2026, ils ont commencé à utiliser une licence MIT modifiée
    • On peut déjà se demander à quoi cette licence s’applique réellement au départ
      Il n’est même pas clair que les poids du modèle soient couverts par le droit d’auteur
    • Aux États-Unis, on peut soutenir que les poids d’un modèle de machine learning sont le produit de processus d’optimisation automatiques comme la descente de gradient stochastique, l’espérance-maximisation ou les algorithmes génétiques, et qu’ils ne relèvent donc pas du droit d’auteur
      Cela n’a pas encore été entièrement validé par les tribunaux, et comme le coût d’un procès est élevé, les employeurs chercheront en général à respecter la licence par prudence
      Thaler v. Perlmutter a confirmé qu’un auteur humain est requis pour le droit d’auteur, et les directives de l’Office américain du copyright précisent également qu’une œuvre générée automatiquement par une machine sans intervention créative humaine ne peut pas être enregistrée
      Les dispositions suivantes excluent aussi du droit d’auteur les principes mathématiques, formules, algorithmes et équations ; si l’on considère donc le modèle comme un algorithme, la conclusion paraît relativement claire
      [1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
      [2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
    • Le fait qu’on puisse le télécharger est déjà mieux, mais avec ces conditions, il est dommage qu’on puisse difficilement parler de véritables poids ouverts ou d’open source
    • On peut aussi se demander comment ils comptent repérer les contrevenants à la licence pour en faire des cibles de poursuite
  • L’approche d’un graphe de connaissances hiérarchique auto-évolutif qui se développe en continu pendant que les agents explorent à l’échelle du web les domaines intensifs en connaissances et le code est intéressante

  • Voir la fonction d’activation revenir vers tanh donne l’impression que les modes techniques sont cycliques

    • D’après la page 6 du papier, ils n’utilisent pas tanh tel quel mais f_gate(b,x) = b * tanh(x / b) * sigmoid(x) et f_up(b,x) = b * tanh(x / b)
      Sur le graphe, cela semble chercher à combiner les avantages du GLU, qui offre une meilleure expressivité quand x dépasse environ 5, et les avantages du SwiGLU, où les valeurs juste avant 0 remontent
  • La composition de tâches fondée sur un graphe de connaissances paraît bien adaptée à ce vieux problème : comment couvrir de façon exhaustive des tâches très diverses
    Cela semble aussi pouvoir déboucher sur des travaux théoriques concernant le rythme auquel de nouvelles connaissances sont produites et les modes de génération humains ou machinaux

  • Je me demande lequel de LoRA+DPO, GRPO est actuellement le meilleur pour un ajustement fin adapté à des tâches d’agent spécifiques

    • Pour commencer, LoRA+SFT semble approprié, mais le modèle est volumineux, donc le coût sera probablement important
      Il vaudrait mieux attendre l’API de fine-tuning du fournisseur, et il ne semble pas nécessaire de partir dès le début sur de l’apprentissage par renforcement ou sur un pseudo-apprentissage par renforcement off-policy comme le DPO
  • Je me demande ce que désigne le modèle enseignant dans la distillation on-policy multi-enseignants
    Je comprends les domaines vérifiables comme les mathématiques et le code, mais comme cela inclut aussi la biologie, je me demande s’il s’agit d’une structure de distillation depuis un modèle plus grand

    • Le document cite https://thinkingmachines.ai/blog/on-policy-distillation/
      Je comprends qu’il s’agit d’une méthode de distillation où le modèle enseignant note chaque token du modèle étudiant qui résout le problème selon la probabilité de génération à chaque étape, puis applique cela comme récompense ou comme perte pour faire de l’apprentissage par renforcement
      Multi-enseignants semble signifier une distillation à partir de plusieurs modèles, potentiellement y compris des modèles propriétaires de pointe
      Cela dit, il faut les log probabilities ; l’API d’OpenAI les autorise, alors qu’Anthropic ne les fournit pas, donc il existe peut-être aussi une méthode d’estimation externe
      Cette approche peut s’appliquer à tout domaine que l’enseignant maîtrise, y compris la biologie
    • Les enseignants désignent d’autres modèles
  • Je me demande si la raison pour laquelle les prix d’inférence sont identiques chez plusieurs fournisseurs vient d’un accord de licence avec Moonshot

  • Je me demande ce qu’il faudrait pour créer un modèle ouvert américain capable de rivaliser avec Kimi

    • Le dernier grand modèle public récent d’un grand laboratoire de recherche américain semble être GPT-OSS-120b, à l’été 2025, il y a environ un an
      Il paraît difficile qu’il sorte spontanément, donc il faudra sans doute faire pression d’une manière ou d’une autre pour obtenir une publication
      J’espérais récemment que Gemma sortirait au moins en 100B, mais Google semble garder en interne les modèles de cette taille
    • Il semble assez probable que MSL ou SpaceXAI publient en open source l’un des prochains grands modèles
      Les deux sont favorables à l’open source et devraient se disputer la place américaine de Kimi
    • Si l’idée reçue selon laquelle la Chine distille simplement les modèles pour les copier en deux semaines est vraie, alors les États-Unis devraient eux aussi pouvoir sortir un modèle copié en deux semaines
    • Inkling est lui aussi globalement dans une plage compétitive