Pour une grande entreprise qui dépense plusieurs millions de dollars par mois en coûts d’inférence, acheter directement un rack GB300 à environ 6 millions de dollars peut avoir du sens
Sur les 20,7 To de mémoire, il ne faut même pas 10 % pour charger l’ensemble du modèle MXFP4, et avec une bande passante HBM totale de 576 To/s, il est possible d’exécuter en parallèle plus de 6 000 tâches d’agents avec un contexte moyen de 100 000 tokens à environ 30 tokens/s
En supposant 1,5 million de dollars par an d’amortissement et d’électricité, ainsi qu’un taux d’utilisation moyen de 50 %, le coût tombe à moins de 0,6 dollar par million de tokens en sortie ; les données restent en interne et cela revient à plus de 10 fois moins cher qu’un service hébergé
Pour les entreprises convaincues que les modèles à poids ouverts vont continuer à progresser et que l’IA va durer, c’est la première vraie justification claire pour décider d’acheter le rack soi-même
Ils font tourner Kimi 2.8 sur un serveur à 107 000 dollars et traitent plus de 50 000 tokens par seconde sur la plupart des tâches
Les économies dépassent déjà ce qu’ils avaient dépensé en tokens pour Claude et Gemini l’an dernier
Embaucher 2 à 3 personnes DevOps pour l’exploitation ajoute encore 400 000 à 700 000 dollars, et les pannes comme la maintenance deviennent entièrement à la charge de l’entreprise
Malgré cela, ils ne font pas confiance aux LLM hébergés pour les données qui doivent rester confidentielles
Il faut aussi un espace avec refroidissement liquide et alimentation électrique ultra-dense, donc un site de colocation classique ou une simple salle serveurs interne aura du mal à suivre
Une entreprise capable d’acheter un rack et l’infrastructure associée à 6 millions de dollars doit aussi prendre en compte les conditions de licence commerciale applicables, donc le calcul n’est pas si simple
J’y voyais au contraire un frein au progrès
D’autres labos peuvent rattraper les plus avancés en distillant leurs modèles, ce qui prive ces derniers d’une partie des revenus qu’ils pourraient réinvestir dans la génération suivante
Si l’on voulait une accélération totale, il faudrait selon moi nationaliser les deux grands labos et les fermer sur le modèle du projet Manhattan jusqu’à atteindre l’auto-amélioration récursive (RSI), mais les contre-arguments dans les réponses m’ont fait fortement évoluer sur ce point
La licence de Kimi-K3 peut être consultée ici : https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Les prestataires de Model as a Service dont le chiffre d’affaires consolidé avec les filiales dépasse 20 millions de dollars sur 12 mois consécutifs doivent conclure un accord distinct avec Moonshot AI avant tout usage commercial
Les conditions existantes comprennent aussi une clause imposant d’afficher le nom Kimi si l’on compte plus de 100 millions d’utilisateurs actifs mensuels ou si le chiffre d’affaires du produit commercial dépasse 20 millions de dollars
On peut déjà se demander à quoi cette licence s’applique réellement au départ
Il n’est même pas clair que les poids du modèle soient couverts par le droit d’auteur
Aux États-Unis, on peut soutenir que les poids d’un modèle de machine learning sont le produit de processus d’optimisation automatiques comme la descente de gradient stochastique, l’espérance-maximisation ou les algorithmes génétiques, et qu’ils ne relèvent donc pas du droit d’auteur
Cela n’a pas encore été entièrement validé par les tribunaux, et comme le coût d’un procès est élevé, les employeurs chercheront en général à respecter la licence par prudence
Thaler v. Perlmutter a confirmé qu’un auteur humain est requis pour le droit d’auteur, et les directives de l’Office américain du copyright précisent également qu’une œuvre générée automatiquement par une machine sans intervention créative humaine ne peut pas être enregistrée
Les dispositions suivantes excluent aussi du droit d’auteur les principes mathématiques, formules, algorithmes et équations ; si l’on considère donc le modèle comme un algorithme, la conclusion paraît relativement claire
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
Le fait qu’on puisse le télécharger est déjà mieux, mais avec ces conditions, il est dommage qu’on puisse difficilement parler de véritables poids ouverts ou d’open source
On peut aussi se demander comment ils comptent repérer les contrevenants à la licence pour en faire des cibles de poursuite
L’approche d’un graphe de connaissances hiérarchique auto-évolutif qui se développe en continu pendant que les agents explorent à l’échelle du web les domaines intensifs en connaissances et le code est intéressante
Voir la fonction d’activation revenir vers tanh donne l’impression que les modes techniques sont cycliques
D’après la page 6 du papier, ils n’utilisent pas tanh tel quel mais f_gate(b,x) = b * tanh(x / b) * sigmoid(x) et f_up(b,x) = b * tanh(x / b)
Sur le graphe, cela semble chercher à combiner les avantages du GLU, qui offre une meilleure expressivité quand x dépasse environ 5, et les avantages du SwiGLU, où les valeurs juste avant 0 remontent
La composition de tâches fondée sur un graphe de connaissances paraît bien adaptée à ce vieux problème : comment couvrir de façon exhaustive des tâches très diverses
Cela semble aussi pouvoir déboucher sur des travaux théoriques concernant le rythme auquel de nouvelles connaissances sont produites et les modes de génération humains ou machinaux
Je me demande lequel de LoRA+DPO, GRPO est actuellement le meilleur pour un ajustement fin adapté à des tâches d’agent spécifiques
Pour commencer, LoRA+SFT semble approprié, mais le modèle est volumineux, donc le coût sera probablement important
Il vaudrait mieux attendre l’API de fine-tuning du fournisseur, et il ne semble pas nécessaire de partir dès le début sur de l’apprentissage par renforcement ou sur un pseudo-apprentissage par renforcement off-policy comme le DPO
Je me demande ce que désigne le modèle enseignant dans la distillation on-policy multi-enseignants
Je comprends les domaines vérifiables comme les mathématiques et le code, mais comme cela inclut aussi la biologie, je me demande s’il s’agit d’une structure de distillation depuis un modèle plus grand
Le document cite https://thinkingmachines.ai/blog/on-policy-distillation/
Je comprends qu’il s’agit d’une méthode de distillation où le modèle enseignant note chaque token du modèle étudiant qui résout le problème selon la probabilité de génération à chaque étape, puis applique cela comme récompense ou comme perte pour faire de l’apprentissage par renforcement
Multi-enseignants semble signifier une distillation à partir de plusieurs modèles, potentiellement y compris des modèles propriétaires de pointe
Cela dit, il faut les log probabilities ; l’API d’OpenAI les autorise, alors qu’Anthropic ne les fournit pas, donc il existe peut-être aussi une méthode d’estimation externe
Cette approche peut s’appliquer à tout domaine que l’enseignant maîtrise, y compris la biologie
Les enseignants désignent d’autres modèles
Je me demande si la raison pour laquelle les prix d’inférence sont identiques chez plusieurs fournisseurs vient d’un accord de licence avec Moonshot
Je me demande ce qu’il faudrait pour créer un modèle ouvert américain capable de rivaliser avec Kimi
Le dernier grand modèle public récent d’un grand laboratoire de recherche américain semble être GPT-OSS-120b, à l’été 2025, il y a environ un an
Il paraît difficile qu’il sorte spontanément, donc il faudra sans doute faire pression d’une manière ou d’une autre pour obtenir une publication
J’espérais récemment que Gemma sortirait au moins en 100B, mais Google semble garder en interne les modèles de cette taille
Il semble assez probable que MSL ou SpaceXAI publient en open source l’un des prochains grands modèles
Les deux sont favorables à l’open source et devraient se disputer la place américaine de Kimi
Si l’idée reçue selon laquelle la Chine distille simplement les modèles pour les copier en deux semaines est vraie, alors les États-Unis devraient eux aussi pouvoir sortir un modèle copié en deux semaines
Inkling est lui aussi globalement dans une plage compétitive
1 commentaires
Commentaires sur Hacker News
Pour une grande entreprise qui dépense plusieurs millions de dollars par mois en coûts d’inférence, acheter directement un rack GB300 à environ 6 millions de dollars peut avoir du sens
Sur les 20,7 To de mémoire, il ne faut même pas 10 % pour charger l’ensemble du modèle MXFP4, et avec une bande passante HBM totale de 576 To/s, il est possible d’exécuter en parallèle plus de 6 000 tâches d’agents avec un contexte moyen de 100 000 tokens à environ 30 tokens/s
En supposant 1,5 million de dollars par an d’amortissement et d’électricité, ainsi qu’un taux d’utilisation moyen de 50 %, le coût tombe à moins de 0,6 dollar par million de tokens en sortie ; les données restent en interne et cela revient à plus de 10 fois moins cher qu’un service hébergé
Pour les entreprises convaincues que les modèles à poids ouverts vont continuer à progresser et que l’IA va durer, c’est la première vraie justification claire pour décider d’acheter le rack soi-même
Les économies dépassent déjà ce qu’ils avaient dépensé en tokens pour Claude et Gemini l’an dernier
Malgré cela, ils ne font pas confiance aux LLM hébergés pour les données qui doivent rester confidentielles
Plusieurs infrastructures open source ont aussi été publiées avec le modèle
https://github.com/MoonshotAI/MoonEP
https://github.com/kvcache-ai/AgentEnv
https://github.com/MoonshotAI/FlashKDA
Il est difficile de comprendre l’idée selon laquelle les modèles à code source et poids ouverts ralentiraient les progrès de l’IA
D’autres labos peuvent rattraper les plus avancés en distillant leurs modèles, ce qui prive ces derniers d’une partie des revenus qu’ils pourraient réinvestir dans la génération suivante
Si l’on voulait une accélération totale, il faudrait selon moi nationaliser les deux grands labos et les fermer sur le modèle du projet Manhattan jusqu’à atteindre l’auto-amélioration récursive (RSI), mais les contre-arguments dans les réponses m’ont fait fortement évoluer sur ce point
La licence de Kimi-K3 peut être consultée ici : https://huggingface.co/moonshotai/Kimi-K3/blob/main/LICENSE
Les prestataires de Model as a Service dont le chiffre d’affaires consolidé avec les filiales dépasse 20 millions de dollars sur 12 mois consécutifs doivent conclure un accord distinct avec Moonshot AI avant tout usage commercial
Les conditions existantes comprennent aussi une clause imposant d’afficher le nom Kimi si l’on compte plus de 100 millions d’utilisateurs actifs mensuels ou si le chiffre d’affaires du produit commercial dépasse 20 millions de dollars
Les modèles publiés en 2025 étaient sous une licence MIT propre, mais à partir de moonshotai/Kimi-K2-Thinking en janvier 2026, ils ont commencé à utiliser une licence MIT modifiée
Il n’est même pas clair que les poids du modèle soient couverts par le droit d’auteur
Cela n’a pas encore été entièrement validé par les tribunaux, et comme le coût d’un procès est élevé, les employeurs chercheront en général à respecter la licence par prudence
Thaler v. Perlmutter a confirmé qu’un auteur humain est requis pour le droit d’auteur, et les directives de l’Office américain du copyright précisent également qu’une œuvre générée automatiquement par une machine sans intervention créative humaine ne peut pas être enregistrée
Les dispositions suivantes excluent aussi du droit d’auteur les principes mathématiques, formules, algorithmes et équations ; si l’on considère donc le modèle comme un algorithme, la conclusion paraît relativement claire
[1] https://media.cadc.uscourts.gov/opinions/docs/2025/03/23-523...
[2] https://www.copyright.gov/comp3/chap300/ch300-copyrightable-...
L’approche d’un graphe de connaissances hiérarchique auto-évolutif qui se développe en continu pendant que les agents explorent à l’échelle du web les domaines intensifs en connaissances et le code est intéressante
Voir la fonction d’activation revenir vers tanh donne l’impression que les modes techniques sont cycliques
f_gate(b,x) = b * tanh(x / b) * sigmoid(x)etf_up(b,x) = b * tanh(x / b)Sur le graphe, cela semble chercher à combiner les avantages du GLU, qui offre une meilleure expressivité quand x dépasse environ 5, et les avantages du SwiGLU, où les valeurs juste avant 0 remontent
La composition de tâches fondée sur un graphe de connaissances paraît bien adaptée à ce vieux problème : comment couvrir de façon exhaustive des tâches très diverses
Cela semble aussi pouvoir déboucher sur des travaux théoriques concernant le rythme auquel de nouvelles connaissances sont produites et les modes de génération humains ou machinaux
Je me demande lequel de LoRA+DPO, GRPO est actuellement le meilleur pour un ajustement fin adapté à des tâches d’agent spécifiques
Il vaudrait mieux attendre l’API de fine-tuning du fournisseur, et il ne semble pas nécessaire de partir dès le début sur de l’apprentissage par renforcement ou sur un pseudo-apprentissage par renforcement off-policy comme le DPO
Je me demande ce que désigne le modèle enseignant dans la distillation on-policy multi-enseignants
Je comprends les domaines vérifiables comme les mathématiques et le code, mais comme cela inclut aussi la biologie, je me demande s’il s’agit d’une structure de distillation depuis un modèle plus grand
Je comprends qu’il s’agit d’une méthode de distillation où le modèle enseignant note chaque token du modèle étudiant qui résout le problème selon la probabilité de génération à chaque étape, puis applique cela comme récompense ou comme perte pour faire de l’apprentissage par renforcement
Multi-enseignants semble signifier une distillation à partir de plusieurs modèles, potentiellement y compris des modèles propriétaires de pointe
Cela dit, il faut les log probabilities ; l’API d’OpenAI les autorise, alors qu’Anthropic ne les fournit pas, donc il existe peut-être aussi une méthode d’estimation externe
Cette approche peut s’appliquer à tout domaine que l’enseignant maîtrise, y compris la biologie
Je me demande si la raison pour laquelle les prix d’inférence sont identiques chez plusieurs fournisseurs vient d’un accord de licence avec Moonshot
Je me demande ce qu’il faudrait pour créer un modèle ouvert américain capable de rivaliser avec Kimi
Il paraît difficile qu’il sorte spontanément, donc il faudra sans doute faire pression d’une manière ou d’une autre pour obtenir une publication
J’espérais récemment que Gemma sortirait au moins en 100B, mais Google semble garder en interne les modèles de cette taille
Les deux sont favorables à l’open source et devraient se disputer la place américaine de Kimi