- La demande pour Kimi K3 a augmenté bien plus que prévu, et l’utilisation des GPU au cours des dernières 48 heures s’est rapprochée de la limite de capacité actuelle
- Afin de préserver l’expérience des abonnés existants, les nouveaux abonnements sont temporairement suspendus et les ressources de calcul sont attribuées en priorité aux membres actuels
- Les abonnés payants existants ne sont pas affectés, et Moonshot AI accélère l’extension de sa capacité d’infrastructure
- Les nouveaux abonnements reprendront par lots dès que de la capacité supplémentaire sera disponible
- Par ailleurs, l’abonnement sera divisé en deux forfaits dédiés selon l’usage
- Kimi Membership : pour Kimi Web, App et Work
- Kimi Code Membership : pour les workflows de codage
- Cette mesure vise à répartir plus précisément les ressources de calcul en fonction de la demande par service et à maintenir une expérience d’utilisation stable
1 commentaires
Avis sur Hacker News
La formulation disant que, la demande ayant frôlé la limite de capacité actuelle au cours des 48 dernières heures, les nouveaux abonnements ont été temporairement suspendus et les ressources de calcul prioritairement allouées aux membres existants afin de préserver leur expérience, est vraiment agréable à lire
C’est une entreprise qui privilégie la satisfaction des clients existants à la croissance rapide
Hier, j’ai épuisé mon quota Claude et j’ai pris l’offre à 20 dollars pour essayer Kimi. Dans Kimi Code, j’ai sélectionné K3 et lui ai demandé de parcourir tous les réglages d’entrée liés au matériel, aux entrées/sorties, au contrôle des threads et au réseau dans le dépôt, puis de rédiger un rapport ; après 12 minutes de réflexion, il a répondu que j’avais déjà consommé tout mon quota quotidien
Le lendemain, Fable a terminé la même tâche en 3 minutes, donc si vous voulez utiliser K3, mieux vaut ne pas acheter l’offre à 20 dollars
L’interface web indiquait aussi 23 % de consommation hebdomadaire, alors qu’avec Cursor à 20 dollars par mois, je fais bien plus de travail sans avoir jamais reçu le moindre avertissement. Au début, je pensais que le problème venait d’OpenCode, mais si c’était pareil dans Kimi Code, ça n’a pas l’air d’être le cas
Ce qui est particulièrement intéressant avec Kimi, c’est qu’il a trois fois plus de couches RNN et d’attention linéaire que de couches d’attention complète. Je ne l’ai pas encore essayé, mais ça semble être une architecture très sensée pour les tâches à long contexte
La raison du grand nombre de paramètres semble être la même que pour les xLSTM optimisés pour le calcul, qui ont eux aussi beaucoup de paramètres. En voyant le succès de ce modèle, il est dommage que l’Europe n’ait pas développé une immense famille de modèles xLSTM. Comme c’est une équipe pragmatique qui retient ce qui fonctionne bien en évaluation interne, elle a aussi conservé des couches d’attention classiques, et on ne peut pas garantir que l’implémentation soit idéale ; mais Kimi montre ce qui aurait pu être possible si on avait fourni un superordinateur d’entraînement LLM à des chercheurs adaptés. Au final, tout cela reste largement le domaine de Hochreiter, celui des RNN
J’utilise Kimi depuis environ 6 mois pour coder, et j’en suis suffisamment satisfait pour ne pas revenir à d’autres modèles. De temps en temps, je teste la même tâche sur Claude juste pour vérifier que je ne rate rien
J’utilise OpenRouter, et comme mon usage des LLM est limité, la différence de coût est négligeable dans un sens comme dans l’autre
C’est rafraîchissant qu’ils aient suspendu les nouveaux abonnements au lieu de réduire discrètement les limites en espérant, comme Google, que les utilisateurs ne remarquent pas que la valeur de leur abonnement a baissé
Gemini Apps précise qu’en cas de contraintes de capacité ou de pics d’activité, les limites peuvent être modifiées sans préavis pour maintenir la qualité : https://support.google.com/gemini/answer/16275805
Dans les évaluations de codage de jeux multi-agents, les modèles chinois sont généralement faibles en raisonnement en un seul passage, mais compensent cela par l’usage d’outils et l’amélioration itérative. Kimi K3 n’est que 19e en codage en un seul passage, mais avec un environnement d’exécution, des outils et plusieurs appels, il monte à la 3e place en codage agentique, avec seulement Sol et Fable devant lui en moyenne par soumission
Pour les ingénieurs logiciels, le codage agentique est le plus pertinent, mais la vitesse compte aussi, et c’est actuellement un vrai problème d’utilisabilité pour Kimi. Des fournisseurs externes d’inférence comme Fireworks avaient déjà réduit cet écart sur des modèles précédents. Il est intéressant de voir des modèles open weights à la pointe s’imposer comme norme, et il deviendra de plus en plus difficile de rivaliser simplement parce qu’on possède un modèle de pointe
Données : https://gertlabs.com/rankings?mode=agentic_coding
La qualité de ce modèle dépasse les attentes, et il est particulièrement bon pour les revues de code et de PR. En revanche, à cause de la demande excessive et de la grande taille du modèle, il est actuellement trop lent, au point qu’une revue de code assez simple peut prendre énormément de temps
Je me demande si cette vague Kimi correspond à une hausse nette due au paradoxe de Jevons, où une offre abondante entraîne davantage de consommation, ou s’il s’agit simplement d’un déplacement vers des modèles moins chers
Je me demande aussi s’il existe de bonnes données pour observer la consommation totale de tokens à travers plusieurs laboratoires et OpenRouter
Je me demande si Anthropic et OpenAI vont rester compétitifs simplement parce qu’ils sont les seuls à pouvoir absorber une telle demande pour le moment. Les clients entreprises n’apprécieront pas qu’on fasse perdre du temps à leurs employés à cause de pannes alors que les coûts sont déjà élevés
Ils semblent avoir suspendu les abonnements parce qu’ils ont jugé ne pas pouvoir garantir une qualité de service minimale à leurs clients