1 points par GN⁺ 19 시간 전 | 1 commentaires | Partager sur WhatsApp
  • La demande pour Kimi K3 a augmenté bien plus que prévu, et l’utilisation des GPU au cours des dernières 48 heures s’est rapprochée de la limite de capacité actuelle
  • Afin de préserver l’expérience des abonnés existants, les nouveaux abonnements sont temporairement suspendus et les ressources de calcul sont attribuées en priorité aux membres actuels
  • Les abonnés payants existants ne sont pas affectés, et Moonshot AI accélère l’extension de sa capacité d’infrastructure
  • Les nouveaux abonnements reprendront par lots dès que de la capacité supplémentaire sera disponible
  • Par ailleurs, l’abonnement sera divisé en deux forfaits dédiés selon l’usage
    • Kimi Membership : pour Kimi Web, App et Work
    • Kimi Code Membership : pour les workflows de codage
  • Cette mesure vise à répartir plus précisément les ressources de calcul en fonction de la demande par service et à maintenir une expérience d’utilisation stable

1 commentaires

 
Avis sur Hacker News
  • La formulation disant que, la demande ayant frôlé la limite de capacité actuelle au cours des 48 dernières heures, les nouveaux abonnements ont été temporairement suspendus et les ressources de calcul prioritairement allouées aux membres existants afin de préserver leur expérience, est vraiment agréable à lire
    C’est une entreprise qui privilégie la satisfaction des clients existants à la croissance rapide

    • Quand GitHub avait fait exactement la même chose autrefois, beaucoup de gens s’étaient plaints, mais c’était alors comme maintenant la bonne décision
    • J’ai toujours détesté, sur n’importe quel site web, quand le bouton « Login » est plus petit que « Sign Up »
    • Dans ce cas, Hetzner aurait-il aussi dû suspendre les nouvelles inscriptions plutôt que d’augmenter les prix pour ajuster l’offre et la demande ?
    • Pas besoin de trop s’emballer. Vu les sommes massives que les fonds de capital-risque injectent dans l’IA, il se pourrait aussi qu’OpenAI ou Anthropic financent des machines à brûler des tokens pour distiller des jeux de données
  • Hier, j’ai épuisé mon quota Claude et j’ai pris l’offre à 20 dollars pour essayer Kimi. Dans Kimi Code, j’ai sélectionné K3 et lui ai demandé de parcourir tous les réglages d’entrée liés au matériel, aux entrées/sorties, au contrôle des threads et au réseau dans le dépôt, puis de rédiger un rapport ; après 12 minutes de réflexion, il a répondu que j’avais déjà consommé tout mon quota quotidien
    Le lendemain, Fable a terminé la même tâche en 3 minutes, donc si vous voulez utiliser K3, mieux vaut ne pas acheter l’offre à 20 dollars

    • Codex continue à raisonner même après avoir atteint la limite, puis répond à la requête
    • J’utilise uniquement des modèles entièrement auto-hébergés, donc l’environnement est peut-être différent, mais je me demande si le fait d’attendre 12 minutes sans aucun retour est courant dans un vrai flux de travail. Moi, je surveille en permanence le chemin pris par le modèle et j’interromps ou je réoriente s’il part dans une impasse
    • J’ai vécu exactement la même chose. J’ai payé à l’année l’offre mensuelle à 20 dollars de Kimi.com et, via l’API dans OpenCode, j’ai envoyé une requête simple à Kimi K2.7, qui a consommé l’intégralité du quota de 5 heures, alors que Cursor a terminé la même requête en quelques minutes
      L’interface web indiquait aussi 23 % de consommation hebdomadaire, alors qu’avec Cursor à 20 dollars par mois, je fais bien plus de travail sans avoir jamais reçu le moindre avertissement. Au début, je pensais que le problème venait d’OpenCode, mais si c’était pareil dans Kimi Code, ça n’a pas l’air d’être le cas
    • Il y a quelques jours, sur Claude aussi, une tâche pourtant relativement simple a consommé tout le quota de 5 heures sans jamais produire de réponse, ce qui m’a donné l’impression d’avoir complètement perdu mon temps
    • Je serais curieux de connaître la taille de l’application cible. Ce n’est pas la même chose selon qu’il s’agit d’une appli de tâches Node.js utilisant des fichiers texte comme base de données, ou d’un million de lignes de code spaghetti COBOL écrites en 1971
  • Ce qui est particulièrement intéressant avec Kimi, c’est qu’il a trois fois plus de couches RNN et d’attention linéaire que de couches d’attention complète. Je ne l’ai pas encore essayé, mais ça semble être une architecture très sensée pour les tâches à long contexte
    La raison du grand nombre de paramètres semble être la même que pour les xLSTM optimisés pour le calcul, qui ont eux aussi beaucoup de paramètres. En voyant le succès de ce modèle, il est dommage que l’Europe n’ait pas développé une immense famille de modèles xLSTM. Comme c’est une équipe pragmatique qui retient ce qui fonctionne bien en évaluation interne, elle a aussi conservé des couches d’attention classiques, et on ne peut pas garantir que l’implémentation soit idéale ; mais Kimi montre ce qui aurait pu être possible si on avait fourni un superordinateur d’entraînement LLM à des chercheurs adaptés. Au final, tout cela reste largement le domaine de Hochreiter, celui des RNN

    • L’un des objectifs initiaux de l’architecture Transformer n’était-il pas justement d’éliminer les RNN impossibles à paralléliser ? Je ne suis pas expert, j’ai seulement lu quelques papiers il y a quelques années
    • Il y a environ un an et demi, j’ai dit à Hochreiter qu’il ne fallait pas s’arrêter aux expériences à quelques milliards de paramètres mais faire passer xLSTM à l’échelle des LLM ; pourtant, il semblait penser qu’il était trop tard pour obtenir investissement et intérêt. C’est regrettable si c’est le niveau d’ambition de l’Europe
    • Je me demandais si c’était un RNN, un modèle d’espace d’état comme Qwen ou Mamba, ou quelque chose de plus proche de RWKV ; après vérification, cela ressemble au Linear DeltaNet utilisé par Qwen
  • J’utilise Kimi depuis environ 6 mois pour coder, et j’en suis suffisamment satisfait pour ne pas revenir à d’autres modèles. De temps en temps, je teste la même tâche sur Claude juste pour vérifier que je ne rate rien
    J’utilise OpenRouter, et comme mon usage des LLM est limité, la différence de coût est négligeable dans un sens comme dans l’autre

    • Je me demande quelle offre tu as. D’après mon expérience, l’offre mensuelle à 20 dollars de Kimi comme celle à 30 dollars de Qwen étaient toutes deux très insuffisantes pour servir d’outil principal, mais à cause de K3, j’ai envie d’essayer les offres à 49 ou 99 dollars par mois
  • C’est rafraîchissant qu’ils aient suspendu les nouveaux abonnements au lieu de réduire discrètement les limites en espérant, comme Google, que les utilisateurs ne remarquent pas que la valeur de leur abonnement a baissé
    Gemini Apps précise qu’en cas de contraintes de capacité ou de pics d’activité, les limites peuvent être modifiées sans préavis pour maintenir la qualité : https://support.google.com/gemini/answer/16275805

  • Dans les évaluations de codage de jeux multi-agents, les modèles chinois sont généralement faibles en raisonnement en un seul passage, mais compensent cela par l’usage d’outils et l’amélioration itérative. Kimi K3 n’est que 19e en codage en un seul passage, mais avec un environnement d’exécution, des outils et plusieurs appels, il monte à la 3e place en codage agentique, avec seulement Sol et Fable devant lui en moyenne par soumission
    Pour les ingénieurs logiciels, le codage agentique est le plus pertinent, mais la vitesse compte aussi, et c’est actuellement un vrai problème d’utilisabilité pour Kimi. Des fournisseurs externes d’inférence comme Fireworks avaient déjà réduit cet écart sur des modèles précédents. Il est intéressant de voir des modèles open weights à la pointe s’imposer comme norme, et il deviendra de plus en plus difficile de rivaliser simplement parce qu’on possède un modèle de pointe
    Données : https://gertlabs.com/rankings?mode=agentic_coding

  • La qualité de ce modèle dépasse les attentes, et il est particulièrement bon pour les revues de code et de PR. En revanche, à cause de la demande excessive et de la grande taille du modèle, il est actuellement trop lent, au point qu’une revue de code assez simple peut prendre énormément de temps

    • Kimi K3 figure désormais dans la grille tarifaire d’opencode-go, donc on dirait qu’il est utilisable, mais je n’ai pas encore pu le vérifier. Il n’est pas sur Zen
    • La route OpenRouter vaut peut-être le coup d’être essayée : https://openrouter.ai/moonshotai/kimi-k3
  • Je me demande si cette vague Kimi correspond à une hausse nette due au paradoxe de Jevons, où une offre abondante entraîne davantage de consommation, ou s’il s’agit simplement d’un déplacement vers des modèles moins chers
    Je me demande aussi s’il existe de bonnes données pour observer la consommation totale de tokens à travers plusieurs laboratoires et OpenRouter

    • Si la tendance était vraiment au déplacement vers des modèles moins chers, les gens seraient allés vers DeepSeek v4 Flash. Le dernier Kimi est plus cher que la plupart des autres modèles chinois, donc cela ressemble davantage à un effet de mode du type « le nouveau modèle est vraiment bon, essayez-le ». La vraie question est de savoir à quel point il résistera à un examen rigoureux, et les laboratoires américains doivent être assez nerveux
  • Je me demande si Anthropic et OpenAI vont rester compétitifs simplement parce qu’ils sont les seuls à pouvoir absorber une telle demande pour le moment. Les clients entreprises n’apprécieront pas qu’on fasse perdre du temps à leurs employés à cause de pannes alors que les coûts sont déjà élevés

    • On voit la même dynamique au travail. Le logiciel lui-même est peu coûteux, mais les compétences d’hébergement et la responsabilité de disponibilité font que le déploiement réel reste concentré chez quelques acteurs. Cela dit, il existe aussi beaucoup d’outils de productivité de vibe coding qui tournent sur un ordinateur portable personnel
    • Anthropic aussi, il y a seulement quelques mois, embêtait les utilisateurs avec des quotas séparant heures de pointe et heures creuses à cause de problèmes de demande, et les pannes étaient fréquentes. Depuis son accord avec xAI, la situation est globalement devenue stable, et Moonshot est lui aussi en train de négocier des contrats de ressources de calcul
    • Une part importante des ressources de calcul d’OpenAI et d’Anthropic appartient en réalité aux hyperscalers. Ils peuvent certes appliquer une marge sur l’accès à des ressources sécurisées par contrats de long terme, mais cela ne durera sans doute pas longtemps si les hyperscalers proposent des prix plus bas
    • Kimi est un modèle open weights, donc d’autres hébergeurs que Moonshot vont rapidement apparaître, et ce problème ne constituera probablement pas un obstacle majeur à l’adoption des open weights
    • J’utilise Synthetic, et il me semble qu’ils prévoient d’héberger Kimi3. Les modèles ouverts permettent de répartir l’inférence
  • Ils semblent avoir suspendu les abonnements parce qu’ils ont jugé ne pas pouvoir garantir une qualité de service minimale à leurs clients

    • Plus précisément, ils ont seulement suspendu les nouveaux abonnements et donné la priorité des ressources de calcul aux membres existants