- En utilisant Kimi K3 et Claude en parallèle pour des tâches de codage quotidiennes, il a été difficile de distinguer une différence réelle dans la qualité des sorties et le nombre de tokens nécessaires aux réponses
- L’API Kimi K3 coûte 3 $ par million de tokens en entrée et 15 $ en sortie, soit nettement moins que le modèle haut de gamme de Claude, à respectivement 10 $ et 50 $
- Kimi démarre à 19 $ par mois, et son palier codage à 39 $ par mois est également généreux, tandis que Claude épuise rapidement les quotas lors de tâches agentiques et n’a même pas conservé l’accès à Fable dans l’offre à 20 $ par mois
- Dans le benchmark de cybersécurité de Semgrep, GLM 5.2 a pris l’avantage en exécutant certaines tâches que Claude, limité, refusait ; il est publié sous licence MIT et coûte moins cher que le dernier Opus
- Les restrictions qui ne s’appliquent qu’aux modèles américains ne font que réduire les choix des clients américains, sans empêcher la concurrence des modèles open source étrangers ; avec une qualité similaire et un prix plus bas, les raisons de continuer à payer Claude diminuent face à Kimi K3
Comparaison qualité-prix entre Kimi K3 et Claude
- Lorsqu’on utilise Kimi K3 aux côtés de Claude pour des tâches de codage courantes, il offre les mêmes tâches et la même qualité de sortie, avec une consommation de tokens presque identique
- Cela va à l’encontre de l’idée selon laquelle les modèles open source produiraient des résultats plus approximatifs ou nécessiteraient davantage de tokens pour obtenir la même réponse
- Le prix de l’API Kimi K3 est de 3 $ par million de tokens en entrée et de 15 $ par million de tokens en sortie
- Le modèle haut de gamme de Claude est à respectivement 10 $ et 50 $ pour la même unité
- Les offres payantes de Kimi commencent à 19 $ par mois, et le palier codage à 39 $ par mois offre plus d’usage que les offres Claude dans une gamme de prix comparable
- Les forfaits Claude imposent des limites d’usage strictes, au point qu’une journée ordinaire de tâches agentiques peut épuiser le quota avant midi
- Claude n’a pas maintenu l’accès à Fable dans l’offre à 20 $ par mois, l’a donc désactivé et a basculé vers Opus, tandis que le palier Kimi n’a pas cette contrainte
Politique américaine en matière d’IA et concurrence des modèles open source
- Alors que le gouvernement américain a retardé le lancement de Fable et que le modèle final applique aussi des restrictions refusant plusieurs catégories de tâches, les modèles open source de niveau frontier issus de laboratoires chinois peuvent être téléchargés et échappent au champ de la régulation américaine
- Dans le benchmark de cybersécurité de Semgrep, GLM 5.2 a devancé Claude
- Le modèle soumis à restrictions a refusé certaines tâches, tandis que le modèle open source les a exécutées, et cette différence a influencé les résultats
- GLM 5.2 est publié sous licence MIT et, sans se présenter lui-même comme un modèle frontier, obtient de meilleurs résultats que le dernier Opus dans des tâches réelles, tout en coûtant bien moins cher
- Le GPT-5.6 d’OpenAI est lui aussi passé par une procédure de restrictions gouvernementales, mais OpenAI a davantage de marge qu’Anthropic, car elle peut proposer son modèle principal dans l’offre à 20 $ par mois
- À l’avenir, le gouvernement américain pourrait appliquer à l’IA et à l’open source les méthodes de subventions, plans de sauvetage et droits de douane protecteurs utilisées pour l’industrie automobile
- Une coopération public-privé pourrait soutenir des modèles nationaux utilisés uniquement aux États-Unis et incapables de rivaliser à l’international
- En conséquence, les utilisateurs américains pourraient devoir acheter des modèles nationaux plutôt que ceux offrant la meilleure qualité ou le plus bas prix, et ne pas pouvoir utiliser les meilleurs modèles au meilleur tarif
1 commentaires
Avis de Hacker News
Qu’il ait atteint des performances comparables par distillation ou qu’il ait été développé indépendamment depuis le départ, l’issue pour les laboratoires américains de pointe était écrite d’avance. La distillation n’est pas une attaque : les laboratoires de pointe ont eux aussi distillé dans leurs modèles le savoir écrit par l’humanité, donc il est naturel que des laboratoires arrivés plus tard compressent cela dans des modèles moins chers.
Comme il n’existe pas vraiment de moyen d’empêcher l’enregistrement des conversations pour entraîner leurs propres modèles, il semble préférable d’investir dans les entreprises de matériel plutôt que dans les entreprises de modèles.
Il y a à peine 6 mois, beaucoup prédisaient encore que l’utilisation des sorties de modèles comme données d’entraînement provoquerait une catastrophe d’apprentissage en boucle et ferait échouer tous les modèles ; il ne faut donc pas présenter cela comme évident depuis le début.
La distillation via API n’est utile que pour franchir rapidement le cold start en apprentissage par renforcement dans de nouveaux domaines ; ce qui compte vraiment, c’est la qualité et la diversité des environnements d’apprentissage par renforcement dans lesquels le modèle apprend.
Les États-Unis n’ont pas encore opté pour un contrôle à la chinoise sur les terres rares, mais si la distillation se généralise, même ceux qui ne la pratiquent pas risquent d’assumer des coûts réglementaires comme des blocages d’accès ou des contrôles excessifs. Comme on a été tolérant envers la copie musicale avant de s’indigner pour les arts visuels, le fait de considérer cela comme du vol ou comme une activité commerciale normale dépendra en fin de compte d’un consensus social ; et sans percée majeure, l’écart se réduira.
Nous sommes arrivés à ce point bien plus vite que prévu. Je me demande à quoi ressemblerait le monde si les gouvernements occidentaux qualifiaient l’accès aux modèles frontier à poids ouverts de risque pour la sécurité nationale et classaient leur utilisation comme acte terroriste.
Kimi K3 pourrait devenir comme Napster, que tout le monde utilisait en sachant que c’était illégal, ou bien faire émerger un marché souterrain façon cannabis où quelqu’un du quartier louerait à l’usage une machine 8×5090 montée dans sa cave avec des pièces eBay. À l’inverse, si le contrôle réussit, les seules options publiques seraient des Cohere et Mistral affaiblis, et il faudrait payer cher pour des modèles « American Frontier » d’Anthropic et d’OpenAI en retard sur la Chine.
Comme le Kindle Fire subventionné par la publicité, on pourrait aussi voir apparaître un Kindle AI vendant son influence au plus offrant, avec de la propagande de fabricants de tabac injectée dans le pipeline d’entraînement et un LLM affirmant que fumer est bon pour la santé.
Le gouvernement américain a récemment annoncé, pour la coopération scientifique de la NSF, des restrictions similaires au Wolf Amendment et déplacé la compétence vers le domaine militaire ; il cherche à entraîner plusieurs pays dans une Pax Silica visant à exclure la Chine, tout en imposant à ses alliés ses propres produits aux fonctionnalités limitées. Il pourrait rester des zones neutres comme la Suisse ou Singapour, où les utilisateurs américains et européens pourraient accéder à l’autre côté du rideau sans conséquences juridiques.
https://nitter.net/RnaudBertrand/status/2069574934972797089
J’ai confié à Kimi K3 la tâche que je fais habituellement passer à tous les modèles : il a réfléchi beaucoup plus longtemps et a presque épuisé les 5 heures d’utilisation de l’abonnement à 19 dollars. Sur l’abonnement OpenAI à 20 dollars, la même tâche ne prend que quelques minutes et ne fait quasiment pas baisser le quota.
Les limites d’abonnement sont difficiles à mesurer, car elles ne fournissent pas de valeur comparable comme les tokens, mais c’était la première fois que je voyais un abonnement autour de 20 dollars aussi serré, au point qu’une seule petite tâche fasse disparaître le volume d’utilisation disponible pour du vrai travail. C’était lent et le coût par tâche semblait aussi élevé, mais il a trouvé un bug que Gemini 3.5 Flash avait inventé tout seul.
Quand j’ai demandé à GLM 5.2 de porter environ 50 lignes de JavaScript en Python, il a lui aussi enchaîné recherches web et revérifications, ce qui a coûté 0,25 dollar d’API ; la première exécution a échoué, mais la seconde a fonctionné. Claude Code/Fable a été beaucoup plus rapide, mais a produit la même erreur ; j’espère que l’auto-vérification excessive des modèles ouverts diminuera, ou que les méthodes de prompting s’amélioreront.
Les modèles chinois n’atteignent pas encore ce niveau et semblent se concentrer sur la maximisation des scores de benchmarks plutôt que sur l’efficacité.
max, mais d’autres niveaux devraient bientôt arriver. Dans les traces de benchmarks, on voyait beaucoup de retours en arrière et d’incertitude du type « attends, mais… », et c’était aussi le cas, quoique dans une moindre mesure, avec GPT 5.6 et les modesxhigh/maxde Fable.La prise en charge de niveaux de raisonnement plus faibles pourrait améliorer cette inefficacité en tokens.
https://platform.kimi.ai/docs/guide/use-thinking-effort
/code-review, sans modification de code, et l’utilisation est montée à 99 % ; avec le 1 % restant, il n’a même pas pu écrirereview.md.D’habitude, une revue consomme 10 à 20 %, mais il arrive que 65 à 69 % disparaissent en 15 minutes : la variabilité de l’utilisation est énorme.
Dans les offres payantes de Kimi, la longueur de contexte d’un million de tokens n’est disponible qu’à partir de 79 dollars par mois ; en dessous, elle est limitée à 256 000 tokens. L’offre la moins chère, à 15 dollars par mois avec remise sur paiement annuel, ne prend actuellement pas en charge K3 lui-même.
https://www.kimi.com/code/docs/en/kimi-code/models.html
Je pense plutôt l’inverse. Kimi K3 a 2,8 billions de paramètres ; la taille de ChatGPT 5.6 ou d’Opus 4.8 n’est pas publique, mais elle est probablement comparable, et Fable/Mythos seraient autour de 10 billions d’après les rumeurs.
Les prix d’entrée/sortie par million de tokens sont de 3/15 dollars pour K3, 5/30 dollars pour ChatGPT 5.6 Sol et 5/25 dollars pour Opus 4.8, donc l’écart n’est pas énorme. Plutôt qu’un tournant historique, cela ressemble à des concurrents qui convergent vers les mêmes performances et vendent un peu moins cher. Les poids actuels de K3 ne sont pas non plus publics, donc la situation ne semble pas devoir changer.
Même dans ce fil, l’utilité réelle de Kimi fait débat. Personnellement, je le trouve inférieur à Fable et à 5.6 Sol, mais le centre de la discussion semble moins être la performance qu’une réaction de rejet face aux mesures réglementaires du gouvernement américain.
La colère et la frustration face à la situation actuelle donnent aussi l’impression qu’il y a une envie que Kimi soit meilleur.
Cela dépend beaucoup du type de tâche et de la manière de l’utiliser, mais l’affirmation selon laquelle K3 n’est pas au niveau des modèles américains de pointe ne correspond pas à mon expérience.
Ici, il faudrait préciser si « Claude » désigne Opus ou Fable, et quel niveau d’intensité de raisonnement est utilisé.
La formulation initiale était imprécise : je n’utilise pas Fable ou K3 la plupart du temps, et je traite généralement des tâches de périmètre limité avant de les relire moi-même.
La politique de confidentialité n’est pas non plus un détail. Avec un abonnement Kimi, l’entreprise indique utiliser les interactions pour l’entraînement du modèle, et ne pas le faire uniquement lorsque l’on accède directement à l’API au tarif API. Reste à savoir si l’on fait confiance à cette affirmation.
J’attendrai que d’autres fournisseurs apparaissent sur OpenRouter, puis j’évaluerai leur fiabilité. Même si je ne leur fais pas une confiance énorme, avec un fournisseur qui n’entraîne pas directement ses propres modèles, la probabilité que les données servent à l’entraînement est plus faible.
99 % des utilisateurs ne manipulent pas de propriété intellectuelle particulière qui mérite de s’en inquiéter.
Jusqu’ici, au final, tout relevait déjà de la distillation. Comme l’a dit Suhail, il faut ramener les profits des modèles d’IA presque à zéro.
Puisqu’ils ont été entraînés sur les données de l’humanité, ils devraient être un cadeau fait à l’humanité elle-même, afin d’empêcher qu’une minorité ne contrôle l’humanité.
Les modèles open source ont déjà atteint le niveau des meilleurs modèles commerciaux. Le dernier goulot d’étranglement est le matériel, mais cette barrière baisse elle aussi rapidement.
Faire tourner Kimi K3 chez soi reste très coûteux, mais il existe déjà de nombreux modèles gratuits performants capables de tourner sur du matériel raisonnable, et cette tendance va se poursuivre.