- Kimi K3 est un modèle agent natif multimodal à poids ouverts, doté de 2,8 billions de paramètres et d’un contexte de 1 048 576 tokens, conçu pour le codage de longue durée, le travail de connaissance et le raisonnement
- Il combine Kimi Delta Attention (KDA), Attention Residuals et Stable LatentMoE, active 16 experts par token parmi 896, et affiche une efficacité globale de mise à l’échelle environ 2,5 fois supérieure à celle de Kimi K2
- Dans les évaluations publiques, il obtient 93,5 sur GPQA Diamond, 88,3 sur Terminal-Bench 2.1, 91,2 sur BrowseComp et 91,1 sur OmniDocBench, mais il faut aussi tenir compte des différences de harness, de réglages d’inférence et de matériel selon les modèles
- Il a été entraîné avec prise en compte de la quantification en poids MXFP4 et activations MXFP8, et peut s’exécuter via Transformers, vLLM, SGLang, Docker et des API compatibles OpenAI et Anthropic
- Dans les conversations multi-tours et les appels d’outils, il faut renvoyer tel quel l’intégralité du message assistant retourné par l’API, y compris
reasoning_contentettool_calls, et le code comme les poids sont publiés sous la Kimi K3 License
Architecture et taille du modèle
- Kimi K3 est un modèle agent natif multimodal à poids ouverts conçu pour le codage de longue durée, le travail de connaissance et le raisonnement
- Il compte 2.8T paramètres au total, dont 104B actifs, et se compose de 93 couches
- Il utilise 1 couche Dense, 69 couches KDA et 24 couches Gated MLA
- La dimension cachée d’attention est de 7 168 et le nombre de têtes d’attention est de 96
- Stable LatentMoE sélectionne 16 experts par token parmi 896 et utilise 2 experts partagés
- La dimension Latent MoE est de 3 584, et la dimension cachée MoE par expert est de 3 072
- Par rapport à Kimi K2, l’efficacité globale de mise à l’échelle progresse d’environ 2,5 fois
- La taille du vocabulaire est de 160K, la longueur de contexte est de 1 048 576 tokens et la fonction d’activation est SiTU-GLU
- Il utilise MoonViT-V2 de 401M paramètres comme encodeur visuel
- Les fonctions principales incluent la compréhension du texte, des images et de la vidéo, mais le champ modality du tableau récapitulatif du modèle ne mentionne que Text et Image
Codage longue durée et travail de connaissance
- Il maintient de longues sessions d’ingénierie avec un minimum de supervision humaine, tout en explorant de grands dépôts et en orchestrant des outils terminal
- Il prend en charge l’optimisation de kernels GPU et le développement de compilateurs
- Le développement de jeux avec vision, la CAO et la conception de puces font aussi partie des cas visés
- Pour le travail de connaissance agentique, il produit des visualisations interactives, des widgets et des tableaux de bord avec des recherches approfondies
- Le motion design et le montage vidéo entrent aussi dans son périmètre
- Le framework d’agent de codage recommandé est Kimi Code CLI, et Kimi K3 peut être sélectionné dans le terminal avec la commande
/model
Résultats d’évaluation
- Tous les résultats de Kimi K3 sont mesurés avec
reasoning_effort="max"et une température de 1.0- Les tâches en une seule étape comme GPQA Diamond, HLE-Full ou les évaluations visuelles sans outil utilisent top-p 0.95
- Les tâches agentiques utilisent top-p 1.0
- En évaluation du raisonnement et des connaissances, il obtient 93,5 sur GPQA Diamond, 23,4 sur CritPt et 74,7 sur AA-LCR
- HLE-Full est à 43,5 sans outil et à 56,0 avec outils
- En évaluation de codage, il obtient 77,8 sur ProgramBench, 88,3 sur Terminal-Bench 2.1 et 81,2 sur FrontierSWE
- DeepSWE est à 67,5 avec le harness Kimi Code et à 67,3 avec le harness mini-SWE-agent
- Il enregistre 42,0 sur SWE-Marathon, 36,6 sur PostTrainBench, 48,3 sur MLS-Bench-Lite, 58,7 sur SciCode et 72,9 sur Kimi Code Bench 2.0
- En évaluation agentique, il obtient 91,2 sur BrowseComp, 95,0 en F1 sur DeepSearchQA et 76,2 sur ResearchRubrics
- MCPMark-Verified est à 94,5, AutomationBench à 30,8, SpreadsheetBench 2 à 34,8 et OSWorld-Verified à 84,8
- Harvey Lab-AA est mesuré à 94,6, CorpFin v2 à 71,6, Finance Agent v2 à 54,4 et Legal Research Bench à 44,2
- En évaluation visuelle, il obtient 91,1 sur OmniDocBench, 90,0 sur Video-MME et 82,1 sur MMVU
- MMMU-Pro est à 81,6 sans outil et à 83,4 avec outils
- MathVision passe de 94,3 à 97,8 avec l’usage de Python
- ZeroBench pass@5 monte de 23,0 à 41,0 avec outils
Conditions d’évaluation et limites de comparaison
- Les modèles comparés incluent Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 et GLM-5.2, mais les harness d’évaluation peuvent différer selon les modèles
- Kimi K3 utilise principalement Kimi Code ou Claude Code
- La famille GPT utilise surtout Codex, tandis que les autres modèles Claude et GLM utilisent Claude Code ou Terminus 2, entre autres
- SWE-Marathon est évalué sur une branche ajustée pour H20 à partir des tâches disponibles au 9 juillet 2026, avant la version finale v1.1
- Les images Docker, les critères de performance GPU et l’oracle de référence ont été recalibrés pour H20, mais ni l’exactitude ni les validateurs anti-triche n’ont été modifiés
- Claude Fable 5 a subi des fallback sur 35 % des tâches, ce qui a pu pénaliser les performances mesurées
- PostTrainBench correspond à la moyenne de 3 exécutions menées avec effort d’inférence maximal sur GPU H20 au lieu du H100 de l’environnement officiel
- Kimi Code Bench 2.0 comprend des tâches de cybersécurité et de sûreté
- Claude Fable 5 a connu 13 fallback et 1 refus sur 80 tâches
- GPT-5.6 Sol a refusé 10 tâches et GPT-5.5 en a refusé 3
- Le score de 91,2 sur BrowseComp a été obtenu avec une stratégie de compression de contexte opérant sur 300K tokens
- En utilisant toute la fenêtre de 1M tokens sans gestion de contexte séparée, le score est de 90,4
- Les évaluations multimodales utilisent la moyenne de 3 exécutions, sauf pour ZeroBench
- ZeroBench est exécuté 5 fois selon le protocole officiel
- PerceptionBench est un benchmark interne qui mesure les capacités atomiques de perception visuelle
Quantification native
- L’entraînement avec prise en compte de la quantification est appliqué dès l’étape SFT
- Les poids utilisent MXFP4 et les activations MXFP8 afin de viser une large compatibilité matérielle
Déploiement et exécution
- On peut accéder à Kimi API en sélectionnant
kimi-k3, avec une API compatible OpenAI et Anthropic - Dans Hugging Face Transformers, il peut être chargé avec
pipeline("image-text-to-text", ...)ouAutoModel.from_pretrained(...)trust_remote_code=Trueest nécessaire pour utiliser le code de modèle personnalisé
- Le serving local est pris en charge par vLLM et SGLang
- Les deux moteurs peuvent traiter des requêtes texte et image via le endpoint compatible OpenAI
/v1/chat/completions
- Les deux moteurs peuvent traiter des requêtes texte et image via le endpoint compatible OpenAI
- Dans Docker Model Runner, l’exécution se fait avec
docker model run hf.co/moonshotai/Kimi-K3 - Le modèle peut aussi être utilisé sur HuggingChat, Google Colab et Kaggle
Utilisation de l’API avec conservation de l’état de raisonnement
- Kimi K3 a le mode de réflexion toujours activé et renvoie
reasoning_content - Le champ de requête de premier niveau
reasoning_effortprend en charge"low","high"et"max", avec"max"comme valeur par défaut - Les conversations multi-tours et les appels d’outils doivent suivre une méthode de conservation de l’historique de réflexion
- Il faut renvoyer tel quel dans
messagesle message assistant retourné par l’API - Il faut inclure non seulement
content, mais aussireasoning_contentettool_calls
- Il faut renvoyer tel quel dans
- Les entrées visuelles, les sorties structurées, le partial mode, la sélection d’outils, le chargement dynamique d’outils et le context caching sont décrits dans Kimi K3 Quickstart et Thinking Effort
Licence
- Le dépôt de code et les poids du modèle sont tous deux publiés sous la Kimi K3 License
2 commentaires
Ce serait bien qu’un fournisseur le propose en Corée.
Avis sur Hacker News
Une fois fixé le prix intermédiaire tiers d’un modèle à 3 billions de paramètres, on pourra estimer le coût réel du serving et voir si le labo subventionne ou non les tokens API
Comme il est nativement en MXFP4, il faut environ 1,5 To de VRAM, ce qui le place à la limite de 8×B200 ; en tenant compte aussi de la longueur de contexte et de l’optimisation du débit, 16 cartes semblent plus réalistes
Sur le benchmark AISI de cybersécurité, il fait mieux que GLM 5.2 mais reste très loin des meilleurs modèles fermés, donc un fine-tuning pourrait être nécessaire. On peut aussi se demander si Cursor va le réentraîner pour le comparer directement aux modèles Composer, qui sont des versions fine-tunées de Kimi 2.6/2.7, ainsi qu’à Grok 4.5
On peut aussi espérer la création de petits modèles via une vraie distillation de connaissances apprenant toute la distribution de probabilité. DSV4-Kimi semble prometteur en particulier grâce à son faible coût de serving
Avec un serveur 4U d’occasion et 32 barrettes ECC DIMM de 64 Go, on peut monter à 3 To de RAM pour moins de 30 000 dollars, ce qui crée un vrai écart de prix avec du matériel GPU. Il n’existe pas encore de poids en pleine précision ni de version quantifiée Q8/Q8-XL d’Unsloth, mais pour disposer d’un contexte confortable, il semble qu’il faille dépasser 1 536 Go pour aller vers 2 To, idéalement 2,5 à 3 To
Q4 et Q6 risquent d’être le pire compromis possible, en perdant à la fois des connaissances et de la précision tout en restant lents et peu fiables ; pour faire tourner sur du matériel peu coûteux un modèle intelligent mais lent, Q8 paraît nécessaire
Une preuve de concept a été réalisée sur https://github.com/woct0rdho/transformers5-qwen3.5-recipe ; sans offload CPU, on peut fine-tuner Qwen3.5-35B-A3B avec 16GiB de VRAM et DeepSeek-V4-Flash 284B-A13B avec 90GiB de VRAM. Cela fonctionne aussi bien sur des systèmes à mémoire unifiée comme Strix Halo
Cela dit, un modèle de la taille de Kimi-K3 nécessite plusieurs GPU et nœuds, donc il y a bien plus de problèmes à résoudre que pour l’entraînement sur un seul GPU
Dans cette publication, l’aspect bien plus intéressant que le prix est la personnalisation. Même les startups peuvent télécharger les poids, les modifier et les affiner ; le véritable avantage n’est pas le coût mais la performance sur leurs propres données et la souveraineté de la propriété intellectuelle. C’est une grande réussite pour l’équipe Kimi
J’ai l’impression que le matériel pour faire tourner des LLM en individuel est mal adapté à l’usage. Soit on se contente de 5 à 10 tokens par seconde avec de la mémoire unifiée, soit il faut passer à des cartes de datacenter avec plusieurs centaines de Go de VRAM et plus de 1 kW de consommation
Il n’existe pas de GPU quasi professionnels avec 128 ou 256 Go de VRAM pour un TDP de 180 à 250 W ; pourtant, deux cartes de ce type avec une interconnexion banalisée de niveau NVLink seraient déjà très utiles. Exécuter Kimi K3 en local demanderait un home lab énorme et très coûteux, mais ce serait bien de pouvoir faire tourner GLM 5.2 à environ 100 tokens par seconde sur une seule session, ou autour de 60 tokens par seconde avec plusieurs sous-agents
D’après des mesures avec le dernier
llama-serverlancé avec--no-mmap, on obtient les estimations suivantes : DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, Qwen3.5-122B-A10B Q8_K_XL 170,038MiBCela contraste avec les tâches desktop, elles aussi intermittentes, mais pour lesquelles la puissance de calcul nécessaire est devenue assez bon marché pour qu’on puisse garder sur son bureau des machines surdimensionnées au regard de leur temps d’inactivité
gpt-osscomme rare exception, et rendent l’exécution des modèles ouverts de plus en plus difficile tout en parlant de démocratisation, ce qui paraît particulièrement injusteSi l’on peut acheter un GPU à plusieurs milliers de dollars, on le fera peut-être en passionné fortuné, mais il faut reconnaître que c’est un luxe extrêmement inefficace, comme une voiture de sport. Le vrai malheur, c’est qu’on ne dispose ni de la technologie informatique ni des institutions politiques et sociales nécessaires pour exploiter du matériel mutualisé de manière fiable
Selon la licence, si le titulaire de la licence ou une société affiliée exploite une activité de modèle en tant que service et que le chiffre d'affaires cumulé sur 12 mois consécutifs dépasse 20 millions de dollars, il faut conclure un accord séparé avec Moonshot AI avant toute utilisation commerciale du logiciel ou de ses dérivés
Disponible sur https://app.fireworks.ai/models/fireworks/kimi-k3, au prix de 3 $ par million de tokens en entrée non mise en cache, 0,30 $ en entrée mise en cache, et 15 $ en sortie
Pour l'instant, la latence est nettement plus faible que chez Moonshot, mais l'utilisation est aussi bien moindre, donc il reste à voir si cela tiendra. Cela dit, le déploiement le jour même est impressionnant
Sous l'effet de la concurrence, le prix de GLM 5.2 a baissé d'environ 45 % en à peine 1,5 mois après sa sortie du 16 juin, et de nouveaux fournisseurs continuent encore de se livrer une guerre des prix : https://openrouter.ai/z-ai/glm-5.2#providers
D'un point de vue économique, le prix ne doit pas nécessairement être inférieur au coût total, mais il ne doit pas être inférieur au coût marginal, qui, pour un datacenter avec un faible taux d'utilisation GPU, correspond à peu près au coût de l'électricité. On peut supposer qu'en raison de la surcapacité et de la concurrence entre petits datacenters, certains finiront bientôt par vendre des tokens à un niveau inférieur à la somme du coût de l'électricité et de l'amortissement GPU
Sur Hugging Face, quand je lui ai demandé “Tell me about yourself”, Kimi K3 a répondu de façon intéressante qu'il était Claude créé par Anthropic
Je recommande de télécharger les modèles de pointe pour les conserver. Même 1,5 To peut être stocké sur un disque bon marché, et ce sera encore plus utile si vous seediez le torrent
Comme on a autrefois tenté de contrôler les algorithmes de chiffrement, les modèles pourraient eux aussi être verrouillés par la régulation, et les logiciels publics ne survivent que s'ils sont largement distribués. Avec le temps, ils deviendront réellement exécutables grâce aux progrès des techniques et aux investissements massifs dans la fabrication du matériel ; il serait regrettable qu'à ce moment-là leur diffusion soit devenue illégale et qu'il faille payer le coût de la capture réglementaire
L'adresse magnet est
magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2FannounceAprès examen de la licence et tests sur du vrai matériel, il semble difficile pour les fournisseurs de proposer des tarifs 60 à 70 % moins chers que ceux de Moonshot. Ils peuvent sans doute baisser un peu, mais sans sacrifier fortement la vitesse de traitement, un rabais du niveau de GLM paraît difficile
La marge de Kimi est estimée à environ 40 à 50 %, même en supposant des GPU obtenus à des prix de location élevés ; elle pourrait être encore supérieure avec leur propre matériel. Mais cela reste loin des plus de 90 % de marge qu'attribuent certains à Anthropic, et même les 80 % de marge de l'API Anthropic paraissent douteux
Si le seul coût réel était l'électricité, 80 à 90 % serait possible, mais au vu du nombre de tokens par seconde actuellement proposé, cela ne semble pas facile. Les tests n'ont été faits que sur B200, sans accès à des B300 ; le modèle est déjà quantifié, et comme le contexte à 1 million de tokens n'est pas utilisé, la marge d'optimisation mémoire immédiate paraît faible. Ce serait bien que quelqu'un ayant accès au R100 puisse vérifier les coûts
Les grands fournisseurs doivent conclure un accord avec Kimi, donc tant que Kimi restera le meilleur modèle public, il sera difficile d'espérer de fortes remises
Je me demande si le lien original renvoie 404 parce qu’il a été bloqué ou autocensuré
Il semble probable qu’il y ait une demande pour l’archiver au cas où il disparaîtrait soudainement à cause d’un contrôle gouvernemental. La Chine a aussi récemment commencé à discuter d’un contrôle des exportations de modèles, et la situation est différente maintenant qu’elle commence à publier non plus des modèles en retard, mais des modèles de pointe