1 points par GN⁺ 3 시간 전 | 2 commentaires | Partager sur WhatsApp
  • Kimi K3 est un modèle agent natif multimodal à poids ouverts, doté de 2,8 billions de paramètres et d’un contexte de 1 048 576 tokens, conçu pour le codage de longue durée, le travail de connaissance et le raisonnement
  • Il combine Kimi Delta Attention (KDA), Attention Residuals et Stable LatentMoE, active 16 experts par token parmi 896, et affiche une efficacité globale de mise à l’échelle environ 2,5 fois supérieure à celle de Kimi K2
  • Dans les évaluations publiques, il obtient 93,5 sur GPQA Diamond, 88,3 sur Terminal-Bench 2.1, 91,2 sur BrowseComp et 91,1 sur OmniDocBench, mais il faut aussi tenir compte des différences de harness, de réglages d’inférence et de matériel selon les modèles
  • Il a été entraîné avec prise en compte de la quantification en poids MXFP4 et activations MXFP8, et peut s’exécuter via Transformers, vLLM, SGLang, Docker et des API compatibles OpenAI et Anthropic
  • Dans les conversations multi-tours et les appels d’outils, il faut renvoyer tel quel l’intégralité du message assistant retourné par l’API, y compris reasoning_content et tool_calls, et le code comme les poids sont publiés sous la Kimi K3 License

Architecture et taille du modèle

  • Kimi K3 est un modèle agent natif multimodal à poids ouverts conçu pour le codage de longue durée, le travail de connaissance et le raisonnement
  • Il compte 2.8T paramètres au total, dont 104B actifs, et se compose de 93 couches
    • Il utilise 1 couche Dense, 69 couches KDA et 24 couches Gated MLA
    • La dimension cachée d’attention est de 7 168 et le nombre de têtes d’attention est de 96
  • Stable LatentMoE sélectionne 16 experts par token parmi 896 et utilise 2 experts partagés
    • La dimension Latent MoE est de 3 584, et la dimension cachée MoE par expert est de 3 072
    • Par rapport à Kimi K2, l’efficacité globale de mise à l’échelle progresse d’environ 2,5 fois
  • La taille du vocabulaire est de 160K, la longueur de contexte est de 1 048 576 tokens et la fonction d’activation est SiTU-GLU
  • Il utilise MoonViT-V2 de 401M paramètres comme encodeur visuel
  • Les fonctions principales incluent la compréhension du texte, des images et de la vidéo, mais le champ modality du tableau récapitulatif du modèle ne mentionne que Text et Image

Codage longue durée et travail de connaissance

  • Il maintient de longues sessions d’ingénierie avec un minimum de supervision humaine, tout en explorant de grands dépôts et en orchestrant des outils terminal
    • Il prend en charge l’optimisation de kernels GPU et le développement de compilateurs
    • Le développement de jeux avec vision, la CAO et la conception de puces font aussi partie des cas visés
  • Pour le travail de connaissance agentique, il produit des visualisations interactives, des widgets et des tableaux de bord avec des recherches approfondies
    • Le motion design et le montage vidéo entrent aussi dans son périmètre
  • Le framework d’agent de codage recommandé est Kimi Code CLI, et Kimi K3 peut être sélectionné dans le terminal avec la commande /model

Résultats d’évaluation

  • Tous les résultats de Kimi K3 sont mesurés avec reasoning_effort="max" et une température de 1.0
    • Les tâches en une seule étape comme GPQA Diamond, HLE-Full ou les évaluations visuelles sans outil utilisent top-p 0.95
    • Les tâches agentiques utilisent top-p 1.0
  • En évaluation du raisonnement et des connaissances, il obtient 93,5 sur GPQA Diamond, 23,4 sur CritPt et 74,7 sur AA-LCR
    • HLE-Full est à 43,5 sans outil et à 56,0 avec outils
  • En évaluation de codage, il obtient 77,8 sur ProgramBench, 88,3 sur Terminal-Bench 2.1 et 81,2 sur FrontierSWE
    • DeepSWE est à 67,5 avec le harness Kimi Code et à 67,3 avec le harness mini-SWE-agent
    • Il enregistre 42,0 sur SWE-Marathon, 36,6 sur PostTrainBench, 48,3 sur MLS-Bench-Lite, 58,7 sur SciCode et 72,9 sur Kimi Code Bench 2.0
  • En évaluation agentique, il obtient 91,2 sur BrowseComp, 95,0 en F1 sur DeepSearchQA et 76,2 sur ResearchRubrics
    • MCPMark-Verified est à 94,5, AutomationBench à 30,8, SpreadsheetBench 2 à 34,8 et OSWorld-Verified à 84,8
    • Harvey Lab-AA est mesuré à 94,6, CorpFin v2 à 71,6, Finance Agent v2 à 54,4 et Legal Research Bench à 44,2
  • En évaluation visuelle, il obtient 91,1 sur OmniDocBench, 90,0 sur Video-MME et 82,1 sur MMVU
    • MMMU-Pro est à 81,6 sans outil et à 83,4 avec outils
    • MathVision passe de 94,3 à 97,8 avec l’usage de Python
    • ZeroBench pass@5 monte de 23,0 à 41,0 avec outils

Conditions d’évaluation et limites de comparaison

  • Les modèles comparés incluent Claude Fable 5, GPT-5.6 Sol, Claude Opus 4.8, GPT-5.5 et GLM-5.2, mais les harness d’évaluation peuvent différer selon les modèles
    • Kimi K3 utilise principalement Kimi Code ou Claude Code
    • La famille GPT utilise surtout Codex, tandis que les autres modèles Claude et GLM utilisent Claude Code ou Terminus 2, entre autres
  • SWE-Marathon est évalué sur une branche ajustée pour H20 à partir des tâches disponibles au 9 juillet 2026, avant la version finale v1.1
    • Les images Docker, les critères de performance GPU et l’oracle de référence ont été recalibrés pour H20, mais ni l’exactitude ni les validateurs anti-triche n’ont été modifiés
    • Claude Fable 5 a subi des fallback sur 35 % des tâches, ce qui a pu pénaliser les performances mesurées
  • PostTrainBench correspond à la moyenne de 3 exécutions menées avec effort d’inférence maximal sur GPU H20 au lieu du H100 de l’environnement officiel
  • Kimi Code Bench 2.0 comprend des tâches de cybersécurité et de sûreté
    • Claude Fable 5 a connu 13 fallback et 1 refus sur 80 tâches
    • GPT-5.6 Sol a refusé 10 tâches et GPT-5.5 en a refusé 3
  • Le score de 91,2 sur BrowseComp a été obtenu avec une stratégie de compression de contexte opérant sur 300K tokens
    • En utilisant toute la fenêtre de 1M tokens sans gestion de contexte séparée, le score est de 90,4
  • Les évaluations multimodales utilisent la moyenne de 3 exécutions, sauf pour ZeroBench
    • ZeroBench est exécuté 5 fois selon le protocole officiel
    • PerceptionBench est un benchmark interne qui mesure les capacités atomiques de perception visuelle

Quantification native

  • L’entraînement avec prise en compte de la quantification est appliqué dès l’étape SFT
  • Les poids utilisent MXFP4 et les activations MXFP8 afin de viser une large compatibilité matérielle

Déploiement et exécution

  • On peut accéder à Kimi API en sélectionnant kimi-k3, avec une API compatible OpenAI et Anthropic
  • Dans Hugging Face Transformers, il peut être chargé avec pipeline("image-text-to-text", ...) ou AutoModel.from_pretrained(...)
    • trust_remote_code=True est nécessaire pour utiliser le code de modèle personnalisé
  • Le serving local est pris en charge par vLLM et SGLang
    • Les deux moteurs peuvent traiter des requêtes texte et image via le endpoint compatible OpenAI /v1/chat/completions
  • Dans Docker Model Runner, l’exécution se fait avec docker model run hf.co/moonshotai/Kimi-K3
  • Le modèle peut aussi être utilisé sur HuggingChat, Google Colab et Kaggle

Utilisation de l’API avec conservation de l’état de raisonnement

  • Kimi K3 a le mode de réflexion toujours activé et renvoie reasoning_content
  • Le champ de requête de premier niveau reasoning_effort prend en charge "low", "high" et "max", avec "max" comme valeur par défaut
  • Les conversations multi-tours et les appels d’outils doivent suivre une méthode de conservation de l’historique de réflexion
    • Il faut renvoyer tel quel dans messages le message assistant retourné par l’API
    • Il faut inclure non seulement content, mais aussi reasoning_content et tool_calls
  • Les entrées visuelles, les sorties structurées, le partial mode, la sélection d’outils, le chargement dynamique d’outils et le context caching sont décrits dans Kimi K3 Quickstart et Thinking Effort

Licence

  • Le dépôt de code et les poids du modèle sont tous deux publiés sous la Kimi K3 License

2 commentaires

 
treestae 1 시간 전

Ce serait bien qu’un fournisseur le propose en Corée.

 
GN⁺ 3 시간 전
Avis sur Hacker News
  • Une fois fixé le prix intermédiaire tiers d’un modèle à 3 billions de paramètres, on pourra estimer le coût réel du serving et voir si le labo subventionne ou non les tokens API
    Comme il est nativement en MXFP4, il faut environ 1,5 To de VRAM, ce qui le place à la limite de 8×B200 ; en tenant compte aussi de la longueur de contexte et de l’optimisation du débit, 16 cartes semblent plus réalistes
    Sur le benchmark AISI de cybersécurité, il fait mieux que GLM 5.2 mais reste très loin des meilleurs modèles fermés, donc un fine-tuning pourrait être nécessaire. On peut aussi se demander si Cursor va le réentraîner pour le comparer directement aux modèles Composer, qui sont des versions fine-tunées de Kimi 2.6/2.7, ainsi qu’à Grok 4.5
    On peut aussi espérer la création de petits modèles via une vraie distillation de connaissances apprenant toute la distribution de probabilité. DSV4-Kimi semble prometteur en particulier grâce à son faible coût de serving

    • Je me demande quelles performances d’inférence lentes on pourrait obtenir sur des serveurs Xeon bi- ou quad-socket avec 1,5 à 3 To de RAM, sans GPU. Pour des tâches longues de 4 à 6 heures, même 5 à 6 tokens par seconde pourraient être exploitables selon l’usage
      Avec un serveur 4U d’occasion et 32 barrettes ECC DIMM de 64 Go, on peut monter à 3 To de RAM pour moins de 30 000 dollars, ce qui crée un vrai écart de prix avec du matériel GPU. Il n’existe pas encore de poids en pleine précision ni de version quantifiée Q8/Q8-XL d’Unsloth, mais pour disposer d’un contexte confortable, il semble qu’il faille dépasser 1 536 Go pour aller vers 2 To, idéalement 2,5 à 3 To
      Q4 et Q6 risquent d’être le pire compromis possible, en perdant à la fois des connaissances et de la précision tout en restant lents et peu fiables ; pour faire tourner sur du matériel peu coûteux un modèle intelligent mais lent, Q8 paraît nécessaire
    • Aujourd’hui, le fine-tuning consiste généralement à appliquer du LoRA sur des modèles en bnb 4 bits, mais il serait temps de passer le format de base à GGUF. GGUF prend activement en charge les nouvelles architectures de modèles et des quantifications plus agressives
      Une preuve de concept a été réalisée sur https://github.com/woct0rdho/transformers5-qwen3.5-recipe ; sans offload CPU, on peut fine-tuner Qwen3.5-35B-A3B avec 16GiB de VRAM et DeepSeek-V4-Flash 284B-A13B avec 90GiB de VRAM. Cela fonctionne aussi bien sur des systèmes à mémoire unifiée comme Strix Halo
      Cela dit, un modèle de la taille de Kimi-K3 nécessite plusieurs GPU et nœuds, donc il y a bien plus de problèmes à résoudre que pour l’entraînement sur un seul GPU
    • Anthropic et OpenAI disposent d’innovations d’optimisation que les laboratoires chinois n’ont pas, donc ce prix montre au mieux une borne supérieure du coût, pas une borne inférieure
    • Comme il s’agit d’un modèle natif MXFP4, l’aspect matériel est lui aussi intéressant. Il tient confortablement dans un nœud 8×AMD MI355X, ce qui pourrait encore faire baisser le prix par token
    • Sans connaître le coût d’entraînement, on ne peut qu’inférer le coût marginal du serving de tels modèles, pas savoir si le labo subventionne les tokens API. On ignore aussi la taille réelle des modèles fermés ; on ne sait même pas si Fable fait 10 billions ou 1 billion de paramètres
  • Dans cette publication, l’aspect bien plus intéressant que le prix est la personnalisation. Même les startups peuvent télécharger les poids, les modifier et les affiner ; le véritable avantage n’est pas le coût mais la performance sur leurs propres données et la souveraineté de la propriété intellectuelle. C’est une grande réussite pour l’équipe Kimi

  • J’ai l’impression que le matériel pour faire tourner des LLM en individuel est mal adapté à l’usage. Soit on se contente de 5 à 10 tokens par seconde avec de la mémoire unifiée, soit il faut passer à des cartes de datacenter avec plusieurs centaines de Go de VRAM et plus de 1 kW de consommation
    Il n’existe pas de GPU quasi professionnels avec 128 ou 256 Go de VRAM pour un TDP de 180 à 250 W ; pourtant, deux cartes de ce type avec une interconnexion banalisée de niveau NVLink seraient déjà très utiles. Exécuter Kimi K3 en local demanderait un home lab énorme et très coûteux, mais ce serait bien de pouvoir faire tourner GLM 5.2 à environ 100 tokens par seconde sur une seule session, ou autour de 60 tokens par seconde avec plusieurs sous-agents

    • Les grands modèles en Q8 souhaités ne tiennent pas dans un système à 3 995 dollars avec seulement 128 Go de RAM, et il n’y a même pas assez d’espace de contexte pour un usage pratique. Qwen 3.5 122B Q8, DeepSeek V4 Flash Q8 et Laguna S 2.1 Q8 demandent 170 à 190 Go de RAM avec tout le contexte, ce qui tient en revanche dans une station de travail ou un serveur bi-socket 256 Go sans GPU
      D’après des mesures avec le dernier llama-server lancé avec --no-mmap, on obtient les estimations suivantes : DeepSeek-V4-Flash Q4_K_XL 178,175MiB, Q8_K_XL 184,636MiB, Laguna-S-2.1 Q8_K_X 172,860MiB, Qwen3.5-122B-A10B Q8_K_XL 170,038MiB
    • L’inférence LLM pour un utilisateur unique convient particulièrement mal au matériel grand public. La charge est intermittente, mais les poids doivent rester en mémoire en permanence ; un serveur multi-utilisateur qui conserve les poids en résidence et n’ajoute qu’un cache KV par utilisateur est bien plus efficace, tout en évitant que des cœurs GPU coûteux restent inactifs la plupart du temps
      Cela contraste avec les tâches desktop, elles aussi intermittentes, mais pour lesquelles la puissance de calcul nécessaire est devenue assez bon marché pour qu’on puisse garder sur son bureau des machines surdimensionnées au regard de leur temps d’inactivité
    • Après le boom des cryptomonnaies, les fabricants de GPU ont commencé à segmenter le marché par la VRAM pour pratiquer une discrimination tarifaire. Nvidia a limité la mémoire des cartes grand public afin d’éviter que les acteurs du cloud les raflent, et a ainsi pu vendre un matériel fondamentalement identique à des prix très différents sur les marchés PC et datacenter, en captant les profits des deux côtés
    • J’ai le sentiment qu’à mesure que les modèles grossissent, on va dans la direction inverse de la révolution PC. Les laboratoires de pointe ne publient que des modèles fermés, avec gpt-oss comme rare exception, et rendent l’exécution des modèles ouverts de plus en plus difficile tout en parlant de démocratisation, ce qui paraît particulièrement injuste
    • Faire tourner ce type de LLM chez soi restera difficilement pratique sans percée de conception. La seule manière raisonnable de les exécuter est de traiter de gros batches sur du matériel mutualisé
      Si l’on peut acheter un GPU à plusieurs milliers de dollars, on le fera peut-être en passionné fortuné, mais il faut reconnaître que c’est un luxe extrêmement inefficace, comme une voiture de sport. Le vrai malheur, c’est qu’on ne dispose ni de la technologie informatique ni des institutions politiques et sociales nécessaires pour exploiter du matériel mutualisé de manière fiable
  • Selon la licence, si le titulaire de la licence ou une société affiliée exploite une activité de modèle en tant que service et que le chiffre d'affaires cumulé sur 12 mois consécutifs dépasse 20 millions de dollars, il faut conclure un accord séparé avec Moonshot AI avant toute utilisation commerciale du logiciel ou de ses dérivés

    • Cela semble similaire à l'approche appliquée par Meta sur les premiers modèles Llama. Il y a aussi une clause, assez habile sur le plan marketing, exigeant que Kimi K3 soit affiché de manière visible dans l'interface utilisateur si le logiciel ou ses dérivés sont utilisés dans un produit ou service commercial dépassant 100 millions d'utilisateurs actifs mensuels ou 20 millions de dollars de revenus mensuels
  • Disponible sur https://app.fireworks.ai/models/fireworks/kimi-k3, au prix de 3 $ par million de tokens en entrée non mise en cache, 0,30 $ en entrée mise en cache, et 15 $ en sortie

    • Le plan tarifaire prioritaire Kimi de Fireworks est aussi proposé sur OpenRouter à 3,75 $ par million de tokens : https://openrouter.ai/moonshotai/kimi-k3#providers
      Pour l'instant, la latence est nettement plus faible que chez Moonshot, mais l'utilisation est aussi bien moindre, donc il reste à voir si cela tiendra. Cela dit, le déploiement le jour même est impressionnant
    • Claude Opus 5 est à 5 $ en entrée non mise en cache, 0,50 $ en entrée mise en cache, et 25 $ en sortie, avec en plus un surcoût d'écriture de cache de 25 % sur 5 minutes et de 100 % sur 1 heure
    • Fireworks a pu le proposer aux utilisateurs de notre plateforme quelques heures seulement après sa sortie. En revanche, ils ont arrêté les modèles Flux à la demande, donc il est regrettable de ne plus savoir où faire de la génération d'images
    • Également disponible sur Together.ai au même prix de vente, et Fireworks comme Together ont été les premiers que j'ai vérifiés
  • Sous l'effet de la concurrence, le prix de GLM 5.2 a baissé d'environ 45 % en à peine 1,5 mois après sa sortie du 16 juin, et de nouveaux fournisseurs continuent encore de se livrer une guerre des prix : https://openrouter.ai/z-ai/glm-5.2#providers
    D'un point de vue économique, le prix ne doit pas nécessairement être inférieur au coût total, mais il ne doit pas être inférieur au coût marginal, qui, pour un datacenter avec un faible taux d'utilisation GPU, correspond à peu près au coût de l'électricité. On peut supposer qu'en raison de la surcapacité et de la concurrence entre petits datacenters, certains finiront bientôt par vendre des tokens à un niveau inférieur à la somme du coût de l'électricité et de l'amortissement GPU

    • Il est aussi possible qu'ils vendent des tokens à bas prix puis revendent ailleurs les données de tokens des utilisateurs
    • Le chiffre de 45 % de baisse paraît douteux. Les fournisseurs bon marché sur OpenRouter utilisent du FP4, contrairement au FP8 officiel de Z.ai. Il existe aussi des fournisseurs FP8 peu chers comme Novita, mais dans l'interface cela ressemble à une remise temporaire, et le prix normal est presque identique à celui de Z.ai officiel
    • SemiAnalysis estime le coût d'un modèle d'environ 2 billions de paramètres à moins de 1 $ par million de tokens. Cela varie selon le débit et la quantification, mais si le coût de revient des grands fournisseurs est suffisamment bas, même le prix plancher actuel de 2,42 $ pour GLM 5.2 peut laisser une grosse marge
  • Sur Hugging Face, quand je lui ai demandé “Tell me about yourself”, Kimi K3 a répondu de façon intéressante qu'il était Claude créé par Anthropic

    • À la même question, il a aussi répondu normalement qu'il était Kimi développé par Moonshot AI
    • Ce genre de réponse n'a pas grande signification. Si on pose la même question en chinois à Opus, il répond parfois qu'il est DeepSeek, car les données d'entraînement se mélangent et que le modèle hallucine
    • Ce n'est pas surprenant. La distillation de connaissances est courante, et tous les laboratoires l'utilisent, volontairement ou non. En effet, les corpus d'entraînement postérieurs à ChatGPT contiennent inévitablement du contenu généré par IA
  • Je recommande de télécharger les modèles de pointe pour les conserver. Même 1,5 To peut être stocké sur un disque bon marché, et ce sera encore plus utile si vous seediez le torrent
    Comme on a autrefois tenté de contrôler les algorithmes de chiffrement, les modèles pourraient eux aussi être verrouillés par la régulation, et les logiciels publics ne survivent que s'ils sont largement distribués. Avec le temps, ils deviendront réellement exécutables grâce aux progrès des techniques et aux investissements massifs dans la fabrication du matériel ; il serait regrettable qu'à ce moment-là leur diffusion soit devenue illégale et qu'il faille payer le coût de la capture réglementaire

    • Le fichier torrent est ici : https://terminalbytes.com/kimi-k3-torrent/Kimi-K3.torrent
      L'adresse magnet est magnet:?xt=urn:btih:1e63a865fbf9b58decc8b71091db54d673c5da6f&dn=Kimi-K3&tr=udp%3A%2F%2Ftracker.opentrackr.org%3A1337%2Fannounce&tr=udp%3A%2F%2Ftracker.openbittorrent.com%3A6969%2Fannounce&tr=udp%3A%2F%2Fopen.stealth.si%3A80%2Fannounce&tr=udp%3A%2F%2Fexplodie.org%3A6969%2Fannounce&tr=udp%3A%2F%2Ftracker.torrent.eu.org%3A451%2Fannounce&tr=udp%3A%2F%2Fexodus.desync.com%3A6969%2Fannounce
    • Les autorités finiront par restreindre jusqu'à l'achat du matériel nécessaire pour faire tourner ce genre de modèles
    • Les disques bon marché n'existent plus vraiment, et je n'ai pas envie de dépenser plusieurs centaines de dollars pour une crainte réglementaire assez vague
  • Après examen de la licence et tests sur du vrai matériel, il semble difficile pour les fournisseurs de proposer des tarifs 60 à 70 % moins chers que ceux de Moonshot. Ils peuvent sans doute baisser un peu, mais sans sacrifier fortement la vitesse de traitement, un rabais du niveau de GLM paraît difficile
    La marge de Kimi est estimée à environ 40 à 50 %, même en supposant des GPU obtenus à des prix de location élevés ; elle pourrait être encore supérieure avec leur propre matériel. Mais cela reste loin des plus de 90 % de marge qu'attribuent certains à Anthropic, et même les 80 % de marge de l'API Anthropic paraissent douteux
    Si le seul coût réel était l'électricité, 80 à 90 % serait possible, mais au vu du nombre de tokens par seconde actuellement proposé, cela ne semble pas facile. Les tests n'ont été faits que sur B200, sans accès à des B300 ; le modèle est déjà quantifié, et comme le contexte à 1 million de tokens n'est pas utilisé, la marge d'optimisation mémoire immédiate paraît faible. Ce serait bien que quelqu'un ayant accès au R100 puisse vérifier les coûts
    Les grands fournisseurs doivent conclure un accord avec Kimi, donc tant que Kimi restera le meilleur modèle public, il sera difficile d'espérer de fortes remises

  • Je me demande si le lien original renvoie 404 parce qu’il a été bloqué ou autocensuré

    • Il y avait encore il y a quelques minutes une page de compte à rebours pour la publication des poids, avec 19 minutes restantes avant la fin, puis soudain une 404 est apparue
    • Il est très probable qu’il s’agisse d’un problème technique pendant la transition. Même si presque personne ne peut réellement l’exécuter, il serait aussi intéressant de voir ce qui arrive à Hugging Face si une multitude d’utilisateurs se mettent à télécharger un modèle de plusieurs To
      Il semble probable qu’il y ait une demande pour l’archiver au cas où il disparaîtrait soudainement à cause d’un contrôle gouvernemental. La Chine a aussi récemment commencé à discuter d’un contrôle des exportations de modèles, et la situation est différente maintenant qu’elle commence à publier non plus des modèles en retard, mais des modèles de pointe
    • Ça peut sonner comme du complotisme, mais ce serait une bonne occasion pour les États-Unis ou la Chine d’afficher leur influence, et l’hypothèse des États-Unis me paraît plus probable