- Kimi K3-256k est un modèle pour le codage au quotidien qui conserve la qualité des résultats de K3 dans un contexte de 256k, tout en consommant environ deux fois moins de quota que
k3avec un contexte de 1M - Kimi Code propose K3 et K2.7 Code via 4 ID de modèles ;
k3prend en charge 2,8T de paramètres et jusqu’à 1M de contexte, tandis quekimi-for-coding-highspeedoffre une sortie environ 5 à 6 fois plus rapide au prix d’une consommation de quota multipliée par 3 - Lors du passage de
k3àk3-256k, si le contexte existant dépasse 256k ou contient une vidéo, il faut d’abord exécuter compact afin de préserver les informations essentielles tout en maintenant la compatibilité - Changer de modèle ou de
reasoning_effortinvalide le cache de contexte existant et impose un nouveau préremplissage, ce qui peut augmenter l’usage ; il est recommandé de basculer dans une nouvelle session - Les modèles et contextes disponibles varient selon l’abonnement ; si vous dépassez vos droits, un
401est renvoyé. Dans les outils tiers, il faut configurer directement l’ID de modèle exact, la taille de contexte et l’intensité de raisonnement
Configuration des modèles de Kimi Code
- Kimi Code propose Kimi K3 et Kimi K2.7 Code via 4 ID de modèles
k3: modèle de codage flagship de 2,8T de paramètres, prenant en charge jusqu’à 1M de contexte avec les abonnements supérieursk3-256k: version à contexte 256k de Kimi K3, axée sur la réduction de la consommationkimi-for-coding: Kimi K2.7 Code, adapté à la complétion de code et aux tâches de développement couranteskimi-for-coding-highspeed: K2.7 Code HighSpeed, qui offre une sortie environ 5 à 6 fois plus rapide avec les mêmes capacités de codage
- Les spécifications et conditions d’accès par modèle sont les suivantes
k3- Fonctionne à vitesse normale et offre jusqu’à 1M de contexte aux membres des abonnements supérieurs
reasoning_effortprend en chargelow,highetmax, avechighcomme valeur par défaut- Disponible à partir de Moderato ; le contexte 1M est proposé à partir d’Allegretto
- Accepte les images et les vidéos en entrée
k3-256k- Fonctionne à vitesse normale et son contexte est fixé à 256k
reasoning_effortprend en chargelow,highetmax, avechighcomme valeur par défaut- Disponible pour les membres Moderato et supérieurs
- Accepte uniquement les images en entrée ; la vidéo n’est pas prise en charge
kimi-for-coding- Offre une vitesse normale et un contexte de 256k, et est disponible pour tous les membres
- Fonctionne avec
Thinking:ONet prend en charge les images et les vidéos
kimi-for-coding-highspeed- Produit des sorties environ 6 fois plus vite dans un contexte de 256k, mais consomme 3 fois plus de quota
- Disponible à partir d’Allegretto, avec prise en charge de
Thinking:ONet des entrées image/vidéo
Usages de K3-256k et changement de modèle
k3-256kfournit les mêmes résultats quek3dans une fenêtre de contexte de 256k, tout en consommant environ deux fois moins de quota que la version 1M- Il convient aux questions-réponses courantes, à la complétion de code, au développement de fonctionnalités générales et à l’édition de fichiers uniques ou de petits ensembles de fichiers, mais ne prend pas en charge les entrées vidéo
-
Passer de K3 à K3-256k
- Si le contexte de la session actuelle dépasse 256k, certains outils comme Kimi Code CLI et Claude Code effectuent eux-mêmes un compact
- Comme le traitement varie selon les outils d’agent, il est recommandé d’exécuter manuellement un compact une fois avant la bascule afin de compresser le contexte sous 256k
- Cela permet de conserver les éléments essentiels du travail tout en maintenant la session
- Après la bascule, le quota pourra être utilisé plus longtemps
- Si l’historique de conversation contient un fichier vidéo, il est impossible de passer directement à
k3-256k; il faut d’abord exécuter compact
-
Passer de K3-256k à K3
- Si
k3-256kapproche de la limite de 256k et que vous voulez éviter une perte d’information due au compact, vous pouvez basculer directement versk31M - Dans la version actuelle, le passage de 256k à 1M n’affecte pas le cache
- Si
Gestion du cache et de l’usage
- Changer de modèle fait que le cache de contexte construit par le modèle précédent ne correspond plus, et ce contexte doit être prérempli à nouveau
- C’est pourquoi l’usage peut sembler augmenter juste après la bascule. Lorsque vous utilisez un nouveau modèle, démarrer une nouvelle session est préférable pour de meilleurs résultats et une consommation plus faible
-
Coût du changement d’intensité de raisonnement
- Changer
reasoning_effortinvalide aussi le cache de contexte existant et impose un nouveau préremplissage - Il est recommandé de choisir l’intensité de raisonnement adaptée à la tâche, puis de la conserver de manière cohérente au sein d’une même session
- Si une autre intensité de raisonnement est réellement nécessaire, mieux vaut démarrer une nouvelle session plutôt que de basculer à répétition dans une longue session
- Changer
Droits d’abonnement et erreur 401
- Même avec le bon ID de modèle, si la fonctionnalité demandée dépasse les droits de l’abonnement, le serveur renvoie
401- Pas d’accès à K3 : les abonnements inférieurs à Moderato ne peuvent pas appeler
k3nik3-256k - Pas d’accès à 1M : avec Moderato,
k3prend en charge jusqu’à 256k ; le maximum de 1M est disponible à partir d’Allegretto - La limite de contexte de
k3-256kest fixée à 256k, quel que soit l’abonnement - Pas d’accès à HighSpeed :
kimi-for-coding-highspeednécessite Allegretto ou supérieur
- Pas d’accès à K3 : les abonnements inférieurs à Moderato ne peuvent pas appeler
- Le message d’erreur complet et les méthodes de traitement sont disponibles dans Error Reference
Pourquoi HighSpeed peut ne pas sembler rapide
- L’ID de modèle HighSpeed doit être exactement
kimi-for-coding-highspeed- En cas de saisie incorrecte, la requête est remplacée sans erreur par le
kimi-for-codingstandard, et aucune accélération n’apparaît
- En cas de saisie incorrecte, la requête est remplacée sans erreur par le
- HighSpeed accélère uniquement la sortie du modèle
- La lecture/écriture de fichiers, les appels de commandes et l’exécution de scripts ne sont pas accélérés
- Si une tâche contient une forte proportion d’exécution d’outils ou de scripts, le gain de vitesse global peut sembler limité
Changer de modèle dans les clients
- Changer l’ID de modèle invalide le cache de contexte. Pour éviter une consommation supplémentaire de tokens et obtenir la meilleure expérience, il est recommandé de démarrer une nouvelle session
- Lors de l’appel, il faut saisir l’un des ID de modèles suivants, et non le nom de version du modèle
k3k3-256kkimi-for-codingkimi-for-coding-highspeed
- Saisir un nom de version comme
Kimi K3ouK2.7 Codefait échouer l’appel - Si vous désactivez Thinking sur K3 ou K2.7, la requête est routée vers K2.6 ; pour utiliser K3 ou K2.7 Code, Thinking doit être activé
-
Clients officiels
- Dans Kimi Code CLI, vous pouvez saisir
/modelpour changer de modèle sans modifier la configuration - Si le dernier modèle n’apparaît pas dans la liste, reconnectez-vous avec
/logoutpuis/login - Dans Kimi Code for VS Code, sélectionnez le modèle dans le menu déroulant du champ de saisie
- Si le modèle ne s’affiche pas, redémarrez VS Code ou réinstallez l’extension
- Dans Kimi Code CLI, vous pouvez saisir
Configuration des outils tiers
- Après avoir créé une API Key dans Kimi Code Console, saisissez la Base URL et l’ID de modèle dans l’outil
- L’API Kimi Code prend en charge à la fois le protocole compatible OpenAI et le protocole compatible Anthropic
- Base URL compatible OpenAI :
https://api.kimi.com/coding/v1 - Base URL compatible Anthropic :
https://api.kimi.com/coding/
- Base URL compatible OpenAI :
- Les méthodes de configuration par outil sont disponibles dans les documents suivants
- Claude Code : assistant de codage en ligne de commande d’Anthropic
- OpenCode : agent de codage basé sur le terminal
- Codex : agent de codage d’OpenAI
-
Configuration du contexte K3
- Le contexte par défaut de certains outils tiers est inférieur au maximum de K3, soit 1M
- Pour utiliser jusqu’à 1M de contexte, il faut configurer directement le champ
context-windowsur1048576
-
Mapping de l’intensité de raisonnement K3
- K3 prend en charge
low,highetmax, et les valeurs envoyées par les outils sont mappées comme suit nullouundefined: valeur par défauthigh- Autre valeur inconnue : erreur HTTP
400 ultra,max,xhigh:maxhigh,medium: niveau recommandéhighlow,minimum,light:lownone:thinking.typeest désactivé
- K3 prend en charge
1 commentaires
Avis sur Hacker News
Codex exploite très bien le contexte de 256k. 1M offre de la marge, mais reste cher et semble inutile par défaut
Les LLM deviennent rapidement une commodité généraliste, et le moat des labos d’IA américains comme OpenAI s’affaiblit. Au final, les hyperscalers et propriétaires de datacenters capables de vendre des tokens bon marché ont de fortes chances de gagner
k3-256kest sorti et fournit les mêmes résultats dans un contexte de 256k.k3 (1M)consomme environ deux fois plus de quota quek3-256kC’est une bonne évolution. En général, j’essaie de garder le contexte sous les 200k
https://www.reddit.com/r/kimi/s/BFa1TR9vNg
Je me demande donc si tous les utilisateurs vont soudain utiliser Kimi à moitié prix jusqu’à ce que le contexte atteigne 256k. Si c’est vrai, c’est un énorme changement
k3-256kpuis en basculant vers le modèle 1M à 256k, le cache serait invalidé, et qu’il faudrait aussi repayer les 256k tokens existants au tarif du modèle 1MMais c’était faux : il est possible de passer au modèle 1M à l’approche de la limite de contexte sans invalidation du cache. Dans la version actuelle, passer de
k3-256kàk3 (1M)n’affecte pas le cacheCet article a été publié il y a 38 minutes, et depuis 20 minutes plusieurs services d’Anthropic sont indiqués en panne majeure. Ce n’est probablement pas lié, mais ça m’a un peu fait rire
Le modèle lui-même semble être le même ; il s’agit apparemment seulement d’un changement au niveau de l’API
C’est fonctionnellement similaire à la manière dont OpenAI change de palier tarifaire au-delà d’une certaine longueur de contexte. Le seuil est aussi autour de 272k, c’est-à-dire près de
2^18ou de 256kÀ mesure que le contexte actif augmente, la quantité de calcul nécessaire par token de sortie et le nombre d’octets à lire augmentent, donc il est logique de répercuter ce coût sur l’utilisateur. En revanche, il est surprenant qu’ils n’aient pas utilisé une courbe de prix progressive plutôt qu’un seuil par paliers
Une configuration à contexte court nécessite moins de nœuds dédiés au prefill par instance et n’a pas besoin de prendre en charge un grand cache KV, ce qui permet aussi de réduire le nombre total de nœuds. Avec l’inférence désagrégée, on peut également ajuster séparément la part de calcul allouée au prefill et au décodage
J’espère que ce changement réduira la charge sur l’infrastructure. Dernièrement, tous les modèles sont devenus nettement plus lents et l’équipe support ne réagit pas. Je soupçonne qu’une bonne partie des requêtes est traitée par des modèles quantifiés
Je me demande s’il ne s’agit pas d’un modèle quantifié, mais simplement d’une fenêtre de contexte limitée à 256k