- Sur environ 1 030 tâches d’agent, la comparaison entre Kimi K3 et Fable 5 montre qu’un routage par tâche atteint une qualité supérieure à celle de chaque modèle pris séparément, avec 93 % de précision
- Les performances globales étaient similaires sur les tâches SWE, terminal, algorithmes, multilingues et juridiques, mais les domaines où chaque modèle excelle différaient
- Le routage oracle a attribué 72 à 96 % des tâches à K3, et K3 était plus rentable que Fable sur les 5 groupes de tâches
- Dans les longues boucles d’agent, K3 a montré jusqu’à environ 50 fois plus d’efficacité coût/performance que l’utilisation de Fable seul, mais un plus grand nombre d’étapes d’exécution peut allonger le temps de traitement
- Un routeur adapté à la charge de travail, prenant un modèle open source bon marché comme base et envoyant les tâches difficiles vers d’autres modèles, peut améliorer à la fois la qualité et le coût
Mesuré sur de vraies tâches d’agent
- Kimi K3 et Fable 5 ont été exécutés dans le même harnais pour effectuer environ 1 030 tâches sous forme de véritables boucles d’agent
- SWE : 460 tâches similaires à des corrections de bugs sur de vrais dépôts
- Terminal : 89 tâches d’agent de longue durée liées à la sécurité, à la cryptographie, au reverse engineering et à l’administration système
- Algorithmes : 100 problèmes de type LeetCode et AtCoder
- Multilingue : 225 tâches d’implémentation dans 6 langages
- Juridique : 120 tâches d’agent juridique évaluées par des avocats
- Les deux modèles ont été comparés en moyennant les résultats de benchmark sur plusieurs types de tâches
Sens et limites du routage oracle
- Le routage oracle est une méthode de mesure théorique qui exécute chaque tâche sur tous les modèles, puis choisit le modèle le moins cher parmi ceux qui ont donné la bonne réponse
- En pratique, un routeur ne peut pas exécuter à l’avance la tâche sur plusieurs modèles ; il doit donc prédire en amont quel modèle offrira le meilleur équilibre entre coût et qualité
- Dans cette approche, K3 est sélectionné pour 72 à 96 % de l’ensemble des tâches
- Il pourrait être possible de concevoir un routeur qui distingue les tâches courantes des tâches de longue traîne nécessitant un modèle de tout premier niveau
- Pour le confirmer, il faut non pas quelques données supplémentaires, mais un volume de données de routage 10 fois supérieur ainsi qu’une validation des performances en conditions réelles
Performances globales similaires, mais points forts différents
- Sur le résultat SWE représentatif, K3 obtenait 92,4 % et Fable 92,6 %, soit des scores presque identiques
- Sur les 5 types de tâches, l’écart entre les deux modèles restait généralement de quelques points de pourcentage au plus, Fable gardant un léger avantage sur la programmation multilingue
- Malgré des scores globaux proches, chaque modèle montrait des zones de nette supériorité sur les tâches détaillées
Différences selon les domaines de tâches
- En découpant SWE par domaine de problème, K3 dominait en mathématiques symboliques et outils de développement, tandis que Fable était meilleur sur les tâches web et de visualisation de données
- Sur les tâches multilingues, Fable devançait K3 en Java, Python et C++, tandis que K3 faisait jeu égal en JavaScript et Rust
- Sur les longues tâches terminal impliquant des dizaines de manipulations shell, K3 se montrait plus solide
- Il a résolu des cas que Fable n’a pas pu traiter : hash 7z, cryptanalyse de FEAL, informations secrètes divulguées, vraies vulnérabilités et tâches asynchrones incontrôlables
- En comparant à la fois précision et coût, Fable était devant en multilingue, K3 en terminal et en juridique, et le reste était globalement similaire
La structure qui crée l’écart de coût
- L’avantage de coût de K3 vient du prix des tokens, du prompt caching et du volume injecté par tâche
- Par tâche SWE, K3 utilisait environ 55 tours et 1,3 million de tokens, contre environ 21 tours et 130 000 tokens pour Fable
- Sur les longues tâches terminal, à l’inverse, Fable montait jusqu’à environ 64 tours et 1,5 million de tokens, atteignant parfois le timeout
- Même en lisant 10 fois plus de tokens que Fable sur SWE, K3 restait moins cher à l’exécution grâce aux hits du prompt cache
- Quand le nombre d’étapes d’exécution augmente, le temps de traitement réel peut s’allonger
- Pour les tâches qui doivent répondre en moins de 2 secondes, la latence est critique
- Pour les agents de fond à grande échelle, c’est une facture d’exécution plus basse qui compte davantage
Résultat de la combinaison des deux modèles
- En envoyant chaque tâche vers le modèle le plus adapté, on n’obtient pas un niveau intermédiaire entre les deux, mais de meilleures performances que chaque modèle pris seul
- Le routage oracle par tâche a toujours donné de meilleurs résultats qu’une exécution sur un seul modèle, et la précision globale a atteint 93 %
- Même en envoyant 72 à 96 % du trafic vers K3, le modèle optimisé pour le coût, la qualité globale restait supérieure à celle de chaque modèle, tandis que le coût se rapprochait de celui de K3 seul
- K3 était plus rentable que Fable sur les 5 groupes de tâches, et dans les longues boucles d’agent il a atteint jusqu’à environ 50 fois plus d’efficacité coût/performance
Routage par charge de travail plutôt que modèle unique
- Router ensemble Kimi K3 et Fable permet de tirer parti de leurs forces différentes tout en réduisant les coûts
- Comme chaque modèle a son propre prix et ses domaines d’expertise, l’IA de meilleure qualité peut émerger d’une combinaison de plusieurs modèles plutôt que d’un fournisseur unique
- Un modèle open source comme K3, auquel l’oracle attribue la majorité du trafic et dont le coût peut être jusqu’à 50 fois inférieur, peut servir d’option par défaut
- Le routeur doit être adapté à la charge de travail réelle et continuer à apprendre la relation entre types de tâches et adéquation des modèles
1 commentaires
Avis de Hacker News
En les exécutant et en les testant soi-même, on voit que tous ces modèles sont surajustés aux benchmarks. Même s’ils se rapprochent des modèles de pointe sur certaines métriques, ils s’effondrent sur des tâches réelles et leur efficacité en tokens est absurdement faible.
Contrairement aux modèles fermés, Fireworks tire un gros bénéfice de l’hébergement de K3, donc l’incitation à mettre en avant ce genre de titre est très forte.
Cela dit, ils sont à peu près au niveau des meilleurs modèles de la génération précédente, Opus 4.8 et GPT 5.5, et on peut aussi les comparer sur https://senko.net/vibecode-bench/.
En utilisant les API officielles et leurs outils de codage respectifs, je leur ai demandé de créer une application web simple mais non triviale à partir d’une spécification détaillée uniquement ; les résultats de K3, Qwen 3.8 et Fable étaient presque identiques lors des tests utilisateurs, tous étaient corrects lors de la revue de code par Sol, avec un léger avantage pour Fable.
En pratique, je préfère toujours Opus 4.8 et Sol, mais si l’on a besoin d’alternatives, K3 et Qwen 3.8 sont tout à fait utilisables.
On évalue surtout les capacités de codage dans des environnements multi-agents ouverts, sans jeu de réponses correctes, où les agents s’influencent mutuellement ; les modèles chinois ont tendance à obtenir des résultats plus faibles face aux modèles américains que ne le laissent entendre leurs model cards.
Kimi K3 fait exception et est réellement proche du niveau de pointe, mais il est très lent. Muse Spark 1.1 est le plus performant après Fable et Sol, tout en étant le plus rentable, ce qui marque un net retournement depuis Llama 4. Les données sont sur https://gertlabs.com/rankings.
La qualité du code est équivalente à ce que j’écrirais, et meilleure dans les domaines que je connais moins. Il accomplit aussi régulièrement des tâches que les humains repoussent ou trouvent ennuyeuses, comme le refactoring, les tests d’intégration et de régression, ou la vérification des journaux d’audit et des alertes d’erreur, ce qui améliore le niveau global de l’ingénierie logicielle.
Il s’agit d’un service de production Ruby on Rails relativement complexe utilisant PostgreSQL ; avec l’abonnement Max à 200 dollars par mois, le budget de tokens n’a pas été un problème et le coût en valait largement la peine.
Il est intéressant qu’environ 1 000 tâches aient été réparties entre cinq domaines, dont l’ingénierie logicielle et le droit, pour tester Kimi K3 et Fable.
Ils placent en amont un modèle routeur qui prédit quel modèle sera le moins cher pour obtenir la bonne réponse, et, à terme, il faudrait selon moi le faire apprendre en continu à partir de la charge de travail propre à chacun.
Le routeur a choisi Kimi pour 72 à 96 % des tâches selon les domaines, avec des économies de coûts allant de 1,5 à 50 fois selon le domaine.
Ce n’est qu’une hypothèse de Fireworks : on peut réduire les coûts s’il existe un routeur capable de prédire à l’avance le même résultat ; l’existence même de ce routeur est donc une hypothèse majeure.
Si un modèle converse comme un humain, je peux accepter une baisse de 5 % du score aux benchmarks.
LOLà une blague, ce n’est pas seulement ridicule, c’est même nuisible.Par exemple, pour guider la lecture d’un long article, il a tout condensé en une ligne remplie de fragments impératifs du type « parcourez-le une fois maintenant, puis relisez-le en lisant la partie II », de mots-clés en gras et de flèches.
Anthropic donne l’impression de rejouer l’Empire romain en accéléré : l’entreprise semble déjà avoir dépassé son apogée et entrer en phase de déclin avant même son IPO.
Je me demande comment la gouvernance des données et la protection de la vie privée s’appliquent lorsqu’on s’abonne au forfait de codage Kimi K3. J’aimerais quitter Anthropic
Contrairement à Claude, il n’existe pas de droit de refus explicite pour l’entraînement du modèle, et les conditions permettent à Kimi d’utiliser le code des clients pour l’entraînement
Si vous ne voulez pas traiter directement avec des entreprises chinoises, AtlasCode à 20 dollars par mois, OpenCode Go à 10 dollars par mois et Cline Pass à 10 dollars par mois offrent 2 à 6 fois plus d’usage sur certains modèles populaires à poids ouverts
Personnellement, je suis abonné à Z.ai pour 17 dollars par mois et je paie les frais API de MiMo v2.5, Hy3, Qwen 3.7 Plus et DeepSeek v4 auprès de leurs fournisseurs d’origine respectifs
Je me demande si l’on peut être payé pour écrire ce genre de texte afin de promouvoir des modèles ouverts, et si oui, dans quel but
Après avoir travaillé sur FastAPI·Python et Spring Boot·Java dans des produits SaaS modernes, le seul modèle ouvert à la fois compétent et efficace était Qwen 3.7 Max
GLM 5.2 et Kimi passent souvent près de 70 000 à 80 000 tokens à fouiller la base de code avant d’écrire du code, pour finir malgré tout par le casser. Ils fonctionnent bien si on leur donne des spécifications très détaillées, comme il y a un an, mais Qwen 3.7 termine le travail sans effort particulier
Je me demande ce que Kimi a de particulièrement meilleur ici. À ma connaissance, son prix est proche de Sonnet 5 ; je me demande donc ce que ça donne en utilisant Sonnet 5 et Fable, ou le moins cher Grok 4.5
J’aime beaucoup les modèles chinois et j’utilise uniquement DeepSeek ; maintenant, j’utilise aussi Kimi K3 comme excellent assistant de planification pour les tâches de codage avancées
DeepSeek v4 Flash est très rapide et traite presque tout ce que je lui confie en Rust, PostgreSQL, Angular et Terraform
J’auto-héberge Bifrost comme passerelle LLM, mais j’aimerais que les fournisseurs facturent automatiquement l’usage réel mensuel ou quotidien, comme pour un VPS, au lieu d’imposer du prépaiement et des recharges automatiques. Je préférerais payer uniquement l’usage exact plutôt que de maintenir un solde minimum non remboursable chez plusieurs fournisseurs
OpenRouter aide, mais je n’aime ni le service lui-même ni les frais supplémentaires
Kimi k2.5/6 est plus lent et ses performances se sont dégradées, avec davantage d’erreurs
engine overloaded, tandis que k3 réfléchit longtemps sans produire de résultats nettement meilleurs. Je pense qu’ils ont peut-être temporairement quantifié le modèle sous la pression des ressources de calculRécemment, j’utilise surtout DeepSeek v4 Pro et GPT 5.5 quand j’ai besoin d’un modèle puissant. GLM 5.2 est bon pour certaines tâches mais très mauvais pour d’autres, et les modèles de Google ou Anthropic ne m’ont pas encore impressionné
OpenRouter propose presque tous les modèles dès le jour de leur sortie, mais l’intérêt de Bifrost est que si je quitte OpenRouter plus tard, je n’aurai pas à toucher au reste de ma stack. Si l’auto-hébergement devient réaliste, cela réduit ma dépendance à OpenAI, Anthropic et OpenRouter, ainsi que le risque qu’un modèle dont je dépends soit soudainement abandonné
On est dans une situation où une entreprise qui héberge des modèles ouverts dit que les modèles ouverts sont excellents
Comme expliqué dans l’article, je cherche un outil de routage utilisable avec Claude Code, ou une autre bonne plateforme de routage. Je sais que le routeur de cet article repose sur une approche par oracle.
Pour chaque rôle, il existe un classement recommandé de LLM provenant de plusieurs fournisseurs ; par exemple,
Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5)est utilisé comme orchestrateur principal.