1 points par GN⁺ 4 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Sur environ 1 030 tâches d’agent, la comparaison entre Kimi K3 et Fable 5 montre qu’un routage par tâche atteint une qualité supérieure à celle de chaque modèle pris séparément, avec 93 % de précision
  • Les performances globales étaient similaires sur les tâches SWE, terminal, algorithmes, multilingues et juridiques, mais les domaines où chaque modèle excelle différaient
  • Le routage oracle a attribué 72 à 96 % des tâches à K3, et K3 était plus rentable que Fable sur les 5 groupes de tâches
  • Dans les longues boucles d’agent, K3 a montré jusqu’à environ 50 fois plus d’efficacité coût/performance que l’utilisation de Fable seul, mais un plus grand nombre d’étapes d’exécution peut allonger le temps de traitement
  • Un routeur adapté à la charge de travail, prenant un modèle open source bon marché comme base et envoyant les tâches difficiles vers d’autres modèles, peut améliorer à la fois la qualité et le coût

Mesuré sur de vraies tâches d’agent

  • Kimi K3 et Fable 5 ont été exécutés dans le même harnais pour effectuer environ 1 030 tâches sous forme de véritables boucles d’agent
    • SWE : 460 tâches similaires à des corrections de bugs sur de vrais dépôts
    • Terminal : 89 tâches d’agent de longue durée liées à la sécurité, à la cryptographie, au reverse engineering et à l’administration système
    • Algorithmes : 100 problèmes de type LeetCode et AtCoder
    • Multilingue : 225 tâches d’implémentation dans 6 langages
    • Juridique : 120 tâches d’agent juridique évaluées par des avocats
  • Les deux modèles ont été comparés en moyennant les résultats de benchmark sur plusieurs types de tâches

Sens et limites du routage oracle

  • Le routage oracle est une méthode de mesure théorique qui exécute chaque tâche sur tous les modèles, puis choisit le modèle le moins cher parmi ceux qui ont donné la bonne réponse
  • En pratique, un routeur ne peut pas exécuter à l’avance la tâche sur plusieurs modèles ; il doit donc prédire en amont quel modèle offrira le meilleur équilibre entre coût et qualité
  • Dans cette approche, K3 est sélectionné pour 72 à 96 % de l’ensemble des tâches
  • Il pourrait être possible de concevoir un routeur qui distingue les tâches courantes des tâches de longue traîne nécessitant un modèle de tout premier niveau
    • Pour le confirmer, il faut non pas quelques données supplémentaires, mais un volume de données de routage 10 fois supérieur ainsi qu’une validation des performances en conditions réelles

Performances globales similaires, mais points forts différents

  • Sur le résultat SWE représentatif, K3 obtenait 92,4 % et Fable 92,6 %, soit des scores presque identiques
  • Sur les 5 types de tâches, l’écart entre les deux modèles restait généralement de quelques points de pourcentage au plus, Fable gardant un léger avantage sur la programmation multilingue
  • Malgré des scores globaux proches, chaque modèle montrait des zones de nette supériorité sur les tâches détaillées

Différences selon les domaines de tâches

  • En découpant SWE par domaine de problème, K3 dominait en mathématiques symboliques et outils de développement, tandis que Fable était meilleur sur les tâches web et de visualisation de données
  • Sur les tâches multilingues, Fable devançait K3 en Java, Python et C++, tandis que K3 faisait jeu égal en JavaScript et Rust
  • Sur les longues tâches terminal impliquant des dizaines de manipulations shell, K3 se montrait plus solide
    • Il a résolu des cas que Fable n’a pas pu traiter : hash 7z, cryptanalyse de FEAL, informations secrètes divulguées, vraies vulnérabilités et tâches asynchrones incontrôlables
  • En comparant à la fois précision et coût, Fable était devant en multilingue, K3 en terminal et en juridique, et le reste était globalement similaire

La structure qui crée l’écart de coût

  • L’avantage de coût de K3 vient du prix des tokens, du prompt caching et du volume injecté par tâche
  • Par tâche SWE, K3 utilisait environ 55 tours et 1,3 million de tokens, contre environ 21 tours et 130 000 tokens pour Fable
  • Sur les longues tâches terminal, à l’inverse, Fable montait jusqu’à environ 64 tours et 1,5 million de tokens, atteignant parfois le timeout
  • Même en lisant 10 fois plus de tokens que Fable sur SWE, K3 restait moins cher à l’exécution grâce aux hits du prompt cache
  • Quand le nombre d’étapes d’exécution augmente, le temps de traitement réel peut s’allonger
    • Pour les tâches qui doivent répondre en moins de 2 secondes, la latence est critique
    • Pour les agents de fond à grande échelle, c’est une facture d’exécution plus basse qui compte davantage

Résultat de la combinaison des deux modèles

  • En envoyant chaque tâche vers le modèle le plus adapté, on n’obtient pas un niveau intermédiaire entre les deux, mais de meilleures performances que chaque modèle pris seul
  • Le routage oracle par tâche a toujours donné de meilleurs résultats qu’une exécution sur un seul modèle, et la précision globale a atteint 93 %
  • Même en envoyant 72 à 96 % du trafic vers K3, le modèle optimisé pour le coût, la qualité globale restait supérieure à celle de chaque modèle, tandis que le coût se rapprochait de celui de K3 seul
  • K3 était plus rentable que Fable sur les 5 groupes de tâches, et dans les longues boucles d’agent il a atteint jusqu’à environ 50 fois plus d’efficacité coût/performance

Routage par charge de travail plutôt que modèle unique

  • Router ensemble Kimi K3 et Fable permet de tirer parti de leurs forces différentes tout en réduisant les coûts
  • Comme chaque modèle a son propre prix et ses domaines d’expertise, l’IA de meilleure qualité peut émerger d’une combinaison de plusieurs modèles plutôt que d’un fournisseur unique
  • Un modèle open source comme K3, auquel l’oracle attribue la majorité du trafic et dont le coût peut être jusqu’à 50 fois inférieur, peut servir d’option par défaut
  • Le routeur doit être adapté à la charge de travail réelle et continuer à apprendre la relation entre types de tâches et adéquation des modèles

1 commentaires

 
GN⁺ 4 시간 전
Avis de Hacker News
  • En les exécutant et en les testant soi-même, on voit que tous ces modèles sont surajustés aux benchmarks. Même s’ils se rapprochent des modèles de pointe sur certaines métriques, ils s’effondrent sur des tâches réelles et leur efficacité en tokens est absurdement faible.
    Contrairement aux modèles fermés, Fireworks tire un gros bénéfice de l’hébergement de K3, donc l’incitation à mettre en avant ce genre de titre est très forte.

    • Après avoir testé pendant quelques jours K3, Qwen 3.8 Max Preview, Fable et Sol, je suis en partie d’accord pour dire qu’il est difficile de faire confiance aux benchmarks, et que les modèles chinois sont lents et peu efficaces en tokens.
      Cela dit, ils sont à peu près au niveau des meilleurs modèles de la génération précédente, Opus 4.8 et GPT 5.5, et on peut aussi les comparer sur https://senko.net/vibecode-bench/.
      En utilisant les API officielles et leurs outils de codage respectifs, je leur ai demandé de créer une application web simple mais non triviale à partir d’une spécification détaillée uniquement ; les résultats de K3, Qwen 3.8 et Fable étaient presque identiques lors des tests utilisateurs, tous étaient corrects lors de la revue de code par Sol, avec un léger avantage pour Fable.
      En pratique, je préfère toujours Opus 4.8 et Sol, mais si l’on a besoin d’alternatives, K3 et Qwen 3.8 sont tout à fait utilisables.
    • Tous sont surajustés aux benchmarks, mais l’essentiel est de savoir dans quelle mesure ils le sont les uns par rapport aux autres.
      On évalue surtout les capacités de codage dans des environnements multi-agents ouverts, sans jeu de réponses correctes, où les agents s’influencent mutuellement ; les modèles chinois ont tendance à obtenir des résultats plus faibles face aux modèles américains que ne le laissent entendre leurs model cards.
      Kimi K3 fait exception et est réellement proche du niveau de pointe, mais il est très lent. Muse Spark 1.1 est le plus performant après Fable et Sol, tout en étant le plus rentable, ce qui marque un net retournement depuis Llama 4. Les données sont sur https://gertlabs.com/rankings.
    • Fable fonctionne très bien même sur des bases de code assez importantes. J’ai dû corriger ou réorienter les choses quelques fois, mais c’était surtout parce que les exigences du prompt étaient insuffisantes ; il ne s’est réellement trompé qu’environ deux fois, soit un taux d’erreur inférieur à celui de ma propre carrière professionnelle.
      La qualité du code est équivalente à ce que j’écrirais, et meilleure dans les domaines que je connais moins. Il accomplit aussi régulièrement des tâches que les humains repoussent ou trouvent ennuyeuses, comme le refactoring, les tests d’intégration et de régression, ou la vérification des journaux d’audit et des alertes d’erreur, ce qui améliore le niveau global de l’ingénierie logicielle.
      Il s’agit d’un service de production Ruby on Rails relativement complexe utilisant PostgreSQL ; avec l’abonnement Max à 200 dollars par mois, le budget de tokens n’a pas été un problème et le coût en valait largement la peine.
    • Je n’ai pas lu l’article, mais le titre était déjà suspect, venant d’un fournisseur de services d’inférence mettant en avant un modèle de niveau Mythos qu’il propose lui-même. GLM 5.2, qui a moins d’un tiers des paramètres de Kimi K3, reste encore le modèle principal.
    • Toutes ces évaluations doivent être assorties de la réserve pour l’instant. Vu la tendance, même si le niveau n’est pas encore assez bon pour le codage, il est évident qu’il y parviendra bientôt, et il faut se préparer à un monde où les modèles publics accompliront presque toutes les tâches logicielles.
  • Il est intéressant qu’environ 1 000 tâches aient été réparties entre cinq domaines, dont l’ingénierie logicielle et le droit, pour tester Kimi K3 et Fable.
    Ils placent en amont un modèle routeur qui prédit quel modèle sera le moins cher pour obtenir la bonne réponse, et, à terme, il faudrait selon moi le faire apprendre en continu à partir de la charge de travail propre à chacun.
    Le routeur a choisi Kimi pour 72 à 96 % des tâches selon les domaines, avec des économies de coûts allant de 1,5 à 50 fois selon le domaine.

    • Ici, le routeur est un point de référence oracle qui exécute les deux modèles, vérifie s’ils réussissent, puis choisit le moins cher.
      Ce n’est qu’une hypothèse de Fireworks : on peut réduire les coûts s’il existe un routeur capable de prédire à l’avance le même résultat ; l’existence même de ce routeur est donc une hypothèse majeure.
    • Il existe plusieurs routeurs similaires, par exemple https://openrouter.ai/openrouter/auto.
  • Si un modèle converse comme un humain, je peux accepter une baisse de 5 % du score aux benchmarks.

    • Au contraire, je préfère les modèles qui n’essaient pas de parler comme des humains.
    • Pas besoin de renoncer à 5 % : il suffit de passer la sortie de Fable dans Gemini Flash pour la faire réécrire dans un style plus lisible.
    • Je préfère fortement que le modèle n’imite pas mon ton humain. Quand Claude se comporte comme un ami et répond LOL à une blague, ce n’est pas seulement ridicule, c’est même nuisible.
    • Par défaut, Opus produit un style que j’appelle le claudien. Ce sont des phrases trop simplifiées et grammaticalement incomplètes, pénibles à lire ; elles sont peut-être faciles à lire et à écrire pour le modèle, mais pas pour les humains.
      Par exemple, pour guider la lecture d’un long article, il a tout condensé en une ligne remplie de fragments impératifs du type « parcourez-le une fois maintenant, puis relisez-le en lisant la partie II », de mots-clés en gras et de flèches.
    • Un LLM n’est pas humain, alors pourquoi devrait-il forcément parler comme une personne ?
  • Anthropic donne l’impression de rejouer l’Empire romain en accéléré : l’entreprise semble déjà avoir dépassé son apogée et entrer en phase de déclin avant même son IPO.

  • Je me demande comment la gouvernance des données et la protection de la vie privée s’appliquent lorsqu’on s’abonne au forfait de codage Kimi K3. J’aimerais quitter Anthropic

    • D’après https://platform.kimi.ai/docs/agreement/modeluse, le contenu peut être utilisé pour fournir, maintenir, développer et améliorer les services, entre autres ; les clients qui ont besoin de restrictions sur l’entraînement doivent discuter d’un contrat d’entreprise séparé ou d’un accord écrit
      Contrairement à Claude, il n’existe pas de droit de refus explicite pour l’entraînement du modèle, et les conditions permettent à Kimi d’utiliser le code des clients pour l’entraînement
    • Il faudra attendre qu’un fournisseur occidental commence à l’héberger
    • La solution la plus simple consiste à s’inscrire sur OpenRouter et à exclure tous les fournisseurs qui ne sont pas en ZDR (zero data retention). Cela dit, les tarifs API peuvent être plus élevés que le forfait de codage, et les 1,7 milliard de tokens fournis par le forfait à 20 dollars par mois de MiniMax valent, selon les ratios entrée/sortie/cache, plus de 200 à 500 dollars en équivalent API
      Si vous ne voulez pas traiter directement avec des entreprises chinoises, AtlasCode à 20 dollars par mois, OpenCode Go à 10 dollars par mois et Cline Pass à 10 dollars par mois offrent 2 à 6 fois plus d’usage sur certains modèles populaires à poids ouverts
      Personnellement, je suis abonné à Z.ai pour 17 dollars par mois et je paie les frais API de MiMo v2.5, Hy3, Qwen 3.7 Plus et DeepSeek v4 auprès de leurs fournisseurs d’origine respectifs
    • La politique de confidentialité est disponible sur https://www.kimi.com/user/agreement/zh/userPrivacy
  • Je me demande si l’on peut être payé pour écrire ce genre de texte afin de promouvoir des modèles ouverts, et si oui, dans quel but
    Après avoir travaillé sur FastAPI·Python et Spring Boot·Java dans des produits SaaS modernes, le seul modèle ouvert à la fois compétent et efficace était Qwen 3.7 Max
    GLM 5.2 et Kimi passent souvent près de 70 000 à 80 000 tokens à fouiller la base de code avant d’écrire du code, pour finir malgré tout par le casser. Ils fonctionnent bien si on leur donne des spécifications très détaillées, comme il y a un an, mais Qwen 3.7 termine le travail sans effort particulier

    • C’est du bon content marketing. Fireworks est un gros fournisseur d’inférence de modèles qui vend l’accès à Kimi K3
    • Fireworks est spécialisé dans l’exécution rapide de modèles ouverts et tire l’essentiel de ses revenus des modèles chinois ; l’incitation économique est donc tout simplement l’ensemble de son modèle économique
    • Il y a beaucoup d’argent dans le business de l’influence tech, mais la plupart vient de grands acteurs, comme l’acquisition de tbpn par OpenAI ou les accès anticipés accordés à certains influenceurs
    • Lin Qiao est cofondatrice et CEO de Fireworks AI. Les LLM sont l’équivalent de la course à l’espace dans la guerre froide sino-américaine, donc l’incitation à prouver une supériorité nationale et civilisationnelle peut être plus forte que l’argent
  • Je me demande ce que Kimi a de particulièrement meilleur ici. À ma connaissance, son prix est proche de Sonnet 5 ; je me demande donc ce que ça donne en utilisant Sonnet 5 et Fable, ou le moins cher Grok 4.5

    • L’article dit que Kimi est meilleur que Fable sur certaines tâches, mais cela ne s’applique probablement pas à Sonnet
    • Les modèles ouverts ont l’avantage de pouvoir être exécutés localement et fine-tunés par les grandes entreprises dans leurs propres datacenters
  • J’aime beaucoup les modèles chinois et j’utilise uniquement DeepSeek ; maintenant, j’utilise aussi Kimi K3 comme excellent assistant de planification pour les tâches de codage avancées
    DeepSeek v4 Flash est très rapide et traite presque tout ce que je lui confie en Rust, PostgreSQL, Angular et Terraform
    J’auto-héberge Bifrost comme passerelle LLM, mais j’aimerais que les fournisseurs facturent automatiquement l’usage réel mensuel ou quotidien, comme pour un VPS, au lieu d’imposer du prépaiement et des recharges automatiques. Je préférerais payer uniquement l’usage exact plutôt que de maintenir un solde minimum non remboursable chez plusieurs fournisseurs
    OpenRouter aide, mais je n’aime ni le service lui-même ni les frais supplémentaires

    • Ces temps-ci, j’utilise surtout DeepSeek v4 Pro ; comme je fais beaucoup de tâches en parallèle, la vitesse m’importe moins. En cas d’échec, je passe à GPT 5.5 au milieu de la conversation pour lui faire trouver le problème, puis je rebascule vers DeepSeek en conservant cette analyse dans le contexte
      Kimi k2.5/6 est plus lent et ses performances se sont dégradées, avec davantage d’erreurs engine overloaded, tandis que k3 réfléchit longtemps sans produire de résultats nettement meilleurs. Je pense qu’ils ont peut-être temporairement quantifié le modèle sous la pression des ressources de calcul
      Récemment, j’utilise surtout DeepSeek v4 Pro et GPT 5.5 quand j’ai besoin d’un modèle puissant. GLM 5.2 est bon pour certaines tâches mais très mauvais pour d’autres, et les modèles de Google ou Anthropic ne m’ont pas encore impressionné
    • Avec des outils comme reasonix ou whale, on peut atteindre environ 98 % de cache hits, ce qui rend le coût des requêtes pratiquement gratuit. C’est possible même chez des fournisseurs américains non subventionnés comme Cloudflare ou DigitalOcean
    • Le prépaiement empêche les utilisateurs de consommer massivement des ressources d’inférence, puis d’annuler leur carte et de disparaître. Un VPS est un investissement de plus long terme, donc il est plus difficile de changer, et même si certains utilisateurs ne paient pas un mois, le coût pour le fournisseur est relativement faible
    • J’envisage Bifrost et je me demande pourquoi tu as choisi une passerelle LLM
      OpenRouter propose presque tous les modèles dès le jour de leur sortie, mais l’intérêt de Bifrost est que si je quitte OpenRouter plus tard, je n’aurai pas à toucher au reste de ma stack. Si l’auto-hébergement devient réaliste, cela réduit ma dépendance à OpenAI, Anthropic et OpenRouter, ainsi que le risque qu’un modèle dont je dépends soit soudainement abandonné
    • En dehors des frais supplémentaires, qu’est-ce qui te déplaît dans le service OpenRouter ?
  • On est dans une situation où une entreprise qui héberge des modèles ouverts dit que les modèles ouverts sont excellents

    • Ils ont publié leur méthodologie et leurs résultats, et j’ai appris des forces et faiblesses relatives de Kimi et Fable que je n’avais pas vues ailleurs. Le fait d’exploiter une activité d’hébergement de modèles ne leur retire pas le droit de partager des résultats
    • Fireworks n’héberge pas uniquement des modèles à poids ouverts, et le fait qu’une grosse annonce puisse attirer de nouveaux clients ne rend pas son contenu faux
    • Quiconque les a essayés directement sait que leur évaluation est correcte
  • Comme expliqué dans l’article, je cherche un outil de routage utilisable avec Claude Code, ou une autre bonne plateforme de routage. Je sais que le routeur de cet article repose sur une approche par oracle.

    • https://github.com/code-yeongyu/oh-my-openagent implémente le modèle d’oracle du texte original avec 11 rôles.
      Pour chaque rôle, il existe un classement recommandé de LLM provenant de plusieurs fournisseurs ; par exemple, Sisyphus (claude-opus-4-8 / kimi-k3 / glm-5) est utilisé comme orchestrateur principal.