1 points par GN⁺ 2 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Parmi les 170 modèles évalués, Claude Opus 5 Adaptive Reasoning·Max Effort arrive en tête avec un Intelligence Index de 61 points, suivi par Xhigh Effort et Claude Fable 5, chacun à 60 points
  • Intelligence Index v4.1 combine 9 évaluations portant sur les tâches agentiques, le code, le raisonnement scientifique, la fiabilité des connaissances et le raisonnement en contexte long, et intègre aussi le temps de réflexion étendu des modèles de raisonnement dans la mesure des performances
  • Côté vitesse de sortie, Mercury 2 est le plus rapide avec 901,6 tokens/s ; la latence du premier token est la plus faible pour Gemini 2.5 Flash-Lite, à 0,34 s ; Llama 4 Scout offre une fenêtre de contexte maximale de 10M tokens
  • Les prix sont comparés non seulement selon le coût unitaire des tokens, mais aussi selon le coût par tâche, pondérant tokens d’entrée, cache hit, écriture en cache, raisonnement et tokens de réponse ; les coûts d’écriture et de stockage en cache varient selon les fournisseurs
  • Parmi les modèles à poids ouverts, GLM-5.2 (max) obtient le meilleur score avec 51 points, soit 10 points de moins que le premier au classement général ; le choix d’un modèle doit donc prendre en compte le coût, la vitesse, la latence et la fenêtre de contexte, en plus de l’intelligence

Classement d’intelligence de Claude Opus 5

  • Claude Opus 5 (Adaptive Reasoning, Max Effort) est premier parmi les 170 modèles évalués, avec un Intelligence Index de 61 points
  • Les 5 meilleurs modèles sont les suivants
    • Claude Opus 5 (Adaptive Reasoning, Max Effort) : 61 points
    • Claude Opus 5 (Adaptive Reasoning, Xhigh Effort) : 60 points
    • Claude Fable 5 (Adaptive Reasoning, Max Effort, Opus 4.8 Fallback) : 60 points
    • GPT-5.6 Sol (max) : 59 points
    • Claude Opus 5 (Adaptive Reasoning, High Effort) : 59 points
  • La configuration Max Effort est aussi première parmi les 126 modèles de raisonnement ; les modèles de raisonnement effectuent une réflexion étendue pour traiter des problèmes complexes avant de répondre

Composition de l’évaluation Intelligence Index v4.1

  • Intelligence Index v4.1 combine les 9 évaluations suivantes
    • GDPval-AA v2 : travail réel basé sur des agents
    • 𝜏³-Banking : utilisation d’outils par des agents
    • Terminal-Bench v2.1 : code agentique et utilisation du terminal
    • SciCode : code
    • Humanity's Last Exam : raisonnement et connaissances
    • GPQA Diamond : raisonnement scientifique
    • CritPt : raisonnement en physique
    • AA-Omniscience : exactitude des connaissances et taux de non-hallucination
    • AA-LCR : raisonnement en contexte long
  • Selon l’usage, les résultats d’évaluations spécifiques peuvent être plus importants que le score global d’intelligence
  • Les benchmarks suivants sont aussi inclus comme éléments d’évaluation distincts
    • AA-Briefcase : travail de connaissance agentique
    • AutomationBench-AA : workflows SaaS agentiques
    • Harvey LAB-AA : tâches agentiques juridiques
    • EnterpriseOps-Gym-AA : opérations métier agentiques
    • IFBench : respect des consignes
    • APEX-Agents-AA : tâches agentiques longues
    • ITBench-AA : analyse de cause racine d’incidents Kubernetes
    • MMMU-Pro : raisonnement visuel

Indicateurs de travail de connaissance, de fiabilité et d’ouverture

  • AA-Briefcase Elo combine l’Elo de qualité d’analyse, l’Elo de présentation et le taux de réussite aux critères d’évaluation
    • Le taux de réussite est converti en Elo via des duels synthétiques en un contre un
    • L’Elo et les bornes de l’intervalle de confiance à 95 % sont limités afin de ne pas descendre sous 0
  • AA-Omniscience Index mesure la fiabilité des connaissances et les hallucinations sur une échelle de -100 à 100 points
    • Les réponses correctes sont récompensées et les hallucinations pénalisées, mais les refus de répondre ne sont pas pénalisés
    • Un score de 0 signifie qu’il y a autant de bonnes que de mauvaises réponses ; un score négatif signifie que les mauvaises réponses sont plus nombreuses que les bonnes
  • L’Openness Index évalue l’ouverture d’un modèle avec un score normalisé de 0 à 100 ; plus il est élevé, plus le modèle est ouvert
  • Il distingue si les poids sont publics ; les modèles dont les poids sont publics mais qui nécessitent par exemple une licence payante pour un usage commercial sont indiqués comme Commercial Use Restricted

Classement des modèles à poids ouverts

  • Sur les 170 modèles évalués, 94 sont des modèles à poids ouverts
  • Les meilleurs modèles à poids ouverts dans l’Intelligence Index sont les suivants
    • GLM-5.2 (max) : 51 points
    • MiniMax-M3 : 44 points
    • DeepSeek V4 Pro (Reasoning, Max Effort) : 44 points
  • GLM-5.2 (max) enregistre le meilleur score parmi les modèles à poids ouverts

Vitesse de sortie et temps de traitement des tâches

  • Mercury 2 affiche la vitesse de sortie la plus élevée, à 901,6 tokens/s
    • Gemini 3.5 Flash-Lite : 435,1 tokens/s
    • HyperNova 60B 2605 : 427,6 tokens/s
    • Granite 4.0 H Small figure aussi parmi les mieux classés
  • La vitesse de sortie correspond, pour les modèles en streaming, au nombre de tokens par seconde reçus pendant que le modèle génère des tokens, après réception du premier chunk
  • Le temps par tâche de l’Intelligence Index est calculé en divisant le nombre de tokens de sortie par tâche par la vitesse de sortie, puis en appliquant la pondération relative de chaque benchmark
    • Le temps d’arrivée du premier token (TTFT) et les autres surcoûts sont exclus
  • Lorsqu’un modèle dispose de sa propre API, les performances de cette API sont utilisées ; lorsqu’il n’en a pas, comme Meta Llama, la médiane de plusieurs fournisseurs est utilisée

Latence et temps de réponse de bout en bout

  • Le modèle dont le temps d’arrivée du premier token de réponse est le plus court est Gemini 2.5 Flash-Lite (Non-reasoning), avec 0,34 s
    • Command A+ : 0,42 s
    • North Mini Code : 0,49 s
    • Gemini 2.5 Flash fait aussi partie des modèles à faible latence
  • La latence du premier token correspond au temps écoulé entre la requête API et la réception du premier token de réponse
    • Pour les modèles de raisonnement, elle inclut aussi le temps de réflexion avant la réponse
    • Pour les modèles qui ne prennent pas en charge le streaming, le temps nécessaire à recevoir la réponse complète est appliqué
  • Le temps de réponse de bout en bout pour 500 tokens additionne les éléments suivants
    • le temps d’entrée jusqu’à la réception du premier token de réponse
    • le temps de réflexion utilisé par les modèles de raisonnement avant la réponse
    • le temps nécessaire à générer 500 tokens de réponse selon la vitesse de sortie
  • Le nombre de tokens de réflexion utilise la moyenne mesurée sur 60 prompts différents

Prix et coût par tâche

  • La comparaison des prix utilise le prix en dollars par million de tokens pour les cache hits, les tokens d’entrée et les tokens de sortie
  • Dans la liste, Devstral 2 et North Mini Code sont affichés à 0,00 $ par million de tokens, suivis de Gemma 3 4B et Gemma 3 27B
  • Les modèles les moins chers selon le prix mixte sont les suivants
    • Nova Micro : 0,03 $/1M tokens
    • Sarvam 30B (high) : 0,03 $/1M tokens
    • Gemma 4 E4B (Non-reasoning) : 0,03 $/1M tokens
  • Le coût par tâche de l’Intelligence Index est calculé en divisant les prix des tokens d’entrée, cache hit, écriture en cache, raisonnement et réponse de chaque évaluation par le nombre de tâches, puis en appliquant la pondération des évaluations dans l’Index
  • Le coût d’exécution de l’Index complet est calculé à partir de l’usage de tokens par évaluation, hors exécutions répétées, et du prix de chaque type de token
  • Le prix mixte du cache affiché n’utilise que le coût des cache hits ; les autres coûts de cache varient selon les fournisseurs
    • Anthropic facture séparément l’écriture en cache ; les tarifs diffèrent pour les TTL de 5 minutes et d’1 heure, ce dernier étant plus cher
    • Google Vertex/Gemini facture des coûts de stockage horaires en plus du prix des cache hits
    • Certains fournisseurs appliquent une tarification par paliers aux prompts dépassant 200K tokens
    • OpenAI, DeepSeek et d’autres facturent généralement uniquement le prix des cache hits, sans coûts d’écriture ni de stockage

Usage de tokens et fenêtre de contexte

  • Le nombre de tokens de sortie par tâche est calculé en multipliant les tokens de sortie de chaque évaluation par leur pondération relative dans l’Intelligence Index, puis en divisant par le nombre de tâches, hors répétitions
  • Les modèles avec les plus grandes fenêtres de contexte sont les suivants
    • Llama 4 Scout : 10M tokens
    • Grok 4.20 0309 : 2M tokens
    • Gemini 1.5 Pro (May)
    • Grok 4.1 Fast
  • La fenêtre de contexte est la limite maximale combinant tokens d’entrée et de sortie ; la limite de tokens de sortie est généralement bien plus faible et varie selon les modèles
  • Les grandes fenêtres de contexte sont liées aux workflows RAG qui recherchent des informations dans de grands volumes de données et raisonnent dessus

Taille des modèles à poids ouverts

  • La taille d’un modèle distingue les paramètres totaux, qui regroupent les poids et biais entraînables, et les paramètres actifs réellement exécutés pendant l’inférence
  • Dans les modèles Mixture of Experts, le mécanisme de routage ne sélectionne qu’une partie des experts pour chaque token, si bien que les paramètres actifs sont moins nombreux que le total
  • Les modèles denses utilisent tous leurs paramètres ; les paramètres actifs et les paramètres totaux sont donc identiques

Périmètre de comparaison et usages

  • Les modèles sont comparés selon plusieurs dimensions : intelligence, prix, vitesse de sortie, latence du premier token, temps de réponse de bout en bout, taille de la fenêtre de contexte, etc.
  • Les indicateurs de performance sont mesurés directement avec des prompts standardisés sur 586 modèles
  • La page détaillée de chaque modèle permet de consulter les indicateurs détaillés et de comparer directement des modèles similaires ; le sélecteur de modèles permet d’ajuster les modèles affichés dans les graphiques

1 commentaires

 
GN⁺ 2 시간 전
Commentaires sur Hacker News
  • Ce classement est devenu en pratique dénué de sens pour décider quel modèle utiliser et quand
    Chaque modèle a des forces et des faiblesses selon les domaines et les tâches, donc un classement à indicateur unique ne sert à rien, il n’existe plus un seul « meilleur modèle », et selon la complexité de la tâche, on n’a même pas forcément besoin du meilleur modèle
    Par exemple, on peut utiliser Fable pour le design d’UI, Sol pour l’architecture de systèmes backend, et Kimi K3 pour le développement d’exploits ; au final, ce genre d’indicateur ressemble surtout à un chiffre de démonstration pour les sociétés de modèles

    • Il y a un an, un nouveau « meilleur modèle » est sorti ; plein d’espoir, je lui ai confié une petite tâche de programmation consistant à modifier légèrement trois fichiers, et il l’a bien faite
      Mais un modèle plus ancien et plus petit de la même famille l’a tout aussi bien fait, trois fois plus vite et pour un neuvième du coût, et c’est là que j’ai eu une révélation
    • Ce serait bien d’avoir des benchmarks par stack technique
      Même si c’est un peu subjectif, comme savoir quel modèle traitera le mieux un projet Elixir/Phoenix de manière la plus idiomatique en 2026, cela pourrait être utile quand il est difficile de continuer à comparer tous les modèles soi-même et que les écarts de performances sont importants
    • Dire que c’est « complètement dénué de sens » ou que c’est son « unique objectif » est exagéré
      Toutes les statistiques comportent des biais, mais c’est toujours mieux que de ne rien savoir, et le fait qu’un benchmark montre la moyenne de plusieurs tâches correspond justement à la vocation des statistiques, qui est de résumer
    • En ouvrant le lien, on voit qu’il n’y a pas seulement un indicateur unique, mais bien tous les indicateurs nécessaires pour se faire un jugement
    • Les graphiques d’Artificial Analysis sur le coût par tâche ou la fréquence des hallucinations ont de la valeur
      En revanche, si on fusionne tout cela en un seul résultat, toutes les nuances disparaissent et il ne reste qu’un classement bon pour frimer
  • Si j’étais dirigeant chez Google, j’aurais peut-être à dormir au bureau non seulement parce qu’il y a trop de travail, mais aussi parce qu’il serait gênant de se montrer devant les gens

    • Comme c’est la seule entreprise qui ne perd pas d’argent tout en brûlant des subventions, ils peuvent au contraire dormir tranquilles
    • Google semble accorder plus d’importance à la vitesse à laquelle il peut monétiser ses produits qu’au fait d’avoir l’IA la plus intelligente
      Depuis longtemps, l’entreprise dit que sa priorité absolue est de fournir le plus rapidement possible des réponses exactes aux questions
    • On peut aussi se demander si Google cherche vraiment à rivaliser avec OpenAI ou Anthropic avec des modèles maximisant l’intelligence
      Des trois, cela ressemble à la seule entreprise qui ne vénère pas l’AGI au point de faire pénitence
    • Sur le benchmark GPQA Diamond, ils sont premiers ex aequo : https://artificialanalysis.ai/evaluations/gpqa-diamond
      C’est peut-être même leur seul objectif
    • Les modèles Gemini sont aussi leaders ou dans le groupe de tête sur plusieurs dimensions, donc conclure qu’ils sont honteusement à la traîne ne semble pas juste
  • En haut de l’indice d’intelligence, on trouve Claude Opus 5 Max à 61 points, Opus 5 Xhigh à 60 points, Claude Fable 5 Max et une combinaison de modèles de remplacement Opus 4.8 à 60 points, GPT-5.6 Sol Max à 59 points, et Opus 5 High à 59 points
    Donc Opus 5 Xhigh est au-dessus de Sol Max, et Opus 5 High est au même niveau que Sol Max ; je serais donc curieux de connaître les différences de prix et de vitesse entre les deux modèles

    • Dans les graphiques d’Artificial Analysis sur le coût et le temps par unité d’intelligence par tâche, Opus 5 High et Sol Max semblent avoir des coûts et des temps globalement similaires
      Sur DeepSwe, Opus 5 bat Fable mais reste derrière Sol, et sur FrontierCode il domine tout le monde avant de chuter au niveau de Sonnet dès qu’on pousse l’effort de raisonnement au-delà de Medium
    • Opus 5 ne semble pas aussi intelligent que Sol Max, et sur certaines tâches il paraît même inférieur à Opus 4.8
      En particulier, il aborde les problèmes de façon superficielle, au point qu’il faut lui enseigner l’application ou le framework dans son ensemble, et il commence par des tâches absurdes comme rajouter encore une fonctionnalité déjà prise en charge sous une autre forme
  • Parmi les composants, l’AA-Omniscience Index est intéressant
    Il mesure la fiabilité des connaissances et les hallucinations, récompense les bonnes réponses et pénalise les hallucinations sans pénaliser les refus de répondre, et cela ressemble à un indicateur donnant une idée de la taille ou de la densité des paramètres
    Le classement est Claude Fable 5 combinaison de modèles de remplacement, Gemini 3.1 Pro Preview, Claude Opus 5 Max, Grok 4.6 High, Gemini 3.6 Flash, GPT-5.6 Sol Max, et avec Gemini 3.x on retrouve depuis longtemps cette impression propre aux gros modèles

    • Gemini 3.1 Pro est excellent pour les tâches de connaissance, et Google a bien réussi sur ce point
      L’analyse d’images de Gemini 3.6 Flash est aussi solide, mais en coding ou sur les tâches agentiques il est en retrait
    • Voir 3.6 Flash à 24 points, au-dessus des 22 points de Sol, rend difficile d’affirmer qu’il s’agit d’un indicateur indirect de la taille des paramètres
      On dit que les Flash 3.x tiennent sur un seul TPU 8i, et leur vitesse de traitement à 234,7 tokens/s écrase les 64,4 de Sol et les 56,3 d’Opus ; même 3.1 Pro est bien plus rapide à 113,9 tokens/s
      AA-Omniscience Accuracy correspond davantage à l’intuition : l’énorme Fable mène avec 61 %, suivi de grands modèles frontier comme Sol, GPT-5.5 et Opus
      Gemini semble se concentrer moins sur le meilleur score en coding que sur les connaissances générales et l’efficacité des coûts d’exploitation, et dans les scores normalisés par domaine, seul le logiciel est moins compétitif
    • Si les refus de répondre ne sont pas pénalisés, ce n’est pas très utile
    • Plus que la taille du modèle, le grounding peut avoir un effet équivalent ou supérieur, et Google est manifestement très bon là-dessus pour des raisons évidentes
  • Avant de s’enthousiasmer, il faut regarder la matrice coût vs intelligence : https://artificialanalysis.ai/models?intelligence-index-toke...

    • Il est surprenant de constater qu’en tenant compte de la qualité des résultats, GPT-5.6 Sol Max est moins cher que tous les autres
    • Max ajoute énormément de raisonnement supplémentaire ; je me demande donc de combien le nombre de tâches résolues baisse en High
      Le coût devrait diminuer de façon notable
  • Meta Muse Spark m’apparaît sous un nouveau jour
    Il n’est le meilleur en rien, mais se place à des points raisonnables un peu partout dans le classement, avec un bon équilibre entre coût et performances
    Je me demande aussi où se situerait Poolside Laguna S, absent de la liste ; personnellement, je m’intéresse beaucoup aux modèles qui fonctionnent bien tout en restant rentables

  • Même avec une première place de justesse, si les « garde-fous » relevant de la censure refusent de répondre ou rétrogradent vers un autre modèle, l’utilité chute fortement.
    Pour cette raison, hormis une partie du workflow existant, l’usage de Claude a quasiment été abandonné, et la fiabilité compte plus que l’écart entre 61 et 57 points.
    En tenant compte de la censure et même de la vérification d’identité, que l’auteur n’a pas personnellement subie, Claude est le modèle le plus dégradé et le plus instable, et la légère optimisation benchmark de la dernière version n’en vaut pas la peine.

    • Je me demande bien quelles questions il faut poser pour se faire censurer aussi souvent.
    • Pour l’avoir utilisé moi-même, ce n’est absolument pas un modèle conçu uniquement pour les benchmarks.
      J’applique à tous les modèles un test de création de jeu, et Opus 5 m’a donné l’impression d’un bond de génération, donc les benchmarks ne montrent pas fidèlement la réalité et il faut tester par soi-même.
    • Chaque fois que je vois en ligne que les limites ou le modèle ont été améliorés et que je reconsidère mon principe de ne jamais payer Anthropic, je vérifie la model card et cela ne fait que renforcer ma conviction.
      Je ne comprends pas pourquoi Anthropic s’obstine autant avec le basculement automatique et silencieux vers une version dégradée, et je me demande même s’il existe un seul utilisateur qui préfère une baisse automatique des performances à un refus de réponse.
    • J’ai demandé à Claude Opus 5.0 de déployer une web app sur le PaaS de l’environnement de test avec une clé API globale pour récupérer des données, et il a refusé pour des raisons de sécurité, au motif que les permissions étaient trop larges.
      Opus 4.5 à 4.8, Fable, Codex 5.4·5.5 et Sol 5.6 ont tous exécuté la même tâche sans problème.
      Opus 5 est beaucoup trop prudent, ce qui le rend difficile à utiliser de façon productive et nécessite des ajustements supplémentaires.
    • Peut-être est-ce simplement parce que je ne fais rien de vraiment significatif, et Terence Tao, lui, ne se plaint pas des « modèles d’IA éveillés ».
  • C’est bien qu’Opus 5 ne réexplique pas tout comme le faisait 4.8.
    Alors que GPT-5.6 Sol raisonne beaucoup trop en profondeur même pour des tâches mineures, Opus 5 est un excellent modèle et Anthropic a bien travaillé.

    • Quand j’ai donné à Sol une spécification d’implémentation, il s’en est très bien sorti, donc je n’avais pas perçu cette différence.
      Quand je lui ai dit de se débrouiller sans spécification, il a consommé 30 % de mon quota hebdomadaire en 2 h 30 ; mais avec une spécification, il n’a utilisé que 2 % en 30 minutes, et le résultat était meilleur sur la structure, la longueur, la validation, le périmètre et le coût.
      Si on laisse Sol faire seul, cela devient incontrôlable, donc désormais Sol rédige les spécifications et Terra implémente ; cette méthode fonctionne bien et la consommation totale a aussi baissé.
  • Le résultat le plus intéressant est peut-être qu’Opus 5 est, après Fable 5, de très loin l’un des modèles les plus chers.
    GPT-5.6 et Kimi K3 obtiennent des scores similaires, à 1 à 2 % près, pour la moitié du coût.

    • Le graphique se base sur l’effort de raisonnement Max, principalement utilisé par les entreprises peu sensibles au prix.
      En Medium, le coût descend à presque la moitié de celui de K3, et cela a de fortes chances d’être largement suffisant pour 95 % des tâches de code.
  • Je ne suis dans aucun camp, mais sur ces résultats GPT-5.6 Sol Max paraît meilleur.
    Il offre des performances presque équivalentes pour environ la moitié du prix, et si Opus 5 est déjà aussi cher que GPT-5.6, cela montre à quel point Fable est tarifé haut.

    • Pour une comparaison correcte, il faudrait comparer Opus High et Sol Max.