4 points par GN⁺ 2024-12-08 | 1 commentaires | Partager sur WhatsApp
  • Countless.dev est un site web qui vise à comparer dans un seul tableau les prix et fonctionnalités des modèles d’IA de plusieurs fournisseurs, afin de parcourir rapidement les limites de tokens et les tarifs unitaires utiles au choix d’un modèle
  • La liste énumère des modèles par fournisseur, comme OpenAI, Anthropic, Google, Qwen, DeepSeek et Mistral, et affiche aussi des valeurs qui semblent correspondre à la longueur de contexte et à la limite de sortie
  • Des familles de modèles commerciaux et open source comme GPT-5.x, Claude Opus/Sonnet/Haiku, Gemini 2.5/3.x, Qwen3.x, DeepSeek V3/R1, Mistral, Llama et Nemotron sont mélangées sur un seul écran
  • Certains éléments sont marqués (free) et la colonne de prix est vide, tandis que des routeurs comme Auto Router, Free Models Router, Pareto Code Router et Switchpoint Router sont aussi traités comme des entrées distinctes
  • Il est possible de comparer, selon les fournisseurs, des modèles récents, anciens, en preview, pour l’image, l’audio, le code ou la recherche, mais le texte fourni ne permet pas de confirmer jusqu’à la définition des colonnes du tableau ni la méthode de calcul des prix

Tableau comparatif des prix et fonctionnalités des modèles d’IA

  • Countless.dev met en avant dans son titre une comparaison des prix et fonctionnalités des LLM
  • Dans le titre sur Hacker News, le site est présenté comme comparant non seulement les LLM, mais aussi le TTS et le STT
  • Le contenu fourni prend la forme d’une longue liste de modèles, et chaque ligne contient en général les informations suivantes
    • le nom du fournisseur ou du routeur
    • le nom du modèle
    • des valeurs de tokens indiquées avec la notation T
    • deux montants en dollars ou des champs de prix vides
    • l’indication d’un modèle gratuit via la mention (free)

Familles de modèles mélangées par fournisseur

  • Les entrées OpenAI incluent GPT-5.5, GPT-5.4, GPT-5.3, GPT-5.2, GPT-5.1, GPT-5, GPT-4.1, GPT-4o, GPT-4 Turbo et GPT-3.5 Turbo
    • Des modèles Pro plus coûteux, comme GPT-5 Pro, GPT-5.4 Pro et GPT-5.5 Pro, apparaissent aussi comme entrées séparées
    • On y trouve également des modèles audio et image comme GPT Audio, GPT Audio Mini, GPT-5 Image et GPT-5 Image Mini
    • Les familles o1, o3, o4 Mini et Deep Research sont aussi incluses
  • Les entrées Anthropic sont composées des familles Claude Opus, Sonnet, Haiku et Fable
    • Claude Opus 4.8, Claude Opus 4.7, Claude Opus 4.6, Claude Opus 4.5, Claude Opus 4.1 et Claude Opus 4 sont listés
    • Claude Sonnet 5, Sonnet 4.6, Sonnet 4.5, Sonnet 4, Claude Haiku Latest et Claude Haiku 4.5 sont également inclus
  • Les entrées Google comprennent les familles Gemini, Gemma, Nano Banana et Lyria
    • Gemini 3 Flash Preview, Gemini 3.5 Flash, Gemini 3.1 Pro Preview, Gemini 2.5 Pro et Gemini 2.5 Flash sont listés
    • Des entrées de modèles d’image comme Nano Banana Pro, Nano Banana 2 et Nano Banana Lite sont également présentes
  • Les modèles d’autres fournisseurs comme Qwen, DeepSeek, Mistral, Meta, NVIDIA, MoonshotAI, MiniMax et Z.ai peuvent aussi être comparés dans la même liste

Affichage des prix et modèles gratuits

  • Les entrées tarifées affichent deux prix unitaires en dollars
    • Anthropic Claude Opus 4.8: $5, $25
    • OpenAI GPT-5.5: $5, $30
    • Google Gemini 2.5 Pro: $1.25, $10
    • OpenAI o1-pro: $150, $600
  • Les entrées marquées (free) ont des colonnes de prix vides, notées
    • NVIDIA Nemotron 3 Ultra (free)
    • Poolside Laguna M.1 (free)
    • Cohere North Mini Code (free)
    • Google Gemma 4 26B A4B (free)
    • OpenAI gpt-oss-120b (free)
    • Meta Llama 3.3 70B Instruct (free)
  • Pour certains modèles, une version gratuite et une version payante existent sur des lignes séparées
    • Poolside Laguna XS.2
    • Poolside Laguna M.1
    • NVIDIA Nemotron 3 Super
    • Google Gemma 4 26B A4B
    • OpenAI gpt-oss-120b
    • OpenAI gpt-oss-20b

Limites des modèles vues à travers les valeurs de tokens

  • De nombreux modèles affichent de grandes valeurs, autour de 1 million de tokens
    • OpenAI GPT-5.5, GPT-5.4, GPT Latest: 1,050,000
    • Anthropic Claude Opus 4.8, Claude Opus 4.7, Claude Sonnet 5: 1,000,000
    • Google Gemini 3 Flash Preview, Gemini 3.1 Flash Lite, Gemini 2.5 Pro: 1,048,576
    • DeepSeek V4 Pro, DeepSeek V4 Flash: 1,048,576 ou 1,048,575
  • La seconde valeur de tokens, qui semble correspondre à une limite de sortie, varie aussi selon les modèles
    • OpenAI GPT-5.5: 128,000
    • Anthropic Claude Opus 4.8: 128,000
    • MoonshotAI Kimi K2.6: 262,144
    • MiniMax MiniMax-01: 1,000,192
  • Sur certaines lignes, la deuxième valeur ou le prix est vide avec , ce qui montre que tous les modèles ne disposent pas du même niveau d’information

Routeurs et modèles à usage spécifique

  • En plus des modèles classiques, des entrées Router sont incluses comme s’il s’agissait de modèles distincts
    • OpenRouter Fusion
    • Pareto Code Router
    • Free Models Router
    • Switchpoint Router
    • Auto Router
  • Des modèles orientés vers des objectifs précis, comme la sécurité, la recherche, la recherche web ou l’application de code, figurent aussi dans la liste
    • NVIDIA Nemotron 3.5 Content Safety
    • Meta Llama Guard 4 12B
    • OpenAI o3 Deep Research
    • Perplexity Sonar Deep Research
    • Relace Search
    • Relace Apply 3
  • Le texte fourni ne permet pas, à lui seul, de vérifier des critères détaillés comme le mode de sélection de chaque routeur ou modèle spécialisé, les benchmarks, les API prises en charge ou la fréquence de mise à jour

1 commentaires

 
GN⁺ 2024-12-08
Avis sur Hacker News
  • OP, vous vous êtes peut-être inspiré de cet outil de comparaison de LLM ?
    https://whatllm.vercel.app
    Le tableau est assez similaire, mais l’ajout d’un calculateur directement ici est un bon point.
    Dans Versus Comparison, ce serait bien d’avoir une fonction qui mette en évidence d’un coup d’œil les meilleures valeurs de chaque LLM quand on coche une case.

    • Les données de cet outil datent un peu, car elles proviennent de https://artificialanalysis.ai/ au 13 octobre 2024.
      Les informations à jour sur tous les modèles et fournisseurs se trouvent sur cette page : https://artificialanalysis.ai/leaderboards/providers
      D’autres pages couvrent aussi la reconnaissance vocale, la synthèse vocale, la génération d’images et la génération de vidéos.
      Pour info, je suis l’un des créateurs d’Artificial Analysis.
  • Aller vers davantage de comparaisons de modèles est une bonne chose. Je me demande si vous prévoyez aussi d’ajouter des analyses indépendantes de ces modèles, ou si vous vous limitez à agréger des informations comme les limites d’entrée.
    Par rapport à d’autres analyses comme celles-ci, quelle différenciation ou valeur ajoutée pensez-vous apporter ?
    https://artificialanalysis.ai
    https://huggingface.co/spaces/TTS-AGI/TTS-Arena
    https://huggingface.co/spaces/hf-audio/open_asr_leaderboard
    https://huggingface.co/spaces/TIGER-Lab/GenAI-Arena
    Le travail d’agrégation est excellent, et le site est agréable à parcourir.

    • J’ai créé https://aimodelreview.com/ pour comparer les sorties de LLM sur plusieurs prompts et catégories, et les afficher côte à côte.
      J’ai exécuté chaque prompt 4 fois avec différentes valeurs de temperature, consultables via un toggle.
      Je voulais aussi ajouter des critiques de chaque modèle, mais je n’en ai plus eu l’énergie. J’ai toutefois reçu des messages disant que la comparaison restait utile pour se faire une idée de la manière dont les modèles répondent différemment au même prompt, et de l’effet de la temperature sur les sorties d’un même modèle.
    • Comme je trouve personnellement les UI Gradio assez laides, j’ai utilisé shadcn et Next.js pour que le site soit agréable visuellement.
      J’essaie de le rendre aussi convivial que possible. La plupart des sites sont moches ou trop techniques.
    • Imaginez aller encore un cran plus loin : exécuter réellement le même prompt sur tous les modèles d’IA, puis afficher la meilleure réponse et le modèle qui l’a produite.
  • Sympa ! Ce serait bien de pouvoir voir une valeur de performance par rapport au prix.
    Il faudrait un moyen de savoir quel est le modèle le moins cher capable de produire de façon fiable des données structurées à partir de texte non structuré.
    Pour l’instant, j’utilise gpt4o-mini, qui est bon marché, mais je ne sais pas si des modèles encore moins chers peuvent faire le même travail.

    • Regardez Gemini Flash 1.5. J’avais besoin de transformer des vidéos en notes structurées et les résultats m’ont satisfait ; étrangement, c’était même meilleur que Gemini 1.5 Pro.
      https://jampauchoa.substack.com/i/151329856/ai-studio
      D’après ce site, le coût est deux fois moindre que celui de gpt4-o mini : 0,15 contre 0,07 par million de tokens.
    • Je n’ai pas encore trouvé de modèle aussi performant dans la gamme de prix de GPT-4o mini. À voir les attentes autour de Llama 3.3 70B, ce pourrait être celui-là.
      Chez Deepinfra, les tokens d’entrée sont plus chers mais les tokens de sortie moins chers, donc le prix me semble à peu près équivalent.
      Cela dit, le meilleur rapport performance/prix est assez subjectif : certains ont seulement besoin que ça marche bien pour un cas d’usage précis, tandis que d’autres veulent de bons résultats sur un périmètre plus large.
    • Quand il s’agit de comparer plusieurs modèles, je recommande toujours openrouter.ai. C’est ce que j’utilise en général pour les petites tâches diverses.
      Je n’ai aucun lien avec eux, je suis juste utilisateur.
  • J’aimerais partager un point de vue personnel sur l’IA, et aussi un coup de gueule. Comme beaucoup de gens, je suis extrêmement enthousiaste face à la vague actuelle de l’IA.
    Nous sommes à la pointe de l’innovation, donc l’envie de se lancer dans ce domaine et d’y contribuer est naturelle.
    Mais je trouve que ce moment ressemble à un marché financier en surchauffe. Quand les marchés sont volatils, l’un des conseils qu’on entend souvent est de patienter et observer.
    Dans l’IA aussi, des talents et des organisations remarquables foncent pour créer des innovations majeures. Il y a de fortes chances que ce que j’imagine comme mon prochain grand projet soit déjà en cours quelque part, ou arrive bientôt.
    Une stratégie consistant à patienter et observer peut donc être étonnamment efficace. Plutôt que de se précipiter, attendre que la poussière retombe, observer les tendances, puis tirer parti de ce qui émerge.
    En un sens, tout l’écosystème IA est en train de construire les fondations de ma prochaine grande idée.
    Cela ne veut pas dire qu’il ne faut pas intégrer les technologies les plus récentes dans des produits et services déjà opérationnels.

    • La suggestion est tout à fait valable. Beaucoup d’entreprises intègrent probablement déjà des modèles de pointe dans leurs produits.
      Mais il n’y a pas de repas gratuit. En procédant ainsi, on devient plus réactif que proactif.
      On réduit les risques, mais on perd aussi l’occasion de prendre une participation dans les rares acteurs qui survivront et deviendront très précieux.
      À force de faire ça longtemps, on finit par ne plus comprendre de quoi parlent les gens du domaine. Si vous voulez saisir ce que je veux dire, regardez le dernier épisode de Dwarkesh Patel.
      Ici, participation est à prendre au sens large : actions d’une entreprise, connaissances en tant que chercheur en IA, etc.
  • Question un peu hors sujet, mais existe-t-il sur ordinateur quelque chose de mieux que le client ChatGPT par défaut ?
    Je trouve les fonctions d’organisation des conversations trop basiques, et comme il existe une dizaine d’apps, c’est difficile à évaluer. La plupart ressemblent surtout à un habillage qui pousse vers le service API d’une entreprise
    Avez-vous quelque chose à recommander ? Idéalement compatible macOS/Linux

    • Il y a Telosnex. Il fonctionne en natif sur toutes les plateformes, et il existe aussi en version web
      Il prend en charge Anthropic, OpenAI, Mistral, Groq, Gemini, ainsi que les LLM locaux de pratiquement toutes les plateformes
      On peut apporter sa propre clé API, et la recherche est aussi la meilleure. Le modèle est au paiement à l’usage ; avec 10 $ par mois, tout est fourni au prix coûtant. Sinon, c’est gratuit
      Toutes les données sont stockées sous forme de simple JSON
    • Il y a https://www.typingmind.com/. C’est uniquement local, sans serveur, et créé par un développeur indépendant
    • J’ai trouvé Machato plutôt bien : https://untimelyunicorn.gumroad.com/l/machato
  • Il n’y a que deux modèles de transcription vocale. C’est vraiment généralement comme ça ?
    Je me demande s’il n’existe pas de modèles open source du type Llama pour la transcription, ou si c’est simplement le jeu de données de ce site qui est limité

    • Ce site semble lister uniquement les modèles hébergés des principaux fournisseurs, et non tous les modèles disponibles sur Hugging Face, civit.ai, etc.
      Si l’on regarde les listes de génération d’images et de chat, Hugging Face contient beaucoup plus de modèles absents d’ici
      Voir https://huggingface.co/models?pipeline_tag=automatic-speech-...
      À titre de référence, les modèles de synthèse vocale et de transcription vocale/reconnaissance automatique de la parole peuvent être entraînés sur les mêmes données. Mais actuellement, leurs architectures étant différentes, ils doivent être entraînés séparément
      L’une des difficultés est le temps d’entraînement. Les données peuvent monter à plusieurs centaines d’heures d’audio
    • Il existe vraiment beaucoup de modèles, couvrant de nombreux cas d’usage : on-device, streaming/faible latence, modèles pour certaines langues, etc.
      Les gens ont l’impression qu’OpenAI a inventé la transcription vocale avec Whisper en 2022, mais d’autres modèles existent depuis des décennies et sont utilisés en production depuis longtemps
      Sur ce site, il n’y a que Whisper
  • L’UI et la disposition du tableau sont bonnes. Avez-vous envisagé d’afficher aussi les besoins en VRAM par modèle ?

  • Ce serait bien d’afficher aussi les informations de classement lmarena, pour pouvoir comparer performances et coûts

  • Très bonne ressource. Pour quelqu’un qui ne connaît pas tous les noms des sous-versions, c’est presque trop exhaustif
    Ce serait bien d’avoir une colonne avec les scores du classement lmarena. Certains prix apparaissent à 0,00 : y a-t-il une raison ?
    Ce serait aussi bien d’avoir, sur chaque ligne, un lien vers une page plus détaillée

    • Merci ! Certains modèles apparaissent en N/A ou à 0,00 ; cela semble correspondre à des modèles gratuits ou indisponibles
      J’ajouterai absolument llmarena. Beaucoup d’autres personnes l’ont aussi recommandé
      Avec le temps, je rendrai le site plus explicatif et plus détaillé
    • Ce serait aussi bien d’avoir des liens vers les pages des entreprises permettant d’utiliser le modèle ou de s’y abonner