5 points par GN⁺ 1 일 전 | 4 commentaires | Partager sur WhatsApp
  • Alibaba Qwen a lancé Qwen3.8, un modèle de 2,4 billions de paramètres, et prévoit de publier prochainement ses open weights
  • Qwen3.8 est présenté comme un modèle en évolution continue, compatible avec les principaux modèles d’IA de frontière
  • Qwen estime que Qwen3.8 est actuellement l’un de ses modèles les plus puissants, situé au niveau juste après Fable 5
  • Qwen3.8-Max-Preview peut être testé dès maintenant sur Alibaba Token Plan, Qoder et QoderWork
  • Token Plan dispose de pages tarifaires distinctes pour les utilisateurs internationaux et les utilisateurs chinois
    • Pour les utilisateurs internationaux, trois niveaux sont proposés : Lite / Standard / Pro, avec des tarifs promotionnels de 6 $/18 $/68 $ par mois respectivement
    • Selon l’offre, 2 500/10 000/40 000 crédits tous les 7 jours et 700/3 000/12 000 crédits toutes les 5 heures sont fournis
    • Le nombre d’agents pouvant être exécutés simultanément est de 1 à 2 / 3 à 4 / 6 à 8 respectivement, avec une connexion possible via API Key et Base URL depuis des outils compatibles avec les protocoles OpenAI/Anthropic

4 commentaires

 
fanotify 1 일 전

J’ai trouvé une infographie, je la partage ici : https://i.postimg.cc/63yLvz16/modelsize202607.png
(légère mise à jour de celle de Kimi en y ajoutant cette fois les informations sur Qwen 3.8)

 
cadenzah 1 시간 전

N’ouvrez pas ce lien dans un lieu public !

 
thkweon 1 일 전

Il y a vraiment énormément de publicités sur le site.

 
GN⁺ 1 일 전
Avis sur Hacker News
  • Cette annonce semble faire suite à celle de Moonshot AI, qui a déclaré vouloir publier d’ici le 27 juillet sur Hugging Face les poids ouverts de Kimi K3, un LLM à 2,8 billions de paramètres.
    Alibaba a répliqué en annonçant qu’il publierait bientôt Qwen 3.8, à 2,4 billions de paramètres, en poids ouverts ; je me demande si c’était prévu de longue date ou si cela a été décidé pour concurrencer Moonshot AI.
    Quoi qu’il en soit, les gagnants de cette course aux LLM, ce sont les utilisateurs.

    • Il est difficile d’affirmer quelles sont les motivations, mais les entreprises chinoises semblent s’efforcer de faire de l’intelligence une commodité.
      C’est peut-être le moyen le plus efficace de faire baisser la valeur des laboratoires américains de pointe, et c’est aussi très bénéfique pour l’humanité.
    • Sur les réseaux sociaux chinois, on voit souvent cette plaisanterie : « les gouvernements des autres pays interviennent pour empêcher les comportements anticoncurrentiels, tandis que le gouvernement chinois intervient pour freiner la concurrence ».
      https://www.reuters.com/business/autos-transportation/what-i...
    • La raison de cette annonce maintenant est que la World AI Conference est en cours.
      Pendant que des robots font de la boxe et que les grandes entreprises chinoises d’IA dévoilent leurs derniers modèles, Xi Jinping a également annoncé la création de la WAICO.
      https://en.wikipedia.org/wiki/World_Artificial_Intelligence_...
    • L’annonce pourrait aussi coïncider avec le moment où Xi Jinping, en lançant une coalition politique à la World AI Conference, a déclaré que « le développement de l’IA ne devrait pas être le solo d’un seul pays, mais une symphonie de coopération internationale ».
      Les grandes conférences s’accompagnent généralement d’une avalanche de lancements de produits et d’annonces.
      https://www.cnbc.com/2026/07/17/x-china-ai-summit-risks-secu...
    • J’aimerais qu’ils publient plutôt Qwen 3.7-27B·122B, ou les versions 3.8 équivalentes, plutôt que des modèles géants.
      La force de Qwen et QwQ a toujours été de proposer le meilleur raisonnement local exécutable à la maison.
  • Alibaba Cloud bloque mon adresse e-mail, ce qui m’empêche de payer l’utilisation ; je ne peux donc pas faire le test du pélican cette fois-ci.
    J’attends la publication des poids ouverts ou l’ajout sur OpenRouter.

    • Le benchmark du pélican est désormais à peu près la seule procédure d’évaluation à laquelle je fais confiance.
      Il est absurde qu’une entreprise comme Alibaba rende difficile le fait de lui donner de l’argent, alors qu’elle devrait vouloir que des développeurs connus testent ses modèles.
      OpenRouter les ajoute généralement assez vite, donc j’espère pouvoir l’utiliser bientôt. On peut aussi télécharger l’application Qwen et la tester dans l’interface de chat avec des outils MCP pour le développement local.
  • J’espère aussi voir sortir des petits modèles Qwen 3.8.
    J’utilise localement le MoE 35B et le modèle dense 27B, et la plupart du temps il n’est pas nécessaire d’appeler Claude.
    C’est particulièrement utile pour les requêtes contenant des données sensibles ou personnelles.

    • J’aimerais voir un modèle MoE intermédiaire entre le 35B de la 3.6 et le 122B de la 3.5.
      Sur un ordinateur domestique assez puissant sans être excessivement coûteux, il pourrait offrir un excellent équilibre entre vitesse et performances.
    • Cette compétition ressemble davantage à une lutte pour la suprématie de l’IA de pointe, et je crains que les petits modèles performants ne passent au second plan.
      Les grands labos ne veulent pas confier aux utilisateurs finaux la poule aux œufs d’or, et des fabricants de matériel comme Nvidia pourraient eux aussi entrer sur ce marché afin de tirer profit de toutes les parties.
    • Je me demande comment ils pourraient réduire un modèle de 2,4 billions de paramètres à 35B tout en conservant sa précision.
      Il faudrait une architecture complètement différente pour y parvenir.
    • Je me demande quel matériel ils utilisent.
  • J’ai essayé Qwen 3.6 27B dans LMStudio : c’était un peu lent, mais meilleur que prévu.
    Avec mtplx, c’est devenu, sans exagérer, réellement 2 à 3 fois plus rapide, ce qui est très impressionnant.
    J’essaie de migrer autant que possible vers des modèles locaux, et cela devient de plus en plus pratique. Cela dit, j’utilise un MacBook M5 Max à configuration maximale, un portable à 6 000 dollars, donc le matériel reste encore hors de portée pour la plupart des gens.
    À l’avenir, on ira probablement vers l’exécution locale de petits modèles entraînés de manière plus ciblée. Le risque de confier toutes ses données à des fournisseurs cloud est trop élevé, et je m’attends à ce qu’ils pratiquent des tarifs délirants quand viendra le moment de prouver leur rentabilité.

    • Après les récentes hausses de prix, ce portable est probablement désormais plus proche des 8 000 dollars
  • Après l’avoir utilisé tous les jours pendant un mois, Qwen 3.7 Pro s’est révélé pratiquement inutilisable
    Il fait perdre énormément de temps, perd le fil du travail ou tombe dans des boucles inutiles, et ne débogue pas correctement
    L’écart avec DeepSeek V4 Pro était flagrant, et jusqu’ici Qwen m’a semblé être le pire modèle pour l’ingénierie logicielle. Il est bien plus cher que DeepSeek, tout en étant impossible à déléguer ou à utiliser pour du travail bas niveau en temps réel

    • J’ai exécuté localement Qwen3.6-35B et 27B quantifiés en Q8 avec llama.cpp, et j’ai aussi essayé le modèle quantifié DS4-flash d’antirez
      Ils étaient tous à peu près au même niveau, DS4 étant un peu plus efficace, mais tous ont donné de très bons résultats sur des scripts Bash, du débogage, du Python et certaines tâches en C++
      Je me demande dans quelles applications ou quels langages Qwen a échoué. Le template de chat de Qwen est cassé, j’ai dû le déboguer moi-même, et un travail est en cours pour le corriger ; c’était similaire avec Gemma
    • Selon mes critères, Qwen 3.7 Max surpasse Opus tout en étant beaucoup plus rapide, et reste légèrement en dessous de Fable
      Il devance largement DeepSeek 4 Pro en vitesse et en compréhension globale, et je l’utilise principalement avec Claude Code
      Qwen 3.7 Plus est aussi plutôt correct pour des sous-agents et bien meilleur que Sonnet. Qwen 3.8 Max Preview fonctionne bien pour l’instant, mais il est trop tôt pour juger ; à 10 % du prix normal, c’est un rapport qualité-prix énorme
    • Qwen 3.7 Pro est quelconque, mais 3.7 Max est un très bon modèle
    • J’ai crédité 2 dollars sur l’API DeepSeek et mis la clé dans Void Editor pour créer un outil crypto en HTML
      J’ai codé tranquillement pendant une ou deux heures avec un fichier CSV d’exemple de plusieurs centaines de lignes et corrigé des bugs, ce qui a coûté environ 1,8 dollar
      Si ce coût est normal, une utilisation professionnelle pendant un mois coûterait sans doute plus que mon salaire ; je me demande donc si les fournisseurs cloud sont vraiment aussi chers
    • Anthropic n’aurait pas dû entraver les attaques par distillation de connaissances
  • La version finale de DeepSeek 4 devrait aussi sortir bientôt
    Elle sera probablement du niveau d’Opus 4.8, et vu les prix de DeepSeek, cela pourrait être un événement assez majeur

    • Le rapport performance/prix de DeepSeek est écrasant
      J’utilise souvent V4 Flash ces derniers temps, et il est vraiment bon
    • DeepSeek V4 est 10 à 30 fois moins cher que la plupart des modèles, tout en suffisant pour la majorité des tâches
    • Demain étant le dernier jour de la WAIC, c’est probablement le moment le plus probable pour sa sortie
    • C’est le modèle que j’attends le plus
      Ces dernières semaines, en utilisant directement DeepSeek Pro, j’ai reçu de plus en plus souvent des réponses qui provenaient clairement d’un modèle bien supérieur
      Ses performances sont tellement bonnes que, dans le camp des modèles fermés, certains propagent déjà peur, incertitude et doute avec des accusations du type « dark routing » ou « ils ont simplement volé Fable »
      Même le prix augmenté offre une valeur énorme. Si vous n’avez pas le temps de tester tous les modèles et voulez seulement utiliser ce qui semble actuellement être le meilleur, il vaut peut-être mieux ne pas l’essayer. Vous risquez de réaliser, avec regret, tout ce que vous auriez pu accomplir de plus si, au premier semestre de cette année, vous aviez dépensé 1 200 dollars chez DeepSeek plutôt que chez OpenAI
  • En regardant Artificial Analysis, j’ai vu qu’au moins 12 fournisseurs affichaient de meilleures performances qu’Opus 4.5, que l’on attribue à Anthropic pour avoir déclenché l’accélération récente après sa publication en décembre
    Si l’on tient compte en plus des faibles coûts de migration, la concurrence est complètement en surchauffe. Personnellement, j’estime qu’un niveau Opus 4.5 suffit pour la plupart des applications et usages

    • C’est pourquoi OpenAI et Anthropic risquent de réclamer plus fortement des réglementations et interdictions gouvernementales
      Sinon, tout leur modèle de revenus s’effondre
  • Pour exécuter cela dans OpenCode avec le Qwen Cloud Token Plan, la configuration suivante fonctionne
    Ne connaissant pas les limites exactes, je les ai définies comme les limites de Qwen 3.7 Max

    "provider": {  
      "alibaba-token-plan": {  
        "models": {  
          "qwen3.8-max-preview": {  
            "limit": {  
              "context": 1048576,  
              "output": 65536  
            },  
            "modalities": {  
              "input": ["text"],  
              "output": ["text"]  
            },  
            "name": "Qwen3.8 Max Preview"  
          }  
        }  
      }  
    }  
    
    • Il faut choisir correctement l’endpoint API et le token
      Si vous appelez le bon endpoint, le quota diminue presque immédiatement, il faut donc le vérifier
      En cas d’erreur, vous pourriez consommer des tokens API qui ne sont pas inclus dans les Credits de l’abonnement et perdre 200 dollars en trois jours ; cela vaut aussi si vous utilisez les 200 dollars reçus en bonus d’inscription à Alibaba Cloud
  • L’expression « le meilleur après Fable 5 » est assez significative
    Au début, beaucoup doutaient que Fable ait vraiment progressé par rapport à Opus, mais qu’on l’apprécie ou non, Anthropic a obtenu avec ce modèle un véritable moat, à condition qu’ils continuent d’en autoriser l’utilisation
    Si un modèle open le dépasse, ce sera vraiment intéressant

    • Difficile de parler de moat, mais c’est clairement un meilleur modèle
      Pour mon travail, je les classe Fable > K3 > Sol
      Cela dit, il n’est pas écrasant au point que perdre l’accès à Fable serait un coup dur par rapport aux deux autres. Les trois sont excellents, et Fable est le seul à refuser régulièrement des requêtes
    • Leur « moat » tient au fait que Mythos est actuellement le seul modèle géant
      Il a toujours été possible d’entraîner un modèle à 10 billions de paramètres pour obtenir 10 % de performances en plus qu’un modèle à 1 billion
      Si Mythos avait été Opus 5 avec la même taille et le même prix que l’ancien Opus, ce serait un différenciateur décisif, mais en réalité ce n’est pas le cas
    • Même s’il est meilleur, il a trop de contraintes pour être aussi utile qu’Opus
    • La qualité des résultats de Fable baisse souvent
      J’utilise Sol comme modèle principal ; Fable peut être créatif, mais il est moins bon pour exécuter des tâches de manière fiable sans consommer des tokens à l’infini
  • La compétition IA en Chine s’intensifie
    J’ai hâte de voir ce qu’Anthropic et OpenAI vont sortir ensuite