1 points par GN⁺ 1 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Le réglage d’inférence maximal obtient 50 points dans l’AAII, ce qui le place 3e derrière Kimi K3 (max) et GLM-5.2 (max)
  • Il s’agit d’un modèle MoE qui n’active que 13 milliards de paramètres par token, sur un total de 284 milliards, et prend en charge les entrées/sorties texte ainsi qu’un contexte de 1 million de tokens
  • Le prix de l’API est de 0,14 $ par million de tokens en entrée, 0,28 $ en sortie et 0,003 $ en cache hit ; le coût total de l’évaluation Intelligence Index a été de 72,02 $
  • Lors de l’évaluation, il a utilisé 210 millions de tokens de sortie, bien au-delà de la médiane de 100 millions pour les modèles comparables, avec une verbosité nettement plus élevée ; la vitesse de sortie n’a pas encore été publiée
  • Les poids du modèle sont publiés sous licence MIT, permettant l’auto-hébergement et l’usage commercial ; il existe actuellement un seul fournisseur d’API

Architecture du modèle et mode de publication

  • DeepSeek V4 Flash 0731 est un modèle de raisonnement à poids ouverts publié le 31 juillet 2026
  • Il compte 284 milliards de paramètres au total et utilise une architecture Mixture of Experts (MoE) dans laquelle 13 milliards de paramètres sont activés pour chaque token pendant l’inférence
  • Les poids du modèle peuvent être téléchargés pour l’auto-hébergement
  • La licence MIT s’applique, autorisant l’usage commercial
  • Il s’agit d’une version de raisonnement utilisant un effort d’inférence maximal (Max Effort), et une version distincte sans raisonnement peut exister

Évaluation de l’intelligence

  • Il obtient 50 points dans l’Artificial Analysis Intelligence Index v4.1
    • 3e derrière Kimi K3 (max) et GLM-5.2 (max). Kimi K3 (low) et MiniMax-M3 occupent les 4e et 5e places
    • La médiane des grands modèles à poids ouverts comparables est de 25 points
    • Artificial Analysis le classe parmi les modèles de tête en matière d’intelligence
  • L’Intelligence Index v4.1 combine les 9 évaluations suivantes
    • GDPval-AA v2 : tâches réelles de type agent
    • 𝜏³-Banking : utilisation d’outils de type agent
    • Terminal-Bench v2.1 : codage/utilisation du terminal de type agent
    • SciCode : codage
    • Humanity's Last Exam : raisonnement/connaissances
    • GPQA Diamond : raisonnement scientifique
    • CritPt : raisonnement en physique
    • AA-Omniscience : exactitude des connaissances et limitation des hallucinations
    • AA-LCR : raisonnement sur long contexte

Périmètre des benchmarks complémentaires

  • Les résultats des évaluations suivantes sont également fournis afin de comparer les usages détaillés par modèle
    • AA-Briefcase : travail de connaissance de type agent
    • AutomationBench-AA : automatisation de tâches SaaS
    • Harvey LAB-AA : tâches juridiques de type agent
    • EnterpriseOps-Gym-AA : opérations d’entreprise
    • IFBench : respect des consignes
    • APEX-Agents-AA : tâches agentiques de longue durée
    • ITBench-AA : analyse des causes de pannes Kubernetes
    • MMMU-Pro : raisonnement visuel
  • DeepSeek V4 Flash 0731 ne prenant pas en charge l’entrée image, il s’agit d’un modèle uniquement textuel et non multimodal

Fiabilité des connaissances et évaluation des hallucinations

  • L’AA-Omniscience Index attribue des points aux réponses exactes, pénalise les hallucinations et ne pénalise pas les refus de répondre
  • Le score va de -100 à 100
    • 0 signifie qu’il y a autant de bonnes que de mauvaises réponses
    • Un score négatif signifie qu’il y a plus de mauvaises réponses que de bonnes

Utilisation des tokens et caractéristiques des réponses

  • Sur l’ensemble de l’évaluation Intelligence Index, il a généré 210 millions de tokens de sortie
    • La médiane des modèles à poids ouverts comparables est de 100 millions de tokens
    • Artificial Analysis le classe comme très verbeux
  • Le nombre de tokens de sortie par tâche est calculé en appliquant les pondérations de l’Intelligence Index au volume de sortie de chaque benchmark, puis en divisant par le nombre de tâches hors exécutions répétées
  • La vitesse de sortie n’a pas encore été mesurée, et le nombre de tokens de sortie par seconde n’est pas publié

Prix de l’API et coût de l’évaluation

  • Les prix de référence de l’API DeepSeek sont les suivants
    • Entrée : 0,14 $ par million de tokens
    • Sortie : 0,28 $ par million de tokens
    • Cache hit : 0,003 $ par million de tokens
  • En combinant cache hit/entrée/sortie dans un ratio 7:2:1, le prix est de 0,06 $ par million de tokens
  • Le coût total de l’évaluation Intelligence Index a été de 72,02 $
  • La zone de résumé indique une médiane des modèles comparés de 0,43 $ en entrée/1,20 $ en sortie, tandis que la zone FAQ indique 0,58 $ en entrée/2,20 $ en sortie
  • Le coût par tâche est calculé en divisant par le nombre de tâches les coûts des tokens d’entrée, de cache hit, d’écriture en cache, de raisonnement et de réponse finale, puis en appliquant la pondération Index de chaque benchmark
  • Les coûts d’écriture et de stockage du cache peuvent être facturés séparément selon le fournisseur d’API

Contexte et disponibilité

  • La fenêtre de contexte est de 1 million de tokens, soit environ 1 500 pages A4 en Arial 12 points
  • Il peut être utilisé pour des workflows RAG nécessitant la recherche et le raisonnement sur de grands documents
  • Il ne prend en charge que l’entrée texte et la sortie texte
  • Un seul opérateur fournit actuellement l’API, et les prix peuvent varier selon le fournisseur

1 commentaires

 
GN⁺ 1 시간 전
Avis sur Hacker News
  • Les poids du modèle viennent d’être publiés : https://huggingface.co/deepseek-ai/DeepSeek-V4-Flash-0731

    • La version quantifiée DwarfStar est attendue. J’ai utilisé pendant plusieurs mois l’aperçu de DeepSeek V4 Flash comme principal agent de codage sur un MacBook Pro 128 Go, et il semble supérieur à GLM 5.2 sur presque tous les indicateurs
    • Il vise des accélérateurs matériels dotés d’une primitive de multiplication de matrices 128×128 ; je me demande si cela désigne le Warp Group Matrix Multiply Accumulate du H100
    • Un GGUF Unsloth de moins de 165 Go devrait pouvoir tourner sur la plupart des systèmes CPU-only dotés de 256 Go de RAM. Une configuration hybride est aussi possible avec llama-server, en chargeant au maximum sur des GPU de 32 Go, 48 Go ou 96 Go et en plaçant le reste dans la DRAM système
      https://huggingface.co/unsloth/DeepSeek-V4-Flash-0731-GGUF
  • Un nouveau modèle DeepSeek, c’est comme un cadeau de Noël. Les modèles API à bas coût, c’est ce que DeepSeek fait le mieux, et tant que le prix de la VRAM ne sera pas assez bas pour permettre l’exécution locale, c’est la meilleure approche
    Les modèles d’abonnement dépendants de subventions auront du mal à durer, tandis que la facturation API ressemble davantage à un modèle économique durable

    • J’utilise DeepSeek sur un projet, et c’est impressionnant de pouvoir consommer des dizaines de millions de tokens pour quelques centimes. Ce n’est pas adapté à toutes les tâches, mais pour certaines, il excelle à un coût quasiment gratuit
    • J’ai hâte de voir la Chine rattraper son retard sur la mémoire et le matériel de calcul, et écraser les entreprises américaines à la fois sur le prix et les performances
    • Mes collègues développeurs se plaignent d’épuiser leurs tokens Claude en une heure, alors que j’utilise DS Flash toute la journée. S’il se trompe de temps en temps, je sors alors un modèle comme Claude uniquement pour les tâches difficiles
    • Même au token, il est très probable que l’API DeepSeek soit plus rentable qu’un abonnement. Après l’avoir testé moi-même, Flash respecte beaucoup mieux les consignes et est devenu plus proactif ; à l’heure actuelle, presque aucun modèle ne rivalise avec lui en rapport coût-efficacité
    • En regardant directement les prix, il faut 5 fois plus de tokens pour obtenir le même résultat qu’avec GPT 5.6 Luna, et le nombre de tokens par seconde est bien plus faible. Cela dit, l’effet de pression exercé par DeepSeek, qui pousse les acteurs en place à continuer d’optimiser, est évident
  • L’ancienne adresse renvoie une 404 ; la bonne URL semble être celle-ci : https://artificialanalysis.ai/models/deepseek-v4-flash

  • J’ai ajouté le point de données DeepSeek V4 Flash 0731 au graphique publié hier par OpenAI, et il se situe sur la frontière prix-performance
    https://files.parasmittal.com/openai_aa_luna_dsflash.svg
    Original : https://openai.com/index/advancing-the-price-performance-fro...

  • Il paraît que les tâches d’agent de code dans les benchmarks publics ont utilisé un mode minimal de DeepSeek Harness qui n’est pas encore sorti ; je me demande s’ils comptent aussi publier un harness d’agent de codage optimisé
    Avec DSv4 Flash associé à reasonix ou pi, on peut coder toute la journée pour quelques centimes sans se soucier des tokens. En revanche, utiliser le même modèle sur Fireworks ou OpenRouter avec ZDR fait grimper les coûts sans raison apparente. On dirait que les prix sont subventionnés pour collecter des données d’utilisation, et j’attends le jour où l’exécution locale deviendra possible

    • Je me demande auprès de quel fournisseur vous l’achetez si ce n’est pas via OpenRouter. Je pensais que, pour les fournisseurs listés sur OpenRouter, le prix était le même en achat direct
    • Le rapport technique annonçait déjà DeepSeek Harness. Les tâches d’agent de code ont été évaluées en mode minimal, avec un effort de raisonnement maximal, temperature = 1.0 et top_p = 0.95 ; le harness sera publié ultérieurement
  • Pour les utilisateurs d’une RTX PRO 6000 96 Go ou d’un DGX Spark 128 Go, vllm-moet, encore peu connu, est un très bon moteur. Il génère automatiquement des plans 2 bits symétriques pour l’inférence, crée aussi un cache de delta 4 bits pour restaurer la précision, et prend en charge le streaming SSD de poids plus grands que la RAM
    On peut définir la VRAM allouée à chaque zone pour équilibrer vitesse et précision, et 170 tokens par seconde ont été démontrés sur DS V4 Flash. Il utilise directement le modèle d’origine, sans conversion séparée
    Sur DGX Spark, il faut un petit contournement pour ignorer la différence entre sm120 et sm121, mais comme il fonctionne aussi sur sm121, cela vaut la peine d’y consacrer quelques heures

  • Pour 0,28 dollar par million de tokens en sortie, il offre une intelligence du niveau de GLM 5.2 et Gemini 3.6, et un modèle Pro mis à jour doit aussi arriver bientôt
    Le Q8 sans perte d’Unsloth fait 162 Go, une taille réellement envisageable pour une exécution à la maison

    • J’aimerais voir à quoi ressemble une maison où l’on fait tourner ce genre de chose
    • La taille du Q8 est d’environ 151 Go
  • Si DeepSeek V4 Flash dépasse V4 Pro, je me demande si l’on peut espérer un V4 Pro de niveau Opus 5 dans quelques semaines. Ce serait encore mieux s’il dépassait Opus

    • J’utilise V4 Flash dans une appli que je développe, et après n’avoir utilisé que GPT, Opus et Sonnet, son rapport coût-efficacité et ses performances sont surprenants. Le coût est si faible que je peux proposer un niveau gratuit généreux pour une appli qui n’a pas pour objectif de générer des revenus
      https://trysojourn.app
    • Les performances d’Opus 5 au prix de V4 Pro, ce serait incroyablement excellent, mais c’est probablement plus proche du rêve
    • Ils ont indiqué qu’une version finale mise à jour de V4 Pro serait bientôt publiée
  • Ce qui est vraiment intéressant, c’est que d’importants gains de performance ont été obtenus uniquement par un fine-tuning supplémentaire, sans changement d’architecture. C’est le résultat de davantage de données, de calcul et de temps
    DS V4 Flash est relativement petit par rapport aux familles de modèles concurrentes ; il paraît donc très probable qu’en appliquant des données de haute qualité et un pipeline d’entraînement similaire à d’autres petits modèles, on puisse obtenir des améliorations comparables

  • Sur le prix par tâche, il devance déjà Luna d’environ un facteur 2 : https://artificialanalysis.ai/models/deepseek-v4-flash?intel...

    • J’aimerais aussi voir comment il se compare à Luna par type de tâche précis
    • Comme le coût est sur l’axe X, plus précisément, DeepSeek V4 Flash 0731 en inférence maximale est autour de 0,03 dollar par tâche, avec un indice de 50. OpenAI Luna en inférence élevée est à 0,03 dollar et indice 46, en inférence ultra-élevée à 0,04 dollar et indice 49, et en inférence maximale à 0,07 dollar et indice 51
      Il est donc plus juste de dire que Luna est 2 à 3 fois plus cher que DeepSeek Flash, mais que son inférence est 2 à 5 fois plus rapide. Le modèle OpenAI le moins cher qui dépasse DeepSeek est Luna en inférence maximale : pour des performances similaires, il est environ 3 fois plus cher avant arrondi, mais aussi presque 3 fois plus rapide
      Le choix d’Artificial Analysis d’utiliser un bleu foncé à la fois pour DeepSeek et OpenAI est particulièrement malheureux, surtout un jour comme aujourd’hui