1 points par GN⁺ 2 시간 전 | 1 commentaires | Partager sur WhatsApp
  • La version officielle de l’API DeepSeek-V4-Flash a été lancée en bêta publique le 31 juillet 2026 ; elle peut être utilisée avec la méthode d’appel existante en indiquant simplement deepseek-v4-flash comme nom de modèle
  • Les performances agent dépassent largement celles de V4-Pro-Preview, avec notamment 82,7 points sur Terminal Bench 2.1, ainsi que 76,7 sur Cybergym, 70,3 sur Toolathlon verified et 68,7 sur DSBench-FullStack
  • Les benchmarks d’agents de code ont été mesurés dans le mode minimal de DeepSeek Harness, à venir, avec les paramètres max effort, top_p=0.95 et temperature=1.0
  • La version officielle de V4-Flash prend en charge nativement le format Responses API et a été ajustée pour Codex ; elle conserve la même structure et la même taille de modèle que la Preview, avec uniquement un entraînement de post-traitement supplémentaire
  • Le périmètre des changements est limité à l’API V4-Flash ; l’API V4-Pro et les modèles APP/WEB restent inchangés, et la version officielle de V4-Pro doit sortir prochainement

Lancement en bêta publique et utilisation de l’API

  • La version officielle de l’API DeepSeek-V4-Flash a été lancée en bêta publique le 31 juillet 2026
  • La méthode d’appel existante reste inchangée : il suffit de définir le paramètre de modèle sur deepseek-v4-flash pour utiliser la dernière version
  • La série V4 est proposée via OpenAI ChatCompletions et l’interface Anthropic sur le même base_url qu’auparavant
    • V4-Pro utilise deepseek-v4-pro, V4-Flash utilise deepseek-v4-flash
    • Les anciens noms de modèles, deepseek-chat et deepseek-reasoner, devaient être arrêtés le 24 juillet 2026
    • Pendant la période de transition, ces deux noms désignaient respectivement le mode sans raisonnement et le mode raisonnement de V4-Flash

Résultats des benchmarks agent

  • La version officielle de V4-Flash affiche des résultats nettement supérieurs à V4-Pro-Preview en performances agent
    • Terminal Bench 2.1 : 82,7
    • NL2Repo : 54,2
    • Cybergym : 76,7
    • DeepSWE : 54,4
    • Toolathlon verified : 70,3
    • Agent Last Exam : 25,2
    • Automation Bench Public : 25,1
    • DSBench-FullStack : 68,7
    • DSBench-Hard : 59,6
  • Les tâches d’agent de code des benchmarks publics ont été mesurées avec le mode minimal de DeepSeek Harness, à venir
    • Le niveau d’effort est max, avec top_p=0.95 et temperature=1.0
  • DSBench-FullStack est un jeu de tests interne de développement full-stack, et DSBench-Hard est un jeu interne de problèmes difficiles pour agents de code

Responses API et intégration avec Codex

  • La version officielle de V4-Flash prend en charge nativement le format Responses API et a été ajustée pour Codex
  • Les paramètres nécessaires à l’intégration avec Codex sont disponibles dans la documentation officielle

Périmètre des changements du modèle

  • DeepSeek-V4-Flash-0731 conserve la même structure et la même taille de modèle que V4-Flash-Preview
  • Aucun changement de structure n’a été apporté au modèle lui-même ; seul un entraînement de post-traitement supplémentaire a été appliqué
  • La mise à jour s’applique uniquement à l’API DeepSeek-V4-Flash
    • L’API DeepSeek-V4-Pro ne change pas
    • Les modèles proposés dans APP/WEB restent également inchangés
  • La version officielle de DeepSeek-V4-Pro doit sortir prochainement

1 commentaires

 
GN⁺ 2 시간 전
Avis sur Hacker News
  • Personnellement, je l’attends encore plus que K3. Le modèle DSV4 a des coûts de serving très bas ; à mesure que ses performances s’améliorent, il peut devenir un modèle « suffisamment bon » pour davantage de tâches.
    DeepSeek propose depuis longtemps sa version Pro à très bas prix et l’a intégrée à OpenCode et d’autres outils ; il est donc très probable qu’ils aient aussi accumulé beaucoup de données de développement réelles. En les utilisant pour le post-entraînement, d’autres améliorations sont possibles.
    Je me demande aussi à quel point K3 s’améliorerait s’il était distillé vers DSV4. Les modèles bon marché et rapides sont particulièrement utiles à la communauté, car on peut continuer à exploiter leurs performances sans qu’ils disparaissent au gré d’un fournisseur. Au minimum, Flash peut tourner chez soi avec du matériel à moins de 10 000 dollars, alors que les grands modèles GLM ou K3 sont difficilement réalistes.

    • Les seuls fournisseurs auxquels je pourrais consentir à fournir des données d’entraînement sont DeepSeek et Moonshot.
    • Combiné à DwarfStar, j’espère que cela permettra une IA locale utilisable.
  • Je traite 90 % de mon travail avec Flash. Je ne sais pas pourquoi, mais il est meilleur que Pro, tout en étant très bon marché et rapide.
    Si je garde les changements sous les 1 000 lignes et que je prends moi-même les décisions d’architecture, je perçois très peu de différence avec les modèles de pointe. Les 10 % restants servent à trouver des bugs ou problèmes de sécurité, ou à examiner de meilleures structures ; Flash s’en sort assez bien aussi, mais je fais des validations croisées.
    Des itérations rapides valent largement mieux que d’attendre 5 à 10 minutes pour de petits changements. Récemment, Kimi et GLM étaient lents parce qu’ils raisonnaient inutilement longtemps. Je peux fournir beaucoup de données — dépendances, logs, dumps de performance — sans m’inquiéter des limites, et je ne me heurte pas non plus à des restrictions de sécurité pour la rétro-ingénierie de binaires.

    • Peut-être parce que mes prompts sont peu explicites, mais les modèles OpenAI utilisés via Codex n’ont jamais refusé mes tâches de rétro-ingénierie de binaires. J’analyse encore aujourd’hui des firmwares tiers avec Codex, et je n’ai jamais rencontré de limite.
      À l’inverse, certains disent se faire refuser même des prompts sans lien avec la sécurité ; je me demande si les différences entre plateformes et entre utilisateurs peuvent être aussi importantes.
    • DeepSeek V4 Flash suffit pour la plupart des tâches et répond vite. J’achète surtout mes tokens auprès de FireWorks.ai, aux États-Unis, mais j’ai aussi prépayé un gros volume chez DeepSeek.
      J’utilise principalement OpenCode, qui consomme moins de tokens que Claude Code, et j’attends aussi avec intérêt la sortie du propre harnais de codage de DeepSeek.
    • Globalement c’est bon, mais sur OpenRouter, la limite de tokens en sortie est beaucoup trop stricte. S’il tombe dans un piège de raisonnement, il n’arrive pas à s’en sortir tout seul dans la limite, mais il a tout de même remplacé les modèles Kimi.
  • Sur les 30 derniers jours, pour la plupart de mes tâches d’agent personnel au quotidien avec DeepSeek, le bilan est de 4,55 dollars, 3 467 requêtes API et 323 183 886 tokens.
    En tant qu’ingénieur dirigeant une petite équipe, j’ai des critères de qualité élevés et j’applique les mêmes à mes projets personnels, mais je n’ai pas du tout été déçu pour les tâches de codage et de revue. Pour les autres tâches, j’utilise d’autres modèles.

    • Je suis curieux de savoir quelle méthode et quels prompts tu utilises pour faire de la revue de code avec un LLM. La qualité des réponses était assez faible de mon côté, et j’aimerais savoir si c’est dû à mon usage.
    • Je me demande quel harnais tu utilises pour atteindre un tel niveau de mise en cache des tokens.
    • Je me demande s’il n’y a pas beaucoup d’hallucinations et, s’il y en a, quel effet elles ont sur ton flux de travail.
    • La qualité n’est pas exceptionnelle, et c’est pareil pour la plupart des LLM.
  • Désormais, j’exécute presque tout dans pi avec Flash. Avec les bons serveurs MCP, des outils de réduction de contexte et des skills, on peut implémenter n’importe quelle tâche.
    Certaines sessions prennent plus de 30 tours, mais c’est rapide et bon marché : une heure de travail coûte environ 0,5 dollar. Cela dit, dans les workflows à plusieurs sous-agents, j’utilise aussi des modèles plus chers pour les rôles de planification, de revue et d’oracle.
    Je n’ai pas utilisé mon abonnement Opus, trop lent, depuis plusieurs semaines. J’ai aussi mis en place un chat OpenWebUI auto-hébergé qui fonctionne sur téléphone, prend en charge MCP et les skills, et remplace entièrement Perplexity ; l’hébergement et les abonnements coûtent environ 18 dollars par mois.

    • Moi aussi, j’ai ajouté à la combinaison pi + DeepSeek de nombreux outils personnalisés pour le suivi des tâches et l’économie de tokens, et je ne réserve les modèles de pointe qu’aux tâches très difficiles. Cette configuration couvre toutes les fonctionnalités dont j’ai besoin.
    • J’aimerais des recommandations d’extensions utilisables avec pi.
    • Je me demande s’il y a des améliorations perceptibles dans cette mise à jour.
    • Je me demande comment définir top_p et temperature dans pi.
  • Si les benchmarks reflètent correctement les performances en usage réel, c’est un modèle impressionnant. Un modèle 300B dépasse les performances du précédent modèle de préversion DS4 Pro à 1,8T paramètres, et semble même meilleur que GPT 5.6 Luna.
    Il reste moins cher que Luna après sa baisse de prix.

    • Sur DeepSWE, DeepSeek est à 54,4 %, contre 67 % pour Luna.
  • Qu’un modèle 200B rivalise avec GLM-5.2 et se rapproche d’Opus 4.8 est assez impressionnant.
    Si ces chiffres se traduisent aussi en performances généralistes, avec en plus l’excellente mise en cache de DeepSeek, l’usage risque de devenir très important.

    • Ce n’est pas seulement un modèle 200B : sa taille n’est que de 160 GiB.
  • Je me demande pourquoi ils ne pouvaient pas l’appeler v4.1-Flash pour le distinguer plus clairement.

  • S’il dépasse les performances de deepseek-v4-pro, qui était déjà tout à fait utilisable, tout en conservant sa vitesse et son faible prix, c’est très prometteur.
    deepseek-v4-flash était déjà le modèle au meilleur rapport performances/prix, donc l’écart devrait encore se creuser sur l’indicateur intelligence/coût. Cela dit, le faible coût de l’API DeepSeek se paie aussi par le transfert des informations de la base de code vers la Chine.

    • D’après au moins un benchmark, il serait meilleur que GLM 5.2.
  • Je me demande si une configuration avec Kimi K3 pour les tâches coûteuses au lieu d’Opus, et DSV4 Flash pour les tâches courantes au lieu de Sonnet, est raisonnable.

    • Une version mise à jour de deepseek-v4-pro devrait sortir bientôt, et vu l’ampleur des progrès de DSV4 Flash, elle pourrait dépasser Kimi K3 à la fois en intelligence et en coût.
    • C’est tout à fait raisonnable. Faire une heure de codage ou de vérification serveur avec DSV4 Flash coûte environ 0,30 dollar en pur coût API, et cela m’étonne à chaque fois.
    • Tu peux utiliser mon routeur de modèles pour basculer entre les deux modèles en arrière-plan.
  • Je suis curieux des cas d’usage de DSv4 dans des agents hors codage. J’aimerais notamment savoir comment les utilisateurs qui confiaient à GPT-5.4 mini des tâches de classification ou de catégorisation utilisent DSv4.