2 points par kallare 5 시간 전 | 1 commentaires | Partager sur WhatsApp
  • Google lance de nouveaux modèles Gemini — 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber — conçus pour améliorer l’efficacité, la faible latence et la fiabilité du développement d’agents IA
  • Gemini 3.6 Flash offre de meilleures performances que 3.5 Flash en codage, tâches de connaissance et multimodalité, tout en réduisant l’usage de tokens de sortie et les coûts
  • Gemini 3.5 Flash-Lite est le modèle le plus rapide et le plus économique de la classe 3.5, adapté aux tâches à haut débit comme la recherche agentique et le traitement de documents
  • Gemini 3.5 Flash Cyber est un modèle spécialisé ajusté pour les vulnérabilités de cybersécurité, proposé via CodeMender dans le cadre d’un programme pilote à accès limité
  • Gemini 3.5 Pro sera bientôt déployé plus largement, et le développement de Gemini 4 est en cours

Résumé complémentaire GN⁺

Neo l’a synthétisé à partir de l’article original

  • Google présente des modèles généralistes, rapides et spécialisés en sécurité, visant l’efficacité en tokens, la latence et la stabilité nécessaires à la construction d’agents IA à grande échelle
  • 3.6 Flash utilise 17 % de tokens de sortie en moins que 3.5 Flash, réduit les étapes de raisonnement et le nombre d’appels d’outils, et est proposé à 1,50 $ par million de tokens d’entrée et 7,50 $ par million de tokens de sortie
  • 3.5 Flash-Lite fournit 350 tokens de sortie par seconde, à 0,3 $ par million de tokens d’entrée et 2,5 $ par million de tokens de sortie, et permet d’ajuster le niveau de raisonnement pour gérer les tâches massives et les sous-agents multi-étapes
  • 3.5 Flash Cyber détecte, vérifie et corrige les vulnérabilités dans la configuration multi-agents de CodeMender ; compte tenu des risques à double usage, il ne sera proposé qu’à des gouvernements et partenaires de confiance, de manière limitée
  • 3.6 Flash et 3.5 Flash-Lite sont disponibles via Gemini API, les plateformes d’entreprise et l’application Gemini ; Google mène aussi des tests partenaires de 3.5 Pro et le pré-entraînement de Gemini 4

Rôle des trois modèles

  • La famille Flash est conçue pour étendre les workflows agentiques en trouvant un équilibre entre efficacité et qualité des agents IA
  • 3.6 Flash est le modèle phare, avec des performances améliorées en codage, tâches de connaissance et multimodalité
    • Selon l’Artificial Analysis Index, il utilise 17 % de tokens de sortie en moins que 3.5 Flash
    • Sur certains benchmarks comme DeepSWE de Datacurve, l’usage de tokens baisse jusqu’à 65 %
    • Le prix par token de sortie est également inférieur à celui de 3.5 Flash
  • 3.5 Flash-Lite est le modèle le plus rapide et le plus économique de la série 3.5, tout en offrant de meilleures performances que les générations Flash-Lite précédentes dans les workflows agentiques
  • 3.5 Flash Cyber combine un modèle spécialisé en cybersécurité avec l’infrastructure d’agents CodeMender, avec pour objectif des performances compétitives face aux modèles de pointe
  • Gemini 3.5 Pro est en cours de test avec des partenaires et sera proposé largement dès qu’il sera prêt
  • L’exécution de pré-entraînement la plus ambitieuse à ce jour pour Gemini 4 a également démarré

Efficacité et prix de 3.6 Flash

  • En tenant compte des retours des développeurs et clients sur 3.5 Flash, Google a amélioré à la fois la qualité en codage et tâches de connaissance, ainsi que l’efficacité en tokens
  • Dans l’Artificial Analysis Index, il utilise 17 % de tokens de sortie en moins que 3.5 Flash, et réduit aussi le nombre d’étapes de raisonnement et d’appels d’outils nécessaires pour terminer des workflows multi-étapes
  • Le prix est de 1,50 $ par million de tokens d’entrée et de 7,50 $ par million de tokens de sortie
  • La combinaison d’une moindre consommation de tokens et d’un prix plus bas réduit le coût total par tâche agentique
  • Dans les tâches API vérifiées OSWorld, il utilise les tokens plus efficacement que 3.5 Flash tout en réduisant les sorties inutilement longues

Améliorations de qualité de 3.6 Flash

  • Pour les tâches de codage, il réduit les modifications de code indésirables et les boucles d’exécution, tout en améliorant la précision
    • DeepSWE : 49 %, contre 37 % pour 3.5 Flash
    • MLE Bench : 63,9 %, contre 49,7 % pour 3.5 Flash
  • Les capacités d’utilisation d’ordinateur progressent également
    • OSWorld-Verified : 83,0 %, contre 78,4 % pour 3.5 Flash
    • La fonctionnalité d’utilisation d’ordinateur est fournie comme outil intégré côté client dans Gemini API et Gemini Enterprise
  • Les performances sur les tâches de connaissance dépassent également celles de 3.5 Flash
    • GDPval-AA v2 : 1421, contre 1349 pour 3.5 Flash
    • Hebbia et Harvey ont validé ses capacités sur des tâches multimodales comme le parsing de documents, l’analyse de graphiques et de données, et la rédaction de rapports
  • Exemples d’utilisation
    • Analyser des données financières et des transcriptions avec les Managed Agents d’AIS
    • Réaliser des migrations de code de haute qualité avec une latence réduite grâce à l’orchestration multi-agents d’AGY
    • Développer un extracteur de textures photo pour workflows 3D avec canvas dans l’application Gemini
    • Construire un studio de thèmes interactif avec AGY et l’éditeur hors ligne tldraw

Garde-fous de 3.6 Flash

  • Des protections Frontier Safety renforcées sont appliquées aux domaines d’abus liés aux attaques chimiques, biologiques, radiologiques et nucléaires (CBRN) ainsi qu’aux cyberattaques
  • Le modèle a été entraîné pour accroître fortement sa résistance aux attaques de jailbreak, tout en minimisant les refus pour les usages utiles
  • Les détails sont disponibles dans la fiche modèle de 3.6 Flash

Vitesse et coût de 3.5 Flash-Lite

  • Conçu pour les workflows de développeurs nécessitant une faible latence ou un haut débit, comme la recherche agentique et le traitement de documents
  • Selon les mesures d’Artificial Analysis, c’est le plus rapide de la série 3.5 avec 350 tokens de sortie par seconde
  • Son prix est de 0,3 $ par million de tokens d’entrée et 2,5 $ par million de tokens de sortie, avec une qualité nettement améliorée par rapport à 3.1 Flash-Lite
  • Il permet d’exécuter des tâches massives avec une latence plus faible que 3.5 Flash
  • Le niveau de raisonnement peut être ajusté selon la charge de travail
    • Les niveaux minimal et low servent à réduire la latence et le coût des tâches à grande échelle
    • Les niveaux de raisonnement plus élevés traitent les charges de travail de sous-agents multi-étapes
  • La fonctionnalité d’utilisation d’ordinateur est aussi fournie comme outil intégré pour soutenir les tâches agentiques dans divers environnements

Benchmarks et usages de 3.5 Flash-Lite

  • Par rapport à 3.1 Flash-Lite, les performances progressent en codage, contexte long et exécution de tâches réelles
    • Terminal-Bench 2.1 : 54 %, contre 31 % pour 3.1 Flash-Lite
    • GDM-MRCR v2 : 72,2 %, contre 60,1 % pour 3.1 Flash-Lite
    • GDPval-AA v2 : 1140, contre 642 pour 3.1 Flash-Lite
  • Il dépasse également 3 Flash dans plusieurs évaluations agentiques et de codage
    • SWE-Bench Pro : 54,2 %, contre 49,6 % pour 3 Flash
    • OSWorld-Verified : 74,0 %, contre 65,1 % pour 3 Flash
    • Il peut constituer une option plus rapide et plus performante pour les charges de travail basées sur 2.5 Flash et 3 Flash
  • Exemples d’utilisation
    • Extraire et synthétiser des caractéristiques produit à partir de grands jeux de données e-commerce
    • Générer 25 concepts de design web explorables avec 3.6 Flash comme agent de niveau supérieur
    • Étendre la traduction et le résumé de reçus grâce à la compréhension multimodale
    • Construire un jeu en générant et itérant rapidement plusieurs options
  • Les détails sont disponibles dans la fiche modèle de 3.5 Flash-Lite

3.5 Flash Cyber dans CodeMender

  • Les modèles IA pouvant trouver des vulnérabilités plus vite que les systèmes existants ne peuvent être corrigés, la sécurité logicielle exige une approche à la fois très performante et efficace
  • Gemini 3.5 Flash Cyber est affiné à partir de 3.5 Flash pour la détection et la correction de vulnérabilités de sécurité
  • Il est conçu pour détecter, vérifier et corriger les problèmes de sécurité du code à un prix par token inférieur à celui des grands modèles
  • Dans CodeMender, plusieurs agents 3.5 Flash Cyber coopèrent pour produire un rapport unifié, et le modèle affiche des performances compétitives de niveau frontière sur le benchmark CyberGym
  • En raison du caractère à double usage de cette technologie, son déploiement est limité
    • Il sera proposé via CodeMender aux gouvernements et partenaires de confiance dans le cadre d’un pilote à accès restreint
    • L’approche vise à aider les défenseurs à détecter et corriger les vulnérabilités critiques avant leur exploitation, tout en réduisant les possibilités d’abus à grande échelle

Canaux de disponibilité

  • 3.6 Flash et 3.5 Flash-Lite sont disponibles dans plusieurs produits dès leur annonce
  • Les développeurs peuvent utiliser Gemini API dans Google AI Studio et Android Studio
  • Les entreprises peuvent y accéder via la Gemini Enterprise Agent Platform, et 3.6 Flash est aussi proposé dans l’application Gemini Enterprise
  • Les utilisateurs grand public peuvent y accéder dans l’application Gemini, et 3.5 Flash-Lite est également déployé progressivement dans Google Search
  • Google prévoit d’intégrer les retours utilisateurs dans les futures améliorations des modèles Gemini et de lancer bientôt 3.5 Pro

1 commentaires

 
GN⁺ 27 분 전
Avis sur Hacker News
  • Je me demande quelle est l’échelle du modèle Pro que Google utilise en interne pour entraîner ses petits modèles
    Si Pro ne sort pas en même temps que Flash, c’est peut-être parce que le modèle est trop gros pour être rentable, parce qu’il manque de ressources de calcul pour le servir, ou parce qu’il y a trop de problèmes d’alignement
    D’après les benchmarks, ses performances sont plutôt moyennes, mais c’est un modèle très rapide en intelligence par temps de travail et en intelligence par vitesse de sortie
    Le 3.5 Flash que j’ai essayé dans Antigravity est aussi un modèle sous-estimé quand on connaît son usage : il est bien meilleur que GPT-5.5 pour le front-end et permettait des itérations rapides, donc j’attends quelque chose de similaire de 3.6

    • Le grand modèle est très loin derrière ChatGPT 5.6 et Fable, donc Google se concentre peut-être sur la vitesse, là où il peut gagner
    • Une quatrième possibilité est que le grand modèle de Google soit même inférieur à K3 et GLM, et que Google ne le publie donc pas
      J’aime bien utiliser Gemini pour traiter d’un coup une MR entière avec un grand contexte, mais il est nettement moins bon pour l’usage d’outils et le codage agentique
    • Je me demande aussi si les aperçus IA de Google Search ont un impact. Utiliser les ressources de calcul pour des dizaines de milliards de recherches quotidiennes peut être plus rentable que vendre l’accès à l’API
    • Ils ne semblent plus réussir à faire progresser les benchmarks de pointe les plus récents ; au fond, cela ressemble surtout au fait de ne pas parvenir à battre GPT-5.6 et Fable
    • Je penche pour la deuxième raison : un manque de capacité de calcul. Faute de capacité Pro, il arrive souvent que Flash, avec la réflexion étendue activée, réponde à la place, et hors codage il est difficile de voir la différence entre les deux
  • Google semble s’être tiré une balle dans le pied alors qu’il était tout près de réussir avec ses produits IA
    La suppression de l’abonnement AI Ultra sans successeur approprié nous a forcés, mon entreprise comme moi, à quitter Antigravity. On ne peut pas associer un abonnement utilisateur avancé Google Workspace à l’IDE Antigravity, et Gemini Enterprise Agent Platform ne s’y intègre pas non plus
    Le processus de configuration de Gemini Enterprise Agent Platform est atroce, et pour limiter les dépenses par utilisateur il faut créer un projet pour chacun. Il est aussi aberrant qu’on ne puisse pas activer les modèles Anthropic sur un compte de facturation où il reste des crédits gratuits
    J’ai beaucoup soutenu Google et Gemini, mais à cause de décisions produit soudaines, j’ai fini par acheter moi-même les abonnements à 200 dollars par mois d’Anthropic et d’OpenAI

    • Leur obstination à séparer artificiellement les produits grand public et entreprise est très pénible. C’est étrange de pouvoir utiliser des outils plus puissants avec un compte Google personnel qu’avec un compte Google Workspace d’entreprise
    • Ils ont à la fois les ressources et la base d’utilisateurs existante pour mener cette technologie, mais continuent de rater des occasions. Désormais, ils ne benchmarkent même plus face à d’autres modèles, mais seulement leurs propres modèles entre eux, ce qui en dit déjà long
    • On en est encore aux débuts, et le leader a déjà changé plusieurs fois. Si n’importe quelle entreprise sort le prochain modèle frontière, le paysage peut de nouveau basculer
    • Les abonnements d’Anthropic et d’OpenAI sont peut-être des produits lourdement subventionnés et déficitaires. Alors que des modèles moins chers et comparables montrent qu’il est difficile de dégager du revenu par token, Google évite peut-être de participer à une guerre d’usure
    • Google Gemini agy empêche d’utiliser des tokens dans son propre outil d’exécution, alors que mon outil est bien plus efficace qu’agy. Il suffirait de bloquer les usages au-delà d’une limite, comme la limite de 5 heures ; si c’est efficace, l’utilisateur y gagne, et si c’est inefficace, il y perd
      C’était frustrant de ne pas pouvoir appeler directement l’endpoint qu’agy appelle, et j’ai même demandé à Gemini comment le contourner. Ironiquement, Gemini est si encourageant qu’il aide volontiers même à lutter contre le client agy, ce qui me le rend toujours sympathique
  • Il est décevant qu’il n’y ait aucune comparaison avec d’autres modèles, et je n’ai pas l’impression qu’ils aient repoussé la courbe de performance. 3.6 Flash semble plus cher que GLM 5.2 tout en étant moins performant, mais le billet manque aussi de détails
    À un moment, Google semblait vraiment accélérer, mais plus le temps passe, plus j’ai des doutes ; il faudra voir ce que donne 3.5 Pro

    • Les résultats de comparaison entre 3.6 Flash et Sol, Luna, Terra sont ici
    • Quand Apple a annoncé un contrat de plusieurs milliards de dollars avec Google pour Apple Intelligence, je m’attendais à de grandes avancées, mais les mauvaises nouvelles s’accumulent, comme le retard du modèle Pro et les départs dans le leadership IA. Je me demande si Apple sait quelque chose que les autres ignorent, ou s’ils regrettent déjà leur décision
    • Sur plusieurs benchmarks, il ressort à peu près au niveau de Opus 4.8 Medium ou Sonnet 5 High, et semble légèrement meilleur que GLM 5.2
    • Dans le benchmark Artificial Analysis, GLM produisait des sorties deux fois plus verbeuses, donc au final il coûtait plus cher
    • Le domaine où les modèles de Google excellent le plus était la correction dans les langues non anglophones. C’est probablement parce que Google dispose des ressources les plus complètes du Web, et donc de beaucoup de données d’entraînement
  • On peut voir les résultats « pélican » de 3.6 Flash et 3.5 Flash-Lite ici. Cyber n’est pas encore disponible via l’API

    • Les billets sur le pélican publiés à chaque nouveau modèle deviennent lassants, et ressemblent à de l’autopromotion à faible effort
    • Il manque une partie du cadre entre la pédale et la roue arrière, et le cadre du vélo traverse l’oiseau. Il a même ajouté un chapeau sur la tête de l’oiseau et un poisson dans son bec ; quand on demande à un LLM d’améliorer un premier résultat, ce genre d’éléments s’ajoute toujours
      Dans l’évolution des LLM, « meilleur » semble de plus en plus signifier ajouter davantage d’éléments ; je me demande si c’est le résultat d’un apprentissage du raisonnement qui récompense plus de tokens et plus d’éléments
    • Je me demande si le pélican de 3.1 Flash-Lite n’est pas meilleur que celui de 3.6
    • J’ai généré un pélican très soigné dans l’application Web, mais il est difficile de l’évaluer relativement aux résultats existants
    • Publier la même chose sous chaque billet sur l’IA ressemble à trop d’autopromotion et à du spam
  • Les prix par million de tokens en entrée/sortie sont les suivants
    2.5 Flash est à 0,3 $/2,5 $, 3.0 Flash à 0,5 $/3 $, 3.5 Flash à 1,5 $/9 $, et 3.6 Flash à 1,5 $/7,5 $
    2.5 Flash-Lite est à 0,1 $/0,4 $, 3.1 Flash-Lite à 0,25 $/1,5 $, et 3.5 Flash-Lite à 0,3 $/2,5 $

    • Si 3.6 Flash avait été au prix de 3.0 Flash, cela aurait été excellent, mais au tarif actuel il se fait largement distancer en rapport performance/prix par une dizaine de modèles, dont Grok 4.5. 3.5 Flash-Lite ne serait compétitif qu’au prix de 2.5 Flash-Lite ; en l’état, il est derrière DeepSeek v4 Flash et d’autres
      Le domaine où Gemini fait vraiment mieux que sa catégorie, ce sont en pratique les tâches de connaissance du type « cherche-moi ça sur Google », donc il a tout de même des cas d’usage. Google est solide dans l’ensemble, mais ses modèles texte sont en deuxième division ; en sciences de la vie, image et vidéo, il est en première division
    • 3.5 Flash était trop cher dès le départ pour un modèle Flash. Il a été présenté comme d’un niveau proche du frontier, mais des modèles publics plusieurs ordres de grandeur moins chers peuvent rivaliser
    • Google semble être l’acteur dont les variations de prix sont les plus fortes à chaque changement de génération de modèle
    • Je payais chaque mois à Google des montants à quatre chiffres à cause de 2.5 Flash, mais même si j’utilise maintenant 3.0 Flash, j’ai l’impression qu’il sera bientôt remplacé. Les modèles Flash-Lite manquent de fiabilité et de cohérence
  • Google indique tester Gemini 3.5 Pro avec des partenaires et prévoit de le rendre largement disponible dès qu’il sera prêt ; l’entreprise dit aussi avoir lancé son pré-entraînement le plus ambitieux à ce jour pour Gemini 4

    • C’est bien qu’ils aient corrigé l’inflation de tokens de 3.5 Flash, mais ce paragraphe est le vrai point clé. J’espère que 3.5 Pro sortira bientôt, que Gemini 4 arrivera en fin d’année et que la date limite des connaissances sera aussi mise à jour
    • À l’origine, ils voulaient probablement sortir 3.5 Pro juste après 3.5 Flash, mais comme Mythos/Fable et GPT-5.6 sont arrivés avec de meilleures performances, je suppose que la direction a retenu la publication
  • Moins intelligent et plus cher que GLM-5.2, avec des poids non publics

    • Comme il prend aussi en charge la vision et l’audio, il est plus pertinent de le comparer aux autres grands modèles ouverts chinois, meilleurs et moins chers que Gemini Flash
    • Les modèles Google ont toujours une expression fluide et sont bien plus agréables en conversation. J’ai aussi beaucoup utilisé des modèles à poids ouverts, mais cette différence est nette
    • En revanche, la vitesse est environ 15 fois supérieure
    • Le prix et l’intelligence sont à peu près comparables à GLM 5.2, tout en étant environ 8 fois plus rapide
  • Dépendre des modèles Google fait peur. Je faisais tourner les tâches très sensibles au prix sur Flash 2.5 Lite, mais il n’est désormais plus pris en charge, et son remplaçant, 3.1 Flash-Lite, est beaucoup plus cher tout en ayant déjà une date de fin annoncée
    3.5 Flash-Lite étant encore plus cher, on n’a pas vraiment le choix que de suivre, même si les prix continuent d’augmenter

    • Je suis passé directement de 2.5 Flash-Lite à DeepSeek v4 Flash. Il est déjà moins cher, et avec un bon usage du prompt caching on peut réduire les coûts beaucoup plus encore
    • Depuis Firebase, j’essaie d’éviter de dépendre des produits Google dans mes activités, surtout de GCP. Les fonctionnalités restent pendant des années en bêta avec une utilité peu claire, et celles lancées officiellement sont vite abandonnées
      Les concurrents, même lorsqu’ils abandonnent un service, se contentent en général de le retirer de la page d’accueil, de mettre des avertissements partout dans la documentation et de déconseiller poliment son usage pour les nouveaux projets
    • Remplacer un modèle n’est pas un gros effort, et on peut trouver des modèles moins chers que 2.5 Lite à niveau d’intelligence équivalent
    • Les grandes entreprises préfèrent traiter avec d’autres grandes entreprises plutôt qu’avec de jeunes sociétés. Google semble considérer que ce type de décision reste acceptable grâce à cette préférence des clients entreprise
    • Je me demande si c’est un environnement où DeepSeek ne peut pas être utilisé
  • Toujours pas de nouvelles d’une mise à jour de Jules, qui est encore bloqué sur 3.1 Pro. C’est peut-être un produit de niche, mais il était utile pour des projets perso dans les trajets domicile-travail, quand il est difficile de sortir un ordinateur portable : on pouvait donner une consigne depuis le téléphone puis, 15 minutes plus tard, relire et merger une PR GitHub
    Je cherche une bonne alternative

    • Claude comme Codex prennent tous deux en charge le cloud coding et fonctionnent plutôt bien. Jules est une bonne idée, mais l’intelligence du modèle était très insuffisante
    • Je me demandais si Jules était un projet mort. Il avait l’air intéressant, mais il y avait très peu de développement, d’annonces ou de discussions, et la dernière mise à jour du changelog remonte à mars avec la prise en charge de 3.1 Pro
    • Superconductor, que j’ai essayé il y a quelques mois, m’a fait penser à Jules. Les fonctionnalités sont peut-être excessives, mais il existe une offre gratuite et il semble peu probable qu’il soit abandonné bientôt
    • Si l’on dispose d’un appareil comme un Raspberry Pi, on peut utiliser la combinaison Hermes + Tailscale + iSH sur tmux
    • Claude Code est une alternative
  • Je ne comprends pas pourquoi Gemini Web ne prend toujours pas en charge les connecteurs, MCP et plugins. Pour un usage sérieux, c’est éliminatoire dès le départ