- Google lance de nouveaux modèles Gemini — 3.6 Flash, 3.5 Flash-Lite et 3.5 Flash Cyber — conçus pour améliorer l’efficacité, la faible latence et la fiabilité du développement d’agents IA
- Gemini 3.6 Flash offre de meilleures performances que 3.5 Flash en codage, tâches de connaissance et multimodalité, tout en réduisant l’usage de tokens de sortie et les coûts
- Gemini 3.5 Flash-Lite est le modèle le plus rapide et le plus économique de la classe 3.5, adapté aux tâches à haut débit comme la recherche agentique et le traitement de documents
- Gemini 3.5 Flash Cyber est un modèle spécialisé ajusté pour les vulnérabilités de cybersécurité, proposé via CodeMender dans le cadre d’un programme pilote à accès limité
- Gemini 3.5 Pro sera bientôt déployé plus largement, et le développement de Gemini 4 est en cours
Résumé complémentaire GN⁺
Neo l’a synthétisé à partir de l’article original
- Google présente des modèles généralistes, rapides et spécialisés en sécurité, visant l’efficacité en tokens, la latence et la stabilité nécessaires à la construction d’agents IA à grande échelle
- 3.6 Flash utilise 17 % de tokens de sortie en moins que 3.5 Flash, réduit les étapes de raisonnement et le nombre d’appels d’outils, et est proposé à 1,50 $ par million de tokens d’entrée et 7,50 $ par million de tokens de sortie
- 3.5 Flash-Lite fournit 350 tokens de sortie par seconde, à 0,3 $ par million de tokens d’entrée et 2,5 $ par million de tokens de sortie, et permet d’ajuster le niveau de raisonnement pour gérer les tâches massives et les sous-agents multi-étapes
- 3.5 Flash Cyber détecte, vérifie et corrige les vulnérabilités dans la configuration multi-agents de CodeMender ; compte tenu des risques à double usage, il ne sera proposé qu’à des gouvernements et partenaires de confiance, de manière limitée
- 3.6 Flash et 3.5 Flash-Lite sont disponibles via Gemini API, les plateformes d’entreprise et l’application Gemini ; Google mène aussi des tests partenaires de 3.5 Pro et le pré-entraînement de Gemini 4
Rôle des trois modèles
- La famille Flash est conçue pour étendre les workflows agentiques en trouvant un équilibre entre efficacité et qualité des agents IA
- 3.6 Flash est le modèle phare, avec des performances améliorées en codage, tâches de connaissance et multimodalité
- Selon l’Artificial Analysis Index, il utilise 17 % de tokens de sortie en moins que 3.5 Flash
- Sur certains benchmarks comme DeepSWE de Datacurve, l’usage de tokens baisse jusqu’à 65 %
- Le prix par token de sortie est également inférieur à celui de 3.5 Flash
- 3.5 Flash-Lite est le modèle le plus rapide et le plus économique de la série 3.5, tout en offrant de meilleures performances que les générations Flash-Lite précédentes dans les workflows agentiques
- 3.5 Flash Cyber combine un modèle spécialisé en cybersécurité avec l’infrastructure d’agents CodeMender, avec pour objectif des performances compétitives face aux modèles de pointe
- Gemini 3.5 Pro est en cours de test avec des partenaires et sera proposé largement dès qu’il sera prêt
- L’exécution de pré-entraînement la plus ambitieuse à ce jour pour Gemini 4 a également démarré
Efficacité et prix de 3.6 Flash
- En tenant compte des retours des développeurs et clients sur 3.5 Flash, Google a amélioré à la fois la qualité en codage et tâches de connaissance, ainsi que l’efficacité en tokens
- Dans l’Artificial Analysis Index, il utilise 17 % de tokens de sortie en moins que 3.5 Flash, et réduit aussi le nombre d’étapes de raisonnement et d’appels d’outils nécessaires pour terminer des workflows multi-étapes
- Le prix est de 1,50 $ par million de tokens d’entrée et de 7,50 $ par million de tokens de sortie
- La combinaison d’une moindre consommation de tokens et d’un prix plus bas réduit le coût total par tâche agentique
- Dans les tâches API vérifiées OSWorld, il utilise les tokens plus efficacement que 3.5 Flash tout en réduisant les sorties inutilement longues
Améliorations de qualité de 3.6 Flash
- Pour les tâches de codage, il réduit les modifications de code indésirables et les boucles d’exécution, tout en améliorant la précision
- DeepSWE : 49 %, contre 37 % pour 3.5 Flash
- MLE Bench : 63,9 %, contre 49,7 % pour 3.5 Flash
- Les capacités d’utilisation d’ordinateur progressent également
- OSWorld-Verified : 83,0 %, contre 78,4 % pour 3.5 Flash
- La fonctionnalité d’utilisation d’ordinateur est fournie comme outil intégré côté client dans Gemini API et Gemini Enterprise
- Les performances sur les tâches de connaissance dépassent également celles de 3.5 Flash
- GDPval-AA v2 : 1421, contre 1349 pour 3.5 Flash
- Hebbia et Harvey ont validé ses capacités sur des tâches multimodales comme le parsing de documents, l’analyse de graphiques et de données, et la rédaction de rapports
- Exemples d’utilisation
- Analyser des données financières et des transcriptions avec les Managed Agents d’AIS
- Réaliser des migrations de code de haute qualité avec une latence réduite grâce à l’orchestration multi-agents d’AGY
- Développer un extracteur de textures photo pour workflows 3D avec canvas dans l’application Gemini
- Construire un studio de thèmes interactif avec AGY et l’éditeur hors ligne tldraw
Garde-fous de 3.6 Flash
- Des protections Frontier Safety renforcées sont appliquées aux domaines d’abus liés aux attaques chimiques, biologiques, radiologiques et nucléaires (CBRN) ainsi qu’aux cyberattaques
- Le modèle a été entraîné pour accroître fortement sa résistance aux attaques de jailbreak, tout en minimisant les refus pour les usages utiles
- Les détails sont disponibles dans la fiche modèle de 3.6 Flash
Vitesse et coût de 3.5 Flash-Lite
- Conçu pour les workflows de développeurs nécessitant une faible latence ou un haut débit, comme la recherche agentique et le traitement de documents
- Selon les mesures d’Artificial Analysis, c’est le plus rapide de la série 3.5 avec 350 tokens de sortie par seconde
- Son prix est de 0,3 $ par million de tokens d’entrée et 2,5 $ par million de tokens de sortie, avec une qualité nettement améliorée par rapport à 3.1 Flash-Lite
- Il permet d’exécuter des tâches massives avec une latence plus faible que 3.5 Flash
- Le niveau de raisonnement peut être ajusté selon la charge de travail
- Les niveaux minimal et low servent à réduire la latence et le coût des tâches à grande échelle
- Les niveaux de raisonnement plus élevés traitent les charges de travail de sous-agents multi-étapes
- La fonctionnalité d’utilisation d’ordinateur est aussi fournie comme outil intégré pour soutenir les tâches agentiques dans divers environnements
Benchmarks et usages de 3.5 Flash-Lite
- Par rapport à 3.1 Flash-Lite, les performances progressent en codage, contexte long et exécution de tâches réelles
- Terminal-Bench 2.1 : 54 %, contre 31 % pour 3.1 Flash-Lite
- GDM-MRCR v2 : 72,2 %, contre 60,1 % pour 3.1 Flash-Lite
- GDPval-AA v2 : 1140, contre 642 pour 3.1 Flash-Lite
- Il dépasse également 3 Flash dans plusieurs évaluations agentiques et de codage
- SWE-Bench Pro : 54,2 %, contre 49,6 % pour 3 Flash
- OSWorld-Verified : 74,0 %, contre 65,1 % pour 3 Flash
- Il peut constituer une option plus rapide et plus performante pour les charges de travail basées sur 2.5 Flash et 3 Flash
- Exemples d’utilisation
- Extraire et synthétiser des caractéristiques produit à partir de grands jeux de données e-commerce
- Générer 25 concepts de design web explorables avec 3.6 Flash comme agent de niveau supérieur
- Étendre la traduction et le résumé de reçus grâce à la compréhension multimodale
- Construire un jeu en générant et itérant rapidement plusieurs options
- Les détails sont disponibles dans la fiche modèle de 3.5 Flash-Lite
3.5 Flash Cyber dans CodeMender
- Les modèles IA pouvant trouver des vulnérabilités plus vite que les systèmes existants ne peuvent être corrigés, la sécurité logicielle exige une approche à la fois très performante et efficace
- Gemini 3.5 Flash Cyber est affiné à partir de 3.5 Flash pour la détection et la correction de vulnérabilités de sécurité
- Il est conçu pour détecter, vérifier et corriger les problèmes de sécurité du code à un prix par token inférieur à celui des grands modèles
- Dans CodeMender, plusieurs agents 3.5 Flash Cyber coopèrent pour produire un rapport unifié, et le modèle affiche des performances compétitives de niveau frontière sur le benchmark CyberGym
- En raison du caractère à double usage de cette technologie, son déploiement est limité
- Il sera proposé via CodeMender aux gouvernements et partenaires de confiance dans le cadre d’un pilote à accès restreint
- L’approche vise à aider les défenseurs à détecter et corriger les vulnérabilités critiques avant leur exploitation, tout en réduisant les possibilités d’abus à grande échelle
Canaux de disponibilité
- 3.6 Flash et 3.5 Flash-Lite sont disponibles dans plusieurs produits dès leur annonce
- Les développeurs peuvent utiliser Gemini API dans Google AI Studio et Android Studio
- 3.6 Flash est également disponible dans Google Antigravity
- Les détails d’implémentation sont disponibles dans le Developer Guide
- Les entreprises peuvent y accéder via la Gemini Enterprise Agent Platform, et 3.6 Flash est aussi proposé dans l’application Gemini Enterprise
- Les utilisateurs grand public peuvent y accéder dans l’application Gemini, et 3.5 Flash-Lite est également déployé progressivement dans Google Search
- Google prévoit d’intégrer les retours utilisateurs dans les futures améliorations des modèles Gemini et de lancer bientôt 3.5 Pro
1 commentaires
Avis sur Hacker News
Je me demande quelle est l’échelle du modèle Pro que Google utilise en interne pour entraîner ses petits modèles
Si Pro ne sort pas en même temps que Flash, c’est peut-être parce que le modèle est trop gros pour être rentable, parce qu’il manque de ressources de calcul pour le servir, ou parce qu’il y a trop de problèmes d’alignement
D’après les benchmarks, ses performances sont plutôt moyennes, mais c’est un modèle très rapide en intelligence par temps de travail et en intelligence par vitesse de sortie
Le 3.5 Flash que j’ai essayé dans Antigravity est aussi un modèle sous-estimé quand on connaît son usage : il est bien meilleur que GPT-5.5 pour le front-end et permettait des itérations rapides, donc j’attends quelque chose de similaire de 3.6
J’aime bien utiliser Gemini pour traiter d’un coup une MR entière avec un grand contexte, mais il est nettement moins bon pour l’usage d’outils et le codage agentique
Google semble s’être tiré une balle dans le pied alors qu’il était tout près de réussir avec ses produits IA
La suppression de l’abonnement AI Ultra sans successeur approprié nous a forcés, mon entreprise comme moi, à quitter Antigravity. On ne peut pas associer un abonnement utilisateur avancé Google Workspace à l’IDE Antigravity, et Gemini Enterprise Agent Platform ne s’y intègre pas non plus
Le processus de configuration de Gemini Enterprise Agent Platform est atroce, et pour limiter les dépenses par utilisateur il faut créer un projet pour chacun. Il est aussi aberrant qu’on ne puisse pas activer les modèles Anthropic sur un compte de facturation où il reste des crédits gratuits
J’ai beaucoup soutenu Google et Gemini, mais à cause de décisions produit soudaines, j’ai fini par acheter moi-même les abonnements à 200 dollars par mois d’Anthropic et d’OpenAI
C’était frustrant de ne pas pouvoir appeler directement l’endpoint qu’agy appelle, et j’ai même demandé à Gemini comment le contourner. Ironiquement, Gemini est si encourageant qu’il aide volontiers même à lutter contre le client agy, ce qui me le rend toujours sympathique
Il est décevant qu’il n’y ait aucune comparaison avec d’autres modèles, et je n’ai pas l’impression qu’ils aient repoussé la courbe de performance. 3.6 Flash semble plus cher que GLM 5.2 tout en étant moins performant, mais le billet manque aussi de détails
À un moment, Google semblait vraiment accélérer, mais plus le temps passe, plus j’ai des doutes ; il faudra voir ce que donne 3.5 Pro
On peut voir les résultats « pélican » de 3.6 Flash et 3.5 Flash-Lite ici. Cyber n’est pas encore disponible via l’API
Dans l’évolution des LLM, « meilleur » semble de plus en plus signifier ajouter davantage d’éléments ; je me demande si c’est le résultat d’un apprentissage du raisonnement qui récompense plus de tokens et plus d’éléments
Les prix par million de tokens en entrée/sortie sont les suivants
2.5 Flash est à 0,3 $/2,5 $, 3.0 Flash à 0,5 $/3 $, 3.5 Flash à 1,5 $/9 $, et 3.6 Flash à 1,5 $/7,5 $
2.5 Flash-Lite est à 0,1 $/0,4 $, 3.1 Flash-Lite à 0,25 $/1,5 $, et 3.5 Flash-Lite à 0,3 $/2,5 $
Le domaine où Gemini fait vraiment mieux que sa catégorie, ce sont en pratique les tâches de connaissance du type « cherche-moi ça sur Google », donc il a tout de même des cas d’usage. Google est solide dans l’ensemble, mais ses modèles texte sont en deuxième division ; en sciences de la vie, image et vidéo, il est en première division
Google indique tester Gemini 3.5 Pro avec des partenaires et prévoit de le rendre largement disponible dès qu’il sera prêt ; l’entreprise dit aussi avoir lancé son pré-entraînement le plus ambitieux à ce jour pour Gemini 4
Moins intelligent et plus cher que GLM-5.2, avec des poids non publics
Dépendre des modèles Google fait peur. Je faisais tourner les tâches très sensibles au prix sur Flash 2.5 Lite, mais il n’est désormais plus pris en charge, et son remplaçant, 3.1 Flash-Lite, est beaucoup plus cher tout en ayant déjà une date de fin annoncée
3.5 Flash-Lite étant encore plus cher, on n’a pas vraiment le choix que de suivre, même si les prix continuent d’augmenter
Les concurrents, même lorsqu’ils abandonnent un service, se contentent en général de le retirer de la page d’accueil, de mettre des avertissements partout dans la documentation et de déconseiller poliment son usage pour les nouveaux projets
Toujours pas de nouvelles d’une mise à jour de Jules, qui est encore bloqué sur 3.1 Pro. C’est peut-être un produit de niche, mais il était utile pour des projets perso dans les trajets domicile-travail, quand il est difficile de sortir un ordinateur portable : on pouvait donner une consigne depuis le téléphone puis, 15 minutes plus tard, relire et merger une PR GitHub
Je cherche une bonne alternative
Je ne comprends pas pourquoi Gemini Web ne prend toujours pas en charge les connecteurs, MCP et plugins. Pour un usage sérieux, c’est éliminatoire dès le départ