Modèles d’IA
Google lance Gemini 3.8 Flash et une version Cyber pour défenseurs de confiance
Google présente Gemini 3.8 Flash et Gemini 3.8 Flash Cyber, avec de meilleurs résultats en code et raisonnement et un modèle restreint pour détecter et corriger les vulnérabilités.
Google a présenté le 2 septembre Gemini 3.8 Flash et Gemini 3.8 Flash Cyber, en décrivant cette sortie comme une avancée pour le code sur longue durée, les workflows agentiques et la cybersécurité défensive. Le lancement arrive quelques semaines après Gemini 3.7 Flash et conserve le même prix d’introduction pour le modèle Flash général: 0,75 dollar par million de tokens d’entrée et 3,75 dollars par million de tokens de sortie jusqu’à fin 2026. Google affirme que le nouveau modèle améliore le raisonnement et le code sans changer le profil de vitesse et de coût qui rend Flash attractif en production.
Gemini 3.8 Flash vise les développeurs et les entreprises qui veulent un modèle moins coûteux capable d’utiliser des outils sur la durée. Google indique qu’il progresse par rapport à Gemini 3.7 Flash en génie logiciel, tâches agentiques et raisonnement spécialisé en plusieurs étapes. L’entreprise cite des gains sur DeepSWE v1.1, Vals Finance Agent V2, Harvey’s Legal Agent Benchmark et HLE-Verified, où elle rapporte un score de 54,9%. Le message est que le modèle n’est pas seulement un assistant rapide pour prompts courts, mais un système conçu pour poursuivre des tâches complexes, appeler des outils à répétition et consacrer davantage d’effort de raisonnement quand la situation l’exige.
La deuxième version, Gemini 3.8 Flash Cyber, est plus strictement encadrée. Google la décrit comme son modèle de cybersécurité le plus capable et dit qu’elle sera disponible pour des défenseurs de confiance via le nouveau Fairwind Program. Elle repose sur la même intelligence fondamentale que Gemini 3.8 Flash, mais elle est ajustée et déployée pour la découverte de vulnérabilités et le patching automatisé. Sur CyberGym, Google affirme que le modèle atteint un niveau frontière en découverte autonome de vulnérabilités. Dans un benchmark interne couvrant des bases de code complexes dans 20 langages, l’entreprise rapporte un taux de réussite supérieur à 70%.
Google met l’accent sur la défense plutôt que sur l’exploitation offensive. Gemini 3.8 Flash Cyber est conçu pour aider les équipes de sécurité à trouver, vérifier et corriger des vulnérabilités rapidement. Sur CWE-Bench, benchmark externe de patching opéré par Collinear, Google rapporte un pass@1 de 47,2%, proche des 47,8% d’un modèle frontière leader plus grand, mais à coût nettement inférieur. L’entreprise affirme aussi que l’équipe sécurité de Chrome a obtenu 2,6 fois plus de correctifs valides pour des vulnérabilités Chrome qu’avec de plus grands modèles commerciaux, tandis que Wiz a mesuré un meilleur rappel à coût plus faible sur un benchmark interne de tests d’intrusion.
Cette sortie illustre la manière dont les grands laboratoires d’IA traitent les capacités cyber comme une catégorie de déploiement à part. Gemini 3.8 Flash embarque des garde-fous contre les usages chimiques, biologiques, radiologiques, nucléaires et cyberoffensifs malveillants. Gemini 3.8 Flash Cyber est plus permissif pour les travaux de cybersécurité, mais réservé aux organisations que Google classe comme défenseurs de confiance. Google indique également que les modèles progressent fortement en robustesse face au prompt injection selon Gray Swan, un point important pour les agents qui lisent des documents, sites et codes non fiables.
Pour le marché, le lancement pousse les concurrents à rivaliser non seulement sur les scores de benchmark, mais aussi sur le coût, les contrôles d’accès et l’emballage opérationnel. Les développeurs peuvent utiliser Gemini 3.8 Flash dans Google AI Studio, l’API Gemini, Android Studio, Google Antigravity, Gemini Enterprise et des produits grand public comme l’application Gemini et AI Mode dans Search. Le modèle Cyber, lui, est traité comme une capacité plus sensible. Cette séparation pourrait devenir fréquente: accès large aux modèles généraux de raisonnement, versions spécialisées à fort impact distribuées par des canaux vérifiés.