Modèles et plateformes d’IA

Google annonce le modèle de pointe Gemini 4 Argon pour le codage et la défense cyber

mm
Ajouter Unite.AI à vos sources préférées sur Google

Google a annoncé Gemini 4 Argon le 30 septembre 2026, le décrivant comme le nouveau modèle de pointe de l’entreprise pour l’ingénierie logicielle réelle, le travail de connaissance en entreprise tel que le juridique et la finance, ainsi que la défense en cybersécurité. Le modèle est d’abord déployé auprès des défenseurs cyber de confiance via le programme Fairwind de Google, à un prix d’introduction de 2 $ par million de jetons d’entrée.

In un article sur The Keyword, Koray Kavukcuoglu, SVP de Google DeepMind et Chief AI Architect chez Google, a déclaré que la diffusion sécurisée de capacités de pointe à ce niveau nécessite une approche progressive. Google participe activement au processus volontaire du gouvernement américain d’accès pré‑release aux modèles tout en élargissant progressivement l’accès, et a indiqué qu’il continuera à recueillir les retours des premiers testeurs lors de l’itération des garde‑fous.

Le tarif d’introduction d’Argon est de 2 $ par million de jetons d’entrée et de 10 $ par million de jetons de sortie, les jetons d’entrée en cache étant proposés avec une remise de 95 % sur le prix des jetons d’entrée. Une note de bas de page dans l’annonce indique qu’après l’expiration de la période d’introduction, le prix sera de 4 $ par million de jetons d’entrée et de 20 $ par million de jetons de sortie.

Déploiement interne et limites de sortie étendues

Google a indiqué qu’Argon alimente déjà les flux de travail internes, des milliers d’employés soulignant les points forts du modèle dans les tâches de codage spécialisées, la conduite de recherches plus approfondies et la rédaction de qualité. L’entreprise a présenté plusieurs exemples issus de ce déploiement. Argon aide les chercheurs en informatique quantique de Google à optimiser les ressources spatio‑temporelles (qubits × portes) des sous‑routines qui constituent des goulets d’étranglement pour des applications importantes ; dans un exemple, il a dépassé la référence publiée de 40 % en quelques minutes. Une équipe d’agents Argon a analysé la télémétrie de profilage à l’échelle du parc pour identifier et appliquer de façon autonome des optimisations de mémoire dans les centres de données de Google, libérant plus de 300 TiB de mémoire après le déploiement, avec une économie estimée entre 500 TiB et 1 PiB au total.

Google a déclaré que les agents Argon migrent également les bases de code C/C++ vers Rust dans l’ensemble de l’entreprise, passant de dizaines de milliers de lignes dans des bibliothèques de base comme re2 et libgav1 à plus de 800 k lignes pour le noyau Zircon de Fuchsia OS. Étant donné la criticité de nombre de ces systèmes, les réécritures à grande échelle font l’objet d’audits automatisés et manuels rigoureux, de tests d’émulation et de revues avant leur mise en production.

Pour libgav1, le logiciel open source de décodage vidéo de Google, les agents Argon ont repris un port Rust existant et remplacé 32 k lignes de code SIMD en exécutant plusieurs cycles d’expériences guidées par le profilage et en étudiant la sortie du compilateur. Google a indiqué que le résultat est un décodeur vidéo sécurisé au niveau de la mémoire, fonctionnant 2,7 fois plus rapidement que le port Rust, avec une sortie vidéo identique.

Pour prendre en charge des cas d’utilisation plus longs et plus complexes, Google a porté la limite de jetons de sortie du modèle à 1 M de jetons, contre 64 k jetons auparavant, un chiffre que l’entreprise qualifie de leader du secteur.

Benchmarks d’entreprise et défense en cybersécurité

Google indique qu’Argon établit un nouveau niveau d’excellence sur DeepSWE v1.1 avec un score de 77,9 %, une référence mesurant les performances sur des tâches d’ingénierie logicielle à long terme dans le monde réel. L’entreprise décrit Argon comme le modèle leader sur le Vals Index, qui mesure l’impact économique dans la finance, le codage, le juridique et le travail fiscal, chaque secteur étant pondéré selon sa contribution au PIB des États‑Unis, et rapporte des performances également leaders sur Vals Finance Agent v2 pour la recherche financière multi‑étapes et le Harvey’s Legal Agent Benchmark pour la recherche et la rédaction juridiques.

Sur AutomationBench, la référence de Zapier mesurant l’exécution de bout en bout des fonctions commerciales principales, Google indique qu’Argon se classe premier avec un score de 51,3 %. Sur LVBench, qui mesure la compréhension de longues vidéos, l’entreprise rapporte un score de pointe de 91,7 % et affirme qu’Argon peut réaliser des analyses de graphiques professionnelles, identifier des détails dans de longues vidéos et agir à partir d’une série de documents.

Google a déclaré avoir entraîné Argon à détecter, valider et corriger de façon autonome les vulnérabilités logicielles critiques, et il publiera le modèle sans garde‑fous cyber aux défenseurs de confiance ainsi qu’à ses propres équipes internes. Wiz utilise déjà Argon via son initiative Scan for Good, un programme dédié à la protection gratuite des infrastructures publiques critiques en détectant et en remédiant aux expositions à haut risque. Google a indiqué que le modèle a découvert une vulnérabilité critique exposant des informations personnelles sensibles dans les logiciels de santé utilisés par les hôpitaux du monde entier, identifiant un risque sévère que les modèles de pointe précédents n’avaient pas détecté.

Sur CWE‑bench v1, qui évalue la capacité d’un modèle à remédier aux vulnérabilités de sécurité, Google indique qu’Argon partage la première place avec un score maximal de 68 %. L’entreprise a déclaré qu’Argon a également découvert des expositions dans des bases de code complexes couvrant 20 langages de programmation sur son benchmark interne de vulnérabilités, et qu’il a surpassé Gemini 3.8 Flash Cyber dans le benchmark interne de test d’intrusion en boîte noire de Wiz, qui teste la capacité d’un modèle à analyser des systèmes web en direct sans code source.

Le programme Fairwind, lancé par Google le 2 septembre 2026, est un programme à accès limité destiné aux gouvernements et aux partenaires de confiance afin d’utiliser les outils de défense cybernétique de l’entreprise. Les organisations participantes acceptent des normes opérationnelles qui incluent la limitation d’accès aux employés des équipes de cybersécurité interne, de réponse aux incidents ou de tests d’intrusion, ainsi que le déploiement de protections telles que l’authentification multifacteur. Google a indiqué que le programme compte plus de 650 partenaires participants à l’échelle mondiale, et que sa première offre a couplé Gemini 3.8 Flash Cyber avec le harnais CodeMender pour aider les défenseurs à identifier, vérifier et corriger les vulnérabilités.

Sauvegardes de frontière et déploiement progressif

Google a déclaré renforcer les sauvegardes de frontière dans quatre domaines avant la disponibilité généralisée d’Argon. Pour la défense contre les abus, le modèle est conçu pour refuser les demandes cybernétiques nuisibles ainsi que les requêtes chimiques, biologiques, radiologiques et nucléaires, tout en préservant la recherche scientifique à double usage légitime dans le cadre du Frontier Safety Framework de Google. L’entreprise a indiqué qu’elle améliore ses techniques de surveillance des activations internes du modèle afin de détecter les abus, et que les sauvegardes ont fait l’objet de tests de robustesse réalisés par des équipes rouges internes et externes utilisant des méthodes d’attaque manuelles et automatisées.

Google décrit Argon comme son modèle le plus résilient à ce jour face à l’injection indirecte d’instructions, où des consignes ou un contexte malveillants sont utilisés pour détourner le comportement du modèle, et rapporte une robustesse de premier plan sur le benchmark Indirect Prompt Injection de Gray Swan grâce à un red teaming automatisé et à un entraînement adversarial.

L’entreprise déploie également des mesures d’atténuation des désalignements qui surveillent la chaîne de pensée et les actions d’Argon et interrompent l’exécution lorsque cela est nécessaire. Google a indiqué qu’un système similaire surveillait ses sessions d’entraînement et envoyait des alertes à une équipe dédiée de réponse aux incidents, avec des précautions rigoureuses pour éviter de réintégrer les découvertes dans l’entraînement. Enfin, Google a affirmé renforcer ses environnements sandboxés en les isolant et les scellant avant le début d’entraînements ou d’évaluations à haut risque, conformément à sa feuille de route de contrôle des agents.

Google a déclaré que les retours du premier groupe de défenseurs cybernétiques et de testeurs de confiance l’aideront à renforcer ses systèmes avant qu’Argon ne soit mis à la disposition des développeurs, des entreprises et des consommateurs, en commençant par les clients API payants et les abonnés Google AI Ultra, dès que possible.

Jonas Reeve est un analyste généré par IA chez Unite.AI, spécialisé dans l'IA cognitive, l'intelligence artificielle générale (IAG) et les fondements théoriques de l'intelligence des machines. Son travail explore comment l'apprentissage, le raisonnement, la mémoire et l'abstraction émergent à la fois dans les systèmes biologiques et artificiels, établissant des liens entre les architectures d'IA modernes et les questions de longue date en sciences cognitives et en philosophie de l'esprit.

Avec une approche conceptuelle et réflexive, Jonas examine des cadres tels que les modèles de raisonnement, les systèmes agentiques, la cognition émergente et la théorie de l'alignement, visant à clarifier ce que signifie réellement le progrès vers l'IAG — et ce qu'il ne signifie pas. Plutôt que de courir après des échéances ou le battage médiatique, il met l'accent sur les premiers principes, la rigueur conceptuelle et les limites des modèles actuels.

Les articles rédigés par Jonas Reeve sont générés par IA et revus par l'équipe éditoriale de Unite.AI afin d'assurer précision, clarté et discussion responsable des concepts avancés d'IA.