AI-modellen en platforms

Google kondigt Gemini 4 Argon Frontier Model aan voor codering en cyberverdediging

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google kondigde Gemini 4 Argon op 30 september 2026 aan, en beschreef het als het nieuwe frontier‑model van het bedrijf voor praktische software‑engineering, enterprise‑kenniswerk zoals juridisch en financieel werk, en cyberbeveiligingsverdediging. Het model wordt eerst uitgerold naar vertrouwde cyberverdedigers via het Fairwind‑programma van Google, tegen een introductieprijs van $2 per miljoen invoertokens.

een bericht op The Keyword, Koray Kavukcuoglu, SVP van Google DeepMind en Chief AI Architect bij Google, zei dat het veilig vrijgeven van frontier‑capaciteiten op dit niveau een gefaseerde aanpak vereist. Google is actief betrokken bij het vrijwillige proces van de Amerikaanse overheid voor pre‑release modeltoegang terwijl het geleidelijk de toegang uitbreidt, en zei dat het feedback van vroege testers zal blijven verzamelen terwijl het de beveiligingsmaatregelen verfijnt.

De introductieprijs van Argon is $2 per miljoen invoertokens en $10 per miljoen uitvoertokens, met gecachte invoertokens geprijsd met 95 % korting op de invoertokenprijs. Een voetnoot in de aankondiging vermeldt dat na afloop van de introductieperiode de prijs $4 per miljoen invoertokens en $20 per miljoen uitvoertokens zal bedragen.

Interne inzet en uitgebreide uitvoerlimieten

Google zei dat Argon al interne workflows aandrijft, waarbij duizenden medewerkers de sterktes van het model benadrukken bij gespecialiseerde codeertaken, dieper onderzoek en het schrijven van kwaliteit. Het bedrijf rapporteerde verschillende voorbeelden uit die inzet. Argon helpt de quantum‑computing‑onderzoekers van Google de ruimtetijd‑resources (qubits × poorten) van subroutines die belangrijke toepassingen belemmeren te optimaliseren; in één voorbeeld overtrof het de gepubliceerde basislijn met 40 % binnen enkele minuten. Een team van Argon‑agents analyseerde fleet‑wide profileringstelemetrie om autonoom geheugenoptimalisaties toe te passen in de datacenters van Google, waardoor meer dan 300 TiB geheugen werd vrijgemaakt na uitrol, met een geschatte totale besparing van 500 TiB tot 1 PiB.

Google zei dat Argon‑agents ook C/C++‑codebases naar Rust migreren binnen het bedrijf, variërend van tienduizenden regels in kernbibliotheken zoals re2 en libgav1 tot meer dan 800 K regels voor de Fuchsia OS Zircon‑kernel. Gezien de kritieke aard van veel van deze systemen ondergaan de grootschalige herschrijvingen een rigoureuze geautomatiseerde en handmatige audit, emulatietesten en beoordeling voordat ze in productie worden genomen.

Voor libgav1, de open‑source‑software van Google voor videodecodering, namen Argon‑agents een bestaande Rust‑port en vervingen 32 K regels SIMD‑code door meerdere rondes van profiel‑gegeleide experimenten uit te voeren en de output van de compiler te bestuderen. Google meldde dat het resultaat een geheugenveilige videodecoder is die 2,7 × sneller draait dan de Rust‑port, met identieke video‑output.

Om langere, complexere use‑cases te ondersteunen, heeft Google de uitvoertoken‑limiet van het model uitgebreid tot 1 M tokens, omhoog vanaf de eerdere 64 K tokens, een cijfer dat het bedrijf beschrijft als toonaangevend in de sector.

Enterprise‑benchmarks en cyberbeveiligingsverdediging

Google meldt dat Argon een nieuwe staat van de kunst bereikt op DeepSWE v1.1 met een score van 77,9 %, een benchmark die de prestaties meet op realistische, langetermijnsoftware‑engineering‑taken. Het bedrijf beschrijft Argon als het toonaangevende model op de Vals‑Index, die de economische impact meet over financiën, codering, juridisch werk en belastingzaken, waarbij elke sector wordt gewogen op basis van zijn bijdrage aan het Amerikaanse BBP, en meldt eveneens een vergelijkbaar leidende prestatie op Vals Finance Agent v2 voor meerstaps financieel onderzoek en Harvey’s Legal Agent Benchmark voor juridisch onderzoek en het opstellen van documenten.

Op AutomationBench, de benchmark van Zapier die end‑to‑end uitvoering over kern‑bedrijfsfuncties meet, meldt Google dat Argon de eerste plaats behaalt met een score van 51,3 %. Op LVBench, die lange‑video‑begrip meet, rapporteert het bedrijf een state‑of‑the‑art score van 91,7 % en stelt dat Argon professionele grafiekanalyse kan aandrijven, details uit lange video’s kan identificeren en actie kan ondernemen op basis van een reeks documenten.

Google zei dat het Argon heeft getraind om autonoom kritieke software‑kwetsbaarheden te vinden, te valideren en te patchen, en dat het model zonder cyber‑beveiligingsmaatregelen zal worden vrijgegeven aan vertrouwde verdedigers en de eigen interne teams. Wiz gebruikt Argon al via zijn Scan for Good‑initiatief, een programma dat zich toelegt op het gratis beschermen van kritieke publieke infrastructuur door high‑risk blootstellingen te vinden en te verhelpen. Google meldde dat het model een kritieke kwetsbaarheid ontdekte die gevoelige persoonlijke informatie blootlegde in zorgsoftware die wereldwijd door ziekenhuizen wordt gebruikt, en een ernstig risico identificeerde dat eerdere frontier‑modellen hadden gemist.

Op CWE‑bench v1, die het vermogen van een model om beveiligingskwetsbaarheden te verhelpen evalueert, meldt Google dat Argon gelijk eindigt op de eerste plaats met een topscore van 68 %. Het bedrijf zei dat Argon ook blootstellingen ontdekte in complexe codebases die 20 programmeertalen omvatten op zijn interne kwetsbaarheidsbenchmark, en dat het Gemini 3.8 Flash Cyber overtrof in de interne black‑box penetratietestbenchmark van Wiz, die het vermogen van een model test om live websysteemen te analyseren zonder broncode.

Het Fairwind Program, gelanceerd door Google op 2 september 2026, is een programma met beperkte toegang voor overheden en vertrouwde partners om de cyberverdedigingsinstrumenten van het bedrijf te gebruiken. Deelnemende organisaties stemmen in met operationele standaarden die onder meer het beperken van toegang voor medewerkers binnen interne cyberbeveiliging, incidentrespons of penetratietestteams omvatten, en het inzetten van beschermingsmaatregelen zoals multi-factor authenticatie. Google zei dat het programma wereldwijd meer dan 650 deelnemende partners heeft, en dat de eerste aanbieding Gemini 3.8 Flash Cyber combineerde met de CodeMender-harnas om verdedigers te helpen kwetsbaarheden te vinden, te verifiëren en te verhelpen.

Frontier Safeguards en gefaseerde uitrol

Google zei dat het de frontier-beveiligingen in vier gebieden versterkt voordat Argon breed beschikbaar wordt. Voor misbruikverdediging is het model ontworpen om schadelijke cyber- en chemische, biologische, radiologische en nucleaire verzoeken te weigeren, terwijl legitiem dual‑use wetenschappelijk onderzoek behouden blijft onder Google’s Frontier Safety Framework. Het bedrijf zei dat het zijn technieken verbetert om de interne activaties van het model te monitoren om misbruik te detecteren, en dat de beveiligingen robuustheidstesten hebben ondergaan door interne en externe red teams met handmatige en geautomatiseerde aanvalsmethoden.

Google beschrijft Argon als tot nu toe het meest veerkrachtige model tegen indirecte promptinjectie, waarbij kwaadwillige instructies of context worden gebruikt om het gedrag van een model over te nemen, en meldt een leidende robuustheid op Gray Swan’s Indirect Prompt Injection-benchmark door geautomatiseerde red teaming en adversarial training.

Het bedrijf implementeert ook misalignment‑mitigaties die de chain-of-thought en acties van Argon monitoren en de uitvoering stoppen wanneer dat nodig is. Google zei dat een soortgelijk systeem zijn trainingsruns monitorde en meldingen naar een toegewijd incidentrespons‑team stuurde, met zorgvuldige voorzorgsmaatregelen om te voorkomen dat de bevindingen terug in de training worden gevoed. Ten slotte zei Google dat het zijn gesandboxtte omgevingen versterkt door ze te isoleren en af te sluiten voordat hoog‑risico training of evaluaties beginnen, in overeenstemming met zijn roadmap voor agentencontrole.

Google zei dat feedback van de eerste cohort van cyberverdedigers en vertrouwde testers hen zal helpen hun systemen te versterken voordat Argon wordt uitgebracht voor ontwikkelaars, bedrijven en consumenten, te beginnen met betalende API‑klanten en Google AI Ultra‑abonnees, zo snel mogelijk.

Jonas Reeve is een AI-gegenereerde analist bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.