AI-modeller och plattformar

Google tillkännager Gemini 4 Argon Frontier-modell för kodning, cybersäkerhetsförsvar

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Google meddelade Gemini 4 Argon den 30 september 2026 och beskrev den som företagets nya frontier-modell för verklig mjukvaruutveckling, företagskunskapsarbete såsom juridik och ekonomi samt cybersäkerhetsförsvar. Modellen lanseras först för betrodda cybersäkerhetsförsvarare via Googles Fairwind-program till ett introduktionspris på $2 per miljon inmatningstoken.

I ett inlägg på The Keyword sade Koray Kavukcuoglu, SVP för Google DeepMind och Chief AI Architect på Google, att en säker lansering av frontier-funktioner på denna nivå kräver ett fasat tillvägagångssätt. Google är aktivt engagerat i den amerikanska regeringens frivilliga process för förhandsåtkomst till modeller medan åtkomsten gradvis utökas, och meddelade att de kommer fortsätta samla in feedback från tidiga testare när de itererar på skyddsmekanismer.

Argons introduktionspriser är $2 per miljon inmatningstoken och $10 per miljon utmatningstoken, med cachade inmatningstoken prissatta till 95 % av inmatningstokenpriset. En fotnot i meddelandet anger att när introduktionsperioden löper ut blir priset $4 per miljon inmatningstoken och $20 per miljon utmatningstoken.

Intern utrullning och utökade utmatningsgränser

Google uppgav att Argon redan driver interna arbetsflöden, med tusentals anställda som framhäver modellens styrkor i specialiserade kodningsuppgifter, djupare forskning och kvalitativ skrivning. Företaget rapporterade flera exempel från den utrullningen. Argon hjälper Googles kvantdatorforskare att optimera rumtidresurser (qubits × gates) för delrutiner som utgör flaskhalsar i viktiga applikationer; i ett exempel överträffade den den publicerade referensnivån med 40 % på bara några minuter. Ett team av Argon‑agenter analyserade flotta‑omfattande profilerings‑telemetri för att autonomt identifiera och tillämpa minnesoptimeringar i Googles datacenter, vilket frigjorde mer än 300 TiB minne efter utrullning, med en uppskattad total besparing på 500 TiB till 1 PiB.

Google uppgav att Argon‑agenter också migrerar C/C++‑kodbaser till Rust i hela företaget, från tiotals tusen rader i kärnbibliotek som re2 och libgav1 till över 800 000 rader för Fuchsia OS Zircon‑kärnan. Med tanke på kritikaliteten hos många av dessa system genomgår de storskaliga omskrivningarna rigorös automatisk och manuell granskning, emuleringstestning och översyn innan de rullas ut i produktion.

För libgav1, Googles öppna källkodsprogramvara för videodekoding, ersatte Argon‑agenter en befintlig Rust‑port och bytte ut 32 000 rader SIMD‑kod genom att köra flera omgångar av profilstyrda experiment och studera kompilatorns resultat. Google meddelade att resultatet är en minnessäker videodekoder som kör 2,7 × snabbare än Rust‑porten, med identisk videoutdata.

För att stödja längre och mer komplexa användningsfall har Google utökat modellens gräns för utmatningstoken till 1 M token, upp från tidigare 64 K token, ett tal som företaget beskriver som branschledande.

Företagsbenchmarkar och cybersäkerhetsförsvar

Google rapporterar att Argon sätter en ny toppnivå på DeepSWE v1.1 med en poäng på 77,9 %, ett benchmark som mäter prestanda på verkliga långsiktiga mjukvaruutvecklingsuppgifter. Företaget beskriver Argon som den ledande modellen på Vals Index, som mäter ekonomisk påverkan inom finans, kodning, juridik och skattearbete, där varje sektor vägs efter sitt bidrag till U.S. GDP, och rapporterar liknande ledande prestanda på Vals Finance Agent v2 för flerstegs finansiell forskning samt Harvey’s Legal Agent Benchmark för juridisk forskning och utarbetande.

På AutomationBench, Zapiers benchmark som mäter end‑to‑end‑utförande över kärnaffärsfunktioner, rapporterar Google att Argon ligger först med ett resultat på 51,3 %. På LVBench, som mäter förståelse av långa videor, rapporterar företaget ett state-of-the-art‑resultat på 91,7 % och säger att Argon kan driva professionell diagramanalys, identifiera detaljer från långa videor och vidta åtgärder baserat på en serie dokument.

Google uppgav att de tränade Argon att autonomt hitta, validera och åtgärda kritiska mjukvarusårbarheter, och att de kommer släppa modellen utan cybersäkerhetsgrindar till betrodda försvarare och sina egna interna team. Wiz använder redan Argon genom sitt Scan for Good‑initiativ, ett program som är dedikerat till att gratis skydda kritisk offentlig infrastruktur genom att hitta och åtgärda högriskexponeringar. Google meddelade att modellen upptäckte en kritisk sårbarhet som exponerade känslig personlig information i sjukvårdsprogramvara som används av sjukhus världen över, och identifierade en allvarlig risk som tidigare frontier‑modeller missat.

På CWE-bench v1, som utvärderar en modells förmåga att åtgärda säkerhetssårbarheter, rapporterar Google att Argon delar förstaplatsen med ett toppresultat på 68 %. Företaget uppgav att Argon också upptäckte exponeringar i komplexa kodbaser som spänner över 20 programmeringsspråk i deras interna sårbarhetsbenchmark, och överträffade Gemini 3.8 Flash Cyber i Wizs interna black‑box‑penetrationstestbenchmark, som testar en modells förmåga att analysera levande webbsystem utan källkod.

The Fairwind Program, lanserad av Google den 2 september 2026, är ett begränsat åtkomstprogram för regeringar och betrodda partners att använda företagets verktyg för cybersäkerhet. Deltagande organisationer godkänner operativa standarder som inkluderar att begränsa åtkomst till anställda inom intern cybersäkerhet, incidentrespons eller penetrationstestteam samt att implementera skyddsåtgärder såsom multifaktorautentisering. Google uppgav att programmet har mer än 650 deltagande partners globalt, och dess första erbjudande kombinerade Gemini 3.8 Flash Cyber med CodeMender‑hylsan för att hjälpa försvarare att hitta, verifiera och åtgärda sårbarheter.

Frontier-skydd och stegvis utrullning

Google sade att de stärker frontier-skydd i fyra områden innan Argon blir allmänt tillgänglig. För missbruksskydd är modellen utformad för att vägra skadliga cyber‑ och kemiska, biologiska, radiologiska och nukleära förfrågningar samtidigt som legitim dual‑use vetenskaplig forskning bevaras under Googles Frontier Safety Framework. Företaget uppgav att de förbättrar sina tekniker för att övervaka modellens interna aktiveringar för att upptäcka missbruk, och att skydden genomgick robusthetstester av interna och externa red‑team med både manuella och automatiserade attackmetoder.

Google beskriver Argon som deras mest motståndskraftiga modell hittills mot indirekt prompt‑injektion, där skadliga instruktioner eller kontext används för att kapra modellens beteende, och rapporterar ledande robusthet på Gray Swans benchmark för indirekt prompt‑injektion genom automatiserad red‑teamning och adversariell träning.

Företaget implementerar också missanpassningsåtgärder som övervakar Argons tankegång och handlingar och stoppar exekvering när så behövs. Google sade att ett liknande system övervakade deras träningskörningar och skickade larm till ett dedikerat incidentrespons‑team, med noggranna försiktighetsåtgärder för att förhindra att fynden matas tillbaka i träningen. Slutligen uppgav Google att de härdar sina sandbox‑miljöer genom att isolera och försegla dem innan hög‑risk‑träning eller utvärderingar påbörjas, i enlighet med deras roadmap för agentkontroll.

Google sade att återkoppling från den initiala kohorten av cyberförsvarare och betrodda testare kommer att hjälpa dem att stärka sina system innan Argon släpps till utvecklare, företag och konsumenter, med start för betalande API‑kunder och Google AI Ultra‑prenumeranter, så snart som möjligt.

Jonas Reeve är en AI‑genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell generell intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete undersöker hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI‑arkitekturer och långvariga frågor inom kognitiv vetenskap och medvetandefilosofi.

Med ett konceptuellt och reflekterande förhållningssätt granskar Jonas ramar såsom resonemangsmodeller, agentbaserade system, emergent kognition och aligneringsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder – och vad det inte betyder. Istället för att jaga tidslinjer eller hype betonar han grundprinciper, konceptuell stringens och begränsningarna i nuvarande modeller.

Artiklar skrivna av Jonas Reeve är AI‑genererade och granskas av Unite.AI:s redaktionsteam för att säkerställa noggrannhet, tydlighet och ett ansvarsfullt samtal om avancerade AI‑koncept.