AI-modeller og platforme

Google annoncerer Gemini 4 Argon Frontier-model for kodning, cybersikkerhed

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google annoncerede Gemini 4 Argon den 30. september 2026 og beskrev den som virksomhedens nye frontier-model til virkelig softwareudvikling, virksomhedens vidensarbejde såsom juridik og finans samt cybersikkerhedsforsvar. Modellen rulles først ud til betroede cybersikkerhedsforsvarere gennem Googles Fairwind Program til en introduktionspris på $2 pr. million input‑tokens.

I et indlæg på The Keyword sagde Koray Kavukcuoglu, SVP for Google DeepMind og Chief AI Architect hos Google, at en sikker frigivelse af frontier‑kapaciteter på dette niveau kræver en trinvis tilgang. Google er aktivt involveret i den amerikanske regerings frivillige proces for forhåndsadgang til modeller, mens adgangen gradvist udvides, og sagde, at de vil fortsætte med at indsamle feedback fra tidlige testere, mens de justerer sikkerhedsforanstaltningerne.

Argons introduktionspris er $2 pr. million input‑tokens og $10 pr. million output‑tokens, med cachede input‑tokens til 95 % af input‑tokenprisen. En fodnote i meddelelsen angiver, at når introduktionsperioden udløber, vil prisen være $4 pr. million input‑tokens og $20 pr. million output‑tokens.

Intern implementering og udvidede output‑grænser

Google sagde, at Argon allerede driver interne arbejdsprocesser, hvor tusindvis af medarbejdere fremhæver modellens styrker i specialiserede kodningsopgaver, dybere forskning og kvalitetsforfatning. Virksomheden rapporterede flere eksempler fra den implementering. Argon hjælper Googles kvantecomputings‑forskere med at optimere rum‑tid‑ressourcer (qubits × gates) i delrutiner, der udgør flaskehalse i vigtige applikationer; i et eksempel overgik den den offentliggjorte baseline med 40 % på blot få minutter. Et team af Argon‑agenter analyserede flådefærdig profileringstelemetri for autonomt at identificere og anvende hukommelsesoptimeringer på tværs af Googles datacentre, hvilket frigjorde mere end 300 TiB hukommelse ved udrulning, med et anslået samlet besparelsesområde på 500 TiB til 1 PiB.

Google sagde, at Argon‑agenter også migrerer C/C++‑kodebaser til Rust i hele virksomheden, fra titusinder af linjer i kernebiblioteker som re2 og libgav1 til over 800 000 linjer for Fuchsia OS Zircon‑kernen. På grund af den kritiske betydning af mange af disse systemer gennemgår de omfattende omskrivninger streng automatiseret og manuel revision, emuleringstest og gennemgang, inden de rulles ud i produktion.

For libgav1, Googles open‑source‑software til videodekodning, tog Argon‑agenter en eksisterende Rust‑port og erstattede 32 000 linjer SIMD‑kode ved at gennemføre runder af profilstyrede eksperimenter og analysere kompilatorens output. Google sagde, at resultatet er en hukommelsessikker videodekoder, der kører 2,7 × hurtigere end Rust‑porten, med identisk videouddata.

For at understøtte længere og mere komplekse anvendelsestilfælde udvidede Google modellens output‑token‑grænse til 1 M tokens, op fra de tidligere 64 K tokens, et tal som virksomheden beskriver som brancheførende.

Virksomhedsbanchmarks og cybersikkerhedsforsvar

Google rapporterer, at Argon sætter en ny topstandard på DeepSWE v1.1 med en score på 77,9 %, et benchmark der måler præstation på virkelige langtidshorisontale software‑udviklingsopgaver. Virksomheden beskriver Argon som den førende model på Vals Index, som måler økonomisk påvirkning på tværs af finans, kodning, juridisk arbejde og skat, hvor hver sektor vægtes efter dens bidrag til USA’s BNP, og rapporterer tilsvarende førende præstation på Vals Finance Agent v2 for flertrins finansiel forskning samt Harvey’s Legal Agent Benchmark for juridisk forskning og udarbejdelse.

På AutomationBench, Zapiers benchmark der måler end‑to‑end‑eksekvering på tværs af kerneforretningsfunktioner, rapporterer Google, at Argon ligger på førstepladsen med en score på 51,3 %. På LVBench, som måler forståelse af lange videoer, rapporterer virksomheden en state‑of‑the‑art‑score på 91,7 % og siger, at Argon kan drive professionel diagramanalyse, identificere detaljer fra lange videoer og handle på baggrund af en række dokumenter.

Google sagde, at de har trænet Argon til autonomt at finde, validere og udbedre kritiske software‑sårbarheder, og at de vil frigive modellen uden cybersikkerheds‑guardrails til betroede forsvarere og deres egne interne teams. Wiz bruger allerede Argon gennem deres Scan for Good‑initiativ, et program dedikeret til gratis beskyttelse af kritisk offentlig infrastruktur ved at finde og afhjælpe højriskiko‑eksponeringer. Google sagde, at modellen opdagede en kritisk sårbarhed, der afslørede følsomme personlige oplysninger i sundheds‑software anvendt af hospitaler verden over, og identificerede en alvorlig risiko, som tidligere frontier‑modeller havde overset.

På CWE‑bench v1, som evaluerer en models evne til at afhjælpe sikkerhedssårbarheder, rapporterer Google, at Argon deler førstepladsen med en top‑score på 68 %. Virksomheden sagde, at Argon også opdagede eksponeringer i komplekse kodebaser, der spænder over 20 programmeringssprog i deres interne sårbarhedsbenchmark, og overgik Gemini 3.8 Flash Cyber i Wiz’s interne sort‑boks penetrationstest‑benchmark, som tester en models evne til at analysere live‑websystemer uden kildekode.

Fairwind-programmet, lanceret af Google den 2. september 2026, er et begrænset adgangsprogram for regeringer og betroede partnere til at bruge virksomhedens cyberforsvars‑værktøjer. Deltagende organisationer accepterer driftsstandarder, der inkluderer at begrænse adgang til medarbejdere inden for intern cybersikkerhed, hændelsesrespons eller penetrationstest‑teams samt implementere beskyttelser som multifaktorautentificering. Google oplyser, at programmet har mere end 650 deltagende partnere globalt, og det første tilbud kombinerede Gemini 3.8 Flash Cyber med CodeMender‑harnessen for at hjælpe forsvarere med at finde, bekræfte og rette sårbarheder.

Frontier-sikringer og trinvis udrulning

Google sagde, at de styrker frontier-sikringer på fire områder, inden Argon bliver bredt tilgængelig. For misbrugsforsvar er modellen designet til at afvise skadelige cyber‑ samt kemiske, biologiske, radiologiske og nukleare anmodninger, mens legitime dual‑use videnskabelige forskningsformål bevares under Googles Frontier Safety Framework. Virksomheden oplyser, at de forbedrer deres teknikker til at overvåge modellens interne aktiveringer for at opdage misbrug, og at sikringerne har gennemgået robusthedstest af interne og eksterne red teams ved brug af manuelle og automatiserede angrebsmetoder.

Google beskriver Argon som deres mest robuste model hidtil mod indirekte prompt‑injektion, hvor ondsindede instruktioner eller kontekst bruges til at kapre modellens adfærd, og rapporterer førende robusthed på Gray Swan’s Indirect Prompt Injection‑benchmark gennem automatiseret red‑team‑arbejde og modstandertræning.

Virksomheden implementerer også misalignments‑mitigationer, der overvåger Argons tankegang og handlinger og stopper udførelsen, når det er nødvendigt. Google sagde, at et lignende system overvågede deres træningskørsler og sendte alarmer til et dedikeret incident‑response‑team, med omhyggelige forholdsregler for at undgå at fodre fundene tilbage i træningen. Endelig oplyser Google, at de styrker deres sandbox‑miljøer ved at isolere og forsegle dem, inden høj‑risiko træning eller evalueringer påbegyndes, i overensstemmelse med deres roadmap for agentkontrol.

Google sagde, at feedback fra den indledende kohorte af cyberforsvarere og betroede testere vil hjælpe dem med at styrke deres systemer, inden Argon frigives til udviklere, virksomheder og forbrugere, startende med betalende API‑kunder og Google AI Ultra‑abonnenter, så hurtigt som muligt.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.