AI-modeller og plattformer
Google lar utviklere blokkere Gemini-agenter sine verktøykall

Google har lagt til en kontrolllag i de administrerte agentene i Gemini-API-en, som lar utviklere kjøre sin egen kode før og etter hvert verktøykall en agent gjør inne i sin sky-sandbox, og avbryte kallet helt. Samme oppdatering gjør Gemini 3.6 Flash til standardmodellen bak agenten, begrenser hvor mange token en enkelt kjøring kan forbruke, og åpner funksjonen for prosjekter uten fakturering.
Administrerte agenter er Googles vertede versjon av agentløkken, samme mønster som ligger bak assistentene som nå kobles til for å utføre handlinger i stedet for å svare på spørsmål. En API-kall utsteder en Linux-sandbox, og modellen planlegger deretter, kjører kode, installerer pakker, leser og skriver filer, og henter nettider inntil oppgaven er ferdig. Denne arkitekturen er det som gjorde den nye funksjonen nødvendig: sandkassen var et sted utviklere kunne sende arbeid inn i, men de kunne ikke overvåke det fra innsiden.
Miljøkroker endrer dette. En hooks.json-fil montert inn i sandkassen registrerer håndterere mot to øyeblikk i løkken, før et verktøy kjøres og etter det er ferdig. Hver regel matcher verktøynavn ved hjelp av regulær uttrykk, så en post kan dekke kodekøring og filskriving sammen eller fange hver enkelt kall. Når en pre-eksekveringshåndterer returnerer en avvisning, hopper kjøretiden over verktøykallet og sender grunnen tilbake til modellens kontekst, hvor agenten kan velge en annen rute eller forklare blokeringen til brukeren inne i samme vending.
Hva krokene når
Krokker utløses på verktøyene Google kjører inne i containern: kodekøring, samt filsystemoperasjoner som leser, skriver, lister og sletter filer. Tilpassede funksjoner utvikleren kjører på klienten og fjernmodellkontekstprotokollservere kjører utenfor containern, så kroker ikke fanger disse.
Feil løser seg mot tillatelse. Hvis en krokscript avslutter med en feil, tidsbegrenser, returnerer en serverfeil eller emitterer JSON som kjøretiden ikke gjenkjenner, går verktøykallet videre. Googles dokumentasjon gir grunnen: en feilaktig linter eller en utilgjengelig telemetriserver burde aldri være i stand til å låse en produksjonsapplikasjon.
Den andre håndterertypeposter hendelsen rett til en ekstern sluttpunkt fra innen sandkassennettverket, som er hvordan revisjonslogging fungerer. Disse forespørslene reiser gjennom Googles egress-proxy, så destinasjonen må sitte på miljøets tillatelsesliste, og autentiseringstokene lever i nettverkskonfigurasjonen i stedet for i krokfilen, med proxyn injiserer ekte header på ledningen. Google peker også på at en agent som holder shell eller skriveadgang kan redigere en krokfil i en skrivbar arbeidsplass, og peker utviklere som trenger tamperbestandighet mot å montere denne konfigurasjonen fra et leselig repository.
Å overvåke hva en agent er tillatt å gjøre, tiltrekker venturepenger på egen hånd. Google setter sjekken inne i sin egen kjøretid.
Verifiseringsrørledninger er den første bruken de satte et kundenavn på. Alston Lin, grunnlegger og teknologidirektør i AI-naturlig investeringsbank OffDeal, sa at en post-eksekveringskrok nå kjører selskapets bildekontrollpipeline øyeblikket hans analystagent skriver ut en selskapliste, og pålegger pikselnivåkvalitetsregler på de titalls logoer en banker-klar dekk må ha. “Før agentkroker, kunne vi ikke gjøre dette på Gemini sine administrerte agenter: sandkassen er fjern, så vår valideringskode hadde ingen sted å kjøre,” sa han.
Gemini 3.6 Flash tar over som standard
Den administrerte agenten kjører Gemini 3.6 Flash uten noen kodeendring, og plukker det opp på neste interaksjon. Utviklere kan feste en annen modell ved å sende den i agentens konfigurasjon, velge Gemini 3.5 Flash for kontinuitet eller 3.5 Flash-Lite for lavere kostnad og latens. For agenter som er lagret som varige ressurser, er modellen fastsatt ved opprettelse og kan ikke overskrives per kall, noe Google sier holder verktøykallingsatferd, feilsøking og sikkerhetsgrenser forutsigbare.
Google lanserte 3.6 Flash den 21. juli 2026, sammen med 3.5 Flash-Lite og en sikkerhetstilpasset 3.5 Flash Cyber, lanseringen hvor dens forsinkede 3.5 Pro-flaggskip ble utsatt igjen. Den prises til 1,50 dollar per million inndata-token og 7,50 dollar per million utdatatoken, mot 9,00 dollar for 3.5 Flash, og selskapet rapporterer at den forbruker 17% færre utdatatoken på kunstig analyseindeks mens den scorer 49% på DeepSWE-kodingbenchmarked mot 37% for forgjengeren. Den billigere tokenprofilen er det som teller inne i en agentløkke, hvor en oppgave kan kjøre i hundrevis av steg.
Utgifter og planlagte kjøringer
Kostnad er det andre som denne utgaven adresseer direkte. En token-tak som sendes med forespørselen begrenser inndata-, utdatatoken og tenketoken over hele interaksjonen; cachede token er ekskludert, og begrensningen er best-ansatt i stedet for nøyaktig. Når en agent treffer den, returnerer kjøringen som ufullstendig med sandkassens tilstand intakt, og en oppfølgingskall gjenopptar arbeidet med en ny tillatelse. Googles egne estimater setter en tung dataprosesseringsoppgave til 0,70 dollar til 3,25 dollar, med komplekse arbeidsflyter som akkumulerer tre til fem millioner token og omtrent 5 dollar i en enkelt interaksjon. Sandkassekalkulasjon blir ikke fakturert under forhåndsvisningen.
To tilføyelser gjør agenten til stående infrastruktur i stedet for en per-forespørselskall:
- Planlagte utløsere binder en agent, en prompt, et miljø og en cron-uttrykk til en varig ressurs som utløses på egen hånd, og pause seg selv som standard etter fem påfølgende feil. Hver kjøring gjenbruker samme sandkasse, så filer skrevet av en kjøring er synlige for den neste.
- Et miljøgrensesnitt lister, inspisere og sletter sandkassesessioner fra kode, som gjenoppretter en miljø-ID etter en brutt forbindelse og klarer sandkasser når en pipeline er ferdig i stedet for å vente ut deres syv-dagers utløpsdato.
Funksjonene bygger på en utgave den 7. juli 2026 som ga administrerte agenter bakgrunnskjøring, fjernmodellkontekstprotokolltilkoblinger, tilpasset funksjonskall og midtsesjons-credential-oppfriskning. Sammen setter de en planlagt, budsjett-kappet agent med en gjennomtvingbar politikklag innenfor rekkevidde av en utvikler som arbeider fra en gratis API-nøkkel.












