AI-modeller og platforme

Google lader udviklere blokere Gemini-agenteres værktøjskald

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google har tilføjet en kontrollag til de administrerede agenter i sin Gemini-API, så udviklere kan køre deres egen kode før og efter hvert værktøjskald, som en agent foretager i sin cloud-sandbox, og afbryde kaldet helt. Den samme opdatering gør Gemini 3.6 Flash til standardmodellen bag agenten, begrænser antallet af tokens, som en enkelt kørsel kan forbruge, og åbner funktionen for projekter uden fakturering.

Administrerede agenter er Googles hosted version af agent-løkken, det samme mønster bag assistenterne, der nu kobles til at udføre handlinger i stedet for at besvare spørgsmål. En API-kald klargører en Linux-sandbox, og modellen planlægger derefter, kører kode, installerer pakker, læser og skriver filer og henter websteder, indtil opgaven er fuldført. Denne arkitektur er det, der gjorde den nye funktion nødvendig: sandkassen var et sted, hvor udviklere kunne sende arbejde ind, men ikke kunne overvåge det indefra.

Miljøhængsler ændrer dette. En hooks.json-fil, der er monteret i sandkassen, registrerer håndterere mod to øjeblikke i løkken, før et værktøj kører og efter det er færdigt. Hver regel matcher værktøjsnavne ved hjælp af regulære udtryk, så en enkelt post kan dække kodekørsel og filskrivning sammen eller aflytte hvert kald. Når en pre-execution-håndtering returnerer en afvisning, springer runtime-værktøjet over værktøjskaldet og sender den angivne grund tilbage til modellens kontekst, hvor agenten kan vælge en anden rute eller forklare blokeringen til brugeren i samme tur.

Hvad hængslerne når

Hængsler aktiveres på de værktøjer, som Google kører inde i containern: kodekørsel samt filsystemoperationer, der læser, skriver, lister og sletter filer. Brugerdefinerede funktioner, som udvikleren kører på clientsiden, og fjern-Model Context Protocol-servere, der kører uden for containern, så hængslerne ikke aflytter dem.

Fejl løses mod tilladelse. Hvis en hængselskript afslutter med en fejl, tidsudløber, returnerer en serverfejl eller emitterer JSON, som runtime ikke genkender, går værktøjskaldet videre. Googles dokumentation giver grunden: en fejl i en linter eller en utilgængelig telemetriserver skal aldrig være i stand til at låse en produktionsapplikation.

Den anden type af håndtering sender begivenheden direkte til en ekstern slutpunkt fra inde i sandkassens netværk, hvilket er, hvordan overvågningslogning fungerer. Disse anmodninger rejser gennem Googles egress-proxy, så destinationen skal være på miljøets tilladelsesliste, og godkendelsestoken er placeret i netværkskonfigurationen i stedet for i hængselsfilen, med proxysættet indsætter ægte headers på ledningen. Google bemærker også, at en agent, der har shell- eller skriveadgang, kan redigere en hængselsfil i en skrivbar arbejdsplads, og peger udviklere, der har brug for manipulationssikkerhed, i retning af at montere denne konfiguration fra et læsebeskyttet repository.

At overvåge, hvad en agent er berettiget til at gøre, tiltrækker venture-penge på egen hånd. Google indsætter kontrollen inde i sin egen runtime.

Verificeringsrørledninger er den første brug, det har tildelt et kundeanavn til. Alston Lin, grundlægger og teknisk direktør for den AI-naturlige investeringsbank OffDeal, sagde, at en post-execution-hængsel nu kører hans firms billedkontrolpipeline øjeblikkeligt, efter at hans analystagent har skrevet ud en virksomhedsliste, og gennemtvinger pixelniveau-kvalitetsregler på de dusinvis af logoer, en bankklar præsentation har brug for. “Før agenthængsler, kunne vi ikke gøre dette på Gemini’s administrerede agenter: sandkassen er fjern, så vores valideringskode havde ingen sted at køre,” sagde han.

Gemini 3.6 Flash overtager som standard

Den administrerede agent kører Gemini 3.6 Flash uden nogen kodeændring, og vælger det på næste interaktion. Udviklere kan fastgøre en anden model ved at overføre det i agentens konfiguration, vælge Gemini 3.5 Flash for kontinuitet eller 3.5 Flash-Lite for lavere omkostninger og ventetid. For agenter, der er gemt som bestandige ressourcer, er modellen fastsat ved oprettelse og kan ikke overskrides per kald, hvilket Google siger holder værktøjskaldsadfærd, fejlfinding og sikkerhedsgrænser forudsigelige.

Google udgav 3.6 Flash den 21. juli 2026 sammen med 3.5 Flash-Lite og en sikkerhedstilpasset 3.5 Flash Cyber, lanceringsdatoen for dens forsinkede 3.5 Pro-flagskib blev rykket tilbage igen. Det prissættes til 1,50 $ pr. million indgangstokens og 7,50 $ pr. million udgangstokens, mod 9,00 $ udgang for 3.5 Flash, og virksomheden rapporterer, at det forbruger 17% færre udgangstokens på Artificial Analysis Index, mens det scorer 49% på DeepSWE-kodningsbenchmark versus 37% for dens forgænger. Den billigere tokenprofil er det, der betyder noget inde i en agentløkke, hvor en opgave kan køre i hundredvis af skridt.

Udgifter og planlagte køringer

Omkostninger er den anden ting, denne udgivelse adresserer direkte. En tokenloft, der overføres med anmodningen, begrænser indgangs-, udgangs- og tænketokens på hele interaktionen; cachede tokens er ikke inkluderet, og begrænsningen er bedst mulig i stedet for præcis. Når en agent rammer det, returnerer kørningen som ufuldstændig med sandkassens tilstand intakt, og et efterfølgende kald genoptager arbejdet med en frisk tilladelse. Googles egne estimeringer placerer en tung dataprocessering opgave på 0,70 $ til 3,25 $, med komplekse arbejdsgange, der akkumulerer tre til fem millioner tokens og cirka 5 $ i en enkelt interaktion. Sandkasseberegning er ikke faktureret under forhåndsvisningen.

To tilføjelser omdanner agenten til en fast infrastruktur i stedet for et per-anmodningskald:

  • Planlagte udløsere binder en agent, en prompt, et miljø og en cron-udtryk sammen i en bestandig ressource, der udløser på egen hånd, og standsede sig selv som standard efter fem på hinanden følgende fejl. Hver kørsel genbruger samme sandkasse, så filer, der er skrevet af en kørsel, er synlige for den næste.
  • Et miljøgrænseflade lister, inspicerer og sletter sandkassesessioner fra kode, hvilket genvinder en miljø-ID efter en tabt forbindelse og rydder sandkasser, når en pipeline er færdig, i stedet for at vente på deres syv-dages udløb.

Funktionerne bygger på en udgivelse den 7. juli 2026, der gav administrerede agenter baggrundskørsel, fjern-Model Context Protocol-forbindelser, brugerdefineret funktionskald og midtsession-godkendelsesopdatering. Sammen sætter de en planlagt, budgetkappede agent med en gennemtvingelig politiklag inden for rækkevidde af en udvikler, der arbejder fra en gratis API-nøgle.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.