KI-Modelle und Plattformen
Google lässt Entwickler Tool-Anrufe von Gemini-Agents blockieren

Google hat eine Kontrollschicht zu den verwalteten Agenten in seiner Gemini-API hinzugefügt, die es Entwicklern ermöglicht, ihren eigenen Code vor und nach jedem Toolanruf eines Agents in seinem Cloud-Sandbox auszuführen und den Anruf direkt abzubrechen. Das gleiche Update macht Gemini 3.6 Flash zum Standardmodell hinter dem Agenten, begrenzt die Anzahl der Token, die ein einzelner Lauf verbrauchen kann, und öffnet die Funktion für Projekte ohne Rechnung.
Verwaltete Agenten sind Googles gehostete Version der Agenten-Schleife, dem gleichen Muster hinter den Assistenten, die jetzt so programmiert werden, dass sie Aktionen ausführen, anstatt Fragen zu beantworten. Ein API-Anruf richtet einen Linux-Sandbox ein, und das Modell plant dann, Code ausführt, Pakete installiert, Dateien liest und schreibt und Webseiten abruft, bis die Aufgabe erledigt ist. Diese Architektur ist es, die die neue Funktion notwendig macht: Der Sandbox war ein Ort, an den Entwickler Arbeit senden konnten, aber sie konnten ihn von innen nicht überwachen.
Umgebungs-Hooks ändern das. Eine hooks.json-Datei, die in den Sandbox eingebunden wird, registriert Handler gegen zwei Momente in der Schleife, vor einem Toolanruf und nach dessen Beendigung. Jede Regel entspricht Toolnamen durch reguläre Ausdrücke, so dass eine Eintrag Codeausführung und Dateischreibvorgänge zusammen abfangen oder jeden Anruf abfangen kann. Wenn ein vorheriger Handler eine Ablehnung zurückgibt, überspringt die Laufzeit den Toolanruf und gibt den angegebenen Grund zurück in den Kontext des Modells, wo der Agent eine andere Route wählen oder die Blockierung dem Benutzer innerhalb desselben Turns erklären kann.
Was die Hooks erreichen
Hooks feuern auf die Tools, die Google innerhalb des Containers ausführt: Codeausführung, sowie Dateisystemoperationen, die Dateien lesen, schreiben, auflisten und löschen. Benutzerdefinierte Funktionen, die der Entwickler clientseitig ausführt, und remote Model Context Protocol-Server, die außerhalb des Containers laufen, werden von Hooks nicht abgefangen.
Fehler werden zur Berechtigung aufgelöst. Wenn ein Hook-Skript mit einem Fehler beendet wird, timeoutet, einen Serverfehler zurückgibt oder JSON emittiert, das die Laufzeit nicht erkennt, wird der Toolanruf fortgesetzt. Googles Dokumentation gibt den Grund an: Ein fehlerhafter Linter oder ein nicht erreichbarer Telemetrieserver sollte niemals in der Lage sein, eine Produktionsanwendung zu blockieren.
Die zweite Handler-Art sendet das Ereignis direkt an einen externen Endpunkt aus dem Sandbox-Netzwerk, was so funktioniert, wie Audit-Protokollierung. Diese Anfragen laufen durch Googles Egress-Proxy, so dass das Ziel in der Umgebungs-Whitelist stehen muss, und Authentifizierungstoken leben in der Netzwerkkonfiguration und nicht in der Hook-Datei, wobei der Proxy echte Header auf dem Draht injiziert. Google weist auch darauf hin, dass ein Agent mit Shell- oder Schreibzugriff eine Hooks-Datei in einem beschreibbaren Arbeitsbereich bearbeiten kann und Entwickler, die Tamper-Resistenz benötigen, darauf hinweist, die Konfiguration von einem schreibgeschützten Repository zu mounten.
Die Überwachung dessen, was ein Agent tun darf, zieht eigenes Risikokapital an. Google setzt die Prüfung in seine eigene Laufzeit.
Verifizierungspipelines sind der erste Einsatz, den es einem Kunden zugewiesen hat. Alston Lin, Gründer und Chief Technology Officer der AI-nativen Investmentbank OffDeal, sagte, dass ein post-execution-Hook jetzt seine Firma Bildprüfpipeline ausführt, sobald sein Analysten-Agent eine Firmenliste schreibt, und pixelgenaue Qualitätsregeln für die Dutzende von Logos, die ein bankerfertiges Deck benötigt, durchsetzt. “Bevor Agenten-Hooks, konnten wir dies bei Googles verwalteten Agenten nicht tun: Der Sandbox ist remote, also hatte unser Validierungscode nirgendwo hin, um zu laufen”, sagte er.
Gemini 3.6 Flash wird zum Standard
Der verwaltete Agent läuft Gemini 3.6 Flash ohne Codeänderung, indem er es beim nächsten Interaktionspunkt aufnimmt. Entwickler können ein anderes Modell festlegen, indem sie es in der Agentenkonfiguration übergeben, wobei sie Gemini 3.5 Flash für Kontinuität oder 3.5 Flash-Lite für geringere Kosten und Latenz wählen können. Für Agenten, die als persistente Ressourcen gespeichert werden, ist das Modell bei der Erstellung festgelegt und kann nicht pro Anruf überschrieben werden, was Google sagt, um das Toolanrufverhalten, die Fehlersuche und die Sicherheitsgrenzen vorhersehbar zu halten.
Google veröffentlichte 3.6 Flash am 21. Juli 2026 zusammen mit 3.5 Flash-Lite und einem sicherheitsorientierten 3.5 Flash Cyber, bei dessen Start sein verzögertes 3.5 Pro-Flaggschiff erneut verschoben wurde. Es kostet 1,50 $ pro Million Eingabetoken und 7,50 $ pro Million Ausgabetoken, gegenüber 9,00 $ Ausgabe für 3.5 Flash, und das Unternehmen berichtet, dass es 17 % weniger Ausgabetoken auf dem Artificial Analysis Index verbraucht und 49 % auf dem DeepSWE-Coding-Benchmark erzielt, gegenüber 37 % für seinen Vorgänger. Das günstigere Token-Profil ist der Teil, der innerhalb einer Agenten-Schleife zählt, wo eine Aufgabe für hunderte von Schritten laufen kann.
Ausgabenlimits und geplante Läufe
Kosten sind das andere, was diese Veröffentlichung direkt anspricht. Eine Token-Obergrenze, die mit der Anfrage übergeben wird, begrenzt Eingabe-, Ausgabe- und Denktoken über die gesamte Interaktion; gecachte Token sind ausgeschlossen, und die Begrenzung ist eher ein Bemühen als eine genaue. Wenn ein Agent diese erreicht, gibt die Laufzeit die Arbeit als unvollständig zurück, mit dem Sandbox-Zustand intakt, und ein Folgeanruf setzt die Arbeit mit einem neuen Kontingent fort. Googles eigene Schätzungen legen nahe, dass eine schwere Datenverarbeitungsaufgabe 0,70 $ bis 3,25 $ kostet, wobei komplexe Workflows drei bis fünf Millionen Token und etwa 5 $ pro Interaktion ansammeln, und die Sandbox-Computerleistung während der Vorschau nicht in Rechnung gestellt wird.
Zwei Ergänzungen machen den Agenten zu einer stehenden Infrastruktur anstatt eines pro-Anruf-Anrufs:
- Geplante Trigger binden einen Agenten, einen Prompt, eine Umgebung und einen Cron-Ausdruck in eine persistente Ressource, die selbstständig feuert, und pausiert sich standardmäßig nach fünf aufeinanderfolgenden Fehlern. Jeder Lauf wiederverwendet den gleichen Sandbox, so dass Dateien, die von einem Durchlauf geschrieben werden, für den nächsten sichtbar sind.
- Eine Umgebungs-Schnittstelle listet, untersucht und löscht Sandbox-Sitzungen aus Code, was eine Umgebungs-ID nach einer abgebrochenen Verbindung wiederherstellt und Sandboxes löscht, wenn eine Pipeline beendet ist, anstatt sie sieben Tage ablaufen zu lassen.
Die Funktionen bauen auf einer Veröffentlichung vom 7. Juli 2026 auf, die verwaltete Agenten Hintergrundausführung, Remote-Model-Context-Protocol-Verbindungen, benutzerdefinierte Funktionsaufrufe und Mittelsitzungs-Anmeldeinformationen-Neuvalidierung hinzufügte. Zusammen bringen sie einen geplanten, budgetkapselten Agenten mit einer durchsetzbaren Richtlinienschicht in die Reichweite eines Entwicklers, der von einem kostenlosen API-Schlüssel arbeitet.












