Cyberbezpieczeństwo

Anthropic Wprowadza Mechanizm Zapobiegania Utracie Danych wewnątrz Claude Enterprise

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Firma Anthropic uruchomiła 5 sierpnia 2026 roku funkcję inference hooks, która jest funkcją beta dla Claude Enterprise, która kieruje każde wprowadzane przez pracownika polecenie do serwera bezpieczeństwa organizacji w celu podjęcia decyzji o zezwoleniu lub odrzuceniu przed tym, jak model będzie mógł je wykonać. System, opisany w ogłoszeniu Anthropic, rozszerza rodzaj mechanizmu zapobiegania utracie danych, który zespoły bezpieczeństwa już teraz stosują w przypadku poczty e-mail i ruchu internetowego, na czaty, sesje Claude Code i Claude Cowork, z jedną konfiguracją na poziomie organizacji.

Do tej pory jedynym rodzajem wbudowanego mechanizmu egzekwowania przepisów w Anthropic były hooki po stronie klienta w Claude Code, które uruchamiają się na maszynie użytkownika. Inference hooks przenoszą punkt kontrolny na serwery Anthropic, po tym, jak żądanie opuściło klienta, a przed uruchomieniem inferencji, tak aby jeden mechanizm kontrolny obejmował wszystkie zarządzane powierzchnie bez konieczności instalowania czegokolwiek na urządzeniach użytkowników.

Jak działa ścieżka egzekwowania

Gdy użytkownik na zarządzanej powierzchni wprowadza polecenie, Anthropic wysyła transkrypt rozmowy do serwera bezpieczeństwa organizacji przez połączenie sygnowane i czeka na decyzję. W przypadku zezwolenia inferencja postępuje. W przypadku odrzucenia żądanie nie dociera do modelu, a użytkownik widzi komunikat o zablokowaniu ze względu na przyczynę, którą serwer bezpieczeństwa zwrócił, oraz stały komunikat, który administratorzy organizacji konfigurują, np. gdzie można wnioskować o wyjątek. Każde odrzucenie trafia do Feedu Aktywności organizacji.

Ten sam mechanizm inspekcji działa w przypadku wywołań narzędzi. Gdy Claude wywołuje narzędzie, w tym narzędzia połączone za pomocą konektorów MCP, umiejętności i wtyczek, odpowiedź narzędzia jest sprawdzana przed tym, jak trafia z powrotem do modelu. Zamyka to drugą połowę problemu z ruchem danych: wrażliwe materiały wprowadzane do rozmowy z połączonego systemu, a nie tylko te, które pracownik wkleja. Odpowiedzi narzędzi stały się pilnie obserwowaną powierzchnią ataku, ponieważ przenoszą dane do kontekstu modelu spoza granic organizacji, jak to podkreśla niedawne badanie przełamania piaskownic agentów.

Decyzja sama w sobie jest małym obiektem JSON, a serwer musi odpowiedzieć w ramach czasu oczekiwania, który wynosi 5 sekund domyślnie, zgodnie z dokumentacją produktu. Żądania są sygnowane zgodnie ze specyfikacją Standard Webhooks, gdy organizacja wygeneruje sekret sygnatury, tak aby serwer bezpieczeństwa mógł zweryfikować, że ruch pochodzi rzeczywiście z Anthropic.

Serwer bezpieczeństwa widzi tekst transkryptu, wywołania narzędzi i ich wyniki oraz tekst wyodrębniony z załączników. Nigdy nie otrzymuje surowych bajtów plików lub obrazów, prompty systemowe ani definicje narzędzi. Pomocnicze żądania, takie jak generowanie tytułu rozmowy, pomijają punkt końcowy, a tryb głosowy nie jest objęty.

Zbudowany, aby usiąść przed istniejącą stertą DLP

Anthropic nie sprzedaje silnika skanowania. Protokół oparty jest na webhookach z opublikowanym schematem, a ogłoszenie wymienia Netskope, Palo Alto Networks (PANW ), Proofpoint i Zscaler jako miejsca, na które organizacje mogą skierować hook, obok serwerów wewnętrznych. Dostawcy bezpieczeństwa mogą tworzyć integracje zgodnie z udokumentowanym schematem i mają wspólne klientów, którzy kierują decyzje do ich platform. Architektura odwraca typową wdrożenie DLP: zamiast tego, aby urządzenie dostawcy śledziło ruch AI w sieci, dostawca AI wywołuje interfejs API decyzji dostawcy na każde żądanie. Check Point przyjął podejście lustrzane kilka dni wcześniej, przenosząc inspekcję promtu AI do swoich zapór sieciowych, tak aby warstwa sieciowa przechwytywała ruch skierowany do modelu.

Kontrola wdrożenia uznaje, że blokowanie pracowników w pierwszym dniu to sposób, w jaki umierają programy DLP. Tryb cieni obserwuje decyzje na żywym ruchu bez blokowania niczego, procent wdrożenia sprawdza wybraną frakcję żądań, a wykluczenia wyłączają członków wybranych ról całkowicie. Jeśli serwer bezpieczeństwa jest niedostępny, generuje błędy lub przekracza limit czasu, organizacja wybiera postawę awaryjną: blokuje żądanie lub pozwala mu przejść bez inspekcji.

Dokumentacja wymienia DLP jako najczęstsze wdrożenie, ale opisuje trzy inne: archiwizację transkryptu w czasie rzeczywistym jako alternatywę push dla sondowania interfejsu API zgodności Anthropic, telemetrię promtu przechwyconą w momencie użycia oraz niestandardowe silniki polityki, które egzekwują reguły, takie jak listy dozwolonych modeli lub ograniczenia zakresu projektu przed inferencją.

Co beta nie obejmuje

Dokumentacja określa bieżące ograniczenia. Decyzje są binarne: serwer może zezwolić lub odrzucić polecenie, ale nie może go przepisać ani ocenzurować. Załączniki przychodzą jako metadane i wyodrębniony tekst, więc treści tylko z obrazami, na przykład zrzut ekranu dokumentu, pozostają nieinspekcjonowane. Jedynym zdarzeniem hooka podczas uruchomienia jest zdarzenie przed inferencją; egzekwowanie po stronie odpowiedzi, sprawdzanie tego, co model zwraca, jest zaplanowane jako późniejsze zdarzenie. A funkcja zarządza tylko powierzchniami Claude Enterprise: dostęp do interfejsu API za pośrednictwem platformy Claude jest poza zakresem, a organizacje uruchamiające Claude na Amazon Bedrock lub Google Cloud nie otrzymują nic.

To pozostawia konkurs inspekcji z dwoma żywymi modelami. Kontrola na poziomie sieci widzi wszystko, co przechodzi przez sieć, ale napotyka na trudności z ruchem AI, który jest zaszyfrowany i rozproszony; hooki po stronie dostawcy, takie jak ten, widzą dokładnie to, co model mógłby zobaczyć, ale tylko w obrębie granic jednego dostawcy. Dokumentacja ogranicza hooki do powierzchni Claude Enterprise i wyklucza Bedrock i Google Cloud, podczas gdy podejście Check Point polega na inspekcji ruchu na poziomie sieci.

Inference hooks jest dostępny w wersji beta dla organizacji Claude Enterprise, z konfiguracją zabezpieczoną za rolami administratora organizacji. Zdarzenie promtu jest aktywne we wszystkich sesjach claude.ai, Cowork i Claude Code na webie, pulpicie i CLI, a dokumentacja Anthropic przedstawia egzekwowanie po stronie odpowiedzi jako następny punkt kontrolny, który ma nadejść.

Miles Okada jest analitykiem generowanym przez SI w Unite.AI, zajmującym się sztuczną inteligencją i cyberbezpieczeństwem, ze szczególnym uwzględnieniem nowych zagrożeń, architektur obronnych oraz ewoluujących dynamik pomiędzy atakującymi a systemami zautomatyzowanymi. Jego praca bada, jak SI przekształca operacje bezpieczeństwa, od autonomicznego wykrywania i reagowania na zagrożenia po rosnącą liczbę technik adversarialnych SI.

Z technicznej i dochodzeniowej perspektywy Miles analizuje badania bezpieczeństwa, ujawnienia incydentów oraz wdrożenia w rzeczywistym świecie, aby zrozumieć, gdzie SI wzmacnia obronę — a gdzie wprowadza nowe podatności. Szczególną uwagę poświęca wykorzystaniu modeli, zatruwaniu danych, automatyzacji ataków oraz operacyjnym realiom zabezpieczania systemów zasilanych przez SI w dużej skali.

Artykuły autorstwa Milesa Okady są generowane przez SI i poddawane przeglądowi przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, rzetelność oraz odpowiedzialne relacjonowanie szybko zmieniającego się krajobrazu bezpieczeństwa SI.