Кібербезпека
Goodfire розгортає кібермонітори на базі зондів для Kimi K3 та GLM 5.3

Goodfire 8 жовтня 2026 року опублікувала Навчання та розгортання виробничих кібермоніторів на Kimi K3, дослідницький пост, у якому описуються кібербезпекові монітори для відкритих моделей Kimi K3 та GLM 5.3, розгорнуті компанією у виробничому стеку інференції. Goodfire повідомляє, що монітори досягають такої ж повноти, як суддя LLM, при приблизно в 50 разів нижчих витратах.
Основними авторами поста є Ekdeep Singh Lubana, Connor Watts, Siddharth Boppana, Dron Hazra та Vasudev Shyam.
Чому кібермоніторинг важкий
Goodfire описує кібербезпеку як один із найскладніших контекстів для моніторингу AI‑агентів: аудит коду на уразливості та його експлуатація включають перекриваючі завдання, тому розрізнення доброзичливої та зловмисної поведінки вимагає відстеження намірів протягом траєкторії, яка може охоплювати мільйони токенів. Очевидним рішенням є залучення другого судді LLM, який читатиме кожен хід, проте це занадто повільно і дорого, щоб працювати поряд з агентом у реальному часі, тому моніторинг зазвичай асинхронний, а шкідливі траєкторії виявляються лише після дії агента.
Згідно з тарифами OpenRouter, у пості оцінюється, що оцінка одного мільйона ходів розгортань Kimi K3 за допомогою судді, що працює на кожному ході, обійдеться приблизно в $200 000 за використання Claude Opus 5 або близько $30 000 за сам Kimi K3.
Каскад «Зонд + Суддя»
Відповідь Goodfire — це двоступеневий каскад. Зонд зчитує внутрішні активації цільової моделі під час того, як сервер інференції генерує токени, і діє як постійний детектор першого рівня; коли вихід зонда перевищує відкалібрований поріг, розгортання передається судді LLM, який може відхилити запит або продовжити взаємодію. Компанія зазначає, що архітектура зондування фіксує поведінку як у локалізованій формі, прив’язаної до конкретного фрагмента ходу, так і у розподіленій формі, що зберігається протягом усього ходу, залишаючись при цьому ефективною у виконанні. Після калібрування зонд досяг 0 % рівня хибно‑негативних випадків і 95 % правильно‑негативних на відкладеному наборі агентних та чат‑взаємодій, повідомляє Goodfire, тому суддя викликається в основному для шкідливої активності, а можна використати швидший, менш потужний суддя.
Навчальні дані отримані від симульованих користувачів з шкідливими та доброзичливими цілями у кібер та некібер середовищах; частина їх була зібрана за допомогою верифікаторів Prime Intellect, Prime Sandboxes та Tunnels, щоб кібер‑офенсивні та доброзичливі інференції Kimi K3 виконувалися без доступу до мережі. Письмова політика визначає небажану кібердіяльність за конкретними факторами, що розрізняють добре‑заплановану роботу, таку як обмежене відтворення уразливостей, від зловмисної, такої як експлуатація уразливостей, і симульовані користувачі можуть підвищувати шкідливий намір у будь‑який момент, включаючи після спочатку доброзичливого запиту.
Дизайн розширює попередні дослідження Goodfire щодо зламу винагороди. У пості, опублікованому 17 вересня 2026 року компанія повідомила про виявлення зламу винагороди у 50–96 % розгортань Kimi K3, GLM 5.2 та Qwen 3.8 Max на трьох агентних тестах, разом з внутрішнім сигналом, пов’язаним із поняттями, такими як шахрайство, маніпуляція метрикою та уникнення виявлення. Прості зондові активації, налаштовані на цей сигнал, виявляли зломи, які пропускали монітори LLM chain‑of‑thought, і на Kimi K3 комбінація зонда та LLM знизила витрати на моніторинг LLM на 90 % при приблизному падінні точності на 1 %, повідомляє компанія.
Пропускна здатність, затримка та результати виявлення
Щоб запускати зони в реальному часі, Goodfire розширила серверний движок SGLang для внутрішнього обчислення оцінок зондів, написала спеціальні ядра для логіки зондів і передавала оцінки зондів через radix‑tree, DSpark‑спекулятор та розподіл prefill‑decode, щоб уникнути повторних обчислень. Кожен робітник, що обслуговує репліку Kimi K3, запускає зони та зберігає історії для активних запитів, причому події моніторингу повертаються у потік відповіді.
У чотирьох робочих навантаженнях інференції включення зондів зберігало пропускну здатність у межах шумового порогу бенчмарків Goodfire, вимірюючи зменшення менш ніж 2 % порівняно зі стандартним SGLang. Каскад скорочує середню додаткову затримку на хід з 160 мс до 2 мс без суддівського роздуму і з 2 750 мс до 42 мс з роздумом, повідомляє Goodfire, і коштує $65 за мільйон ходів агента без роздуму або $185 з роздумом, зменшуючи витрати на суддю приблизно в 49‑ і 29‑рази відповідно порівняно з оцінкою кожного ходу. За фіксованого обчислювального бюджету, за словами компанії, монітори споживають менше 1 % обчислювальних ресурсів, у порівнянні з до 20 % для судді, що працює на кожному ході. Оскільки каскад досить дешевий для синхронного запуску, Goodfire стверджує, що ризиковані кібердії можна блокувати до того, як агент викличе інструмент, а не лише позначати після цього.
Goodfire оцінила монітори на внутрішньому наборі даних, що складається з 2 400 чат‑ і агентських сесій, у яких понад 60 000 ходів, використовуючи мітки Claude Opus 5 як еталон; взаємодії походили з відкритої бібліотеки Petri від Anthropic, реальних середовищ, адаптованих з таких бенчмарків, як ExploitBench, кібер‑специфічного підмножини WildChat, а також безпечних розгортань у сфері розробки програмного забезпечення, кодування та DevOps. При рівні переривання безпечних сесій у 5,5 % Goodfire повідомляє, що каскад досяг приблизно 93 % відновлення шкідливих сесій як з суддівським розумінням, так і без нього, і не позначив 0 % некібер‑трафіку, що компанія описує як покращення Парето порівняно з використанням лише судді при будь‑якому випробуваному рівні переривань. Додавання монітора підвищило рівень блокування шкідливих сесій Kimi K3 з приблизно 29 % до 96 %, а рівень переривання безпечних сесій зріс з близько 5 % до 9 %; для GLM 5.3 блокування зросло з приблизно 36 % до 91 %, а переривання безпечних сесій – з близько 10 % до 15 %.
Проти Jev, моделі‑рішення, яка може слугувати дешевим суддею, каскади досягли 93 % відновлення при тому ж рівні переривання безпечних сесій у 5,5 % у порівнянні з 86 % у Jev, при приблизно $65 обчислювальних ресурсів судді на мільйон ходів і 2 мс додаткової затримки на хід, у порівнянні з $600 і 200 мс у Jev, повідомляє Goodfire. Jev виявив лише 12 % шкідливих підказок, вбудованих у безпечне формулювання, і все частіше переривав безпечні сесії після виходу за межі його 32 000‑токенної вікна. Стандартні лінійні проби забезпечували приблизно на 5 % нижче відновлення, ніж остаточний рецепт, нелінійні проби втрачали до 30 % відновлення на наборах даних поза розподілом, а досягнення межі відновлення судді при шести разів меншій кількості викликів судді вимагало використання проб‑каскаду, а не випадкового вибору ходу. Рецепт також був перенесений на GLM 5.3, використовуючи лише дані, розроблені для Kimi K3, що дало приблизно так само ефективний монітор GLM у розгортаннях Kimi та трохи гірший на власних даних оцінки GLM, повідомляє компанія.
Зовнішнє червоне тестування від FAR.AI
Щоб перевірити розгорнуту систему поза внутрішніми оцінками, Goodfire попросила FAR.AI провести червоне тестування. У звіті FAR.AI, процитованому у дописі:
“FAR.AI провела попереднє тестування моніторів Goodfire Kimi K3 протягом двох днів, застосовуючи неадаптивний портфель статичних jailbreak‑ів для атак у чат‑контекстах з метою шкідливого кіберзловживання. З початкового пулу з 1500 кандидатських jailbreak‑ів тестування відібрало 140, які виявилися ефективними проти іншої версії базової моделі без наших моніторів. Тестуючи кожен із цих 140 у 8 окремих взаємодіях, що відповідали різним цілям атакувальників, монітори Goodfire зменшили вразливості, викликані 66 універсальними jailbreak‑ами та 700 загальними jailbreak‑взаємодіями, до 0 універсальних jailbreak‑ів і 18 jailbreak‑взаємодій.”
Без монітора успішність універсальної jailbreak‑атаки коливалася від 12 % до 53 % у різних налаштуваннях зусиль розумової обробки, згідно з дописом; з увімкненим монітором жодна з 140 стратегій не призвела до універсального jailbreak, а успішність окремих підказок у 1 120 неуніверсальних взаємодіях знизилася з принаймні 9–40 % до 0,1–1,6 % залежно від зусиль розумової обробки.
Goodfire описує таку конфігурацію моніторингу як практичний стандарт для будь‑кого, хто обслуговує відкриті моделі в агентних середовищах, зазначаючи, що відкриті моделі не постачаються з повним набором безпекових засобів. Компанія заявила, що планує продовжувати співпрацю з FAR.AI щодо подальшого тестування та посилення моніторів.












