Интервью

Майянк Кумар, основатель и ведущий инженер по ИИ в DeepTempo – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Майянк Кумар является основателем и ведущим инженером по ИИ в DeepTempo, где он руководит разработкой фундаментальной модели языка логов (LogLM) компании. Обладая сильным академическим и исследовательским опытом в области генеративного и многомодального ИИ, он привносит специализированные знания в создание моделей, специфичных для конкретных областей, что улучшает обнаружение и реагирование на угрозы в средах кибербезопасности.

DeepTempo – это компания по кибербезопасности, построенная на основе LogLM, модели ИИ, обученной на большом объеме данных безопасности. Платформа excels в выявлении продвинутых, ранее не виденных угроз, минимизируя ложные положительные результаты. Разработанная для бесшовной интеграции в существующие рабочие процессы безопасности, DeepTempo поддерживает развертывание в datalakes, Kubernetes и Snowflake, обеспечивая более быструю судебно-медицинскую экспертизу, снижение затрат на ингестию данных и масштабируемую, автоматизированную защиту для современных предприятий.

Что привело вас к созданию DeepTempo, и как ваш опыт в академических исследованиях и открытом ИИ способствовал направлению компании?

Я вырос в тесном сообществе, где отношения строились лично, а не через экраны. Мой отец, учитель, привил мне важность возвращения долга. Хотя мы не были богаты материально, мы были богаты связями и смыслом. В такой среде вы быстро учитесь, что решение проблем не только в индивидуальном таланте, но и в коллективной силе. Этот настрой оставался со мной и в конечном итоге привел меня к интересу к социальному предпринимательству во время изучения инженерии в IIT Ropar.

Переломный момент наступил, когда браузер моего отца был атакован программой-вымогателем. Это не было просто технической ошибкой, это ввело страх, путаницу и уязвимость в наш дом. Этот опыт открыл мне глаза на то, как хрупок цифровой мир, не только для отдельных людей, но и для организаций, которые постоянно находятся под угрозой. В то время я встретил Эвана, чья видение построения коллективной защиты в масштабе интернета глубоко резонировало со мной. Эта общая миссия – и моя мотивация применять технологии на службу людям – привела меня к DeepTempo.

В Университете Вашингтона мои исследования были сосредоточены на двух основных областях: многомодальной представленности и данных-центричном ИИ. Оба оказались критически важными, когда мы строили нашу вертикальную фундаментальную модель, LogLM. В отличие от естественного языка, логи безопасности хаотичны, структурированы и фрагментированы. Наша первая задача заключалась в том, чтобы создать новый “язык” для интерпретации этих данных, позволяя LogLM учиться значимым представлениям из этих последовательностей. Мы также много инвестируем в то, как мы оцениваем производительность, поскольку в безопасности точность не является опциональной, а галлюцинации не являются приемлемыми.

Но за пределами технологий наша северная звезда всегда была коллективной защитой. Поэтому открытая совместная работа будет иметь решающее значение для того, чтобы сделать эту миссию успешной в масштабе.

Что означает “коллективная защита” на практике, и как она отличается от традиционных подходов к кибербезопасности?

На практике коллективная защита означает, что когда один экземпляр LogLM выявляет новое поведение атаки, скажем, кампанию по созданию C2 и эксфильтрации с помощью beaconing и аномального исходящего передачи данных, эта информация может быть дистиллирована в обобщенный поведенческий сигнал и поделена по всей экосистеме. Критически важно, что это не предполагает отправку сырых логов или данных клиентов. Вместо этого мы абстрагируем высокообоснованные поведенческие закономерности и включаем их в веса модели через методы федеративного обучения.

Это резкий контраст с устаревшими системами, которые полагаются на универсальные правила или статические потоки угроз. Эти системы не эволюционируют, пока не пострадают несколько жертв. С коллективной защитой система обнаружения эволюционирует с каждым высококачественным сигналом, даже если угроза гиперспецифична для одной среды. Это позволяет нам поймать полиморфные угрозы и потоки атак, усиленных ИИ, до того, как они станут широко распространенными.

Какие конкретные пробелы в безопасности предприятий привели к разработке LogLM, и как она фундаментально отличается от более старых систем обнаружения?

Команды безопасности предприятий сталкиваются с тремя основными проблемами: высоким соотношением шума и сигнала, хрупкими обнаружениями, которые не переносятся между средами, и медленной адаптацией к новым угрозам. LogLM была создана для решения всех трех.

Существующие системы в основном полагаются на правило-ориентированные или узкие подходы ИИ, которые требуют недель или месяцев настройки для понимания новой среды. Эти подходы терпят неудачу, когда атакующие слегка меняют тактику, как мы видели с группами, такими как Scattered Spider или Volt Typhoon. LogLM обучена на больших объемах данных безопасности, рассматривая их как своего рода структурированный язык. Это позволяет ей распознавать сложные последовательности, такие как всплеск подозрительных запросов DNS, последующий необычный исходящий трафик, не как изолированные аномалии, а как часть повествования об угрозе.

В отличие от устаревших инструментов, которые производят несвязанные оповещения, LogLM производит интерпретируемые, тактические обнаружения. И поскольку она построена с нуля, а не заимствована или адаптирована, она разработана с учетом безопасности с самого начала, что позволяет быстро адаптироваться всего за несколько дней безметочных логов. Это делает процесс подключения быстрым, а обнаружение намного более устойчивым.

Что такое тени агенты, и как они представляют риск для организаций, работающих без централизованного надзора?

Тени агенты – это автономные инструменты ИИ, часто построенные на основе моделей ИИ, которые работают внутри предприятия без явного разрешения или видимости со стороны команды безопасности. Недавний пример – это уязвимость нулевого дня в Microsoft 365 Copilot, вызванная простым запросом на суммирование электронных писем. Эта уязвимость позволяет атакующим эксфильтровать внутренние данные через контекст RAG агента без взаимодействия пользователя. Хотя эти агенты могут повысить производительность, они часто обходят обзор безопасности и подвергают конфиденциальные данные неконтролируемым слоям вывода.

Мы видели случаи, когда тени агент, построенный с помощью публичной модели ИИ, был подвергнут воздействию системных логов и начал утечку трассировок стека, содержащих закодированные учетные данные. Эти агенты обычно не оснащены контролями DLP, не следуют политикам доступа и не подвергаются аудиту. Хуже того, поскольку они могут принимать решения, такие как передача вывода внешним системам, они сами становятся поверхностями атаки. В контексте инъекции подсказок или цепной адверсарной атаки один агент может быть вынужден запустить последующие действия с реальным воздействием.

Почему инъекция подсказок и манипуляция моделью становятся серьезными угрозами, и почему большинство текущих систем не обнаруживают их?

Инъекция подсказок опасна, потому что она эксплуатирует основную функциональность модели: интерпретацию естественного языка. Большинство систем предприятий считают вывод модели достоверным, но если модель получает скрытые инструкции, встроенные в комментарий пользователя, вызов API или даже имя файла, она может быть обманута на выполнение непредвиденных действий. Мы видели, как атакующие используют это для извлечения учетных данных из истории чатов, имитации пользователей или обхода валидации ввода.

Более глубокая проблема заключается в том, что модели ИИ оптимизированы для связности, а не безопасности. Как мы исследовали в нашем недавнем ответе на исследование Королевского общества, модели отдают приоритет связности и общности над осторожностью и точностью. Даже подсказка их быть “более точными” может обратиться, что приводит к более уверенным, но все еще неправильным, ответам. И манипуляция моделью является долгосрочной проблемой. Атакующие могут отравить наборы данных или тонко сформировать вывод, повторяя структурированные запросы с течением времени, постепенно подталкивая модель в более пермиссивное поведенческое пространство. Обнаружение здесь требует полной цепочки логирования, непрерывной оценки и sandboxing на уровне модели, техник, которые большинство систем предприятий еще не приняли.

Как Tempo использует сопоставления MITRE ATT&CK, чтобы предоставить действенную разведку, а не просто сырые оповещения?

Tempo сопоставляет свои обнаружения с тактиками и техниками ATT&CK с помощью как контролируемых классификаторов, так и цепного поведенческого анализа. Когда система видит последовательность, такую как подозрительное выполнение PowerShell, изменение реестра и необычный исходящий трафик, она не просто предупреждает об каждом шаге, она помечает последовательность как “Выполнение > Обход защиты > Эксфильтрация”, соответствуя известным идентификаторам ATT&CK.

Это позволяет защитникам сразу понять цель противника и где они находятся в цепи убийства. Мы также предоставляем обогащение: затронутые сущности, связанные логи и баллы уверенности. Этот структурированный подход снижает когнитивную нагрузку для аналитиков SOC и ускоряет рабочие процессы реагирования, команды знают, какая тактика была использована, что привело к ней, и какой следующий шаг, скорее всего, будет. Это значительный скачок от систем усталости оповещений, которые срабатывают на каждой аномалии без повествовательного контекста.

Почему DeepTempo работает вверх по потоку от систем SIEM (Управление безопасностью и событиями), и как это положение улучшает обнаружение угроз и оптимизирует операции для команд безопасности?

SIEM склонны нормализовать и фильтровать логи, чтобы снизить затраты на ингестию. Но, делая это, они часто теряют ценный контекст, такой как точные метки времени, скачки задержки или эфемерное поведение сессии. DeepTempo работает вверх по потоку, ингестируя сырые телоданные до этой трансформации. Это позволяет нам моделировать более богатые поведенческие закономерности, такие как повторное использование токена службы с небольшими вариациями времени или редкие последовательности вызовов API, которые никогда не пройдут через пороги SIEM.

Работа вверх по потоку также означает, что мы можем снизить шум до того, как он достигнет SIEM. Вместо того, чтобы передавать петабайты строк логов в день, мы передаем 50-100 высококонтекстных событий с полным обогащением ATT&CK и оценкой модели. Команды тратят меньше времени на тренировку и больше времени на расследование угроз, которые имеют значение. Это также снижает затраты на хранение и вычисление SIEM, которые могут быть значительными в больших средах.

Что позволяет Tempo настраивать модели для новых сред так быстро, и как это сравнивается с традиционными рабочими процессами машинного обучения?

Традиционные системы машинного обучения часто требуют недель меток данных и повторной тренировки для адаптации к новой среде. Tempo использует фундаментально другой подход. Вместо начала с нуля она использует предварительно обученную модель, построенную на основе крупномасштабной, реальной сети телоданных, таких как NetFlow и VPC потоковые данные. Это дает ей сильное понимание того, как трафик и поведение обычно выглядят в различных средах.

Когда Tempo развертывается в новой среде, она не нуждается в метках данных или длительных циклах обучения. Она использует всего несколько дней местной сетевой активности, чтобы установить базовую линию и настроить себя для обнаружения закономерностей, специфичных для этой среды, таких как необычный доступ в нерабочее время, аномалии в коммуникации служба-сервис или неожиданное перемещение данных. Это происходит за часы, а не недели.

Поскольку процесс является самообучением, нет необходимости для команд безопасности вручную помечать или标ать события. И чтобы оставаться актуальными, когда среды эволюционируют, мы построили механизмы снимков, которые позволяют модели “забыть” устаревшие поведения, когда инфраструктура или политики меняются. Работа на уровне сети позволяет нам обнаруживать угрозы раньше и более широко, что отличает Tempo от традиционных инструментов безопасности, ориентированных на конечные точки или логи.

Как DeepTempo поддерживает высокую точность, минимизируя ложные положительные результаты, особенно в динамичных облачных средах?

Мы объединяем временное моделирование с контекстно-осведомленным сетевым поведенческим анализом, построенным直接 на NetFlow и VPC потоковых логах. Наш благородный подход к генерации последовательностей в сочетании с крупномасштабной предварительной тренировкой алгоритмов глубокого обучения на основе трансформеров помогает понять, как сетевые события разворачиваются во времени. Мы не флагируем один неудачный вход, но мы флагируем неудачный вход, за которым следует успешный вход с нового устройства, движение в сторону и необычный доступ к данным. Этот слоистый временной контекст фильтрует шум и подчеркивает реальные и новые угрозы.

Во-вторых, мы профилируем поведение пользователей и служб в контексте. Перезапуск узла Kubernetes 12 раз является нормальным во время обновлений, но подозрительным в 2 часа ночи, если за ним следует новое развертывание контейнера из неизвестного реестра. Tempo распознает это, потому что она смотрит на последовательность, время и контекст одновременно. Кроме того, наш активный пайплайн обучения активно отслеживает и собирает информацию о конкретных стилях обнаружения. Если пайплайн обнаруживает дрейф в производительности или данных, он будет использовать снимки и обратную связь от аналитиков, чтобы настроить небольшое количество параметров модели.

Мы строим наше обнаружение на сырых, высокочастотных сетевых метаданных, сочетая временную разведку с поведенческим базилированием для предоставления оповещений с высоким уровнем уверенности – даже в облачных средах, которые меняются в мгновение ока.

Какова роль объяснимости в вашей системе, и как вы обеспечиваете, чтобы оповещения приходили с полезным, интерпретируемым контекстом?

Каждое обнаружение в Tempo включает в себя краткое изложение, основные доказательства логов и выведенную тактику (например, “Доступ к учетным данным через Brute Force”). Мы также предоставляем граф связанных сущностей, пользователей, конечных точек, облачных ресурсов, чтобы команды SOC могли визуализировать инцидент. Цель – устранить “черный ящик”, который поражает многие системы ИИ.

Мы заимствовали из академических инструментов объяснимости, таких как LIME и SHAP, в ранних прототипах, но обнаружили, что они не являются интуитивными для аналитиков. Итак, вместо этого мы генерируем повествовательный язык: что произошло, когда, почему это подозрительно и насколько мы уверены. Это не только вопрос ясности, но и облегчения действий для аналитиков первого уровня без эскалации каждого оповещения.

Каковы долгосрочные риски атакующих, использующих ИИ и фундаментальные модели, и как DeepTempo планирует оставаться впереди?

Ландшафт угроз входит в фазу, когда атакующие могут развертывать агенты ИИ, которые самообучаются, мутируют полезные нагрузки на лету и имитируют законное поведение пользователя. Эти агенты могут работать 24/7, зондируя слабые места, адаптируясь с каждой неудачной попыткой. Это фундаментальный сдвиг, это больше не о днях нулевого дня, а о скорости, итерации и обфускации.

Мы готовимся, инвестируя в противостоящее обучение, обнаружение вверх по потоку и поведенческое моделирование, которое не полагается на известные индикаторы. Наша цель – выявить структуру злонамеренного поведения до его эскалации. Мы также исследуем способы отпечатка трафика атакующего, сгенерированного ИИ, как мы когда-то отпечатывали ботнеты, чтобы защитники могли пометить активность, даже когда полезные нагрузки постоянно меняются.

 Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить DeepTempo

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.