Haastattelut
Mayank Kumar, DeepTempo:n Perustaja ja AI-Insinööri – Haastattelusarja

Mayank Kumar on DeepTempo:n perustaja ja AI-insinööri, joka johtaa yhtiön perusrakenteen Log Language Model (LogLM):n suunnittelua ja kehittämistä. Vahvan akateemisen ja tutkimuslähtöisen taustansa ansiosta hänellä on erityisosaamista rakenteiden kehittämisessä, jotka parantavat uhkaiden havaitsemista ja reagointia kyberTurvallisuusympäristöissä.
DeepTempo on kyberturvallisuusyhtiö, joka on rakennettu LogLM:n ympärille, joka on AI-alkuperäinen perusmalli, joka on koulutettu suurten turvallisuuslokitietojen avulla. Alusta erottuu edistyneiden, aikaisemmin näkemättömien uhkien tunnistamisessa minimoiden samalla väärät positiiviset. Suunniteltu helppokäyttöiseksi integroinniksi olemassa oleviin turvallisuusvirroksiin, DeepTempo tukee käyttöönottoja datalakejen, Kubernetesin ja Snowflaken ympärillä, mahdollistaen nopeamman forensiikan, vähennetyt tietojen omaksumiskustannukset ja skaalautuvan, automaattisen puolustuksen modernille yrityksille.
Mikä johti sinut perustamaan DeepTempo:a, ja miten taustasi akateemisessa tutkimuksessa ja avoimessa AI:ssa vaikuttivat yhtiön suuntaan?
Kasvoin yhteisössä, jossa suhteet rakennettiin kasvotusten, ei ruutujen kautta. Isäni, opettaja, istutti minuun tärkeän antamisen merkityksen. Vaikka emme olleet materiaalisesti rikkaita, olimme rikkaita yhteyksissä ja tarkoituksessa. Sellaisessa ympäristössä opit nopeasti, että ongelmien ratkaiseminen ei ole vain yksilöllistä lahjakkuutta – se on yhteisöllistä voimaa. Se asenne pysyi minussa ja lopulta johti minun kiinnostukseen sosiaaliseen yrittäjyyteen opiskellessani insinööritieteitä IIT Roparissa.
Ratkaiseva hetki tuli, kun isäni selain joutui kiristyssalaisuuden hyökkäyksen kohteeksi. Se ei ollut vain tekninen vihje, se toi pelkoa, sekaannusta ja haavoittuvuutta kotiimme. Se kokemus avasi silmäni siihen, kuinka hauras digimaailma on, ei vain yksilöille, vaan myös organisaatioille, jotka ovat jatkuvasti uhkien alla. Tuolloin tapasin Evanin, jonka visio kollektiivisesta puolustamisesta internet-asteikolla resonoi minun kanssani. Se jaettu tehtävä – ja haluni soveltaa teknologiaa ihmisten hyväksi – vetivät minut DeepTempo:on.
Washingtonin yliopistossa tutkimukseni keskittyi kahteen keskeiseen alueeseen: monimodaaliseen edustamiseen ja datakeskeiseen AI:hen. Molemmat osoittautuivat kriittisiksi, kun rakensimme pystysuoraa perusmalliamme, LogLM:ää. Toisin kuin luonnollinen kieli, kyberturvallisuuslokit ovat sekavia, rakenteellisia ja sirpaleisia. Ensimmäinen haasteemme oli rakentaa uusi “kieli” tulkita tätä dataa, mahdollistaen LogLM:lle oppia merkityksellisiä edustuksia näistä sekvensseistä. Olemme myös investoineet paljon siihen, miten arviomme suorituskykyä, koska turvallisuudessa tarkkuus ei ole valinnainen, eikä hallusinaatioita voida hyväksyä.
Mutta teknologian ulkopuolella, meidän pohjoisen tähteenä on aina ollut kollektiivinen puolustus. Siksi avoimen lähdekoodin yhteistyö on olennainen tehtävän onnistumiselle laajassa mittakaavassa.
Mitä tarkoittaa “kollektiivinen puolustus” käytännössä, ja miten se eroaa perinteisistä kyberturvallisuuden lähestymistavoista?
Käytännössä kollektiivinen puolustus tarkoittaa, että kun yhden asiakkaan LogLM:n esiintymä tunnistaa uuden hyökkäyskäyttäytymisen, sanotaan uuden C2- ja exfiltration-kampanjan, jossa on mukana merkkivalo- ja poikkeuksellinen ulosmenojen tietoliikenne, se voidaan tiivistää yleistetyksi käyttäytymismalliksi ja jakaa ekosysteemin laajuisesti. Olennaisesti, tämä ei vaadi raakalogien tai asiakastietojen lähettämistä. Sen sijaan, me abstrahoidaan korkean luottamuksen käyttäytymismalleja ja sisällytämme ne mallipainoihin federoidun oppimisen tekniikoiden avulla.
Tämä on selvä kontrasti perinteisiin järjestelmiin, jotka luottavat joko yleispäteviin sääntöihin tai staattisiin uhkatiedon syötteisiin. Nämä järjestelmät eivät kehity, kunnes useita uhreja on vaikuttunut. Kollektiivisessa puolustuksessa havaintojärjestelmä kehittyy jokaisen laadukkaan signaalin mukaan, vaikka uhka on hyvin spesifinen yhdelle ympäristölle. Tämä mahdollistaa meidän havaita polymorfinen uhkat ja LLM-tukea saavat hyökkäysvirrat ennen kuin ne tulevat laajamittaisiksi.
Mitkä tarkat aukot yritysten turvallisuudessa johtivat LogLM:n kehittämiseen, ja miten se perustuu perinteisiin havaintojärjestelmiin?
Yritysten turvallisuustiimit kohtaavat kolme suurta ongelmaa: korkeat melu-signaali-suhteet, haurat havainnot, jotka eivät siirry ympäristöistä toisiin, ja hitaasti sopeutuminen uusiin uhkiin. LogLM luotiin ratkaisemaan nämä kolme ongelmaa.
Useimmat olemassa olevat järjestelmät luottavat sääntöpohjaisiin tai kapeisiin ML-lähestymistapoihin, jotka vaativat viikkoja tai kuukausia säätämistä ymmärtääkseen uuden ympäristön. Nämä lähestymistavat epäonnistuvat, kun hyökkääjät muuttavat taktiikkaansa, kuten ryhmillä kuten Scattered Spider tai Volt Typhoon. LogLM on koulutettu suurilla määrillä turvallisuustiedustelua, ja se kohdeltaa sitä kuin rakenteellista kieltä. Se mahdollistaa sille tunnistaa monimutkaisia sekvenssejä, kuten epäilyttävää ulosmenojen DNS-pyyntöjen ja poikkeuksellisen Okta-toiminnan jälkeen, ei erillisenä poikkeamana vaan osana uhkakertomusta.
Toisin kuin perinteiset työkalut, jotka tuottavat erillisiä hälytyksiä, LogLM tuottaa tulkittavissa, taktiikka-tasolla olevia havaintoja. Ja koska se on rakennettu kokonaan alusta, eikä uudelleenohjattu tai sovellettu, se on suunniteltu turvallisuudesta alusta alkaen, mahdollistaen nopean sopeutumisen vain muutamassa päivässä merkityksettömiä lokitietoja. Se tekee käyttöönoton nopeaksi ja havaintojen paljon kestävämmäksi.
Mitkä ovat varjohahmot, ja miten ne aiheuttavat riskin organisaatioille, jotka toimivat ilman keskitettyä valvontaa?
Varjohahmot ovat autonomisia AI-työkaluja, usein rakennettu LLM:ien päälle, jotka toimivat yrityksen sisällä ilman turvallisuustiimin eksplisiittistä valvontaa tai näkyvyyttä. Äskettäinen esimerkki on MITRE:n CVE-2025-32711 (“EchoLeak”), nollaklikkausvulnerabiliteetti Microsoft 365 Copilotissa, joka laukaistaan yksinkertaisesti pyytämällä sitä tiivistämään sähköposteja. Virhe sallii hyökkääjille tietojen vuotamisen sisäisen datan kautta agentin RAG-kontekstissa ilman käyttäjän vuorovaikutusta. Vaikka nämä agentit voivat parantaa tuottavuutta, ne usein ohittavat turvallisuuden tarkastuksen ja altistavat arkaluontoisia tietoja hallitsemattomille päättelykerroksille.
Olemme nähneet tapauksia, joissa varjohahmo, joka on rakennettu julkisella LLM:llä, on altistunut järjestelmälokeille ja alkanut vuotamaan pinorakenteita, jotka sisältävät kovakoodatut tunnistetietoja. Nämä agentit eivät yleensä ole varustettu DLP-ohjaimilla, eivät noudata pääsykäytäntöjä eivätkä ole tarkastettuja. Pahimmassa tapauksessa, koska ne voivat tehdä päätöksiä, kuten eteenpäin lähettäminen ulkoisiin järjestelmiin, ne muodostavat itse hyökkäyspinnan. Prompt-injektion ja mallin manipuloinnin kontekstissa yksittäinen agentti voidaan pakottaa laukaisemaan alasvirtaisia toimia, joilla on todellinen vaikutus.
Miksi prompt-injektio ja mallin manipulointi muodostuvat vakaviksi uhiksi, eikö nykyiset järjestelmät havaitse niitä?
Prompt-injektio on vaarallista, koska se hyödyntää mallin keskeistä toimintoa: luonnollisen kielen tulkintaa. Useimmat yritysjärjestelmät käsittävät mallin tulokset luotettavina, mutta jos malli vastaanottaa piilotettuja ohjeita, upotettuna käyttäjän kommenttiin, API-kutsuun tai jopa tiedostonimeen, se voidaan huijata suorittamaan tahattomia toimia. Olemme nähneet viholliset käyttävät tätä menetelmää luodakseen todennuksia chat-historioista, Impersonoidaakseen käyttäjiä tai ohittamaan syötteen validoinnin.
Syvempi ongelma on, että LLM:t ovat optimoituja koherenssille, ei turvallisuudelle. Kun tutkimme Royal Societyn tutkimusta, mallit priorisoivat sujuvuutta ja yleisyyttä varovaisuuden ja tarkkuuden sijaan. Jopa ohjelmoimalla niitä “olemaan tarkempi” voidaan saada aikaan vain luottavampia, mutta yhä väärin, vastauksia. Ja vihamielinen mallin manipulointi on pitkäaikainen huolenaihe. Hyökkääjät voivat myrkyttää tietokantoja tai hienovaraisesti muotoilla tulosteita toistamalla rakenteellisia kyselyjä ajan myötä, hitaasti työntäen mallia myöntävämmän käyttäytymisen tilaan. Havaitseminen edellyttää täysin ketjun lokitusta, jatkuva arviointia ja mallitasolla sandboxausta, tekniikoita, joita useimmat yritysjärjestelmät eivät ole vielä omaksuneet.
Miten Tempo käyttää MITRE ATT&CK-kartauksia toimittamaan toimintatietoa raw-hälytyksen sijaan?
Tempo kartoittaa havaintonsa ATT&CK-taktiikoihin ja -tekniikoihin valvottujen luokittimien ja havainnonketjujen avulla. Kun järjestelmä näkee sekvenssin, kuten epäilyttävän PowerShell-suorituksen, rekisteriavaimen muutoksen ja epätavallisen ulospäin suuntautuvan liikenteen, se ei vain hälytä kussakin vaiheessa, vaan se merkitsee sekvenssin suorittamiseksi > puolustuksen välttämiseksi > tietojen vuotamiseksi, vastaavasti tunnettuja ATT&CK-tunnisteita.
Tämä mahdollistaa puolustajille ymmärtää vihollisen tavoitteen ja missä he ovat tappoketjussa. Tarjoamme myös rikastusta: vaikuttavat entiteetit, liittyvät lokit ja luottamusluokat. Tämä rakenteellinen lähestymistapa vähentää kognitiivista kuormitusta SOC-analyytikoille ja kiihdyttää reagointiprosesseja; tiimit tietävät, mikä taktiikkaa käytettiin, mitä seurasi ja mikä seuraava vaihe todennäköisesti on. Se on merkittävä askel hälytysväsymyksen järjestelmistä, jotka laukaisevat hälytyksen jokaisesta poikkeavuudesta ilman kertomuskontekstia.
Miksi DeepTempo toimii SIEM-järjestelmien (Turvallisuuden tiedon ja tapahtuman hallinta) yläpuolella, ja miten tämä asema parantaa uhkien havaitsemista ja sujuvoittaa toimintoja turvallisuustiimille?
SIEM-järjestelmät taipuvat normalisoimaan ja suodattamaan lokit vähentääksesi omaksumiskustannuksia. Mutta tekemällä niin, ne usein menettävät arvokasta kontekstia, kuten tarkkoja aikaleimoja, viivepiikkejä tai hetkellisiä istuntojen käyttäytymistä. DeepTempo toimii ylävirrassa, omaksuen raakaa tietoa ennen tämän muodonmuutosta. Tämä mahdollistaa meille mallittaa rikkaampia käyttäytymismalleja, kuten palvelutunnisteiden uudelleen käyttöä pienin aikamuutoksin tai harvinaisia API-kutsusekvenssejä, jotka eivät koskaan pääsisi SIEM-kynnyksen yli.
Toimimalla ylävirrassa, voimme myös vähentää melua ennen kuin se edes osuu SIEM:iin. Sen sijaan, että lähettäisimme petatavun logirivejä päivässä, välitämme 50-100 korkean kontekstin tapahtumia, joissa on täydellinen ATT&CK-rikastus ja mallipohjainen arviointi. Tiimit viettävät vähemmän aikaa hälytysten karsimiseen ja enemmän aikaa tutkimiseen uhkiin, jotka ovat merkityksellisiä. Tämä alentaa myös SIEM-tallennus- ja laskentakustannuksia, jotka voivat olla merkittäviä suurissa ympäristöissä.
Mikä mahdollistaa Tempolle mallien hienosäätö uusiin ympäristöihin nopeasti, ja miten se vertautuu perinteisiin koneoppimisen työvirtoihin?
Perinteiset ML-järjestelmät usein vaativat viikkoja merkittyjä tietoja ja uudelleen koulutusta sopeutuaan uuteen ympäristöön. Tempo ottaa perustavanlaatuisesti erilaisen lähestymistavan. Sen sijaan, että aloittaisimme alusta, se hyödyntää esikoulutettua mallia, joka on rakennettu suurten, todellisten verkkoliikenteen tietojen avulla, kuten NetFlow- ja VPC-virtausdataa. Tämä antaa sille vahvan ymmärryksen siitä, miten liikennevirrat ja käyttäytymisen tavat yleensä näyttävät moninaisissa ympäristöissä.
Kun Tempo otetaan käyttöön uuteen asetelmaan, se ei tarvitse merkittyjä tietoja tai pitkiä oppimisjaksoja. Se käyttää vain muutamia päiviä paikallista verkkotoimintaa perustamaan perusviivan ja hienosäätämään itsensä havaitsemaan ympäristöön spesifejä malleja, kuten epätavallista ulosajoa työaikojen ulkopuolella, palvelun ja palvelun välisiä kommunikaatioanomaliasta tai odottamattomia tietoliikenteen siirtoja. Tämä tapahtuu tunteissa, ei viikoissa.
Koska prosessi on itseohjattu, turvallisuustiimien ei tarvitse manuaalisesti merkitä tai merkitä tapahtumia. Ja pysyäkseen ajan tasalla, kun ympäristöt kehittyvät, olemme rakentaneet snapshot-mekanismit, jotka sallivat mallille “unohtaa” vanhentuneita käyttäytymismalleja, kun infrastruktuuri tai käytännöt muuttuvat. Toimimalla verkkotasolla, voimme havaita uhkia aiemmin ja laajemmin, mikä erottaa Tempoa perinteisistä päätepiste- tai lokikeskeisistä turvallisuustyökaluista.
Miten DeepTempo ylläpitää korkeaa tarkkuutta minimoiden samalla väärät positiiviset, erityisesti dynaamisissa pilviympäristöissä?
Yhdistämme aikamuotoinen mallinnus ja kontekstia vaativa verkkokäyttäytyminen analyysi, rakennettu suoraan NetFlow- ja VPC-virtauslokeihin. Meidän jalostettu sekvenssien generointitapa yhdistettynä suurimittakaavan esikoulutukseen transformer-pohjaisilla syvällisillä oppimisalgoritmeilla auttavat ymmärtämään, miten verkkotapahtumat kehittyvät ajan myötä. Emme vain merkitse yksittäistä epäonnistunutta kirjautumista, mutta merkitsemme epäonnistuneen kirjautumisen, jota seuraa onnistunut kirjautuminen uudesta laitteesta, sivusuunnan liikkuminen ja epätavallinen tietoliikenne. Tämä kerroksellinen aikamuotoinen konteksti suodattaa melun ja korostaa todellisia ja uusia uhkia.
Toiseksi, profiloimme käyttäjien ja palvelujen käyttäytymistä kontekstissa. Kubernetes-solmun uudelleenkäynnistys 12 kertaa on normaalia päivitysten aikana, mutta epäilyttävää kello 2 aamulla, jos seuraa uuden kontainerin käyttöönottoa tuntemattomasta rekisteristä. Tempo tunnistaa tämän, koska se tarkastelee sekvenssiä, ajoitusta ja kontekstia yhtä aikaa. Me myös rakennamme aktiivisen oppimisputken, joka seuraa ja kerää tietoa tietyistä havaintotyyppien suorituskyvystä. Jos putki havaitsee suorituskyvyn heilahtelua tai tietojen muutosta, se käyttää snapshotteja ja analyytikkojen palautetta hienosäätämään mallin parametreja.
Rakennamme havaintomme raakoihin, korkealaatuisiin verkkometatietoihin, yhdistäen aikamuotoista älykkyyttä käyttäytymisen perusviivojen kanssa, toimittamaan korkean luottamuksen hälytyksiä – jopa pilviympäristöissä, jotka muuttuvat silmänräpäyksessä.
Mikä on selitettävyyden rooli järjestelmässänne, ja miten varmistatte, että hälytykset tulevat käytännöllisen ja tulkittavissa olevan kontekstin kanssa?
Jokainen havainto Tempossa sisältää yhteenvedon, perustavan logi-evidenssin ja johtuvan taktiikan (esim. tunnistetietojen pääsy Brute Forcen kautta). Tarjoamme myös liittyvien entiteettien graafin, käyttäjien, päätepisteiden, pilviresurssien, jotta SOC-tiimit voivat visualisoida tapahtuman. Tavoitteena on poistaa “musta laatikko” -vaikutus, joka vaivaa monia AI-järjestelmiä.
Olemme lainanneet akateemisista selitettävyyden työkaluista, kuten LIME ja SHAP, alkuvaiheen prototyypeistä, mutta havaitsemme, etteivät ne ole intuitiivisia analyytikoille. Sen sijaan, generoimme selkeän kielisen kertomuksen: mitä tapahtui, milloin, miksi se on epäilyttävää ja kuinka varma olemme. Tämä ei ole vain selkeää, vaan se mahdollistaa myös tier-one-analyytikoille toimia ilman joka hälytyksen eskaloimista.
Mitkä ovat pitkän aikavälin riskit hyökkääjien käytölle AI:ta ja perusmalleja itse, ja miten DeepTempo aikoo pysyä edellä?
Uhkakuvamaailma on siirtymässä vaiheeseen, jossa hyökkääjät voivat käyttää itseoppivia AI-agenteja, jotka muuttavat hyökkäyskuormia lennossa, simuloivat legitiimejä käyttäjänkäyttäytymistä ja toimivat 24/7 etsimällä heikkoja kohtia. Nämä agentit voivat toimia ilman keskeytyksiä, sopeutuen jokaisen epäonnistuneen yrityksen jälkeen. Se on perustavanlaatuinen muutos; se ei ole enää nollapäivähyökkäyksistä, vaan nopeudesta, iteroinnista ja peittämisestä.
Päästäksemme valmiiksi, investoimme vastustuskykyiseen koulutukseen, ylävirran havaintoihin ja käyttäytymismallien muodostamiseen, joka ei riipu tunnetuista indikaattoreista. Tavoitteemme on tunnistaa vaarallisen käyttäytymisen rakenne ennen kuin se eskaloituu. Olemme myös tutkimassa keinoja sormeilua AI:n tuottamalle hyökkääjien liikenteelle, aivan kuten aikoinaan sormeilimme botnetit, jotta puolustajat voivat merkitä toimintaa, vaikka kuormat muuttuvat jatkuvasti.
Kiitos hienosta haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla DeepTempo:ssa.












