Rozhovory

Elizabeth Nammour, generální ředitelka a zakladatelka společnosti Teleskope – série rozhovorů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Elizabeth Nammour, CEO a zakladatelka Teleskope, je bezpečnostní inženýrka, která se stala zakladatelkou, jejíž kariéra zahrnuje datové bezpečnost, softwarové inženýrství a inovační role ve některých z největších technologických organizací na světě. Zatímco pracovala jako seniorní softwarový inženýr se zaměřením na datovou bezpečnost v Airbnb (ABNB ), narazila na provozní výzvu spočívající v pochopení a kontrole enormního, rychle rostoucího majetku dat rozprostřeného přes desítky systémů. Tato zkušenost, kombinovaná s předchozími technickými a strategickými roli v Amazonu a Booz Allen Hamilton (BAH ), formovala její perspektivu na to, jak moderní organizace bojují s vládnutím citlivými daty v měřítku a nakonec ji vedla k vybudování společnosti, která řeší tuto mezeru. (AMZN )

Teleskope je moderní platforma pro datovou bezpečnost, která je navržena tak, aby pomohla organizacím neustále rozumět, kde jejich data žijí, jak jsou používána a jaké rizika vytvářejí, jak se prostředí stávají složitějšími. Postavená s ohledem na vývojáře a bezpečnostní týmy, platforma zdůrazňuje přesnou viditelnost dat, automatizovanou nápravu a řízené kontroly napříč cloudovými, SaaS a hybridními prostředími. Přechodem za statické audity a manuální procesy si Teleskope klade za cíl poskytnout organizacím praktický základ pro správu datového rozptylu a zároveň umožnit odpovědnou adopci AI.

Vy jste založila Teleskope poté, co jste ve společnosti Airbnb vyvinula interní nástroje pro datovou bezpečnost za účelem katalogizace a klasifikace dat ve velkém měřítku. Jaký okamžik vás přesvědčil, že to musí být společnost, a notně interní projekt, a jak tyto rané урокy formovaly vaši produktovou tezi?

Když jsem dokončila stavbu tohoto produktu v AirBnB, měla jsem příležitost napsat příspěvek na blog AirBnB nazvaný “Automatizace ochrany dat v měřítku”. Nikdy jsem opravdu neočekávala, že by z toho něco vzniklo, ale bezpečnostní komunita reagovala velmi pozitivně a začala jsem dostávat žádosti od praktiků z celého světa. Určitě jsem měla tento okamžik, kdy jsem si uvědomila, že tolik lidí sdílí stejné výzvy, kterým jsem čelila, a že tento produkt je něco, co trh skutečně požaduje. V počátcích jsem se hodně spoléhala na zpětnou vazbu od kolegů a dokonce i Teleskope v1.0 bylo mnohem lepší než to, co jsem původně postavila v AirBnB. Dnes je náš produkt větší a má větší dopad, než jsem si kdy mohla představit.

Vaše multi-modelová klasifikační pipeline kombinuje tradiční ML, formátově specifické modely a validaci GenAI. Můžete nás provést logikou rozhodování a tím, jak snižujete falešné pozitivy/negativy v měřítku?

Určitě bych doporučila přečíst si náš blog, který jsem napsala spolu s naším vedoucím oddělení Data Science, Ivanem, o klasifikaci dat. Nejprve řeknu, že se jedná o umění, stejně jako o vědu. Existuje obrovské množství nuancí – každé nalezení citlivého datového subjektu bude mít jedinečný kontext. Zatímco měřítko dat učinilo tento problém neskonale složitějším, protože skenování petabajtů produkčních dat vyžaduje大量 výpočetního výkonu a času. Základní důvod, proč je tento problém považován za stále nevyřešený.

Tam, kde umění přichází, je najít způsob, jak vyvážit všechny kompromisy – rychlost, latenci, přesnost, náklady a šíři (v úložištích dat, formátech souborů, jazycích atd.). Věříme, že odpověď musí být kreativní a musí být multi-modální. Proto jsme přijali přístup, který kombinuje mnoho dostupných klasifikačních metod, abychom měli dynamický a nuancovaný přístup, který, abychom to shrnuli, je navržen tak, aby používal co nejjednodušší metodu, aniž by významně obětoval přesnost. Tento dynamický přístup nám umožňuje skenovat data 10-20x rychleji než nástroje, které závisí na univerzálních LLM, a zároveň dodává mnohem přesnější výsledky než REGEX nebo konvenční kontextově založené přístupy.

Nedávno jste představila Prism, zaměřenou na porozumění obchodním datům a GenAI poháněnou nápravou. Jaké nové použití se otevírají ve srovnání s detekcí PII na úrovni elementů, a jak chráníte proti halucinacím v nápravných akcích?

Když jsem se poprvé pokusila řešit výzvu klasifikace a ochrany dat, můj zaměřením bylo snižovat skutečné falešné pozitivní výsledky. Například, jak zajistíme, aby alespoň 95 % času, kdy označíme něco jako číslo sociálního zabezpečení, skutečně bylo číslem sociálního zabezpečení. Před několika lety by i 80% přesnost napříč různými typy datových prvků byla zlepšením.

Ale pracováním v úzké spolupráci s našimi zákazníky v minulém roce se stalo jasné, že “šum”, který týmy zahlcuje, není pouze způsoben nepřesnými klasifikacemi datových subjektů (tradiční “falešné pozitivy”). Šum je často stejně tak způsoben zahlcením irelevantními výstrahami, jako je získávání falešných výstrah. To, co Prism dělá, je odemknout naši schopnost zohlednit mnohem více kontextu – ne pouze “co je toto kus dat” nebo “kdo přistupuje k tomuto souboru”, ale také “co, prakticky řečeno, je tento soubor”. Kombinací tohoto s informacemi, které můžeme získat o tom, co konkrétní podnik skutečně dělá a o co se stará, můžeme dodávat produkt, který se přizpůsobí každé společnosti odlišným definicím “citlivých” dat.

Zachycení této úrovně nuancovaného kontextu je skutečným game-changerem. Ukládání stovek čísel sociálního zabezpečení do dokumentu Google (GOOGL ) v osobním disku, například, by mohlo být velkým rizikem a porušením vaší politiky správy dat. Ale mít složku v zabezpečeném HR disku plném W2 vašich zaměstnanců? To je očekávané chování. Bezpečnostní týmy chtějí být upozorněny na první případ, ale získání výstrahy pro každý zaměstnanecký W2, uložený správně, je pouze šum. Porozumění tomu, kde a v jakém kontextu citlivá data sídlí, vyžaduje více než jen model klasifikace subjektu.

Pracujeme s mezinárodní chemickou společností, Chevron (CVX ) Philips Chemicals. Tento podnik by nikdy nekoupil nástroj na ochranu soukromí nebo standardní DSPM, protože oni skutečně nevidí riziko spotřebitelských dat jako prioritu. Co se jim ale zajímá, je duševní vlastnictví ve formě proprietárních chemických rovnic. Abychom mohli zjednodušit podstatu dokumentu na seznam seskupených štítků, můžeme nejen detekovat jedinečné citlivé prvky, ale také najít instance těchto datových aktiv, která se nacházejí na “nesprávných” místech. Kombinací tohoto kontextu s naší automatizovanou nápravou, můžeme poté podniknout akci k archivaci, smazání, redakci nebo přesunu těchto souborů do jejich správné polohy. Nikdo na trhu s datovou bezpečností nedělá tuto práci.

Teleskope zdůrazňuje kontinuální objevování napříč multi-cloud, on-prem a třetími systémy – včetně stínových dat. Co vypadá “úplná mapa” pokrytí, a jak rychle můžete povrchovat neznámé úložiště v greenfield nasazení?

“Úplná” je slovo, které je zde trochu matoucí – ve skutečnosti je to laťka, která se neustále pohybuje, a to i denně. To je to, jak těžké je spravovat datový rozptyl. Naším cílem bylo vždy, aby Teleskope existovala všude, kde existují data našich zákazníků. Jsme v mnoha ohledech produkt založený na integraci – vyvinuli jsme desítky proprietárních datových konektorů, abychom mohli procházet, skenovat a klasifikovat data napříč širokou škálou SaaS nástrojů, cloudových úložišť dat a on-premise systémů. Většina zákazníků začíná s několika konektory, které považují za nejvyšší riziko, nebo kde mají nejméně viditelnosti, takže ve skutečnosti jsme zřídka všude, kde se nachází data společnosti. Nicméně, v rámci každého zdroje dat, neustále procházíme jejich prostředí, abychom povrchovali nová účta, tabulky, nové bloky, soubory, zprávy atd. Takže ať jsme kdekoliv, nacházíme data, nová i stará, v téměř reálném čase.

Pro AI bezpečnost & governance, jak sledujete linii mezi trénovacími datovými sadami, modely, podněty a výstupy pro auditovatelnost?

Máme tři základní způsoby, jak podporujeme AI bezpečnost a governance. První je naše schopnost aplikovat naši klasifikační a nápravnou technologii na data v pohybu prostřednictvím našich API. Když společnosti generují nebo připravují datové sady pro trénování svých vlastních modelů, potřebují způsob, jak zajistit, aby tato data byla zbavena PII nebo jiných citlivých dat. Takže se zapojíme přímo do datové pipeline a můžeme očistit datové sady, zatímco se pohybují nebo kopírují do trénovací sady, zajistíme, že tyto modely nikdy nejsou vystaveny riziku výstupu citlivých dat.

Druhý způsob, jak vidíme náš hlavní produkt, je jako umožňující adopci AI. Každá společnost je pod tlakem, aby využívala AI nástroje, aby operovala efektivněji a udržovala krok s trhem. Velmi dobrým příkladem je M365’s Copilot, který poskytuje inteligentní vyhledávání a usnadňuje najít soubory nebo data. Ale tyto nástroje definicí usnadňují najít citlivá data také, a tak máme mnoho společností, které přicházejí k nám a říkají: “musíme implementovat tento AI nástroj, ale bojíme se, co bude povrchovat.” Potřebují Teleskope, aby přišlo, proskenovalo jejich prostředí a automaticky vynutilo jejich datové bezpečnostní a správní politiky, aby mohli adoptovat AI s důvěrou.

Nakonec stavíme integrace pro AI nástroje, které budou redigovat nebo karanténně izolovat podněty, které obsahují citlivá data, dříve než mohou být propuštěny do veřejných AI nástrojů, jako je ChatGPT. Spousta společností prostě zakazuje používání těchto nástrojů, ale existuje způsob, jak je adoptovat bezpečně, aby se zajistilo, že žádná citlivá data (jak je definována každou společností) nebudou vyčerpána.

Redakce a “náprava na místě” jsou jádrem vašeho přístupu. Jaký je váš filozofický přístup k auto-nápravě vs. human-in-the-loop, a kde kreslíte bezpečnostní hranice?

Uvědomili jsme si před několika lety, že, stejně potřebné, jak jsou objevování a klasifikace dat, poskytují pouze polovinu příběhu. Nacházení datového rizika je prvním krokem, ale řešení a náprava tohoto rizika je skutečným konečným cílem. Naši zákazníci obvykle začínají vyhodnocováním zjištění Teleskope v našem katalogu dat, poté přecházejí k nápravě s human-in-the-loop, než se přesunou k plně automatizované nápravě. Jsme si velmi vědomi, že ve skutečnosti budou vždy existovat některé akce, které týmy nikdy nebudou plně komfortní s plnou automatizací. Smazání dat z produkčního databáze, například, by mohlo být velmi problematické. Ale ve mnoha případech vidíme, že zákazníci adoptují plnou automatizaci pro věci, jako je odvolání oprávnění, přesunutí dat, vynucení archivačních nebo retence politik atd.

Mnohé DSPM/DLP nástroje bojují se skutečnou ochranou v reálném čase. Co muselo změnit architektonicky, aby se “reálný čas” stal samozřejmostí, a jakou latenci a propustnost lze očekávat v produkčním prostředí?

Abychom mohli řešit problém reálného času, bylo důležité rozložit úkoly na jejich základní součásti. Různé situace vyžadují různé typy latencí, ale cílem je vždy poskytnout nejrychlejší možnou cestu k získání nejpreciznějších informací. To znamená, že flexibilní architektura, která by umožnila paralelizovat náš systém s nízkou latencí, aby se přizpůsobil různým požadavkům na propustnost. Když má podnik Teleskope spuštěné ve svém prostředí, data jsou klasifikována a chráněna přímo v jejich infrastruktuře, snižují se tím latence a tok dat. Tento fakt umožňuje poskytnout nápravu v případech s vysokým rizikem v podsekundových časových rámcích.

Ochrana soukromí a dodržování předpisů: tvrdíte, že máte kontinuální monitorování a automatické mapování na rámce/předpisy. Jak udržujete mapování aktuální, jak se zákony vyvíjejí, a jak jsou ovládání přizpůsobitelná pro různé regiony nebo obchodní jednotky?

Upřímně, náš zaměřením se skutečně posunulo od zaškrtnutí políček k hlubšímu porozumění tomu, co se našich zákazníků týká. V některých případech chtějí mapovat 100 % na nejnovější předpisy, které vycházejí, a my neustále monitorujeme tyto změny a začleňujeme je do našeho produktu. Ale, pravdivě, většina společností je tak daleko od toho, aby mohly plně dodržovat tyto zákony, že se musíme setkat s nimi tam, kde jsou, a zajistit, že můžeme je dostat z bodu A do bodu B do bodu C, než se budeme starat o to, abychom se dostali k bodu Z. Způsob, jakým to děláme, je tím, že nejprve rozumíme tomu, co dodržování předpisů znamená pro tuto společnost (opět, výrobní společnost možná nevidí něco jako GDPR jako hlavní obavu), a zajišťujeme, že můžeme tvarovat produkt kolem jejich specifických rizikových profilů a potřeb.

Adopce GenAI: jak zákazníci používají Teleskope k vytvoření “bezpečných vstupů” a “bezpečných výstupů” bez degradace rychlosti vývoje?

Zákazníci integrují Redact API Teleskope do svých trénovacích a inferenčních pipeline, aby zajistili, že citlivá data nikdy neproudí do generativních AI modelů. Proces redakce je abstrahován od vývojářů, čímž se zachovává rychlost vývoje tím, že se redakce provádí před inferencí a rehydratací dat poté.

Pohledem vpřed, jste mluvila o koncovém “agentic” datovém bezpečnostním produktu s autonomní nápravou. Jaké milníky budou signalizovat, že je průmysl připraven pro plně autonomní ochranu dat?

Víme s jistotou, že je průmysl připraven na to. Jiné oblasti kybernetické bezpečnosti, jako je SOC, již prokázaly úplný posun směrem k agentic AI jako prostředku pro škálování kapacity bezpečnostních týmů. Máme frontu zákazníků, kteří žádají o to, aby byli designovanými partnery pro tuto práci, takže víme, že mnoho společností cítí stejnou bolest, že musí stále manuálně triážovat, vyšetřovat, přijímat rozhodnutí a poté provádět, aby vyřešili jediný ticket. Máme absolutní přesvědčení, že tímto směrem se trh ubírá, a jsme odhodláni vést tento posun.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Teleskope.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.