Interviews
Chester Leung, medstifter og chef for AI-platform hos OPAQUE – Interviewserie

Chester Leung er medstifter og chef for platformarkitektur hos OPAQUE, et Series A-startup, der bygger en konfidentiel data- og AI-platform, der giver teams mulighed for at udvide deres virksomhedsdata pipelines med en konfidentiel lag, hvilket muliggør hurtigere indsigt med mindre indsats og verificerbar privatliv og kontrol.
Tidligere var Chester en computer science-student ved UC Berkeley, hvor han offentliggjorde peer-reviewed artikler på topkonferencer og også fungerede som lead-maintainer af det open-source MC2-projekt til sikker samarbejdsanalyse og maskinlæring.
De co-foundede Opaque efter din tid på UC Berkeley’s RISELab, hvor dit arbejde brogede AI og sikre systemer. Hvad var det specifikke hul i virksomhedsdata-infrastruktur, du så, der førte til oprettelsen af OPAQUE, og hvordan informerede din akademiske erfaring virksomhedens retning?
På det tidspunkt var der en enorm fokus, både i akademien og i industrien, på at udnytte maskinlæring til bestemte anvendelsesområder. I laboratoriet havde vi ekstremt held med at have store virksomheds-sponsorer, der hjalp os forskere med at forme vores arbejde til at løse mere presserende problemer, som de stod overfor i deres organisationer. Vores gruppe havde i særdeleshed en unik mulighed for at arbejde tæt sammen med teknologi- og bank-, finans- og forsikringsvirksomheder (BFSI) til at løse svære privatlivsproblemer i forbindelse med brugen af følsom, men værdifuld data til maskinlæring. Ligesom alle områder af AI, afhænger maskinlæring af store mængder af højkvalitetsdata for at producere værdifulde og robuste indsigt.
Vi stødte på det samme mønster gang på gang, mens vi samarbejdede med hold fra Amazon (AMZN ), Scotiabank og Ant Group (dengang Ant Financial): deres maskinlæringsbaserede projekter stoppede, før de nåede produktion på grund af bekymringer omkring brugen af følsom, men kritisk data til disse anvendelsesområder. Med andre ord, disse hold kunne ikke bruge AI i projekter, som de vidste, kunne generere værdi for virksomheden, ikke på grund af et teknisk problem med AI, men fordi de ikke kunne få adgang til den rette data.
Hos Opaque har vi løst et identisk problem. Vi hjælper hold med at få adgang til den rette data, så de kan låse op eller sælge deres AI-kapaciteter. Den eneste ændring, siden vores forskningsdage, har været, at problemets urgencen er øget: vi ser nu konsekvent AI-adopterings- og integrationsprocesser, som fortsat er begrænsede af adgangen til den rette data, og som er blevet en virksomhedsomfattende strategisk imperativ.
I et landskab, hvor virksomheder investerer massivt i resonansmodeller og agens-ai, hvorfor tror du, at sikre data-pipelines er mere vigtige end nogensinde?
Sikre data-pipelines er rygmarven, på hvilken virksomheder bygger resonansmodeller og agens-ai. Alt fra træning af disse resonansmodeller til implementering af agens-ai indebærer følsom data og afhænger af sikre data-pipelines.
For eksempel ser vi nu, som en industri, en stigende investering i generering af højkvalitetsdata til at træne disse modeller. Nogle rapporter har endda forudsagt, at investeringen i generering af højkvalitetsdata snart vil overstige investeringen i træning af modellerne selv. Naturligvis er data-generering en multi-trin-proces, der drives af pipelines, der producerer en virksomheds mest værdifulde IP: højkvalitets-domænespecifik data, der kan træne modeller, der genererer enorm værdi downstream. Investeringen i at generere denne data er enorm, og den genererede data, givet sin afstamning, adskiller en virksomhed fra dens konkurrenter og fungerer som dens grav. En virksomhed må gøre alt, hvad den kan, for at sikre denne pipeline.
OPAQUES konfidentielle computing-platform muliggør analyse på krypteret data. Hvad er de centrale tekniske udfordringer i at gøre dette både skalerbart og udvikler-venligt for virksomheds-miljøer?
Vores konfidentielle AI-platform muliggør ikke kun analyse, maskinlæring og generativ AI på krypteret data, men giver også verificerbar bevis for, at din data blev brugt på måder, som kun du forventer og tillader.
De centrale udfordringer, med hensyn til skalerbarhed, udvikling og administration, ligger i at gøre orkestreringen af arbejdsbyrden sikker og verificerbar i skala. I særdeleshed bruger mange virksomheder i dag managed cloud services, når de har brug for at skalerer. Dette kan være både omkostningseffektivt og praktisk. Men udfordringen bliver, hvordan en organisation kan sikre og verificere software, der ikke er under deres kontrol? Hvis organisationen tager kontrollen over al softwaren, hvad giver de så op ved ikke at bruge en managed service, og hvad mister de ved at gøre det?
DU har sagt, at sikkerhed-by-design-arkitektur kan give en varig konkurrencefordel. Kan du uddybe, hvordan denne princip spiller ud i praksis for virksomheds-AI-hold?
Der er to vinkler at se på dette fra: en produktvinkel og en ingeniørvinkel.
Set fra en produktvinkel forstår alle, at deres data er radioaktiv, deres grav eller begge dele. Virksomheder bliver mere og mere modne i deres evaluering af løsningers data-integritet, sikkerhed og suverænitet. Følgelig må ethvert hold, der bygger ethvert produkt, der behandler virksomhedsdata, give garantier for, at den behandlede data kun er synlig for og brugt af autoriserede parter og enheder. En sikkerhed-by-design-arkitektur giver tillid til, at data-integritet, sikkerhed og suverænitet var førsteklasses-overvejelser i produktets design, og giver mulighed for, at produktet kan give disse garantier.
Set fra en ingeniørvinkel er en sikkerhed-by-design-arkitektur mere udvidbar og fremtidssikret. Juridiske, risiko- og compliance-hold bliver mere og mere strænge i deres reaktion på nye risici og regler. Derfor bør ingeniør-organisationer ønske at bygge et sikker virksomheds-AI-system fra starten, så de ikke behøver at omkonstruere og/eller lave patches på deres system, når de indser, at deres eksisterende system er utilstrækkeligt sikret og risiko-frit. At omkonstruere og lave patches koster måneder, hvis ikke år, af dyrebetalt ingeniør-arbejdskapacitet.
Hvordan bør organisationer omdefinere rollen af data – ud over en ressource – som en forsvarlig grav?
Der er en voksende enighed i branchen om, at data snart kan være den eneste grav, en organisation har. Vi har set forskning og ingeniør-talent og de fantastiske teknologier og produkter, de bygger, hoppe fra organisation til organisation. Som følge heraf kan mange organisationer tilbyde de samme produkter, støttet af de samme teknologier.
Hvad der ikke let kan overføres fra organisation til organisation, er dog en organisations data – medmindre det er lækket. Desuden er det netop denne data, der kan gøre et produkt mere tiltrækkende end dets konkurrenter – mere personligt, tilpasset og domænespecifikt. Organisationer må gøre alt, hvad de kan, for at sikre deres data, så de kan udnytte deres data som den konkurrencefordel.
Hvad ligner en resilient AI-pipeline i praksis, og hvordan hjælper den virksomheder med at undgå skjulte omkostninger eller risici, når de skal udvide deres AI-implementationer?
En resilient AI-pipeline er en, der er pålidelig, fejl-tolerant, men mest af alt, verificerbar sikker fra ende til ende. Før behandling skal virksomheder verificere både den data, der går ind i pipelinen, samt pipelinen selv, for at sikre, at der ikke er nogen mulighed for, at pipelinen misbruger dataen. Under behandling skal AI-pipelinen være tamper-bevis, for at sikre, at ingen kan stjæle nogen data, som den behandler, eller forvrænge de indsigt, den giver. Efter behandling skal AI-pipelinen være verificerbar auditerbar, så et hold kan observere og forklare AI-pipelinen og dens beslutningsprocesser og se, hvad der gik galt, når noget går galt.
Det er afgørende at overveje, hvordan en usikker, fejlbehæftet AI-pipeline kan lække en organisations data eller proprietær model, og hvilke implikationer det har for en virksomheds differentierende faktorer eller rygte. Det, der er endnu vigtigere, er følgende: når virksomheder skal udvide deres AI-implementationer til mere kritiske og indflydelsesrige anvendelsesområder, stiger risikoen for en usikker, uforklarlig AI-pipeline eksponentielt. I en verden, hvor lån- og ansættelsesbeslutninger allerede er AI-forstærket og påvirker alt fra personlige finanser til karrierer, kan en intentionel eller utilsigtet fejl i en AI-pipeline have en dramatisk effekt på et individs liv.
Mange virksomheder fokuserer på model-nøjagtighed eller latency. Hvad overser de, når det kommer til data-integritet og langsigtede operationelle risici?
Mens mange virksomheder fokuserer på modellen eller AI-teknologien, har jeg længe troet, at data er den fundamentale flaskehals for at rulle ud værdi-genererende AI.
At have en model, der super hurtigt genererer en præcis respons om et emne, som slutbrugeren ikke er interesseret i, genererer ingen værdi. For at bygge et unikt tiltrækkende produkt må virksomheder sikre, at deres modeller og de produkter, de driver, er trænet med højkvalitets-, relevante data. Data-hygiejne-problemer, der resulterer fra manglen på højkvalitets-inddata, kan måske ikke dukke op, før måneder senere.
For det andet har vi fundet, at virksomheder generelt ikke har en god historie om at opdage data-drift, forurening eller lækkage, hvilket sætter model-integriteten i fare. Dette er tæt knyttet til mit første punkt, og mens det mere er en reaktiv løsning, gør det evals og observabilitet endnu vigtigere.
OPAQUE integrerer i eksisterende cloud-stacks. Hvad har du lært om at balancere let adoptionsmulighed med stærke sikkerheds-garantier i virksomheds-implementationer?
Vi har brugt næsten et årti, startende fra vores forskningsdage, på at løse dette problem. Den beviselige sikkerhed af AI-systemer, især i en virksomheds-indstilling, er et meget svært problem. Det kræver systemer, sikkerhed, kryptografi og AI-ekspertise. Som følge heraf har de fleste systemer, vi er stødt på, ikke været fundamentalt sikre – fordi sikkerhed er så svær at implementere.
Hos Opaque har vi bygget et produkt, der er det bedste af begge verdener – inherent og verificerbar sikker fra bunden, men let at implementere gennem cloud-markedspladser og tilstrækkeligt fleksibelt til at integrere i nye og eksisterende AI-applikationer.
Hvad for slags trusler eller sårbarheder opstår der omkring AI-pipelines og data-deling, som virksomhedsledere måske ikke fuldt ud kan værdsætte?
Det, vi ser i denne agens-guldfeber, er en blind hastighed efter at implementere AI-agenter, der interagerer med forskellige systemer af registrering. Mens disse agenter kan give værdi, stiller de også enorme risici, fordi de berører så mange systemer med værdifuld data. Agenter er inherent ikke-deterministiske, og vi har set utallige eksempler på, at de går ud og gør noget, vi ikke forventer. I en verden, hvor din data er din eneste grav, bør virksomhedsledere altid spørge, om de kan stole på og stole på AI-agenter, der har adgang til alle deres data, til ikke at misbruge dem utilsigtet eller bevidst.
Hvordan ser du interaktionen mellem sikker data-infrastruktur, model-ansvarlighed og compliance udvikle sig i de næste par år, mens AI-reguleringer tager form globalt?
Verificerbar sikker data-infrastruktur muliggør model- og agent-ansvarlighed. Specifikt kan vi ikke være sikre på noget, hvis vi ikke har verificerbar bevis for en agents eller models beslutningsprocesser eller værktøjsbrug. Mens AI bliver mere og mere integreret i vores daglige liv, vil vi ønske mere forklarbarhed og observabilitet i AI. Men når AI kan operere i maskinehastighed, og vi ikke kan, kan en ondsindet AI let narre os ved at konstruere falske historier. Vi har brug for verificerbarhed for at holde AI ansvarlig.
Til mig er regulerings-compliance meget reaktiv. Udviklingen og vedtagelsen af regler bevæger sig meget langsommere end teknologisk innovation. Dette vil blive mere og mere sandt, mens AI hjælper os med at øge vores innovationshastighed. Mens compliance vil drive efterfølgere til at adoptere sikker data-infrastruktur, vil tidlige adoptere og tidlige majoriteter erkende, at det er afgørende for AI-sikkerhed, og vil adoptere det langt før compliance gør det obligatorisk. De forstår, at agent-ansvarlighed, muliggjort af sikker data-infrastruktur, er kritisk for adoptionen af deres egne AI-drevne produkter.
Tak for det store interview, læsere, der ønsker at lære mere, skal besøge OPAQUE.












