Wywiady
Chester Leung, Współzałożyciel i Szef Platformy AI w OPAQUE – Wywiad

Chester Leung jest Współzałożycielem i Szefem Architektury Platformy w OPAQUE, startupie z serii A, który buduje platformę danych poufnych i sztucznej inteligencji, która umożliwia zespołom rozszerzanie swoich potoków danych przedsiębiorstwa o warstwę poufną, umożliwiając szybsze uzyskiwanie wglądów z mniejszym nakładem pracy i weryfikowalną prywatnością i kontrolą.
Poprzednio Chester był studentem informatyki na Uniwersytecie Kalifornijskim w Berkeley, gdzie opublikował recenzowane prace na najważniejszych konferencjach i również pełnił funkcję głównego utrzymującego otwartego projektu MC2 dla bezpiecznej analityki współpracy i sztucznej inteligencji.
Po twoim czasie w RISELab na Uniwersytecie Kalifornijskim w Berkeley, gdzie twoja praca łączyła sztuczną inteligencję i bezpieczne systemy, jaka konkretna luka w infrastrukturze danych przedsiębiorstwa widziałeś, co doprowadziło do stworzenia OPAQUE, i jak twoje doświadczenie akademickie ukształtowało kierunek firmy?
W tym czasie istniał ogromny nacisk, zarówno w środowisku akademickim, jak i przemysłowym, na wykorzystanie uczenia maszynowego dla konkretnych przypadków użycia. W laboratorium mieliśmy ogromne szczęście, że mieliśmy dużych sponsorów przedsiębiorstw, którzy pomogli nam badaczom ukształtować naszą pracę w celu rozwiązania bardziej palących problemów, z którymi borykali się w swoich organizacjach. Nasza grupa miała wyjątkową okazję do współpracy z zespołami z firm technologicznych, bankowych, usług finansowych i ubezpieczeniowych (BFSI), współpracując w celu rozwiązania trudnych problemów związanych z prywatnością przy użyciu wrażliwych, ale cennych danych do uczenia maszynowego. Podobnie jak we wszystkich dziedzinach sztucznej inteligencji, uczenie maszynowe opiera się na dużych ilościach wysokiej jakości danych, aby produkować cenne i solidne wglądy.
Spotkaliśmy się z tym samym wzorcem wielokrotnie podczas współpracy z zespołami z firm takich jak Amazon (AMZN ), Scotiabank i Ant Group (wówczas Ant Financial): ich projekty zasilane przez uczenie maszynowe zatrzymywały się przed osiągnięciem produkcji ze względu na obawy związane z użyciem wrażliwych, ale krytycznych danych dla tych przypadków użycia. Innymi słowy, te zespoły nie były w stanie wykorzystać sztucznej inteligencji w projektach, które wiedziały, że mogą wygenerować wartość dla firmy, nie ze względu na problem techniczny z sztuczną inteligencją, ale dlatego, że nie mogły uzyskać dostępu do odpowiednich danych.
W OPAQUE rozwiązujemy identyczny problem. Pomagamy zespołom uzyskać dostęp do odpowiednich danych, umożliwiając im odblokowanie lub rozszerzenie ich możliwości sztucznej inteligencji. Jedyna zmiana od czasów naszych badań jest pilnością problemu: teraz konsekwentnie widzimy, że przyjęcie i integracja sztucznej inteligencji staje się strategiczną imperatywą na poziomie przedsiębiorstwa, która nadal jest ograniczona przez dostęp do odpowiednich danych.
W krajobrazie, w którym przedsiębiorstwa inwestują dużo w modele rozumowania i sztuczną inteligencję agentywną, dlaczego uważasz, że bezpieczne potoki danych są ważniejsze niż kiedykolwiek?
Bezpieczne potoki danych są podstawą, na której przedsiębiorstwa budują modele rozumowania i sztuczną inteligencję agentywną. Wszystko, od szkolenia tych modeli rozumowania do wdrożenia sztucznej inteligencji agentywnej, obejmuje wrażliwe dane i opiera się na bezpiecznych potokach danych.
Na przykład teraz, jako branża, widzimy rosnące inwestycje w generowanie wysokiej jakości danych do szkolenia tych modeli. Niektóre raporty przewidują, że inwestycje w generowanie danych będą wkrótce większe niż inwestycje w szkolenie samych modeli. Oczywiście, generowanie danych jest wieloetapowym procesem napędzanym potokami, które produkują najcenniejszy IP przedsiębiorstwa: wysokiej jakości, specyficzne dla domeny dane, które mogą szkolić modele, generujące ogromną wartość w dół strumienia. Inwestycje w generowanie tych danych są ogromne, a wygenerowane dane, ze względu na ich pochodzenie, skutecznie odróżniają jedno przedsiębiorstwo od jego konkurentów, służąc jako ich rów. Przedsiębiorstwo musi zrobić wszystko, co w jego mocy, aby utrzymać ten potok bezpieczny.
Platforma OPAQUE umożliwia analitykę na danych zaszyfrowanych. Jakie są podstawowe wyzwania techniczne w uczynieniu jej zarówno skalowalną, jak i przyjazną dla deweloperów w środowiskach przedsiębiorstw?
Nasza platforma Confidential AI nie tylko umożliwia analitykę, uczenie maszynowe i generatywną sztuczną inteligencję na danych zaszyfrowanych, ale także zapewnia weryfikowalny dowód, że Twoje dane zostały wykorzystane w sposób, który tylko Ty oczekujesz i zezwalasz.
Podstawowe wyzwania, ze skalowalnością, rozwojem i zarządzaniem, leżą w uczynieniu orkiestracji obciążenia bezpieczną i weryfikowalną w skali. W szczególności wiele przedsiębiorstw dzisiaj korzysta z usług zarządzanych w chmurze, gdy muszą skalować. Może to być zarówno opłacalne, jak i wygodne. Niemniej jednak wyzwanie staje się, jak może organizacja zabezpieczyć i zweryfikować oprogramowanie, które nie jest pod jej kontrolą? Jeśli organizacja odzyska kontrolę nad wszystkim oprogramowaniem, co musi poświęcić, nie korzystając z usługi zarządzanej, i co traci, robiąc to?
Powiedziałeś, że architektura zabezpieczona przez projekt może zapewnić trwałą przewagę konkurencyjną. Możesz wyjaśnić, jak ta zasada odgrywa się praktycznie dla zespołów sztucznej inteligencji przedsiębiorstw?
Istnieją dwa punkty widzenia: kąt produktu i kąt inżynierski.
Z punktu widzenia produktu każdy rozumie, że ich dane są radioaktywne, ich rów lub oba. Przedsiębiorstwa stają się coraz bardziej dojrzałe w ocenie rozwiązań pod kątem prywatności danych, bezpieczeństwa i suwerenności. W związku z tym każdy zespół, który buduje jakikolwiek produkt, który przetwarza dane przedsiębiorstwa, musi zapewnić gwarancje, że przetwarzane dane są widoczne i wykorzystywane tylko przez upoważnione strony i podmioty. Architektura zabezpieczona przez projekt zapewnia pewność, że prywatność danych, bezpieczeństwo i suwerenność były pierwszorzędnymi rozważaniami w projekcie produktu i umożliwiają produktowi wyraźnie zapewnić te gwarancje.
Z punktu widzenia inżynierskiego architektura zabezpieczona przez projekt jest bardziej rozszerzalna i odporne na przyszłość. Zespoły prawne, ryzyka i zgodności stają się coraz bardziej surowe w odpowiedzi na nowe ryzyka i regulacje. W związku z tym organizacje inżynierskie powinny chcieć zbudować bezpieczny system sztucznej inteligencji przedsiębiorstwa od samego początku, aby nie musiały przebudowywać i/lub łatać swojego systemu, gdy zrozumieją, że ich istniejący system jest niewystarczająco bezpieczny i odporne na ryzyko. Konieczność przebudowy i łatania kosztuje miesiące, jeśli nie lata, cennego potencjału inżynierskiego.
Jak organizacje powinny przemyśleć rolę danych – poza zasobem – jako broniony rów?
Istnieje rosnący konsensus w branży, że dane mogą wkrótce stać się jedynym rowem, jaki posiada organizacja. Widzimy badania i inżynierię talentów, a także genialne technologie i produkty, które budują, skaczące z organizacji do organizacji. W związku z tym wiele organizacji jest w stanie zaoferować te same produkty, wspierane przez te same technologie.
Co nie może łatwo przenieść się z organizacji do organizacji, są dane organizacji – chyba że są przeciekać. Co więcej, to właśnie dane mogą uczynić produkt bardziej atrakcyjnym niż jego konkurenci – bardziej personalizowanym, dostosowanym i specyficznym dla domeny. Organizacje muszą zrobić wszystko, co w ich mocy, aby zabezpieczyć swoje dane, umożliwiając im wykorzystanie swoich danych jako przewagę konkurencyjną.
Co wygląda potok sztucznej inteligencji odporne na awarie w praktyce, i jak pomaga firmom uniknąć ukrytych kosztów lub ryzyk podczas skalowania wdrożeń sztucznej inteligencji?
Potok sztucznej inteligencji odporne na awarie to taki, który jest niezawodny, odporny na awarie, ale co najważniejsze, weryfikowalnie bezpieczny od końca do końca. Przed przetwarzaniem firmy powinny zweryfikować dane, które wprowadzane są do potoku, a także sam potok, aby upewnić się, że nie ma możliwości, że potok nie będzie wykorzystywał danych w sposób nieoczekiwany. Podczas przetwarzania potok sztucznej inteligencji powinien być odporny na manipulację, aby upewnić się, że nikt nie może ukraść żadnych danych, które są przetwarzane, ani zniekształcić wglądów, które zapewnia. Po przetworzeniu potok sztucznej inteligencji powinien być weryfikowalnie audytowalny, aby zespół mógł obserwować i wyjaśnić podejmowanie decyzji i trajektorię potoku sztucznej inteligencji, i aby zespół mógł zobaczyć, co poszło nie tak, gdy coś pójdzie nie tak.
Jest niezwykle ważne, aby rozważyć, jak potok sztucznej inteligencji, który nie jest bezpieczny, mógłby przeciekać dane przedsiębiorstwa lub własny model, i jakie ma to implikacje dla różnicujących czynników lub reputacji firmy. Co więcej, gdy firmy skalują wdrożenie sztucznej inteligencji do coraz bardziej krytycznych i wpływowych przypadków użycia, ryzyko potoku sztucznej inteligencji, który nie jest bezpieczny i niezrozumiały, rośnie wykładniczo. W świecie, w którym decyzje kredytowe i decyzje zatrudnienia są już wspomagane przez sztuczną inteligencję, wpływając na wszystko, od finansów osobistych po kariery, celowy lub niecelowy błąd w potoku sztucznej inteligencji mógłby mieć dramatyczny wpływ na życie jednostki.
Wiele przedsiębiorstw koncentruje się na dokładności modelu lub opóźnieniu. Co pomijają, gdy chodzi o integralność danych i długoterminowe ryzyko operacyjne?
Podczas gdy wiele przedsiębiorstw koncentruje się na modelu lub technologii sztucznej inteligencji, od dawna uważam, że dane są podstawowym problemem w wdrożeniu sztucznej inteligencji, która generuje wartość.
Mając model, który bardzo szybko generuje dokładną odpowiedź na temat, o którym użytkownik końcowy nie dba, generuje zero wartości. Aby zbudować unikalnie atrakcyjny produkt, przedsiębiorstwa muszą upewnić się, że ich modele, a produkty, które je napędzają, są szkolone z wysokiej jakości, istotnych danych. Problemy z higieną danych, wynikające z braku wysokiej jakości danych wejściowych, mogą nie pojawić się aż do miesięcy później.
Ponadto stwierdziliśmy, że przedsiębiorstwa ogólnie nie mają dobrego pomysłu na wykrywanie dryfu danych, zanieczyszczenia lub przecieku, narażając integralność modelu. To jest ściśle związane z moim pierwszym punktem, a chociaż jest to bardziej reakcyjne rozwiązanie, sprawia, że evals i obserwowalność są jeszcze ważniejsze.
OPAQUE integruje się z istniejącymi stosami chmury. Co nauczyłeś się o balansowaniu łatwości przyjęcia z silnymi gwarancjami bezpieczeństwa w wdrożeniach przedsiębiorstw?
Spędziliśmy prawie dekadę, zaczynając od naszych dni badawczych, rozwiązując ten problem. Bezpieczeństwo systemów sztucznej inteligencji, zwłaszcza w środowisku przedsiębiorstwa, jest bardzo trudnym problemem. Wymaga systemów, bezpieczeństwa, kryptografii i sztucznej inteligencji. W związku z tym większość systemów, z którymi się spotkaliśmy, nie była fundamentalnie bezpieczna – ponieważ bezpieczeństwo jest tak trudne do wdrożenia.
W OPAQUE zbudowaliśmy produkt, który jest najlepszym z obu światów – wewnętrznie i weryfikowalnie bezpieczny od podstaw, ale łatwo wdrożony za pomocą rynków chmury i wystarczająco elastyczny, aby zintegrować się z nowymi i istniejącymi aplikacjami sztucznej inteligencji.
Jakie rodzaje zagrożeń lub słabości pojawiają się wokół potoków sztucznej inteligencji i udostępniania danych, których liderzy przedsiębiorstw mogą jeszcze nie w pełni doceniać?
Co widzimy w tym pościgu za agentami, jest ślepa pilność wdrożenia agentów sztucznej inteligencji, które interaktywnie współpracują z różnymi systemami rejestracji. Chociaż agenci ci mogą zapewnić wartość, niosą one również ogromne ryzyka, ponieważ dotykają tak wielu systemów z cennymi danymi. Agenci są wewnętrznie nieokreśleni, a widzieliśmy niezliczone przypadki, w których idą i robią coś, czego nie oczekujemy. W świecie, w którym Twoje dane są Twoim jedynym rowem, liderzy przedsiębiorstw powinni zawsze pytać, czy mogą ufać i polegać na agentach sztucznej inteligencji, które mają dostęp do wszystkich ich danych, aby nie przypadkowo lub nawet celowo nadużyć ich.
Jak regulacja sztucznej inteligencji kształtuje się na całym świecie, jak widzisz interakcję między bezpieczną infrastrukturą danych, odpowiedzialnością modelu a zgodnością ewoluującą w ciągu najbliższych kilku lat?
Weryfikowalnie bezpieczna infrastruktura danych umożliwia odpowiedzialność modelu i agenta. Konkretnie, bez weryfikowalnego dowodu podejmowania decyzji lub wykorzystania narzędzi przez agenta lub model, nie możemy być pewni niczego, więc nie będziemy w stanie śledzić odpowiedzialności. Gdy sztuczna inteligencja staje się coraz bardziej zintegrowana z naszym codziennym życiem, aby czuć, że nadal mamy kontrolę, będziemy chcieli większej wyjaśnialności i obserwowalności sztucznej inteligencji. Niemniej jednak, gdy sztuczna inteligencja może działać z prędkością maszynową, a my nie, sztuczna inteligencja może łatwo nas oszukać, konstruując fałszywe historie. Potrzebujemy weryfikowalności, aby utrzymać sztuczną inteligencję odpowiedzialną.
Regulacyjna zgodność jest bardzo reakcyjna. Rozwój i przyjęcie regulacji poruszają się znacznie wolniej niż innowacje technologiczne. To będzie coraz bardziej prawdziwe, gdy sztuczna inteligencja pomoże nam zwiększyć tempo innowacji. Chociaż zgodność ostatecznie popchnie opóźnione do przyjęcia bezpiecznej infrastruktury danych, wczesni przyjmujący i wczesna większość rozpoznają, że to jest kluczowe dla bezpieczeństwa sztucznej inteligencji, i przyjmą to znacznie wcześniej, zanim zgodność uczyni to obowiązkowe. Rozumieją, że odpowiedzialność agenta, umożliwiona przez bezpieczną infrastrukturę danych, jest kluczowa dla przyjęcia ich własnych produktów napędzanych sztuczną inteligencją.
Dziękuję za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić OPAQUE.












