Wywiady
Or Lenchner, CEO Bright Data – Seria wywiadów

Or Lenchner, CEO Bright Data, od 2018 roku kieruje platformą do zbierania danych internetowych, prowadząc ją do rozwoju, innowacji i wzrostu do ponad 100 milionów dolarów rocznie. Bright Data umożliwia korporacjom z listy Fortune 500, wiodącym firmom, renomowanym uczelniom i instytucjom sektora publicznego dostęp do publicznych danych internetowych w czasie rzeczywistym i w dużych ilościach. Lenchner jest silnym orędownikiem utrzymania publicznych danych internetowych otwartych i dostępnych, podkreślając ich kluczową rolę w napędzaniu innowacji.
Jaki był powód Twojej decyzji o wejściu w świat danych i sztucznej inteligencji, a od czasu objęcia stanowiska CEO w 2018 roku, jak ukształtowałeś misję i wizję Bright Data?
Zawsze fascynowała mnie siła danych, zwłaszcza sposób, w jaki mogą one napędzać decyzje i wspierać innowacje. Kiedy użyte są one we właściwy sposób, dane mogą również zapewnić transparentność w biznesie. Objęcie stanowiska CEO w Bright Data w 2018 roku dało mi możliwość współkształtowania, w jaki sposób zespoły badawcze i firmy pozyskują i wykorzystują publiczne dane internetowe.
Jakie są kluczowe wyzwania, z którymi spotykają się zespoły AI przy pozyskiwaniu dużych ilości publicznych danych internetowych, i jak Bright Data rozwiązuje te problemy?
Skalowalność pozostaje jednym z największych wyzwań dla zespołów AI. Ponieważ modele AI wymagają ogromnych ilości danych, efektywne pozyskiwanie danych nie jest łatwym zadaniem. A ponieważ modele AI są tylko tak dobre, jak dane, których używają, zapewnienie zespołom dostępu do świeżych, wysokiej jakości danych jest stałym wyzwaniem. Jest to szczególnie prawdziwe, gdy internet ewoluuje w czasie rzeczywistym.
Innym dużym problemem jest zgodność z przepisami. Prawa i wymagania dotyczące ochrony danych prywatnych ciągle ewoluują, więc zespoły AI muszą zawsze być świadome tych zmian. Muszą również rozumieć, jak radzić sobie z witrynami, które egzekwują mechanizmy przeciwbottowe, co może skomplikować proces gromadzenia danych.
Platforma, którą zbudowaliśmy w Bright Data, rozwiązuje te problemy. Zapewniamy skalowalne, zautomatyzowane pozyskiwanie danych, które dostarcza strukturalne dane w czasie rzeczywistym. Nasze narzędzia oparte na AI czyszczą i walidują dane, aby zapewnić dokładność. Mamy ścisłe środki, aby zapewnić legalne i etyczne pozyskiwanie danych, aby zapewnić zgodność. Ideą jest umożliwienie zespołom AI skupienia się na budowaniu dobrych modeli, podczas gdy my zajmujemy się złożonościami pozyskiwania danych.
Jak wysokiej jakości dane internetowe przyczyniają się do wydajności modeli AI, i jakie są najlepsze praktyki, aby zapewnić dokładność danych?
Wysokiej jakości dane oznaczają dane, które są kompletne, pozbawione stronniczości i najważniejsze, dokładne. Jeśli dane są niepełne lub zanieczyszczone nieścisłościami i błędami, wynikowy model AI nie będzie działał zgodnie z oczekiwaniami.
Aby osiągnąć dokładność, najlepiej jest pozyskiwać dane z różnych publicznych źródeł, które mają ustanowioną wiarygodność. Używanie tylko kilku, lub co gorsza, jednego źródła danych, prowadzi do problemów, takich jak niepełność. Posiadanie wielu źródeł pozwala na skrzyżowanie danych i zbudowanie bardziej zrównoważonego i reprezentatywnego zbioru danych. Dodatkowo, organizacje powinny rozważyć zautomatyzowaną walidację i czyszczenie danych, aby wydajnie usunąć błędne i niespójne dane.
W Bright Data bierzemy pod uwagę wszystkie te czynniki. Zapewniamy zespołom AI strukturalne dane w czasie rzeczywistym, które zostały zwalidowane pod kątem dokładności. W ten sposób mogą one trenować modele z pewnością.
Jakie są największe problemy etyczne związane z pozyskiwaniem publicznych danych internetowych dzisiaj?
Prywatność pozostaje jednym z największych problemów związanych z pozyskiwaniem publicznych danych internetowych. Ludzie martwią się, że ich dane zostaną ujawnione i wykorzystane w sposób nieuprawniony. Aby upewnić się, że dane pozostają prywatne, niezwykle ważne jest podkreślenie transparentności. Organizacje, które gromadzą dane, muszą być otwarte w odniesieniu do danych, które zbierają. Ważne jest, aby zapewnić publiczność, że ich dane są wykorzystywane zgodnie ze ścisłymi wytycznymi etycznymi.
Innym dużym problemem jest monopolizacja. Niektóre duże firmy kontrolują ogromne ilości danych, co tworzy nierówny podział, w którym tylko nieliczni mają dostęp do informacji niezbędnych do szkolenia modeli AI i napędzania innowacji. Nie powinno tak być. Publiczne dane internetowe powinny pozostać dostępne dla firm, badaczy i deweloperów. W ten sposób rozwój AI nie jest skoncentrowany w rękach tylko kilku dużych graczy.
Etyka nie jest u nas czymś, co robimy po fakcie. Są one wbudowane w każdą decyzję, którą podejmujemy. Nie tylko przestrzegamy standardów branżowych – je ustanawiamy. Liderujemy w branży zbierania danych w definiowaniu odpowiednich standardów etycznych. Chcemy zapewnić, że publiczne dane internetowe są dostępne w sposób odpowiedzialny, transparentny i w pełnej zgodzie z globalnymi regulacjami.
Jak Bright Data zapewnia zgodność z globalnymi regulacjami dotyczącymi ochrony danych prywatnych, jednocześnie umożliwiając pozyskiwanie dużych ilości danych?
Nasza organizacja jest zaangażowana w przestrzeganie globalnych wymagań prawnych i regulacyjnych dotyczących gromadzenia i wykorzystania danych. Zapewniamy, że przestrzegamy wymagań GDPR, CPRA, CCPA i innych odpowiednich regulacji. Co więcej, ściśle przestrzegamy protokołów Know Your Customer (KYC), aby upewnić się, że tylko uzasadnieni użytkownicy mają dostęp do naszej platformy. Nasze rozwiązania dotyczące danych mogą być dostępne tylko dla uzasadnionych firm i badaczy.
Nasza Polityka dopuszczalnego użytkowania jest również jasna w określaniu, jakie dane mogą i nie mogą być gromadzone. Obejmuje to odpowiedzialne użytkowanie. Mamy dedykowany zespół ds. zgodności, który jest odpowiedzialny za ciągłe monitorowanie regulacji, aby upewnić się, że jesteśmy na bieżąco z najnowszymi wymaganiami prawnymi i regulacyjnymi.
Niezależnie od tego, wierzymy, że publiczne dane internetowe powinny pozostać dostępne. Naszym celem jest zapewnienie zespołom AI danych, których potrzebują, jednocześnie zapewniając zgodność z normami prywatności i prawa.
Jak balansujesz wzrost biznesu z utrzymaniem etycznych praktyk pozyskiwania danych?
Zawsze myślimy o etyce i wzroście jako o rzeczach, które nie są wzajemnie wykluczające. Zaufanie naszych klientów i relacja, którą budujemy z nimi, są dla nas najważniejsze. Rozumiemy, że możemy osiągnąć długoterminowy sukces tylko wtedy, gdy zbieramy dane w sposób transparentny i zgodny z obowiązującymi przepisami.
Dlatego też wprowadziliśmy ścisły protokół weryfikacji dla naszych użytkowników. Ma on na celu zapewnienie, że dane, które gromadzimy, są wykorzystywane w sposób etyczny. Przydzielamy czas, wysiłek i zasoby na zgodność i bezpieczeństwo, aby chronić naszych klientów i ogół społeczeństwa. Przestrzegając etyczne praktyki pozyskiwania danych, osiągamy sukces biznesowy, jednocześnie przyczyniając się do tworzenia transparentnego i odpowiedzialnego ekosystemu AI.
Jak Bright Data pozostaje na bieżąco z zmianami regulacyjnymi w zakresie ochrony danych?
Rozumiemy, że nasze procesy i polityki dotyczące wykorzystania danych muszą ewoluować, aby odzwierciedlać zmiany w przepisach i regulacjach. W związku z tym regularnie konsultujemy się z ekspertami prawnymi i komunikujemy się z organami regulacyjnymi. Uczestniczymy również w dyskusjach z legislatorami i innymi osobami zaangażowanymi w tworzenie polityki, dostarczając wkład w tworzenie znaczących regulacji dotyczących danych. Naszym celem jest znalezienie balansu między innowacją a ochroną danych.
Nasza ramowa struktura dotycząca gromadzenia i wykorzystania danych ewoluuje wraz z nowymi przepisami i zmianami regulacyjnymi. Mamy zespół ds. zgodności, który aktywnie aktualizuje nasze polityki dotyczące wykorzystania danych, aby upewnić się, że nasza platforma jest zawsze w pełni zgodna. Co więcej, prowadzimy inicjatywy edukacyjne dla klientów, aby promować etyczne wykorzystanie danych.
Jakie są pojawiające się trendy w pozyskiwaniu danych AI, o których firmy powinny wiedzieć?
Pozyskiwanie danych w czasie rzeczywistym staje się koniecznością dla dzisiejszych modeli AI. Jest to kluczowe dla nich, aby mieć dostęp do najświeższych danych, aby osiągnąć wysoki poziom dokładności i zapewnić lepsze doświadczenia użytkowników.
Innym godnym uwagi trendem jest zależność od syntetycznych danych wykorzystywanych do augmentacji danych, w której AI generuje dane, które uzupełniają zbiory danych pozyskane z rzeczywistych sytuacji.
Obserwuję również silne zainteresowanie AI, które można wyjaśnić. Większość obecnych modeli AI cierpi na efekt “czarnej skrzynki” lub brak przejrzystości w procesach podejmowania decyzji. Firmy starają się zmienić ten paradygmat, tworząc modele AI, które mogą wyjaśnić, w jaki sposób doszły do wyników lub decyzji, które podejmują.
Na koniec, firmy są świadome rosnących problemów związanych z ochroną danych. Dlatego techniki AI, które mają na celu zachowanie prywatności danych, takie jak federacyjne uczenie, stają się coraz bardziej popularne. Organizacje chcą maksymalnie wykorzystać szkolenie modeli AI, nie narażając na szwank prywatności użytkowników.
Upewnimy się, że jesteśmy na bieżąco z tymi trendami, aby mogliśmy budować rozwiązania, które pozwalają zespołom AI utrzymać przewagę konkurencyjną.
Jak widzisz przyszłość agentów i automatyzacji AI w krajobrazie pozyskiwania danych?
Obecnie modele AI wykorzystują strukturalne zbiory danych, które są w większości gromadzone ręcznie. Te zbiory danych przechodzą również przez przetwarzanie wstępne, czyszczenie i inne procedury, które zwykle wymagają interwencji człowieka. To ma się zmienić w najbliższej przyszłości z powodu wzrostu agentów AI do autonomicznego pozyskiwania i przetwarzania danych do szkolenia AI. Umożliwiają one automatyczne uczenie się z danych internetowych w czasie rzeczywistym w niezwykłej skali.
Stworzyliśmy infrastrukturę, która wspiera wdrożenie i rozwój agentów AI, umożliwiając łatwy dostęp do wysokiej jakości danych internetowych w czasie rzeczywistym. Ta technologia pozwala zaawansowanym systemom AI na ciągłe współdziałanie z dynamicznymi danymi internetowymi, uczenie się z nich i rozwijanie się.
Agenci AI mogą przekształcić branże, ponieważ pozwalają systemom AI na dostęp i uczenie się z ciągle zmieniających się zbiorów danych internetowych, zamiast polegać na statycznych i ręcznie przetworzonych danych. Może to prowadzić do bankowych lub bezpiecznych chatbotów AI, które są w stanie podejmować decyzje, które odzwierciedlają najnowsze realia. To prowadzi do ogromnych postępów w wydajności i większych możliwości automatyzacji.
W Bright Data nie tylko umożliwiamy tę transformację w krajobrazie pozyskiwania danych. Wierzymy, że jesteśmy na czele, wprowadzając technologię, która zapowiada następną generację sztucznej inteligencji. Jesteśmy podekscytowani, aby pomóc firmom i zespołom AI w wykorzystaniu pełnego potencjału agentów AI w swoich operacjach.
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Bright Data.












