Rozhovory

Or Lenchner, generální ředitel Bright Data – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Or Lenchner, generální ředitel Bright Data, vede od roku 2018 platformu pro sběr dat z webu, která je lídrem na trhu, a řídí její expanzi, inovace a růst na více než 100 milionů dolarů ročně. Bright Data umožňuje společnostem z žebříčku Fortune 500, předním podnikům, renomovaným univerzitám a veřejným institucím přístup k veřejným datům z webu v reálném čase a ve velkém měřítku. Lenchner je silným zastáncem otevřeného a přístupného veřejného webu, zdůrazňuje jeho kritickou roli při podpoře inovací.

Co vás inspirovalo k vaší cestě do světa dat a umělé inteligence a od té doby, co jste se stal generálním ředitelem v roce 2018, jak jste formoval misi a vizi Bright Data?

Jsem vždy fascinován silou dat, zejména tím, jak mohou ovlivňovat rozhodnutí a pohánět inovace. Když se data použijí správně, mohou také zajišťovat transparentnost v podnikání. Mé jmenování generálním ředitelem Bright Data v roce 2018 mi dalo příležitost pomoci formovat, jak týmy pro výzkum umělé inteligence a podniky získávají a využívají veřejná data z webu.

Jaké jsou hlavní výzvy, kterým čelí týmy umělé inteligence při získávání velkých množství veřejných dat z webu, a jak Bright Data tyto výzvy řeší?

Škálovatelnost zůstává jednou z největších výzev pro týmy umělé inteligence. Protože modely umělé inteligence vyžadují obrovská množství dat, efektivní sběr není malým úkolem. A protože modely umělé inteligence jsou pouze tak dobré, jako jsou data, na kterých byly vyškoleny, zajištění toho, aby týmy měly přístup k čerstvým, vysoce kvalitním datům, je neustálou výzvou. To je zejména pravda, protože web se vyvíjí v reálném čase.

Další velkou obavou je dodržování předpisů. Zákony a předpisy na ochranu osobních údajů se neustále vyvíjejí, takže týmy umělé inteligence musí být vždy informovány o těchto změnách. Musí také rozumět tomu, jak nakládat s webovými stránkami, které uplatňují mechanismy proti botům, což může komplikovat proces sběru dat.

Platforma, kterou jsme vyvinuli v Bright Data, řeší tyto výzvy. Poskytujeme škálovatelný, automatizovaný sběr dat, který dodává strukturovaná data v reálném čase. Naše nástroje poháněné umělou inteligencí čistí a validují data, aby zajistily přesnost. Máme přísná opatření, aby zajistily legální a etické sběr dat pro dodržování předpisů. Nápad je poskytnout týmům umělé inteligence data, která potřebují, aby se mohli soustředit na budování velkých modelů, zatímco my řešíme složitosti sběru dat.

Jak přispívají vysoce kvalitní data z webu k výkonu modelů umělé inteligence a jaké jsou nejlepší postupy pro zajištění přesnosti dat?

Vysoce kvalitní data znamenají data, která jsou kompletní, bez偏ů a nej重要něji přesná. Pokud data chybí nebo jsou zatížena nesrovnalostmi a chybami, výsledný model umělé inteligence nebude fungovat podle očekávání.

Pro dosažení přesnosti je nejlepší získat data z různých veřejných zdrojů, které mají etablovanou spolehlivost. Používání pouze několika nebo horšího, jediného zdroje dat, vede k problémům, jako je neúplnost. Mít více zdrojů poskytuje možnost křížově ověřit data a vytvořit vyváženější a lépe reprezentovanou sadu dat. Kromě toho by organizace měly zvážit automatizovanou validaci a čištění dat, aby efektivně odstranily chybná a nesrovnalá data.

V Bright Data bereme všechny tyto faktory v úvahu. Poskytujeme týmům umělé inteligence strukturovaná a reálná data, která byla ověřena na přesnost. To jim umožňuje školit modely s jistotou.

Jaké jsou největší etické obavy při sběru veřejných dat z webu dnes?

Ochrana osobních údajů zůstává jednou z největších obav při sběru veřejných dat z webu. Lidé se obávají, že jejich data budou zneužita. Abychom zajistili, že data zůstanou soukromá, je důležité zdůraznit transparentnost. Organizace, které shromažďují data, musí být otevřené o typech dat, která shromažďují. Je důležité ujistit veřejnost, že jejich data jsou používána v souladu se striktními etickými směrnicemi.

Další velkou obavou je monopolizace. Některé velké společnosti ovládají velké množství dat, což vytváří nerovné podmínky, ve kterých mají pouze vybraní přístup k informacím nezbytným pro školení modelů umělé inteligence a pohánění inovací. To není správné. Veřejná data z webu by měla zůstat přístupná podnikům, výzkumníkům a vývojářům. To umožňuje, aby vývoj umělé inteligence nebyl koncentrován pouze v rukou několika velkých hráčů.

Etika nejsou u Bright Data dopothought. Jsou zabudovány do každého rozhodnutí, které činíme. Nesledujeme pouze průmyslové standardy – stanovujeme je. Jsme lídrem v definování správných etických standardů v oblasti sběru dat. Chceme zajistit, aby veřejná data z webu byla přístupná zodpovědně, transparentně a v souladu se globálními předpisy.

Jak Bright Data zajišťuje dodržování globálních předpisů na ochranu osobních údajů při velkém měřítku sběru dat?

Naše organizace je povinna dodržovat globální právní a regulační požadavky na sběr a využití dat. Zajišťujeme, aby jsme dodržovali požadavky GDPR, CPRA, CCPA a dalších relevantních předpisů. Dále přísně dodržujeme protokol Know Your Customer (KYC), aby se zajistilo, že k naší platformě mají přístup pouze legální uživatelé. Naše datové řešení mohou být přístupná pouze legálními podniky a výzkumníky.

Náš Akceptovatelný uživatelský protokol jasně definuje, která data lze a nelze sbírat. To zahrnuje odpovědné použití. Máme vyčleněný tým pro dodržování předpisů, který je zodpovědný za nepřetržité monitorování předpisů, aby se ujistilo, že jsme v souladu s nejnovějšími právními a regulačními požadavky.

Přestože jsme přesvědčeni, že veřejná data z webu by měla zůstat přístupná. Naším cílem je poskytnout týmům umělé inteligence data, která potřebují, zatímco zajišťujeme dodržování předpisů na ochranu osobních údajů a právních standardů.

Jak vyvažujete obchodní růst s udržením etických postupů sběru dat?

Myslíme si, že etika a růst nejsou vzájemně se vylučující. Důvěra našich zákazníků a vztah, který s nimi budujeme, jsou pro nás nejdůležitější. Chápeme, že můžeme dosáhnout dlouhodobého úspěchu pouze tehdy, pokud sbíráme data transparentním způsobem a v souladu s platnými zákony.

Proto jsme zavedli přísný proces ověřování našich uživatelů. To je navrženo tak, aby se zajistilo, že data, která sbíráme, jsou používána eticky. Věnujeme čas, úsilí a zdroje dodržování předpisů a bezpečnosti, aby chránili naše zákazníky a veřejnost obecně. Dodržováním etických postupů sběru dat dosahujeme obchodního úspěchu a přispíváme k vytvoření transparentního a zodpovědného ekosystému umělé inteligence.

Jak Bright Data zůstává v čele regulačních změn v oblasti ochrany osobních údajů?

Chápeme, že naše postupy a zásady pro využívání dat musí být přizpůsobeny změnám v relevantních zákonech a předpisech. Pravidelně proto konzultujeme s právními odborníky a komunikujeme s regulačními orgány. Účastníme se také diskusí s legislativci a dalšími osobami zapojenými do tvorby politik, poskytujeme vstup do vytváření smysluplných předpisů na ochranu dat. Naším cílem je najít rovnováhu mezi inovací a ochranou osobních údajů.

Náš rámec pro sběr a využívání dat se vyvíjí s novými zákony a revizemi předpisů. Máme tým pro dodržování předpisů, který proaktivně aktualizuje naše zásady pro využívání dat, aby se ujistilo, že naše platforma je vždy plně v souladu. Kromě toho provozujeme vzdělávací iniciativy pro zákazníky, aby podporovaly etické využívání dat.

Jaké jsou vznikající trendy ve sběru dat pro umělou inteligenci, o kterých by si společnosti měly být vědomy?

Sběr dat v reálném čase se stává nezbytností pro současné modely umělé inteligence. Je wichtig, aby měly přístup k nejnovějším nebo nejčerstvějším datům, aby mohly poskytovat vysokou úroveň přesnosti a lepší uživatelské zkušenosti.

Dalším pozoruhodným trendem je závislost na syntetických datech pro augmentaci dat, kdy umělá inteligence generuje data, která doplňují sady dat shromážděných z reálných scénářů.

Také vidím silný zájem o explainable AI. Většina současných modelů umělé inteligence trpí efektem “černé skříňky”, nebo nedostatkem transparentnosti ve svých rozhodovacích procesech. Společnosti se snaží změnit tento paradigm tím, že vytvářejí modely umělé inteligence, které mohou vysvětlit, jak dospěly k výstupům nebo rozhodnutím, která činí.

Nakonec si společnosti uvědomují rostoucí obavy o ochranu osobních údajů. Proto se stávají populárními techniky umělé inteligence zaměřené na ochranu osobních údajů, jako je federated learning. Organizace chtějí maximalizovat školení modelů umělé inteligence bez kompromisů v oblasti ochrany osobních údajů uživatelů.

Zajišťujeme, aby jsme byli v čele těchto trendů, abychom mohli budovat řešení, která umožňují týmům umělé inteligence udržet konkurenční výhodu.

Jak vidíte změnu krajiny sběru dat s umělou inteligencí a automatizací?

V současné době používají modely umělé inteligence většinou strukturované sady dat, které jsou většinou shromážděny ručně. Tyto sady dat také procházejí předzpracováním, čištěním a dalšími postupy, které obvykle zahrnují lidskou intervenci. To se má změnit v blízké budoucnosti se vzestupem agentů umělé inteligence pro autonomní sběr a zpracování dat pro školení umělé inteligence. Tyto agenty umožňují automaticky učit se z dat z webu v reálném čase a ve velkém měřítku.

Vyvinuli jsme infrastrukturu, která podporuje nasazení a vývoj agentů umělé inteligence, umožňující hladký přístup k vysoce kvalitním datům z webu v reálném čase. Tato technologie umožňuje sofistikovaným systémům umělé inteligence nepřetržitě komunikovat s dynamickými daty z webu, učit se z nich a růst.

Agenty umělé inteligence mohou transformovat odvětví, protože umožňují systémům umělé inteligence přístup k datům, která se neustále mění, místo aby se spoléhaly na statická a ručně zpracovaná data. To může vést k bankovním nebo bezpečnostním chatbotům umělé inteligence, které jsou schopny činit rozhodnutí, která odrážejí nejnovější realitu. To vede k velkým pokrokům v efektivitě a většímu prostoru pro automatizaci.

V Bright Data nejsme pouze.enableujeme tuto transformaci ve sběru dat. Věříme, že jsme v čele, zavádějíce technologii, která uvádí další generaci umělé inteligence. Jsme rádi, že můžeme pomoci podnikům a týmům umělé inteligence, aby využily plný potenciál agentů umělé inteligence pro své operace.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Bright Data.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.