Interviews

Or Lenchner, CEO van Bright Data – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Or Lenchner, CEO van Bright Data, leidt sinds 2018 de marktleidende webdata-verzamelpagina en heeft deze gedreven naar uitbreiding, innovatie en groei tot meer dan 100 miljoen dollar aan jaarlijkse omzet. Bright Data maakt het mogelijk voor Fortune 500-bedrijven, toonaangevende bedrijven, bekende universiteiten en overheidsinstanties om toegang te krijgen tot openbare webdata in real-time en op grote schaal. Lenchner is een sterke voorstander van het openhouden van openbare webdata en benadrukt de cruciale rol die het speelt bij het stimuleren van innovatie.

Wat heeft je reis naar de wereld van data en AI geïnspireerd, en hoe heb je sinds je CEO werd in 2018 de missie en visie van Bright Data gevormd?

Ik ben altijd gefascineerd geweest door de kracht van data, vooral door hoe het beslissingen kan stimuleren en innovatie kan stimuleren. Wanneer het op de juiste manier wordt gebruikt, kan data ook transparantie in bedrijven stimuleren. Het worden van CEO van Bright Data in 2018 gaf me de kans om te helpen bij het vormen van hoe AI-onderzoekers en bedrijven te werk gaan bij het verzamelen en gebruiken van openbare webdata.

Wat zijn de belangrijkste uitdagingen waarmee AI-teams te maken krijgen bij het verzamelen van grote hoeveelheden openbare webdata, en hoe lost Bright Data deze uitdagingen op?

Schaalbaarheid blijft een van de grootste uitdagingen voor AI-teams. Aangezien AI-modellen enorme hoeveelheden data nodig hebben, is efficiënte verzameling geen kleine taak. En aangezien AI-modellen alleen zo goed zijn als de data waarop ze zijn getraind, is het waarborgen dat teams toegang hebben tot verse, hoge kwaliteit data een constante uitdaging. Dit is vooral zo nu het web in real-time evolueert.

Een andere grote zorg is naleving. Data-privacywetten en -eisen evolueren voortdurend, dus AI-teams moeten altijd op de hoogte zijn van deze veranderingen. Ze moeten ook weten hoe ze omgaan met websites die anti-botmechanismen afdwingen, wat de dataverzameling kan compliceren.

Het platform dat we bij Bright Data hebben gebouwd, lost deze uitdagingen op. We bieden schaalbare, geautomatiseerde dataverzameling die gestructureerde real-time data levert. Onze AI-gestuurde tools reinigen en valideren data om nauwkeurigheid te waarborgen. We hebben strikte maatregelen genomen om juridische en ethische dataverzameling voor naleving te waarborgen. Het idee is om AI-teams in staat te stellen zich te concentreren op het bouwen van geweldige modellen, terwijl wij ons bezighouden met de complexiteit van dataverzameling.

Hoe draagt hoge kwaliteit webdata bij aan de prestaties van AI-modellen, en wat zijn de beste praktijken om datanauwkeurigheid te waarborgen?

Hoge kwaliteit data betekent data die compleet is, vrij van vooroordelen en vooral nauwkeurig. Als data ontbreekt of verontreinigd is met inconsistenties en fouten, zal het resulterende AI-model niet naar verwachting presteren.

Om nauwkeurigheid te bereiken, is het het beste om data te verzamelen uit een verscheidenheid aan openbare bronnen die betrouwbaarheid hebben bewezen. Alleen een paar, of erger, één enkele datbron gebruiken, leidt tot problemen zoals onvolledigheid. Het hebben van meerdere bronnen biedt de mogelijkheid om data te cross-refereren en een meer gebalanceerd en goed vertegenwoordigd dataset op te bouwen. Bovendien moeten organisaties geautomatiseerde datavalidatie en -reiniging overwegen om efficiënt foutieve en inconsistente data te verwijderen.

Bij Bright Data houden we al deze factoren in overweging. We bieden AI-teams gestructureerde en real-time data die is geverifieerd voor nauwkeurigheid. Zo kunnen ze modellen trainen met vertrouwen.

Wat zijn de grootste ethische zorgen in de verzameling van openbare webdata vandaag?

Privacy blijft een van de grootste zorgen in de verzameling van openbare webdata. Mensen maken zich zorgen over het feit dat hun data wordt blootgesteld aan misbruik en oneigenlijk gebruik. Om ervoor te zorgen dat data privé blijft, is het essentieel om transparantie te benadrukken. Organisaties die data verzamelen, moeten openhartig zijn over de data die ze verzamelen. Het is belangrijk om de publieke mening te verzekeren dat hun data wordt gebruikt onder strikte ethische richtlijnen.

Een andere grote zorg is monopolisering. Bepaalde grote bedrijven hebben de controle over een enorme hoeveelheid data, wat een onevenredige speelveld creëert waarin alleen een selecte groep toegang heeft tot de informatie die nodig is om AI-modellen te trainen en innovatie te stimuleren. Dit is niet hoe het zou moeten zijn. Openbare webdata moet toegankelijk blijven voor bedrijven, onderzoekers en ontwikkelaars. Zo kan AI-ontwikkeling niet worden geconcentreerd in de handen van slechts een paar grote spelers.

Ethische overwegingen zijn geen bijzaak bij Bright Data. Ze zijn ingebed in elke beslissing die we nemen. We volgen de industrienormen niet alleen – we stellen ze vast. We leiden de dataverzamelingsindustrie in het definiëren van de juiste ethische normen. We willen ervoor zorgen dat openbare webdata op een verantwoorde, transparante en volledig in overeenstemming met mondiale regelgeving toegankelijke manier wordt benaderd.

Hoe zorgt Bright Data ervoor dat het voldoet aan mondiale dataprotectie-regelgevingen en tegelijkertijd grote hoeveelheden data verzamelt?

Onze organisatie is toegewijd aan het naleven van mondiale wettelijke en regelgevende vereisten voor dataverzameling en -gebruik. We zien erop toe dat we voldoen aan de vereisten van de AVG, CPRA, CCPA en andere relevante regelgevingen. Belangrijk is dat we strikt de Know Your Customer (KYC)-protocollen volgen om ervoor te zorgen dat alleen legitieme gebruikers toegang krijgen tot ons platform. Onze dataservices mogen alleen worden gebruikt door legitieme bedrijven en onderzoekers.

Ons Acceptabele Gebruiksbeleid is duidelijk in het definiëren van welke data kan en niet kan worden verzameld. Dit omvat verantwoord gebruik. We hebben een speciaal team voor naleving dat verantwoordelijk is voor het continue monitoren van regelgeving om ervoor te zorgen dat we up-to-date zijn met de laatste wettelijke en regelgevende vereisten.

Desondanks geloven we nog steeds dat openbare webdata toegankelijk moet blijven. Ons doel is om AI-teams te voorzien van de data die ze nodig hebben, terwijl we ervoor zorgen dat we voldoen aan privacy- en wettelijke normen.

Hoe balanceren jullie bedrijfsgroei met het behoud van ethische dataverzamelingspraktijken?

We denken altijd aan ethiek en groei als niet onderling exclusief. Het vertrouwen van onze klanten en de relatie die we met hen opbouwen, zijn van het grootste belang. We begrijpen dat we alleen langdurige successen kunnen behalen als we data verzamelen onder transparante voorwaarden en in overeenstemming met van toepassing zijnde wetten.

Daarom hebben we een strikt selectieprotocol voor onze gebruikers ingesteld. Dit is ontworpen om ervoor te zorgen dat de data die we verzamelen, op een ethische manier wordt gebruikt. We besteden tijd, inspanning en middelen aan naleving en beveiliging om onze klanten en het publiek in het algemeen te beschermen. Door ethische dataverzameling te waarborgen, slagen we zowel zakelijk als bij het bijdragen aan het creëren van een transparante en verantwoorde AI-ecosysteem.

Hoe blijft Bright Data voorop bij de veranderingen in de regelgeving met betrekking tot dataprotectie?

We begrijpen dat onze dataprocessen en -beleid onvermijdelijk moeten veranderen om veranderingen in relevante wetten en regelgevingen te weerspiegelen. Daarom raadplegen we regelmatig juridische experts en communiceren we met regelgevende instanties. We nemen ook deel aan discussies met wetgevers en anderen die betrokken zijn bij het opstellen van beleid, waarbij we input leveren bij het creëren van zinvolle dataprotectieregelgeving. We streven ernaar om een balans te vinden tussen innovatie en dataprotectie.

Ons dataprotocol en -gebruikskader evolueren naarmate nieuwe wetten worden uitgevaardigd en regelgevingen worden herzien. We hebben een team voor naleving dat proactief onze dataprotocol up-to-date houdt om ervoor te zorgen dat ons platform altijd volledig in overeenstemming is. Bovendien voeren we klanteneducatie-initiatieven uit om ethisch dataprotocol te stimuleren.

Wat zijn de opkomende trends in AI-dataverzameling waar bedrijven zich bewust van moeten zijn?

Real-time dataverzameling wordt een must voor hedendaagse AI-modellen. Het is cruciaal dat ze toegang hebben tot de meest recente of verse data om een hoge mate van nauwkeurigheid te bieden en betere gebruikerservaringen te bieden.

Een andere opvallende trend is de afhankelijkheid van synthetische data die wordt gebruikt voor data-augmentatie, waarbij AI data genereert die supplementaire datasets aanvult die zijn verzameld uit real-world scenario’s.

Ik zie ook een sterke interesse in het nastreven van verklarende AI. De meeste AI-modellen van tegenwoordig lijden aan het black box-effect, of een gebrek aan transparantie in hun besluitvormingsprocessen. Bedrijven proberen dit paradigma te veranderen door AI-modellen te creëren die kunnen uitleggen hoe ze tot de uitvoer of beslissingen zijn gekomen.

Tenslotte zijn bedrijven zich bewust van de groeiende zorgen over dataprotectie. Daarom worden AI-technieken die dataprotectie behouden, zoals federated learning, steeds meer gevraagd. Organisaties willen AI-modellen trainen zonder enige compromis met gebruikersdataprotectie.

We zorgen ervoor dat we op de hoogte zijn van deze trends, zodat we oplossingen kunnen bouwen die AI-teams in staat stellen om concurrerend te blijven.

Hoe zie je AI-gestuurde agenten en automatisering de dataverzamelingslandschap veranderen?

Op dit moment gebruiken AI-modellen voornamelijk gestructureerde datasets die meestal handmatig worden verzameld. Deze datasets gaan ook door preprocessen, reinigen en andere procedures die meestal menselijke interventie vereisen. Dit zal in de nabije toekomst veranderen met de opkomst van AI-agenten voor autonome dataverzameling en -verwerking voor AI-training. Ze maken het mogelijk om van real-time webdata te leren op een ongekende schaal.

We hebben infrastructuur gecreëerd die de implementatie en evolutie van AI-agenten ondersteunt, waardoor AI-teams soepel toegang hebben tot hoge kwaliteit, real-time webdata. Deze technologie stelt geavanceerde AI-systemen in staat om voortdurend te communiceren met dynamische webdata, ervan te leren en te groeien.

AI-agenten kunnen industrieën transformeren omdat ze AI-systemen in staat stellen om toegang te krijgen tot en te leren van constant veranderende datasets op het web, in plaats van te vertrouwen op statische en handmatig verwerkte data. Dit kan leiden tot bank- of cybersecurity AI-chatbots, bijvoorbeeld, die in staat zijn om beslissingen te nemen die de meest recente realiteiten weerspiegelen. Dit resulteert in enorme efficiëntieverbeteringen en meer mogelijkheden voor automatisering.

Bij Bright Data zijn we niet alleen deze transformatie in de dataverzamelingslandschap aan het faciliteren. We geloven dat we aan de voorzijde staan van het introduceren van een technologie die de volgende generatie van kunstmatige intelligentie aankondigt. We zijn enthousiast om bedrijven en AI-teams te helpen bij het benutten van het volledige potentieel van AI-agenten voor hun operaties.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Bright Data bezoeken op Bright Data.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.