Intervjuer
Or Lenchner, CEO av Bright Data – Intervju-serie

Or Lenchner, CEO av Bright Data, har ledet markedets ledende webdata-samlingplattform siden 2018, og har drevet dens utvidelse, innovasjon og vekst til over 100 millioner USD i årlig omsetning. Bright Data muliggjør at Fortune 500-selskaper, ledende bedrifter, kjente universiteter og offentlige instanser kan få tilgang til offentlig webdata i sanntid og i stor skala. Lenchner er en sterk forkjemper for å holde offentlig webdata åpen og tilgjengelig, og understreker dens kritiske rolle i å drive innovasjon.
Hva inspirerte din reise inn i verden av data og AI, og siden du ble CEO i 2018, hvordan har du formet Bright Data’s misjon og visjon?
Jeg har alltid vært fascinert av kraften i data, særlig av hvordan det kan drive beslutninger og fremme innovasjon. Når det brukes riktig, kan data også drive transparens i bedrifter. Å bli CEO av Bright Data i 2018 ga meg en mulighet til å hjelpe med å forme hvordan AI-forskere og bedrifter går om å samle inn og bruke offentlig webdata.
Hva er de største utfordringene AI-teamene møter i å samle inn stor skala offentlig webdata, og hvordan løser Bright Data disse utfordringene?
Skalabilitet er en av de største utfordringene for AI-teamene. Ettersom AI-modellene krever enorme mengder data, er effektiv innhenting ingen liten oppgave. Og ettersom AI-modellene bare er like gode som dataene de er trent på, er det en konstant utfordring å sikre at teamene har tilgang til fersk, høykvalitetsdata. Dette er særlig sant ettersom weben utvikler seg i sanntid.
En annen stor bekymring er reviderte krav. Data-privatlovene og -kravene utvikler seg kontinuerlig, så AI-teamene må alltid være oppmerksomme på disse endringene. De må også forstå hvordan de skal håndtere nettsteder som setter i verk anti-bot-mekanismer, som kan komplisere datagjøringen.
Plattformen vi har bygget på Bright Data løser disse utfordringene. Vi tilbyr skalerbar, automatisert data-innhenting som leverer strukturert sanntidsdata. Våre AI-drevne verktøy rensker og validerer data for å sikre nøyaktighet. Vi har strenge tiltak på plass for å sikre lovlig og etisk data-innhenting for reviderte krav. Ideen er å gi AI-teamene mulighet til å fokusere på å bygge gode modeller, mens vi håndterer kompleksiteten i data-innhenting.
Hvordan bidrar høykvalitets webdata til AI-modellens ytelse, og hva er de beste praksisene for å sikre data-nøyaktighet?
Høykvalitetsdata betyr data som er fullstendig, fritt for fordommer og mest viktig, nøyaktig. Hvis dataene mangler eller er preget av inkonsistenser og feil, vil den resulterende AI-modellen ikke fungere i henhold til forventningene.
For å oppnå nøyaktighet, er det best å samle inn data fra en rekke offentlige kilder som har etablert pålitelighet. Å bruke bare noen få, eller verre, bare en enkelt datakilde, resulterer i problemer som manglende fullstendighet. Å ha flere kilder gir mulighet til å krysseferiere data og bygge en mer balansert og representativ datasett. I tillegg bør organisasjonene vurdere automatisert data-validering og rensking for å effektivt fjerne feilaktig og inkonsistent data.
Ved Bright Data tar vi alle disse faktorene i betraktning. Vi tilbyr AI-teamene strukturert og sanntidsdata som er validerert for nøyaktighet. På den måten kan de trene modeller med tillit.
Hva er de største etiske bekymringene i offentlig webdata-innhenting i dag?
Personvern er en av de største bekymringene i offentlig webdata-innhenting. Folk er bekymret for at deres data kan bli utsatt for misbruk og overtramp. For å sikre at dataene forblir private, er det viktig å understreke transparens. Organisasjoner som samler inn data, må være åpne omkring hvilke data de samler inn. Det er viktig å forsikre allmennheten om at deres data brukes under strenge etiske retningslinjer.
En annen stor bekymring er monopolisering. Visse store selskaper har kontroll over en stor mengde data, noe som skaper en ujevn spillende felt hvor bare noen få har tilgang til informasjonen som er nødvendig for å trene AI-modeller og drive innovasjon. Dette er ikke slik det bør være. Offentlig webdata bør forbli tilgjengelig for bedrifter, forskere og utviklere. På den måten kan AI-utviklingen ikke konsentreres i hendene på bare noen få store spillere.
Etikk er ikke en ettertanke på Bright Data. De er innbygget i hver enkelt beslutning vi tar. Vi følger ikke bare bransjestandarder – vi setter dem. Vi leder i data-innhentingsindustrien i å definere riktige etiske standarder. Vi ønsker å sikre at offentlig webdata tilgjengelig på en ansvarlig, transparent og i samsvar med globale regler.
Hvordan sikrer Bright Data overholdelse av globale data-privatlovene samtidig som de muliggjør stor skala data-innhenting?
Vår organisasjon er kommet til å overholde globale lovmessige og regulative krav til data-innhenting og -bruk. Vi ser til at vi overholder kravene i GDPR, CPRA, CCPA og andre relevante regler. Viktig er at vi strengt følger Know Your Customer (KYC)-protokoller for å sikre at bare legitime brukere får tilgang til vår plattform. Våre datasølnader kan bare tilgjengelig for legitime bedrifter og forskere.
Vår godkjente brukspolitikk er også tydelig i å definere hva slags data som kan og ikke kan samles inn. Dette inkluderer ansvarlig bruk. Vi har en dedikert overholdelses-team som er ansvarlig for kontinuerlig overvåking av regler for å sikre at vi er oppdatert med de siste lovmessige og regulative kravene.
Uansett, mener vi at offentlig webdata bør forbli tilgjengelig. Vårt mål er å gi AI-teamene den data de trenger samtidig som vi sikrer overholdelse av personvern og lovmessige standarder.
Hvordan balanserer du bedriftsvekst med å opprettholde etiske data-innhentingspraksiser?
Vi tenker alltid på etikk og vekst som ikke er gjensidig exclusive. Tilliten til våre kunder og forholdet vi bygger med dem er viktigste bekymringene. Vi forstår at vi bare kan oppnå langvarig suksess hvis vi samler inn data under åpne og lovmessige vilkår.
Derfor har vi satt i verk en streng vurderingsprotokoll for våre brukere. Dette er designet for å sikre at dataene vi samler inn brukes på en etisk måte. Vi allokerer tid, innsats og ressurser til overholdelse og sikkerhet for å beskytte våre kunder og allmennheten generelt. Ved å følge etiske data-innhentingspraksiser, lykkes vi bedriftsmessig samtidig som vi bidrar til å etablere en transparent og ansvarlig AI-økosystem.
Hvordan holder Bright Data seg foran reguleringer i data-privatlovene?
Vi forstår at våre data-bruksprosesser og -politikk uunngåelig må endres for å reflektere endringer i relevante lover og regler. Som sådan konsulterer vi regelmessig juridiske eksperter og kommuniserer med reguleringer. Vi deltar også i diskusjoner med lovgivere og andre involvert i politikkbygging, og gir innspill i utarbeidelsen av meningsfulle data-reguleringer. Vi søker å finne en balanse mellom innovasjon og data-privat.
Vårt data-innhentings- og -bruk-rammeverk utvikler seg som nye lover utstedes og regler revideres. Vi har et overholdelses-team som proaktivt oppdaterer våre data-brukspolitikk for å sikre at vår plattform alltid er fullstendig overholdt. I tillegg driver vi kunde-utdanningsinitiativer for å fremme etisk data-bruk.
Hva er de fremvoksende trendene i AI-data-innhenting som bedrifter bør være oppmerksomme på?
Sanntids data-innhenting blir en nødvendighet for dagens AI-modeller. Det er kritisk for dem å få tilgang til de siste eller ferskeste dataene for å levere en høy nivå av nøyaktighet og gi bedre brukeropplevelser.
En annen merkbart trend er avhengighet av syntetisk data brukt til data-augmentering, hvor AI genererer data som supplementerer datasett samlet inn fra virkelige verdens-scenarier.
Jeg ser også en sterk interesse for å drive forklarbar AI. De fleste AI-modellene i dag lider av en “black box”-effekt, eller en mangel på transparens i deres beslutningsprosesser. Bedrifter søker å endre denne paradigmen ved å skape AI-modeller som kan forklare hvordan de kom frem til utgangene eller beslutningene de tar.
Til slutt er bedrifter oppmerksomme på økende data-privat-bekymringer. Derfor blir AI-teknikker rettet mot å bevare data-privat, som f.eks. distribuert læring, mer etterspurt. Organisasjoner ønsker å maksimere AI-modell-trening uten å kompromittere brukerdata-privat.
Vi sikrer at vi er på toppen av disse trendene, så vi kan bygge løsninger som lar AI-teamene holde en konkurransefordel.
Hvordan ser du på AI-drevne agenter og automatisering som endrer data-innhentingslandskapet?
I øyeblikket bruker AI-modellene strukturerte datasett som hovedsakelig samles inn manuelt. Disse datasettene går også gjennom forbehandling, rensking og andre prosedyrer som vanligvis involverer menneskelig inngripen. Dette er på vei til å endre seg i nær fremtid med oppkomsten av AI-agenter for autonom data-innhenting og -behandling for AI-trening. De gjør det mulig å lære automatisk fra sanntids webdata på en tidligere uoppnåelig skala.
Vi har skapt infrastruktur som støtter utrullingen og utviklingen av AI-agenter, og muliggjør enkel tilgang til høykvalitets, sanntids webdata på nettet. Denne teknologien lar sofistikerte AI-systemer kontinuerlig kommunisere med dynamisk webdata, lære fra den og vokse større og bedre.
AI-agenter kan transformere industrier ved å gi AI-systemer mulighet til å få tilgang til og lære fra konstant endrende datasett på nettet, i stedet for å avhenge av statiske og manuelt prosesserte data. Dette kan føre til bank- eller sikkerhets-AI-chatbots, for eksempel, som er i stand til å komme frem til beslutninger som reflekterer de siste realitetene. Dette resulterer i massive effisiens-fremgang og flere områder for automatisering.
Ved Bright Data er vi ikke bare med på å muliggjøre denne transformasjonen i data-innhentingslandskapet. Vi mener at vi er i forkant, og introduserer en teknologi som innleder den neste generasjonen av kunstig intelligens. Vi er spente på å hjelpe bedrifter og AI-team med å utnytte fullt potensialet i AI-agenter for deres operasjoner.
Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Bright Data.












