Interviste
Or Lenchner, CEO di Bright Data – Serie di Interviste

Or Lenchner, CEO di Bright Data, ha guidato la piattaforma di raccolta di dati web di mercato leader dal 2018, guidandone l’espansione, l’innovazione e la crescita a oltre 100 milioni di dollari di entrate annuali. Bright Data consente alle società Fortune 500, alle principali aziende, alle università più rinomate e alle entità del settore pubblico di accedere ai dati web pubblici in tempo reale e su larga scala. Lenchner è un forte sostenitore della necessità di mantenere i dati web pubblici aperti e accessibili, sottolineando il loro ruolo critico nel guidare l’innovazione.
Qual è stato il tuo percorso nel mondo dei dati e dell’intelligenza artificiale e, dal momento in cui sei diventato CEO nel 2018, come hai plasmato la missione e la visione di Bright Data?
Ho sempre sido affascinato dal potere dei dati, in particolare da come possono guidare le decisioni e alimentare l’innovazione. Quando utilizzati correttamente, i dati possono anche garantire la trasparenza negli affari. Diventare CEO di Bright Data nel 2018 mi ha dato l’opportunità di aiutare a plasmare come i ricercatori di intelligenza artificiale e le aziende raccolgono e utilizzano i dati web pubblici.
Quali sono le principali sfide che le squadre di intelligenza artificiale affrontano nella raccolta di grandi quantità di dati web pubblici e come Bright Data affronta queste sfide?
La scalabilità rimane una delle principali sfide per le squadre di intelligenza artificiale. Poiché i modelli di intelligenza artificiale richiedono enormi quantità di dati, la raccolta efficiente non è un compito facile. E poiché i modelli di intelligenza artificiale sono solo così buoni come i dati su cui sono stati addestrati, assicurarsi che le squadre abbiano accesso a dati freschi e di alta qualità è una sfida costante. Ciò è particolarmente vero poiché il web evolve in tempo reale.
Un’altra preoccupazione importante è la conformità. Le leggi e i requisiti sulla privacy dei dati continuano a evolversi, quindi le squadre di intelligenza artificiale devono sempre essere consapevoli di questi cambiamenti. Devono anche capire come gestire i siti web che applicano meccanismi anti-bot, che possono complicare il processo di raccolta dei dati.
La piattaforma che abbiamo costruito in Bright Data affronta queste sfide. Forniamo una raccolta di dati automatizzata e scalabile che fornisce dati in tempo reale e strutturati. I nostri strumenti guidati dall’intelligenza artificiale puliscono e convalidano i dati per garantire l’accuratezza. Abbiamo misure severe in atto per garantire la raccolta di dati legale ed etica per la conformità. L’idea è di potenziare le squadre di intelligenza artificiale per concentrarsi sulla costruzione di grandi modelli, mentre noi gestiamo le complessità della raccolta dei dati.
Come i dati web di alta qualità contribuiscono alle prestazioni dei modelli di intelligenza artificiale e quali sono le migliori pratiche per garantire l’accuratezza dei dati?
I dati di alta qualità significano dati che sono completi, privi di pregiudizi e, soprattutto, accurati. Se i dati sono carenti o pieni di incoerenze e errori, il modello di intelligenza artificiale risultante non si comporterà secondo le aspettative.
Per raggiungere l’accuratezza, è meglio raccogliere dati da una varietà di fonti pubbliche che abbiano stabilito l’affidabilità. Utilizzare solo alcune fonti o, peggio, una sola fonte di dati, comporta problemi come l’incompletezza. Avere più fonti fornisce la capacità di verificare i dati e costruire un set di dati più bilanciato e rappresentativo. Inoltre, le organizzazioni dovrebbero considerare la convalida e la pulizia dei dati automatizzate per eliminare efficientemente i dati errati e incoerenti.
In Bright Data, consideriamo tutti questi fattori. Forniamo alle squadre di intelligenza artificiale dati strutturati e in tempo reale che sono stati convalidati per l’accuratezza. Ciò consente loro di addestrare i modelli con fiducia.
Quali sono le principali preoccupazioni etiche nella raccolta di dati web pubblici oggi?
La privacy rimane una delle principali preoccupazioni nella raccolta di dati web pubblici. Le persone si preoccupano che i loro dati vengano esposti a abusi e maltrattamenti. Per garantire che i dati rimangano privati, è essenziale sottolineare la trasparenza. Le organizzazioni che raccolgono dati devono essere trasparenti riguardo ai dati che raccolgono. È importante assicurare al pubblico che i loro dati vengono utilizzati secondo severe linee guida etiche.
Un’altra preoccupazione importante è la monopolizzazione. Alcune grandi aziende controllano una vasta quantità di dati, creando un campo di gioco ineguale in cui solo pochi hanno accesso alle informazioni necessarie per addestrare i modelli di intelligenza artificiale e guidare l’innovazione. Non è così che dovrebbero essere le cose. I dati web pubblici dovrebbero rimanere accessibili alle aziende, ai ricercatori e agli sviluppatori. Ciò consente lo sviluppo dell’intelligenza artificiale senza concentrarsi nelle mani di pochi grandi giocatori.
Le questioni etiche non sono un pensiero successivo in Bright Data. Sono incorporate in ogni decisione che prendiamo. Non seguiamo solo gli standard dell’industria – li stabiliamo. Guidiamo l’industria della raccolta di dati nel definire gli standard etici giusti. Vogliamo assicurarci che i dati web pubblici vengano accessi in modo responsabile, trasparente e in piena conformità con le normative globali.
Come Bright Data garantisce la conformità con le normative sulla privacy dei dati a livello globale, consentendo allo stesso tempo la raccolta di grandi quantità di dati?
La nostra organizzazione è impegnata a rispettare i requisiti legali e normativi globali sulla raccolta e sull’utilizzo dei dati. Ci assicuriamo di conformarci ai requisiti del GDPR, del CPRA, del CCPA e di altre normative pertinenti. Inoltre, seguiamo rigorosamente i protocolli Know Your Customer (KYC) per assicurarci che solo utenti legittimi abbiano accesso alla nostra piattaforma. Le nostre soluzioni di dati possono essere accessibili solo da aziende e ricercatori legittimi.
La nostra Politica di utilizzo accettabile definisce chiaramente quali dati possono e non possono essere raccolti. Ciò include l’uso responsabile. Abbiamo un team di conformità dedicato alla sorveglianza continua delle normative per assicurarci di essere aggiornati con gli ultimi requisiti legali e normativi.
Tuttavia, crediamo ancora che i dati web pubblici dovrebbero rimanere accessibili. Il nostro obiettivo è fornire alle squadre di intelligenza artificiale i dati di cui hanno bisogno, garantendo al contempo la conformità con le normative sulla privacy e la legge.
Come bilanci la crescita aziendale con il mantenimento di pratiche di raccolta di dati etiche?
Pensiamo sempre all’etica e alla crescita come non mutualmente esclusive. La fiducia dei nostri clienti e la relazione che costruiamo con loro sono questioni di massima importanza. Capiamo che possiamo raggiungere il successo a lungo termine solo se raccogliamo i dati in modo trasparente e in conformità con le leggi applicabili.
Pertanto, abbiamo messo in atto un protocollo di selezione rigoroso per i nostri utenti. Ciò è progettato per garantire che i dati che raccogliamo vengano utilizzati in modo etico. Allochiamo tempo, sforzi e risorse per la conformità e la sicurezza per proteggere i nostri clienti e il pubblico in generale. Seguendo le pratiche di raccolta di dati etiche, riusciamo a raggiungere il successo aziendale e a contribuire alla creazione di un ecosistema di intelligenza artificiale trasparente e responsabile.
Come Bright Data rimane al passo con i cambiamenti normativi nella privacy dei dati?
Capiamo che i nostri processi di utilizzo dei dati e le nostre politiche devono inevitabilmente cambiare per riflettere i cambiamenti nelle leggi e nelle normative pertinenti. Pertanto, consultiamo regolarmente esperti giuridici e comunichiamo con gli organismi di regolamentazione. Partecipiamo anche a discussioni con legislatori e altri coinvolti nella creazione di politiche, fornendo input nella stesura di normative sui dati significative. Cerchiamo di trovare un equilibrio tra innovazione e privacy dei dati.
Il nostro quadro di raccolta e utilizzo dei dati evolve man mano che vengono emesse nuove leggi e le normative vengono riviste. Abbiamo un team di conformità che aggiorna proattivamente le nostre politiche di utilizzo dei dati per assicurarsi che la nostra piattaforma sia sempre completamente conforme. Inoltre, operiamo iniziative di educazione dei clienti per promuovere l’uso etico dei dati.
Quali sono le tendenze emergenti nella raccolta di dati per l’intelligenza artificiale che le aziende dovrebbero conoscere?
La raccolta di dati in tempo reale sta diventando una necessità per i modelli di intelligenza artificiale odierni. È fondamentale per loro accedere ai dati più recenti o freschi per fornire un alto livello di accuratezza e offrire migliori esperienze utente.
Un’altra tendenza degna di nota è la dipendenza dai dati sintetici utilizzati per l’arricchimento dei dati, in cui l’intelligenza artificiale genera dati che integrano i set di dati raccolti da scenari del mondo reale.
Sto anche vedendo un forte interesse per l’intelligenza artificiale spiegabile. La maggior parte dei modelli di intelligenza artificiale attuali soffre dell’effetto “scatola nera”, o della mancanza di trasparenza nei processi decisionali. Le aziende stanno cercando di cambiare questo paradigma creando modelli di intelligenza artificiale che possano spiegare come sono arrivati ai risultati o alle decisioni che prendono.
Infine, le aziende sono consapevoli delle crescenti preoccupazioni sulla privacy dei dati. È per questo che le tecniche di intelligenza artificiale finalizzate alla preservazione della privacy dei dati, come l’apprendimento federato, stanno diventando richieste. Le organizzazioni vogliono massimizzare l’addestramento dei modelli di intelligenza artificiale senza compromettere la privacy dei dati degli utenti.
Ci assicuriamo di essere al passo con queste tendenze, in modo da poter costruire soluzioni che consentano alle squadre di intelligenza artificiale di mantenere un vantaggio competitivo.
Come vedi cambiare il paesaggio della raccolta di dati con l’avvento degli agenti e dell’automazione guidati dall’intelligenza artificiale?
Attualmente, i modelli di intelligenza artificiale utilizzano set di dati strutturati che vengono raccolti manualmente. Questi set di dati vengono anche sottoposti a pre-elaborazione, pulizia e altre procedure che di solito coinvolgono l’intervento umano. Ciò sta per cambiare in futuro con l’avvento degli agenti di intelligenza artificiale per la raccolta e l’elaborazione autonoma dei dati per l’addestramento dell’intelligenza artificiale. Consentono di apprendere automaticamente dai dati web in tempo reale su una scala senza precedenti.
Abbiamo creato un’infrastruttura che supporta il dispiegamento e l’evoluzione degli agenti di intelligenza artificiale, consentendo un accesso fluido ai dati web di alta qualità in tempo reale. Questa tecnologia consente ai sistemi di intelligenza artificiale avanzati di interfacciarsi costantemente con i dati web dinamici, imparare da essi e crescere.
Gli agenti di intelligenza artificiale possono trasformare interi settori, poiché consentono ai sistemi di intelligenza artificiale di accedere e imparare da set di dati in continua evoluzione sul web, invece di affidarsi a dati statici e manualmente elaborati. Ciò può portare, ad esempio, a chatbot di banca o di sicurezza informatica che sono in grado di prendere decisioni che riflettono la realtà più recente. Ciò porta a enormi progressi nell’efficienza e a più aree di automazione.
In Bright Data, non solo stiamo facilitando questa trasformazione nel paesaggio della raccolta di dati, ma crediamo di essere all’avanguardia, introducendo una tecnologia che segna l’avvento della prossima generazione di intelligenza artificiale. Siamo entusiasti di aiutare le aziende e le squadre di intelligenza artificiale a sfruttare appieno il potenziale degli agenti di intelligenza artificiale per le loro operazioni.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Bright Data.












