Interviste

Roshanak Houmanfar, VP di Machine Learning Products presso Integrate.ai – Intervista

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Roshanak (Ro) Houmanfar è il VP di machine learning products per integrate.ai, un’azienda che aiuta gli sviluppatori a risolvere i problemi più importanti del mondo senza rischiare dati sensibili. Ro ha un particolare talento per trovare nuovi modi per semplificare concetti di intelligenza artificiale complessi e collegarli alle esigenze degli utenti. Sfruttando questa esperienza, si trova alla forefront della missione di integrate.ai per democratizzare l’accesso alla tecnologia di privacy-enhancing.

Cosa ti ha inizialmente attratto verso la scienza dei dati e il machine learning?

Ho iniziato il mio percorso nella robotica. Dopo aver sperimentato con diversi angoli della robotica e aver bruciato un laboratorio di saldatura, sono giunta alla conclusione che ero più attratta dal lato dell’intelligenza artificiale del mio campo e che mi ha portato al meraviglioso mondo del machine learning.

Puoi descrivere il tuo ruolo attuale e cosa significa una giornata tipo per te?

Sono il VP di Product presso integrate.ai, un’azienda SaaS che aiuta gli sviluppatori a risolvere i problemi più importanti del mondo senza rischiare dati sensibili. Stiamo costruendo strumenti per il machine learning e l’analisi dei dati in modo sicuro per il futuro distribuito dei dati.

Nella mia giornata tipo, lavoro con i nostri team attraverso le funzioni per raggiungere tre cose:

Pensare al futuro dell’intelligenza e come possiamo plasmarlo in modo che l’intelligenza risolva i problemi più critici

Capire i punti deboli dei nostri clienti e come possiamo innovare per rendere il loro lavoro più impattante ed efficiente.

Assicurarmi che la nostra visione e il feedback dei clienti siano sempre considerati nello sviluppo del prodotto, lavorando in collaborazione con i nostri team per offrire le migliori funzionalità.

Il dato sintetico è attualmente tutto il rage nel machine learning, ma integrate.ai prende un approccio un po’ contrarian. Quali sono alcune applicazioni in cui il dato sintetico potrebbe non essere un’opzione desiderabile?

Per capire quando il dato sintetico non è la migliore soluzione, è importante capire innanzitutto quando lo è. Il dato sintetico è meglio utilizzato quando l’obiettivo di modellazione ha o una piccola quantità di dati reali disponibili o nessuno – ad esempio, in problemi di avvio a freddo e formazione di modelli basati su testo e immagini. A volte, semplicemente non c’è abbastanza dati necessari per addestrare un modello, ed è quando il dato sintetico brilla come soluzione.

Tuttavia, il dato sintetico viene utilizzato sempre più in situazioni in cui esiste una grande quantità di dati reali, ma quei dati sono isolati a causa di regolamenti sulla privacy, costi di centralizzazione o altri ostacoli di interoperabilità. Questo è un uso improprio del dato sintetico. In questi casi di utilizzo, è difficile determinare il livello giusto di astrazione per la creazione di dati sintetici, il che porta a dati sintetici di bassa qualità che possono causare pregiudizi innati o altri problemi lungo la strada che sono difficili da debuggare. Inoltre, i modelli addestrati con dati sintetici non sono paragonabili a quelli addestrati con dati reali di alta qualità e granulari.

Integrate.ai si specializza nell’offrire soluzioni di federated learning, potresti descrivere cosa è il federated learning?

Nel machine learning tradizionale, tutti i dati di addestramento del modello devono essere centralizzati in un database. Con il federated learning, i modelli possono essere addestrati su set di dati decentralizzati e distribuiti – o dati che risiedono in due o più database separati e non possono essere facilmente spostati. Funziona in questo modo: porzioni di un modello di machine learning vengono addestrate dove si trovano i dati e i parametri del modello vengono condivisi tra i set di dati partecipanti per produrre un modello globale migliorato. E poiché non si spostano dati all’interno del sistema, le organizzazioni possono addestrare modelli senza ostacoli come regolamenti sulla privacy e la sicurezza, costi o altre preoccupazioni di centralizzazione.

In generale, i dati di addestramento accessibili con il federated learning sono di qualità molto più alta, poiché i dati centralizzati tendono a perdere un po’ della loro granularità a scapito della facilità di accesso in un’unica posizione.

Come un’azienda può identificare i migliori casi d’uso per il federated learning?

Il federated learning è una tecnologia di machine learning costruita per situazioni in cui l’accesso ai dati o il loro trasferimento nell’infrastruttura tradizionale del machine learning con laghi di dati centralizzati è doloroso. Se si verifica uno dei seguenti sintomi, il federated learning fa per voi:

  • Fornite prodotti intelligenti alimentati da analisi e machine learning e non potete creare effetti di rete per i vostri prodotti perché i dati sono di proprietà dei vostri clienti.
  • State lavorando attraverso lunghi accordi di servizio o accordi di condivisione dei dati per ottenere l’accesso ai dati dei vostri partner.
  • State spendendo molto tempo a formare contratti di collaborazione con i vostri partner, in particolare in situazioni in cui il risultato di questa partnership di dati è incerto per voi.
  • Sedete su una grande quantità di dati e volete monetizzare i vostri set di dati, ma avete paura delle implicazioni per la vostra reputazione.
  • State già monetizzando i vostri dati, ma state spendendo molto tempo, sforzo e denaro per rendere i dati sicuri per la condivisione.
  • La vostra infrastruttura è stata lasciata indietro durante il passaggio al cloud, ma avete ancora bisogno di analisi e machine learning.
  • Aveete molte filiali che appartengono alla stessa organizzazione, ma non potete condividere direttamente i dati tra loro.
  • I set di dati con cui state lavorando sono troppo grandi o costosi da spostare, quindi avete deciso di non utilizzarli o le vostre pipeline ETL costano molto.
  • Avevi un’applicazione o un’opportunità che potrebbe avere un impatto significativo, ma non avete i dati necessari per farla accadere.
  • I vostri modelli di machine learning hanno raggiunto un plateau e non sapete come migliorarli ulteriormente.

La privacy differenziale è spesso utilizzata in congiunzione con il federated learning, cosa è esattamente?

La privacy differenziale è una tecnica per garantire la privacy mentre si sfrutta il potere del machine learning. Utilizzando matematiche diverse dalle tecniche di de-identificazione standard, la privacy differenziale aggiunge rumore durante l’addestramento del modello locale, preservando la maggior parte delle caratteristiche statistiche del set di dati mentre limita il rischio che i dati individuali vengano identificati.

Nelle implementazioni ideali, la privacy differenziale porta il rischio vicino a zero, mentre i modelli di machine learning mantengono prestazioni simili – fornendo tutta la sicurezza necessaria per la de-identificazione dei dati, senza ridurre la qualità dei risultati del modello.

La privacy differenziale è inclusa nella piattaforma di integrate.ai per default, in modo che gli sviluppatori possano assicurarsi che i dati individuali non possano essere dedotti dai parametri del modello.

Potresti descrivere come funziona la piattaforma di federated learning di integrate.ai?

La nostra piattaforma sfrutta il federated learning e la privacy differenziale per sbloccare una gamma di capacità di machine learning e analisi dei dati su dati che altrimenti sarebbero difficili o impossibili da accedere a causa di problemi di privacy, confidenzialità o ostacoli tecnici. Operazioni come l’addestramento del modello e l’analisi vengono eseguite localmente e solo i risultati finali vengono aggregati in modo sicuro e confidenziale.

Integrate.ai è confezionato come uno strumento per gli sviluppatori, consentendo loro di integrare queste funzionalità in quasi qualsiasi soluzione con un facile da usare software development kit (SDK) e un servizio cloud di supporto per la gestione end-to-end. Una volta integrata la piattaforma, gli utenti finali possono collaborare su set di dati sensibili mentre i custodi dei dati mantengono il pieno controllo. Le soluzioni che incorporano integrate.ai possono servire sia come strumenti di sperimentazione efficaci che come servizi pronti per la produzione.

Quali sono alcuni esempi di come questa piattaforma possa essere utilizzata nella diagnostica di precisione?

Una delle reti di partner con cui stiamo lavorando, l’Autism Sharing Initiative, raccoglie informazioni relative alla diagnosi dell’autismo, nonché campioni di dati del genoma per comprendere le connessioni tra i diversi genotipi e fenotipi e le diagnosi dell’autismo. Ogni sito di dati individuali non ha abbastanza set di dati per far funzionare i modelli di machine learning, ma collettivamente creano un campione significativo. Tuttavia, spostare i dati rappresenta un alto rischio per la sicurezza e la privacy, e a causa dei regolamenti e delle politiche dell’ospedale, questi istituti di ricerca hanno sempre fatto default a non condividere.

In una rete diversa, con un’impostazione simile, i ricercatori sono interessati a migliorare l’assegnazione dei trial clinici ai pazienti utilizzando una visione più olistica della storia di ogni paziente.

I diversi istituti di ricerca coinvolti hanno accesso a informazioni diverse su ogni paziente – un laboratorio ha accesso alle loro scansioni mediche, un altro laboratorio ha accesso alle loro informazioni genomiche e un altro istituto ha i risultati dei trial clinici. Ma queste diverse organizzazioni non possono condividere direttamente le informazioni tra loro.

Con la soluzione integrate.ai, ogni organizzazione può accedere ai dati degli altri per i propri obiettivi senza spostare i dati lontano dai custodi dei dati e quindi aderendo alle loro politiche interne.

Potresti discutere l’importanza di rendere la privacy comprensibile e come integrate.ai lo consente?

Rendere la privacy comprensibile significa aprire molte porte a imprese e organizzazioni che storicamente erano chiuse a causa della natura ambigua del rischio. I regolamenti sulla privacy come il GDPR, il CCPA e l’HIPPA sono incredibilmente complessi e possono variare a seconda dell’industria, della regione e del tipo di dati, rendendo difficile per le organizzazioni determinare quali progetti di dati sono sicuri per la privacy. Invece di sprecare tempo e manodopera controllando ogni casella, la piattaforma di federated learning di integrate.ai offre la privacy differenziale, l’omomorphic encryption e il secure multi-party computation incorporati, in modo che gli sviluppatori e i custodi dei dati possano stare tranquilli sapendo che i loro progetti saranno automaticamente conformi ai requisiti regolamentari, senza il fastidio di saltare attraverso ogni categoria.

C’è qualcos’altro che vorresti condividere su integrate.ai?

La soluzione di integrate.ai è uno strumento incredibilmente amichevole per gli sviluppatori che consente il machine learning e l’analisi dei dati in modo conforme, preservando la privacy e la sicurezza su fonti di dati sensibili. Attraverso API facili da usare, tutta la complessità della conformità regolamentare e dei contratti su dati sensibili è astratta. La soluzione di integrate.ai consente ai data scientist e agli sviluppatori di software di gestire i loro carichi di lavoro in modo sicuro con un impatto minimo sulla loro infrastruttura e flussi di lavoro attuali.

Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare integrate.ai.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.