Interviuri
Andrea Vattani, Co-Fondator & Șef Științific la Spiketrap – Seria de Interviuri

Andrea Vattani este Co-Fondator & Șef Științific la Spiketrap, o companie de contextualizare care alimentează inteligența audienței și performanța media pentru creatori, platforme și mărci. Tehnologia lor proprietară Clair AI extrage semnalul din zgomotul seturilor de date nestructurate, oferind o claritate și un context fără precedent, în special în medii online cu viteză ridicată.
Ce v-a atras inițial către știința calculatoarelor și IA?
A fost o combinație de circumstanțe favorabile, am ajuns la Universitatea din Roma pentru a susține testul de admitere la specializarea Statistică și s-a dovedit că am întârziat o zi! Mi s-a sfătuit să aplic pentru Știința calculatoarelor și să mă mut înapoi la Statistică după un an. Am mers la testul de admitere la Știința calculatoarelor (care a fost în acea zi!) și am trecut… și niciodată nu m-am mutat înapoi la Statistică! Interesul meu pentru IA a început cu realizarea modului în care calculatoarele pot ajuta la automatizarea lucrurilor, iar IA este mașinaria de automatizare supremă. De asemenea, limba naturală și modul în care oamenii o folosesc m-a interesat întotdeauna: am studiat studii clasice în liceu, studii de limbă greacă veche și latină, ceea ce este probabil similar cu modul în care o mașină se simte atunci când i se oferă un flux de cuvinte.
Ați lucrat anterior ca Inginer de Software Senior la Amazon (AMZN ) Goodreads, ce proiecte ați lucrat și ce au fost câteva dintre principalele concluzii din această experiență?
La Goodreads, am lucrat la multiple proiecte de învățare automată, care au inclus detectarea spam-ului și scalarea motorului de recomandare de cărți. Concluziile mele din perioada petrecută acolo au fost învățarea importanței definirii metricilor de IA care se potrivesc obiectivelor de afaceri și clienți. Pentru a da un exemplu, motoarele de recomandare au existat de foarte mult timp. Își amintiți concursul “Netflix (NFLX ) Prize” din 2009 pentru a găsi recomandări de filme mai bune? Unele insight-uri din soluțiile câștigătoare au sugerat că șansele de a urmări un film nu sunt conduse atât de mult de faptul că îl veți place sau nu, ci mai mult de faptul că este similar cu interesele dvs. Acest lucru poate funcționa pentru filme, deoarece este un angajament scurt de 90 de minute, dar pentru cărți nu este cazul. Integrarea obiectivului potrivit în metrici este cheia.
O altă învățare pe care am aplicat-o la Spiketrap este să construiesc echipe de IA care sunt orientate către livrare și integrate cu planul de produs, mai degrabă decât o echipă izolată care se concentrează doar pe explorări și cercetare. Acest lucru duce la o definire mai bună a obiectivelor, termenelor și înțelegerii ROI-ului. De asemenea, favorizează în mod natural ca echipa să se concentreze pe viteza și practicitatea unui model, mai degrabă decât doar pe acuratețe. Revenind la exemplul concursului Netflix, modelele echipelor câștigătoare nu au fost niciodată integrate din cauza lipsei de practicitate, în ciuda acurateței îmbunătățite.
Cercetarea dvs. a fost publicată în numeroase reviste, ce considerați a fi cel mai important articol până acum?
În timpul doctoratului meu, am avut norocul de a colabora cu mai mulți cercetători din diferite domenii, inclusiv învățare automată, “big data”, analiza datelor sociale și teoria jocurilor. Un articol pe care îl apreciez pentru simplitatea și aplicabilitatea sa este “Scalable K-Means++” : K-means++ este o metodă de clustering nesupervizată ubicuă pentru a împărți un set de date în K grupuri coerente. Acesta face acest lucru prin adăugarea unui grup la un moment dat, astfel încât, atunci când aveți tone de date și grupuri, devine prea lent. În acel articol, arătăm cum puteți obține același rezultat, dacă nu și mai bun, prin paralelizarea metodei. Metodologia noastră este extrem de simplă și a fost implementată în mai multe biblioteci de învățare automată.
Puteți împărtăși povestea de origine a Spiketrap?
După ce am lucrat la Goodreads, eu și co-fondatorii Spiketrap, Kieran și Virgilio, am înțeles că există o lacună în industrie pentru accesarea insight-urilor avansate de marcă de la platforme sociale de nișă. Prin aplicarea tehnologiilor de IA, am putut aborda problema într-un mod eficient.
În economia de astăzi, este esențial pentru companii să asculte clienții și industriile lor în ansamblu. Cu toate acestea, multe dintre ceea ce clienții au de spus despre mărci rămân neauzite. Milioane de oameni își exprimă opinia deschis în fiecare zi, pe platforme precum Twitter, Reddit, Twitch și altele. Acesta s-a dovedit a fi o resursă extrem de valoroasă pentru orice cercetător de piață, cu condiția ca conținutul să poată fi contextualizat la scară. Problema este că industria de insight-uri nu a ținut pasul cu comportamentele digitale și limbajul în evoluție.
Uneltele de ascultare rămân dependente de cuvinte cheie și căutări booleane, pierzând multe dintre conversațiile care ar putea și ar trebui să fie atribuite unei anumite mărci. Între timp, firmele de cercetare de piață au fost prinse într-un act de echilibristică din ce în ce mai dificil, încercând să obțină insight-uri calitative din metode cantitative și limitate de cost.
În rezumat, oamenii au lipsit de uneltele necesare pentru a înțelege audiența la scară. Numărul de vânzări și numărul de vizualizări răspund la “ce” al comportamentului audienței, dar nu și la “de ce”. Fără context, stabilirea a ceea ce este corelație versus cauzalitate este un joc de ghicire. Recunoscând acest vid, am săpat în ceea ce ar fi o soluție pentru înțelegerea contextuală și așa a apărut Spiketrap.
Care sunt unele dintre tehnologiile de învățare automată utilizate la Spiketrap?
Folosim o multitudine de tehnologii, de la Scikit-learn obișnuit la biblioteci de învățare profundă precum Pytorch. Pe lângă biblioteci, metodologiile, modelele și seturile de date pe care le utilizăm sunt în mare parte proprietare. Am învățat că metodele și modelele standard nu vă duc prea departe, dar pentru a aborda cu adevărat o problemă, trebuie să puneți propriul dvs. efort, începând de la obiective și ajungând la arhitectura modelului și seturile de date. Pentru a da un exemplu, modelarea de subiecte este sarcina de a extrage teme dintr-o colecție de texte. “Spiketrap Convos” oferă clienților noștri insight-uri cruciale despre audiența lor și utilizează modelarea de subiecte ca unul dintre semnalele sale. Metoda dvs. standard pentru modelarea de subiecte este LDA (Latent Dirichlet Allocation), dar, din nefericire, este prea inconsistent și imprevizibil și pur și simplu nu este suficient de puternic. Pe de altă parte, puteți încerca un model preantrenat modern, cum ar fi Bert-Topics, care, deși puternic și cuprinzător, este, de asemenea, rigid și lent. IA și limbajul au făcut salturi și sărituri în ultimul deceniu, dar transformarea modelelor existente în produse este încă departe de a fi optimal și o miză riscantă.
Puteți explica cum Spiketrap alimentează înțelegerea instantanee a audienței pentru creatori, platforme și mărci?
Agencies și agenții de publicitate folosesc tabelele noastre de lideri de influență și uneltele de afinitate de marcă pentru a identifica creatori ale căror comunități sunt sigure pentru marcă într-o serie de categorii, inclusiv note pentru conținut toxic, profan și sexual, precum și siguranța generală a comunității.
Creatorii pot folosi instrumentul pentru a intra în fluxuri individuale și a vedea care conversații au fost cele mai sigure sau mai puțin sigure, care au condus la implicarea pozitivă a sponsorilor și unde ar putea îmbunătăți eforturile de moderare.
Un articol recent intitulat “FeelsGoodMan: Inferarea semantică a neologismelor Twitch” a fost publicat de Spiketrap. Puteți descrie pe scurt ce este acest articol?
Modul în care oamenii comunică și își exprimă online a devenit din ce în ce mai complex și mai dificil de descifrat. Mai întâi au apărut emoticoanele :-). Apoi au apărut emoji-urile. Apoi au apărut meme-urile… și acum “emote”-urile, o nouă formă de comunicare bazată pe icone care a devenit extrem de populară pe platforma de streaming Twitch. Asemănător cu emoji-urile pentru utilizarea lor amestecată cu textul regulat, acestea prezintă provocări similare cu cele ale meme-urilor, deoarece sunt generate de utilizatori și au un sens criptic care nu are o legătură evidentă cu imaginea înfățișată. Există peste 8 milioane de emote distincte până în prezent, cu peste 400.000 utilizate săptămânal. Încă, oamenii comunică eficient utilizându-le pentru a exprima orice fel de sentiment, cum ar fi bucurie, plictiseală, entuziasm sau sarcasm. Articolul nostru recent este o “carte de bucate” de IA pentru a infera semnificația semantică a emote-urilor. Abordarea noastră nu necesită menținerea și actualizarea unui set de date curat manual, și este capabilă să se auto-adapteze la introducerea continuă de noi emote, dar și la evoluția sensului emote-urilor populare. Acest lucru este deosebit de important atunci când un emote devine încărcat politic sau rasial, așa cum am văzut că se întâmplă cu emote-uri extrem de populare, cum ar fi “TriHard”, “PogChamp” și “FeelsGoodMan”. Utilizarea dinamică a limbajului și schimbările de sens ridică probleme uriașe pentru sistemele de moderare sau cadrele de analiză a sentimentului, așa că suntem mândri să abordăm această problemă în modul corect la Spiketrap.
Există altceva pe care ați dori să îl împărtășiți despre Spiketrap?
Pe măsură ce ne uităm spre noul an, Spiketrap lucrează la dezvoltarea și perfecționarea unui nou instrument care va oferi o înțelegere mai profundă a sentimentului de marcă pentru clienții noștri. Noul instrument de afinitate Spiketrap oferă o modalitate interactivă și intuitivă de a identifica și cuantifica afinitățile audienței între creatori, mărci, jocuri și multe altele. Pentru orice întrebare dată, instrumentul generează scoruri de indice de afinitate care indică cât de bine o entitate dată este corelată pozitiv cu alta. Numeroase semnale contextuale compun scorul, inclusiv frecvența și sentimentul mențiunilor conexe. Stiva tehnologică Spiketrap este poziționată în mod unic pentru a indexa afinitățile între jocuri, mărci și creatori. Clair, IA de NLP proprietară, procesează milioane de mesaje generate de utilizatori și publicate public în fiecare zi, atribuind conținutul altfel ambiguu entităților din graficul de cunoaștere extins al Spiketrap, identificând subiecte de conversație, determinând sentimentul și monitorizând siguranța. Adăugarea noului instrument de afinitate împuternicește dezvoltatorii, creatorii, mărcile și multe altele să înțeleagă mai bine audiența și impactul mărcii lor.
Mulțumim pentru acest interviu minunat, cititorii care doresc să afle mai multe despre Spiketrap ar trebui să viziteze Spiketrap.












