Interviews

Andrea Vattani, mede-oprichter en hoofdwetenschapper bij Spiketrap – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Andrea Vattani is de mede-oprichter en hoofdwetenschapper bij Spiketrap, een contextualisatiebedrijf dat audience-intelligentie en media-prestaties levert voor creators, platforms en merken. De eigen Clair AI haalt het signaal uit de ruis van ongestructureerde datasets, waardoor ongekende duidelijkheid en context worden geboden, vooral in high-velocity online-omgevingen.

Wat trok je aanvankelijk aan naar informatica en AI?

Het was een combinatie van gelukkige omstandigheden. Ik kwam aan bij de Universiteit van Rome om me aan te melden voor de statistiekopleiding, en het bleek dat ik een dag te laat was! Ik kreeg het advies om me aan te melden voor informatica en een jaar later terug te keren naar de statistiekafdeling. Ik ging naar de toelatingsexamen voor informatica (die dag!) en slaagde… en ik ben nooit teruggegaan naar de statistiek! Mijn interesse in AI begon echt toen ik besefte hoe computers je kunnen helpen om dingen te automatiseren, en AI is de ultieme automatiseringsmachine. Ook de natuurlijke taal en hoe mensen deze gebruiken, heeft me altijd geïnteresseerd: ik studeerde klassieke studies op de middelbare school, waarbij ik oude Grieks en Latijn bestudeerde, wat waarschijnlijk vergelijkbaar is met hoe een machine zich voelt wanneer deze een stroom van woorden krijgt.

Je werkte eerder als Senior Lead Software Engineer bij Amazon (AMZN ) Goodreads, wat waren enkele van de projecten waar je aan werkte en wat waren enkele belangrijke inzichten uit deze ervaring?

Tijdens mijn tijd bij Goodreads werkte ik aan meerdere machine learning-projecten, waaronder spamdetectie en het schalen van de boekaanbevelingsengine. Mijn inzichten uit mijn tijd daar waren het leren van de belangrijkheid van het definiëren van ML-metrics die overeenkomen met de bedrijfs- en klantdoelen. Om een voorbeeld te geven: aanbevelingsengines bestaan al heel lang. Herinner je je de “Netflix (NFLX ) Prize”-wedstrijd uit 2009 om betere film-aanbevelingen te vinden? Enkele inzichten uit de topoplossingen suggereren dat de kans dat je een film bekijkt, niet zozeer wordt bepaald door of je hem leuk vindt of niet, maar vooral door of hij vergelijkbaar is met je interesses. Dat kan werken voor films, omdat het een korte verbintenis van 90 minuten is, maar voor boeken is dat niet het geval. Het integreren van het juiste doel in je metrics is cruciaal.

Een andere les die ik heb toegepast bij Spiketrap is het opbouwen van AI-teams die gericht zijn op levering en geïntegreerd zijn met de productroadmap, in plaats van een geïsoleerd team dat alleen gefocust is op exploratie en onderzoek. Dit leidt tot een betere definitie van doelen, tijdslijnen en begrip van de ROI. Het geeft de voorkeur aan het team om zich te concentreren op de snelheid en praktische toepasbaarheid van een model, in plaats van puur te kijken naar nauwkeurigheid. Terugkijkend naar het voorbeeld van de Netflix-wedstrijd: de modellen van de winnende teams werden nooit geïntegreerd omdat ze niet praktisch genoeg waren, ondanks hun verbeterde nauwkeurigheid.

Je onderzoek is gepubliceerd in talloze tijdschriften, wat is volgens jou het belangrijkste artikel tot nu toe?

Tijdens mijn promotieonderzoek had ik het geluk om met verschillende onderzoekers uit verschillende gebieden te werken, waaronder machine learning, “big data”, sociale gegevensanalyse en speltheorie. Een artikel dat ik leuk vind vanwege zijn eenvoud en toepasbaarheid is “Scalable K-Means++”: K-means++ is een overal gebruikte ongesuperviseerde clusteringmethode om een dataset te splitsen in K coherente groepen. Het doet dit door één groep tegelijk toe te voegen, dus wanneer je veel data en groepen hebt, wordt het veel te langzaam. In dat artikel laten we zien hoe je dezelfde, zo niet betere, nauwkeurigheid kunt bereiken door de methode te paralleliseren. Onze methodologie is extreem eenvoudig en is geïmplementeerd in verschillende machine learning-bibliotheken.

Kun je het verhaal achter Spiketrap delen?

Na mijn tijd bij Goodreads, begrepen mijn mede-oprichters van Spiketrap, Kieran en Virgilio, en ik dat er een gat in de markt was voor het verkrijgen van geavanceerde merk-inzichten van niche sociale platforms. Door AI-technologieën toe te passen, konden we dit probleem op een efficiënte manier aanpakken.

In de huidige economie is het essentieel voor bedrijven om naar hun klanten en hun respectievelijke industrieën te luisteren. Echter, veel van wat klanten over merken zeggen, blijft ongehoord. Miljoenen mensen uiten elke dag openlijk hun mening over platforms als Twitter, Reddit, Twitch en meer. Het is een uiterst waardevolle bron voor elke marktonderzoeker, mits de inhoud op grote schaal kan worden gecontextualiseerd. Het probleem is dat de inzichtenindustrie niet heeft kunnen bijhouden met de evoluerende digitale gedragingen en taal.

Luisterhulpmiddelen zijn nog steeds afhankelijk van trefwoorden en booleaanse zoekopdrachten, waardoor veel van het gesprek dat aan een bepaald merk kan en zou moeten worden toegeschreven, wordt gemist. Ondertussen hebben marktonderzoeksbureaus het moeilijk om kwalitatieve inzichten te verkrijgen uit kwantitatieve en kostengebonden methodologieën.

Kortom, mensen hebben de tools nodig om hun publiek op grote schaal te begrijpen. Verkoopcijfers en kijkcijfers beantwoorden de “wat”-vraag van publieksgedrag, maar niet de “waarom”-vraag. Zonder context is het raden naar oorzaak en gevolg. Door deze leegte te erkennen, zijn we gaan kijken naar wat een oplossing voor contextuele begrip zou kunnen zijn, en zo is Spiketrap ontstaan.

Welke machine learning-technologieën worden bij Spiketrap gebruikt?

We gebruiken een veelvoud aan technologieën, van de gebruikelijke Scikit-learn tot deep learning-bibliotheken zoals Pytorch. Naast bibliotheken zijn de methodologieën, modellen en datasets die we gebruiken, voornamelijk eigendom van ons. We hebben geleerd dat standaardmethoden en -modellen je alleen zo ver brengen, maar om een probleem echt op te lossen, moet je je eigen werk doen, van doelen tot modelarchitectuur en datasets. Om een voorbeeld te geven: onderwerpsmodellering is de taak om thema’s te extraheren uit een verzameling van stukken tekst. Ons “Spiketrap Convos” biedt onze klanten cruciale inzichten over hun publiek en gebruikt onderwerpsmodellering als een van de signalen. De gebruikelijke methode voor onderwerpsmodellering is LDA (Latent Dirichlet Allocation), maar helaas is deze te inconsistent en onvoorspelbaar en niet krachtig genoeg. Aan de andere kant van het spectrum kun je een modern, vooraf getraind model zoals Bert-Topics proberen, dat, hoewel krachtig en omvattend, ook erg stijf en langzaam is. NLP en taal-AI hebben in het afgelopen decennium grote sprongen gemaakt, maar bestaande modellen omzetten in producten is nog verre van optimaal en een risicovolle gok.

Kun je uitleggen hoe Spiketrap instant publieksbegrip biedt voor creators, platforms en merken?

Adverteerders en agentschappen gebruiken onze influencer-leaderboards en merkaffiniteitsgereedschap om creators te identificeren wiens gemeenschappen merkveilig zijn in een aantal categorieën, waaronder cijfers voor giftig, vulgair en seksueel content, evenals de algehele gemeenschapsmerkveiligheid.

Creators kunnen het hulpmiddel gebruiken om dieper in te gaan op individuele streams en te zien welke gesprekken het meest of minst veilig waren, welke positieve betrokkenheid voor hun sponsors opleverden en waar ze hun moderatie-inspanningen zouden kunnen verbeteren.

Onlangs is een artikel getiteld ‘FeelsGoodMan: Inferring Semantics of Twitch Neologisms’ gepubliceerd door Spiketrap. Kun je dit artikel kort beschrijven?

De manier waarop mensen online communiceren en zich uitdrukken, is steeds complexer en moeilijker te ontcijferen geworden. Eerst kwamen emoticons :-). Toen kwamen emojis. Toen kwamen memes… en nu “emotes”, een nieuwe vorm van iconische communicatie die populair is geworden op het Twitch-streamingplatform. Enigszins herinnerend aan emojis vanwege hun gemengd gebruik met reguliere tekst, presenteren ze vergelijkbare uitdagingen als memes, omdat ze door gebruikers zijn gemaakt en hun cryptische betekenis geen duidelijke verbinding heeft met het daadwerkelijk afgebeelde beeld. Er zijn meer dan 8 miljoen verschillende emotes, met meer dan 400.000 die wekelijks worden gebruikt. Toch communiceren mensen effectief met behulp van emotes om elke soort gevoel uit te drukken, zoals vreugde, verveling, opwinding of sarcasme. Ons recente artikel is een AI-kookboek om de semantische betekenis van emotes af te leiden. Onze aanpak vereist geen handmatig onderhouden dataset en kan zichzelf aanpassen aan de voortdurende introductie van nieuwe emotes, evenals aan de evolutie van de betekenis van populaire emotes. Dit is vooral belangrijk wanneer een emote politiek of raciaal geladen wordt, wat we hebben gezien gebeuren met extreem populaire emotes, zoals “TriHard”, “PogChamp” en “FeelsGoodMan”. De dynamische gebruik van taal en verschuivingen in betekenis vormen enorme problemen voor moderatiesystemen of sentimentanalyse-kaders, dus we zijn trots om dit probleem op de juiste manier aan te pakken bij Spiketrap.

Is er nog iets anders dat je over Spiketrap wilt delen?

Terwijl we vooruitkijken naar het nieuwe jaar, werkt Spiketrap aan het ontwikkelen en perfectioneren van een nieuw hulpmiddel dat een dieper inzicht zal bieden in de merkbeoordeling van onze klanten. Het nieuwe Affinity Tool van Spiketrap biedt een interactieve en intuïtieve manier om publieksaffiniteiten te identificeren en te kwantificeren over creators, merken, games en meer. Voor elke gegeven query genereert het hulpmiddel affiniteitsindexscores die aangeven hoe goed een bepaalde entiteit positief correleert met een andere. Verschillende contextuele signalen maken deel uit van de score, waaronder de frequentie en sentiment van gerelateerde vermeldingen. De technische stack van Spiketrap is uniek gepositioneerd om affiniteiten tussen games, merken en creators te indexeren. Clair, hun eigen NLP-AI, verwerkt miljoenen openbaar geposte gebruikers gegenereerde berichten elke dag, waarbij anderszins dubbelzinnige inhoud wordt toegeschreven aan entiteiten in de uitgebreide kennisgrafiek van Spiketrap, onderwerpen van conversatie identificeren, sentiment bepalen en veiligheid bewaken. De toevoeging van het nieuwe Affinity Tool stelt ontwikkelaars, creators, merken en meer in staat om hun publiek en merkimpact beter te begrijpen.

Bedankt voor het geweldige interview, lezers die meer willen leren, kunnen Spiketrap bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.