Intervjuer

Andrea Vattani, medgrundare och chefsforskare på Spiketrap – Intervjuserie

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Andrea Vattani är medgrundare och chefsforskare på Spiketrap, ett företag som specialiserar sig på kontextualisering och som tillhandahåller lösningar för publikanalys och medieprestanda för skapare, plattformar och varumärken. Det egna AI-systemet Clair extraherar signalen från bruset i ostrukturerade datamängder och tillhandahåller en oöverträffad tydlighet och kontext, särskilt i höghastighetsmiljöer online.

Vad var det som initialt drog dig till datavetenskap och AI?

Det var en kombination av lyckliga omständigheter. Jag kom till Rom universitet för att skriva statistikprovet, men det visade sig att jag var en dag för sent! Jag fick rådet att istället söka till datavetenskap och gå tillbaka till statistikavdelningen ett år senare. Jag gick till datavetenskapsprovet (som var samma dag!) och klarade det… och gick aldrig tillbaka till statistik! Min intresse för AI började när jag insåg hur datorer kan hjälpa till att automatisera saker, och AI är den ultimata automatiseringsmaskinen. Dessutom har jag alltid varit intresserad av naturligt språk och hur människor använder det: jag studerade klassiska studier i gymnasiet, med fokus på antik grekiska och latin, vilket är liknande med hur en maskin känner när den matas med en ström av ord.

Tidigare arbetade du som senior lead software engineer på Amazon (AMZN ) Goodreads. Vilka var några av de projekt du arbetade med och vad var några av de viktigaste lärdomarna från den erfarenheten?

Under min tid på Goodreads arbetade jag med flera maskinlärningsprojekt, inklusive spåmdetektering och skalning av bokrekommendationssystemet. Min viktigaste lärdom från den tiden var att lära mig att definiera maskinlärningsmått som matchar affärsmål och kundmål. Till exempel har rekommendationssystem funnits i många år. Kom ihåg “Netflix (NFLX ) Prize”-tävlingen 2009 för att hitta bättre filmrekommendationer? Några insikter från de vinnande lösningarna visade att chansen att du tittar på en film inte beror så mycket på om du kommer att gilla den eller inte, utan snarare om den liknar dina intressen. Det kan fungera för filmer, eftersom det är en kort 90-minutersåtag, men för böcker är det inte fallet. Att integrera rätt mål i dina mått är nyckeln.

En annan lärdom som jag har tillämpat på Spiketrap är att bygga AI-lag som är inriktade på leverans och integrerade med produktvägen, snarare än ett isolerat lag som bara fokuserar på utforskning och forskning. Det leder till en bättre definition av mål, tidsramar och förståelse för avkastningen på investeringen. Det favoriserar också laget att fokusera på hastighet och praktiskhet i en modell, snarare än att bara titta på precision. Återigen, om man tittar på Netflix-tävlingen, var vinnarlagnas modeller aldrig integrerade på grund av att de inte var praktiskt tillräckliga, trots deras förbättrade precision.

Vilken av dina forskningsartiklar tycker du är den viktigaste hittills?

Under min doktortid hade jag turen att samarbeta med flera forskare från olika områden, inklusive maskinlärning, “big data”, social dataanalys och spelteori. En artikel som jag gillar för sin enkelhet och tillämpbarhet är “Scalable K-Means++”: K-means++ är en allmänt använd metod för ostrukturerad klusteranalys för att dela upp en datamängd i K sammanhängande grupper. Det gör det genom att lägga till en grupp i taget, så när du har massor av data och grupper, blir det alldeles för långsamt. I den artikeln visar vi hur du kan uppnå samma, om inte bättre, precision genom att parallellisera metoden. Vår metodik är extremt enkel och har implementerats i flera maskinlärningsbibliotek.

Kan du berätta om hur Spiketrap kom till?

Efter att ha arbetat på Goodreads insåg mina medgrundare av Spiketrap, Kieran och Virgilio, och jag att det fanns ett gap i branschen när det gäller att få avancerad varumärkesinsikt från nischade sociala plattformar. Genom att tillämpa AI-teknologier kunde vi hantera problemet på ett effektivt sätt.

I dagens ekonomi är det avgörande för företag att lyssna på sina kunder och branschen som helhet. Men mycket av vad kunderna har att säga om varumärken hörs inte. Miljontals människor uttrycker sina åsikter öppet varje dag, över plattformar som Twitter, Reddit, Twitch och liknande. Det är en extremt värdefull resurs för marknadsforskare, förutsatt att innehållet kan kontextualiseras i stor skala. Problemet är att insiktindustrin inte har hållit jämna steg med den digitala beteendeförändringen och språket.

Lyssningsverktyg är fortfarande beroende av nyckelord och booleska sökningar, och missar mycket av samtalet som kunde och borde tillskrivas ett visst varumärke. Samtidigt har marknadsundersökningsföretag hamnat i en allt svårare balansgång, där de försöker fastställa kvalitativa insikter från kvantitativa och kostnadsbegränsade metoder.

För att sammanfatta har människor saknat de verktyg de behöver för att förstå sin publik i stor skala. Försäljningssiffror och vyantal svarar på “vad”-frågan om publikbeteende, men inte “varför”-frågan. Utan kontext är det en gissningsspel att avgöra vad som är korrelation och vad som är orsak. När vi insåg detta tomrum, grävde vi djupare i vad en lösning för kontextuell förståelse skulle kunna se ut, och Spiketrap föddes.

Vilka maskinlärningsteknologier används på Spiketrap?

Vi använder en mängd olika teknologier, från vanliga Scikit-learn till djupinlärningsbibliotek som Pytorch. Utöver bibliotek är metoderna, modellerna och datamängderna vi använder mestadels egna. Vi har lärt oss att färdiga metoder och modeller bara tar dig så långt, men för att verkligen knäcka ett problem måste du lägga ner eget arbete, från mål till modellarkitektur och datamängd. Till exempel är ämnesmodellering uppgiften att extrahera teman från en samling texter. Vår “Spiketrap Convos” ger våra kunder viktiga insikter om sin publik, och använder ämnesmodellering som en av signalerna. Den vanliga metoden för ämnesmodellering är LDA (Latent Dirichlet Allocation), men tyvärr är den alltför inkonsekvent och oförutsägbar och inte tillräckligt kraftfull. Å andra sidan kan du försöka med en modern förtränad modell som Bert-Topics, som är kraftfull och omfattande, men också riktigt stel och långsam. NLP och språk-AI har gjort stora framsteg under det senaste decenniet, men att ta befintliga modeller och omvandla dem till produkter är fortfarande långt ifrån optimalt och en riskabel insats.

Kan du förklara hur Spiketrap möjliggör omedelbar publikförståelse för skapare, plattformar och varumärken?

Annonsörer och byråer använder våra influencer-topplistor och varumärkesaffinitetsverktyg för att identifiera skapare vars samhällen är varumärkesäkra inom en mängd olika kategorier, inklusive betyg för giftigt, stötande och sexuellt innehåll, samt allmän samhällssäkerhet.

Skapare kan använda verktyget för att dyka ner i enskilda strömmar och se vilka samtal som var de mest eller minst säkra, vilka drev positiv engagemang för deras sponsorer och var de kan förbättra sina moderatorinsatser.

En nyligen publicerad artikel med titeln “FeelsGoodMan: Inferring Semantics of Twitch Neologisms” publicerades av Spiketrap. Kan du kort beskriva vad den artikeln handlar om?

Sättet människor kommunicerar och uttrycker sig online har blivit alltmer komplext och utmanande att tolka. Först kom emotikonerna :-). Sedan kom emojierna 🤔. Sedan kom memerna… och nu “emotes”, en ny form av ikonbaserad kommunikation som har blivit mycket populär på Twitch-streamingsplattformen. Det är påminnande om emojierna i deras blandade användning med vanlig text, men de presenterar liknande utmaningar som memer, eftersom de är användargenererade och deras kryptiska betydelse har ingen uppenbar koppling till den faktiska bilden. Det finns över 8 miljoner olika emotes hittills, med över 400 000 används varje vecka. Trots det kommunicerar människor effektivt med hjälp av dem för att uttrycka alla slags känslor, som glädje, tristess, upphetsning eller sarkasm. Vår nyligen publicerade artikel är en AI-kokbok för att härleda den semantiska betydelsen av emotes. Vår metod kräver inte att man underhåller och uppdaterar en manuellt kuraterad datamängd, och den kan själv anpassa sig till den kontinuerliga introduktionen av nya emotes, samt till utvecklingen av betydelsen av populära emotes. Detta är särskilt viktigt när en emote får politisk eller rasistisk laddning, vilket vi har sett hända med extremt populära emotes, som “TriHard”, “PogChamp” och “FeelsGoodMan”. Den dynamiska användningen av språk och skiftningarna i betydelse utgör enorma problem för modereringssystem eller sentimentanalysramverk, så vi är stolta över att tackla det här problemet på rätt sätt på Spiketrap.

Finns det något annat du vill dela om Spiketrap?

När vi ser framåt mot det nya året arbetar Spiketrap med att utveckla och förbättra ett nytt verktyg som kommer att ge en djupare förståelse av varumärkeskänslor för våra kunder. Spiketraps nya Affinity Tool erbjuder ett interaktivt och intuitivt sätt att identifiera och kvantifiera publikaffiniteter över skapare, varumärken, spel och mer. För varje given fråga genererar verktyget affinitetsindexpoäng som indikerar hur väl en given enhet är positivt korrelerad till en annan. Många kontextuella signaler utgör poängen, inklusive frekvensen och sentimentet av relaterade omnämnanden. Spiketraps tekniska stack är unikt positionerad för att indexera affiniteter mellan spel, varumärken och skapare. Clair, deras egna NLP-AI, bearbetar miljontals offentligt publicerade användargenererade meddelanden varje dag, attribuerar annars tvetydigt innehåll till enheter inom Spiketraps omfattande kunskapsgraf, identifierar ämnen för samtal, bestämmer sentiment och övervakar säkerhet. Tillägget av det nya Affinity Tool-verktyget ger utvecklare, skapare, varumärken och fler möjlighet att ytterligare förstå sin publik och varumärkespåverkan.

Tack för den underbara intervjun. Läsare som vill lära sig mer kan besöka Spiketrap.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.