Rozhovory
Andrea Vattani, spoluzakladatel a hlavní vědec ve společnosti Spiketrap – rozhovor

Andrea Vattani je spoluzakladatel a hlavní vědec ve společnosti Spiketrap, která se specializuje na kontextualizaci a poskytuje inteligenci o publikačních a mediálních výkonech pro tvůrce, platformy a značky. Proprietární technologie Clair AI extrahuje signál z hluku nestrukturovaných dat, poskytující bezprecedentní jasnost a kontext, zejména v prostředí s vysokou rychlostí online.
Co vás původně přitáhlo k informatice a umělé inteligenci?
Byla to kombinace šťastných okolností. Přišel jsem na Univerzitu v Římě, aby jsem se zapsal do statistického oboru, a ukázalo se, že jsem o den pozdě! Byl jsem poraděn, abych se вместo toho zapsal do oboru informatika a poté se mohl vrátit do statistického oboru o rok později. Šel jsem na přijímací zkoušku z informatiky (která byla ten den!) a prošel jsem ji… a nikdy se nevrátil zpět do statistiky! Můj zájem o umělou inteligenci začal, když jsem si uvědomil, jak počítače mohou pomoci automatizovat věci, a umělá inteligence je konečná automatizační mašinérie. Kromě toho mě vždy zajímala přirozená řeč a jak lidé ji používají: ve střední škole jsem studoval klasické studie, ancient Greek a Latin, což je podobné tomu, jak se stroj cítí, když je krmen proudem slov.
Předtím jste pracoval jako Senior Lead Software Engineer ve společnosti Amazon (AMZN ) Goodreads, na jakých projektech jste pracoval a jaké byly některé z vašich poznatků z této zkušenosti?
Při Goodreads jsem pracoval na několika projektech s využitím strojového učení, včetně detekce spamu a škálování doporučení knih. Mými poznatky z mého působení tam bylo, že je důležité definovat metriky strojového učení, které odpovídají obchodním a zákaznickým cílům. Například doporučení motorů existují již dlouho. Připomeňte si soutěž “Netflix (NFLX ) Prize” v roce 2009, aby se zjistilo, jak lépe doporučit filmy? Některé poznatky z nejlepších řešení naznačily, že šance, že budete sledovat film, není příliš ovlivněna tím, zda se vám bude líbit, ale spíše zda je podobný vašim zájmům. To může fungovat pro filmy, protože je to krátká 90minutová závazek, ale pro knihy to není případ. Integrace správného cíle do vašich metrik je klíčová.
Važí se vaše výzkumu publikovaly v mnoha časopisech, co je podle vás nejvýznamnější článek?
Během mého doktorského studia jsem měl možnost spolupracovat s několika výzkumníky z různých oblastí, včetně strojového učení, “big data”, sociálních dat a teorie her. Článek, který mi přijde na mysl pro jeho jednoduchost a aplikovatelnost, je “Scalable K-Means++“: K-means++ je všudypřítomně používaná metoda nesupervizovaného shlukování, která rozděluje dataset na K koherentních skupin. To dělá přidáním jedné skupiny najednou, takže když máte obrovské množství dat a skupin, stává se to příliš pomalé. V tomto článku ukazujeme, jak můžete dosáhnout stejné, ne-li lepší, přesnosti paralelizací metody. Naše metodologie je extrémně jednoduchá a byla implementována v několika knihovnách strojového učení.
Můžete sdílet příběh o vzniku Spiketrapu?
Po práci u Goodreads jsme s mými spoluzakladateli Spiketrapu, Kieranem a Virgiliem, pochopili, že v průmyslu chybí přístup k pokročilým informacím o značkách z niklových sociálních platforem. Pomocí technologií umělé inteligence jsme mohli tento problém řešit efektivním způsobem.
V dnešní ekonomice je pro společnosti nezbytné naslouchat svým zákazníkům a svým odvětvím jako celku. Avšak většina toho, co zákazníci říkají o značkách, zůstává neslyšena. Milióny lidí vyjadřují své názory otevřeně každý den, napříč platformami jako Twitter, Reddit, Twitch a podobně. To je protrženě cenný zdroj pro jakýkoli trhový výzkumník, pokud lze obsah kontextualizovat ve velkém měřítku. Problém spočívá v tom, že průmysl inteligence nezachoval krok s vývojem digitálních chování a jazyka.
Jaké jsou některé z technologií strojového učení, které se používají ve Spiketrapu?
Používáme řadu technologií, od běžného Scikit-learn až po hluboké učení knihovny jako Pytorch. Kromě knihoven jsou metodologie, modely a datové sady, které používáme, většinou proprietární. Naučili jsme se, že metody a modely “off-the-shelf” vás dostanou pouze tak daleko, ale aby jste skutečně vyřešili problém, musíte investovat do své vlastní práce, počínaje cíli a konče architekturou modelu a datovými sadami. Například téma modelování je úkolem extrahovat témata z kolekce textů. Naše “Spiketrap Convos” poskytuje našim zákazníkům kritické informace o jejich publikační základně a používá téma modelování jako jeden ze signálů. Vaše typická metoda pro téma modelování je LDA (Latent Dirichlet Allocation), ale bohužel je to příliš nekonzistentní a nepředvídatelné a jednoduše недостатčně silné. Na druhé straně spektra můžete zkusit moderní předtrénovaný model, jako je Bert-Topics, který – přestože je silný a komplexní – je také příliš rigidní a pomalý. NLP a jazyková umělá inteligence udělaly obrovské pokroky v posledních deseti letech, ale převést existující modely na produkty je stále daleko od optimálního a riskantního.
Můžete vysvětlit, jak Spiketrap poskytuje okamžité pochopení publikační základny pro tvůrce, platformy a značky?
Inzerenti a agentury používají naše žebříčky influencerů a nástroje pro brand affinity, aby identifikovali tvůrce, jejichž komunity jsou bezpečné pro značky napříč několika kategoriemi, včetně hodnocení pro toxický, profánní a sexuální obsah — stejně jako celkovou bezpečnost komunity. Tvůrci mohou použít nástroj, aby se ponořili do jednotlivých streamů a viděli, které konverzace byly nejbezpečnější nebo nejméně bezpečné, které povedly k pozitivnímu zapojení pro jejich sponzory a kde by mohli lépe zlepšit své úsilí o moderaci.
Byl nedávno publikován článek s názvem ‘FeelsGoodMan: Odhadování sémantiky Twitch neologismů‘. Můžete stručně popsat, o čem je tento článek?
Způsob, jakým lidé komunikují a vyjadřují se online, se stal stále složitějším a výzvou pro dešifrování. Nejprve přišly emodži :-). Pak přišly emodži. Pak přišly memy… a teď “emotes”, nový formát ikonové komunikace, který se stal velmi populární na platformě Twitch. Téměř podobně jako emodži pro jejich promíchané použití s běžným textem, představují podobné výzvy jako memy, protože jsou generovány uživateli a jejich kryptický význam nemá žádný zjevný vztah k obrázku. Existuje více než 8 milionů různých emotes, z nichž více než 400 tisíc se používá týdně. Přesto lidé komunikují účinně pomocí nich, aby vyjádřili jakékoli pocity, jako je radost, nudu, vzrušení nebo sarkasmus. Naše nedávná práce je kuchařka AI pro odhadnutí sémantického významu emotes. Naše přístup nepotřebuje udržovat a aktualizovat ručně kurátorovanou datovou sadu a je schopná se samo-adaptovat na neustálé zavádění nových emotes a také na vývoj významu populárních emotes. To je zvláště důležité, když emote získá politickou nebo rasovou náladu, což jsme viděli u extrémně populárních emotes, jako je “TriHard”, “PogChamp” a “FeelsGoodMan”. Dynamické použití jazyka a posuny významu představují enormní problémy pro systémy moderace nebo rámce sentimentální analýzy, takže jsme hrdí, že řešíme tento problém správným způsobem ve Spiketrapu.
Je něco jiného, co byste rádi sdíleli o Spiketrapu?
Podívejte se na nás v novém roce, Spiketrap pracuje na vývoji a zdokonalování nového nástroje, který poskytne hlubší pochopení sentimentu značky pro naše klienty. Nový nástroj Spiketrap Affinity Tool poskytuje interaktivní a intuitivní způsob, jak identifikovat a kvantifikovat publikační afinitu napříč tvůrci, značkami, hrami a více. Pro jakýkoli dotaz generuje nástroj index skóre afinit, který ukazuje, jak dobře je daná entita pozitivně korelována s jinou. Četné kontextové signály tvoří skóre, včetně frekvence a sentimentu souvisejících zmínek. Technologický stack Spiketrapu je unikátně positionován pro indexování afinit mezi hrami, značkami a tvůrci. Proprietární NLP AI Clair zpracovává miliony veřejně zveřejněných uživatelsky generovaných zpráv každý den, atribuuje jinak nejasný obsah entitám v rozsáhlém znalostním grafu, identifikuje témata konverzace, determinuje sentiment, a monitoruje bezpečnost. Přidání nového nástroje Affinity Tool umožňuje vývojářům, tvůrcům, značkám a více, aby lépe pochopili svou publikační základnu a dopad značky.
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Spiketrap.












