Entretiens
Andrea Vattani, Co-Fondateur & Chef Scientifique chez Spiketrap – Série d’entretiens

Andrea Vattani est le Co-Fondateur & Chef Scientifique de Spiketrap, une entreprise de contextualisation qui alimente l’intelligence d’audience et la performance médiatique pour les créateurs, les plateformes et les marques. Le système de traitement de l’information Clair AI propriétaire extrait le signal du bruit des jeux de données non structurés, offrant une clarté et un contexte sans précédent, en particulier dans les environnements en ligne à haute vitesse.
Qu’est-ce qui vous a initialement attiré vers l’informatique et l’IA ?
C’était une combinaison de circonstances fortuites, je me suis présenté à l’Université de Rome pour passer le test d’admission en statistiques, et il s’est avéré que j’étais en retard d’un jour ! On m’a conseillé de postuler pour l’informatique à la place et de revenir au département de statistiques un an plus tard. Je suis allé passer le test d’admission en informatique (qui avait lieu ce jour-là !) et je l’ai réussi… je n’ai jamais repris mes études en statistiques ! Mon intérêt pour l’IA a vraiment commencé lorsque j’ai réalisé à quel point les ordinateurs pouvaient vous aider à automatiser les choses, et l’IA est la machine d’automatisation ultime. De plus, le langage naturel et la façon dont les gens l’utilisent m’ont toujours intéressé : j’ai étudié les études classiques au lycée, en étudiant le grec ancien et le latin, ce qui est probablement similaire à la façon dont une machine se sent lorsqu’elle est alimentée par un flux de mots.
Avez-vous précédemment travaillé en tant que Lead Software Engineer chez Amazon (AMZN ) Goodreads, quels étaient certains des projets sur lesquels vous avez travaillé et quels étaient certains des enseignements clés de cette expérience ?
Pendant mon séjour chez Goodreads, j’ai travaillé sur plusieurs projets d’apprentissage automatique, notamment la détection de spam et la mise à l’échelle du moteur de recommandation de livres. Mes enseignements clés de mon expérience là-bas étaient d’apprendre l’importance de définir des métriques d’apprentissage automatique qui correspondent aux objectifs commerciaux et aux objectifs des clients. Pour donner un exemple, les moteurs de recommandation existent depuis longtemps. Rappelez-vous le concours « Netflix (NFLX ) Prize » en 2009 pour trouver de meilleures recommandations de films ? Certaines idées des meilleures solutions suggéraient que la probabilité que vous regardiez un film n’est pas très liée au fait que vous allez l’aimer ou non, mais plutôt si cela correspond à vos intérêts. Cela peut fonctionner pour les films, car c’est un engagement court de 90 minutes, mais pour les livres, ce n’est pas le cas. Intégrer l’objectif approprié dans vos métriques est clé.
Un autre enseignement que j’ai appliqué chez Spiketrap est de construire des équipes d’IA axées sur la livraison et intégrées à la feuille de route produit plutôt que d’une équipe isolée axée uniquement sur les explorations et la recherche. Cela conduit à une meilleure définition des objectifs, des délais et de la compréhension du ROI. Cela favorise également naturellement l’équipe à se concentrer sur la vitesse et la praticité d’un modèle plutôt que uniquement sur sa précision. Pour revenir à l’exemple du concours Netflix, les modèles des équipes gagnantes n’ont jamais été intégrés en raison de leur manque de praticité, malgré leur précision améliorée.
Votre recherche a été publiée dans de nombreuses revues, qu’est-ce que vous considérez comme l’article le plus important jusqu’à présent ?
Pendant mon doctorat, j’ai eu la chance de collaborer avec plusieurs chercheurs de différents domaines, notamment l’apprentissage automatique, les « grandes données », l’analyse des données sociales et la théorie des jeux. Un article que j’aime pour sa simplicité et son applicabilité est « Scalable K-Means++ » : K-means++ est une méthode de regroupement non supervisée ubiquitaire pour diviser un jeu de données en K groupes cohérents. Il le fait en ajoutant un groupe à la fois, donc lorsque vous avez des tonnes de données et de groupes, cela devient beaucoup trop lent. Dans cet article, nous montrons comment vous pouvez obtenir la même précision, voire meilleure, en parallélisant la méthode. Notre méthodologie est extrêmement simple et a été mise en œuvre dans plusieurs bibliothèques d’apprentissage automatique.
Pouvez-vous partager l’histoire de la création de Spiketrap ?
Après avoir travaillé chez Goodreads, moi-même et les co-fondateurs de Spiketrap, Kieran et Virgilio, avons compris qu’il y avait un vide dans l’industrie pour accéder à des informations avancées sur les marques à partir de plates-formes sociales de niche. En appliquant les technologies d’IA, nous pouvions résoudre le problème de manière efficace.
Dans l’économie d’aujourd’hui, il est essentiel pour les entreprises d’écouter leurs clients et leurs industries respectives dans leur ensemble. Cependant, beaucoup de ce que les clients ont à dire sur les marques passe inaperçu. Des millions de personnes expriment leurs opinions ouvertement chaque jour, sur des plateformes comme Twitter, Reddit, Twitch, etc. Il s’agit d’une ressource extrêmement précieuse pour tout chercheur de marché, à condition que le contenu puisse être contextualisé à grande échelle. Le problème est que l’industrie des études de marché n’a pas suivi l’évolution des comportements numériques et du langage.
Les outils d’écoute restent dépendants des mots clés et des recherches booléennes, manquant une grande partie de la conversation qui pourrait et devrait être attribuée à une marque particulière. Pendant ce temps, les sociétés de recherche de marché sont prises dans un exercice de funambulisme de plus en plus difficile, essayant de déterminer des informations qualitatives à partir de méthodes quantitatives et de contraintes de coût.
En résumé, les gens ont manqué d’outils pour comprendre leur public à grande échelle. Les chiffres de vente et les nombres de téléspectateurs répondent au « quoi » du comportement du public, mais pas au « pourquoi ». Sans contexte, déterminer ce qui est corrélation ou causalité est un jeu de devinette. En reconnaissant ce vide, nous nous sommes plongés dans ce que pourrait ressembler une solution pour la compréhension contextuelle, et Spiketrap est né.
Quelles sont certaines des technologies d’apprentissage automatique utilisées chez Spiketrap ?
Nous utilisons une multitude de technologies, allant de Scikit-learn à des bibliothèques d’apprentissage profond telles que Pytorch. Outre les bibliothèques, les méthodologies, les modèles et les jeux de données que nous utilisons sont principalement propriétaires. Nous avons appris que les méthodes et les modèles standard ne vous mènent qu’à un certain point, mais pour vraiment résoudre un problème, vous devez vraiment mettre votre propre travail en commençant par les objectifs et en allant jusqu’à l’architecture du modèle et aux jeux de données. Pour vous donner un exemple, la modélisation de sujet est la tâche d’extraire des thèmes d’une collection de pièces de texte. Notre « Spiketrap Convos » fournit à nos clients des informations cruciales sur leur public, et utilise la modélisation de sujet comme l’un des signaux. Votre méthode habituelle pour la modélisation de sujet est LDA (Latent Dirichlet Allocation), mais malheureusement, elle est trop inconsistante et imprévisible et simplement pas assez puissante. De l’autre côté du spectre, vous pouvez essayer un modèle pré-entraîné moderne comme Bert-Topics, qui, bien qu’il soit puissant et englobant, est également très rigide et lent. L’IA et le traitement du langage naturel ont fait des progrès énormes au cours de la dernière décennie, mais prendre des modèles existants pour les transformer en produits est toujours loin d’être optimal et un pari risqué.
Pouvez-vous élaborer sur la façon dont Spiketrap permet une compréhension instantanée du public pour les créateurs, les plateformes et les marques ?
Les annonceurs et les agences utilisent nos classements d’influenceurs et nos outils d’affinité de marque pour identifier les créateurs dont les communautés sont sûres pour la marque dans de nombreuses catégories, y compris les notes pour le contenu toxique, profane et sexuel — ainsi que la sécurité globale de la communauté. Les créateurs peuvent utiliser l’outil pour plonger dans les flux individuels et voir quels étaient les conversations les plus ou les moins sûres, qui ont conduit à un engagement positif pour leurs sponsors, et où ils pourraient améliorer leurs efforts de modération.
Un article récent intitulé ‘FeelsGoodMan: Inferring Semantics of Twitch Neologisms‘ a été publié par Spiketrap. Pouvez-vous décrire brièvement ce que cet article est ?
La façon dont les gens communiquent et s’expriment en ligne est devenue de plus en plus complexe et difficile à déchiffrer. Tout d’abord, il y a eu les émoticônes :-). Ensuite, il y a eu les émojis. Ensuite, les mèmes… et maintenant les « émotes », une nouvelle forme de communication basée sur les icônes qui est devenue très populaire sur la plateforme de streaming Twitch. Un peu semblable aux émojis pour leur utilisation mélangée avec du texte régulier, ils présentent des défis similaires à ceux des mèmes, car ils sont générés par les utilisateurs et leur signification cryptique n’a pas de lien évident avec l’image réelle représentée. Il y a plus de 8 millions d’émotes distincts à ce jour, avec plus de 400 000 utilisés chaque semaine. Les gens communiquent efficacement en utilisant ces émotes pour exprimer tout type de sentiment, tel que la joie, l’ennui, l’excitation ou le sarcasme. Notre article récent est un livre de cuisine d’IA pour inférer la signification sémantique des émotes. Notre approche ne nécessite pas de maintenir et de mettre à jour un jeu de données manuellement curé, et elle est capable de s’adapter en continu à l’introduction de nouveaux émotes, ainsi qu’à l’évolution de la signification des émotes populaires. C’est particulièrement important lorsque un émote devient politiquement ou racialement chargé, ce que nous avons vu se produire avec des émotes extrêmement populaires, tels que « TriHard », « PogChamp » et « FeelsGoodMan ». L’utilisation dynamique du langage et les changements de signification posent des problèmes énormes aux systèmes de modération ou aux cadres d’analyse de sentiment, nous sommes donc fiers de résoudre ce problème de la bonne manière chez Spiketrap.
Y a-t-il autre chose que vous aimeriez partager à propos de Spiketrap ?
Alors que nous regardons vers l’année à venir, Spiketrap travaille sur le développement et la perfection d’un nouvel outil qui fournira une compréhension plus approfondie du sentiment de la marque pour nos clients. L’outil d’affinité de Spiketrap fournit une façon interactive et intuitive d’identifier et de quantifier les affinités du public à travers les créateurs, les marques, les jeux et plus encore. Pour toute requête donnée, l’outil génère des scores d’indice d’affinité qui indiquent à quel point une entité donnée est positivement corrélée à une autre. De nombreux signaux contextuels composent le score, y compris la fréquence et le sentiment des mentions liées. La pile technologique de Spiketrap est unique pour indexer les affinités entre les jeux, les marques et les créateurs. Le système de traitement de l’information Clair, leur IA de traitement du langage naturel propriétaire, traite des millions de messages générés par les utilisateurs publiés chaque jour, attribuant un contenu autrement ambigu à des entités dans l’extensive connaissance graphique de Spiketrap, en identifiant les sujets de conversation, en déterminant le sentiment, et en surveillant la sécurité. L’ajout de l’outil d’affinité permet aux développeurs, créateurs, marques et plus encore de mieux comprendre leur public et leur impact sur la marque.
Je vous remercie pour cette grande interview, les lecteurs qui souhaitent en savoir plus peuvent visiter Spiketrap.












