Интервью

Андреа Ваттани, сооснователь и главный ученый в Spiketrap – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Андреа Ваттани – сооснователь и главный ученый в Spiketrap, компании, занимающейся контекстуализацией и предоставлением информации о аудитории и медиа-производительности для создателей, платформ и брендов. Собственный алгоритм Clair AI извлекает сигнал из шума неструктурированных данных, обеспечивая беспрецедентную ясность и контекст, особенно в высокоскоростных онлайн-средах.

Что изначально привлекло вас к информатике и ИИ?

Это было сочетание счастливых обстоятельств. Я пришел в Римский университет, чтобы сдать вступительный экзамен на факультет статистики, и оказалось, что я опоздал на один день! Мне посоветовали подать заявление на факультет информатики и перейти на факультет статистики через год. Я пошел на вступительный экзамен по информатике (который был в тот же день!) и сдал его… и никогда не перешел на факультет статистики! Мой интерес к ИИ начался с понимания того, как компьютеры могут помочь автоматизировать задачи, и ИИ – это в конечном итоге машина для автоматизации. Кроме того, естественный язык и то, как люди его используют, всегда меня интересовали: в школе я изучал классические дисциплины, такие как древнегреческий и латынь, что, вероятно, похоже на то, как машина чувствует себя, когда ей подают поток слов.

Ранее вы работали в качестве ведущего инженера-программиста в Amazon (AMZN ) Goodreads. Расскажите о некоторых проектах, над которыми вы работали, и о том, что вы узнали из этого опыта.

В Goodreads я работал над несколькими проектами по машинному обучению, включая обнаружение спама и масштабирование системы рекомендаций книг. Мои выводы из этого опыта были связаны с пониманием важности определения метрик ИИ, соответствующих бизнес- и клиентским целям. Например, системы рекомендаций существуют уже очень давно. Помните конкурс “Netflix (NFLX ) Prize” в 2009 году, целью которого было разработать лучшие рекомендации фильмов? Некоторые идеи из лучших решений предполагали, что вероятность просмотра фильма не зависит от того, понравится он вам или нет, а скорее от того, насколько он соответствует вашим интересам. Это может работать для фильмов, поскольку это короткая 90-минутная привязанность, но для книг это не так. Включение правильных целей в метрики имеет ключевое значение.

Другим выводом, который я применил в Spiketrap, было построение команд ИИ, ориентированных на поставку и интегрированных с дорожной картой продукта, а не изолированных команд, сосредоточенных только на исследованиях и разработке. Это приводит к лучшему определению целей, сроков и пониманию ROI. Это также естественным образом способствует тому, чтобы команда фокусировалась на скорости и практичности модели, а не только на точности. Вернувшись к примеру с конкурсом Netflix, модели победивших команд никогда не интегрировались, поскольку они были недостаточно практичными, несмотря на их повышенную точность.

Ваше исследование было опубликовано в многочисленных журналах. Какой, по вашему мнению, был наиболее важным документом на данный момент?

Во время моего докторантуры мне посчастливилось сотрудничать с несколькими исследователями из различных областей, включая машинное обучение, “большие данные”, анализ социальных данных и теорию игр. Документ, который мне нравится за свою простоту и применимость, – это “Масштабируемый K-Means++“. K-Means++ – это широко используемый метод несупervised кластеризации для разделения набора данных на K связных групп. Он делает это, добавляя одну группу за раз, поэтому, когда у вас есть много данных и групп, это становится слишком медленным. В этом документе мы показываем, как можно добиться той же, если не лучшей, точности, параллелизуя метод. Наша методология чрезвычайно проста и была реализована в нескольких библиотеках машинного обучения.

Расскажите историю создания Spiketrap.

После работы в Goodreads я и сооснователи Spiketrap, Кирен и Вирджилио, поняли, что в отрасли существует пробел в доступе к передовым бренд-инсайтам из нишевых социальных платформ. Применяя технологии ИИ, мы могли решить эту проблему эффективно.

В сегодняшней экономике для компаний важно слушать своих клиентов и отрасли в целом. Однако большая часть того, что клиенты говорят о брендах, остается незамеченной. Миллионы людей выражают свои мнения открыто каждый день на платформах seperti Twitter, Reddit, Twitch и других. Это очень ценный ресурс для любого маркетингового исследователя, если только контент не может быть контекстуализирован в масштабе. Проблема заключается в том, что отрасль инсайтов не поспевает за эволюцией цифрового поведения и языка.

Инструменты прослушивания все еще полагаются на ключевые слова и булевы поиски, пропуская большую часть разговора, который мог бы и должен быть отнесен к определенному бренду. Тем временем маркетинговые исследовательские фирмы оказались в все более трудном положении, пытаясь определить качественные инсайты из количественных и ограниченных методологий.

Вкратце, людям не хватает инструментов, чтобы понять свою аудиторию в масштабе. Продажи и просмотры отвечают на вопрос “что” поведения аудитории, но не на вопрос “почему”. Без контекста определение корреляции и причинности – это игра в угадайку. Признавая этот пробел, мы погрузились в то, каким может быть решение для контекстного понимания, и Spiketrap родился.

Какие из технологий машинного обучения используются в Spiketrap?

Мы используем множество технологий, от обычных Scikit-learn до библиотек глубокого обучения, таких как Pytorch. Помимо библиотек, методологии, модели и наборы данных, которые мы используем, в основном являются проприетарными. Мы узнали, что готовые методы и модели могут привести вас только так далеко, но чтобы действительно решить проблему, вам нужно вложить свою работу, начиная с целей и переходя к архитектуре модели и наборам данных. Например, тематическое моделирование – это задача извлечения тем из коллекции текстов. Наш “Spiketrap Convos” предоставляет нашим клиентам важные инсайты об их аудитории и использует тематическое моделирование в качестве одного из сигналов. Ваш обычный метод тематического моделирования – это LDA (Латентное распределение Дирхле), но, к сожалению, оно слишком непоследовательно и непредсказуемо и просто не достаточно мощно. С другой стороны, вы можете попробовать современную предварительно обученную модель, такую как Bert-Topics, которая, хотя и мощная и охватывающая, также очень жесткая и медленная. NLP и языковый ИИ сделали огромный шаг в последнее десятилетие, но превращение существующих моделей в продукты все еще далеки от оптимального и рискованного.

Можете ли вы рассказать, как Spiketrap обеспечивает мгновенное понимание аудитории для создателей, платформ и брендов?

Рекламодатели и агентства используют наши рейтинги влиятельных лиц и инструменты бренд-аффинити, чтобы определить создателей, чьи сообщества являются безопасными для бренда в различных категориях, включая оценки токсичности, нецензурной лексики и сексуального контента, а также общую безопасность сообщества.

Создатели могут использовать инструмент, чтобы погрузиться в отдельные потоки и увидеть, какие разговоры были наиболее или наименее безопасными, какие стимулировали положительное взаимодействие для их спонсоров и где они могли бы улучшить свои усилия по модерации.

Недавно была опубликована статья под названием ‘FeelsGoodMan: Инференция семантики неологизмов Twitch‘. Можете ли вы кратко описать эту статью?

Способ, которым люди общаются и выражают себя в Интернете, становится все более сложным и сложным для расшифровки. Сначала появились эмодзи :-). Затем появились эмодзи. Затем появились мемы… и теперь “эмоуты”, новый вид иконографии, который стал очень популярен на платформе Twitch. Напоминает эмодзи своей смешанной использованием с обычным текстом, они представляют подобные проблемы, как и мемы, поскольку они генерируются пользователями и их криптический смысл не имеет очевидной связи с изображением. Существует более 8 миллионов различных эмоутов, и более 400 тысяч используются еженедельно. Тем не менее, люди эффективно общаются с их помощью, выражая любые чувства, такие как радость, скука, волнение или сарказм. Наша недавняя статья – это кулинарная книга ИИ для инференции семантического смысла эмоутов. Наш подход не требует поддержания и обновления вручную курированного набора данных и может самоадаптироваться к постоянному появлению новых эмоутов, а также к эволюции смысла популярных эмоутов. Это особенно важно, когда эмоут становится политически или расово заряженным, что мы видели с очень популярными эмоутами, такими как “TriHard”, “PogChamp” и “FeelsGoodMan”. Динамическое использование языка и сдвиги в значении представляют огромные проблемы для систем модерации или рамок анализа настроений, поэтому мы гордимся тем, что решаем эту проблему правильно в Spiketrap.

Есть ли что-то еще, что вы хотели бы поделиться о Spiketrap?

Когда мы смотрим вперед в новый год, Spiketrap работает над разработкой и совершенствованием нового инструмента, который обеспечит более глубокое понимание бренд-настроений для наших клиентов. Новый инструмент Spiketrap Affinity Tool предоставляет интерактивный и интуитивно понятный способ определить и количественно оценить аудиторные аффинити по создателям, брендам, играм и многому другому. Для любого заданного запроса инструмент генерирует индексные баллы аффинити, которые указывают, насколько хорошо данная сущность положительно коррелирует с другой. Многие контекстные сигналы составляют балл, включая частоту и настроение связанных упоминаний. Технологический стек Spiketrap уникально позиционирован для индексирования аффинити между играми, брендами и создателями. Собственный NLP-алгоритм Clair AI обрабатывает миллионы публично опубликованных сообщений пользователей каждый день, атрибутируя неоднозначный контент к сущностям в обширном графе знаний Spiketrap, выявляя темы разговора, определяя настроение и контролируя безопасность. Добавление нового инструмента Affinity Tool позволяет разработчикам, создателям, брендам и многим другим лучше понять свою аудиторию и влияние бренда.

Спасибо за отличное интервью. Читателям, которые хотят узнать больше, рекомендуется посетить Spiketrap.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.