Моделі та платформи ШІ
Доктор Ніл Ягер, співзасновник і головний науковий співробітник Phrasee – Серія інтерв’ю

Доктор Ніл Ягер – головний науковий співробітник Phrasee, і архітектор методу Phrasee, інструменту копірайтингу, що використовує штучний інтелект, який допоміг оптимізувати маркетинговий контент для деяких з найбільш відомих брендів світу, включаючи eBay, Groupon і Virgin – плюс багато інших, з Австралії до Америки, у понад 20 мовах, від англійської до японської.
Доктор Ягер написав понад десяток академічних публікацій, автор книги про аналіз даних, і володіє декількома патентами. Як один з світових лідерів у комерціалізації штучного інтелекту, він має ступінь доктора філософії з комп’ютерних наук Університету Нового Південного Уельсу в Австралії.
Ви – 20-річний ветеран технологічної галузі, які були деякі з ваших попередніх ролей, пов’язаних з штучним інтелектом?
Я займаюсь роботою, пов’язаною зі штучним інтелектом, з моменту здобуття ступеня доктора філософії в середині 2000-х років. Однак галузь пройшла через кілька ребрендингів з тих пір. Наприклад, 15 років тому я вивчав “статистичне розпізнавання закономірностей”. Через кілька років це стало відомо як “машинне навчання”, яке є набагато більш привабливим іменем. Нещодавно машинне навчання (і “глибоке навчання” зокрема) стало синонімом “штучного інтелекту” загалом. У мене є змішані почуття щодо цього. З одного боку, моя робота з Phrasee навчила мене важливості брендингу. З іншого боку, термін “штучний інтелект” несе багаж із собою і може привести до неправильного розуміння технології. Я дивуюсь, де б ми були, якби всі ми все ще називали це “статистичним розпізнаванням закономірностей”.
Більшість моєї попередньої роботи була в галузі обробки сигналів і комп’ютерного зору. У мене не було великого досвіду роботи з обробкою природної мови до Phrasee. Я з тих пір дізнався, що мова, ймовірно, є найбільш складною проблемою в штучному інтелекті.
У 2008 році ви співавтор книги під назвою “Біометрична система та аналіз даних: проектування, оцінка та аналіз даних“, яка поєднує аспекти статистики та машинного навчання для надання комплексного керівництва з оцінки, інтерпретації та розуміння біометричних даних. Поза рамками більшої кількості обчислювальних ресурсів, чи вважаєте ви, що ця галузь еволюціонувала з моменту публікації цієї книги? Чи можете ви описати, як?
Глибоке навчання суттєво вплинуло на галузі комп’ютерного зору, обробки мови та машинного навчання з моменту написання цієї книги. Було б неможливо написати цю книгу сьогодні без розділу про глибоке навчання.
Революція глибокого навчання фактично розпочалася в 2012 році, коли модель глибокого навчання виграла конкурс ImageNet. ImageNet – це візуальна база даних розпізнавання об’єктів, де комп’ютер визначає, що знаходиться на зображенні (наприклад, “собака” або “балон”). Десятиліттями дослідники робили поступові досягнення на таких базах даних. Кожна підгалузь працювала незалежно та сильно залежала від експертизи конкретної галузі. Практично за одну ніч всі моделі, які були побудовані за багато років, стали застарілими. Алгоритми глибокого навчання, розроблені сторонніми розробниками, вигравали конкурси з суттєвими перевагами. Це перетворило галузь штучного інтелекту.
Галузь все ще швидко рухається і еволюціонувала навіть з моменту заснування Phrasee кілька років тому. Наприклад, інструменти глибокого навчання, на яких ми зараз залежимо, не існували на момент заснування компанії. Темп інновацій приносить свої власні виклики.
Чи можете ви поділитися з нами тим, що Phrasee здатна зробити для бізнесу?
Phrasee вирішує дві проблеми для бізнесу. По-перше, існує проблема написання маркетингового контенту. Тепер існує більше рекламних каналів, ніж будь-коли раніше (наприклад, електронна пошта, AdWords, соціальні мережі, друк, подкасти тощо). Написання контенту для всіх цих каналів, який є високої якості та відповідає стилю та тону бренду, є складним завданням. Phrasee вирішує проблему масштабу, автоматично генеруючи контент. По-друге, важливо, щоб вся мова, яка використовується, була ефективною. Не тільки Phrasee генерує мову, але також використовує машинне навчання для прогнозування впливу повідомлення та оптимізації відповідно.
Чи можете ви поділитися з нами тим, що спонукало вас до використання обробки природної мови (NLP) та глибокого навчання для підвищення ефективності рекламного контенту?
Використання штучного інтелекту для максимізації впливу цифрових маркетингових кампаній не є новою ідеєю. Існують команди людей з докторськими ступенями з фізики, які були завербовані для роботи над оптимізацією реклами. Однак у більшості випадків вони зосереджують свої зусилля на таких речах, як сегментація аудиторії, персоналізація, час доставки, розміщення реклами, шрифти тощо. Коли ми вперше обговорювали ідеї для Phrasee, ми помітили, що майже все в рекламі оптимізується, крім фактичної мови, яка використовується! Ми визначили це як пробіл на ринку та величезну можливість.
Phrasee здатна покращити маркетинговий контент у понад 20 мовах, включаючи японську. Чи можете ви обговорити деякі унікальні проблеми обробки природної мови, з якими стикаються іноземні мови?
Останнім доповненням до нашого набору підтримуваних мов є російська. Це слов’янська мова, яка суттєво відрізняється від інших індо-європейських мов. У цьому випадку нам було необхідно розробити нові правила для нашої системи генерації мови, щоб вихід був вільним і граматично правильним. Це не тільки мова питання. Це також питання розробки програмного забезпечення. Коли вихід нашої системи знаходиться в рідній мові розробника, відносно легко помітити помилки та перевірити, що все працює правильно. Однак, коли ми працюємо з російською або японською, ми могли б виводити безглуздість і не мали б про це жодного уявлення. Тому важливо мати рідного мовця, тісно залученого до процесу перевірки якості.
Виклик не тільки полягає в іноземних мовах. Існують деякі цікаві регіональні відмінності. Наприклад, англійська мова має варіанти орфографії для США, Великої Британії, Австралії, Канади тощо. Крім того, існують граматичні відмінності. У британській англійській ви “подивіться”, тоді як в американській англійській ви “взгляните”. Значення слів також може відрізнятися з місця на місце. “Резинка” – це стиральна гумка у Великій Британії, але презерватив у Північній Америці! Щоб системи генерації мови могли бути використані для бізнес-застосунків, вони повинні обробляти всі ці нюанси.
Чи можете ви також поділитися деякими деталями щодо того, як глибоке навчання використовується в Phrasee?
Існують два основних компоненти штучного інтелекту в технології Phrasee. Перший – це генерація природної мови (NLG), яка фактично виробляє мову. Другий – глибоке навчання, яке зосереджується на ефективності. Ефективність може означати різні речі залежно від контексту. Наприклад, мета електронного листа – заманити одержувача відкрити лист і побачити вміст всередині. Для Facebook (META ) мета може полягати у максимізації лайків або поділень. За великих обсягів історичних даних можливо знайти тонкі тенденції та закономірності, які ніколи не були б помічені людиною. Це стандартна проблема машинного навчання.
Глибоке навчання пропонує кілька переваг над традиційним підходом машинного навчання. З традиційним машинним навчанням існує сильний акцент на “інженерії функцій”. Це означає, що розробник повинен вирішити, які функції мови, на його думку, є найбільш важливими. Наприклад, слова, довжина, використання емоджі тощо. Проблема полягає в тому, що це обмежено навичками та уявою інженера. Однак з глибоким навчанням сирій текст вводиться в модель, і вона будує свою власну машину-представлення мови (це відомо як навчання з кінця в кінець). Тому воно вільне від упереджень людини та є потужним підходом. Однак недолік полягає в тому, що воно може бути складним для розуміння, чому модель поводиться певним чином. “Роз’яснюваність” – це активна галузь дослідження в спільноті глибокого навчання. Однак існує фундаментальний компроміс між складністю системи та нашою здатністю її зрозуміти. Людська мова – це безлад, тому успішні рішення з обробки природної мови зазвичай мають високий рівень складності.
Одна з функцій Phrasee полягає в тому, що вона може писати в унікальному тоні бренду, чи можете ви розповісти про те, як це здійснюється?
Коли ми підписуємо нового клієнта, перша річ, яку ми робимо, – це збираємо інформацію про стиль спілкування бренду. Це включає будь-які офіційні керівництва з брендингу, історичні маркетингові кампанії та серію питань, які ми розробили для цієї мети. Вся ця інформація використовується нашою внутрішньою командою мовних фахівців для створення клієнтської моделі мови. Наші моделі мови є генеративними, тобто вони можуть виробляти нову мову в унікальному стилі клієнта.
Моделі мови можна оновлювати в будь-який момент. Наприклад, зараз ми на піку кризи COVID-19. Наша мова команда переглядає наші моделі, щоб переконатися, що не можна створити невластиву мову. Фраза типу “Ці пропозиції стають вірусними!” могла бути безневинною кілька місяців тому, але зараз явно невластива під час глобальної пандемії. Це демонструє гнучкість нашої системи.
Який тип даних потрібен компанії, яка хоче почати роботу з Phrasee?
Щиро кажучи, для початку роботи з нами потрібно не багато даних. Перший крок – визначити підходящу область проекту. Наприклад, це можуть бути теми електронних листів для щотижневих промо-акцій. Ідеально, якщо це буде відносно велика аудиторія та зв’язки будуть регулярними. Як тільки проект визначено, нам потрібно інформація про тему та голос бренду для будівництва моделі мови. Phrasee потребує результатів виконання на постійній основі. Оскільки наше рішення використовує машинне навчання, важливо вимірювати та відстежувати ключові метрики з часом. Ця інформація подається назад у нашу систему, щоб вона могла постійно оптимізуватися для взаємодії.
Чи є щось ще, що ви хотіли б поділитися про Phrasee?
Коли Паррі, Вікторія та я заснували Phrasee п’ять років тому, ми були впевнені, що це буде лише питання часу, поки інші стартапи з’являться з подібними продуктами. Наш план був – вийти вперед і залишатися на одному кроці попереду конкурентів. Однак ми були здивовані відсутністю учасників на цьому ринку. Де всі інші? Я думаю, що є кілька причин для цього, але одна з основних полягає в тому, що мова є такою складною проблемою. Я підозрюю, що інші спробували створити подібні продукти, але зазнали невдачі на ранніх стадіях дослідження та розробки. Це свідчить про унікальність нашої технології.
Дякуємо за інформативне інтерв’ю про обробку природної мови, генерацію природної мови та глибоке навчання. Для отримання більшої інформації відвідувачі можуть відвідати Phrasee.












