Інтерв’ю
Метт Хокінг, співзасновник WellSaid Labs – Інтерв’ю Серія

Метт Хокінг є співзасновником WellSaid Labs, провідної підприємства з генерації голосу штучного інтелекту. Він має понад 15 років досвіду керівництва командами та впровадження технологічних рішень у великому масштабі.
Ваше походження досить підприємницьке, як ви спочатку стали залучені до штучного інтелекту?
Я завжди вважав себе досить підприємницьким. Я заснував свій перший бізнес після університету, а з тлом у дизайні продукту, я часто допомагав людям з ранньою стадією ідей. На протяженні своєї кар’єри, я був досить удачливим, працюючи з багатьма стартапами, які мали досить неймовірні результати. Під час цих досвідів, я мав можливість познайомитися з багатьма великими засновниками, що надихнуло мене на створення власних ідей як засновника. Штучний інтелект був досить новим для мене, коли я приєднався до AI2, однак цей досвід дав мені можливість застосувати свій досвід у сфері продукту та стартапів до真正 революційних досліджень та уявити, як ці нові досягнення зможуть допомогти багатьом людям у майбутньому. Моя мета з самого початку була створити справжні бізнеси для справжніх людей, і я вірю, що штучний інтелект має потенціал створити багато цікавих можливостей та ефективності в нашому майбутньому, якщо його застосовувати вдумливо.
Чи можете ви поділитися історією про те, як виникла ідея WellSaid Labs, коли ви були підприємцем у The Allen Institute for AI?
Я приєднався до The Allen Institute for Artificial Intelligence (AI2) як підприємцем у 2018 році. Це, безумовно, один з найінноваційних інкубаторів у світі, AI2 об’єднує найяскравіші розуми у сфері штучного інтелекту, які застосовують рішення з межі того, що можливе сьогодні, до осяжних продуктів, які розв’язують проблеми у всьому світі. Мій досвід у сфері дизайну та технологій породив довгостроковий інтерес до творчих галузей, і з тим, що ми зараз спостерігаємо у сфері штучного інтелекту, я хотів дослідити спосіб зв’язати ці дві галузі. Я познайомився з Майклом Петрочуком (співзасновником та технічним директором WellSaid Labs) під час розробки інтерактивного медичного додатку, який спрямовував пацієнтів через різні чутливі сценарії. Під час розробки контенту для цього досвіду, моя команда працювала з голосовими талантами, щоб попередньо записати тисячі рядків голосового супроводу для аватара. Коли я познайомився з деякими проривами, яких досяг Майкл під час своїх досліджень, ми швидко побачили цінність того, як голос штучного інтелекту з людською якістю міг трансформувати не тільки продукт, над яким я працював, але й вплинути на інші галузі та застосування.
WellSaid Labs є однією з небагатьох компаній, яка надає голосовим акторам можливість увійти у сферу штучного інтелекту. Чому ви вважали важливим інтегрувати справжні голоси у свій продукт?
Наша відповідь на це питання двостороння: по-перше, ми хотіли створити рішення, які доповнюють можливості професійних голосових акторів, розширюючи можливості голосу. І по-друге, ми прагнули досягти найвищого рівня людської якості у наших продуктах. Наші голосові актори є довгостроковими партнерами та отримують компенсацію та частку доходу за свої голосові дані та подальший контент, створений з їх допомогою. Кожен голосовий актор, якого ми наймаємо для створення аватара штучного інтелекту на основі їхнього голосу, отримує оплату залежно від того, як часто його голос використовується на нашій платформі. Ми заохочуємо таланти співпрацювати з нами; чесна компенсація за їх внесок дуже важлива для нас.
Щоб пропонувати продукти найвищої людської якості на ринку, нам потрібно бути ретельними щодо джерел наших даних. Цей процес дає нам більше контролю над якістю, оскільки ми тренуємо свої моделі глибокого навчання, щоб говорити як людська мова, з урахуванням контексту та стилів, актуальних для контексту.
Ми тренуємося на справжніх людських голосових даних. Наші голосові таланти читають свої сценарії автентично та цікаво, коли записують для нас. Ідеальна мова є механічною концепцією, яка веде до роботизованого, незвичайного виходу. Коли професійні голосові актори виконують, їхня швидкість мови коливається. Їхня гучність змінюється у відповідності з контентом, який вони читають. Їхній голосовий тон може підвищуватися у пасажі, який вимагає захопленого прочитування, та знижуватися знову у більш сумному рядку. Ці динамічні варіації складають цікаву людську вокальну виставу.
Розробляючи процеси штучного інтелекту, які працюють у координації з динамічними виступами наших професійних талантів, ми створили справжню природну систему генерації тексту у мову. Ми розробили першу систему генерації тексту у мову з передбачувальними контролями на всіх етапах творчого процесу. Наша фонетична бібліотека містить різноманітну колекцію аудіоданих, що дозволяє користувачам включати конкретні голосові підказки, такі як керівництво з вимови або керування, у модель під час фази виробництва. На одній платформі користувачі WellSaid можуть записувати, редагувати та стилізувати свій голосовий супровід без необхідності імпортувати зовнішні дані.
WellSaid Labs претендує на звання першої етичної платформи штучного інтелекту голосу. Чому етика штучного інтелекту важлива для вас?
З ростом прийняття штучного інтелекту та його все більшої популярності, страхи перед шкідливими випадками використання та зловмисними акторами стають центральною темою кожної розмови – і ці побоювання підтверджуються реальними випадками. Голос штучного інтелекту не є винятком; майже щодня з’являється новий звіт про те, як знаменитість, публічна особа чи політик були глибоко фальсифіковані для рекламних чи політичних цілей. Хоча офіційний федеральний регламент щодо цієї технології все ще розвивається, виявлення та боротьба з шкідливими акторами та випадками використання синтетичних голосів стануть все більш складними, оскільки технологія продовжує розвиватися.
Майкл і я мали ці розмови з першого дня. Розробка технології штучного інтелекту голосу супроводжується значними відповідальностями щодо згоди, конфіденційності та загальної безпеки. Ми знаємо, що нам, як розробникам, потрібно будувати нашу технологію безпечно, вирішувати етичні проблеми та закладати основу для майбутнього розвитку синтетичних голосів. Ми визнаємо потенціал технології штучного інтелекту голосу для зловживання та приймаємо на себе відповідальність за зменшення потенційного зловживання нашим продуктом. Ми повинні закладати цю основу з першого дня, а не спішити та допускати помилки на своєму шляху. Це не буде правильно щодо наших клієнтів та голосових акторів, які покладаються на нас, щоб створити високоякісний, надійний продукт.
Ми повністю підтримуємо заклик до законодавства в цій сфері; однак ми не чекатимемо федеральних регуляцій. Ми завжди ставили на перше місце та продовжимо ставити на перше місце практики, які підтримують конфіденційність, безпеку, прозорість та підзвітність.
Ми суворо дотримуємося нашого компанійського етичного кодексу, який базується на будівництві з відповідальною інновацією у кожному рішенні, яке ми приймаємо. Це в інтересах наших глобальних клієнтів – підприємств.
Як ви розробляєте етичну платформу штучного інтелекту голосу?
WellSaid Labs була присвячена етичній інновації з самого початку. Ми централізуємо довіру та прозорість через використання внутрішніх моделей даних, явних вимог до згоди, програми модерації контенту та нашої присвяченості захисту бренду. У WellSaid, ми спираємося на принципи Відповідального Штучного Інтелекту, щоб сформувати наші рішення та дизайни, і ці принципи поширюються на використання наших голосів. Наш кодекс етики представляє ці принципи як Відповідальність, Прозорість, Конфіденційність та Безпека, та Справедливість.
Відповідальність: Ми підтримуємо суворі стандарти для відповідного контенту, забороняючи використання наших голосів для контенту, який є шкідливим, ненависним, фальшивим або призначеним для підбурювання до насильства. Наша команда довіри та безпеки підтримує ці стандарти з суворою програмою модерації контенту, блокуючи та видаляючи користувачів, які намагаються порушити наші Умови обслуговування.
Прозорість: Ми вимагаємо явної згоди перед тим, як будувати синтетичний голос з кимось голосовими даними. Користувачі не можуть завантажувати голосові дані з політиків, знаменитостей чи будь-кого іншого, щоб створити клон їхнього голосу, якщо у нас немає явної, письмової згоди.
Конфіденційність та Безпека: Ми захищаємо ідентичність наших голосових акторів, використовуючи запасні зображення та псевдоніми для представлення синтетичних голосів. Ми також заохочуємо їх бути обережними щодо того, як і з ким вони ділиться своєю асоціацією з WellSaid Labs або іншими компаніями синтетичних голосів, щоб зменшити можливість зловживання їхнім голосом.
Справедливість: Ми компенсуємо всіх голосових акторів, які надають голосові дані для нашої платформи, та надаємо їм подальшу частку доходу за використання синтетичних голосів, створених з їхніми даними.
Разом з цими принципами, ми також суворо поважаємо інтелектуальну власність. Ми не претендуємо на володіння контентом, наданим нашими користувачами чи голосовими акторами. Ми ставимо на перше місце цілісність, справедливість та прозорість у всьому, що ми робимо, забезпечуючи, щоб наша технологія синтетичної мови використовувалася відповідально та етично. Ми активно шукаємо партнерства з голосами з різних背景ів та досвіду, щоб забезпечити, що ми надаємо голос кожному.
Наша присвяченість відповідальній інновації та розробці технології штучного інтелекту голосу з етикою на увазі відрізняє нас від інших у цій сфері, які намагаються скористатися новою, нерегульованою галуззю будь-якими засобами. Наші ранні інвестиції в етику, безпеку та конфіденційність закладуть основу для довіри та лояльності серед наших голосових акторів та клієнтів, які все частіше шукають етично створені продукти та послуги від компаній, які стоять на чолі інновацій.
WellSaid Labs створила свою власну внутрішню модель штучного інтелекту, яка дозволила досягти людської якості у синтетичних голосах, і це було досягнуто шляхом введення людських недоліків у розмови. Що саме робить ці недоліки кращими, і як вони реалізовані?
WellSaid Labs не є просто ще одним генератором тексту у мову. Там, де рання технологія генерації тексту у мову не могла визнати людські якості мови, такі як тон, висота та діалект, які передають контекст та емоції за словами, голоси WellSaid досягли людської якості, вводячи унікальні людські недоліки у мову штучного інтелекту.
Наша основна міра якості голосу завжди була природністю людини. Ця керівна віра сформувала нашу технологію на кожному етапі, від бібліотек сценаріїв, які ми побудували, до інструкцій, які ми надаємо талантам, та, останнім часом, того, як ми ітеруємо над нашими основними алгоритмами генерації тексту у мову.
Ми тренуємося на справжніх людських голосових даних. Наші голосові таланти читають свої сценарії автентично та цікаво, коли записують для нас. Ідеальна мова є механічною концепцією, яка веде до роботизованого, незвичайного виходу. Коли професійні голосові актори виконують, їхня швидкість мови коливається. Їхня гучність змінюється у відповідності з контентом, який вони читають. Їхній голосовий тон може підвищуватися у пасажі, який вимагає захопленого прочитування, та знижуватися знову у більш сумному рядку. Ці динамічні варіації складають цікаву людську вокальну виставу.
Розробляючи процеси штучного інтелекту, які працюють у координації з динамічними виступами наших професійних талантів, ми створили справжню природну систему генерації тексту у мову. Ми розробили першу систему генерації тексту у мову з передбачувальними контролями на всіх етапах творчого процесу. Наша фонетична бібліотека містить різноманітну колекцію аудіоданих, що дозволяє користувачам включати конкретні голосові підказки, такі як керівництво з вимови або керування, у модель під час фази виробництва. На одній платформі користувачі WellSaid можуть записувати, редагувати та стилізувати свій голосовий супровід без необхідності імпортувати зовнішні дані.
Чи можете ви обговорити деякі з викликів, пов’язаних з будівництвом компанії штучного інтелекту тексту у мову?
Розробка технології штучного інтелекту голосу створила цілком новий набір перешкод для її виробників та споживачів. Одним з основних викликів є не потрапляння у шум та гіперію, яка заповнює сферу штучного інтелекту. Як нова, модна технологія, багато організацій намагаються скористатися короткостроковими розробками штучного інтелекту голосу. Ми хочемо надати голос кожному, керуючись центральними етичними принципами та автентичністю. Це дотримання автентичності може затримати розвиток та впровадження наших технологій, але закріплює безпеку та безпеку голосів WellSaid та їхніх даних.
Іншим викликом розробки нашої платформи генерації тексту у мову було розроблення конкретних керівних принципів згоди, щоб забезпечити, що організації чи окремі актори не зловживають нашою технологією. Щоб подолати цей виклик, ми шукаємо співпрацю, довгострокові партнерства та повністю займаємося розробкою голосу, щоб збільшити відповідальність, прозорість та безпеку користувачів. Ми активно шукаємо партнерства з голосовими талантами з різних背景ів, організацій та досвіду, щоб забезпечити, що бібліотека голосів WellSaid Labs відображає її творців та аудиторію. Ці процеси розроблені для того, щоб бути намереними та детальними, щоб забезпечити, що наша технологія використовується якомога безпечніше та етично, що може сповільнити розвиток та запуск.
Яка ваша візія майбутнього генерації штучного інтелекту голосу?
Найтриваліше, технологія штучного інтелекту голосу не досягла достатньої якості, щоб дозволити компаніям створювати значимий контент у великому масштабі. Тепер, коли аудіотехнологія вже не вимагає дорогого обладнання та апаратури, весь написаний контент може бути створений та опублікований у аудіоформаті, щоб створити цікаві, багатомодальні досвіди.
Сьогодні голоси штучного інтелекту можуть виробляти людські звуки та захоплювати нюанси, необхідні для того, щоб зробити цифрове оповідання більш доступним та природнім. Майбутнє генерації штучного інтелекту голосу буде всепроникним аудіо-досвідом, який торкнеться кожного аспекту нашого життя. Зі зростанням технологій, ми побачимо все більш природні та виразні синтетичні голоси, які затьмарять межу між людською та машинною мовою – відкриваючи нові двері для бізнесу, комунікацій, доступності та того, як ми взаємодіємо зі світом навколо нас.
Бізнеси знайдуть покращену персоналізацію у інтерфейсах штучного інтелекту голосу та використовуватимуть їх, щоб зробити взаємодію з віртуальними асистентами більш іммерсивною та зручною. Ці вдосконалення вже відбуваються, від розумних агентів центрів обслуговування до швидкого харчування на виїзді. Створення контенту, включаючи рекламу, маркетинг продукту, розповідь новин, подкасти, аудіокниги та інші мультимедійні матеріали, побачать збільшення ефективності завдяки використанню інструментів для розробки цікавого контенту – в кінцевому підсумку збільшуючи підйом та доходи для організацій, особливо зараз, коли багатомовні моделі можуть розширити присутність компанії з однієї точки походження до глобальної присутності. Виробничі команди знайдуть велику користь у синтетичних голосах для створення голосів, створених на вимогу бренду чи налаштованих під слухача.
До появи штучного інтелекту, технологія генерації тексту у мову не мала необхідної людської емоції, інтонації та вимови, необхідних для повного оповідання у великому масштабі та з легкістю. Тепер технологія генерації тексту у мову, підкріплена штучним інтелектом, пропонує більш іммерсивні та доступні досвіди, включаючи реальні можливості мови та інтерактивних розмовних агентів.
Досягнення людських можливостей мови було подорожжю, але тепер, коли це досяжне, ми свідчимо повний масштаб штучного інтелекту голосу для створення справжньої бізнес-цінності для організацій.
Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати WellSaid Labs.












