Интервью

Мэтт Хокинг, сооснователь WellSaid Labs – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Мэтт Хокинг – сооснователь WellSaid Labs, ведущей компании, занимающейся разработкой корпоративного класса генераторов голоса на основе ИИ. У него более 15 лет опыта руководства командами и разработки технологических решений в крупном масштабе.

Ваш опыт довольно предпринимательский, как вы первоначально стали вовлечены в ИИ?

Думаю, я всегда считал себя довольно предпринимательским. Я основал свое первое бизнес после колледжа, и с фоном в области дизайна продукта, я обнаружил, что я тяготею к помощи людям с ранними идеями. На протяжении всей своей карьеры я был достаточно удачлив, чтобы работать с множеством стартапов, которые имели довольно удивительные результаты. Во время этих опытов я имел возможность познакомиться с множеством отличных основателей, что вдохновило меня на то, чтобы заняться своими собственными идеями в качестве основателя. ИИ был относительно новым для меня, когда я присоединился к AI2, однако этот опыт дал мне возможность применить мой опыт в области продукта и стартапов к действительно удивительным исследованиям и представить, как эти новые достижения смогут помочь многим людям в ближайшие годы. Моя цель с самого начала была – разработать реальные бизнесы для реальных людей, и я считаю, что ИИ имеет потенциал создать множество интересных возможностей и эффективностей в нашем будущем, если он будет применен вдумчиво.

Можете ли вы рассказать историю о том, как идея WellSaid Labs была задумана, когда вы были предпринимателем в резиденции в Институте Аллена по ИИ?

Я присоединился к Институту Аллена по ИИ (AI2) в качестве предпринимателя в резиденции в 2018 году. Это, безусловно, один из самых инновационных инкубаторов в мире, AI2 объединяет самые яркие умы в области ИИ, которые применяют решения с переднего края того, что возможно сегодня, к осязаемым продуктам, которые решают проблемы по всему миру. Мой опыт в области дизайна и технологий воспитал долгосрочный интерес к творческим областям, и с ИИ, который мы все наблюдаем сегодня, я хотел исследовать способ соединить их. Меня познакомили с Майклом Петрочуком (сооснователем и техническим директором WellSaid Labs) во время разработки интерактивного приложения для здравоохранения, которое руководит пациентом через различные чувствительные сценарии. Во время разработки контента для этого опыта моя команда работала с талантами голоса, чтобы предварительно записать тысячи строк голоса за аватаром. Когда я был представлен некоторым прорывам, которых достиг Майкл во время своих исследований, мы оба быстро увидели ценность того, как человеческий голос текста в речь (TTS) мог бы преобразовать не только продукт, над которым я работал, но и повлиять на множество других приложений и отраслей. Технология и инструменты боролись с тем, чтобы поспевать за потребностями производителей, создающих с помощью голоса как средства. Мы увидели путь к тому, чтобы поставить эту технологию в руки всех создателей, позволяя голосу быть неотъемлемой частью всех историй.

WellSaid Labs – одна из немногих компаний, которая предоставляет талантам голоса возможность войти в пространство ИИ-голоса. Почему вы считали, что важно интегрировать реальные голоса в продукт?

Наш ответ на это двойной: во-первых, мы хотели создать решения, которые дополняют возможности профессиональных талантов голоса, расширяя возможности для голоса. И во-вторых, мы стремились иметь самый высокий уровень человеческого качества в наших продуктах. Наши таланты голоса – это долгосрочные партнеры, и они получают компенсацию и долю дохода за свои данные голоса и последующий контент, созданный с их помощью. Каждый талант голоса, которого мы нанимаем для создания аватара ИИ-голоса на основе сходства его голоса, оплачивается на основе того, как много его голос используется на нашей платформе. Мы поощряем таланты к сотрудничеству с нами; справедливая компенсация за их вклад чрезвычайно важна для нас.

Чтобы предложить самый высокий уровень человеческого качества продуктов на рынке, мы должны быть строгими в отношении того, откуда мы получаем наши данные. Этот процесс дает нам больше контроля над качеством, поскольку мы обучаем наши модели глубокого обучения говорить как человеческая пара и в конкретных контекстно-релевантных стилях. Мы не просто создаем голос, который повторяет предоставленный вход. Наши модели предлагают разнообразие стилей голоса, которые выполняют то, что на странице. Будь то пользователи создают голос за помощью аватара из нашей библиотеки или создают голос за помощью с помощью индивидуально созданного голоса для своей марки, мы используем реальные данные голоса, чтобы обеспечить бесперебойный процесс и простую в использовании платформу. Если бы наши клиенты должны были манипулировать и редактировать наши голоса в пост-продакшене, процесс получения желаемого вывода был бы неуклюжим и долгим. Наши голоса принимают контекст написанного контента и предоставляют контекстуально точное чтение. Мы предлагаем голоса для всех видов использования – будь то чтение новостей, создание аудиорекламы или автоматизированная поддержка колл-центра – поэтому партнерство с профессиональными талантами голоса для каждого случая использования дает нам как контекст, так и высококачественные данные голоса.

Мы регулярно обновляем и добавляем новые стили и акценты в нашу библиотеку аватаров, чтобы обеспечить представление голосов наших клиентов. В студии WellSaid Labs клиенты и бренды могут прослушать разные голоса на основе региона, стиля и случая использования, что позволяет создать более бесперебойную и унифицированную производство аудиоконтента, персонализированного для потребностей создателя. Как только первоначальная запись отобрана, пользователи могут сигнализировать конкретные слова, написание и произношение, чтобы обеспечить, что ИИ последовательно говорит конкретно для их потребностей.

WellSaid Labs заявляет о себе как первая этическая платформа ИИ-голоса. Почему ИИ-этика важна для вас?

По мере того, как принятие ИИ увеличивается и становится более распространенным, страхи перед вредными случаями использования и плохими акторами находятся в центре каждого разговора – и эти опасения, к сожалению, подтверждаются реальными событиями. ИИ-голос не является исключением; почти каждый день появляется новый отчет о том, как знаменитость, общественный деятель или политик был глубоко подделан для рекламы или политических целей. Хотя формальное федеральное регулирование в отношении этой технологии все еще развивается, обнаружение и борьба с злонамеренными акторами и использованием синтетического голоса станет все более сложной задачей по мере развития технологии.

Исходя из AI2, где ИИ-этика является основным принципом, Майкл и я имели эти разговоры с первого дня. Разработка технологии ИИ-речи несет в себе значительные обязанности в отношении согласия, конфиденциальности и общей безопасности. Мы знаем, что мы, как разработчики, должны строить нашу технологию безопасно, решать этические проблемы и закладывать основу для будущего развития синтетических голосов. Мы признаем потенциал технологии ИИ-речи для злоупотребления и принимаем на себя ответственность за снижение потенциального злоупотребления нашей продукцией. Нам нужно заложить этот фундамент с первого дня, а не спешить и совершать ошибки по пути. Это не будет правильно по отношению к нашим корпоративным клиентам и талантам голоса, которые полагаются на нас, чтобы построить высококачественный, заслуживающий доверия продукт.

Мы полностью поддерживаем призыв к законодательству в этой области; однако мы не будем ждать федеральных правил. Мы всегда ставили во главу угла практики, которые поддерживают конфиденциальность, безопасность, прозрачность и подотчетность.

Мы строго придерживаемся кодекса намерений нашей компании, который основан на построении с помощью ответственных инноваций в каждом решении, которое мы принимаем. Это в интересах наших глобальных клиентов – корпоративных брендов.

Как вы развиваете этическую платформу ИИ-голоса?

WellSaid Labs привержена этическим инновациям с самого начала. Мы централизуем доверие и прозрачность с помощью использования внутренних моделей данных, явных требований согласия, нашей программы модерации контента и нашего обязательства по защите бренда. В WellSaid мы опираемся на принципы Ответственного ИИ, чтобы формировать наши решения и конструкции, и эти принципы распространяются на использование наших голосов. Наш кодекс этики представляет эти принципы как Ответственность, Прозрачность, Конфиденциальность и Безопасность, и Справедливость.

Ответственность: Мы поддерживаем строгие стандарты для подходящего контента, запрещая использование наших голосов для контента, который является вредным, ненавистным, мошенническим или предназначенным для подстрекательства к насилию. Наша команда Доверие и Безопасность поддерживает эти стандарты с помощью строгой программы модерации контента, блокируя и удаляя пользователей, которые пытаются нарушить наши Условия обслуживания.

Прозрачность: Мы требуем явного согласия перед построением синтетического голоса с помощью данных голоса кого-либо. Пользователи не могут загружать данные голоса политиков, знаменитостей или кого-либо еще, чтобы создать клон их голоса, если мы не имеем явного, письменного согласия этого человека.

Конфиденциальность и Безопасность: Мы защищаем личности наших талантов голоса, используя запасные изображения и псевдонимы для представления синтетических голосов. Мы также поощряем их проявлять осторожность в отношении того, как и с кем они делятся своей связью с WellSaid Labs или другими компаниями синтетического голоса, чтобы снизить возможность злоупотребления их голосом.

Справедливость: Мы компенсируем всех талантов голоса, которые предоставляют данные голоса для нашей платформы, и мы предоставляем им постоянную долю дохода за использование синтетического голоса, который мы строим с их данными.

Вместе с этими принципами мы также строго уважаем интеллектуальную собственность. Мы не претендуем на владение контентом, предоставленным нашими пользователями или талантами голоса. Мы ставим во главу угла целостность, справедливость и прозрачность во всем, что мы делаем, обеспечивая, что наша синтетическая технология речи используется ответственно и этично. Мы активно ищем партнерства с голосами из различных слоев общества и опыта, чтобы обеспечить, что мы предоставляем голос для всех.

Наша приверженность ответственным инновациям и разработке технологии ИИ-голоса с учетом этики отличает нас от других в этой области, которые стремятся капитализировать новый, нерегулируемый рынок любыми средствами. Наши ранние инвестиции в этику, безопасность и конфиденциальность устанавливают доверие и лояльность внутри наших талантов голоса и клиентов, которые все чаще ищут этически созданные продукты и услуги от компаний, которые находятся на переднем крае инноваций.

WellSaid Labs создала свою собственную внутреннюю модель ИИ, которая позволила ИИ-голосам достичь человеческого уровня, и она достигла этого, введя несовершенства, которые люди имеют в разговорах. Что именно в этих несовершенствах делает ИИ лучше, и как эти несовершенства реализуются?

WellSaid Labs – это не просто еще один генератор TTS. Где ранние технологии TTS не могли распознавать качества человеческой речи, такие как высота, тон и диалект, которые передают контекст и эмоции за словами, голоса WellSaid достигли человеческого уровня, введя уникально человеческие несовершенства в речь ИИ.

Наша основная мера качества голоса всегда была человеческой естественностью. Это руководящая убеждение сформировало нашу технологию на каждом этапе, от библиотек сценариев, которые мы построили, до инструкций, которые мы даем талантам, и, более недавно, как мы итерируем наши основные алгоритмы TTS.

Мы обучаем на аутентичных человеческих вокализациях. Наши таланты голоса читают свои сценарии аутентично и увлекательно, когда они записывают для нас. Идеальное совершенство, с другой стороны, является механической концепцией, которая приводит к роботически безупречному, неестественному выводу. Когда профессиональные таланты голоса выступают, их скорость речи колеблется. Их громкость меняется в соответствии с контентом, который они читают. Их вокальный тон может подняться в проходе, требующем возбужденного чтения, и упасть снова в более мрачной строке. Эти динамические вариации составляют увлекательную человеческую вокальную производительность.

Строив ИИ-процессы, которые работают в координации с динамическими выступлениями наших профессиональных талантов, мы построили действительно естественную платформу TTS. Мы разработали первую систему TTS с длинной формой с прогнозируемыми контролями на протяжении всего творческого процесса. Наша фонетическая библиотека содержит разнообразную коллекцию аудиоданных, позволяющую пользователям включать конкретные вокальные подсказки, такие как руководство по произношению или контролируемость, в модель во время производственной фазы. На одной платформе пользователи WellSaid могут записать, отредактировать и стилизовать свою голосовуюovers без необходимости импортировать внешние данные.

Можете ли вы обсудить некоторые проблемы, связанные с построением компании ИИ-голоса?

Разработка технологии ИИ-голоса создала совершенно новый набор препятствий для ее производителей и потребителей. Одной из основных проблем является то, что не попасть в шум и ажиотаж, которые наводняют сектор ИИ. Как новая, модная технология, многие организации пытаются заработать на краткосрочных разработках ИИ-голоса. Мы хотим предоставить голос для всех, руководствуясь центральными этическими принципами и аутентичностью. Это придерживание аутентичности может задержать разработку и развертывание наших технологий, но укрепляет безопасность и безопасность голосов WellSaid и их данных.

Другой проблемой разработки нашей платформы TTS было разработка конкретных руководств по согласию, чтобы обеспечить, что организации или отдельные акторы не злоупотребляют нашей технологией. Чтобы противостоять этой проблеме, мы стремимся к сотрудничеству, долгосрочным партнерствам и полностью участвуем в разработке голоса, чтобы увеличить подотчетность, прозрачность и безопасность пользователей. Мы активно ищем партнерства с талантами голоса из различных слоев общества, организаций и опыта, чтобы обеспечить, что библиотека голосов WellSaid Labs отражает ее создателей и аудиторию. Эти процессы предназначены для того, чтобы быть намеренными и детальными, чтобы обеспечить, что наша технология используется как можно более безопасно и этично, что может замедлить разработку и сроки запуска.

Каково ваше видение будущего генеративных ИИ-голосов?

На протяжении долгого времени технология ИИ-речи не достигала достаточно высокого качества, чтобы позволить компаниям создавать значимый контент в крупном масштабе. Теперь, когда технология аудио больше не требует дорогого оборудования и аппаратуры, все написанный контент может быть произведен и опубликован в аудиоформате, чтобы создать увлекательные, многомодальные trải nghiệm.

Сегодня ИИ-голоса могут производить человеческо-podobный аудио и захватить нюансы, необходимые для того, чтобы сделать цифровое повествование более доступным и естественным. Будущее генеративного ИИ-голоса будет всеобъемлющим слышимым trải nghiệm, которые затронут каждый аспект нашей жизни. По мере того, как технология продолжает развиваться, мы увидим все более и более естественные и выразительные синтетические голоса, стирающие границу между человеческой и машинной речью – открывая новые двери для бизнеса, коммуникаций, доступности и того, как мы взаимодействуем с миром вокруг нас.

Бизнес найдет улучшенную персонализацию в интерфейсах ИИ-голоса и будет использовать их, чтобы сделать взаимодействия с виртуальными помощниками более иммерсивными и удобными для пользователя. Эти улучшения уже происходят, от интеллектуальных агентов колл-центра до быстрого обслуживания в ресторанах. Создание контента, включая рекламу, маркетинг продукта, чтение новостей, подкасты, аудиокниги и другие мультимедийные trải nghiệm, увидит увеличение эффективности с помощью инструментов для разработки увлекательного контента – в конечном итоге увеличивая подъем и доход для организаций, особенно теперь, когда многолингвальные модели могут расширить охват компании с одной точки до глобального присутствия. Производственные команды найдут большую пользу от синтетических голосов для создания голосов, созданных на заказ для потребностей бренда или настроенных для слушателя.

До введения ИИ технология TTS не имела важных человеческих эмоций, интонаций и способностей произношения, необходимых для рассказа полной истории в крупном масштабе и с легкостью. Теперь ИИ-поддерживаемая технология TTS предлагает более иммерсивные и доступные trải nghiệm, включая возможности реального времени и интерактивных разговорных агентов.

Достижение человеческих возможностей речи было путешествием, но теперь, когда оно достижимо, мы свидетели полного объема ИИ-голоса для создания реальной бизнес-ценности для организаций.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить WellSaid Labs.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.