Лидеры мнений

Как использовать генеративные голоса ИИ этично для бизнеса в 2023 году

mm
Добавьте Unite.AI в избранные источники в Google

Конец 2022 года ознаменовался широким внедрением технологий ИИ благодаря огромной популярности OpenAI и ChatGPT. Впервые ИИ достиг массового признания, доказав свою полезность и ценность в создании успешных бизнес-результатов.

Многие технологии ИИ, которые кажутся революционными для обычных людей в 2023 году, на самом деле уже несколько лет используются крупными бизнесами и медиа. Присоединяйтесь ко мне, и я расскажу о технологии, лежащей в основе этих решений, в частности, о генеративных системах ИИ для клонирования голоса, его бизнес-преимуществах и этических подходах к использованию ИИ.

Как работает клонирование голоса?

Вкратце, клонирование голоса позволяет одному человеку говорить голосом другого человека.

Оно использует технологию генеративного ИИ для создания записей голоса человека и использования их для генерации нового аудиоконтента с тем же голосом. По сути, это позволяет людям услышать, что сказал бы кто-то, даже если он этого не сказал.

С технической стороны, все выглядит не очень сложным. Но если вы копнете немного глубже, есть некоторые минимальные требования, чтобы начать:

  1. Вам нужно не менее 5 минут высококачественной записи аудио исходного голоса, чтобы его склонировать. Эти записи должны быть четкими и свободными от фонового шума или других искажений, поскольку любые несовершенства могут повлиять на точность вывода модели.
  2. После этого подайте эти записи в модель генеративного ИИ, чтобы создать “голосовой аватар.”
  3. Затем обучите модель точно воспроизводить закономерности речи в высоте и темпе.
  4. Как только это будет сделано, эта обученная модель сможет генерировать неограниченный контент, используя исходный голос любого другого человека, ставая эффективным инструментом для создания реалистичных звуковых реплик голосов.

Именно на этом этапе многие люди поднимают этические вопросы. Что происходит, когда мы можем вставить любой текст в уста другого человека, и невозможно определить, являются ли эти слова реальными или фальшивыми?

Да, эта возможность уже давно стала реальностью. Как в случае с OpenAI и ChatGPT, мы сейчас сталкиваемся с рядом этических проблем, которые нельзя игнорировать.

Этические стандарты в ИИ

Как и многие другие новые технологии на начальном этапе внедрения, главная угроза заключается в создании негативной стигмы вокруг технологии, а не в признании угроз в качестве источника обсуждения и ценных знаний. Что важно, так это раскрытие методов, которые злоумышленники используют для злоупотребления технологией и ее продуктами, применение инструментов смягчения и продолжение обучения. 

Сегодня у нас есть три уровня рамок для этических стандартов, связанных с использованием генеративного ИИ. Национальные и наднациональные регулирующие уровни находятся на начальном этапе разработки. Мир политики может не успевать за скоростью развития новой технологии, но мы уже можем наблюдать, как ЕС лидирует с Предложением ЕС по регулированию ИИ и Кодекс поведения 2022 года по дезинформации, который очерчивает ожидания для крупных технологических компаний по борьбе с распространением злонамеренного контента, манипулированного ИИ. На национальном уровне мы видим первые шаги в регулировании со стороны США и Великобритании в решении этой проблемы с помощью Национальной задачи по глубоким фейкам и цифровому происхождению и Законопроекта о безопасности в Интернете

Уровень технологической отрасли развивается быстрее, поскольку компании и технологи принимают эту новую реальность в отношении новых технологий и их влияния на безопасность общества и конфиденциальность. Диалог об этике генеративного ИИ живой и привел к разработке отраслевых инициатив по Кодексу поведения при использовании генеративного ИИ (например, Кодекс поведения Partnership on AI по синтетическим медиа) и этических заявлений, выпущенных различными компаниями. Вопрос в том, как сделать поведение практичным? И могут ли они повлиять на продукты, конкретные функции и процедуры команд? 

Работая над этой проблемой с различными медиа и развлекательными, кибербезопасными и сообществами этики ИИ, я сформулировал несколько практических принципов для работы с контентом и голосами ИИ в частности: 

  1. Владельцы прав интеллектуальной собственности и компании, использующие склонированный голос, могут избежать многих потенциальных осложнений, связанных с использованием оригинальных голосов, подписав юридические соглашения.
  2. Владельцы проектов должны публично раскрыть использование склонированного голоса, чтобы слушатели не были введены в заблуждение.
  3. Компании, работающие над технологией ИИ для голоса, должны выделить определенный процент ресурсов на разработку технологии, способной обнаруживать и идентифицировать контент, сгенерированный ИИ.
  4. Маркировка контента, сгенерированного ИИ, водяными знаками позволяет аутентифицировать голос.
  5. Каждый поставщик услуг ИИ должен рассмотреть каждый проект с точки зрения его влияния (общественного, делового и уровня конфиденциальности) перед согласием работать над ним.

Конечно, принципы этики в ИИ не повлияют на распространение самодельных глубоких фейков в Интернете. Однако они вытолкнут любые проекты из серой зоны за пределы публичного рынка.

В 2021-22 годах голоса ИИ использовались в различных мейнстримовых проектах, которые имели значительные последствия для этики и общества. Среди них были клонирование голоса молодого Люка Скайуокера для сериала “Мандалорец”, голос ИИ для God of War 2 и голос Ричарда Никсона для исторической речи “В случае лунной катастрофы”.

Доверие к технологиям растет не только в медиа и развлечениях. Традиционные бизнесы в различных отраслях используют склонированные голоса в своих проектах. Вот несколько наиболее заметных случаев использования.

Применение в отраслях

В 2023 году клонирование голоса продолжит свое развитие вместе с различными бизнесами, которые собираются получить его многочисленные преимущества. От здравоохранения и маркетинга до обслуживания клиентов и рекламной индустрии клонирование голоса революционизирует, как организации строят отношения с клиентами и оптимизируют свои рабочие процессы.

Клонирование голоса приносит пользу медицинским работникам и социальным работникам, работающим в онлайн-среде. Цифровые аватары с тем же голосом, что и у медицинских работников, создают более сильные связи между ними и пациентами, повышая доверие и удерживая клиентов.

Потенциальные применения клонирования голоса в кино- и развлекательной индустрии обширны. Дублирование контента на несколько языков, дополнительный диалог для детей и взрослых (ADR) и практически бесконечные варианты настройки – все это становится возможным благодаря этой технологии.

Аналогично, в операционном секторе технология клонирования голоса, основанная на ИИ, может дать отличные результаты для брендов, которым нужны эффективные решения для интерактивных систем голосового ответа или корпоративных учебных видео. С технологией синтеза голоса актеры могут расширить свою аудиторию, увеличивая возможность зарабатывать роялти от записей.

Наконец, в производственных студиях рекламы появление клонирования голоса существенно снизило затраты и количество часов, связанных с производством рекламы. Пока есть высококачественная запись для клонирования (даже от недоступных актеров), рекламу можно производить быстро и более творчески, чем когда-либо прежде.

Интересно, что предприятия и малый бизнес могут использовать клонирование голоса, чтобы создать что-то уникальное для своих брендов. Крупные проекты могут реализовать свои самые амбициозные планы, а малый бизнес может получить доступ к ранее недоступным масштабным моделям. Это и есть настоящая демократизация.

Заключение

Клонирование голоса ИИ предлагает бизнесу революционные преимущества, такие как создание уникальных впечатлений для клиентов, интеграция возможностей обработки естественного языка в продукты и услуги и генерация высокоточных имитаций голосов, которые звучат совершенно реально.

Бизнесы, стремящиеся сохранить свое конкурентное преимущество в 2023 году, должны обратить внимание на клонирование голоса ИИ. Компании могут использовать эту технологию, чтобы открыть новые возможности для завоевания доли рынка и удержания клиентов, делая это этически ответственным образом.

Анна является руководителем по этике и партнерствам в Respeecher, компании, разработавшей технологию клонирования голоса, получившую премию Эмми и базирующуюся в Украине. Анна ранее работала в качестве советника по политике в Reface, приложении для синтетических медиа, работающем на основе ИИ, и была техническим сооснователем инструмента противодействия дезинформации Cappture, финансируемого программой ускорения Startup Wise Guys. Анна имеет 11 лет опыта в области политики безопасности и обороны, технологий и построения устойчивости. Она ранее была исследовательским сотрудником Международного центра обороны и безопасности в Таллинне и Пражского института изучения безопасности. Она также консультировала крупные украинские компании по вопросам построения устойчивости в рамках группы по борьбе с гибридной войной в Киевской школе экономики.