Лідери думок

Як використовувати генеративний AI-голос етично для бізнесу в 2023 році

mm
Додайте Unite.AI до бажаних джерел у Google

Кінець 2022 року ознаменувався широким впровадженням технологій штучного інтелекту завдяки популярності OpenAI та ChatGPT. Вперше AI здобула масову популярність, довівши свою корисність та цінність у створенні успішних бізнес-результатів.

Багато технологій AI, які здаються революційними для звичайних людей у 2023 році, вже кілька років активно використовуються великими підприємствами та медіа. Приєднуйтесь до мене, щоб я міг ретельніше розглянути технологію, що лежить в основі цих рішень, зокрема генеративні системи AI для клонування голосу, її бізнес-переваги та етичні підходи до використання AI.

Як працює клонування голосу?

У короткому вигляді, клонування голосу дозволяє однієї людині говорити голосом іншої людини.

Воно використовує технологію генеративного AI для створення записів голосу людини та використання їх для генерації нового аудіоконтенту з тим самим голосом. По суті, це дозволяє людям чути те, що хтось міг би сказати, навіть якщо вони цього не сказали.

З технічної сторони, все здається досить простим. Але якщо ви заглибитеся трохи глибше, є мінімальні вимоги для початку роботи:

  1. Вам потрібно至少 5 хвилин високоякісного запису аудіо джерельного голосу, щоб склонувати його. Ці записи повинні бути чіткими та вільними від фонового шуму або інших спотворень, оскільки будь-які недоліки можуть вплинути на точність виходу моделі.
  2. Після цього, введіть ці записи в модель генеративного AI для створення “голосового аватара”.
  3. Потім, навчіть модель точно відтворювати мовні закономірності в тоні та темпі.
  4. Як тільки це буде зроблено, ця навчена модель може генерувати необмежений контент, використовуючи джерельний голос іншої людини, ставши ефективним інструментом для створення реалістичних звучань голосу.

Це той момент, коли багато людей піднімають етичні питання. Що відбувається, коли ми можемо вставити будь-який текст у рот іншої людини, і неможливо сказати, чи ці слова справжні чи фальшиві?

Так, ця можливість вже давно стала реальністю. Як у випадку з OpenAI та ChatGPT, ми зараз стикаємося з рядом етичних питань, які не можна ігнорувати.

Етичні стандарти в AI

Як і з багатьма іншими новими технологіями на початкових етапах впровадження, основною загрозою є створення негативної стигми навколо технології, а не визнання загроз як джерела обговорення та цінних знань. Що важливо, то це викриття методів, які погані актори використовують для зловживання технологією та її продуктами, застосування засобів мінімізації, та продовжування навчання.

Сьогодні у нас є три шари рамок для етичних стандартів, пов’язаних з використанням генеративного AI. Національні та наднаціональні регуляторні шари знаходяться на початковому етапі розвитку. Світ політики може не поспішати за швидкістю розвитку нової технології, але ми вже можемо спостерігати, як ЄС веде за допомогою Європейської пропозиції щодо регулювання AI та Кодексу практики щодо дезінформації 2022 року, який викладає очікування щодо великих технологічних компаній щодо боротьби з поширенням шкідливого AI-маніпульованого контенту. На національному рівні ми бачимо перші регуляторні кроки США та Великої Британії щодо вирішення цієї проблеми з боку США Національної групи з глибоких підробок та цифрової автентичності та Великої Британії Закону про онлайн-безпеку.

Шар технологічної промисловості рухається швидше, оскільки компанії та технологи приймають цю нову реальність щодо впливу нових технологій на суспільну безпеку та приватність. Діалог щодо етики генеративного AI є яскравим і веде до розробки галузевих ініціатив щодо кодексів поведінки щодо використання генеративного AI (наприклад, Кодекс поведінки щодо синтетичних медіа) та етичних заяв, випущених різними компаніями. Питання полягає в тому, як зробити цю поведінку практичною? І чи можуть вони вплинути на продукти, конкретні функції та процедури команд?

Працюючи над цією проблемою з різними медіа-, розважальними, кібербезпековими та спільнотами етики AI, я сформулював кілька практичних принципів для роботи з контентом AI та голосами зокрема:

  1. Власники інтелектуальної власності та компанії, які використовують склонований голос, можуть уникнути багатьох потенційних ускладнень, пов’язаних з використанням оригінальних голосів, підписавши юридичні угоди.
  2. Власники проєктів повинні публічно розкрити використання склонованого голосу, щоб слухачі не були введені в оману.
  3. Компанії, які працюють над технологією AI для голосу, повинні виділити частку ресурсів на розробку технології, здатної виявляти та ідентифікувати контент, згенерований AI.
  4. Маркування контенту, згенерованого AI, водяними знаками дозволяє проводити автентифікацію голосу.
  5. Кожен провайдер послуг AI повинен переглянути кожен проєкт щодо його впливу (суспільного, бізнесового та приватного рівнів) перед погодженням на роботу над ним.

Очевидно, що принципи етики в AI не вплинуть на поширення домашніх глибоких підробок в Інтернеті. Однак вони змусять будь-які проєкти в сірій зоні вийти за межі публічного ринку.

У 2021-2022 роках голоси AI використовувалися в різних масштабних проєктах, які мали серйозні наслідки для етики та суспільства. Серед них були клонування молодого Люка Скайвокера для серіалу “Мандалорець”, голос AI для God of War 2 та голос Річарда Ніксона для історичної промови “У разі місячного катастрофного розгрому”.

Довіра до технологій зростає за межами медіа та розваг. Традиційні підприємства у багатьох галузях використовують склоновані голоси у своїх проєктах. Ось кілька найбільш відомих випадків використання.

Використання в галузях

У 2023 році клонування голосу продовжить свій розвиток разом з різними підприємствами, які готуються отримати його численні переваги. Від охорони здоров’я та маркетингу до обслуговування клієнтів та рекламної індустрії клонування голосу революціонізує спосіб, яким організації будують відносини зі своїми клієнтами та оптимізують свої робочі процеси.

Клонування голосу приносить користь медичним працівникам та соціальним працівникам, які працюють в онлайн-оточенні. Цифрові аватари з тим самим голосом, що й у медичних працівників, зміцнюють зв’язки між ними та їхніми пацієнтами, підвищуючи довіру та утримуючи клієнтів.

Потенційні застосування клонування голосу в кінематографічній та розважальній індустрії є величезними. Дублювання контенту на декілька мов, додатковий діалог для дітей та дорослих (ADR) та майже нескінченні варіанти налаштування роблять це можливим завдяки цій технології.

Аналогічно, у сфері операцій технологія клонування голосу, керованого AI, може дати excelente результати для брендів, які потребують ефективних рішень для інтерактивних систем голосової відповіді або корпоративних навчальних відео. З допомогою технології синтезу голосу актори можуть розширити свій вплив, збільшуючи можливість заробляти роялті з записів.

Нарешті, у виробництві реклами клонування голосу допомогло значно скоротити витрати та кількість годин, пов’язаних з виробництвом реклами.只要 є високоякісний запис для клонування (навіть від недоступних акторів), рекламу можна виробляти швидко та більш творчо, ніж раніше.

Цікаво, що підприємства та малий та середній бізнес можуть скористатися клонуванням голосу, щоб створити щось унікальне для своїх брендів. Великі проєкти можуть реалізувати свої найбільш амбіційні плани, а малий бізнес може отримати доступ до раніше недоступних масштабних моделей. Це і є справжня демократизація.

Підсумок

Клонування голосу AI пропонує підприємствам революційні переваги, такі як створення унікальних клієнтських trải nghiệm, інтеграція природної мови обробки в їхні продукти та послуги, та генерація дуже точних імітацій голосів, які звучать абсолютно реально.

Підприємства, які бажають зберегти свій конкурентний优势 у 2023 році, повинні звернути увагу на клонування голосу AI. Компанії можуть використовувати цю технологію, щоб розблокувати різноманітні нові можливості для отримання частки ринку та утримання клієнтів, роблячи це етично відповідальним способом.

Анна є керівником з питань етики та партнерств у Respeecher, компанії, яка володіє технологією клонування голосу, відзначеною премією Еммі, та розташована в Україні. Анна раніше працювала радником з питань політики у Reface, застосунку синтетичних медіа, що працює за допомогою штучного інтелекту, та є технічним співзасновником інструменту боротьби з дезінформацією Cappture, який фінансується програмою акселерації Startup Wise Guys. Анна має 11 років досвіду у сфері політики безпеки та оборони, технологій та будівництва стійкості. Вона раніше працювала науковим співробітником Міжнародного центру оборони та безпеки у Таллінні та Інституті прагматичних досліджень безпеки у Празі. Крім того, вона радила великим українським компаніям щодо будівництва стійкості в рамках групи з боротьби з гібридною війною у Київській школі економіки.