Моделі та платформи ШІ

Google представляє музичну модель AI, яка створює музику швидше, ніж відтворює

mm
Додайте Unite.AI до бажаних джерел у Google

Представьте собі: музикант сидить за комп’ютером, не складає ноти одну за одною, а керує співпрацею з AI під час живого виконання – змінює жанри, змішує інструменти та досліджує звукові території, які існують між усталеними музичними стилями. Це відбувається зараз з Google’s Magenta RealTime (RT) (GOOGL ), відкритою моделлю, яка привносить інтерактивність у режимі реального часу в генерацію музики AI.

Відразу після випуску Magenta RT змушує нас змінити спосіб мислення про музику, згенеровану AI. На відміну від попередніх моделей, які вимагали від користувачів чекати повної треки для рендерингу, Magenta RT генерує музику швидше, ніж відтворює, забезпечуючи справжню інтерактивність у режимі реального часу. Для музичної індустрії – вже боротьби з дисруптивним впливом AI – ця технологія відкриває двері до зовсім нових форм творчого вираження, одночасно піднімаючи глибокі питання про авторство, виконання та майбутнє людської музикантності.

Поняття Magenta RealTime

У своєму ядрі Magenta RT – це модель автoregresивного трансформера з 800 мільйонами параметрів, але те, що відрізняє її, – це підхід до завдання генерації у режимі реального часу. Модель генерує безперервні потоки музики у 2-секундних фрагментах, кожен з яких умовний на попередніх 10 секундах аудіових даних та динамічно налаштовуваному стилістичному вкладенні. Ця архітектура дозволяє музикантам маніпулювати стилістичним вкладенням у режимі реального часу, фактично керуючи музичним виходом, коли він розгортається.

Технічне досягнення тут не можна переоцінити. На безкоштовному рівні Google Colab TPU Magenta RT генерує 2 секунди аудіо за всього 1,25 секунди – реальний фактор у 1,6. Ця швидкість досягається завдяки декільком інноваціям:

  • Блокова автoregresія: замість генерації цілого треку одразу модель працює у малих, керованих фрагментах, які можна швидко обробити
  • SpectroStream Codec: наступник SoundStream, який дозволяє високоякісне 48kHz стерео аудіо
  • MusicCoCa Embeddings: нова спільна музично-текстова модель вкладення, яка дозволяє семантичний контроль над процесом генерації

Що робить це особливо вражаючим, так це те, що на відміну від API-орієнтованих рішень або моделей генерації у пакетному режимі, Magenta RT підтримує синтез потоку з фактором реального часу більше 1. Це означає, що модель може фактично опередити відтворення, створюючи буфер, який забезпечує гладкий, безперервний музичний потік.

Від пасивної генерації до активної діяльності

Імплікації генерації музики у режимі реального часу розширюються далеко за межі технічних специфікацій. Як зазначає команда Magenta, “Жива взаємодія вимагає більше від виконавця, але може пропонувати більше у відповідь. Безперервний цикл сприйняття-дії між людиною та моделлю забезпечує доступ до стану творчої діяльності, центруючи досвід навколо радості процесу над кінцевим продуктом.”

Ця зміна від пасивної до активної участі вирішує одну з основних критик AI-генерованого контенту: його потенційну здатність затопити ринок бездушною, масово виробленою музикою. Моделі у режимі реального часу “природно уникнуть створення потоку пасивного контенту, оскільки вони внутрішньо балансують слухання з генерацією у співвідношенні 1:1”. Кожен момент створеної музики вимагає моменту людської уваги та прийняття рішень.

Розгляньте можливості, які це відкриває:

  • Живе виконання: діджеї та електронні музиканти можуть включити AI як реактивний інструмент у свої виступи, додаючи до розширюваного інструментарію інструментів AI для музикантів, які підвищують, а не замінюють людську творчість
  • Інтерактивні інсталяції: художники можуть створювати середовища, у яких музика реагує на рух аудиторії або екологічні чинники
  • Освітні інструменти: студенти можуть досліджувати музичні концепції через негайну, осяжну зворотню зв’язок
  • Саундтреки для ігор: динамічні саундтреки, які адаптуються до дій гравця у режимі реального часу

Дисрупція та можливість

Музична індустрія стоїть на розі вулиць. Доходи у музичній індустрії очікується збільшаться на 17,2%, частково завдяки музиці, згенерованій AI, з глобальним ринком музики AI, оціненим у 2,9 мільярда доларів у 2024 році. Однак цей рост супроводжується значними проблемами з боку артистів та професіоналів індустрії.

Дослідження Goldmedia передбачає, що без належних систем компенсації музиканти можуть втратити до 27% свого доходу до 2028 року, оскільки зростає вміст, згенерований AI. Страх відчутний – чи замінять AI людських музикантів? Чи буде знижена цінність людської творчості у світі, де кожен може створювати професійно звучну музику?

Magenta RT пропонує нюансований відповідь на ці проблеми. Позиціонуючи себе як відкритий інструмент, який підвищує, а не замінює людську творчість, вона пропонує модель того, як AI та музиканти можуть співіснувати. Вимога реального часу людського вводу забезпечує те, що технологія посилює людську творчість, а не діє автономно.

Демократизація проти девальвації

Одним з найбільш значимих впливів Magenta RT є її потенційність демократизувати музичне створення. Модель розроблена для того, щоб в кінцевому підсумку працювати на споживчій апаратурі та вже функціональна на безкоштовному рівні Colab TPU. Ця доступність означає, що музиканти без дорогого обладнання чи формальної освіти можуть експериментувати з складними музичними ідеями, вступаючи до зростаючої екосистеми генераторів музики AI, які перетворюють творчі робочі процеси.

Однак ця демократизація супроводжується ризиками. Як композитор Марк Генрі Філліпс зазначає у своїх експериментах з генерацією музики AI, він підозрює, що “він скоро вже не зможе заробляти на життя як музикант, оскільки компанії почнуть використовувати цю технологію безпосередньо”. Легкість, з якою AI може створювати комерційно якісну музику, загрожує традиційним потокам доходу професійних музикантів.

Однак є інша перспектива, яку варто розглянути. Як і цифрова фотографія не ліквідувала професійних фотографів, а змінила природу їхньої роботи, генерація музики AI може змінити, а не замінити музичні кар’єри. Ключ лежить у тому, як музиканти адаптуються та інтегрують ці інструменти у свій творчий процес.

Підйом генерації музики AI у режимі реального часу також ставить нагальні етичні питання на передній план. Авторське право, володіння та справедлива компенсація залишаються спірними питаннями. 90% музикантів вважають, що компанії AI повинні запитувати дозвіл перед використанням захищеної авторським правом музики для навчання, підкреслюючи напруженість між технологічними інноваціями та художніми правами.

Відкритий підхід Magenta RT пропонує один потенційний шлях вперед. Зробивши технологію безкоштовно доступною та натренувавши її на приблизно 190 000 годинах інструментальної фонової музики з різних джерел, Google намагається обійти деякі питання щодо авторського права, одночасно створюючи здатну модель.

Обмеження моделі також відображають етичні розгляди. Хоча вона здатна генерувати невокальні вокалізації та гумання, Magenta RT не умовна на тексти пісень і малоймовірно генеруватиме фактичні слова. Це дизайнерське рішення допомагає уникнути потенційних проблем з генерацією неприйнятного ліричного контенту, одночасно фокусуючи інструмент на інструментальній композиції.

Майбутнє людської співпраці з AI у музиці

Стоячи на порозі цієї нової ери музичного створення, декілька тенденцій виділяються:

  1. Гібридні моделі створення: інструменти типу Magenta RT стають співпрацею. Недавні розробки систем відстежування ритму з нульовою затримкою та підвищеною керованості показують, як AI може синхронізуватися з людськими виконавцями у режимі реального часу.
  2. Нові парадигми виконання: концепція “виступу” з AI відкриває цілком нові художні можливості. Музиканти вчаться “грати” на цих системах як на інструментах, розвиваючи техніки для отримання конкретних звуків та навігації у прихованих музичних просторах.
  3. Освітня революція: технологія генерації музики AI революціонізувала музичну освіту, з платформами, які забезпечують інтерактивний досвід, який слухає виконання користувачів та пропонує негайну зворотню зв’язок.Технічна конвергенція: з інноваціями у нейронних аудіо кодеках та оптимізованих архітектурах інструменти типу MusicFX DJ тепер можуть передавати музику виробництва у режимі реального часу, привнося генерацію музики AI до професійних стандартів.

Приняття колаборативного майбутнього

Magenta RealTime пропонує погляд у майбутнє, де межі між людською та машинною творчістю стають дедалі більш розмитими. Вимагаючи реального часу людського вводу та фокусуючись на процесі, а не тільки на виході, вона пропонує модель AI, яка підвищує, а не замінює людську творчість.

Технологія відкритого коду та доступність на споживчій апаратурі демократизують музичне створення, одночасно забезпечуючи, що людська агентність залишається центральною у творчому процесі. Як зазначає команда Magenta, підвищення людської творчості – а не її заміна – завжди було у центрі їхньої місії.

Для музикантів, продюсерів та любителів музики повідомлення ясне: майбутнє музики лежить не у виборі між людським чи AI-творенням, а у дослідження нових творчих можливостей, які виникають, коли обидва працюють разом у режимі реального часу. Magenta RT – це запрошення переосмислити, що може бути музичне створення у добу AI.

Як ми рухаємося вперед, музична індустрія повинна займатися важливими питаннями щодо справедливої компенсації, авторського права та цінності людської творчості. Але якщо інструменти типу Magenta RT є будь-яким індикатором, майбутнє музики буде співпрацею, експериментами та новими формами вираження, яких ми тільки починаємо уявляти.

Алекс Макфарленд - журналіст та письменник з питань штучного інтелекту, який досліджує останні розробки в галузі штучного інтелекту. Він співпрацював з численними стартапами та виданнями з штучного інтелекту у світі.