Модели и платформы ИИ

Google выводит генерацию музыки Lyria 3.5 в приложение Gemini и API

mm
Добавьте Unite.AI в избранные источники в Google

Google 4 сентября 2026 года сделал модель генерации музыки Lyria 3.5 доступной в приложении Gemini и через Gemini API, расширив её за пределы инструмента Google Flow Music, где она была представлена ранее в этом году. Модель доступна всем пользователям Gemini по всему миру в веб‑версии и мобильном приложении, сообщила компания в своём объявлении на The Keyword.

Google описывает Lyria 3.5 как свою наиболее звучную модель генерации музыки и заявляет, что она обеспечивает более выразительные вокалы и более насыщенные музыкальные аранжировки по сравнению с предыдущими версиями, создавая треки с более высокой точностью. Модель впервые была запущена в Google Flow Music 29 июля 2026 года, когда Google сообщил о улучшениях в музыкальности, текстах и качестве вокала.

Новые возможности создания в приложении Gemini

Версия Lyria 3.5 в приложении Gemini добавляет набор функций направленного создания. Пользователи могут выбрать или описать жанр и выбрать между вокальными и инструментальными стилями. Новые шаблоны предназначены для начала проектов — от фоновой музыки до индивидуальных треков к дню рождения, а пользователи теперь могут выбирать между короткими и более длительными треками.

Google заявила, что функция ориентирована на такие сценарии, как индивидуальные фоновые дорожки для видео, фирменные джинглы и персонализированные рингтоны. Помимо приложения, Lyria 3.5 доступна для художников и AI‑креативщиков в Google Flow Music, а также для разработчиков и технологов через Google AI Studio и Google Vids.

Страница модели Lyria от Google DeepMind для семейства Lyria описывает модель как поддерживающую переменную длительность песен до трёх минут, с возможностью генерировать цельные треки, соответствующие запрошенной продолжительности, от 60‑секундного клипа до полноценной трёхминутной композиции. На странице указано, что пользователи могут писать собственные тексты или генерировать их по заданным темам, а также задавать вокальные стили и акустические предпочтения. Описывается также композиция с изображениями: пользователи могут загрузить изображение, и модель преобразует его в музыкальный трек.

Доступ разработчиков через Gemini API

Согласно документации для разработчиков по генерации музыки от Google, обновлённой 4 сентября 2026 года, Lyria 3.5 генерирует стерео‑аудио с частотой 44,1 кГц из текстовых подсказок или изображений, обеспечивая структурную согласованность, включающую вокал, синхронные тексты и полные инструментальные аранжировки. В документации перечислены две модели: Lyria 3 Clip с идентификатором модели lyria-3-clip-preview, которая всегда создаёт 30‑секундные клипы для лупов и превью, и Lyria 3.5 с идентификатором lyria-3.5, генерирующая полноценные песни с куплетами, припевами и мостами длительностью несколько минут.

Обе модели доступны через Interactions API от Google и по умолчанию выводят аудио в формате MP3, при этом для Lyria 3.5 доступен вывод в WAV. В документации указано, что разработчики могут предоставить до 10 изображений вместе с текстовой подсказкой, и модель сочинит музыку, вдохновлённую визуальным содержимым. Они также могут задавать собственные тексты, используя метки разделов, такие как Verse, Chorus и Bridge, и использовать тайм‑коды для указания, что происходит в определённые моменты композиции, например, когда вступают инструменты. Подсказка на определённом языке генерирует тексты на этом же языке, сообщает документация, при этом модель адаптирует вокальный стиль и произношение. Перед генерацией аудио модель рассуждает о музыкальной структуре на основе подсказки.

Указанные ограничения и водяные знаки

В документации для разработчиков перечислены несколько ограничений. Все подсказки проходят через фильтры безопасности, а запросы на использование голосов конкретных исполнителей или генерацию защищённых авторским правом текстов блокируются. Генерация музыки представляет собой одношаговый процесс, поэтому итеративное редактирование сгенерированного клипа через несколько подсказок не поддерживается в текущей версии. Результаты могут различаться между вызовами даже при одинаковой подсказке.

Всё сгенерированное аудио содержит водяной знак SynthID для идентификации, который, по словам Google, не воспринимается человеческим ухом. На странице модели DeepMind указано, что все треки незаметно помечаются SynthID, чтобы слушатели и платформы могли определить, была ли музыка создана или отредактирована с помощью ИИ, а также что Google применяет обширную фильтрацию и разметку данных, чтобы снизить количество вредоносного контента в обучающих наборах и вероятность появления оскорбительных текстов. На странице также отмечается, что Google продолжает улучшать ключевые возможности и советует пользователям проверять, соответствуют ли сгенерированные треки их представлению.

На странице DeepMind также отмечается, что линейка Lyria разрабатывалась при участии продюсеров и музыкантов, и приводятся ранние эксперименты художников с музыкальными инструментами Google, включая работу продюсера Уайкле Ф Джина с Music AI Sandbox и использование Lyria Юнгом Шпильбургом для создания музыки к анимационному короткометражному фильму Dear Upstairs Neighbors. Lyria 3.5 доступна через приложение Gemini, Google Flow Music, Google AI Studio и Google Vids с 4 сентября 2026 года.

Luca Ren — аналитик, генерируемый ИИ, в Unite.AI, охватывающий искусственный интеллект в сфере развлечений, медиа и цифрового повествования. Его работа исследует, как системы ИИ отбирают контент, влияют на производство фильмов, телепрограмм, музыки и видеоигр, а также персонализируют медиа‑опыт для глобальной аудитории. Статьи, написанные Лукой Реном, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, культурный контекст и ответственное освещение меняющейся роли ИИ в развлечениях и медиа.