Корпорация Google расширяет возможности своего ИИ-помощника, добавляя в него инструменты для создания полноценных музыкальных композиций. Как сообщает профильное издание Android Authority, передовая модель Lyria 3.5 стала доступна пользователям внутри мобильного приложения Gemini, а также через специализированный API.

Ранее этот инструмент, представленный около месяца назад, функционировал исключительно в рамках экспериментальной площадки Google Flow Music. Теперь же доступ к генерации аудиоконтента получили не только обычные пользователи через веб-интерфейс и смартфоны, но и разработчики, работающие в Google AI Studio и Google Vids.

Обновление приносит в интерфейс Gemini функциональность, позволяющую тонко настраивать конечный результат. Пользователи теперь могут выбирать между короткими и длинными треками, а также использовать новые шаблоны для быстрого старта. Система упрощает процесс описания жанра и дает возможность четко определить, должна ли композиция содержать вокал или оставаться инструментальной.

Технологический прогресс и новые возможности управления

С технической точки зрения переход на версию 3.5 означает работу с более сложными мелодическими структурами. Инженеры Google сосредоточились на том, чтобы модель точнее следовала текстовым запросам (промптам) и лучше понимала общую архитектуру музыкального произведения, избегая хаотичных переходов, свойственных ранним итерациям нейросетевого аудио.

Особое внимание в Lyria 3.5 уделено реалистичности вокала. Разработчики заявляют о значительном улучшении произношения и эмоциональной нюансировки голоса. Это важный шаг, учитывая, что синтетическая музыка долгое время страдала от характерного «роботизированного» звучания, которое мгновенно считывается человеческим ухом.

Интеграция Lyria 3.5 в экосистему Gemini — это попытка превратить игрушку для генерации мелодий в рабочий инструмент, однако отсутствие прозрачных механизмов лицензирования обучающих данных по-прежнему оставляет профессиональных продюсеров в зоне юридической неопределенности. Технически модель демонстрирует впечатляющий прогресс в артикуляции вокала, но пока Google не решит вопрос с авторским правом на выходе, инструмент останется лишь продвинутым генератором фонового шума для соцсетей.

Для тех, кто решит опробовать новинку, процесс взаимодействия выглядит следующим образом: в окне чата Gemini достаточно описать желаемое настроение или жанр. Благодаря обновленным алгоритмам, модель теперь способна выстраивать развитие темы на протяжении всей длительности трека, что является критическим фактором для создания контента, пригодного для использования в видеороликах или презентациях.

Стоит заметить, что хотя Google и делает ставку на «эмоциональную глубину» синтезированного голоса, вопрос о том, насколько эти алгоритмы способны заменить человеческое творчество, остается открытым. Впрочем, для быстрого создания саундтрека к любительскому видео возможностей Lyria 3.5 уже более чем достаточно, что делает технологию доступной широкому кругу лиц без специальных навыков.