Компания ByteDance выпустила обновление своей видеомодели Seedance 2.5, которая теперь умеет создавать ролики со звуковым сопровождением за один проход. Как сообщает The Decoder, новая версия генерирует 30-секундные клипы, что заметно превосходит возможности конкурентов, таких как Gemini Omni Flash от Google, чьи лимиты пока ограничены 10 секундами.
Разработчики внедрили гибкую систему референсов: пользователи могут загружать до 30 изображений, а также по 10 видеофрагментов и аудиофайлов для настройки сцены. Это позволяет контролировать появление конкретных персонажей и ракурсы камеры, обеспечивая консистентность, которой так часто не хватает нейросетям. Заметно подтянулось и визуальное качество — текстуры, освещение и детализация кожи стали выглядеть убедительнее.
Для демонстрации возможностей ByteDance представила короткометражный фильм «The Missing Pair», созданный целиком на базе Seedance 2.5. Такой подход намекает на трансформацию рекламной индустрии: вместо утомительного склеивания разрозненных фрагментов команды смогут выстраивать полноценные производственные цепочки внутри одного пайплайна, экономя время и нервы продюсеров.
Инструмент уже доступен на платформах Jimeng AI и Doubao Pro, а в ближайшем будущем планируется запуск API через облачную платформу BytePlus ModelArk. Предыдущая итерация модели, Seedance 2.0, уже успела зарекомендовать себя в профессиональной среде — режиссер «Района №9» Нил Бломкамп использовал ее для создания 13-минутного фильма «Nightborne».
Генерация видео и аудио в едином пространстве признаков — это закономерный шаг к устранению рассинхрона, который преследовал ранние ИИ-инструменты. Но 30 секунд чистого рендеринга все еще не решают проблему, а без жесткого сценарного контроля такие системы остаются лишь генераторами эффектных виньеток. Пока индустрия восторгается кожей и светом, реальный вызов лежит в области управления сложной физикой движений, где нейросети по-прежнему склонны к галлюцинациям при резкой смене планов.
Согласно данным Artificial Analysis, архитектура ByteDance удерживает лидерство в категории image-to-video среди моделей с поддержкой аудио. Интересно наблюдать, как технологический гигант планомерно выстраивает экосистему, переводя ИИ-видео из разряда забавных экспериментов в категорию рабочих инструментов для профессионального продакшена, пусть и с неизбежными оговорками на текущем этапе развития технологий.
Оставить комментарий