Оглавление

Компания Runway представила результаты своих последних исследований, направленных на превращение процесса создания ИИ-видео в управляемый «прямой эфир». Как пишет The Decoder, новая технология позволит пользователям транслировать видеопоток, изменяя его содержание буквально на лету с помощью текстовых описаний, вместо привычного ожидания рендеринга.

Современные пайплайны генерации видео обычно разделены на этапы: ввод промпта, мучительное ожидание завершения работы GPU и проверка результата, который часто требует правок. В Runway заметили, что пользователи тратят больше всего времени именно на итерации, и решили минимизировать задержку до появления первого кадра, превратив процесс в непрерывный поток данных.

Технологический фундамент проекта заложили еще в марте, а ключевую роль здесь играет GWM-1 — первая «общая модель мира» (General World Model) от Runway, представленная в конце 2025 года. Эта архитектура, опирающаяся на возможности Gen-4.5, генерирует контент покадрово, принимая в качестве управляющих сигналов не только текст, но и команды для роботов, движения камеры или аудио дорожки.

Экономика скорости и проблема накопления ошибок

Переход к генерации в реальном времени — это не только вопрос удобства интерфейса, но и жесткая экономическая необходимость. Сокращение времени работы графических процессоров (GPU) напрямую снижает себестоимость каждого кадра. Это делает рентабельными те бизнес-кейсы, которые раньше разбивались о высокую стоимость серверных мощностей.

Однако на пути к «бесконечному видео» стоит фундаментальная проблема авторегрессионных моделей. В отличие от текста, где модель может исправить логическую ошибку в следующем предложении, в видео каждый новый кадр жестко опирается на предыдущий. Малейшее искажение геометрии или артефакт на втором кадре к сотому превращается в визуальный хаос, поскольку модель «достраивает» ошибку, а не исправляет ее.

Для решения этой проблемы Runway обучает свои системы на их собственных несовершенных выводах. Это приучает нейросеть распознавать отклонения и корректировать их в динамике. Подобный подход уже применялся стартапом Decart в модели MirageLSD, а Google DeepMind с их проектом Genie 3 демонстрировали способность удерживать консистентность интерактивных миров в течение нескольких минут.

Генерация видео в реальном времени неизбежно сталкивается с проблемой «галлюцинаторного дрейфа», когда мелкие артефакты наслаиваются друг на друга, превращая сцену в цифровой сюрреализм. Решение Runway обучать модель на собственных ошибках — это костыль, хоть и высокотехнологичный. Пока аппаратные мощности не позволят пересчитывать глобальный контекст всей сцены на лету, такие системы останутся лишь эффектными симуляторами с короткой памятью, непригодными для серьезного продакшена.

От развлечений к обучению роботов

Амбиции разработчиков простираются далеко за пределы создания видеороликов для соцсетей. Интерактивные среды критически важны для образования, гейминга и, что особенно актуально, для робототехники. Оценка поведения автономного транспорта в виртуальных мирах требует мгновенной реакции среды на действия «водителя» — именно здесь генеративные модели мира становятся незаменимыми.

Подобную стратегию уже реализует Waymo, используя Waymo World Model на базе разработок DeepMind для симуляции редких дорожных ситуаций. Виртуальные беспилотники проезжают миллиарды миль в сгенерированных сценариях — от встреч с дикими животными до наводнений — прежде чем их допустят на реальные улицы. В Runway также подтвердили, что их модель, разрабатываемая совместно с Nvidia, нацелена на выдачу первого кадра менее чем за 100 миллисекунд.