Нейросети научили "понимать" время при генерации видео

Ученые из России создали легковесную надстройку для генеративных нейросетей, которая управляет динамикой событий и частотой кадров в видео, позволяя ИИ "понимать" течение времени при создании видеороликов. Это также откроет возможности для генерации физически достоверных синтетических данных, необходимых для обучения физического ИИ, как сообщила пресс-служба Сбербанка. Об этом рассказывает ТАСС.

Ранее скорость событий в кадре определялась только словами в запросе, и повлиять на реальную динамику видео было сложно. С новой надстройкой модель осознает, как процессы развиваются во времени, и может естественно задавать нужный ритм в любой сцене, а не просто заучивать готовые шаблоны. Это является ключевым условием для обучения физического ИИ и будущих моделей мира, отметил управляющий директор по исследованию данных Сбера Денис Димитров.

Существующие системы ИИ при генерации видео не всегда корректно передают скорость событий, что может приводить к неестественному растягиванию быстрых действий или замедлению медленных. Это связано с архитектурными особенностями моделей и тем, что при их обучении акцент делается на эстетике отдельных кадров, а не на физической достоверности.

Чтобы решить эту проблему, российские математики разработали компактный модуль, который подключается к уже существующей нейросети и состоит из двух независимых блоков: один управляет частотой кадров, а другой — динамикой событий в каждом моменте сцены. Для обучения модуля был подготовлен набор из 40 тыс. видеороликов с различной частотой и динамикой, включая как динамичные сцены с людьми, так и медленные природные процессы.

Система функционирует в двух режимах: в первом надстройка подключается к обученной модели, делая движения в создаваемом видео более плавными, не изменяя общий характер генерации. Во втором режиме разработка дообучается совместно с генеративной нейросетью, что позволяет менять не только плавность движения, но и физику сцены.

Работа надстройки была протестирована на моделях Kandinsky 5.0 Video Lite и Wan2.2. Исследования показали, что новая разработка увеличила естественность движений на 29%, улучшила визуальное качество на 8% и повысила соответствие видео текстовому запросу на 19%. Исходный код проекта доступен на популярных платформах для работы с ИИ, что позволит разработчикам и исследователям использовать это решение для своих задач.