Опубликовано 15 сентября 2026, 18:25
1 мин.

Сбер научил видеонейросети лучше понимать течение времени

Time Adapter управляет динамикой и частотой кадров в генерации видео
Команда Kandinsky из Сбера разработала Time Adapter — лёгкую надстройку к генеративным моделям видео. Модуль управляет динамикой событий и частотой кадров, делая ролики физически достовернее. Код доступен бесплатно под лицензией MIT. Соответствующая научная статья представлена на конференции ICML.
Сбер научил видеонейросети лучше понимать течение времени

© Ferra.ru

Обычные модели хорошо рисуют отдельные кадры, но плохо понимают, как должно течь время. Быстрые действия растягиваются, медленные замирают или ускоряются. К примеру, падение шарика, которое в реальности длится очень быстро, модель может растянуть на несколько секунд вместо долей. Дождь идёт рывками, бег человека выглядит неестественно.

Time Adapter — компактный модуль (меньше 1% от размера основной модели). Один блок отвечает за частоту кадров (от 15 до 60 fps), другой — за динамику сцены. Разработчики обучали модуль на 40 тысячах видео: от ходьбы и бега до тумана, волн и дождя.

Есть два режима. В первом адаптер просто подключается к готовой модели — движения становятся плавнее. Во втором модель дообучается вместе с ним — меняется и физика сцены. Дообученная Kandinsky 5.0 Video Lite показала рост естественности движения на 29%. Визуальное качество выросло на 8%, соответствие тексту — на 19%.

Исходный код опубликован на Hugging Face. Решение можно использовать в том числе в коммерческих проектах.

Источник:Пресс-релиз Сбера
  1. Ferra.ru/
  2. Новости/
  3. В России/