Сбер научил видеонейросети лучше понимать течение времени
Time Adapter управляет динамикой и частотой кадров в генерации видео© Ferra.ru
Обычные модели хорошо рисуют отдельные кадры, но плохо понимают, как должно течь время. Быстрые действия растягиваются, медленные замирают или ускоряются. К примеру, падение шарика, которое в реальности длится очень быстро, модель может растянуть на несколько секунд вместо долей. Дождь идёт рывками, бег человека выглядит неестественно.
Time Adapter — компактный модуль (меньше 1% от размера основной модели). Один блок отвечает за частоту кадров (от 15 до 60 fps), другой — за динамику сцены. Разработчики обучали модуль на 40 тысячах видео: от ходьбы и бега до тумана, волн и дождя.
Есть два режима. В первом адаптер просто подключается к готовой модели — движения становятся плавнее. Во втором модель дообучается вместе с ним — меняется и физика сцены. Дообученная Kandinsky 5.0 Video Lite показала рост естественности движения на 29%. Визуальное качество выросло на 8%, соответствие тексту — на 19%.
Исходный код опубликован на Hugging Face. Решение можно использовать в том числе в коммерческих проектах.