У НЕЙРОСЕТЕЙ ПОЯВИЛОСЬ ЧУВСТВО ВРЕМЕНИ ⏳ При генерации видео нейросети могут создавать красивые кадры, но путаться в ск
При генерации видео нейросети могут создавать красивые кадры, но путаться в скорости происходящего. Команда Kandinsky разработала Time Adapter — лёгкую надстройку из двух блоков, которая помогает управлять временем в сгенерированном ролике.
Один блок отвечает за частоту кадров — от 15 до 60 fps. Другой — за динамику событий в сцене. Вместе они позволяют задавать темп происходящего и делать движения естественнее
При этом модуль, обученный на 40 тысяч видео, занимает меньше 1% от размера основной модели.
Как его использовать 🤔
Есть два варианта: обучать адаптер отдельно и далее подключать к модели или дообучать их вместе.
Что показали тесты 👇🏻
После совместного дообучения с адаптером модель Kandinsky 5.0 Video Lite улучшила показатели на тестовом наборе видео с людьми и природой:
🟣 Естественность движения выросла на 29%
🟣 Визуальное качество — на 8%
🟣 Соответствие текстовому запросу — на 19%
Научная статья о подходе была представлена на ведущей конференции по машинному обучению ICML.
Где пригодится Time Adapter 🤩
С ним можно генерировать ролики без артефактов движения, подбирать темп видео под музыку и монтаж. А ещё создавать физически достоверные синтетические данные для обучения физического ИИ.
👉🏻 Код доступен под лицензией MIT
👉🏻 Научная статья