Для обучения системы исследователи использовали массив из 40 тысяч видеороликов с разнообразными показателями частоты кадров. Модель научили различать реальную скорость событий и искусственно ускоренные или замедленные записи. В итоге получилась компактная надстройка, состоящая из двух блоков: один отвечает за частоту кадров, второй — за плавность динамики в каждой отдельной сцене. Вес модуля составляет менее 1% от объема базовой нейросети, что делает его удобным для интеграции в готовые решения.
Система поддерживает два режима работы: подключение к уже обученной модели или совместное обучение с нуля. Второй вариант позволяет нейросети осваивать сложные физические процессы, которые ранее были ей недоступны. Тесты обновленной версии Kandinsky 5.0 Video Lite показали, что естественность движений в сценах с людьми и природными явлениями возросла на 29%. По словам CTO Kandinsky Дениса Димитрова, это важный шаг к созданию полноценных моделей мира, которые не полагаются на заученные шаблоны. Технологию уже представили на конференции ICML, а исходный код опубликовали в открытом доступе по лицензии MIT.
Комментарии (0)
Пока нет комментариев. Будьте первым!