нейросети и наука

В России научили нейросеть прогнозировать события на видео

Исследователи МФТИ, AIRI и Университета Иннополис разработали метод, который позволяет нейросетям понимать динамику на видео и прогнозировать, что произойдет дальше. Технология нужна для «умных» роботов, работающих в логистике, на производстве и в бытовом сервисе.
Автор Наука Mail
Научная иллюстрация
Нейросеть отвечает на вопрос, у какого объекта сядет человек после того, как закроет холодильник, и она отвечает верноИсточник: mipt.ru

Исследователи Московского физико-технического института вместе с коллегами из Института AIRI и Университета Иннополис разработали метод DyGEnc, который позволяет большим языковым моделям понимать динамику на видео и прогнозировать события. Технология нужна для «умных» роботов, работающих в логистике, на производстве и в бытовом сервисе.

Традиционные системы компьютерного зрения хорошо распознают статичные объекты, но не понимают динамику: кто за кем взял предмет, в какой последовательности происходили действия или что произойдет дальше. При попытке описать длинное видео языковые модели либо «забывают» начало, либо начинают выдумывать детали.

Мы предложили метод, который назвали DyGEnc. Он сжимает происходящее на видео в специальную структуру — граф событий, где каждый объект связан с другими с помощью ребер-действий. Затем эта структура кодируется и подается в языковую модель, которая отвечает на вопросы. Общая картина собирается из отдельных кусочков
Дмитрий Юдин
заведующий лабораторией интеллектуального транспорта МФТИ-НКБ ВС

Эффективность метода проверили на международных бенчмарках. На тестах с графовой разметкой STAR (9 тыс. бытовых сцен) алгоритм правильно ответил на 99% вопросов о взаимодействиях объектов и на 97% — при прогнозировании следующего действия. На более сложной базе AGQA (2,27 млн вопросов) точность открытых ответов выросла с 54% до 93% после дообучения.

Разработчики испытали алгоритм на реальном роботе — мобильной платформе с рукой-манипулятором. Робот успешно получал задания на русском языке, например, «подъехать к столу и взять предмет», и выполнял их, анализируя видео с камер в реальном времени. Система сохраняет точность выше 90% даже при ошибках в описании сцены, шумах или замене слов синонимами. Исходный код опубликован на GitHub в открытом доступе.

Ранее Наука Mail писала о том, заменит ли нейросеть вашу профессию.