Бенчмарк VSTAT: слепое пятно видеомоделей

Современные видеомодели уверенно описывают, что происходит в ролике, но почти не умеют следить за тем, как объект меняется со временем. Исследователи из Нью-Йоркского университета и KAIST собрали бенчмарк VSTAT, который проверяет именно это умение, и разрыв с человеком оказался огромным.

В наборе 834 видео и 1500 вопросов, причём ответ нельзя подсмотреть в одном кадре. Нужно проследить цепочку событий по всему ролику: куда сместился предмет, в каком он сейчас состоянии, что с ним сделали несколько секунд назад. Люди справляются на 90,5%, а Gemini 3.1 Pro лишь на 44,4%.

Самое любопытное в другом. Те же задачи, переписанные текстом, модели решают без проблем. Значит, дело не в логике, а в восприятии: модель видит отдельные кадры, но не складывает их в связную картину. Не вытягивают результат и агентные подходы поверх мультимодальных моделей.

Вывод для разработчиков простой: высокие баллы на обычных видеобенчмарках часто берутся за счёт догадок по кадру, а не за счёт понимания динамики. Если ваш продукт опирается на анализ видео, проверяйте модель именно на отслеживании изменений, а не на описании картинки.

Источник: https://x.com/askalphaxiv/status/2062594320885059587

Статья: https://www.alphaxiv.org/abs/2606.03920

Проект: https://vision-x-nyu.github.io/vstat-site/

+1
0
+1
0
+1
0
+1
0
+1
0

Ответить

Ваш адрес email не будет опубликован. Обязательные поля помечены *