Бенчмарк VSTAT: слепое пятно видеомоделей

Современные видеомодели уверенно описывают, что происходит в ролике, но почти не умеют следить за тем, как объект меняется со временем. Исследователи из Нью-Йоркского университета и KAIST собрали бенчмарк VSTAT, который проверяет именно это умение, и разрыв с человеком оказался огромным.
В наборе 834 видео и 1500 вопросов, причём ответ нельзя подсмотреть в одном кадре. Нужно проследить цепочку событий по всему ролику: куда сместился предмет, в каком он сейчас состоянии, что с ним сделали несколько секунд назад. Люди справляются на 90,5%, а Gemini 3.1 Pro лишь на 44,4%.
Самое любопытное в другом. Те же задачи, переписанные текстом, модели решают без проблем. Значит, дело не в логике, а в восприятии: модель видит отдельные кадры, но не складывает их в связную картину. Не вытягивают результат и агентные подходы поверх мультимодальных моделей.
Вывод для разработчиков простой: высокие баллы на обычных видеобенчмарках часто берутся за счёт догадок по кадру, а не за счёт понимания динамики. Если ваш продукт опирается на анализ видео, проверяйте модель именно на отслеживании изменений, а не на описании картинки.
Источник: https://x.com/askalphaxiv/status/2062594320885059587
Статья: https://www.alphaxiv.org/abs/2606.03920
Проект: https://vision-x-nyu.github.io/vstat-site/
