Войти Позвонить мне
Новости Для профи
Абстрактная сеть узлов в лагунных тонах как символ проверки видео-моделей

Учёные проверили, помнят ли видео-модели про предметы

наукавидео-модели

Коротко

Международная группа исследователей выпустила датасет WROP на 1,5 млн примеров, чтобы проверить, понимают ли видео-модели, что предмет не исчезает навсегда, если пропал из кадра. Из 14 проверенных моделей собственная модель авторов заняла третье место в общем зачёте и первое среди моделей continuation. Задача ещё далека от решения.

Что показала проверка

Постоянство объектов, способность держать в уме предмет, который на время скрылся за другим объектом или ушёл из кадра, ребёнок осваивает ещё в младенчестве. Для генеративных видео-моделей это до сих пор сложная задача: модель может «забыть» предмет и не вернуть его в кадр правильно, когда он должен снова появиться.

Датасет WROP построен так, чтобы явно проверять именно эту способность на полутора миллионах примеров. Исследователи прогнали через него 14 моделей трёх типов: модели, которые продолжают видео по образцу (continuation), модели, которые генерируют видео по референсу, и модели редактирования видео. Собственная модель авторов, размером 16 миллиардов параметров, заняла первое место среди моделей continuation и третье место в общем зачёте, уступив только двум моделям типа reference-to-video, причём с ними результат статистически почти равный.

Подписаться на Telegram

Свежие материалы Журнала - в Telegram-канале ultiOS.

Подписаться на TelegramГотов ли ваш бизнес к ИИ-сотруднику?

Почему это важно бизнесу

Напрямую к звонкам, переписке с клиентами или записи сделок в CRM это исследование отношения не имеет: речь о фундаментальной проверке видео-моделей, а не о голосовых или текстовых диалогах. Но вывод общий для любых моделей, включая те, что ведут разговор с клиентом: даже сильная модель может ошибаться в базовой логике там, где не ожидаешь.

Именно поэтому ИИ-сотрудника нельзя принимать на веру по общим бенчмаркам: реальную проверку даёт только прогон настоящих диалогов и разбор актуальных рейтингов моделей, а не отдельная громкая цифра из презентации разработчика. Тем, кто выбирает модель для голосового или текстового ИИ-сотрудника, стоит смотреть на разбор конкретных решений для бизнеса, а не только на общие рейтинги.

Что дальше: авторы обещают открыть доступ к датасету и коду проверки, чтобы другие команды могли тестировать свои модели на том же наборе примеров.

Источники

Источник

arXiv