Суть проекта
«Визирь.VLM» — визуально-языковая модель (VLM, Visual Language Model), которая объединяет возможности классической видеоаналитики и генеративного искусственного интеллекта. В отличие от традиционных систем компьютерного зрения, которые лишь фиксируют события по заранее заданным правилам, VLM способна «понимать» контекст происходящего и формулировать выводы в виде текста на естественном языке.
Система установлена в парке Малевича, расположенном в Одинцовском городском округе. Она анализирует видеопоток с камер видеонаблюдения в режиме реального времени: отслеживает посещаемость, оценивает загруженность отдельных зон, фиксирует поведенческие паттерны посетителей и формирует аналитические дашборды. Информация визуализируется в виде карт популярности локаций и графиков активности.
По словам министра государственного управления, информационных технологий и связи Московской области Надежды Куртяник, ИИ-система «не просто фиксирует события — она понимает, что видит, составляет отчёты и подсказывает, как сделать лучше». Ключевым эффектом чиновник назвала автоматизацию задач, которые прежде выполнялись вручную, сокращение неэффективных бюджетных расходов и проактивное управление инфраструктурой парка.
Технология
«Визирь.VLM» разработана группой ЦРТ в технологическом партнёрстве с Sber AI — исследовательским подразделением «Сбербанка», специализирующимся на разработке языковых и мультимодальных моделей. Платформа стала развитием линейки «Визирь» — собственного решения ЦРТ для компьютерного зрения, на базе которого компания к настоящему времени реализовала более 550 проектов на объектах спорта, транспорта, а также в масштабе городов и регионов.
Принципиальное отличие новой платформы от классических ИИ-продуктов в этой категории состоит в поддержке диалогового интерфейса. Оператор или управляющая организация может задать системе произвольный вопрос на русском языке — например, «есть ли очереди в кассовой зоне?» или «какие локации наиболее загружены в выходные?» — и получить структурированный ответ с привязкой к конкретным видеофрагментам и зонам на карте парка. Прежде подобный анализ требовал ручного просмотра записей операторами.
Генеральный директор группы ЦРТ Дмитрий Дырмовский обозначил объединение классической видеоаналитики и генеративного ИИ как «новый тренд» в отрасли. По его словам, платформа позволяет «за секунды получать информацию о состоянии территории, существенно оптимизируя городское управление».
Функциональность системы
Система решает несколько классов задач. Оперативные: поиск конкретного события в видеоархиве, выявление нарушений в массиве записей, мониторинг очередей и перемещений посетителей в реальном времени. Аналитические: формирование статистики по объектам в кадре, оценка прогресса выполнения задач персоналом, построение тепловых карт популярности зон. Управленческие: автоматическое формирование кратких рекомендаций по улучшению инфраструктуры с учётом сезонности.
Все результаты работы системы могут быть преобразованы в структурированный отчёт в произвольном формате. Это позволяет передавать данные в существующие управленческие процессы без необходимости технической интеграции на стороне заказчика.
Конечной целью внедрения ЦРТ называет возможность принимать решения об управлении территорией «на основе объективных данных»: понимать, какие зоны наиболее востребованы, где есть перегрузка инфраструктуры, а где — потенциал для развития. Ранее подобные оценки строились преимущественно на наблюдениях персонала или редких опросах посетителей.
Масштабирование
ЦРТ позиционирует парк Малевича как пилотный полигон, подтвердивший эффективность технологии, и заявляет о готовности к тиражированию решения. Дырмовский отметил, что компания «приветствует масштабирование таких решений для обеспечения нового уровня комфорта в парках, городах и регионах».
Проект вписывается в более широкую тенденцию: российские регионы последовательно расширяют применение систем компьютерного зрения в городском управлении. При этом переход от систем, работающих по жёстким правилам (детектирование конкретных объектов или событий), к моделям, способным к контекстному анализу и генерации текстовых выводов, открывает возможности для автоматизации задач, которые прежде требовали участия человека-аналитика.