Проблема и контекст
Разработка адресует одну из ключевых практических проблем внедрения искусственного интеллекта в корпоративной среде: реальные данные необходимы для обучения, тестирования и мониторинга моделей, однако их прямое использование сопряжено с рисками раскрытия персональных сведений. Это противоречие особенно остро проявляется в корпоративных информационных системах, где данные о пользователях, сотрудниках, обучающихся и клиентах хранятся в виде связанных таблиц, идентификаторов и атрибутов.
В условиях действующего российского законодательства о персональных данных организации не могут просто передавать сырые данные во внешние или внутренние ИИ-сервисы без предварительной обработки. При этом стандартная анонимизация нередко разрушает структуру данных и снижает их аналитическую ценность — то, что делает их пригодными для задач машинного обучения. Сервис НИУ ВШЭ нацелен именно на эту точку напряжения: сохранить структуру и полезность данных, убрав из них персонально идентифицирующие атрибуты.
Архитектура и принципы работы
В основе решения — сочетание трёх компонентов: набора правил обработки, реестра замен и воспроизводимой модели обезличивания. Принципиально важное свойство системы — детерминированность: для одинаковых входных данных сервис формирует предсказуемый результат. Это требование обеспечивает повторяемость экспериментов, позволяет проверять качество данных и проводить последующий аудит обработки.
Архитектура сервиса включает раздельное хранение исходных данных и артефактов обработки, управление правилами замены, разграничение доступа, контроль целостности и ведение реестра замен. Такое разделение позволяет использовать сервис как элемент управляемого жизненного цикла данных для ИИ (data lifecycle management) — то есть встроить обезличивание не как разовую процедуру, а как регулярный этап пайплайна подготовки данных.
Решение разрабатывается с учётом требований российского законодательства о персональных данных — в частности, требований к процедурам обезличивания, которые регулируются приказами Роскомнадзора. Это делает сервис применимым там, где соответствие регуляторным требованиям является обязательным условием, а не опцией.
Текущее применение
Сейчас сервис используется в составе платформы SmartMLOps НИУ ВШЭ — внутренней MLOps-инфраструктуры университета для управления жизненным циклом машинного обучения. В этом контексте он обрабатывает данные корпоративных информационных систем вуза, включая сценарии подготовки данных для аналитики, тестирования и эксплуатации ИИ-сервисов.
За пределами университета разработка позиционируется как решение для закрытых IT-контуров организаций, работающих с чувствительными наборами данных. Целевые отрасли, которые называют разработчики: образование, медицина, промышленность, финансовый сектор и государственные организации. Все они объединены одним признаком — высокими требованиями к защите персональных данных при одновременной потребности в ИИ-инструментах.
Версия для неструктурированных данных
Параллельно команда ведёт разработку версии сервиса для неструктурированных данных — текстовых документов, обращений, договоров и иных материалов, в которых персональные данные встречаются в свободной форме, а не в столбцах таблиц. Это принципиально более сложная задача: если в таблице ФИО всегда находится в конкретном поле, то в тексте договора оно может появиться в любом месте, в разных форматах и контекстах.
Для решения этой задачи предполагается использовать комбинацию из правил, NLP-инструментов (инструментов обработки естественного языка) и моделей распознавания именованных сущностей (NER — Named Entity Recognition). Такие модели умеют выделять из текста имена, организации, адреса, номера документов и другие персональные атрибуты с учётом контекста предложения. По состоянию на момент публикации версия для неструктурированных данных находится в разработке и проходит опытную эксплуатацию.
Позиция команды и планы
«Для ИИ-проектов недостаточно просто иметь доступ к данным. Необходимо уметь безопасно готовить данные так, чтобы они сохраняли аналитическую ценность, но не раскрывали персональные сведения. Наш сервис решает именно эту инженерную задачу: он встраивает обезличивание в управляемый процесс подготовки данных для ИИ», — заявил Салех Хади, руководитель команды проекта и начальник отдела прикладных технологических решений Института искусственного интеллекта и цифровых наук ФКН НИУ ВШЭ.
Права на ключевые компоненты разработки зарегистрированы. Команда рассматривает два направления дальнейшего развития: продолжение использования сервиса как внутреннего инструмента НИУ ВШЭ и его внедрение в закрытых контурах сторонних организаций, которым требуется подготовка данных для ИИ при соблюдении требований к защите персональных данных. Конкретных партнёров или сроков коммерциализации команда пока не называет.