Проблема
Исследователи и специализированные лаборатории в сфере ИИ существенно продвинулись в оценке моделей: сегодня существуют инструменты для проверки безопасности и соответствия нормативным требованиям, выявления склонности модели к лести, анализа выравнивания и измерения общих когнитивных способностей. Однако перед компаниями и продуктовыми командами встала иная, более прикладная задача: убедиться, что их конкретная ИИ-система ведёт себя ровно так, как задумано для конкретного продукта или сервиса.
Универсальные бенчмарки с этим не справляются. Они оценивают модели в отрыве от прикладного контекста — без учёта внутренних политик компании, доступных агенту инструментов или ограничений, продиктованных конкретным сценарием использования. Именно этот разрыв и призван закрыть ASSERT.
Как работает ASSERT
ASSERT принимает на вход описания ожидаемого поведения модели и связанных политик на естественном языке — то есть разработчику не нужно вручную формализовывать требования в виде кода или специальных структур данных. Фреймворк самостоятельно структурирует эти описания в набор допустимых и недопустимых действий, после чего генерирует проблемные сценарии и тестовые случаи.
Сгенерированные тесты запускаются против целевой системы, а результаты автоматически оцениваются. Принципиально важная деталь: ASSERT фиксирует не только итоговый ответ модели, но и всю цепочку действий ИИ-системы — включая промежуточные шаги рассуждений и вызовы внешних инструментов (tool calls). Это даёт разработчикам возможность точно локализовать, на каком именно шаге произошёл сбой, а не просто констатировать, что результат оказался неверным.
При необходимости разработчик может задать дополнительный системный контекст, предоставить описание доступных инструментов и явно указать ограничения — тем самым расширяя охват и точность оценок под требования своего приложения.
Пример применения
В качестве иллюстрации Microsoft приводит ИИ-агента для работы с корпоративными документами. Разработчик задаёт три правила: агент не должен отправлять письма сотрудникам вне компании, доступ к конфиденциальным материалам должен быть ограничен уровнем топ-менеджмента, а при подготовке сводок необходимо учитывать предыдущий контекст диалога.
ASSERT на основе этих правил генерирует тестовые случаи — в том числе заведомо провокационные сценарии, призванные проверить, не нарушит ли агент политику под давлением нетипичного запроса. Сформированный набор тестов затем можно запускать как в процессе разработки, так и на уже развёрнутой системе в режиме непрерывного мониторинга, чтобы отслеживать регрессии при обновлении модели или промпта.
Позиция Microsoft
«Одно из ключевых открытий для нас состоит в том, что оценки абсолютно необходимы для принятия верных решений, — заявила Сара Бёрд, директор по продукту направления ответственного ИИ в Microsoft. — Если вы не понимаете, как ведёт себя ваша ИИ-система, очень сложно определить, соответствует ли она стандартам вашей организации».
По словам Бёрд, компания убедилась: чтобы система действительно заслуживала доверия, необходимо оценивать значительно больше параметров — специфических для каждого конкретного приложения. ASSERT применим на всём жизненном цикле продукта: на этапе разработки, при приёмке перед деплоем и в режиме непрерывного постпродакшн-мониторинга.
Контекст отрасли
Выход ASSERT происходит на фоне постепенного, но заметного сдвига в индустрии. По мере того как модели становятся мощнее и активнее используются в агентных сценариях, исследователи и организации по безопасности всё больше внимания уделяют воспроизводимому тестированию и регрессионным проверкам — то есть возможности убедиться, что обновление модели не сломало ранее работавшее поведение.
В этом направлении уже действуют несколько крупных инициатив: Стэнфорд запустил HELM (Holistic Evaluation of Language Models) — один из наиболее широко используемых академических бенчмарков; отраслевая организация MLCommons выпустила AILuminate для стандартизированной оценки безопасности; METR (организация по оценке ИИ) публикует собственные бенчмарки для измерения поведения моделей в условиях автономного выполнения задач.
Отличие ASSERT от перечисленных инструментов — в прикладной направленности: он не претендует на универсальный рейтинг моделей, а решает задачу конкретной команды, проверяющей соответствие своего продукта собственным же требованиям. Фреймворк опубликован с открытым исходным кодом.