Путь через классические форматы
Меня зовут Егор Спирин, я руковожу лабораторией прикладных агентов (ЛаПА) в магистратуре AI Talent Hub при ИТМО.
Соревнования в IT интересовали меня давно. Сначала это был ICPC — командный чемпионат по программированию, где главное алгоритмическое мышление и скорость: ты либо решил задачу быстрее соперника, либо нет. Затем — Kaggle, где весь прогресс выражается одной метрикой на фиксированном датасете: модель либо поднимается в лидерборде, либо остаётся на месте.
Почему агентный формат — другое
В обоих случаях понятно, что именно оценивается и как улучшить результат: критерий успеха задан заранее и однозначен. Агентные соревнования устроены принципиально иначе. Здесь оценивается не ответ как таковой, а поведение системы в процессе: как агент планирует действия, использует инструменты, реагирует на неожиданные состояния среды и справляется с неопределённостью.
Это ставит перед организаторами нетривиальный вопрос: как вообще провести такое соревнование? Что именно измерять, если финальный вывод — лишь часть картины, а не вся картина целиком?
О чём эта статья
В этой статье я разбираю суть агентских соревнований и то, чем они отличаются от классических форматов. Кроме этого, делюсь личным опытом участия в двух турнирах — BitGN PAC1 и AgentBeats — и рассматриваю, как каждый из них подходит к вопросу оценки агентного поведения.