Что такое Dev Cluster
Dev Cluster — сервис для динамического распределения GPU-ресурсов между ML-командами внутри «Яндекса». Инструмент позволяет ML-разработчику за несколько кликов получить контейнер с нужной конфигурацией GPU для обучения модели или тестирования гипотезы — без участия инфраструктурной команды и без ручной настройки окружения.
Сервис закрывает типичную проблему крупных ML-организаций: неоптимальное использование дорогостоящих GPU-ресурсов, их простой между задачами и необходимость вручную управлять загруженностью кластера. По заявлению компании, нужные ресурсы теперь доступны за секунды.
Место в ML-платформе
Dev Cluster — один из компонентов единой ML-платформы «Яндекса», которую развивает подразделение Yandex Infrastructure. Платформа охватывает полный жизненный цикл машинного обучения: подготовку данных, создание, обучение и деплой моделей.
Yandex Infrastructure — команда, отвечающая за всю внутреннюю инфраструктуру компании: собственные дата-центры, сеть, распределённые хранилища на экзабайты данных, платформы разработки и деплоя, а также инфраструктуру для ML. Фактически любой сервис «Яндекса» опирается на ресурсы этой команды.
Декларируемая цель платформы — дать ML-инженерам возможность быстро и удобно решать задачи на всех этапах разработки модели, снизив операционную нагрузку, связанную с управлением вычислительной инфраструктурой.
Метрики и позиция команды
«Ключевая задача ML-инфраструктуры — ускорить time-to-market и предоставить бизнес-командам инструменты для удобного проведения ML-экспериментов и быстрого обучения моделей», — заявил Андрей Ривкин, руководитель ML-платформы в Yandex Infrastructure.
Одной из основных метрик команды Ривкин назвал удовлетворённость ML-инженеров инфраструктурой. По его словам, за последний год этот показатель улучшился в 2 раза. Компания не раскрывает абсолютных значений метрики и методологии её измерения.