Зачем потребовалось сравнение
LLM сегодня применяются повсеместно: бизнес использует их для быстрого анализа новых направлений, поиска решений типовых задач, автоматизации рутинных процессов. Параллельно растёт спрос на генерацию изображений и видео — задачи, где GPU-ускорение принципиально.
В мае 2026 года провайдер расширил линейку VDS с GPU и добавил тарифы с виртуальными видеокартами. Поскольку цена на тариф с физической картой (GPU Passthrough) и на тариф с vGPU заметно различается, у клиентов возникает закономерный вопрос: что именно теряется при выборе более дешёвого варианта?
Объекты тестирования
В качестве физического ускорителя использовался NVIDIA L40S в режиме GPU Passthrough — это означает монопольный доступ виртуальной машины к железу без какого-либо разделения ресурсов. L40S — серверная карта на архитектуре Ada Lovelace с 48 ГБ GDDR6 ECC, ориентированная на задачи инференса и рендеринга.
Виртуальная карта vGPU на 16 ГБ — срез ресурсов того же физического ускорителя, выделенный через технологию виртуализации NVIDIA vGPU. Такой подход позволяет разместить несколько арендаторов на одной карте, что снижает стоимость тарифа, но потенциально влияет на пропускную способность и задержки.
Основная цель теста — не доказать превосходство одного варианта, а количественно показать, в каких задачах разрыв критичен, а где vGPU обеспечивает сопоставимый результат.
Инструменты тестирования
Для оценки инференса LLM использовался llama.cpp — широко распространённый инструмент с открытым исходным кодом для запуска языковых моделей на CPU и GPU. Стандартный показатель: скорость генерации текста в токенах в секунду (tokens/s) при разных размерах моделей и уровнях квантизации.
Генерацию изображений тестировали через ComfyUI — модульную среду для диффузионных моделей (Stable Diffusion и аналогов), де-факто стандарт среди разработчиков локальных AI-пайплайнов для изображений. Ключевой метрикой здесь служит время генерации одного изображения при фиксированном числе шагов и разрешении.
Оба инструмента — практический выбор для независимого бенчмаркинга: они воспроизводимы, широко задокументированы и отражают реальные рабочие нагрузки клиентов, а не синтетические тесты.
Для кого актуальны результаты
Тестирование ориентировано прежде всего на клиентов, выбирающих конфигурацию под ИИ-задачи: разработчиков, запускающих собственные LLM или диффузионные модели, компании, автоматизирующие процессы с помощью нейросетей, а также исследователей, которым важна воспроизводимость результатов на облачном железе.
Результаты тестирования публикуются как открытые данные — провайдер заявляет, что они будут полезны не только действующим клиентам, но и всем, кто выбирает инфраструктуру для развёртывания ИИ-инструментов.