Зачем это читать
Если вы технарь и работаете с инфраструктурой, то регулярно слышите слова GPU, HBM, NVLink, Tensor Cores, FP8, PCIe и тому подобное. Термины вроде знакомые, но как показывает практика, далеко не всегда люди понимают, что за ними скрывается и как одно связано с другим.
Привет! Я Евгений Зенухин, руководитель отдела развития и сопровождения физической инфраструктуры в Selectel. В этой статье я решил ответить на базовые, но очень важные вопросы о GPU, развеять некоторые мифы и показать, на что при выборе графического ускорителя нужно смотреть помимо цифр в его спецификации.
Самое главное: этот текст должен помочь лучше понимать, какое железо подбирать под конкретную задачу. Вслепую выбирать GPU по цене, объёму памяти или количеству ядер в отрыве от реальности бессмысленно.
Популярное заблуждение
С запросами в духе «а можно ли вместо одной H100 использовать 10 штук RTX 1080, ведь суммарно VRAM получается столько же?» я сталкиваюсь чаще, чем хотелось бы.
Это классический пример того, как поверхностное чтение спецификаций вводит в заблуждение. Суммарный объём VRAM — лишь одна из характеристик, и далеко не самая важная при большинстве ML- и inference-задач. Полоса пропускания памяти, межчиповое соединение, поддержка конкретных числовых форматов вроде FP8, архитектура Tensor Cores — всё это определяет реальную производительность не меньше, а часто и больше, чем гигабайты.
Что стоит за терминами
HBM (High Bandwidth Memory) — стековая память с высокой полосой пропускания, которая физически размещается рядом с вычислительным чипом. Именно она отличает серверные ускорители класса H100 от потребительских видеокарт с обычной GDDR-памятью.
NVLink — собственный высокоскоростной интерфейс NVIDIA для связи между несколькими GPU в одном узле. Его пропускная способность принципиально выше, чем у PCIe, который используется как стандартная шина соединения процессора с ускорителем. Разница становится критичной при обучении больших моделей, где данные активно перемещаются между картами.
Tensor Cores — специализированные вычислительные блоки внутри GPU, оптимизированные для матричных операций, которые лежат в основе нейросетевых вычислений. FP8, FP16, BF16 — числовые форматы с пониженной точностью, которые ускоряют inference и обучение при приемлемых потерях в точности. Поддержка конкретного формата у конкретного поколения ускорителя — не маркетинг, а инженерная деталь, влияющая на выбор железа.
Как подбирать под задачу
Главный тезис статьи: выбор GPU — это не сравнение строчек в таблице характеристик, а соответствие архитектуры ускорителя конкретному рабочему профилю. Задача inference с малым батчем и задача обучения большой языковой модели предъявляют к железу принципиально разные требования — по полосе памяти, по межузловому соединению, по поддержке числовых форматов.
Понимание того, что именно стоит за каждым термином в спецификации, позволяет не переплачивать за характеристики, которые не используются в вашем сценарии, и не экономить там, где экономия обернётся узким местом в продакшене.