В обычном сервере основную работу делает CPU (англ. Central Processing Unit — центральный процессор). Он хорошо справляется с последовательными задачами: обработкой запросов, запуском программ, работой с файлами. GPU действует иначе: разбивает сложный расчет на множество операций и выполняет их одновременно. Поэтому он особенно эффективен при работе с большими массивами данных и математическими моделями, на которых строятся нейросети.

На GPU-серверах запускают большие языковые модели, системы компьютерного зрения, генераторы изображений. При обучении модель много раз обрабатывает огромные объемы данных и изменяет свои параметры. GPU ускоряет этот процесс. Затем тот же сервер может использоваться для инференса — обработки новых запросов.
Для работы большой нейросети часто требуется сразу несколько GPU. Важен не только сам ускоритель, но и объем его памяти. Если памяти не хватает, фрагменты модели распределяют между несколькими GPU или переносят часть данных в оперативную память сервера. Но даже самый производительный GPU бесполезен, если данные поступают к нему слишком медленно. Поэтому в GPU-сервере критически важны не только сами ускорители, но и их видеопамять, ее пропускная способность, процессор, сеть и скорость обмена информацией между несколькими GPU.

Мощные ускорители потребляют много энергии и выделяют немало тепла. Поэтому ИИ-кластерам требуются продуманные системы охлаждения, способные работать с высокой нагрузкой в круглосуточном режиме. В некоторых современных центрах обработки информации для этого используют жидкостное охлаждение: оно эффективнее отводит тепло от самых горячих компонентов.
В то же время сфера применения GPU-серверов не ограничена только ИИ. Ускорители также необходимы для научных расчетов, анализа данных, моделирования, создания 3D-графики, обработки видео и других задач, предусматривающих множество параллельных вычислений.
