Зачем дата-центрам столько видеопамяти

Когда говорят о дата-центрах, обычно представляют огромные серверные стойки, процессоры, накопители и сетевое оборудование. Но в последние годы всё больше внимания привлекает другой компонент: видеопамять. Причём речь уже давно не идёт о привычных 8 или 16 ГБ, которые можно встретить в игровой видеокарте.

Современные ускорители для дата-центров могут иметь десятки, а в некоторых конфигурациях и сотни гигабайт памяти. На первый взгляд кажется странным, зачем серверу столько VRAM. Однако для искусственного интеллекта именно память ускорителя во многих случаях становится не менее важной, чем вычислительная мощность.

Причина проста: нейросети работают не только с вычислениями. Им нужно где-то хранить сами модели, промежуточные результаты и огромные массивы данных, с которыми GPU должен работать практически одновременно.

Зачем дата-центрам столько видеопамяти

Видеопамять нужна не только для картинки

Название VRAM создаёт ложное впечатление, будто такая память предназначена исключительно для вывода изображения. В игровом компьютере она действительно хранит текстуры, геометрию, буферы кадров и другие данные, необходимые для рендеринга.

В серверных ускорителях ситуация совершенно другая. Там GPU используется прежде всего как массивный вычислительный процессор, а память нужна для размещения данных непосредственно рядом с вычислительными блоками.

Для нейросети это особенно важно. Если необходимые данные находятся в быстрой памяти ускорителя, вычислительные блоки могут обращаться к ним с огромной скоростью. Если же приходится постоянно получать их из системной RAM или накопителя, производительность резко падает.

Именно поэтому разработчики ИИ смотрят на объём памяти ускорителя почти так же внимательно, как на количество вычислительных ядер.

Почему нейросети съедают гигабайты памяти

Большая языковая модель может содержать миллиарды параметров. Каждый параметр хранится в определённом числовом формате, поэтому уже сама модель занимает значительный объём памяти.

Но загрузить модель в VRAM недостаточно. Во время работы появляются дополнительные данные: промежуточные вычисления, состояния слоёв, кеши и другие структуры.

Особенно заметно это становится во время обучения. Модель не просто получает входные данные и выдаёт результат. Она должна вычислить ошибку, сохранить необходимые промежуточные значения и выполнить обратное распространение для изменения параметров.

В результате реальное потребление памяти может оказаться значительно выше размера самой модели.

Почему обучение требует больше памяти, чем запуск модели

При обычном использовании уже обученной нейросети задача относительно простая: загрузить модель и выполнять вычисления по мере поступления запросов.

Во время обучения ситуация гораздо тяжелее. Система должна хранить дополнительные данные, необходимые для обновления параметров. Кроме того, одновременно обрабатываются большие пакеты примеров.

Поэтому ускоритель, которого хватает для запуска модели, может оказаться совершенно недостаточным для её обучения.

Именно здесь большие объёмы HBM-памяти становятся особенно ценными.

Почему используют HBM, а не обычную память

В серверных ускорителях применяются специальные типы высокоскоростной памяти, прежде всего HBM. Она отличается от обычной видеопамяти игровых GPU не только объёмом, но и способом организации.

HBM размещается очень близко к вычислительному ускорителю и обеспечивает огромную пропускную способность. Это критично для ИИ, потому что GPU способен выполнять огромное количество операций, но ему постоянно нужны данные.

Можно представить это как завод. Даже если на производственной линии стоят тысячи мощных станков, они бесполезны, если материалы приходится доставлять к каждому станку по узкой дороге. Высокая пропускная способность памяти решает именно эту проблему.

Почему нельзя просто добавить оперативной памяти

На первый взгляд решение кажется очевидным: если модели не помещаются в VRAM, можно просто добавить серверу больше обычной RAM.

На практике это неравноценная замена.

Системная память находится дальше от GPU и обычно обладает существенно меньшей пропускной способностью. Если ускоритель вынужден постоянно обмениваться данными с RAM, его вычислительные блоки могут простаивать в ожидании.

Поэтому для ИИ важен не только общий объём доступной памяти, но и то, насколько быстро вычислительный ускоритель может получить необходимые данные.

Большая VRAM позволяет запускать более крупные модели

Объём памяти напрямую влияет на то, какие модели можно разместить на одном ускорителе.

Если модель не помещается в доступную VRAM, приходится распределять её между несколькими GPU. Это возможно, но добавляет обмен данными между ускорителями и усложняет инфраструктуру.

Чем больше памяти у одного ускорителя, тем больше работы можно выполнить внутри одной системы без постоянного обмена между несколькими устройствами.

Поэтому рост объёма HBM имеет практический смысл даже тогда, когда вычислительная мощность самого GPU практически не меняется.

Почему дата-центры используют сразу много ускорителей

Проблема заключается в масштабе современных моделей. Одна крупная модель может быть настолько большой, что даже ускорителя с огромным объёмом памяти недостаточно.

Тогда несколько GPU объединяются в единую вычислительную систему. Между ними постоянно передаются данные, а специальные высокоскоростные интерфейсы позволяют уменьшить потери производительности.

Получается своеобразная иерархия:

GPU → память ускорителя → память других GPU → оперативная память → накопитель.

Чем дальше данные находятся от вычислительных блоков, тем дороже обходится их получение с точки зрения задержки и пропускной способности.

Именно поэтому производители серверных ускорителей одновременно наращивают и вычислительную мощность, и объём HBM.

Видеопамять становится ограничивающим ресурсом

В эпоху классических вычислений производительность часто ассоциировалась прежде всего с количеством ядер и частотой процессора. Для современных ИИ-систем этого уже недостаточно.

Ускоритель может обладать огромной вычислительной мощностью, но если модели не помещаются в его память или данные поступают слишком медленно, значительная часть этой мощности останется невостребованной.

Поэтому в инфраструктуре искусственного интеллекта возникает интересный баланс. Нужно одновременно получить:

  • достаточный объём памяти;
  • высокую пропускную способность;
  • большую вычислительную производительность;
  • быстрый обмен между несколькими ускорителями.

Увеличение только одного из этих параметров не гарантирует пропорционального роста производительности.

Почему дефицит HBM становится проблемой рынка

Высокий спрос на ускорители для ИИ автоматически создаёт спрос и на HBM. Это уже не второстепенный компонент, который можно без проблем заменить обычной памятью.

Производство такой памяти технологически сложнее, а её использование тесно связано с производством самих высокопроизводительных ускорителей. Поэтому рост спроса со стороны дата-центров влияет не только на рынок GPU, но и на всю цепочку поставок памяти.

Именно здесь возникает одна из причин, почему развитие ИИ затрагивает рынок железа гораздо шире, чем кажется обычному пользователю.

Что будет дальше

Потребность в памяти, скорее всего, продолжит расти вместе с размерами моделей и объёмом задач, которые они выполняют. При этом разработчики будут искать способы уменьшить требования к памяти: использовать более компактные числовые форматы, квантование, оптимизацию кешей и другие методы.

Но это не означает, что проблема исчезнет. Если модели становятся больше быстрее, чем повышается эффективность их хранения, индустрии всё равно приходится увеличивать объём памяти на ускоритель.

В результате VRAM и HBM постепенно превращаются из технической характеристики, интересной только специалистам, в один из ключевых ресурсов всей ИИ-инфраструктуры.

Итог

Дата-центрам требуется огромное количество видеопамяти не для обработки изображения, а для вычислений. Современные нейросети работают с массивами параметров и промежуточных данных, которые необходимо держать максимально близко к вычислительным блокам.

Большой объём HBM позволяет загружать более крупные модели, обрабатывать больше данных и реже распределять вычисления между несколькими ускорителями. При этом важен не только объём памяти, но и её пропускная способность: медленная память способна свести на нет преимущества даже очень мощного GPU.

Поэтому в гонке за производительность ИИ сегодня соревнуются не только ядра ускорителей. Производители одновременно пытаются дать дата-центрам больше вычислительной мощности, больше быстрой памяти и более эффективную связь между всеми этими компонентами. И чем крупнее становятся модели, тем важнее становится вопрос, куда именно поместить все эти данные и насколько быстро их оттуда можно получить.

Написать комментарий

Ваш адрес email не будет опубликован. Обязательные поля помечены *