Cerebras представила ИИ-стойки CS-4 с тремя разогнанными царь-ускорителями WSE-3 Turbo

 

Компания Cerebras Systems анонсировала мощные ИИ-ускорители WSE-3 Turbo и стоечную систему на их основе CS-4. Утверждается, что это решение обеспечивает выигрыш в производительности на задачах инференса до 30 раз по сравнению с платформами на базе современных GPU.

Как и оригинальное изделие WSE-3 (Wafer Scale Engine), ускоритель WSE-3 Turbo содержит 4 трлн транзисторов, 900 тыс. ядер и 44 Гбайт памяти SRAM. При производстве по-прежнему применяется 5-нм техпроцесс TSMC, а площадь кремниевой пластины сохранилась на отметке 46 225 мм2. При этом пропускная способность памяти поднялась с 21,6 до 43,2 Пбайт/с, а подсистемы ввода-вывода — с 1,2 до 2,4 Тбит/с.

 Источник изображений: Cerebras

Источник изображений: Cerebras

Производительность в разреженных FP16-вычислениях выросла вдвое — со 125 до 250 Пфлопс, на обычных FP16-операциях — с 12,5 до 25 Пфлопс. Показатель TDP на уровне пластины оценивается в 33 кВт против 15 кВт у WSE-3, на уровне узла — 46 кВт против 23 кВт, а на уровне всей стойки CS-4 — порядка 120–140 кВт. По-видимому, компания просто подняла рабочие частоты — ориентировочно с 1,4 ГГц до 2,8 ГГц.

ИИ-стойка CS-4 выполнена на модульной архитектуре Nexus. Система разделена на три ключевых блока: это вычислительный узел Wafer-Scale Backpack, подсистема питания и IO-подсистема. Такая архитектура упрощает производство, развёртывание, обслуживание и обновление. Отмечается, что Cerebras полностью переосмыслила концепцию ИИ-сервера. В общей сложности в составе CS-4 задействованы три узла Wafer-Scale Backpack, каждый из которых представляет собой автономную сборку с ускорителем, преобразователем питания, прямым жидкостным охлаждением, компонентами высокоскоростного ввода-вывода и управляющей электроникой.

Питание подводится вплотную к чипам (всего около 0,5 мм против 50 мм в традиционных платах с GPU), что почти полностью исключает потери на уровне платы и позволяет подавать больше мощности, повышая частоту работы и скорость генерации токенов. Специальный IO-модуль позволяет соединять пластины WSE-3 Turbo внутри стойки и между стойками без коммутатора: в результате заявленная задержка передачи данных между пластинами находится на уровне всего 2 мкс. Общее быстродействие достигает 750 Пфлопс в разреженных FP16-вычислениях.

В целом, новинка обеспечивает высочайшую производительность. В качестве примера приводится тест на модели GPT-OSS-120B, где система CS-4 показала результат более 4400 токенов в секунду на одного пользователя. Для сравнения, «наиболее производительный на сегодняшний день сервис ИИ-инференса на базе GPU» демонстрирует показатель в 350 токенов в секунду. Утверждается также, что CS-4 выдаёт свыше 1000 токенов в секунду на моделях с более чем 10 трлн параметров. Поставки системы планируется организовать в текущем квартале.

Если вы заметили ошибку — выделите ее мышью и нажмите CTRL+ENTER. | Можете написать лучше? Мы всегда рады новым авторам.

Источник:

Постоянный URL: https://servernews.ru/1147059

Комментарии