Материалы по тегу: hpc

09.10.2026 [19:22], Владимир Мироненко

NVIDIA Vera показал превосходство над чипами AMD и Intel в HPC-бенчмарках

Ресурс Phoronix провёл тестирование процессора NVIDIA Vera в двухсокетной конфигурации (в сумме 176 ядер и 352 потока) в ряде HPC-задач, включая OpenFOAM (CFD) и WRF, сравнив его с двухсокетными системами на базе AMD EPYC 9575F (Turin) с общим количеством 128 ядер и 256 потоков, а также системами с двумя EPYC 9755 (всего 256 ядер и 512 потоков) и двумя процессорами Intel Xeon 6980P (Granite Rapids-AP) с 256 ядрами и 512 потоками.

 Источник изображения: NVIDIA

Источник изображения: NVIDIA

Что касается оперативной памяти, то у системы NVIDIA Vera было 16 × 96 Гбайт LPDDR5x-9600 Samsung M564K6LC3CL0-CCVS7. В топовой конфигурации процессоры AMD EPYC 9575F (2P) и EPYC 9755 (2P) имели память DDR5-6400 Samsung M321R8GA0PB1-CCPKC ёмкостью 24 × 64 Гбайт, а Intel Xeon 6980P (2P) — 24 × 64Гбайт памяти MRDIMM-8800.

Особенно высокие результаты NVIDIA Vera продемонстрировал в рабочих нагрузках с интенсивной пропускной способностью, где память LPDDR5x-9600 превосходила DDR5-6400 с серверами AMD EPYC 5-го поколения или MRDIMM-8800 с процессором Intel Xeon 6. Производительность Vera ещё более впечатляет, если учесть, что 88 ядер конкурировали со 128 P-ядрами процессоров Xeon и EPYC.

 Источник изображений: Phoronix

Источник изображений: Phoronix

При анализе пиковой частоты процессора в преобладающем диапазоне высокопроизводительных вычислений выяснилось, что NVIDIA Vera, как правило, имел пиковую частоту 3,2–3,3 ГГц по сравнению с Xeon 6980P с максимальной частотой 3,9 ГГц, EPYC 9755 с частотой 4,3 ГГц и EPYC 9575F с частотой 5,0 ГГц. Ядра Olympus продемонстрировали чрезвычайно высокую производительность на такт с учётом всех факторов.

В ходе бенчмарков с фокусом на HPC, таких как как OpenFOAM CFD, WRF и т.д., энергопотребление двух процессоров NVIDIA Vera в среднем составило 842 Вт при пиковом значении в 1044 Вт, что аналогично показателю двух EPYC 9755, и немного меньше среднего энергопотребления двух EPYC 9575F. Процессоры Intel Xeon 6980P потребляли больше всего энергии, приближаяь к киловатту.

Геометрическое среднее по всем результатам тестов (Geometric Mean Of All Test Results) с формированием комплексного показателя (Result Composite) в рамках набора NVIDIA Vera HPC Benchmarks, дающее общую оценку производительности системы, отражает тот факт, что самым быстрым является решение NVIDIA Vera (2P). Как отметил Phoronix, NVIDIA Vera по-прежнему остаётся самым производительным серверным процессором на Arm64 из числа когда-либо тестировавшихся этим сайтом.

Постоянный URL: http://servernews.ru/1149678
06.10.2026 [22:44], Владимир Мироненко

NetApp представила зеттабайтную платформу храненния Novus для ИИ-фабрик с миллионами GPU

Компания NetApp представила дезагрегированную архитектуру нового поколения NetApp Novus, поддерживающую хранение данных зеттабайтного масштаба, которая позволит ИИ-фабрикам обеспечивать непрерывную подачу данных на миллионы GPU, повышая до максимума эффективность, уровень загрузки ресурсов и окупаемость инвестиций. NetApp позиционирует Novus как самую быструю на планете систему хранения.

Компания отметила, что неооблака и провайдеры GPUaaS создают ИИ-фабрики такого масштаба, на который не были рассчитаны традиционные архитектуры СХД. Это приводит к возникновению «узких мест», снижающих коэффициент использования GPU и увеличивающих затраты на инфраструктуру. При использовании традиционных архитектур загрузка GPU может падать ниже 30​%, если система не способна обеспечить подачу достаточного объёма данных для получения необходимых результатов и окупаемости вложений.

«ИИ-фабрики давно нуждались в инфраструктуре, способной масштабироваться со скоростью развития технологий ИИ», — отметил Сьям Наир (Syam Nair), директор по продуктам NetApp. По его словам, используя преимущества платформы NetApp, решение Novus обеспечивает совокупную пропускную способность 100 Тбайт/с с возможностью неограниченного горизонтального масштабирования.

 Источник изображения: NetApp

Источник изображения: NetApp

Ариндам Банерджи (Arindam Banerjee), главный архитектор платформ и технологий NetApp, пояснил, что Novus использует принцип федерации для объединения нескольких кластеров хранения в единое пространство имен, при этом пропускная способность системы растёт по мере добавления новых кластеров. Архитектура опирается на стандартные протоколы pNFS и Flex Files, что позволяет использовать стандартное ядро Linux.

Это избавляет операторов от необходимости развёртывать, обновлять и проверять проприетарные клиентские решения для тысяч образов узлов, различных поколений GPU и сред разных арендаторов. Такой подход устраняет значительный источник постоянных накладных расходов, сохраняя при этом единое пространство имен для совместной инфраструктуры ИИ. Novus переносит надёжность, безопасность и возможности многопользователького доступа платформы ONTAP в архитектуру, специально разработанную для ИИ-фабрик, говорит он.

Novus разделяет потоки метаданных и данных, позволяя каждому из них масштабироваться независимо. Банерджи отметил, что в Novus службы обработки метаданных разделены на независимо масштабируемые уровни (протоколов, состояний и каталогов). Это позволяет устранить «узкие места», возникающие при рабочих нагрузках ИИ, когда интенсивные операции чтения и записи данных сочетаются с масштабными операциями с метаданными. Серверы данных Novus будут работать под управлением ОС ONTAP, что позволит распространить на новую архитектуру уже существующие в решениях NetApp механизмы обеспечения целостности данных, отказоустойчивости, безопасности, изоляции и качества обслуживания (QoS).

 Источник изображения: NetApp

Источник изображения: NetApp

Единое пространство имен упрощает эксплуатацию. Когда данные задачи распределены по разным системам, их приходится перемещать, перемонтировать, перебалансировать, а также отслеживать каждую копию. Единое пространство имён зеттабайтного масштаба устраняет эту проблему, обеспечивая постоянную доступность наборов данных, контрольных точек и артефактов модели по мере роста среды. Архитектура Novus позволяет операторам добавлять ёмкость и повышать производительность без необходимости внесения изменений в приложения, прерывания работы или сбоев в работе клиентов. Вместо того, чтобы делать топологию хранения видимой для каждой рабочей нагрузки, Novus предоставляет единую согласованную среду данных, созданную для масштабов ИИ-фабрики.

Первые версии Novus объединяют ПО для управления метаданными NetApp Novus Data Director (работающее на сертифицированной инфраструктуре Supermicro) и сервисы обработки данных NetApp ONTAP, реализованные на базе систем AFF A90. В совокупности они формируют дезагрегированную архитектуру, рассчитанную на пропускную способность свыше 100 Тбайт/с и высокую степень загрузки сотен тысяч GPU, при этом сохраняя надёжные корпоративные сервисы обработки данных ONTAP, которым доверяют клиенты.

Как отметил ресурс Blocks​&​Files, системы ONTAP на базе платформ AFF (A800, A90 и аналогичных) поддерживают технологию GDS (GPU Direct Storage) c NFS поверх RDMA, начиная с версии ONTAP 9.12.1. Опубликованные результаты демонстрируют показатели ~171 ГиБ/с (для A800) и ~351 ГиБ/с (для кластера A90), так что Novus с запасом превзойдёт эти цифры. Решение NetApp AFX (дезагрегированная версия ONTAP для ИИ) сертифицировано для использования с NVIDIA DGX SuperPOD и прошло тестирование с технологией Magnum IO GPUDirect Storage. NetApp зафиксировала устойчивую пропускную способность 457 ГиБ/с при работе восьми узлов AFX. В документации AFX заявлена поддержка NFS/RDMA, включая технологии GPU Direct, pNFS и Session Trunking.

 Источник изображения: NetApp

Источник изображения: NetApp

По словам гендиректора NetApp Джорджа Куриана (George Kurian), благодаря пропускной способности в 100 Тбайт/с и доступу к объёму данных, превышающему 1 Збайт, в рамках единого пространства имен, NetApp Novus поможет ускорить научные исследования: например, учёные смогут в реальном времени запускать сложные симуляции и модели, а биологи — задействовать десятки тысяч компьютеров для отслеживания поведения каждой молекулы белка в клетке.

Как отметила NetApp, клиенты, внедряющие архитектуру Novus, получают следующие преимущества:

  • Максимальная эффективность использования GPU: Novus обеспечивает высокую загрузку GPU путём отделения сервисов обработки метаданных от путей передачи данных, устранения «узких мест» в системе хранения и бесперебойной подачи высокопроизводительных потоков данных в ИИ-инфраструктуру.
  • Масштабирование без фрагментации: Novus позволяет наращивать объёмы данных (включая миллиарды файлов и массивные наборы данных для ИИ) в рамках единого пространства имен. Это обеспечивает независимое масштабирование метаданных, пропускной способности и ёмкости без создания изолированных хранилищ или усложнения операционных процессов.
  • Повышение эффективности ИИ-инфраструктуры: Novus позволяет масштабировать только те ресурсы, которые необходимы для конкретной рабочей нагрузки, снижая затраты на электроэнергию, занимаемую площадь и обслуживание инфраструктуры, и одновременно сохраняя отказоустойчивость, безопасность и возможности мультиарендности, необходимые для совместного использования ИИ-сред.
Постоянный URL: http://servernews.ru/1149374
06.10.2026 [18:31], Сергей Карасёв

Bull удвоила мощности по производству суперкомпьютерных стоек во Франции

Компания Bull, выкупленная властями Франции у Atos Group за €404 млн, объявила о запуске модернизированного производственного комплекса в Анже — примерно в 300 км к юго-западу от Парижа. Мощность площадки увеличилась в два раза — с 6 до 12 суперкомпьютерных стоек в месяц, а в 2027 году объемы выпуска планируется довести до 24 единиц.

Инвестиции в проект составили €80 млн. Общая площадь завода составляет примерно 20 тыс. м2, из которых 10,7 тыс. м2 отведено непосредственно под производство. На объекте смонтированы более 3500 фотоэлектрических панелей с суммарной пиковой мощностью 1500 кВт. Используется электроэнергия из возобновляемых источников. Кроме того, реализована система рекуперации, улавливающая тепло от оборудования: в перспективе в сеть централизованного теплоснабжения планируется подавать до 5 ГВт·ч/год.

 Источник изображения: Bull

Источник изображения: Bull

По заявления Bull, модернизация позволила создать уникальный для Европы промышленный комплекс, на базе которого может выполняться широчайший спектр операций — от проектирования и сборки систем до их тестирования и интеграции. На площадке будут изготавливаться суперкомпьютеры, ИИ-оборудование, корпоративные серверы, а в дальнейшем — и квантовые решения. Запуск модернизированного завода является частью более масштабного проекта реконструкции, завершение которого запланировано на 2028 год.

Bull играет важную роль в формировании европейской сети суперкомпьютеров, на создание которой Европейский союз выделил €7 млрд в 2021–2027 годах. В частности, компания участвует в проекте второго европейского суперкомпьютера экзафлопсного класса — системы Alice Recoque. Кроме того, Bull займётся созданием европейского ИИ-суперкомпьютера LUMI-AI стоимостью €387,8 млн. В целом, компания выиграла 15 из 18 тендеров, объявленных Европейским совместным предприятием по развитию высокопроизводительных вычислений (EuroHPC JU).

Постоянный URL: http://servernews.ru/1149537
06.10.2026 [13:53], Сергей Карасёв

В Германии запущен гибридный суперкомпьютер HoreKa 2 с производительностью 33 Пфлопс

Технологический институт Карлсруэ (KIT) в Германии объявил о вводе в эксплуатацию НРС-комплекса HoreKa 2 (Hochleistungsrechner Karlsruhe 2) с гибридной архитектурой. Суперкомпьютер поможет в решении сложных научных задач в таких областях, как климатология, создание новых материалов, физика элементарных частиц, энергетика и ИИ. Система, размещённая на территории кампуса KIT Campus North в Баден-Вюртемберге на юго-западе Германии, обошлась в €17 млн.

 Источник изображения: Markus Breig/KIT

Источник изображения: Markus Breig/KIT

В составе платформы объединены более 42 тыс. процессорных ядер, 300 ускорителей и 250 Тбайт основной памяти. Заявленная пиковая производительность находится на отметке 33 Пфлопс, что примерно в два раза больше по сравнению с суперкомпьютером HoreKa первого поколения (17 Пфлопс).

В состав HoreKa 2 входят разделы HoreKa Onyx, HoreKa Blue, HoreKa Teal и HoreKa Ruby. Первый включает 164 двухпроцессорных узла на базе AMD EPYC 9655 (96 ядер) с 768 Гбайт памяти, SSD вместимостью 1,92 Тбайт и интерконнектом InfiniBand NDR 200. Сегмент HoreKa Blue представлен восемью двухсокетными узлами с чипами Intel Xeon Platinum 8368 (38 ядер), 4 Тбайт памяти, семью SSD ёмкостью 3,84 Тбайт каждый и интерконнектом InfiniBand HDR 200.

Раздел HoreKa Teal содержит 22 двухсокетных узла с процессорами AMD EPYC 9354 (32 ядра), 768 Гбайт памяти, четырьмя ускорителями NVIDIA H100, двумя SSD на 3,84 Тбайт и интерконнектом 4 × InfiniBand NDR200. Кроме того, задействован один узел с двумя чипами Intel Xeon Platinum 8568Y+ (48 ядер), 2 Тбайт памяти, восемью ускорителями NVIDIA H200 (HGX), восемью SSD вместимостью 3,84 Тбайт и интерконнектом 8 × InfiniBand NDR400. Наконец, секция HoreKa Ruby объединяет 13 узлов с двумя чипами AMD EPYC 9454 (48 ядер), 768 Гбайт памяти, четырьмя ускорителями NVIDIA HGX H200, одним SSD ёмкостью 15,36 Тбайт и интерконнектом 4 × InfiniBand NDR400.

Отмечается, что в перспективе в состав вычислительного комплекса войдёт раздел HoreKa Jade с 75 узлами на базе NVIDIA Grace, 960 Гбайт памяти, четырьмя ускорителями NVIDIA B200, SSD на 15,36 Тбайт и интерконнектом 2 × InfiniBand NDR200. На всех узлах используется платформа Red Hat Enterprise Linux (RHEL) 9.x. Применена распределённая файловая система с поддержкой параллельного доступа IBM Spectrum Scale (GPFS).

Постоянный URL: http://servernews.ru/1149515
23.09.2026 [15:54], Владимир Мироненко

SiPearl поставила первые образцы европейского серверного Arm-процессора Rhea1 для суперкомпьютера JUPITER

Французский разработчик процессоров SiPearl предоставил образцы своего первого процессора Rhea1 компании Bull, которая приступила к интеграции чипа в свою платформу BullSequana XH3000 для первого в Европе суперкомпьютера экзафлопсного класса JUPITER (Joint Undertaking Pioneer for Innovative and Transformative Exascale Research) в суперкомпьютерном центре Forschungszentrum Juelich (FZJ) в Юлихе (Jülich, Германия).

На данном этапе производятся работы по созданию процессорного блейд-модуля для JUPITER, дополняющего GPU-сегмент, что открывает возможность полноценной модульной интеграции всего комплекса. Поставка оборудования для JUPITER стала первым заказом на серверные процессоры Rhea1 для компании SiPearl. Процессор включает 80 ядер Arm Neoverse V1 (Zeus), четыре стека памяти HBM2e (64 Гбайт), а также четыре канала памяти DDR5 (2DPC). Поддерживаются 104 линии PCIe 5.0 в виде шести комплексов x16 и двух x4.

Благодаря этим ключевым характеристикам Rhea1 идеально подходит для выполнения самых ресурсоёмких HPC-задач, обеспечивая при этом безопасность без бэкдоров и «выключателей», энергоэффективность и гибкость, отмечено в пресс-релизе. Выход Rhea1 на рынок запланирован на конец 2026 года.

 Источник изображения: SiPearl

Источник изображения: SiPearl

«Благодаря высокой пропускной способности памяти этот процессор особенно хорошо подходит для приложений, которым необходим эффективный доступ к большим объёмам данных», — отметил директор Юлихского суперкомпьютерного центра Исследовательского центра Юлиха, а исполнительный директор EuroHPC JU назвал поставку образцов «важной вехой на пути к суверенитету Европы в области суперкомпьютерных технологий».

Вторая европейская система экзафлопсного уровня Alice Recoque, будет установлена в центре CEA/DAM к югу от Парижа. В ней будет использоваться процессор Rhea2. Генеральный директор и основатель SiPearl сообщил, что компания сейчас ведёт переговоры с предприятиями оборонного сектора по поводу поставок ещё одного продукта — Athena1 — специализированной версии Rhea1 для приложений двойного назначения.

Постоянный URL: http://servernews.ru/1148925
18.09.2026 [17:40], Владимир Мироненко

Вглубь и вширь: Cornelis анонсировала архитектуру Active Compute Fabric

Cornelis представила Active Compute Fabric — открытую архитектуру, охватывающую сетевые системы класса scale-up (вертикальное масштабирование) и scale-out (горизонтальное масштабирование) и включающую встроенные средства программируемых вычислений.

В настоящее время ИИ-кластеры выросли до многих тысяч GPU. Количество параметров в моделях увеличилось с миллиардов до триллионов. Однако фундаментальное поведение большинства сетей ЦОД не эволюционировало так быстро — они в основном перемещают данные из точки А в точку Б, обеспечивая максимально надёжную передачу.

Современные рабочие ИИ-нагрузки не всегда ведут себя как традиционные HPC и другие распределённые приложения. В них доминируют синхронизация, коллективные операции и зависимости, а также значительный трафик между серверами (east-west). Когда сеть не справляется с огромными требованиями к пропускной способности таких рабочих нагрузок, ускорители часто простаивают, иногда в течение длительного времени.

Проблему простоя поставщики пытаются решить преимущественно за счёт увеличения пропускной способности, а не изменения принципов работы самой сетевой инфраструктуры. «ИИ-инфраструктура достигла того этапа, когда одного лишь повышения быстродействия конечных узлов уже недостаточно. Сетевая фабрика должна стать активным компонентом вычислительной системы», — заявила Лиза Спелман (Lisa Spelman), генеральный директор Cornelis.

 Источник изображений: Cornelis Networks

Источник изображений: Cornelis Networks

Архитектура Active Compute Fabric переносит программируемые вычислительные функции непосредственно на уровень сети. Сетевая фабрика может производить манипуляции над данными прямо во время передачи: собирать данные KV-кеша для дезагрегированного инференса, координировать распределение экспертов для моделей MoE, ускорять коллективные операции, такие как AllReduce, и сжимать градиенты при передаче, разгружая вычислительные узлы, уменьшая накладные расходы на синхронизацию и отвечая за целостность передачи данных. При этом она может брать на себя новые функции по мере развития алгоритмов ИИ и ПО. Нечто похожее, например, NVIDIA начала предлагать в InfiniBand несколько поколений назад (SHARP), но, по слухам, данная функциональность особой популярностью не пользуется.

Cornelis опирается на открытые Ethernet-стандарты UALink для вертикального масштабирования и Ultra Ethernet — для горизонтального, что даёт поддержку широкого спектра ускорителей. Это важный фактор, поскольку компании всё больше диверсифицируют оборудование и технологии, используемые в своих ЦОД. Клиенты, использующие решения для ИИ, всё чаще обращаются к решениям стоечного масштаба, сталкиваясь при этом с проблемой привязки к конкретному поставщику, а Cornelis позиционирует себя как нейтральная, открытая альтернатива. Это явный кивок в сторону NVIDIA, хотя тот же UALink пока трудно назвать действительно зрелой технологией.

Видение Cornelis по поводу открытых и эффективных сетей, масштабируемых по принципу «масштабирование и расширение», разделяет Qualcomm, которая присоединилась к Cornelis на конференции AI Infra Summit. Cornelis отметила, что обе компании разделяют общее видение проблем, стоящих перед ИИ-инфраструктурой: использование пассивных сетевых архитектур, обеспечивающих лишь передачу данных, приводит к недогрузке вычислительных ускорителей, что напрямую сказывается на экономической эффективности процессов инференса. По мере перехода к созданию ИИ-систем стоечного масштаба, обе компании рассматривают сеть как ключевой элемент проектирования, а не как второстепенный компонент.

Лиза Спелман отдельно отметила в интервью CRN схожесть подходов с Qualcomm: «Мы видим много общего в отношении проблем инфраструктуры ИИ, проблем, с которыми сталкиваются клиенты, и множество возможностей и потенциала для объединения наших технологий и решения этих проблем для клиентов <…> Мы считаем, что сейчас идеальное время для выхода на этот рынок. Ещё многое предстоит решить», — сказала Спелман.

Как отметил CRN, проблема для Cornelis заключается в том, что NVIDIA более года продвигает свою собственную технологию интерконнекта NVLink Fusion как де-факто интерконнект для вертикального масштабирования. К альянсу уже присоединились Qualcomm, Arm, Marvell, Amazon, Fujitsu, Ayar, SiFive, Intel, d-Matrix и MediaTek. Это позволяет NVIDIA оставаться важнейшим поставщиком для рынка ИИ-инфраструктуры и открывает новый источник дохода.

Cornelis также объявила о привлечении финансирования в размере $205 млн. Средства будут направлены на масштабирование производства, укрепление партнёрских отношений с клиентами и ускорение реализации планов по выводу продукции на рынок. Ресурс Forbes считает, что для компании в сегменте HPC-сетей такой уровень инвестиций значителен и свидетельствует о том, что рынок считает проблему узкого места в сетевых технологиях реальной, и что Cornelis продемонстрировала достаточный прогресс благодаря текущим внедрениям в ЦОД для ИИ и HPC, чтобы оправдать дальнейшее расширение.

«Потенциал рынка сетевых решений на базе открытых стандартов для масштабирования ИИ (как вертикального, так и горизонтального) к 2030 году превысит $55 млрд. Мы убеждены, что именно сетевая инфраструктура будет определять, какая часть инвестиций в развёртывание систем ИИ принесёт реальную отдачу», — заявили в IAG Capital Partners.

Постоянный URL: http://servernews.ru/1148561
09.09.2026 [10:15], Владимир Мироненко

FP64 — это не Святой Грааль: Мацуока встал на защиту Озаки

В своей опубликованной не так давно статье Сатоши Мацуока (Satoshi Matsuoka), директор Центра вычислительной науки RIKEN в Кобе (Япония), подверг сомнению устоявшиеся представления о необходимости FP64-вычислений для HPC-задач и встал на защиту схемы Озаки II. Мацуока, по сути, утверждает, что аппаратная поддержка FP64 — не лучший способ выполнения определённых HPC-нагрузок, требующих 64-бит точности, на новых моделях ускорителей NVIDIA. В подтверждение он демонстрирует возможность использования FP8-расчётов с использованием схемы Озаки II для ускорения вычислений при сохранении той же 64-бит точности.

Используя терминологию автомобильных гонок, Мацуока говорит: прекратите использовать автомобили «Формулы-1» (FP64) для максимально быстрого перемещения по трассе HPC и замените их множеством «электровелосипедов» (FP8). Как отметил ресурс HPCwire, формат FP64 десятилетиями отвечал за производительность вычислений с плавающей запятой для приложений HPC. Исторически сложилось так, что производители CPU и GPU неизменно демонстрировали рост производительности в FP64-расчётах на протяжении поколений.

Но на рынке, движимом ИИ нового поколения, предпочтение отдаётся увеличению FP8-производительности. В то время как HPC требуют FP64, для обучения и инференса в ИИ нового поколения достаточно низкой точности расчётов. Ориентируясь на более крупный рынок, NVIDIA снизила производительность FP64 в ускорителях нового поколения (у AMD таких планов нет) и создала разрыв, который, по мнению Мацуоки, может быть заполнен «электровелосипедами» FP8. В связи с этим сообщество HPC задаётся вопросом: «Где мы будем получать производительность в формате FP64? Похоже, мы стали второсортными участниками рынка NVIDIA».

 Источник изображений: HPCwire                     Таблица 1

Источник изображений: HPCwire

Следует отметить, что по сравнению с традиционной схемой Озаки I, Озаки II обеспечивает более высокую вычислительную эффективность и лучшую масштабируемость для крупномасштабных высокоточных численных вычислений. В начале 2026 года Кацухиса Озаки (Katsuhisa Ozaki) и два других японских исследователя отметили, что исходный алгоритм Озаки II не может быть напрямую адаптирован к матричным MAC-блокам (умножение и сложение) FP8. В связи с этим они ввели квантование, которое имитирует модульную арифметику в FP8. Благодаря этому Ozaki II поддерживается Blackwell Ultra и Rubin, которые ограничили развитие INT8-производительности в пользу FP8/FP4.

В качестве аргумента Мацуоки привёл графики работы HCP-приложений на конкретных чипах. В целом, на все приложения, работающие на GPU, действует одно из двух ограничений. Первое — это пропускная способность памяти (диагональная линия в левой части графика). Второе ограничение — это пиковая скорость, с которой может работать чип (горизонтальная линия в верхней части изображения).

В точке пересечения линий пропускной способности памяти и пиковой производительности GPU получает данные с той скоростью, с которой он может их обрабатывать, что представляет собой хороший баланс между характеристиками подсистемы памяти процессора. При этом, большинство HPC-приложений ограничены пропускной способностью памяти, т.е. диагональной линией на графике. Снижение FP64-производительности резко меняет эти «пределы» для новых GPU NVIDIA.

Мацуока указал на два важных следствия этих изменений. Во-первых, ранее ограничиваемые памятью ядра (kernel) теперь упираются в вычислительные ресурсы. У B300 соотношение производительности к пропускной способности памяти находится на уровне 0,16 флопс/байт (1,3 Тфлопс/8 Тбайт/с). Во-вторых, тензорные блоки низкой точности (FP4 и FP8) при работе с типичным HPC-ядром, поддерживающим только FP64, простаивают и никак не влияют на время, затрачиваемое ядром на решение. Эта ситуация является наглядным проявлением различия между ИИ-нагрузками и HPC.

Мацуока также отметил, что несмотря на быстрое развитие алгоритмов Ozaki-I и Ozaki-II для операций GEMM (General Matrix-Matrix Multiply), все опубликованные исследования производительности сосредоточены на режиме, ограниченном вычислительными ресурсами, когда метод Ozaki наиболее очевидно в выигрыше благодаря огромному количеству тензорных блоков. Исследователь указал, что ни в одном опубликованном анализе никто не задавался вопросом: когда Ozaki-II становится выгодным для ядер, ограниченных объёмом памяти? Общепринятое мнение заключается в том, что методы EFT, в т.ч. Ozaki-I и II, не могут помочь ядрам с ограниченной пропускной способностью.

Поэтому Мацуока категорически называет нативную FP64-обработку единственным способом достижения производительности уровня HPC при использовании NVIDIA B300 и более поздних версий лишь догмой. Для обоснования своего утверждения Мацуока анализирует производительность с использованием четырех стандартных примитивов HPC:

  • GEMM (общее умножение матриц).
  • Пакетное GEMV (общее умножение матриц на векторы).
  • 7-point Stencil (метод конечных разностей).
  • SpMV (разреженное умножение матриц на векторы).

В таблице ниже приведены данные об ускорении вычислений на GPU нескольких поколения при использовании Ozaki-II в FP8-режиме относительно производительности тех же GPU в нативном режиме FP64. За базовый уровень взята производительность H100, последнего ускорителя NVIDIA, архитектура которого сбалансированна и подходит для HPC, а не исключительно для ИИ-инференса.

Мацуока утверждает, что согласно приведённым данным, схема Ozaki-II не ухудшает производительность по сравнению с базовым уровнем H100; напротив, она восстанавливает или улучшает масштабируемость для каждой рабочей нагрузки. «Ozaki-II — это не просто механизм компенсации регрессии NVIDIA в FP64; это механизм, который преобразует экономию площади кремния в <…> более быстрый FP64 с точки зрения приложения», — заявил исследователь.

AMD же повышает FP64-производительность, «поскольку метод Озаки не оправдывает ожиданий». Ранее компания указала на несколько проблем с EFT-методами. Во-первых, такое ПО не соответствует стандарту IEEE и не дает тех же результатов, что запуск кода на реальном FP-64оборудовании. Во-вторых, схема Озаки нацелена на квадратные матрицы. Если таковые в расчётах не используется, то производительность оказывается ниже, чем у нативного FP64-исполнения. В-третьих, традиционные HPC-задачи основаны на векторных расчётах, для которых методы Озаки малоэффективны — менее 10 % таких приложений охвачены матричными расчётами, позволяющими использовать EFT-методы. Но и для тех, что поддерживают такие методы, всё равно придётся переписывать код. Вместе с тем AMD не собирается отказываться от поддержки эмуляции Озаки на своих чипах в качестве резервного варианта.

В правительстве США выразили поддержку обеим концепциям. «В ходе обсуждений с Лизой Су (Lisa Su) и Дженсеном Хуангом (Jensen Huang) я убедился в их твёрдой приверженности формату FP64 и его дальнейшему развитию, — сказал ранее в интервью СМИ заместитель министра энергетики США (DoE) по науке и инновациям. «Это взаимодополняющие технологии», которые будут работать вместе, чтобы поддержать цель миссии Genesis — расширение границ в науке и технике с использованием ИИ. Следует уточнить, что он никогда прямо не заявлял о методах Озаки как о «запасном варианте» по сравнению с традиционными методами FP64 и и не объявлял об использовании эмуляции Озаки в целом.

Постоянный URL: http://servernews.ru/1143900
01.09.2026 [12:09], Сергей Карасёв

Bull займётся созданием европейского ИИ-суперкомпьютера LUMI-AI стоимостью €387,8 млн

Европейское совместное предприятие по развитию высокопроизводительных вычислений (EuroHPC JU) и консорциумом LUMI AI Factory выбрали французскую компанию Bull в качестве подрядчика для реализации проекта LUMI-AI — ИИ-суперкомпьютера стоимостью €387,8 млн. Ожидается, что этот комплекс существенно расширит возможности Европы в сфере HPC.

Система LUMI-AI расположится в IT-центре CSC в Каяани (Финляндия) рядом с действующим суперкомпьютером LUMI. Новая машина проектируется с прицелом на широкий спектр нагрузок — от обучения ИИ-моделей и инференса до масштабных научных симуляций, критически важных для поддержания прорывных исследований.

В основу суперкомпьютера LUMI-AI ляжет новейшая архитектура BullSequana XH3500 с жидкостным охлаждением. Говорится о применении 256-ядерных процессоров AMD EPYC Venice 9006 и ускорителей AMD Instinct MI430X. Платформа BullSequana XH3500 использует открытую модульную конструкцию: такой подход позволяет свободно комбинировать блоки CPU, GPU и сетевые компоненты от различных производителей. Так, в качестве технологических партнёров в рамках проекта LUMI-AI выступают IBM (отвечает за хранилище на основе Storage Scale) и Nokia (экспертиза в области сетевых технологий).

Ожидается, что LUMI-AI обеспечит десятикратный прирост производительности для нагрузок ИИ, а также почти двукратное увеличение быстродействия для HPC-задач по сравнению с существующим суперкомпьютером LUMI. Производительность последнего находится на отметке 379,7 Пфлопс. Новый вычислительный комплекс будет работать исключительно на возобновляемой энергии, соответствуя строгим экологическим стандартам. Генерируемое тепло планируется направлять в городскую систему теплоснабжения Каяани.

 Источник изображения: Bull

Источник изображения: Bull

Проект LUMI-AI финансируется на паритетных началах предприятием EuroHPC JU и консорциумом LUMI AI Factory, в который входят Финляндия, Чехия, Дания, Эстония, Норвегия и Польша. Развёртывание суперкомпьютера намечено на II половину 2027 года.

Постоянный URL: http://servernews.ru/1147758
10.08.2026 [11:21], Сергей Карасёв

Lenovo вдвое расширила предприятие в США для выпуска серверов и НРС-систем

Компания Lenovo объявила о комплексной модернизации своей производственной площадки, расположенной в Уитсетте (Северная Каролина, США). Площадь завода увеличилась в два раза, достигнув примерно 82,68 тыс. м2. Наращивание мощностей является частью комплексной программы Lenovo, направленной на формирование производственной инфраструктуры по всему миру.

Многомиллионные инвестиции в площадку в Уитсетте позволят создать около 1 тыс. новых рабочих мест и укрепить глобальную цепочку поставок. Обновлённое предприятие рассчитано на мощность в 20 МВт. Утверждается, что этого будет достаточно для удовлетворения потребностей по выпуску НРС-решений двух следующих поколений. В целом, объём изготовления продукции на этой площадке поднимется примерно на 35 %. В частности, на заводе будет организовано производство передовых систем прямого жидкостного охлаждения (DLC).

 Источник изображения: Lenovo

Источник изображения: Lenovo

Подчёркивается, что расширение площадки в Уитсетте знаменует собой следующий этап в долгосрочной стратегии Lenovo по поддержке трудовых ресурсов США и местных сообществ, а также масштабной производственной экосистемы компании. Предприятие в Северной Каролине расположено менее чем в часе езды от центра разработок Lenovo, что обеспечивает дополнительную гибкость при выводе продуктов на рынок.

Глобальная производственная сеть Lenovo включает более 30 региональных предприятий, расположенных на 11 рынках — в Аргентине, Бразилии, Китае, Венгрии, Индии, Индонезии, Японии, Мексике, Саудовской Аравии, США и Вьетнаме. Такое географическое распределение повышает устойчивость цепочек поставок, а также позволяет компании быстрее реагировать на запросы локальных клиентов.

Постоянный URL: http://servernews.ru/1146542
08.08.2026 [16:10], Сергей Карасёв

Bull и Kalray займутся разработкой сетевых технологий для ИИ и НРС

Французские компании Bull и Kalray объявили о стратегическом партнёрстве, направленном на развитие передовых сетевых технологий для инфраструктур ИИ и НРС. Стороны, в частности, намерены сотрудничать в сфере Ultra Ethernet — нового стандарта на базе Ethernet, ориентированного на современные ресурсоёмкие нагрузки.

Bull и Kalray сосредоточат усилия на разработке решений следующего поколения, отвечающих высоким требованиям производительности, масштабируемости и эффективности. Речь идёт, в частности, об интерконнекте с большой пропускной способностью и малыми задержками.

В рамках партнёрства Kalray предоставит свою сетевую платформу Kalray Networking Engine, предназначенную для работы с огромными массивами данных в составе ЦОД, инфраструктур ИИ и НРС. Эта платформа предусматривает использование 64 ядер KV5 с открытой архитектурой RISC-V. Заявленная пропускная способность достигает 1,6 Тбит/с.

В свою очередь, Bull ускорит развитие собственного интерконнекта BXI (Bull eXascale Interconnect) — это специализированная высокоскоростная сетевая архитектура для суперкомпьютеров и систем высокопроизводительных вычислений. В частности, планируется добавление в состав BXI новых функций безопасности и виртуализации, необходимых для облачных и ИИ-нагрузок. В целом, развитие BXI будет смещено в сторону стандарта Ethernet.

 Источник изображения: Bull

Источник изображения: Bull

Соглашение между Bull и Kalray предусматривает совместную разработку технологических блоков, совместимых с Ultra Ethernet, и их интеграцию в будущие поколения сетевых решений Bull. Сотрудничество, как ожидается, откроет новые возможности для OEM-производителей и поставщиков инфраструктурных решений. Помимо этого, партнёрство будет способствовать развитию отраслевых стандартов, обеспечивающих масштабируемость, совместимость и долгосрочный потенциал платформ для ИИ и НРС. Планируется, что первые решения, разработанные совместными усилиями Bull и Kalray, станут доступны для коммерческого использования в 2028 году.

Постоянный URL: http://servernews.ru/1146462