Материалы по тегу: энергоэффективность

17.09.2026 [22:06], Руслан Авдеев

NVIDIA, Google и Emerald AI создают альянс для развития ИИ ЦОД с гибким энергопотреблением — больше всех выиграет NVIDIA

Компании NVIDIA, Google и Emerald AI анонсировали создание объединения AI Energy Management Alliance (AEMA). Оно должно ускорить развитие ИИ ЦОД, готовых оптимизировать и корректировать своё энергопотребление в соответствии с текущим состоянием энергосистем. ИИ ЦОД будут взаимодействовать с сетями, при необходимости меняя нагрузку. NVIDIA полагает, что это поможет в ускоренном режиме подключать новые мощности, повысить надёжность энергосистем и эффективнее использовать доступную инфраструктуру.

Как сообщает NVIDIA, обычные процедуры присоединения к сетям предполагают снабжение объектов с довольно стабильным энергопотреблением, но ИИ ЦОД к ним не относятся. При этом их вычислительные нагрузки можно будет произвольно менять, перенося вычисления, использовать системы накопления энергии, реагировать на инциденты в энергосистеме и др. Это позволит эффективнее использовать имеющиеся мощности электросетей, снижать энергопотребление во время пиковых нагрузок на энергосистему и даже откладывать затратную модернизацию инфраструктуры. Кроме того, более безопасным и быстрым становится подключение к сетям крупных ИИ ЦОД.

При этом эксперты The Register обращают внимание на ограничения, касающиеся самой NVIDIA. Компания сможет продавать всё больше ИИ-ускорителей только в случае, если дата-центры будут получать достаточно энергии. В результате NVIDIA стремится «выжать» максимум из каждого доступного гигаватта. Например, обычный ЦОД на 100 МВт оставляет в резерве до 20 % мощности для компенсации неэффективности оборудования, потерь при преобразовании энергии и скачков потребления.

 Источник изображения: NVIDIA

Источник изображения: NVIDIA

Одно из решений — платформа DSX MaxLPS, позволяющая использовать больше ИИ-ускорителей в рамках заданного «энергетического бюджета». Она координирует работу вычислительной и физической инфраструктуры, элементы которой могут обмениваться данными о работе друг друга, снижая энергопотребление в зависимости, например, от фактической загрузки серверов, без постоянной работы на максимальной мощности. API DSX Exchange также позволяют работать с совместимыми компонентами стороннего производства, в т.ч. оборудования Vertiv и Schneider Electric.

DSX Flex непосредственно обеспечивает взаимодействие ЦОД и энергосистемы. NVIDIA, Emerald AI и Silicon Valley Power продемонстрировали способность временно высвобождать некоторые мощности ЦОД при росте нагрузок на электросети без остановки критически важных вычислений. Аналогичный эксперимент успешно провели National Grid, Emerald AI и Nebius. На уровне стоек NVIDIA и Lambda уже показали, что подобная умная координация позволяет уместить в пределах заданного энергетического бюджета больше вычислительных модулей — 19 вместо обычных 16, при этом производительность на ватт выросла приблизительно на четверть.

Формально ничего принципиального нового в предложенной технологии нет. Ещё в 2023 году Google тестировала систему перепаспределения нагрузок в ЦОД в часы пик. То же делала и Microsoft, но в обоих случаях речь шла о переносе обработки несрочных фоновых задач во времени или между дата-центрами. В 2026 году Google модернизировала управление питанием своих ЦОД в США, добавив возможность более гибко регулировать их энергопотребление, которая подкреплена контрактами с несколькими энергокомпаниями.

 Источник изображения: NVIDIA

Источник изображения: NVIDIA

NVIDIA намерена интегрировать подобную возможность в инфраструктуру ИИ ЦОД по умолчанию. Для компании смысл не только в снижении нагрузки на энергосеть, но и в оптимизации контактов с энергокомпаниями. Предполагается, что они смогут в упрощённом порядке разрешать подключение новых мощностей, если будут знать, что часть нагрузки можно быстро отключить. Впрочем, полную остановку работы ЦОД это не предусматривает, поскольку критически важные задачи будут выполняться, а второстепенные нагрузки приостановить или перенести в другие ЦОД.

Альянс AEMA должен дополнить технологические решения разработкой общих правил взаимодействия ИИ ЦОД с энергосистемами, в том числе вопросы регулирования энергопотребления и реагирования на аварийные ситуации. Также предполагается стандартизировать технические требования, показатели эффективности и обмен эксплуатационными данными.

AEMA позиционируется как технологически нейтральная инициатива, поскольку требования будет определять не использование того или иного конкретного оборудования или ПО, а измеряемые характеристики ЦОД — от скорости реакции на чрезвычайные ситуации до предсказуемости и продолжительности доступного сокращения нагрузки. Если объект способен подтвердить «гибкость», для него могут создать более простые и быстрые процедуры подключения к электросетям с учётом фактических рисков и преимуществ для энергосистемы.

Постоянный URL: http://servernews.ru/1148632
01.06.2026 [10:00], Руслан Авдеев

Ampere Computing: экстремальная жара в мире потребует больше энергии, повышения эффективности вычислений и сокращения количества ЦОД

Наступившее лето обещает быть чрезвычайно жарким, похожим на прошлогоднее, когда среднемировая температура достигла исторического максимума. Жара и засухи вынуждают индустрию и власти принимать трудные решения на фоне растущего расширения ЦОД, сообщил директор по продуктам Ampere Computing Джефф Виттич (Jeff Wittich).

Согласно прогнозу AccuWeather на 2026 год, счета за электричество могут взлететь текущим летом из-за вероятной повсеместной жары по всей территории США. По оценкам отвечающей за надёжность электроснабжения в стране North American Electric Reliability Corporation, летний пиковый спрос на энергию вырастет на 224 ГВт за следующие 10 лет. Это более чем на 69 % выше прогноза 2024 года и на 24 % — пикового спроса 2025-го.

В первую очередь ожидаемый рост спроса обусловлен потреблением электричества новыми ЦОД. В 2023 году в США дата-центры потребляли 4,4 % всей электроэнергии, а к 2028 году будут потреблять 12 %. Из-за роста спроса на электричество многим странам пришлось ужесточить правила для снижения нагрузки на энергосистемы и население. Во многом проблема в том, что энергосистемы не справляются с колебаниями энергопотребления в связи с экстремальной погодой. В июле прошлого года сообщалось, что аномальная жара привела к сбоям в лондонских дата-центрах Google и Oracle. Более того, согласно исследованию Rest of World, около 80 % всех дата-центров в мире построены в не особенно подходящих для них климатических условиях.

Так, в 2025 году в США было внесено более 200 законопроектов, направленных на регулирование работы ЦОД, и по меньшей мере в 18 штатах предложены специальные тарифы для крупных потребителей электричества, а в Мэне предпринята пока не увенчавшаяся успехом попытка вовсе запретить строительство новых ЦОД. В некоторых законопроектах от желающих строить ЦОД требуют инвестиций в модернизацию инфраструктуры и обеспечение преимуществ для рядовых потребителей энергии.

 Источник изображения: Ant Rozetsky/unsplash.com

Источник изображения: Ant Rozetsky/unsplash.com

В 2025 году в Амстердаме продлили мораторий на строительство новых ЦОД и расширение в столичном муниципалитете уже действующих. Приоритет отдан жилью, а новые дата-центры появятся не раньше 2030 года. Во Франкфурте на ЦОД приходится до 40 % от всего потребления городской агломерации, что создаёт непосильную нагрузку местной энергосистеме. В некоторых районах введены временные моратории на подключение новых «индустриальных» объектов, строительство новых не ожидают до II квартала 2027 года.

В условиях развития ИИ-проектов дефицит ресурсов будет всё ощутимее. Поддержать этот рост без ущерба окружающей среде можно, повысив эффективность вычислений каждого отдельного ЦОД. Это позволит строить меньше дата-центров для удовлетворения спроса на вычисления или уменьшать их сами по себе, чтобы снизить энергопотребление. Кроме того, потребуется модернизация систем охлаждения. Пока же бум ИИ подталкивает отрасль к экстенсивному развитию, тогда как необходимо максимизировать реальную производительность не только на уровне чипов, но и на остальных уровнях тоже.

Для этого необходимы более энергоэффективные чипы, чем сейчас. Виттич подчёркивает, что мощные ИИ-ускорители на основе GPU стоит использовать только там, где это действительно необходимо. Если для обучения и масштабного инференса без них не обойтись, то для многих других задач они избыточны. Оптимизируя вычисления для каждой задачи, следует использовать энергоёмкую инфраструктуру только там, где это действительно необходимо.

 Источник изображения: Peter Herrmann/unsplash.com

Источник изображения: Peter Herrmann/unsplash.com

Более эффективные системы охлаждения необходимо использовать независимо от снижения энергопотребления. При этом рекомендуется сочетать разные варианты охлаждения. Например, жидкостное всё чаще используется с энергоёмким ИИ-оборудованием. К сожалению для операторов ЦОД, модернизация систем охлаждения требует серьёзного изменения инфраструктуры, а на старых объектах модернизация сложна и дорога или вовсе невозможна. В существующих ЦОД нередко выгоднее использовать маломощные чипы с воздушным охлаждениями, размещая новые компоненты только там, где они действительно нужны.

Фактически это означает переосмысление вычислительных архитектур для получения максимальной производительности на ватт за счёт использования современных чипов. Кроме того, придётся перераспределить рабочие нагрузки и проектировать системы, в которых производительность соответствует требованиям к допустимому тепловыделению и энергосбережению. В конечном итоге, чем больше вычислительных возможностей можно «извлечь» из каждого Вт и м2, тем меньше ЦОД нужно будет строить в будущем. Чем меньше ЦОД придётся строить, тем ниже нагрузка на водные и энергетические ресурсы в конкретных локациях.

По словам представителя Ampere, для удовлетворения растущих энергетических потребностей потребуется не просто расширять инфраструктуру, но и оптимизировать её, начиная с вычислительных мощностей. И хотя Виттич прямо об этом не говорит, Ampere видит себя как раз-таки поставщиком энергоэффективных чипов, в том числе CPU для инференса. Однако на практике компания задержала выпуск AmpereOne M, была продана SoftBank и рискует лишиться одного из крупнейших заказчиков в лице Oracle, которая весьма заинтересована в NVIDIA Vera. Ей же приходится конкурировать с собственными Arm-процессорами AWS, Google, Microsoft и Alibaba, а также теперь уже и с самой Arm, Fujitsu и Qualcomm.

Постоянный URL: http://servernews.ru/1142682
05.03.2026 [09:36], Руслан Авдеев

National Grid и Emerald AI успешно умерили энергетические аппетиты британского ИИ ЦОД Nebius

Ведущий оператор электросетей Великобритании National Grid провёл первое в стране испытание «гибкой» системы электроснабжения дата-центров при участии Nebius и с использованием ИИ-системы управления нагрузками и питанием Emerald AI. По данным Computer Weekly, эксперимент проходил с использованием кластера из 96 ускорителей NVIDIA Blackwell Ultra.

В декабре 2025 года в течение пяти дней были проведены более 200 симуляций «сетевых событий» для проверки способности ПО Emerald динамически оптимизировать энергопотребление дата-центра. Платформа Emerald AI смогла подогнать энергопотребление к заданному уровню, сократить спрос на энергию до −40 % и сохранить исполнение критических нагрузок в нормальном режиме.

Система успешно реагировала на скачки спроса в энергосети в перерывах во время футбольных матчей, справилась с запросом на понижение энергопотребления продолжительностью до 10 часов и отработала резкое снижение потребление (30 %) — всё для сохранения стабильности работы энергосети. По оценкам исследователей, при таком подходе ИИ ЦОД по запросу могут «высвобождать» для энергосети до 2 ГВт. Если дата-центры перестанут быть просто крупными потребителями энергии и будут «вовлечены» в работу энергосети, это позволит лучше использовать существующую инфраструктуру и поддержит подключение к сети различных источников.

 Источник изображения: Toolmash Expo/unsplash.com

Источник изображения: Toolmash Expo/unsplash.com

По словам National Grid Partners, большинство энергосистем используют, вероятно, 30 % от имеющейся мощности в течение года, а пиковые нагрузки случаются довольно редко. Если присоединённые объекты могут быстро и контролируемо снижать энергопотребление по запросу энергосети, сетевому оператору не нужно будет наращивать мощности.

По словам Emerald AI, эксперимент показал способность ИИ-оборудования ЦОД Nebius гибко регулировать энергопотребление в любой момент времени. Даже после получения сигнала среди ночи удалось за 30 с снизить энергопотребление более чем на треть. Система отлично подходит при питании от источников возобновляемой энергии. Например, когда ветра мало в течение восьми часов, дата-центр может снизить потребление, на 100 % сохрание питание критически важных вычислительных нагрузок.

По словам Emerald AI, есть три основных способа добиться «гибкости» энергопотребления для ИИ-задач. Во-первых, можно замедлить некоторые процессы или приостановить их. Напрмиер, тонкую настройку модели обычно можно отложить на час. Во-вторых, можно перемещать рабочие нагрузки. Так, компания уже протестировала перенос генерации ответа ИИ из одного ЦОД Oracle в другой, что вызвало не такую критичную для данной нагрузки задержку примерно в 10 мс. На самом деле гиперскейлеры, включая Google и Microsoft, уже давно используют перемещение нагрузок между регионами, хотя и не с такой скоростью и с другими целями.

В-третьих, можно организовать мониторинг работы ЦОД. В этом случае Emerald AI управляет рабочими нагрузками с помощью ИИ, расставляя для них приоритеты. Это оптимальный способ обеспечить энергосистеме необходимые ресурсы, при этом сохраняя для пользователя целостность рабочих нагрузок, говорит компания.

Постоянный URL: http://servernews.ru/1137778
02.02.2026 [23:44], Андрей Крупин

Экология в приоритете: проект энергоэффективного ЦОД МТС получил прописку в федеральном реестре углеродных единиц

Компания «Мобильные ТелеСистемы» сообщила о регистрации проекта «Строительство ЦОД с энергоэффективной системой охлаждения на площадке ПАО "МТС"» в российском национальном реестре углеродных единиц.

 Источник изображения: МТС

Источник изображения: МТС

Проект энергоэффективного дата-центра реализован МТС на территории модульного ЦОД в Тосненском районе Ленинградской области. В основе проектного решения лежит использование энергоэффективной адиабатической системы охлаждения для сокращения показателей удельного потребления энергоресурсов на единицу произведённого холода. Ожидается, что в перспективе до 2032 года проект позволит сократить выбросы парниковых газов совокупным объёмом 1375 тонн СО2-эквивалента.

«Ленинградский модульный ЦОД МТС — первый климатический проект в российской телеком-отрасли. Согласно углеродной стратегии, наша цель — снижение углеродоемкости на 60 % к 2030 году по сравнению с 2021 годом, и мы рассчитываем, что тиражирование строительства современных ЦОД повысит энергоэффективность компании за счёт снижения потребления электроэнергии. Регистрация проекта в реестре — важный шаг к достижению стратегических задач МТС в области управления выбросами парниковых газов и углеродного менеджмента», — говорится в заявлении оператора.

Постоянный URL: http://servernews.ru/1136231
31.01.2026 [21:37], Сергей Карасёв

10 тыс. ампер на ускоритель: AmberSemi представила чип питания PowerTile для повышения энергоэффективности ИИ ЦОД

Калифорнийская компания AmberSemi, специализирующаяся на разработке полупроводниковых изделий, сообщила о создании нового чипа управления питанием под названием PowerTile для дата-центров, ориентированных на ресурсоёмкие задачи ИИ.

Решение PowerTile представляет собой конвертер DC-DC, предназначенный для использования с мощными современными процессорами. Новинка монтируется на обратной стороне системной платы непосредственно под компонентом, на который подаётся питание. AmberSemi заявляет, что благодаря такой вертикальной схеме потери мощности сокращаются более чем на 85 % по сравнению с традиционным боковым распределением питания. В результате, значительно повышается эффективность и улучшается масштабируемость ИИ-систем.

Изделие PowerTile имеет размеры 20 × 24 × 1,68 мм. Чип способен подавать до 1000 А на CPU, GPU, FPGA или другие компоненты с высоким энергопотреблением. В системе могут быть задействованы несколько экземпляров PowerTile, что обеспечивает возможность наращивания тока до 10 000 А и более. Благодаря небольшой толщине может быть использовано жидкостное охлаждение.

 Источник изображений: AmberSemi

Источник изображений: AmberSemi

По оценкам AmberSemi, для ИИ ЦОД мощностью 500 МВт решение PowerTile может сэкономить до 225 МВт, что эквивалентно $160 млн/год. Компания сравнивает это с приблизительной годовой выработкой энергии малым модульным ядерным реактором. AmberSemi подчёркивает, что чип PowerTile разработан с учётом будущих архитектур дата-центров для ИИ, поскольку мощность таких объектов постоянно увеличивается.

Тар Кейси (Thar Casey), генеральный директор AmberSemi, отмечает, что существующие архитектуры питания с трудом справляются с быстро растущими потребностями ИИ-платформ. Это создаёт узкое место, ограничивающее дальнейшее наращивание производительности систем. PowerTile открывает путь для решения проблемы. AmberSemi планирует организовать тестирование изделия совместно с ключевыми партнёрами в конце текущего года. Поставки первых серийных образцов PowerTile начнутся в 2027-м.

Постоянный URL: http://servernews.ru/1136139
18.12.2025 [16:20], Сергей Карасёв

IXcellerate разработала собственное решение для эффективного охлаждения высоконагруженных ЦОД

Российский оператор коммерческих дата-центров IXcellerate сообщил о разработке передового решения для охлаждения высоконагруженных машинных залов. Компания уже получила патент на изобретение, которое прошло независимую экспертизу Федеральной службы по интеллектуальной собственности.

Целью исследовательского проекта являлось создание технологии для увеличения мощности системы кондиционирования при неизменной площади помещения. При этом требовалось решить проблемы неравномерного распределения воздуха, обеспечив возможность размещать стойки в любой точке машинного зала без изменения конфигураций инженерных систем.

В процессе разработки специалисты использовали CFD-инструменты. В результате, была получена специальная формула для расчёта объёма расходуемого воздуха, температурного режима и суммарной площади теплообменников для оптимального подбора мощности и количества вентиляторов. Формула позволила сконструировать новую воздухоохладительную камеру статического давления: она обеспечивает равномерное распределение воздушных потоков на все теплообменные аппараты.

 Источник изображения: IXcellerate

Источник изображения: IXcellerate

Инновационное решение внедрено в действующих машинных залах Южного кампуса IXcellerate с общей нагрузкой более 30 МВт. По заявлениям компании, применённая технология обеспечивает ряд преимуществ по сравнению с другими системами. В частности, благодаря оптимизации повышена энергоэффективность ЦОД и снижено потребление электроэнергии. Количество стойко-мест удалось увеличить на 15 % при сохранении прежней площади машинного зала. Исключены риски перегрева высоконагруженного IT-оборудования. Кроме того, достигнут оптимальный температурный график теплоносителя, благодаря чему дата-центр работает в энергосберегающем режиме фрикулинга.

Разработка новой технологии особенно важна в свете сформировавшейся геополитической обстановки, из-за которой поставки импортной продукции в Россию ограничены. Предложенное решение позволяет поддерживать параметры климата по стандарту ASHRAE, обеспечивает отказоустойчивость и сервисное обслуживание оборудования без перерывов на ремонты. Система подходит для любых дата-центров и помещений с серверным оборудованием.

Постоянный URL: http://servernews.ru/1134116
12.12.2025 [21:35], Руслан Авдеев

Крошечные чипы для гигантской экономии: PowerLattice пообещала удвоить производительность ИИ-ускорителей на ватт

Если энергоснабжение организовано неэффективно, на обеспечение работы ИИ-ускорителя мощностью 700 Вт может понадобиться и 1700 Вт. Решить это проблему поможет стартап PowerLattice, который миниатюризировал и переупаковал высоковольтные регуляторы, сообщает IEEE Spectrum. В компании утверждают, что её новые чиплеты позволяют снизить реальное энергопотребление наполовину, удвоив таким образом производительность на ватт. Чиплеты можно разместить максимально близко к вычислительным кристаллам.

Традиционные системы питания ИИ-чипов преобразуют переменный ток из сети в постоянный, а затем понижают напряжение до уровня, подходящего ускорителям (порядка 1 В). При значительном падении напряжения сила тока на финальном участке пути к чипу резко возрастает для сохранения нужного уровня мощности. Именно здесь и происходят существенные энергопотери и тепловыделение, которые можно снизить, разместив питающую электронику как можно ближе к потребителю — на расстоянии в несколько миллиметров, а не сантиметров, т.е. буквально внутри чипа.

 Источник изображения: PowerLattice

Источник изображения: PowerLattice

PowerLattice упаковала все необходимые компоненты в один чиплет размеров с пару ластиков, которые ставятся на карандаши. Чиплеты располагаются под подложкой корпуса вычислительного чипа. Одной из ключевых задач было уменьшение индукторов, помогающих поддерживать стабильное выходное напряжение. Пришлось применять специальный магнитный сплав, позволяющий очень эффективно использовать пространство, работая на высоких частотах, в сто раз выше, чем при использовании традиционного варианта. Уникальность решения в том, что сплав сохраняет лучшие магнитные свойства на высоких частотах, чем сопоставимые материалы.

Утверждается, что полученные чиплеты более чем в 20 раз компактнее по площади, чем современные стабилизаторы. При этом толщина каждого из них составляет всего 100 мкм, что сопоставимо с толщиной волоса. Такие чиплеты действительно можно размещать очень близко к кристаллам процессора. При этом заказчики могут использовать несколько чиплетов в зависимости от прожорливости и требований конкретных чипов. Энергорасход можно снизить на 50 %, обещает компания, но эксперты пока сомневаются в этом — для достижения такого уровня экономии нужно динамическое управление электропитанием в режиме реального времени в зависимости от текущей нагрузки, что с решением PowerLattice может быть недостижимо.

 Источник изображения: PowerLattice

Источник изображения: PowerLattice

Сейчас PowerLattice тестирует свой продукт на надёжность, а первые клиенты получат чиплеты приблизительно через два года. Intel тоже работает над модулем Fully Integrated Voltage Regulator, которая тоже помогает решить похожие проблемы. В самом стартапе Intel в качестве конкурента не рассматривается, поскольку подход у компаний разный, кроме того, Intel вряд ли будет предлагать свои решения конкурирующим производителям чипов.

Эксперты утверждают, что ещё 10 лет назад у компании не было шансов на успех, поскольку поставщики процессоров давали гарантию на них только при покупке их же модулей питания. Например, Qualcomm продавала свои чипсеты только вкупе с чипами управления питанием её же производства. Однако сейчас всё чаще практикуется гетерогенный подход, когда заказчики комбинируют компоненты разных компаний для оптимизации своих систем. Хотя поставщики уровня Intel и Qualcomm, вероятно, будут иметь фору при работе с крупными клиентами, более мелкие разработчики чипов и ИИ-инфраструктуры, возможно, будут искать альтернативные модули управления электропитанием.

Постоянный URL: http://servernews.ru/1133838
12.12.2025 [17:21], Руслан Авдеев

Никаких закладок: NVIDIA анонсировала новое ПО для мониторинга и продления жизни ИИ-ускорителей в ЦОД

NVIDIA разрабатывает новое открытое ПО, благодаря которому операторы ЦОД смогут получать более подробные данные о тепловом состоянии и иных параметрах работы ИИ-ускорителей. Предполагается, что это поможет решать проблемы, связанные с перегревом оборудования и его надёжностью, увеличив его срок службы и производительность. NVIDIA отдельно подчёркивает, что телеметрия собирается только в режиме чтения без слежки за оборудованием, а в ПО нет «аварийных выключателей» и бэкдоров. Да и в целом использование новинки опционально.

ПО обеспечивает операторам ЦОД доступ к мониторингу потребления энергии, загрузки, пропускной способности памяти и других ключевых параметров в масштабах всего парка ускорителей. Это помогает выявлять на ранних стадиях риски и проблемные компоненты и условия работы, отслеживать использование ИИ-ускорителей, их конфигурации и ошибки. Детализированная телеметрия становится всё важнее для планирования и управления масштабными инфраструктурами, говорит компания. ПО позволит:

  • отслеживать скачки энергопотребления, чтобы избежать превышение энергетических бюджетов, максимизируя производительность на ватт;
  • отслеживать загрузку, пропускную способность памяти и состояние интерконнектов во всём парке оборудования;
  • заблаговременно выявлять локальные перегревы и проблемы с воздушным потоком, чтобы избежать троттлинга и преждевременного старения компонентов;
  • проверять единообразие конфигураций ПО и настроек для воспроизводимости результатов и надёжности работы;
  • обнаруживать ошибки и аномалии, заблаговременно идентифицировать выходящие из строя компоненты.
 Источник изображения: NVIDIA

Источник изображения: NVIDIA

Такой мониторинг особенно важен на фоне недавнего отчёта учёных Принстонского университета, в котором сообщается, что интенсивные тепловые и электрические нагрузки способны сократить срок службы ИИ-чипов до года-двух, хотя обычно предполагается, что они способны стабильно проработать до трёх лет. Современные ускорители потребляют 700 Вт и более, а высокоплотные системы — от 6 кВт. Из-за этого формируются зоны перегрева, происходят колебания энергопотребления и растёт риск деградации интерконнектов в высокоплотных стойках.

Телеметрия, позволяющая оценить потребление энергии в реальном времени, состояние интерконнектов, систем воздушного охлаждения и др. позволяет перейти от реактивного мониторинга к проактивному проектированию. Рабочие нагрузки можно размещать с учётом теплового режима, быстрее внедрять СЖО или гибридные системы охлаждения, оптимизировать работу сетей с уменьшением тепловыделения.

Также ПО может помочь операторам ЦОД выявлять скрытые ошибки, вызванные несоответствием версий прошивки или драйверов. Благодаря этому можно повысить общую стабильность парка ускорителей. Кроме того, без задержек передаваемые данные об ошибках и состоянии компонентов могут значительно сократить среднее время восстановления работы и упростить анализ причин сбоев. Соответствующие данные могут влиять на решения о тратах на инфраструктуру и стратегию её развития на уровне предприятия.

 Источник изображения: NVIDIA

Источник изображения: NVIDIA

Как заявляют в Gartner, современный ИИ представляет собой «энергоёмкого и сильно нагревающегося монстра», разрушающего экономику и принципы работы ЦОД. В результате, предприятиям нужны специальные инструменты мониторинга и управления для того, чтобы ситуация не вышла из-под контроля. В ближайшие годы использование подобных решений, вероятно, станет обязательным. Кроме того, прозрачность на уровне всего парка оборудования становится необходимой для обоснования роста бюджетов на ИИ-инфраструктуру.

По словам экспертов, такие программные инструменты позволяют оптимизировать капитальные и операционные затраты на ЦОД и инфраструктуру, запланированные на ближайшие годы. «Каждый доллар и каждый ватт» должны быть учтены при эффективном использовании ресурсов.

Постоянный URL: http://servernews.ru/1133822
13.10.2025 [00:30], Владимир Мироненко

Вложи $5 млн — получи $75 млн: NVIDIA похвасталась новыми рекордами в комплексном бенчмарке InferenceMAX v1

NVIDIA сообщила о результатах, показанных суперускорителем GB200 NVL72, в новом независимом ИИ-бенчмарке InferenceMAX v1 от SemiAnalysis. InferenceMAX оценивает реальные затраты на ИИ-вычисления, определяя совокупную стоимость владения (TCO) в долларах на миллион токенов для различных сценариев, включая покупку и владение GPU в сравнении с их арендой. InferenceMAX опирается на инференс популярных моделей на ведущих платформах, измеряя его производительность для широкого спектра вариантов использования, а результаты может перепроверить любой желающий, говорят авторы бенчмарка.

Суперускоритель GB200 NVL72 победил во всех категориях бенчмарка InferenceMAX v1. Чипы NVIDIA Blackwell показали наилучшую окупаемость инвестиций — вложение в размере $5 млн приносят $75 млн дохода от токенов DeepSeek R1, обеспечивая 15-кратную окупаемость (год назад NVIDIA обещала ROI на уровне 700 %). Также ускорители поколения Blackwell отличаются самой низкой совокупной стоимостью владения. например, оптимизация ПО NVIDIA B200 позволила добиться стоимости всего в два цента на миллион токенов на OpenAI gpt-oss-120b, обеспечив пятикратное снижение стоимости одного токена всего за два месяца.

NVIDIA B200 первенствовал и по пропускной способности и интерактивности, обеспечив 60 тыс. токенов в секунду на ускоритель и 1 тыс. токенов в секунду на пользователя в gpt-oss с новейшим стеком NVIDIA TensorRT-LLM. NVIDIA сообщила, что постоянно повышает производительность путём оптимизации аппаратного и программного стека. Первоначальная производительность gpt-oss-120b на системе NVIDIA DGX Blackwell B200 с библиотекой NVIDIA TensorRT LLM уже была лидирующей на рынке, но команды NVIDIA и сообщество разработчиков значительно оптимизировали TensorRT LLM для ускорения исполнения открытых больших языковых моделей (LLM).

 Источник изображений: NVIDIA

Источник изображений: NVIDIA

Компания отметила, что выпуск TensorRT LLM v1.0 стал значительным прорывом в повышении скорости инференса LLM благодаря распараллеливанию и оптимизации IO-операций. А у недавно вышедшей модели gpt-oss-120b-Eagle3-v2 используется спекулятивное декодирование — интеллектуальный метод, позволяющий предсказывать несколько токенов одновременно. Это уменьшает задержку и обеспечивает получение ещё более быстрых результатов — пропускная способность выросла втрое, до 100 токенов в секунду на пользователя (TPS/пользователь), а общая производительность на ускоритель выросла с 6 до 30 тыс. токенов.

Для моделей с «плотной» архитектурой (Dense AI), таких как Llama 3.3 70b, которые требуют значительных вычислительных ресурсов из-за большого количества параметров и одновременного использования всех параметров в процессе инференса, NVIDIA Blackwell B200 достиг нового рубежа производительности в бенчмарке InferenceMAX v1, отметила NVIDIA. Суперускоритель показал более 10 тыс. токенов/с (TPS) на GPU при 50 TPS на пользователя, т.е. вчетверо более высокую пропускную способность на GPU по сравнению с NVIDIA H200.

NVIDIA подчеркнула, что такие показатели, как количество токенов на Вт, стоимость на миллион токенов и TPS/пользователь не уступают по важности пропускной способности. Фактически, для ИИ-фабрик с ограниченной мощностью ускорители с архитектурой Blackwell обеспечивают до 10 раз лучшую производительность на МВт по сравнению с предыдущим поколением и позволяют получать более высокий доход от токенов.

Компания отметила, что стоимость обработки одного токена (Cost per Token) имеет решающее значение для оценки эффективности ИИ-модели и напрямую влияет на эксплуатационные расходы. NVIDIA утверждает, что в целом архитектура NVIDIA Blackwell позволила снизить стоимость обработки миллиона токенов в 15 раз по сравнению с предыдущим поколением.

В InferenceMAX используется метод оценки эффективности Pareto front, определяющий наилучшее (компромиссное) сочетание различных факторов для оценки производительности ускорителя. Это показывает, насколько Blackwell лучше конкурентов справляется с балансом стоимости, энергоэффективности, пропускной способности и скорости отклика. Системы, оптимизированные только для одной метрики, могут демонстрировать пиковую производительность «в вакууме», но такая «экономика» не масштабируется в производственных средах.

Компания отметила, что ИИ переходит от экспериментальных пилотных проектов к ИИ-фабрикам — инфраструктуре, которая производит интеллектуальные решения, преобразуя данные в токены и решения в режиме реального времени. Фреймворк NVIDIA Think SMART помогает предприятиям ориентироваться в этом переходе, демонстрируя, как полнофункциональная платформа инференса обеспечивает измеримую окупаемость инвестиций.

Обещая 15-кратную окупаемость инвестиций и непрерывный рост производительности за счёт ПО, NVIDIA не просто лидирует в текущей гонке ИИ-технологий, но и задаёт правила для следующего этапа, где экономика будет определять победителей рынка, пишет The Tech Buzz. Для предприятий, делающих ставку на конкурирующие платформы в своих стратегиях по развёртыванию ИИ, результаты таких бенчмарков должны побудить к пересмотру выбора ИИ-инфраструктуры.

Постоянный URL: http://servernews.ru/1130690
03.07.2025 [15:01], Руслан Авдеев

Из-за ИИ дата-центры Google резко нарастили энергопотребление, но их PUE всё равно снизился

В Google связывают будущее искусственного интеллекта со своей климатической стратегией. В компании заявили о намерении обеспечить энергоснабжение ИИ «чистым» электричеством на фоне растущего энергопотребления глобальных проектов гиперскейлера, сообщает eWeek.

Как свидетельствует десятый отчёт Google Environmental Report, в 2024 году выбросы ЦОД, связанные с энергетикой, снизились на 12 % при росте энергопотребления на 27 %. Прогресс в Google объясняют долгосрочными контрактами на поставки «чистой» энергии и повышением энергоэффективности — это помогает компенсировать негативные экологические эффекты от развития ИИ. Компания даже смогла впервые за шесть лет снизить среднегодовой PUE дата-центров с 1,10 до 1,09.

По данным Google, компания значительно расширила применение «чистой» энергии, подписав крупнейший в своей истории пакет контрактов на её поставку. Речь идёт о 8 ГВт новых мощностей, вдвое больше в сравнении с 2023 годом. Также было введено в эксплуатацию 2,5 ГВт по более ранним контрактам.

 Источник изображений: Google

Источник изображений: Google

Положительная динамика отмечается и на региональном уровне. В девяти регионах более 80 % электричества поступает от безуглеродных источников, а общемировой средний показатель достиг 66 % благодаря интеллектуальному перераспределению нагрузки и локализованным закупкам энергии.

 Источник изображения: Google

Удалось добиться и повышения эффективности оборудования. Последнее поколение чипов компании в 30 раз энергоэффективнее моделей 2018 года. Кроме того, благодаря пяти инструментам Google в 2024 году удалось предотвратить выбросы 26 млн метрических тонн CO₂ — более чем вдвое снизив углеродный след от собственных операций компании.

 Источник изображения: Google

Несмотря на системные улучшения, общий углеродный след Google в 2024 году увеличился. В отчёте указываются и некоторые проблемы, а также замедление прогресса в ряде направлений. Так, общий объём выбросов вырос из-за активного строительства, выпуска оборудования и деятельности подрядчиков. Выбросы Scope 3, относящиеся к цепочкам поставок и производству, увеличились на 22 % год к году.

 Источник изображения: Google

При этом в Азиатско-Тихоокеанском регионе уровень использования безуглеродной энергии остаётся на прежнем уровне в 12 %, а в некоторых других странах доля начала даже снижаться из-за ограниченного доступа к возобновляемой энергии. Взрывной рост инфраструктуры заставляет Google пересматривать подход к климатическим обязательствам и энергетике. Компания намерена больше вкладывать в передовые технологии и использовать инновационные схемы закупок энергии.

 Источник изображения: Google

Например, недавно появилась информация о закупке 200 МВт термоядерной энергии у Commonwealth Fusion Systems — правда, проект ещё далёк от готовности к коммерческому использованию. В целом ожидается более активный переход на безуглеродную энергетику, особенно в регионах с высоким уровнем использования ископаемого топлива (например, в Азии). Представитель Google заявил, что компания совершенствует подход к достижению климатических целей, не снижая темпов развития ИИ на пользу обществу.

Обозначенные в отчёте Google проблемы стали отражением общей обеспокоенности индустрии «экологическим следом» искусственного интеллекта. Компании всех масштабов компенсируют выбросы инвестициями в экопроекты (например, сохранение лесов), но эффект от них не так велик и отложен во времени. А в засушливых регионах активисты и власти часто критикуют владельцев дата-центров за высокое потребление чистой воды. Кроме того, эксперты требуют большей прозрачности относительно влияния ИИ на окружающую среду.

Постоянный URL: http://servernews.ru/1125348