Материалы по тегу: i

05.05.2024 [13:56], Сергей Карасёв

Власти США продали на аукционе 5,34-ПФлопс суперкомпьютер Cheyenne из-за растущего числа сбоев и протечек СЖО

Администрация общих служб США (GSA) реализовала на аукционе НРС-систему под названием Cheyenne, которая была введена в строй в Центре суперкомпьютерных вычислений NCAR-Wyoming (NWSC) штата Вайоминг в 2016 году. Стоимость лота составила $480 085, тогда как затраты на строительство машины оцениваются как минимум в $25 млн.

Cheyenne стал одним из последних суперкомпьютеров компании Silicon Graphics International (SGI). Корпорация HPE приобрела эту фирму после того, как Cheyenne был смонтирован, но до фактического запуска системы в эксплуатацию. На момент начала работы производительность комплекса составляла 5,34 Пфлопс, что соответствовало 20 месту в актуальном тогда списке ТОР500.

Cheyenne представляет собой кластер SGI ICE XA с 4032 узлами, каждый из которых содержит два процессора Intel Xeon E5-2697v4 Broadwell (18C/36; 2,3 ГГц). Таким образом, суммарное количество ядер достигает 145 152. Применяется оперативная память DDR4-2400 ECC общей ёмкостью 313 Тбайт (4890 модулей на 64 Гбайт). В состав машины изначально входило хранилище данных вместимостью 40 Пбайт. Энергопотребление — приблизительно 1,7 МВт. Задействована система жидкостного охлаждения.

 Источник изображения: GSA

Источник изображения: GSA

Две стойки управления с воздушным охлаждением состоят из 26 серверов типоразмера 1U (20 со 128 Гбайт ОЗУ и ещё 6 с 256 Гбайт ОЗУ), 10 коммутаторов и двух блоков питания. Суперкомпьютер эксплуатировался с 12 января 2017 года по 31 декабря 2023-го, решая задачи в области изменений климата и в других сферах, связанных с науками о Земле. Cheyenne превзошёл свой запланированный срок службы: в заявлении NWSC говорилось, что он будет эксплуатироваться до 2021 года. Однако к концу 2023-го количество сбоев и проблем стало слишком большим.

В описании лота говорится, что «примерно 1 % узлов столкнулись с отказами за последние шесть месяцев», в основном из-за модулей памяти. Кроме того, система испытывает ограничения по техническому обслуживанию из-за неисправных быстроразъёмных соединений, вызывающих протечки воды. Таким образом, «учитывая затраты и время простоя, связанные с устранением проблем», дальнейшее использование комплекса признано нецелесообразным, в связи с чем он пущен с молотка.

Вместе с тем, как отмечает Tom's Hardware, новый владелец суперкомпьютера может реализовать его основные компоненты на вторичном рынке. Например, стоимость чипов Xeon E5-2697 v4 на eBay составляет около $50, а модулей DDR4-2400 ECC ёмкостью 64 Гбайт — примерно $65. То есть, по самым скромным подсчётам, только эти компоненты могут принести новому владельцу суперкомпьютера приблизительно $700 тыс. без учёта затрат на демонтаж и вывоз машины массой 43 т, а также на тестирование компонентов. Впрочем, массовый выброс на рынок CPU и RAM в таких объёмах приведёт к снижению цен.

Постоянный URL: http://servernews.ru/1104317
16.11.2023 [02:43], Алексей Степин

Microsoft представила 128-ядерый Arm-процессор Cobalt 100 и ИИ-ускоритель Maia 100 собственной разработки

Гиперскейлеры ради снижения совокупной стоимости владения (TCO) и зависимости от сторонних вендоров готовы вкладываться в разработку уникальных чипов, изначально оптимизированных под их нужды и инфраструктуру. К небольшому кругу компаний, решившихся на такой шаг, присоединилась Microsoft, анонсировавшая Arm-процессор Azure Cobalt 100 и ИИ-ускоритель Azure Maia 100.

 Изображения: Microsoft

Изображения: Microsoft

Первопроходцем в этой области стала AWS, которая разве что память своими силами не разрабатывает. У AWS уже есть три с половиной поколения Arm-процессоров Graviton и сразу два вида ИИ-ускорителей: Trainium для обучения и Inferentia2 для инференса. Крупный китайский провайдер Alibaba Cloud также разработал и внедрил Arm-процессоры Yitian и ускорители Hanguang. Что интересно, в обоих случаях процессоры оказывались во многих аспектах наиболее передовыми. Наконец, у Google есть уже пятое поколение ИИ-ускорителей TPU.

Microsoft заявила, что оба новых чипа уже производятся на мощностях TSMC с использованием «последнего техпроцесса» и займут свои места в ЦОД Microsoft в начале следующего года. Как минимум, в случае с Maia 100 речь идёт о 5-нм техпроцессе, вероятно, 4N. В настоящее время Microsoft Azure находится в начальной стадии развёртывания инфраструктуры на базе новых чипов, которая будет использоваться для Microsoft Copilot, Azure OpenAI и других сервисов. Например, Bing до сих пор во много полагается на FPGA, а вся ИИ-инфраструктура Microsoft крайне сложна.

Microsoft приводит очень мало технических данных о своих новинках, но известно, что Azure Cobalt 100 имеет 128 ядер Armv9 Neoverse N2 (Perseus) и основан на платформе Arm Neoverse Compute Subsystem (CSS). По словам компании, процессоры Cobalt 100 до +40 % производительнее имеющихся в инфраструктуре Azure Arm-чипов, они используются для обеспечения работы служб Microsoft Teams и Azure SQL. Oracle, вложившаяся в своё время в Ampere Comptuing, уже перевела все свои облачные сервисы на Arm.

Чип Maia 100 (Athena) изначально спроектирован под задачи облачного обучения ИИ и инференса в сценариях с использованием моделей OpenAI, Bing, GitHub Copilot и ChatGPT в инфраструктуре Azure. Чип содержит 105 млрд транзисторов, что больше, нежели у NVIDIA H100 (80 млрд) и ставит Maia 100 на один уровень с Ponte Vecchio (~100 млрд). Для Maia организован кастомный интерконнект на базе Ethernet — каждый ускоритель располагает 4,8-Тбит/с каналом для связи с другими ускорителями, что должно обеспечить максимально эффективное масштабирование.

Сами Maia 100 используют СЖО с теплообменниками прямого контакта. Поскольку нынешние ЦОД Microsoft проектировались без учёта использования мощных СЖО, стойку пришлось сделать более широкой, дабы разместить рядом с сотней плат с чипами Maia 100 серверами и большой радиатор. Этот дизайн компания создавала вместе с Meta, которая испытывает аналогичные проблемы с текущими ЦОД. Такие стойки в настоящее время проходят термические испытания в лаборатории Microsoft в Редмонде, штат Вашингтон.

В дополнение к Cobalt и Maia анонсирована широкая доступность услуги Azure Boost на базе DPU MANA, берущего на себя управление всеми функциями виртуализации на манер AWS Nitro, хотя и не целиком — часть ядер хоста всё равно используется для обслуживания гипервизора. DPU предлагает 200GbE-подключение и доступ к удалённому хранилищу на скорости до 12,5 Гбайт/с и до 650 тыс. IOPS.

Microsoft не собирается останавливаться на достигнутом: вводя в строй инфраструктуру на базе новых чипов Cobalt и Maia первого поколения, компания уже ведёт активную разработку чипов второго поколения. Впрочем, совсем отказываться от партнёрства с другими вендорами Microsoft не намерена. Компания анонсировала первые инстансы с ускорителями AMD Instinct MI300X, а в следующем году появятся инстансы с NVIDIA H200.

Постоянный URL: http://servernews.ru/1096037
29.09.2023 [00:00], Владимир Мироненко

Raspberry Pi 5 — немного дороже, но гораздо производительнее предшественника

Организация Raspberry Pi Foundation представила одноплатный компьютер Raspberry Pi 5, который гораздо производительнее предшественника, хотя и дороже его. Первоначально предназначенный для любителей и преподавателей, Raspberry Pi с годами превратился в довольно производительный компьютер, способный, несмотря на свои миниатюрные размеры, справляться со множеством рабочих нагрузок, сохраняя при этом возможности расширения.

Raspberry Pi 5 построен на 16-нм процессоре Broadcom BCM2712 с четырьмя 64-бит ядрами Arm Cortex-A76 (2,4 ГГц), обеспечивающим увеличение производительности компьютера в 2–3 раза по сравнению с Raspberry Pi 4. Имеющийся графический ускоритель VideoCore VII с частотой 800 МГц, поддержкой стандартов OpenGL ES 3.1 и Vulkan 1.2 и open source драйверами Igalia Mesa обеспечивает одновременный вывод изображения через порты HDMI на два 4K-монитора с частотой обновления 60 Гц. Мультимедийная подсистема также включает аппаратный декодер 4K60p HEVC и ISP собственной разработки.

 Источник изображений: raspberrypi.com

Источник изображений: raspberrypi.com

Компания отметила, что Raspberry Pi 5 — первый полноразмерный Raspberry Pi, в котором используется специальный чип RP1 собственной разработки. Он играет роль южного моста, куда вынесены некоторые IO-интерфейсы. RP1 предлагает по паре USB 2.0 и 3.0, 1GbE-контроллер, пару MIPI-трансиверов по четыре линии каждый, а также 3,3-В GPIO, включая стандартные низкоскоростные интерфейсы вроде UART, SPI, I2C, I2S и PWM. К BCM2712 контроллер подключается посредством четырёх линий PCIe 2.0, а ещё одна линия от основной SoC доступна для подключения периферии, например, NVMe SSD в форм-факторе M.2 2230/2242 (нужна плата-адаптер).

На начальном этапе компьютер предлагается с 4 или 8 Гбайт оперативной памяти LPDDR4X-4267. Слот для карт памяти поддерживает высокоскоростной режим SDR104 (UHS-I). Ещё одно улучшение — поддержка часов реального времени, для питания которых необходима отдельная батарея. Коммуникационные возможности Raspberry Pi 5 включают адаптеры беспроводной связи Bluetooth 5.0 (BLE) и Wi-Fi 5 (2,4/5 ГГц), гигабитный порт Ethernet (RJ-45).

Есть также два порта USB 3.0, два USB 2.0 Type-B и один порт USB Type-C (для подключения питания). Кроме того, сохранён стандартный 40-контактный разъём GPIO, а также появилась кнопка включения/выключения питания, которой не было у предшественника. Вместе с тем, у Raspberry Pi 5 нет комбинированного 3,5-мм разъёма для вывода аналогового аудио и композитного видео, отсутствие которого объясняется нехваткой свободного места на плате.

Raspberry Pi 5 в целом энергоэффективнее предшественника. Однако из-за более высокой производительности пиковое энергопотребление при максимальных нагрузках увеличивается примерно до 12 Вт по сравнению с 8 Вт у Raspberry Pi 4. Поэтому при использовании стандартного адаптера питания USB-C 5 В, 3 А (15 Вт) с Raspberry Pi 5 по умолчанию ограничивает отдаваемый USB-портам ток до 600 мА, чтобы гарантировать достаточный запас для поддержки пиковых нагрузок.

Для желающих использовать мощные периферийные устройства, такие как HDD/SSD, сохраняя при этом запас для пиковых рабочих нагрузок, предлагается 25-Вт блок питания стоимостью $12. Если Raspberry Pi 5 обнаруживает этот источник питания, предельная сила тока для USB увеличивается до 1,6 А, обеспечивая по 5 Вт дополнительной мощности USB-устройствам и самому ПК. Пользователи также могут изменить ограничение силы тока, указав более высокое значение.

Компания также предлагает дополнительные аксессуары к компьютеру. В их числе — обновлённый корпус Raspberry Pi 5 по цене $10, оснащённый встроенным вентилятором производительностью 2,79 (макс.) кубических футов в минуту (0,08 м3/мин) с гидродинамическими подшипниками, который подключается к четырехконтактному разъёму JST на Raspberry Pi 5 для обеспечения охлаждения с контролируемой температурой. Воздух всасывается через щель под крышкой, проходит через радиатор и выводится через отверстия разъёмов и вентиляционные отверстия в основании.

Для охлаждения платы без корпуса можно добавить кулер за $5. Он крепится к плате через два новых монтажных отверстия и подключается к тому же четырехконтактному разъёму JST, что и корпусной вентилятор. При этом при пиковых нагрузках SoC может нагреваться до 80 °C, так что в некоторых сценариях применения новинки понадобится или кулер, или корпус с вентилятором.

 Источник: Phoronix

Источник: Phoronix

Цена Raspberry Pi 5 немного выросла по сравнению с предшественником — $60 за версию с 4 Гбайт ОЗУ и $80 за 8-Гбайт версию. Рост связан с небольшим увеличением себестоимости производства и общим ростом цен на компоненты, за исключением SDRAM. В продажу плата поступит в октябре. Тогда же состоится релиз Raspberry Pi OS на базе Debian Bookworm. Ресурс Phoronix уже провёл первые тесты новинки, которые показали, что она действительно примерно втрое быстрее Raspberry Pi 4, поэтому небольшое повышение стоимости более чем оправдано.

Постоянный URL: http://servernews.ru/1093728
13.07.2023 [22:23], Владимир Мироненко

Akamai постепенно превращается в распределённого облачного провайдера

CDN-провайдер Akamai Technologies Inc. объявил об открытии трёх новых облачных ЦОД Connected Cloud в Париже, Вашингтоне (округ Колумбия) и Чикаго, а также о предстоящем запуске в этом квартале аналогичных объектов в Сиэтле и Ченнаи (Индия). По словам компании, стратегически выбранное расположение новых ЦОД позволит предоставлять клиентам высокопроизводительные, масштабируемые облачные ресурсы.

Новый объект в Вашингтоне находится невдалеке от Северной Вирджинии с крупнейшим в мире кластером ЦОД. Новый объект в Чикаго позволит получать доступ к облачным услугам на пятом по величине рынке ЦОД в мире, а объект в Сиэтле будет актуален для Тихоокеанского Северо-Запада. ЦОД в Париже позволит европейским компаниям работать в соответствии с местным законами по обеспечению суверенитета данных, в то время как объект в Ченнаи обеспечит доступ к одному из крупнейших ИТ-центров Индии.

 Источник изображения: Akamai

Источник изображения: Akamai

Сообщается, что новые ЦОД отличаются современными архитектурой и оборудованием. Компания отметила, что их запуск знаменует важный шаг в стремлении интегрировать облачные ресурсы с её глобальной сетью, охватывающей более 4 тыс. точек присутствия в 135 странах. Сервис Akamai Connected Cloud изначально был задуман как более распределённая альтернатива AWS и Azure, которая позволяет «сделать приложения и сервисы ближе, а угрозы — дальше».

Попутно Akamai расширяет возможности своего облака. Компания запустила инстансы премиум-класса, а ёмкость хранилища увеличила до 1 Пбайт и 1 млрд объектов. Этим летом станет доступен глобальный балансировщик Akamai Global Load Balancer, который позволит избежать единой точки отказа и направлять запросы в наиболее оптимальный ЦОД для минимизации задержек. Наконец, компания создала партнёрскую программу, в рамках которой квалифицированные технологические партнёры будут обучаться развёртыванию приложений на её платформе.

Постоянный URL: http://servernews.ru/1089874
23.05.2023 [20:08], Владимир Мироненко

5G из-под земли: Ericsson и KDDI развернут в Японии сеть подземных базовых станций

Японский телекоммуникационный оператор KDDI выбрал шведскую компанию Ericsson в качестве партнёра для развёртывания первых в Японии подземных базовых станций 5G, сообщил ресурс DatacenterDynamics.

Как и везде, в Японии большинство базовых станций связи установлены на отдельных башнях или крышах зданий для обеспечения связи на больших территориях. Вместе с тем существуют ограничения на установку базовых станций в живописных местах. В июле 2021 года Министерство внутренних дел и коммуникаций Японии (MIC) ввело в действие новые регуляции, что сделало возможным строительство и эксплуатацию подземных базовых станций.

 Источник изображения: Ericsson

Источник изображения: Ericsson

Ericsson сообщила, что подземные базовые станции позволят провайдерам связи размещать оборудование в существующих подземных пространствах, а оптоволоконные сети и силовая инфраструктура будут подключаться на уровне поверхности земли, что обеспечит возможность беспроблемного получения разрешения на установку и быстрого развёртывания, гарантируя при этом отсутствие визуального воздействия на городской ландшафт.

По словам Ericsson, её подземные антенны способны работать в ограниченном пространстве, например, в канализационных люках, где установка стандартных базовых станций невозможна. Благодаря установке под землёй, антенна обеспечивает оптимальные характеристики излучения (MIMO) в условиях плотной застройки, и при этом менее чувствительна к ветровой нагрузке. KDDI отметила, что подземные базовые станции могут быть развёрнуты на улицах, площадях, в торговых центрах и других местах, где разрешение на установку наружных антенн невозможно получить.

Постоянный URL: http://servernews.ru/1087221
04.03.2023 [00:34], Алексей Степин

Huawei представила СХД начального уровня: OceanStor Dorado 2000 и OceanProtect X3000

На выставке-конференции MWC 2023 компания Huawei демонстрирует не только телекоммуникационные новинки, но и новые решения в области хранения данных. Именно в Барселоне Huawei представила свои новые СХД — OceanStor Dorado 2000 и OceanProtect X3000, предназначенные для малых и средних предприятий.

Как и старшие собратья, OceanStor Dorado 2000 являет собой хранилище класса all-flash, но сама система несколько проще в сравнении с Dorado 3000 и поддерживает только Fibre Channel (FC32) и iSCSI (25GbE). Объём системного кеша может варьироваться от 128 до 512 Гбайт, но SCM нет. Типичная конфигурация начального уровня содержит до 25 накопителей (SAS-3) общим объёмом 10–50 Тбайт. Максимальное количество контроллеров в системе сокращено с 16 до 8.

При этом система может обслуживать до 400 SSD и поддерживает не только RAID 5/6, но и фирменный RAID-TP, выдерживающий одновременный выход из строя трёх накопителей. Также поддерживаются фирменные алгоритмы сжатия и дедупликации данных. OceanStor Dorado 2000 гарантирует доступность данных на уровне 99,9999 %.

К решениям начального уровня относится и система защиты данных OceanProtect X3000, также построенная на архитектуре Active-Active (по характеристикам аналогична Dorado 200) и позволяющая восстанавливать потерянные в результате сбоя данные в крайне сжатые сроки. Как и все системы OceanProtect она предлагает современную продвинутую защиту от кибер-вымогателей.

Постоянный URL: http://servernews.ru/1082888
15.02.2023 [16:35], Владимир Мироненко

Промежуточное звено: Akamai объявила о запуске платформы Connected Cloud на базе Linode

Провайдер платформ доставки контента и приложений Akamai Technologies анонсировал сервис Connected Cloud, основанный на платформе Linode, приобретённой им в прошлом году. Connected Cloud представляет собой более распределённую альтернативу сервисам AWS или Azure. Также было объявлено о сниженной стоимости облачных вычислений за счёт более низкой платы за исходящий трафик благодаря «приведению экономики, подобной CDN, к облачной передаче данных».

Akamai поставила целью заполнить нишу, образовавшуюся между предложениями гиперскейлеров и провайдеров периферийных вычислений. Компания считает, что современные приложения зачастую разделяются на ряд различных микросервисов. Во многих случаях эти микросервисы должны быть распределены по географически обширной территории, что создаёт потребность в вычислительных ресурсах, отличных от тех, которые предлагает большинство поставщиков традиционных облачных услуг.

С одной стороны, по словам Akamai, есть гиперскейлеры, предлагающие мощные вычислительные сервисы в нескольких регионах. С другой стороны, есть провайдеры CDN, чьи сервисы менее масштабны и предназначены для использования в более крупных, но менее производительных периферийных вычислительных средах. Поэтому Akamai намерена создать инфраструктуру, занимающую промежуточное положение в этой иерархии.

 Источник изображения: Akamai

Источник изображения: Akamai

Akamai досталось 11 площадок Linode, но компания планирует увеличить их количество более чем вдвое в 2023 году, а также удовлетворить потребности «промежуточного» рынка, добавив более 50 объектов для «распределённых» вычислений, «чтобы перенести базовые возможности облачных вычислений в труднодоступные места, которые в настоящее время не в полной мере обслуживаются традиционными поставщиками облачных услуг».

В частности, компания добавит к концу II квартала 2023 года три новых объекта в США и ещё 10 объектов по всему миру. Linode заявила, что к концу 2023 года они будут размещены в Индии, Бразилии, Индонезии, Японии, Швеции, Италии, Франции и Нидерландах. Компания сообщила ресурсу DCD, что эти объекты будут подключены к существующей сети Akamai CDN. Заказчикам будут доступны виртуальные машины и контейнеры, но в более в облечённом по сравнению с большими облаками варианте.

Кроме того, компания поменяла цены на исходящий трафик, что снизит затраты компаний, которым необходимо регулярно перемещать свои данные в облако и обратно. Также Akamai занялась сертификацией своих площадок, что даёт больше возможностей для использования облачных вычислений компаниям из строго регулируемых отраслей. Наконец, компания создала партнёрскую программу, в рамках которой квалифицированные технологические партнёры будут обучаться развёртыванию приложений на новой платформе.

Постоянный URL: http://servernews.ru/1082011
04.10.2022 [22:57], Алексей Степин

Intel Labs представила нейроморфный ускоритель Kapoho Point — 8 млн электронных нейронов на 10-см плате

Компания Intel уже не первый год развивает направление нейроморфных процессоров — чипов, имитирующих поведение нейронов головного мозга. Уже во втором поколении, Loihi II, процессор получил 128 «ядер», эквивалентных 1 млн «цифровых нейронов», однако долгое время этот чип оставался доступен лишь избранным разработчикам Intel Neuromorphic Research Community через облако.

Но ситуация меняется, пусть и спустя пять лет после анонса первого нейроморфного чипа: компания объявила о выпуске платы Kapoho Point, оснащённой сразу восемью процессорами Loihi II. Напомним, что они производятся с использованием техпроцесса Intel 4 и состоят из 2,3 млрд транзисторов, образующих асинхронную mesh-сеть из 128 нейроморфных ядер, модель работы которых задаётся на уровне микрокода.

 Здесь и далее источник изображений: Intel Labs

Источник изображений: Intel Labs

Площадь кристалла нейроморфоного процессора Intel второго поколения составляет всего 31 мм2. Судя по всему, активного охлаждения Loihi II не требует: даже в первой реализации в виде PCIe-платы Oheo Gulch кулером оснащалась только управляющая ПЛИС, но не сам нейроморфный чип. В своём интервью ресурсу AnandTech Майк Дэвис (Mike Davies), глава проекта, отметил, что в реальных сценариях, выполняемых в человеческом масштабе времени, речь идёт о цифре порядка 100 милливатт, хотя в более быстром масштабе чип, естественно, может потреблять и больше.

 выф

Архитектура и особенности строения Loihi II. По нажатию открывается полноразмерная версия

Новый модуль, по словам компании, способен эмулировать до 1 млрд синапсов, а в задачах оптимизации с большим количеством переменных (до 8 миллионов, эквивалентно количеству «нейронов»), где нейроморфная архитектура Intel очень сильна, он может опережать традиционные процессоры в 1000 раз. Каждое ядро имеет свой небольшой пул быстрой памяти объёмом 192 Кбайт. Шесть выделенных ядер отвечают за управление нейросетью Loihi II; также в составе чипа имеются аппаратные ускорители кодирования-декодирования данных.

Новинка изначально создана модульной: благодаря интерфейсному разъёму несколько плат Kapoho Point можно устанавливать одна над другой. Поддерживаются «бутерброды» толщиной до 8 плат, в деле опробован, однако, вдвое более тонкий вариант, но даже четыре Kapoho Point дают 32 миллиона нейронов в совокупности. Для коммуникации с внешним миром используется интерфейс Ethernet: в чипе реализована поддержка скоростей от 1 (1000BASE-KX) до 10 Гбит/с (10GBase-KR). Размеры каждой платы невелики, всего 4×4 дюйма (102×102 мм).

 Платы Kapoho Point позволяют легко расширять нейросеть на базе Loihi II

Платы Kapoho Point позволяют легко расширять нейросеть на базе Loihi II

В отличие от первого поколения Loihi, доступ к которому можно было получить лишь виртуально, через облако, системы на базе Kapoho Point уже доставлены избранным клиентам Intel, и речь идёт о реальном «железе». В число первых клиентов входит Исследовательская лаборатория ВВС США (Air Force Research Laboratory, AFRL), для задач которой такие достоинства Loihi II, как компактность и экономичность являются решающими.

 Возможности SDK Lava

Возможности SDK Lava

Одновременно с анонсом Kapoho Point компания Intel обновила и фреймворк Lava. В отлчиие от SDK первого поколения Nx новая открытая программная платформа разработки сделана аппаратно-независимой, что позволит разрабатывать нейро-приложения не только на платформе, оснащённой чипами Loihi II.

Постоянный URL: http://servernews.ru/1075270
24.08.2022 [22:42], Владимир Мироненко

Untether AI представила ИИ-ускоритель speedAI240 — 1,5 тыс. ядер RISC-V и 238 Мбайт SRAM со скоростью 1 Пбайт/с

Компания Untether AI анонсировала ИИ-архитектуру следующего поколения speedAI (кодовое название «Boqueria»), ориентированную на инференс-нагрузки. При энергоэффективности 30 Тфлопс/Вт и производительности до 2 Пфлопс на чип speedAI устанавливает новый стандарт энергоэффективности и плотности вычислений, говорит компания.

Поскольку at-memory вычисления в ряде задач значительно энергоэффективнее традиционных архитектур, они могут обеспечить более высокую производительность при одинаковых затратах энергии. Первое поколение устройств runAI в 2020 году Untether AI достигла энергоэффективности на уровне 8 Тфлопс/Вт для INT8-вычислений. Новая архитектура speedAI обеспечивает уже 30 Тфлопс/Вт.

 Изображения: Untether AI (via ServeTheHome)

Изображения: Untether AI (via ServeTheHome)

Этого удалось добиться благодаря архитектуре второго поколения, использованию более 1400 оптимизированных 7-нм ядер RISC-V (1,35 ГГц) с кастомными инструкциями, энергоэффективному управлению потоком данных и внедрению поддержки FP8. Вкупе это позволило вчетверо поднять эффективность speedAI по сравнению с runAI. Новинка может быть гибко адаптирована к различным архитектурам нейронных сетей. Концептуально speedAI напоминает ещё один тысячеядерный чип RISC-V — Esperanto ET-SoC-1.

Первый член семейства speedAI — speedAI240 — обеспечивает 2 Пфлопс вычислениях в FP8-вычислениях или 1 Пфлопс для BF16-операций. Благодаря этому обеспечивается самая высокая в отрасли эффективность — например, для модели BERT заявленная производительность составляет 750 запросов в секунду на Вт (qps/w), что, по словам компании, в 15 раз выше, чем у современных GPU. Добиться повышения производительности удалось благодаря тесной интеграции вычислительных элементов и памяти.

На каждый блок SRAM объёмом 328 Кбайт приходится 512 вычислительных блоков, поддерживающих работу с форматами INT4, INT8, FP8 и BF16. Каждый вычислительный блок имеет два 32-бит (RV32EMC) кастомных ядра RISC-V с поддержкой четырёх потоков и 64 SIMD. Всего есть 729 блоков, так что суммарно чип несёт 238 Мбайт SRAM и 1458 ядер. Блоки провязаны между собой mesh-сетью, к которой также подключены кольцевая IO-шина, несущая четыре 1-Мбайт блока общего кеша, два контроллера LPDRR5 (64 бит) и порты PCIe 5.0: один x16 для подключения к хосту и три x8 для объединения чипов.

Суммарная пропускная способность SRAM составляет около 1 Пбайт/с, mesh-сети — от 1,5 до 1,9 Тбайт/с, IO-шины — 141 Гбайт/c в обоих направлениях, а 32 Гбайт DRAM — чуть больше 100 Гбайт/с. PCIe-интерфейсы позволяют объединить до трёх ускорителей, с шестью speedAI240 чипами у каждого. Решения speedAI будут предлагаться как в виде отдельных чипов, так и в составе готовых PCIe-карт и M.2-модулей. Ожидается, что первые поставки избранным клиентам начнутся в первой половине 2023 года.

Постоянный URL: http://servernews.ru/1072806
01.08.2022 [23:00], Игорь Осколков

Великое объединение: спецификации и наработки OpenCAPI и OMI планируется передать консорциуму CXL

Консорциумы OpenCAPI Consortium (OCC) и Compute Express Link (CXL) подписали соглашение, которое подразумевает передачу в пользу CXL всех наработок и спецификаций OpenCAPI и OMI. Если будет получено одобрения всех участвующих сторон, то это будет ещё один шаг в сторону унификации ключевых системных интерфейсов и возможности реализации новых архитектурных решений. Во всяком случае, на бумаге.

Консорциумы OpenCAPI (Open Coherent Accelerator Processor Interface) был сформирован в 2016 году с целью создание единого, универсального, скоростного и согласованного интерфейса для связи CPU с ускорителями, сетевыми адаптерами, памятью, контроллерами и устройствами хранения и т.д. Причём в независимости от типа и архитектуры самого CPU. На тот момент новый интерфейс был определённо лучше распространённого тогда PCIe 3.0. С течением времени дела у OpenCAPI шли ни шатко ни валко, однако фактически его использование было ограничено только POWER-платформами от IBM.

 Источник: OpenCAPI

Источник: OpenCAPI

Тем не менее, в недрах OpenCAPI родился ещё один очень интересный стандарт — Open Memory Interface (OMI). OMI, если коротко, предлагает некоторую дезагрегацию путём добавления буферной прослойки между CPU и RAM. С одной стороны у OMI есть унифицированный последовательный интерфейс для подключения к CPU, с другой — интерфейсы для подключения какой угодно памяти, на выбор конкретного производителя.

 Источник: Open Memory Interface (OMI)

Источник: Open Memory Interface (OMI)

OMI позволяет поднять пропускную способность памяти, не раздувая число контактов и физические размеры и самого CPU, и модулей. Однако и в данном случае массовая поддержка OMI по факту есть только в процессорах IBM POWER10. Концептуально CXL в части работы с памятью повторяет идею OMI, только в данном случае в качестве физического интерфейса используется распространённый PCIe.

 Изображение: SK Hynix

Изображение: SK Hynix

Существенная разница c OMI в том, что начальная поддержка CXL будет в грядущих процессорах AMD и Intel. А Samsung и SK Hynix уже готовят соответствующие DDR5-модули. Да и в целом поддержка CXL в индустрии намного шире. Так что консорциуму CXL, по-видимому, осталось поглотить только ещё один конкурирующий стандарт в лице CCIX, как это уже произошло с Gen-Z.

Комментируя соглашение, президент консорциума CXL отметил, что сейчас наиболее удачное время для объединения усилий, которое принесёт пользу всей IT-индустрии. Участники OpenCAPI имеют богатый опыт, который поможет улучшить грядущие спецификации CXL и избежать ошибок.

Постоянный URL: http://servernews.ru/1071325

Входит в перечень общественных объединений и религиозных организаций, в отношении которых судом принято вступившее в законную силу решение о ликвидации или запрете деятельности по основаниям, предусмотренным Федеральным законом от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности»;