Материалы по тегу: инференс

27.08.2026 [09:25], Владимир Мироненко

MTIA 300: первый ИИ-чип Meta✴ со встроенными 800GbE-адаптерами и механизмами разгрузки коммуникаций

Meta сообщила новые подробности о 667-Вт ИИ-ускорителе MTIA 300 — своём первом чипе, оптимизированном для обучения DLRM-моделей. В отличие от LLM, требующих огромной пропускной способности вычислений с плавающей запятой, рекомендательные модели сталкиваются с проблемой необходимости быстрого и эффективного взаимодействия ускорителей в сочетании с большой ёмкостью памяти и высокой пропускной способностью интерконнекта.

Их таблицы эмбеддингов могут содержать более 99 % параметров модели, что требует гибридного параллелизма, генерирующего частые коллективные операции AllReduce, AllToAll и AllGather на сотнях ускорителей. На таких чипах, как GPU, эти коммуникационные операции конкурируют с вычислениями за одни и те же ресурсы, часто приводя к неэффективному использованию дорогостоящего оборудования.

Для решения этой проблемы разработчики, используя совместную разработку MTIA 300 с HCCL, библиотекой коммуникационных интерфейсов, созданной на основе разработанного с нуля оборудования, сделали коммуникацию первостепенной задачей в проектировании микросхем. На практике HCCL обеспечивает пропускную способность передачи данных до 940 Гбайт/с в пределах одной стойки. На модели со 150 млрд параметров, работающей на 40 ускорителях, общее время обмена данными при использовании MTIA 300 в 3,9 раза меньше, чем у эквивалентного кластера на базе GPU.

 Источник изображения: ***

Источник изображения: Meta

В MTIA 300 сетевой интерфейс находится внутри самой упаковки микросхемы. Два 5-нм сетевых чиплета, каждый из которых содержит по шесть специализированных 800GbE RoCE-адаптеров, обеспечивают общую пропускную способность I/O 1,2 Тбайт/с без пересечения c шиной PCIe. Это устраняет узкое место в цепочке «хост-устройство-NIC», присутствующей в традиционных архитектурах GPU, где CPU должен выступать посредником между ускорителем и сетью, и позволяет избежать перегрузки PCIe между ускорителем и NIC. При этом NIC можно гибко использовать для масштабирования.

Поскольку используются одни и те же 12 NIC на базе Ethernet для вертикального масштабирования (внутри стойки из 16 узлов, до 1 Тбайт/с) и горизонтального масштабирования (между стойками, до 200 Гбайт/с), можно гибко распределять NIC в соответствии с меняющимися потребностями. По мере изменения требований модели можно переконфигурировать сеть, а не само оборудование. Для минимизации задержки транзакций разработчики внедрили экспресс-оповещения (doorbell). Сама запись запроса на выполнение служит оповещением, исключая дополнительное чтение из памяти и экономя около 800 нс на операцию.

 Источник изображения: ***

Источник изображения: Meta

В случае GPU библиотеки вроде NCCL реализуют операции коллективных коммуникаций в виде вычислительных ядер (kernel), которые используют те же ресурсы, что нужны для вычислений при обучении. Пересечение коллективных операций и операций обучения приводит к замедлению обоих и того, и другого. В MTIA 300 использовали другой подход. Наряду с матрицей из 72 3-нм вычислительных элементов (PE), чип включает 16 выделенных механизмов обработки сообщений (ME), которые обрабатывают всю коммуникацию независимо.

ME содержит ядро RISC-V для оркестрации; сетевой интерфейс, который направляет запросы к нужному NIC; вычислительный блок Near-Memory Computing (NMC), который выполняет операции редукции со скоростью 128 байт/цикл. Расположенные по краям чипа, рядом с HBM и кешем, NMC в совокупности обеспечивают пропускную способность редукции более 2,8 Тбайт/с — более чем вдвое превышающую пропускную способность I/O. Это позволяет выполнять коллективные операции AllReduce и ReduceScatter на линейной скорости NIC без использования ресурсов PE.

 Источник изображения: ***

Источник изображения: Meta

В результате обеспечивается практически идеальная изоляция операций. Одновременное выполнение больших GEMM-операций с коллективными операциями приводит к снижению вычислительной пропускной способности менее чем на 0,5 %, в отличие от традиционных GPU, где снижение может превышать 20 % из-за использования одних и тех же ресурсов на обмен данными и вычисления.

Разработанная совместно с MTIA 300 библиотека HCCL вместо управления обменом данными с хостом во время выполнения компилирует каждую коллективную операцию в полный набор подграфов (массивы очередей задач с явным указанием зависимостей), которые отправляются на ME для полностью автономного выполнения. Таким образом, хост лишь единожды отправляет ускорителю набор сетевых инструкций и более не вмешивается в работу сети.

 Источник изображения: ***

Источник изображения: Meta

По словам Meta, такая архитектура естественным образом интегрируется с PyTorch. Коллективные операции компилируются в единый граф вместе с вычислительными задачами. HCCL сама выбирает алгоритмы, учитывающие топологию сети и асимметричность полос пропускания, по возможности минимизируя межстоечный трафик. Для инференса были разработаны дополнительные пути: односторонняя коммуникация, когда PE используют экспресс-оповещения, и параллельный запуск коллективных операций по сигналу от kernel'а без прерывания работы последнего.

Компания отметила, что MTIA 300 имеет и другие плюсы 216 Гбайт HBM3E (6,1 Тбайт/с) позволяют разместить больше данных на одном чипе, а не загружать их лишний раз извне; на каждый ускоритель приходится всего один CPU, что позволяет нагружать его интенсивными вычислениями на некоторых этапах; высокая пропускная способность сети позволяет при необходимости использовать форматы данных с более высокой точностью.

Хотя сочетание умеренной FP-производительности с ёмкой и быстрой HBM в MTIA 300 изначально было оптимизировано для обучения DLRM, эти качества позволяет эффективно использовать чипа для более широкого спектра нагрузок, включая инференс моделей генеративного ИИ. Стоит отметить, что подход Meta с внедрением NIC непосредственно в чип не нов сам по себе. Например, чипы Intel/Habana Gaudi2, представленные в 2022 году, использовали 24 100GbE-интерфейса RoCE для вертикального и горизонтального масштабирования.

Постоянный URL: http://servernews.ru/1147478
27.08.2026 [08:59], Владимир Мироненко

OpenAI: Jalapeño опередил в тестах чипы NVIDIA

OpenAI сообщила новые подробности об ИИ-ускорителе Jalapeño, разработанном в сотрудничестве с Broadcom, пишет The Register. Как утверждает OpenAI, Jalapeño, предназначенный для инференса, показал в тестах лучше результаты, чем текущая линейка ускорителей NVIDIA — GB200 и GB300.

Тестирование в бенчмарк-пакете SemiAnalysis InferenceX показало, что системы OpenAI на базе Jalapeño обеспечивают в 1,5–1,9 раза больший объём «работы ИИ» при пиковой пропускной способности и в 1,7–3,6 раза меньшую сквозную задержку, чем у конкурентов, на GPT-OSS-120B, DeepSeek R1 670B и Kimi K2.5 1T.

Во время внутренних тестов Jalapeño также хорошо показал себя при работе с некоторыми крупными, продвинутыми моделями OpenAI, которые ещё не выпущены. Это говорит о том, что конструкция чипа «становится более ценной по мере роста рабочих нагрузок и повышения их сложности», сообщила компания в блоге.

На системном уровне стойка со 128 ускорителями Jalapeño обеспечивает 1,7 Эфлопс 4-бит вычислений, имеет 27,5 Тбайт HBM4 с агрегированной пропускной способностью чуть менее 2 Пбайт/с. Чип сочетает вычислительный кристалл с шестью стеками HBM4 общим объёмом 216 ГиБ (15,4 Тбайт/с), обеспечивая производительность 13,4 Пфлопс в операциях MXFP4, и масштабируется до 27 Эфлопс и 432 ТиБ памяти в системе из 2048 ASIC.

 Источник изображений: OpenAI/ServeTheHome

Источник изображений: OpenAI/ServeTheHome

Поскольку чип демонстрирует высокие результаты при низком энергопотреблении — 700 Вт — Jalapeno позволит OpenAI экономить средства при эксплуатации своих ЦОД, где электроэнергия является ключевой статьей расходов, заявил агентству Bloomberg вице-президент по аппаратному обеспечению OpenAI Ричард Хо (Richard Ho). Новейшие стоечные системы AMD и NVIDIA работают быстрее, обеспечивая в 1,46–2 раза больше вычислительных ресурсов и до 12 % больше памяти (Helios), но имеют всего лишь 85 % пропускной способности памяти стойки OpenAI.

Ричард Хо сообщил, что чип был разработан для минимизации перемещения данных и хранения промежуточных операций. «Мы разработали Jalapeño таким образом, чтобы минимизировать перемещение данных и задержки связи. Это означает, что состояние модели, включая KV-кеш, используемый при генерации ответа, может быть явно размещено и храниться локально, пока система активирует правильную комбинацию вычислительных ресурсов, памяти и сети для каждой фазы инференса», — сообщила компания в своем блоге.

В отличие от стоек NVIDIA Groq LPX, Jalapeño не является узкоспециализированным решением. В компании сообщили ресурсу The Register, что он оптимизирован как для ресурсоёмких операций предварительного заполнения, где обрабатываются промты, так и для фазы декодирования, требующей большой пропускной способности памяти, где генерируются выходные токены.

Также следует отметить, что благодаря использованию ИИ для проектирования архитектуры и оптимизации чипа для инференса, OpenAI потратила на его разработку от начала до готовности первого пробного чипа всего девять месяцев. Процесс включал использование собственных моделей для оптимизации механизмов обработки инференса и для написания пользовательских ядер по мере внедрения новых моделей.

Преимущество Jalapeño в скорости настолько велико, что OpenAI может получать результаты, ранее достижимые только с помощью чипов, использующих другой тип памяти и конструкцию. Например, в настоящее время OpenAI использует чипы Cerebras для некоторых своих LLM, которые, по словам Хо, лучше всего подходят для небольших моделей. Jalapeño, напротив, может обрабатывать более крупные модели, отметил он.

Тем не менее, компания не собирается отказываться от сотрудничества с другими поставщиками, включая NVIDIA. «У нас огромная потребность в вычислительных мощностях, поэтому мы привлекли так много разных поставщиков, — сказал он. — Это будет продолжаться ещё некоторое время». Ожидается, что Jalapeño будет выпущен в ограниченных объёмах в конце этого года с дальнейшим увеличение производства в следующем году.

Вторая версия Jalapeño находится на продвинутой стадии разработки, готовность к производству ожидается в «ближайшие месяцы», сказал Хо. Также уже разрабатывается концепция чипа третьего поколения. The Register призвал относиться с осторожностью к заявлениям OpenAI. Новый чип тестировался в сравнении с системами NVIDIA GB200 NVL72 и GB300 NVL72, выпущенными в 2024 и 2025 годах соответственно, но не сравнивался с Vera Rubin, поставки которого только начались.

Постоянный URL: http://servernews.ru/1147525
26.08.2026 [12:45], Сергей Карасёв

32 ядра Xe3P и до 480 Гбайт памяти LPDDR5X: Intel раскрыла детали об ИИ-ускорителе Crescent Island

Intel поделилась информацией об ИИ-ускорителях Crescent Island, предназначенных для использования в серверах и рабочих станциях. Ожидается, что поставки образцов изделий начнутся в текущем полугодии.

Решения Crescent Island будут предлагаться в виде карт расширения с интерфейсом PCIe 5.0 x16. Конфигурация включает 32 ядра Xe3P и 256 матричных движков XMX. Кроме того, задействованы 256 векторных движков. На каждое ядро приходится 1 Мбайт регистра общего назначения (GRF) и 512 Кбайт кеша L1. Помимо этого, есть 32 Мбайт унифицированного кеша L2.

В случае Crescent Island корпорация Intel решила отказаться от использования дорогостоящей памяти НВМ с высокой пропускной способностью. Вместо этого применяются чипы LPDDR5X с пониженным энергопотреблением (скоростные характеристики не раскрываются). Референсный вариант ускорителя несёт на борту 160 Гбайт LPDDR5X, тогда как ODM-производители будут предлагать модификации, имеющие до 480 Гбайт памяти. Заявленное энергопотребление карты находится на уровне 350 Вт; применяется воздушное охлаждение.

 Источник изображений: Intel

Источник изображений: Intel

Изделие поддерживает различные форматы данных — FP64, FP16, BF16, TF32, INT8, INT4, FP8 и FP4. Ускоритель ориентирован прежде всего на задачи инференса. Он хорошо подходит для работы с агентным ИИ и длинными контекстами, где ключевой фактор эффективности — возможность размещения модели и её KV-кеша в памяти. Отмечается, что рабочая станция, оборудованная четырьмя ускорителями Crescent Island с 480 Гбайт памяти, сможет использовать в локальном режиме модели с триллионом параметров, например, Kimi K3. В области программного обеспечения Intel указывает на поддержку vLLM, SGLang, llm-d и NVIDIA Dynamo, что позволяет ИИ-агентам функционировать в гетерогенной инфраструктуре без изменений в коде.

Постоянный URL: http://servernews.ru/1147462
25.08.2026 [18:35], Владимир Мироненко

IBM объединила архитектуры z и Arm в одном CPU для будущих мейнфреймов

IBM анонсировала первый двухархитектурный процессор для мейнфреймов, который позволит запускать операционные системы и приложения на вычислительных платформах IBM (s390x) и Arm (AArch64) в будущих системах IBM z и LinuxONE. Компания отметила, что это первый этап в разработке процессора, достигнутый в рамках сотрудничества с Arm, стартовавшего в апреле 2026 года.

 Источник изображения: IBM

Источник изображения: IBM

2-нм процессор будет содержать 11 доступных двухпоточных (SMT 2) ядер, работающих на частоте более 5,7 ГГц, ускорители ИИ-инференса, специально разработанные для обнаружения мошенничества в финансовых транзакциях в режиме реального времени, выделенный встроенный DPU для ускорения I/O и большую кеш-архитектуру для ресурсоёмких корпоративных рабочих нагрузок с большими частными кешами L2 объёмом по 36 Мбайт, из которых формируются виртуальные L3/L4-кеши. Как отметил ресурс ServeTheHome, виртуальный L3 даёт 432 Мбайт, в то время как L4, объединяя все кеши всех ядер, обеспечит до 3,5 Гбайт памяти с очень низкой задержкой, что полезно для корпоративных рабочих нагрузок, таких как обработка транзакций и обслуживание баз данных.

 Источник изображений: IBM/ServeTheHome

Источник изображений: IBM/ServeTheHome

Компания отметила, что архитектура чипа не предусматривает отдельных ядер Arm и IBM: каждое процессорное ядро может одновременно выполнять инструкции Arm и IBM Z, или Arm и LinuxONE, отдавая приоритет установленным характеристикам платформы: производительности, безопасности, шифрования и доступности. Платформы IBM Z и LinuxONE способны масштабироваться до сотен ядер и десятков терабайт памяти.

Подчёркивается, что ключевым моментом является то, что IBM реализовала AArch64 на аппаратном уровне, а не путём трансляции. В этом проекте используется реализация Arm с порядком байтов little-endian поверх архитектуры z/Architecture с порядком байтов big-endian. Заявлена поддержка Armv9.3, SVE и SVE2 — всего 2792 инструкции, что более чем в два раза больше, чем z-инструкций. IBM также заявляет о соответствии стандарту Arm SystemReady, что важно для совместимости с имеющимся ПО. Приложения Arm видят собственный полноценный процессор Arm, работая без изменений «из коробки».

IBM говорит, что новый чип эффективно объединит две крупнейшие в мире вычислительные экосистемы, которые до сих пор были изолированы друг от друга. Мейнфреймы IBM z и системы LinuxONE составляют основу мировой экономики, обрабатывая, по оценкам аналитиков, около 70 % всех финансовых транзакций в мире, а также огромные объёмы данных в сфере здравоохранения. В свою очередь, программную экосистему Arm поддерживает более 22 млн разработчиков по всему миру. Она охватывает широкий и постоянно растущий спектр облачных и периферийных приложений, включая облачное ПО и ПО для ИИ.

Предсказатель ветвлений демонстрирует, как существующая конструкция ядра IBM z может использоваться и для AArch64. Используется XML-описание архитектуры Arm для автоматического декодирования инструкций, диспетчеризации и отправки на исполнение. Переиспользуется возможность переименования регистров и основные пути исполнения инструкций, а также некоторые CISC-решения вроде копирования и очистки памяти. Но разработчиком всё равно пришлось добавить новые элементы управления для SVE, а также пути исполнения для FP16/Bfloat16 и криптографических функций.

Встроенные ускорителям для криптографии, сжатия и инференса отображаются для Arm ПО представляются в качестве платформенных устройств в Linux на Arm. При этом процессор способен одновременно выполнять инструкции обеих ISA с сохранением сквозной проверки массивов и потоков данных/управления, прозрачного восстановления после нерегулярных сбоев, резервирования/замещения ядер при постоянных сбоях, параллельного восстановления и технологии аппаратной защиты оперативной памяти RAIM. Эта конструкции обеспечивает надёжность с целевым показателем доступности 99,999999 %.

На программном уровне для запуска Linux-приложений для обеих архитектур используются KVM и OpenShift, которые, как нативные приложения z/OS, используют логически разделы, работающие на одном физическом процессоре. А каждый поток может работать как с инструкциями s390x, так и с Arm, при этом переключение занимает наносекунды. Такое сосуществование является залогом получения наилучших результатов от обеих программных экосистем, позволяя клиентам сохранять код для мейнфреймов, одновременно используя широкую базу ПО Arm, пишет SiliconANGLE.

Дополнит новый CPU ускоритель ИИ-инференса второго поколения, который ориентирован на более крупные корпоративные рабочие нагрузки. Он содержит 16 активных ИИ-ядер (и одно резервное) с поддержкой FP4 и MXFP4, которые, по словам IBM, могут обеспечить четырёхкратное увеличение TOPS. Он получит 96 Гбайт HBM3e с ПСП до 4 Тбайт/с и PCIe 6.0 в качестве интерфейса одноранговой сети с низкой задержкой. IBM позиционирует чип как компонент для критически важных ИИ-систем, обеспечивающий надёжные вычисления, защищающие данные и модели в состоянии покоя, при передаче и использовании, в том числе с использованием криптографии с квантовой защитой.

Как пишет SiliconANGLE, финансовые компании, работающие в условиях жёсткого регулирования, не могут отказаться от использования мейнфреймов и LinuxONE, известных своей исключительной безопасностью и надёжностью. Но для доступа к программной экосистеме Arm им приходилось отказываться от систем IBM. Новый чип меняет положение дел.

«Этот процессор представляет собой значительный архитектурный прогресс для IBM z и LinuxONE, — сказал Кристиан Якоби (Christian Jacobi), главный технический директор и научный сотрудник IBM Systems Development. — Внедряя Arm непосредственно в наши платформы, мы объединяем доступ к одной из самых быстрых программных экосистем в отрасли с качествами, которые сделали системы IBM основой для ведения бизнеса».

Двухпроцессорная архитектура IBM и Arm потенциально может способствовать новой волне внедрения ИИ компаниями в отраслях с жёстким регулированием. Вскоре разработчики смогут писать код для Arm и развёртывать его непосредственно на мейнфреймах, так что устаревшие аппаратные системы IBM останутся актуальными ещё долгие годы. Сообщается, что новый процессор будет доступен для клиентов в 2028 году.

Это не первая попытка IBM скрестить две ISA в одном чипе. В 1994 году компания анонсировала процессор PowerPC 615, который объединил бы x86 и PPC, причём на уровне сокета он был совместим именно с Pentium-платформами, что, как ожидала IBM, привлечёт многочисленных производителей ПК. На деле чип поддерживался только Minix и особой версией OS/2, тогда как Microsoft отказалась участвовать в развитии ПО для него, а MacOS на нём, по-видимому, никто запускать и не собирался. В результате чип так и остался прототипом.

Постоянный URL: http://servernews.ru/1147384
14.08.2026 [15:20], Владимир Мироненко

Круг замкнулся: Groq присоединилась к программе NVIDIA Cloud Partner

Компания Groq, основная часть сотрудников которой перешла в NVIDIA в результате сделки стоимостью $20 млрд, объявила о присоединении к программе NVIDIA Cloud Partner (NCP). В качестве партнёра NCP компания Groq сертифицирована для проектирования, развёртывания и эксплуатации в любом регионе мира систем на базе ускорителей NVIDIA в соответствии со стандартами производителя чипов.

Groq отметила, что после заключения неисключительного соглашения о лицензировании технологий обработки данных с NVIDIA и её участия в недавнем раунде финансирования, сертификация NCP формализует сотрудничество двух компаний. Компания сообщила, что статус облачного партнёра NVIDIA позволит ей повысить уровень комплексной поддержки клиентов, поскольку она сможет оснащать свои существующие ЦОД новейшими технологиями NVIDIA. Идёт ли речь исключительно об ускорителях LPU или о GPU тоже, не уточняется.

Для масштабируемой обработки данных требуется глубокая интеграция по всему стеку — от вычислительных ресурсов и сетей до ПО и операций, отметила Groq. «Поэтому это сотрудничество важно: оно объединяет наши компании в понимании того, как должна строиться и эксплуатироваться современная инфраструктура ИИ», — добавила она. NVIDIA в рамках сделки не досталось облако GroqCloud, на обслуживание которого в формально до сих пор независимой Groq было оставлено минимум персонала.

 Источник изображения: Groq

Источник изображения: Groq

Groq заявила, что, управляя ЦОД в Северной Америке, Европе, на Ближнем Востоке и в Азиатско-Тихоокеанском регионе, а также обеспечивая более 6 млн разработчиков и тысячам компаний в сфере ИИ возможность создания приложений в GroqCloud, генерируя триллионы токенов каждую неделю, она является единственной в мире компанией с практическим опытом масштабного развёртывания и управления LPU. «Мы масштабируемся до более чем 200 МВт по мере роста спроса на обработку данных», — отметила компания.

«Стать облачным партнёром NVIDIA — это естественный следующий шаг в нашем сотрудничестве с NVIDIA. Это подтверждает то, что наши клиенты уже знают: Groq управляет инфраструктурой ИИ по самым высоким стандартам в любой точке мира. Инференс становится крупнейшим и наиболее важным уровнем ИИ, и мы намерены управлять им лучше, чем кто-либо другой», — заявил генеральный директор Groq.

Постоянный URL: http://servernews.ru/1146832
07.08.2026 [16:50], Владимир Мироненко

AMD купила разработчика ИИ-ускорителей Taalas

AMD объявила о достижении окончательного соглашения о приобретении Taalas, канадского разработчика ускорителей для ИИ-инференса из Торонто. Финансовые подробности сделки не раскрываются. С момента основания в 2023 году Taalas привлекла в общей сложности $219 млн венчурных инвестиций в рамках трёх раундов финансирования, включая последний на $169 млн в феврале этого года. AMD сообщила, что технология Taalas дополнит полнофункциональную ИИ-платформу AMD, включая стоечные решения Helios, Instinct, EPYC, ROCm и расширяющуюся экосистему ИИ компании.

Покупая Taalas, компания AMD решает те же задачи, что и NVIDIA при покупке Groq за $20 млрд в декабре прошлого года, говорят аналитики: сделать высокопроизводительные «премиальные» сервисы инференса, востребованные для ИИ-агентов, быстрее и дешевле в использовании. Taalas разрабатывает чипы, ориентированные на конкретные ИИ-модели, что обеспечивается путём прямой интеграции их весов в «кремний» вместе со значительным объёмом высокоскоростной памяти SRAM.

 Источник изображения: AMD

Источник изображения: AMD

Этот подход отличается от традиционных решений для инференса, которые полагаются на универсальные GPU. При этом он позволяет снизить задержку и вычислительные затраты за счёт устранения необходимости обращения к внешней памяти во время процесса инференса. Ресурс The Register отметил, что Taalas не раскрывает принцип работы своих чипов, но известно, что они состоят из двух основных областей: микросхемы памяти с маской (Mask-ROM), где вытравливаются веса модели, и собственно SRAM, где хранятся KV-кеши и т.д.

Что важно, технология Taalas — это не просто концептуальная разработка. В феврале компания представила свой первый тестовый чип HC1, изготовленный по 6-нм техпроцессу TSMC с площадью кристалла 815 мм2, который содержит 53 млрд транзисторов. Первоначальные тесты показали, что чип обрабатывает Meta Llama 3.1 8B со скоростью 16 960 токенов в секунду — на момент анонса в феврале прошлого года это было в 48 раз быстрее, чем NVIDIA H200, и в 8,5 раза быстрее, чем ускорители Cerebras.

 Источник изображения: Taals

Источник изображения: Taals

Taalas разработала совместно с TSMC оптимизированный для литографического производства рабочий процесс, который позволяет клиентам перейти от весов моделей к развёртываемым PCIe-картам, работающим с реальным инференсом, примерно за два месяца, говорит генеральный директор Taalas Любиша Байич (Ljubisa Bajic), о чём пишет ресурс CNBC. Это значительно быстрее по сравнению с традиционными циклами разработки заказных чипов, что делает кастомные кремниевые микросхемы более доступными для компаний, которые ранее не могли позволить себе разработку ASIC из-за высокой стоимости.

В чипе HC2 второго поколения, который должен выйти этим летом, Taalas планирует увеличить количество параметров ИИ-модели до 20 млрд. При обработке больших ИИ-моделей, как и при использовании GPU, веса просто распределяются между несколькими ускорителями с использованием конвейерного параллелизма. Таким образом, для модели с 1 трлн параметров понадобится всего 50 ускорителей HC2, и у AMD как раз есть вычислительная платформа стоечного масштаба и собственная команда разработчиков систем. Это решение компактнее и энергоэффективнее NVIDIA LPX, для работы которого потребуется несколько десятков GPU и как минимум 2000 LPU Groq, отметил The Register.

 Источник изображения: Taals

Источник изображения: Taals

Альтернативные чипы, разработанные Taalas и Groq, особенно важны для приложений с «низкой задержкой», где время до первого ответа от ИИ-модели имеет большое значение. «Я твёрдо убеждена, что в отношении чипов нет универсального решения», — заявила генеральный директор AMD Лиза Су (Lisa Su) в июле. Она добавила, что AMD прогнозирует, что GPU будут и дальше составлять большую часть рынка ИИ-чипов, поскольку они достаточно гибкие, чтобы поддерживать новые ИИ-модели. Впрочем, AMD недавно заключила соглашение с Cerebras, которое тоже ориентировано на сверхбыстрый инференс.

Разрабатывая чип специально для конкретной модели, компания жертвует гибкостью ради эффективности. Специализация позволяет сократить рабочую нагрузку, переведя её в более прямой поток данных, что снижает вычислительные и оперативные издержки, присущие универсальным решениям. Но стойку, построенную для использования одной модели, нельзя просто перенастроить при изменении модели. Это делает подход Taalas наиболее привлекательным для стабильного, высокопроизводительного инференса, который, по словам AMD, является наиболее быстрорастущим сегментом ИИ-рынка.

При этом Taalas утверждает, что изменение весов, размеров матрицы и других важных параметров требует изменения всего двух слоев маски. Это означает, что даже если для каждой модели потребуется много разных чипов, количество дорогостоящих масок, которые необходимо будет изготовить, намного меньше, чем если бы, например, пришлось изготавливать два разных GPU, пишет ServeTheHome.

Постоянный URL: http://servernews.ru/1146457
05.08.2026 [00:34], Владимир Мироненко

Samsung запустила в Южной Корее NPUaaS на базе ИИ-ускорителей FuriosaAI RNGD

Компания Samsung SDS запустила в Южной Корее сервис NPU-as-a-Service (NPUaaS) с использованием ИИ-ускорителей RNGD южнокорейского стартапа FuriosaAI. Теперь они доступны в облачной платформе Samsung, пишет Data Center Dynamics. Как утверждает компания, это первый сервис в стране с использованием этих чипов.

ИИ-ускорители RNGD, построенные на 5-нм архитектуре Tensor Contraction Processor (TCP), обеспечивают вычислительную мощность 512 Тфлопс в режиме FP8 при TDP в пределах 180 Вт. Сервер может включать до восьми ускорителей RNGD, что позволяет его использовать для задач агентного ИИ.

«Предоставление RNGD через Samsung SDS обеспечивает предприятиям новый способ развёртывания инфраструктуры для ИИ-инференса без необходимости управления соответствующим оборудованием», — сообщил Джун Пайк (June Paik), генеральный директор FuriosaAI.

 Источник изображения: developer.furiosa.ai

Источник изображения: developer.furiosa.ai

Samsung SDS развернула чипы RNGD в своем ЦОД Dongtan IDC в Донтане (Dongtan) и уже виртуализировала сервер NXT RNGD от FuriosaAI, предоставляя доступ к инстансам в конфигурациях по запросу с 1, 2, 4 или 8 картами. ЦОД Dongtan IDC занимает шесть этажей и включает четыре серверных зала. Благодаря использованию естественного воздушного охлаждения его показатель PUE составляет 1,12.

Постоянный URL: http://servernews.ru/1146268
04.08.2026 [17:31], Сергей Карасёв

ASUS выпустила «ИИ-брелок» UGen300 USB AI с ускорителем Hailo-10H и 8 Гбайт RAM

Компания ASUS начала продажи внешнего ИИ-ускорителя UGen300 USB AI, предназначенного для использования с ноутбуками, смартфонами, одноплатными компьютерами и пр. Новинка выполнена в виде USB-брелока, который можно подключать к устройствам с архитектурой x86 и ARM под управлением Linux, Windows и Android.

В основу UGen300 USB AI положен чип Hailo-10H, обеспечивающий ИИ-производительность до 40 TOPS в режиме INT4 и до 20 TOPS на операциях INT8. Объём встроенной памяти LPDDR4-4266 равен 8 Гбайт. Заявленное энергопотребление — 2,5 Вт. Подключение осуществляется через порт USB 3.1 Type-C (10 Гбит/с). Габариты составляют 105 × 50 × 18 мм, масса — 150 г.

Ускоритель даёт возможность локально запускать небольшие LLM, VLM и другие модели генеративного ИИ, снижая зависимость от облачных сервисов. Отсутствие необходимости передачи данных на удалённые серверы повышает уровень кибербезопасности, говорит ASUS. Говорится о совместимости с популярными фреймворками, включая Keras, TensorFlow, TensorFlowLite, PyTorch и ONNX.

 Источник изображений: ASUS

Источник изображений: ASUS

Приобрести ИИ-ускоритель UGen300 USB AI можно по ориентировочной цене в $300. Готовится также более доступный вариант изделия, оборудованный 2 Гбайт RAM, однако эта модификация пока недоступна для заказа. Среди потенциальных сфер применения названы обучение навыкам работы с ИИ, создание прототипов различных ИИ-устройств и разработка сервисов с нейросетевыми алгоритмами, такими как компьютерное зрение, обнаружение объектов, классификация изображений и пр.

Постоянный URL: http://servernews.ru/1146245
25.07.2026 [21:30], Сергей Карасёв

ИИ-платформа Liqid UltraStack объединяет 30 ускорителей AMD Instinct MI350P

Компания Liqid объявила о стратегическом сотрудничестве с AMD, направленном на создание решений следующего поколения для ИИ-инфраструктур. В рамках партнёрства представлена аппаратная платформа Liqid UltraStack 30, оптимизированная для задач инференса.

В состав системы входят сервер с двумя процессорами AMD EPYC 9005 Turin и коммутатор Liqid PCIe Fabric Switch. Ключевыми компонентами являются три GPU-блока, каждый из которых содержит десять ускорителей AMD Instinct MI350P (144 Гбайт памяти HBM3E с 4096-бит шиной). Таким образом, в общей сложности задействованы 30 названных карт и 4,3 Тбайт памяти HBM3E.

Заявленная производительность достигает 69 Пфлопс в режиме FP8. Говорится о возможности работы с общими пулами памяти по высокоскоростному стандарту CXL. Суммарное энергопотребление платформы находится на уровне 22 кВт. По заявлениям Liqid, система обеспечивает 3,7-кратный прирост показателя токенов в секунду по сравнению с традиционными решениями. Количество токенов в пересчете на $1 увеличивается в 2,1 раза, а токенов на 1 Вт затрачиваемой энергии — в 1,8 раза. Затраты на развёртывание могут быть уменьшены на 65 %.

 Источник изображения: Liqid

Источник изображения: Liqid

Программное обеспечение Liqid Matrix объединяет GPU-ускорители и в реальном времени распределяет их ресурсы между рабочими нагрузками через высокоскоростную PCIe-шину. При этом все карты остаются в пределах одного узла. В целом, платформа Liqid UltraStack 30, как утверждается, устраняет накладные расходы, связанные с использованием нескольких узлов, обеспечивает предсказуемое линейное масштабирование и доводит загрузку GPU почти до 100 %. Упомянута поддержка Kubernetes для работы с несколькими моделями.

Постоянный URL: http://servernews.ru/1145732
24.07.2026 [11:58], Сергей Карасёв

AMD и Cerebras представили платформу для ИИ-инференса со сверхнизкой задержкой

Компании AMD и Cerebras Systems объявили о сотрудничестве, в раках которого планируется вывод на рынок новой аппаратной платформы для ИИ-инференса со сверхнизкой задержкой и высокой пропускной способностью. Речь идёт об объединении стоечных решений AMD Helios и ускорителей Cerebras Wafer-Scale Engine (WSE). Это своего рода ответа на интеграцию Groq в платформу NVIDIA Vera Rubin.

Напомним, система Helios двойной ширины объединяет процессоры EPYC Venice с ядрами Zen 6, ускорители Instinct MI400 и DPU Vulcano. Данная платформа спроектирована специально с прицелом на ресурсоёмкие ИИ-задачи. В свою очередь, изделия WSE, насчитывающие сотни тысяч ядер, оптимизированы для сверхбыстрого обучения и запуска ИИ-моделей.

Совместное решение AMD и Cerebras объединяет сильные стороны Helios и WSE в общий рабочий процесс для достижения максимальной производительности и эффективности инференса. В частности, формируется дезагрегированная среда, в которой два основных этапа задачи оптимизируются независимо друг от друга. Стойки Helios обеспечивают сверхвысокую пропускную способность, обрабатывая запросы и большие контекстные окна. Ускорители WSE при этом отвечают за генерацию токенов с минимальной задержкой.

 Источник изображения: Cerebras

Источник изображения: Cerebras

В целом, новая платформа AMD и Cerebras, как утверждается, даёт возможность повысить показатель токенов в секунду на ватт (Т/с/Вт) в пять раз по сравнению с конфигурациями, в которых используются только лишь изделия WSE (при работе с мультимодальной моделью Kimi 2.6 1T, насчитывающей 1 трлн параметров). В рамках партнёрства с AMD компания Cerebras намерена развернуть системы Helios в своих дата-центрах. Новое аппаратное решение станет доступно клиентам через облако Cerebras Cloud во II половине текущего года.

Постоянный URL: http://servernews.ru/1145670

Входит в перечень общественных объединений и религиозных организаций, в отношении которых судом принято вступившее в законную силу решение о ликвидации или запрете деятельности по основаниям, предусмотренным Федеральным законом от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности»;