Материалы по тегу: сети

11.09.2026 [08:51], Владимир Мироненко

ЦОД как чип: Meta✴ и Panmnesia предложили CXL-фабрику размером с целый дата-центр

Компания Meta✴ и южнокорейский стартап Panmnesia, специализирующийся на разработке интерконнекта для ИИ-инфраструктур, представили архитектуру ИИ ЦОД нового поколения, в которой весь дата-центр функционирует как единый чип. Описание архитектуры опубликовано в журнале Nature Reviews Electrical Engineering (NREE), входящем в портфолио издательства Nature.

В исследовании отмечено, что в современных дата-центрах ускорители внутри одной стойки могут взаимодействовать через высокоскоростные интерфейсы для вертикального масштабирования (scale-up), тогда как трафик, выходящий за пределы стойки, обычно опирается на более медленные сети с горизонтальным масштабированием (scale-out), такие как Ethernet или InfiniBand.

 Источник изображений: Panmnesia

Источник изображений: Panmnesia

Компании отметили, что для эффективной работы ИИ ЦОД необходимы контроль и координация как внутри стоек с GPU, памятью и СХД, так и между ними. В масштабной ИИ-инфраструктуре снижение вариативности задержек (джиттера) между устройствами — чтобы весь ЦОД функционировал предсказуемо — имеет такое же значение, как и повышение производительности отдельных устройств или скорости каналов связи.

Meta✴ и Panmnesia предлагают взять за основу стандарт CXL, дополнив его новыми возможностями по объединению нескольких стоек с GPU для минимизации колебаний задержки при передаче данных за пределы каждой отдельной стойки. Конечная цель — создать дата-центр, работающий столь же предсказуемо, как отдельный чип.

В этой схеме расширенный CXL обеспечивает когерентность кеш-памяти между стойками ускорителей, поддерживая большее количество устройств по сравнению со стоечными решениями NVIDIA уровня GB200 NVL72 (на базе NVLink) и UALink. Для минимизации и ограничения вариативности задержек предлагается использовать три специализированных аппаратных компонента: неблокирующий коммутатор с высокой плотностью портов, блок ускорения передачи данных и контроллер сетевой фабрики.

Неблокирующий коммутатор с большим количеством портов (high-fan-out) обеспечивает одновременное подключение множества устройств, сокращая количество переходов (hop) и выравнивая длину путей прохождения сигнала независимо от источника. Блок ускорения передачи (Link Acceleration Unit, LAU) переносит повторяющиеся операции обработки протокола в каждой точке соединения на специализированный аппаратный конвейер, обеспечивая стабильность системы на уровне отдельных этапов передачи и ограничивая колебания задержки.

Контроллер фабрики (Fabric Controller) применяет единую политику упорядочивания запросов во всей системе, обеспечивая согласованную обработку транзакций через все устройства. Для преодоления физических ограничений дальности передачи электрических сигналов рассматривается использование оптических каналов связи (CXL-over-optics) для увеличения радиуса действия фабрики CXL. Консорциум PCI-SIG уже работает над оптической версией PCIe, да и первые чипы тоже уже были анонсированы.

По словам Panmnesia, комбинированный контроллер фабрики CXL/PCIe и блок LAU уже прошли проверку работоспособности на кремниевых чипах; также изготовлен коммутатор фабрики, и начаты поставки предсерийных образцов.

Архитектура решения предусматривает группировку CPU, ускорителей, памяти и коммутаторов по функциональному признаку в модули (узлы), объединение модулей в группы (поды) и объединение подов посредством коммутационной фабрики. Такая упорядоченная иерархия призвана обеспечить стабильные пути передачи данных с фиксированным количеством сетевых переходов и предсказуемыми временными характеристиками.

По сравнению с NVIDIA GB200 NVL72 данная схема:

  • увеличивает в 8 раз количество ускорителей, непосредственно управляемых одним CPU (с 2 до 16);
  • позволяет объединить до 960 ускорителей для совместной работы в рамках единого домена когерентности;
  • сокращает задержку доступа к данным с микросекундного уровня до нескольких сотен наносекунд (примерно на порядок);
  • повышает отказоустойчивость, поскольку при сбоя замене подлежит не весь сервер, а лишь отдельное устройство.

«Объединение устройств такого масштаба в единую среду выполнения позволит обучать гораздо более крупные ИИ-модели без прерывания процесса или одновременно запускать несколько сервисов на общей инфраструктуре, исключая взаимное замедление их работы», — отметили компании. При этом платформы с PCIe/CXL-интерконнектом уровня стойки уже есть — например, Liqid UltraStack.

Постоянный URL: http://servernews.ru/1148278
09.09.2026 [15:27], Руслан Авдеев

5 Пбит/с на 200 км: Telecom Egypt проложит подводный интернет-кабель между Шарм-эль-Шейхом и Табой

Telecom Egypt расширит инфраструктуру своих кабелей, проложенных вдоль Синайского полуострова с помощью нового кабеля протяжённостью около 200 км. Он свяжет города Шарм-эль-Шейх и Таба, обеспечив дополнительный цифровой маршрут в одном из ключевых телекоммуникационных «коридоров», связывающих Европу и Азию. Система обойдётся без усилителей и обеспечит пропускную способность порядка 5 Пбит/с. Ввод в эксплуатацию запланирован на IV квартал 2027 года, сообщает Converge! Digest. За реализацию проекта отвечает Power Sub Link (PSL).

Прокладка нового участка позволит продлить уже имеющуюся у Telecom Egypt кабельную систему Red Sea Subsea Festoon к северу до Табы, обеспечив клиентам непрерывную подводную цифровую магистраль, соединяющую Суэц, Зафарану, Рас-Гареб, Шарм-эш-Шейх и Табу. Трафик сможет переходить от сетей в Красном море через египетский «интернет-коридор» Internet Corridor of Egypt (ICE) в направлении Средиземноморья. Новый кабель увеличит количество доступных маршрутов, увеличит устойчивость местной сети и повысит её пропускную способность.

Это обеспечит телеком-операторам ещё один вариант маршрута через Египет, также можно будет диверсифицировать инфраструктуру при передаче трафика между Азией, Европой и Африкой. Благодаря проекту вырастет значение Синайского полуострова в международной сети Telecom Egypt. В Табе уже размещается посадочная станция кабеля Coral Bridge (на месте более старого кабеля), прокладка которого завершилась в 2025 году. Кабель тянется до иорданской Акабы, где сойдутся кабели ANDROMEDA, Blue, FEA и Raman. Оттуда же пройдут уже наземные маршруты до акватории Средиземного моря.

 Источник изображения: Karim Elmalhy/unsplash.com

Источник изображения: Karim Elmalhy/unsplash.com

В данных Telecom Egypt для инвесторов упоминаются 16 подводных кабельных систем компании, а также 11 точек выхода на берег. Планируется и строительство новой инфраструктуры, в т.ч. наземных маршрутов через Египет. По словам представителя Telecom Egypt, проект соответствует новой стратегии компании, в рамках которой предполагается максимально усилить её роль на рынке цифровой инфраструктуры и укрепить позиции на региональном и глобальном уровнях. Проект содействует развитию восточного цифрового коридора, соединяющего Красное и Средиземное моря через Синайский полуостров.

Важность маршрута определяется не столько его протяжённостью (всего 200 км), сколько его местом в глобальной сети телекоммуникаций. Египет является естественным «мостом», позволяющим соединять кабельную инфраструктуру Азии и Ближнего Востока в Красном море с европейскими сетями через Средиземное море. Так, система Red2Med вдоль побережья Красного моря подключена к наземному кабельному маршруту ICE. Здесь же проложены крупные системы IEX и SEA-ME-WE-6.

Для международных телеком-операторов ключевое значение играет доступность разнообразных маршрутов. Внутри коридора между Азией и Европой можно создавать дополнительные варианты маршрутизации, что особенно важно в условиях политической нестабильности на Ближнем Востоке. Обрывы кабелей в Красном море, умышленные и неумышленные, редкостью не являются. Сирийские власти и вовсе подозревают, что подводный интернет-кабель, связывающий страну с Египтом, повреждён в результате «систематического саботажа». Проблем добавляет затянувшийся конфликт с Ираном. Так, уже были атакованы объекты AWS — два в ОАЭ и один в Бахрейне. Последний удар по ЦОД в Бахрейне был зарегистрирован в конце июля.

Постоянный URL: http://servernews.ru/1148183
09.09.2026 [14:28], Руслан Авдеев

Firmus вложит $300 млн в «гиперкабель» SubCo APX East, соединяющий Австралию и США

Австралийская неооблачная компания Firmus станет якорным заказчиком в новом проекте подводного кабеля APX East компании SubCo. В кабельную систему, связывающую Австралию и США, Firmus вложит $300 млн, сообщает Datacenter Dynamics. Взамен компания получит в течение 25 лет до 150 Тбит/с выделенной пропускной способности. Ранее компании объявили о строительстве подводного кабеля, соединяющего материковую Австралию с Тасманией.

По словам SubCo, требования ИИ к сетевым соединениям в корне меняют структуру спроса на международные подводные магистрали. Решение инвестора зарезервировать часть пропускной способности кабеля само по себе является свидетельством правильности выбранного SubCo направления деятельности, нацеленного на создание безопасной высокоскоростной инфраструктуры связи, которая будет необходима в Индо-Тихоокеанском регионе для технологий нового поколения.

«Гиперкабель» APX East объединит 16 оптоволоконных пар, проложенных от севера Сиднея (новый Южный Уэльс) до Сан-Диего (Калифорния). Посадочная станция в Австралии разместится в Сиднее на площадке S1/S2 компании NextDC. Предполагается, что APX East будет готов к эксплуатации в IV квартале 2028 года, а ответвление к Гавайям должны ввести в эксплуатацию в IV квартале 2029-го. Кроме того, планируется проложить ответвление к Фиджи.

Firmus строит сеть ИИ-фабрик в Австралии, но создание вычислительных мощностей — лишь одна из частей задачи, необходимо ещё и обеспечить надёжную связь инфраструктуры с остальным миром. Подчёркивается, что резервирование полосы 150 Тбит/с обеспечит необходимый масштаб для прямого соединения ИИ-инфраструктуры в Австралии с США, что позволит обслуживать ведущие мировые компании, для которых ИИ — важная часть бизнеса.

 Источник изображения: SubCo

Основанная в 2019 году компания Firmus изначально специализировалась на криптовалютах и HPC, а также на решениях с иммерсионным охлаждением. Сейчас она позиционирует себя как чистого «строителя ИИ-фабрик», а её Project Southgate — долговременная инициатива для разработки и внедрения в Австралии суверенных мощностей для инференса. Их совокупная мощность должна составить к 2028 году 1,6 ГВт. Для своих проектов компания использует проприетарную систему электроснабжения и охлаждения HyperCube.

Поддерживаемый NVIDIA бизнес располагает небольшим действующим ЦОД на Тасмании, но строит и 90-МВт ЦОД в Лонсестоне (Launceston), 52-МВт площадку в Уэсли-Вейл (Wesley Vale) и 288-МВт проект в Белл-Бей (Bell Bay). Также компания взаимодействует с CDC для строительства мощностей в материковой части Австралии, использует мощности на объекте STT GDC в Сингапуре, оснащённые системами иммерсионного охлаждения ИИ-ускорителей и готовит площадку в Батаме (Индонезия).

Ранее SubCo заявляла, что система APX East станет первым кабельным проектом между Австралией и Соединёнными Штатами, не требующим оптической «регенерации» сигнала по пути — обычно ретрансляторы ставят приблизительно через каждые 100 км. Вместо этого будет достаточно питания с одного конца кабеля. Утверждается, что APX East будет первой в мире системой подобного типа. SubCo, входящая в Soda Group, владеет кабельной системой Oman Australia Cable и строит кабельную систему SMAP, соединяющую Сидней, Мельбурн, Аделаиду и Перт. Кроме того, ей принадлежат полосы в кабельных системах Indigo.

Постоянный URL: http://servernews.ru/1148199
07.09.2026 [15:14], Владимир Мироненко

NVIDIA инвестировала в разработчика оптических коммутаторов iPronics

Испанский стартап iPronics из Валенсии, специализирующийся в области оптической коммутации (Optical Circuit Switching) на основе кремниевой фотоники для ИИ-инфраструктур, объявил о привлечении $125 млн венчурных инвестиций в рамках раунда финансирования серии B, возглавляемого совместно Maverick Silicon и Light Street Capital при участии NVIDIA и ряда существующих и новых инвесторов. С учётом нынешнего раунда общий объём финансирования компании достиг $177 млн.

Компания сообщила, что полученные средства позволят ускорить коммерческое внедрение стоечного оптического коммутатора iPronics Optical Networking Engine (ONE). Благодаря интегрированному управлению, телеметрии и API, iPronics ONE предоставляет программируемый оптический уровень, позволяющий ИИ-кластерам перенастраивать соединения в режиме реального времени для рабочих нагрузок обучения и инференса.

 Источник изображения: iPronics

Источник изображения: iPronics

Компания отметила ускорение внедрения технологии оптической коммутации (OCS) в сетях ИИ ЦОД, получившей применение в самых разных областях. По мере роста ИИ-кластеров требования к масштабируемости сетей ускоряют переход от медных кабелей к оптическим и создают потребность в новом поколении высокоплотных решений для коммутации. iPronics разработала компактную, специализированную OCS-платформу на основе кремниевой фотоники. Она же вместе с Lumentum запустила проект по стандартизации OCS в рамках OCP.

Ключевое преимущество OCS заключается в способности быстро адаптироваться к выходу из строя вычислительных чипов, что стало неизбежным, поскольку в ЦОД теперь размещаются сотни тысяч чипов. «Сбои происходят в масштабе минут — это уже не часы, месяцы или недели, — сообщил агентству Reuters основатель и главный технический директор iPronics. — Первоочередная задача — обеспечить отказоустойчивость — надёжную и отказоустойчивую сеть, способную, по сути, перестраиваться».

Компания утверждает, что её технология позволяет достичь времени переконфигурации менее миллисекунд, что открывает возможность изменения топологии непосредственно во время исполнения рабочих нагрузок, скрывая задержки во время вычислительных циклов, пишет The Register. iPronics утверждает, что она также способна достичь более высокой плотности, чем решения OCS «первого поколения». iPronics One поддерживает 32 порта на одном чипе-коммутаторе, но компания готовит чипы на 72 и 144 порта. Поскольку эти чипы созданы с использованием кремниевой фотоники, они весьма компактны, так что iPronics рассчитывает на многочиповые решения и разъёмы высокой плотности для размещения до 720 пар портов в 1U-шасси.

 Источник изображения: iPronics

Источник изображения: iPronics

Даже при задержках менее миллисекунды OCS лучше всего работает в средах, где сетевые пути меняются не так часто. Это разнится с подходом, используемым в большинстве современных стоечных систем, таких как NVIDIA NVL72 или AMD Helios, которые отдают приоритет коммуникациям All-to-All и чрезвычайному разнообразию путей. Но эти два подхода не являются взаимоисключающими. Существует несколько потенциальных вариантов использования, включая гибридные среды, объединяющие mesh-сети с коммутируемыми фабриками.

В связи со стремительным развёртыванием ИИ ЦОД, растут инвестиции в индустрию оптической коммуникации, от стартапов в области фотоники до уже существующих предприятий по производству оптического оборудования и волоконно-оптических кабелей, отметил The Register. В марте NVIDIA инвестировала $6 млрд (по $2 млрд в каждую) в Coherent, Lumentum и Marvell для развития их оптических технологий. Расширяя присутствие в США, iPronics открыла офис в Санта-Кларе (Santa Clara) в Калифорнии, и активно набирает сотрудников для «усиления своей продуктовой стратегии, развёртывания решений у клиентов и партнёрства в области ИИ-инфраструктуры».

Постоянный URL: http://servernews.ru/1148000
07.09.2026 [14:03], Владимир Мироненко

В MikroTik RouterOS нашли шесть серьёзных уязвимостей — пора срочно обновить роутеры

Команда CERT Polska, созданная для реагирования на инциденты кибербезопасности на базе Национального научно-исследовательского института Польши (NASK), сообщила об обнаружении шести уязвимостей в MikroTik RouterOS. Сочетание двух из них позволяет злоумышленнику получить полный контроль над устройством без аутентификации, если устройство поддерживает удалённый доступ по протоколу SSH.

Данные уязвимости затрагивают SSH-сервер и клиент, службу тестирования пропускной способности, обработку сертификатов X.509 и интерфейс WebFig. В связи с этим MikroTik выпустила исправления в версиях 7.25beta3, 7.24.2, 7.23.4 и 6.49.21, уведомив об этом пользователей, но не рассказав об уязвимостях. об Администраторам рекомендуется обновить свои устройства, а затем проверить конфигурацию на наличие неизвестных пользователей, скриптов, задач планировщика, прокси-серверов и туннелей.

 Источник изображения: MikroTik

Источник изображения: MikroTik

CERT Polska также опубликовала описание трёх самых серьёзных из этих уязвимостей:

  • CVE-2026-67276 — обход аутентификации SSH (рейтинг опасности CVSS: 9.2)

Используя уязвимость, злоумышленник, зная имя пользователя и открытый модуль ключа пользователя, может создать другой ключ и войти через SSH, не имея соответствующего закрытого ключа. Полученные привилегии эквивалентны привилегиям целевой учётной записи.

  • CVE-2026-86060 — манипулирование привилегиями SSH-сессии с помощью специально созданного имени пользователя (CVSS: 9.2)

RouterOS некорректно обрабатывала имена пользователей, начинающиеся с запрещённого символа, в механизме входа через SSH. Используя специально созданное имя пользователя, злоумышленник может повысить свои привилегии. В результате сессия получает полные административные привилегии в системе RouterOS.

  • CVE-2026-67277 — утечка памяти и сбой при проверке пропускной способности (CVSS: 8.8)

Сервис проверки пропускной способности позволял неаутентифицированному соединению перейти в состояние, которое должно быть доступно только после входа в систему. В сочетании с двумя отдельными уязвимостями — утечкой неинициализированных данных буфера пакетов и полным переполнением при проверке размера — это позволяет либо осуществить утечку памяти ядра, либо удалённую DoS-атаку, приводящую к перезагрузке системы.

По данным CERT Polska, указанные уязвимости RouterOS активно использовались в реальных атаках, проведённых в последние дни. Обновление до последней версии ОС обеспечивает защиту от взлома. В нём MikroTik использует механизм, который при запуске RouterOS сканирует конфигурацию на наличие известных признаков несанкционированных изменений, отключает распознанные подозрительные записи конфигурации, записывает критическое сообщение в журнал и устанавливает предупреждение (маркер Flagged). Этот механизм обнаруживает только выбранные следы после компрометации — отсутствие маркера не является доказательством безопасности устройства, поскольку могут существовать и другие необнаруженные уязвимости.

CERT Polska рекомендует немедленно обновить RouterOS до одной из версий, содержащих легальные обновления: 7.25beta3, 7.24.2, 7.23.4 или 6.49.21. «После обновления проверьте журналы на наличие сообщения о компрометации устройства и значения помеченного маркера в выводе команды /system/device-mode/print. Также проверьте конфигурацию на наличие неизвестных пользователей, скриптов и других неопознанных изменений», — сообщила команда польских программистов.

В случае отсутствия возможности установки патча, следует отключить открытые службы или заблокировать доступ к ним со всех адресов за пределами доверенных сетей управления. Это относится, в частности, к SSH, WWW/WWW-SSL и серверу проверки пропускной способности. Также рекомендуется не инициировать TLS-соединения с устройства и не использовать встроенные SSH-клиенты (/system ssh и /system ssh-exec), особенно когда связь проходит через незащищённые сети или направлена на незащищённые хосты.

Постоянный URL: http://servernews.ru/1148069
07.09.2026 [13:22], Сергей Карасёв

24 576 волокон в 1U-шасси: Mixx представила сверхплотный оптический коннектор SxC для ИИ-инфраструктур

Американская компания Mixx Technologies анонсировала решение SxC Connector — высокоплотный оптический разъём для ИИ-инфраструктур гиперскейл-класса. Изделие позволяет объединять до 24 576 оптических волокон в одном стоечном корпусе типоразмера 1U.

SxC Connector призван устранить «бутылочное горлышко» в современных ИИ-кластерах — решить проблему передачи данных между огромным количеством ускорителей. Один коннектор нового типа может содержать до 64 оптических волокон. При этом 16 коннекторов объединяются в панель на 1024 волокна, занимая площадь менее 800 мм2. В пределах шасси 1U можно разместить 24 такие панели, что в сумме даёт 24 576 оптических волокон. Это в четыре раза больше по сравнению с MMC-VSFF — самой высокоплотной платформой разъёмов, сертифицированной для использования на сегодняшний день.

 Источник изображения: Mixx

Источник изображения: Mixx

Особенность SxC Connector заключается в использовании технологии оптики с расширенным пучком EBO (Expanded Beam Optics). В традиционных коннекторах волокна контактируют торцами, и любая пыль или микроцарапины заметно ухудшают качество сигнала. В случае EBO световой поток из волокна сначала попадает на микролинзу, которая коллимирует и расширяет пучок, после чего тот проходит через воздушный зазор без физического контакта и фокусируется на приёмной стороне второй микролинзой. В результате, снижаются чувствительность к загрязнениям и износ при переподключениях, что важно для крупномасштабных ИИ ЦОД.

В SxC Connector используются стеклянные наконечники, что позволяет передавать мощные сигналы от удалённых лазерных источников. Говорится о возможности использования одномодовых (SMF) и многомодовых (PMF) волокон в одном и том же форм-факторе — в зависимости от требований заказчика. При производстве применяются инструменты роботизированной сборки и автоматизированного визуального контроля, что обеспечивает высокий уровень качества. SxC Connector позиционируется как единый оптический интерфейс для разных сегментов системы — от внешних лазеров до бэкплейна и фронтальной панели.

Постоянный URL: http://servernews.ru/1148062
07.09.2026 [13:15], Сергей Карасёв

Вышел Radxa Linkr — IP KVM в виде флеш-брелока с поддержкой Wi-Fi

Компания Radxa анонсировала решение Linkr — компактное устройство удалённого управления IP-KVM. Новинка выполнена в виде флеш-брелока с размерами 70 × 22 × 12 мм. Возможно взаимодействие через браузер посредством подключения через интерфейс USB Type-C, Ethernet или при помощи Wi-Fi.

В основу изделия положен процессор Rockchip RV1106G3. В его состав входят ядра Arm Cortex-A7 (1,2 ГГц) и RISC-V, а также нейропроцессорный узел (NPU) с производительностью до 1 TOPS и поддержкой режимов INT4, INT8, INT16. Интегрированный VPU-модуль обеспечивает возможность работы с видеоматериалами в форматах H.265/H.264 с разрешением 3072 × 1728 точек и скоростью 30 к/с.

 Источник изображений: Radxa

Источник изображений: Radxa

Linkr несёт на борту 256 Мбайт DDR3L. Есть слот для карты microSD, а опционально может быть добавлен флеш-чип eMMC вместимостью 16 Гбайт. Реализована поддержка 10/100MbE и Wi-Fi 6. Новинка располагает портом USB Type-C для эмуляции клавиатуры и мыши, ещё одним разъёмом USB Type-C (с поддержкой USB Type-C — RJ45) для подключения к компьютеру или маршрутизатору/коммутатору и коннектором HDMI с поддержкой видео 2K (30 к/с).

Для организации удалённого управления могут применяться устройства на базе Windows, macOS, iOS, Linux, HarmonyOS и Android. При этом Linkr может работать с целевыми системами на основе Windows, macOS, Linux и HarmonyOS. Говорится о поддержке двухфакторной аутентификации и ИИ-агентов, таких как OpenClaw и Hermes, которые помогают автоматизировать различные задачи. Цена новинки начинается с $59.

Постоянный URL: http://servernews.ru/1148060
06.09.2026 [19:10], Руслан Авдеев

RTFM-ошибка гиперскейл-уровня: инженер Google Cloud уронил часть облака, разом отключив все оптические кабели

Google Cloud раскрыла довольно курьёзную причину частичного сбоя в регионе us-central1-b, который произошёл 1 сентября с 07:41 до 11:52 по тихоокеанскому времени (PT). Часть облака физически отключил от Сети инженер, обслуживавший оборудование, сообщает The Register. Это привело к «серьёзному ухудшению работы сети и изоляции ресурсов».

По данным Google, в разгар инцидента объём проходящего трафика в пострадавшей области облака «сократился на 100 %», из-за чего ряд инстансов оказался попросту недоступен пользователям, а потери пакетов ожидаемо выросли. Компания пояснила, что при проектировании облачных ЦОД занимается резервированием маршрутизаторов, но против человеческой «смекалки» ей противопоставить нечего. Система рассчитана на двойные и даже тройные отказы и использует раздельное питание оборудования и несколько ВОЛС. Тем не менее, как оказалось, все эти меры защиты можно обойти, просто выдернув кабели из гнёзд.

Сообщается, что непосредственной технической причиной сбоя стало отключение оптоволоконных кабелей в ходе стандартных работ по обслуживанию оборудования. Компания сообщила, что инженер последовательно отключил 100 % оптоволоконных соединений всего за 13 мин. Характер ошибки и высокая скорость работы «инициативного» сотрудника не позволили вовремя предупредить его о неправильных действиях до полного отключения.

 Источник изображения: Jimmy Nilsson Masth/unsplash.com

Источник изображения: Jimmy Nilsson Masth/unsplash.com

После отключения маршрутизаторов ВМ в одной из зон доступности региона us-central1-b физически потеряли связь с внешним миром. Хотя их возможность обмена данными друг с другом сохранилась, пользователи не могли получить к ним доступ хотя бы для того, чтобы понять, что происходит. После того, как в Google выявили проблему, трафик был перенаправлен с маршрутизаторов, отключенных инженером, на «работоспособные мощности в других частях региона». Затем инженеры вернули кабели назад и восстановили исходную конфигурацию сети. Предполагается, что виноватый в сбое инженер нарушил базовое требование, предполагающее чтение инструкций до того, как браться за работу.

Человеческий фактор неоднократно становился причиной сбоев в США и за их пределами. Так, летом 2025 года австралийские военные по ошибке «положили» Wi-Fi и радио на побережье Новой Зеландии. В декабре 2025 года появилась новость, что лень и безалаберность инженеров Nokia и Optus в Австралии привели к смерти людей, которые не смогли дозвониться до скорой. Как отмечает Uptime Institute, сбои в дата-центрах стали реже, но значительнее.

Постоянный URL: http://servernews.ru/1148048
04.09.2026 [08:56], Владимир Мироненко

MetaRoCE — RDMA-транспорт от Meta✴ для крупных ИИ-кластеров с обычным Ethernet

Meta✴ представила MetaRoCE — новый транспортный RDMA-протокол на базе обычного Ethernet, созданный для крупных ИИ-кластеров. Компания разместила спецификации MetaRoCE, эталонную программную реализацию и набор тестов на соответствие требованиям (Compliance Test Suite, CTS) в рамках OCP, предоставив возможность его внедрения всем желающим. В Meta✴ настаивают на том, что Ethernet должен быть предпочтительной инфраструктурой для ИИ, продемонстрировав, что её реализация RoCE может обеспечивать распределённое обучение ИИ в масштабе, объединяя миллионы GPU.

Компания отметила, что в ходе инференса низкая задержка коммуникации между распределёнными сегментами модели напрямую влияет на время отклика для сотен миллионов пользователей. Даже небольшие сетевые помехи ограничивают вычислительную мощность. Протокол RoCE (RDMA over Converged Ethernet) предполагает, что сеть будет доставлять каждый пакет в определённом порядке, используя PFC и препятствуя распылению пакетов, обеспечивая производительность в многоплоскостных и крупномасштабных сетях. При использовании MetaRoCE в строгом выполнении очерёдности передачи данных нет необходимости. Главная задача — обеспечение высокой пропускной способности, низкой задержки в конце очереди распределения и простоты эксплуатации по мере роста сети при увеличении количества ускорителей и расстояний между ними.

 Источник изображений: engineering.fb.com

Источник изображений: engineering.fb.com

Как указано в блоге Meta✴, суть MetaRoCE проста: сетевая фабрика видит пакеты, а сетевая карта (NIC) — намерения. Традиционные архитектуры ориентированы на «ум» фабрики, полагаясь на коммутаторы для обеспечения отсутствия потерь и поддержания порядка. Перенося интеллектуальные функции на конечную точку, MetaRoCE декомпозирует сеть на множество детализированных (мелкозернистых) логических путей, каждый из которых имеет свою собственную телеметрию в реальном времени — время приёма-передачи данных для каждого пути (Per-path RTT), состояние ECN и загрузку. Такая прозрачность открывает возможности, которые трудно достичь с помощью традиционного RDMA.

MetaRoCE распределяет пакеты по множеству путей, поэтому они поступают не в том порядке, в каком были отправлены. Транспортный уровень рассматривает неупорядоченное поступление как обычный случай. Каждый пакет имеет свой адрес назначения, а данные записываются непосредственно в конечную область памяти по мере их поступления, без буфера переупорядочивания и блокировок. При этом MetaRoCE всегда рассматривает Ethernet-фабрику как систему с потерями и не требует от неё иного поведения. Прикладной уровень практически не затрагивается — существующие RDMA-«глаголы» и программные стеки работают без изменений, а дополнительные функции поддерживаются с помощью расширений стандартных API.

MetaRoCE предоставляет каждому соединению несколько путей и распределяет по ним пакет за пакетом. Каждый путь имеет свой уникальный исходный UDP-порт в качестве энтропии ECMP, который сетевая карта может изменить в любой момент, чтобы перенаправить трафик с неподходящего маршрута. Выбор пути пакета полностью зависит от NIC, так что и эффективность работы всей фабрики зависит от NIC. Оценка каждого пути позволяет явно отличить перегрузку и от сбоя, и сделать перебалансировку, избавившись от плохо работающего пути без обрыва соединение целиком и с возможностью переотправки ровно того пакета, который потерялся из-за сбоя или перегрузки.

MetaRoCE сочетает в себе традиционный ECN-контроль перегрузки с AIMD у отправителя с обратной связью со стороны получателя, который при каждом ACK уведомляет отправителя о выделенной ему доле из общей доступной получателю полосы. MetaRoCE запрашивает у фабрики олько две функции, которые уже есть в каждом коммутаторе: ECN и ECMP. Протокол Meta✴ не требует обрезки пакетов, внутрисетевой телеметрии, управления потоком на основе кредитов или распыления пакетов на стороне коммутатора, но и наличие этих функций не мешает работе протокола. MetaRoCE совместим практически с любыми топологиями, в том числе с сегментами в облачных системах, конфигурацию которых нельзя контролировать. В протоколе нет проприетарных компонентов, поэтому фабрика может свободно оптимизироваться с точки зрения стоимости и кабельной разводки.

Очередь отправки и очередь приёма (Queue Pair, QP) отвечают как за упорядоченный поток сообщений, так и за пропускную способность. Традиционный RDMA получает больше того или другого путём открытия большего количества QP (по несколько десятков на каждую пару узлов), не знающих ничего ни о друг друге в плане перегрузки, ни об их состоянии в NIC. MetaRoCE использует одно соединение для множества независимых упорядоченных потоков (в т.ч. по одному на каждую коллективную операцию), использующее множественные пути под управлением одного контроллера перегрузки.

Чтобы ускорить проверку аппаратного обеспечения, Meta✴ совместно с AMD реализовала MetaRoCE на DPU Pensando. На 64-узловом кластере GPU AMD, работающем под управлением RCCL, компании напрямую сравнили MetaRoCE с RoCEv2 при выполнении коллективных операций All-Reduce и All-to-All.

Результаты, как утверждает Meta✴, соответствуют поставленным целям:

  • MetaRoCE стабильно обеспечивал более высокую пропускную способность и меньшее время завершения потока по сравнению с RoCEv2.
  • При потере пакетов, когда пропускная способность RoCEv2 снижается, MetaRoCE сохраняет около 86 % пропускной способности при потере 1 % пакетов и продолжает обеспечивать полезную пропускную способность даже при экстремальной потере 10 % пакетов, плавно снижаясь, а не коллапсируя.
  • Multiplane-топология с 4 и 8 независимым физическими подключениями к коммутаторам для каждого NIC с поддержкой до 4000 одновременных подключений подтвердила, что пропускная способность линейно зависит от количества плоскостей.
  • При имитации сбоев на отдельных физических подключениях в сценарии выше протокол демонстрирует плавное автономное восстановление — трафик перераспределяется без участия приложения или вмешательства оператора.

Эти результаты подтверждают правильность выбора, сделанного при разработке MetaRoCE, отметила Meta✴. Благодаря тому, что протокол с самого начала разрабатывался с учётом возможных потерь пакетов, а интеллектуальные функции вынесены на периферию, он обеспечивает более высокую производительность в идеальных условиях и плавно снижает нагрузку при сбоях. Компания подчеркнула, что протокол MetaRoCE является открытым, его спецификации добавлены в OCP, и любой поставщик может с их помощью создать и реализовать совместимое оборудование. Впрочем, во многом похожий протокол MRC (Multipath Reliable Connection) также передан в OCP, да и Ultra Ethernet тоже решает схожие задачи.

Постоянный URL: http://servernews.ru/1147673
03.09.2026 [17:31], Владимир Мироненко

Тонущую GoPro поглотили за $285 млн, и теперь она займётся оптикой для ЦОД

Испытывающий финансовые трудности производитель экшн-камер GoPro заключил окончательное соглашения о слиянии с американской компанией Starman Optical, в результате которого акционеры GoPro получат в общей сложности $285 млн или $1,14 за акцию и сохранят за собой примерно 10 % акций компании. Непогашенный долг GoPro в размере приблизительно $92 млн будет полностью погашен на момент закрытия сделки, которое ожидается к концу этого года.

Как сообщает GoPro, сделка позволит «максимизировать ценность интеллектуальной собственности GoPro и потенциал роста на потребительском, коммерческом и оборонном рынках путем рекапитализации компании, укрепления её баланса, инвестиций в развитие и переноса производства продукции для стратегических рынков в страну». При этом она останется публичной компанией и продолжит оказывать полную поддержку своим существующим потребительским продуктам.

Компания Starman Optical была зарегистрирована в Делавэре 31 августа. Она позиционируется как «оптико-фотонная компания, специализирующаяся на разработке и внутреннем производстве оптических трансиверов и связанных с ними фотонных технологий через своё подразделение Starman New Photonics (SNP)». И Starman Optical, и Starman New Photonics входят в состав Starman Holding, которой принадлежат такие бренды потребительской электроники, как Incase, Incipio и Griffin. SNP представила на выставке OFC 2026 продукты Liberty, в том числе трансиверы 800G и 1,6T для ИИ ЦОД.

 Источник изображения: GoPro

Источник изображения: GoPro

Сообщается, что SNP планирует инвестировать $150 млн в реконструкцию завода площадью 9300 м2 в Уоррене (Warren, штат Нью-Джерси), на котором будет осуществлять высокоточное производство оптических трансиверов, сборку, упаковку и научно-исследовательские разработки, создав 250 рабочих мест. Ожидается, что оптические трансиверы Starman, производимые в США, будут добавлены в портфель GoPro, что расширит присутствие компании на быстрорастущем рынке ИИ-инфраструктуры.

Как отметил ресурс Converge! Network Digest, для Starman компания GoPro потенциально может предоставить инженерные ресурсы, опыт в области оптики, интеллектуальную собственность, включающую 2500 зарегистрированных в США патентов, и доступ к публичным рынкам капитала; для GoPro Starman — это возможность выйти на быстрорастущий рынок оптики для ЦОД.

«Сочетание мирового класса оптической экспертизы и интеллектуальной собственности GoPro с передовыми возможностями трансиверов Starman и американской производственной платформой создаёт уникальную возможность. Вместе мы намерены вернуть производство этих критически важных компонентов в США», — заявил Чарльз Тебеле (Charles Tebele), генеральный директор Starman Holdings.

Спрос на оптику для ИИ-систем стимулирует значительные инвестиции в наращивание производственных мощностей по всей отрасли. Например, компания Applied Optoelectronics (AOI) расширяет производство оптики для систем с пропускной способностью 800 Гбит/с и 1,6 Тбит/с в Техасе, а Coherent вкладывает значительные средства в наращивание мощностей по производству полупроводников на основе фосфида индия по мере роста спроса на системы с пропускной способностью 1,6 Тбит/с. Запланированное открытие производства в Нью-Джерси позволит компании SNP добавить ещё один производственный объект в цепочку поставок оптики, которая исторически в значительной степени полагалась на мощности в Азии.

Постоянный URL: http://servernews.ru/1147914

✴ Входит в перечень общественных объединений и религиозных организаций, в отношении которых судом принято вступившее в законную силу решение о ликвидации или запрете деятельности по основаниям, предусмотренным Федеральным законом от 25.07.2002 № 114-ФЗ «О противодействии экстремистской деятельности»;