Spectrum-X Ethernet: como a NVIDIA redesenha a conectividade para data centers de IA em escala gigante
O crescimento acelerado da inteligência artificial generativa transformou de forma profunda o projeto dos data centers modernos. À medida que o treinamento distribuído de modelos passa a envolver centenas de milhares de GPUs, a rede que conecta esses nós, chamada de rede scale-out, emergiu como um dos principais gargalos de desempenho. Por décadas, o Ethernet tradicional foi o padrão absoluto no mercado corporativo e em computação em nuvem, devido ao baixo custo e à ampla padronização. Contudo, a nova geração de cargas de trabalho de IA exige muito mais do que as redes convencionais conseguem entregar.
Para enfrentar esse desafio, a NVIDIA apresentou o Spectrum-X Ethernet, uma arquitetura de rede com aceleração por hardware projetada especificamente para as chamadas fábricas de IA em escala de giga. Diferentemente do Ethernet tradicional, que utiliza paradigmas de roteamento e controle de congestionamento baseados em soluções de software, o Spectrum-X Ethernet adota uma abordagem de codesign entre switches de alta performance e placas de interface de rede instaladas nos servidores, conhecidas como NICs. Essa integração tem como objetivo entregar latência baixa e previsível, alta utilização da malha de rede e robustez mesmo sob cargas extremas.
A solução se sustenta em três pilares técnicos centrais. O primeiro é o roteamento adaptativo com aceleração por hardware, que ajusta dinamicamente os caminhos de tráfego dentro da malha para evitar congestionamentos. O segundo é o controle de congestionamento direcionado, aplicado na camada de transporte, que gerencia de forma precisa o fluxo de dados entre os nós. O terceiro é o PLB, abreviação de Plane Load Balancing, executado na borda do host por meio das NICs, responsável por distribuir a carga entre os diferentes planos da rede. Juntos, esses mecanismos permitem desempenho estável, latência ultrabaixa e eficiência consistente mesmo em ambientes multi-inquilino e sob estresse intenso.
Além disso, a tecnologia Spectrum-X Multiplane complementa a arquitetura ao oferecer uma malha de rede resiliente e com alta visibilidade operacional. Esse recurso simplifica a gestão de clusters de grande porte, permitindo que operadores monitorem e administrem a infraestrutura com mais clareza e segurança. O resultado é uma rede capaz de sustentar a comunicação coletiva e sincronizada exigida pelo treinamento de modelos de IA em larga escala, algo para o qual o Ethernet tradicional não foi originalmente projetado.
O contraste com o modelo convencional é significativo. O Ethernet foi criado para aplicações corporativas e para o tráfego norte-sul, ou seja, o fluxo de dados que se desloca entre usuários, servidores e sistemas de armazenamento. Ele não foi pensado para os padrões coletivos e sincronizados característicos das cargas de trabalho de IA em escala de giga. O Spectrum-X Ethernet surge justamente para preencher essa lacuna, convertendo o Ethernet em uma malha scale-out de alto desempenho, projetada para manter cada GPU alimentada com dados de forma contínua.
A iniciativa também reflete uma estratégia mais ampla da NVIDIA, baseada na integração vertical e na abertura horizontal. A empresa codesenha silício, sistemas e software em toda a plataforma de computação, mantendo ao mesmo tempo a compatibilidade com o Ethernet padrão, sistemas operacionais de rede abertos, protocolos abertos e um amplo ecossistema de parceiros. Clientes que adotam a solução recebem uma plataforma completa, evitando a necessidade de montar e otimizar manualmente um conjunto de peças separadas.
Ao propor uma arquitetura redesenhada do zero para os requisitos específicos da IA generativa, o Spectrum-X Ethernet representa uma mudança de paradigma na forma como as redes de data centers são concebidas. Em vez de adaptar tecnologias legadas às novas demandas, a abordagem da NVIDIA parte do princípio de que a infraestrutura de rede precisa ser construída em conjunto com os demais componentes da plataforma de IA. Com isso, a empresa busca oferecer o que chama de fábrica de IA completa, na qual cada elemento, do chip ao switch, foi pensado para operar de maneira integrada e eficiente.