PUBLICIDADE

Agentes de IA em alta velocidade: NVIDIA Nemotron 3.5 Lightning desembarca no Amazon SageMaker JumpStart

18/08/2026
6 visualizações
4 min de leitura
Imagem principal do post

NVIDIA Nemotron 3.5 Lightning agora está disponível no Amazon SageMaker JumpStart

A NVIDIA disponibilizou o modelo Nemotron 3.5 Lightning no Amazon SageMaker JumpStart, o catálogo de modelos fundacionais da AWS voltado para implantação e experimentação de inteligência artificial. O modelo foi projetado para executar tarefas rápidas e especializadas em fluxos de trabalho de agentes de inteligência artificial que operam de forma contínua, atendendo a aplicações com alto volume de chamadas de inferência.

Imagem complementar

O Nemotron 3.5 Lightning é descrito pela NVIDIA como o modelo aberto mais rápido de sua categoria para alimentar agentes sempre ativos. Segundo a empresa, a arquitetura entrega até quatro vezes mais throughput e até trinta por cento mais rapidez na conclusão de tarefas em workloads agentic de alto volume. O modelo conta com trinta bilhões de parâmetros totais, mas apenas três bilhões são ativados a cada passagem, o que permite sua execução em uma única GPU compatível, sem a necessidade de infraestrutura de fronteira.

PUBLICIDADE

Desenvolvido em parceria com a Nemotron Coalition, o modelo foi destilado a partir do Nemotron 3 Ultra, versão de fronteira da NVIDIA. A arquitetura híbrida chamada Mixture-of-Experts, ou MoE, seleciona apenas parte dos parâmetros a cada operação, mantendo alta capacidade de raciocínio sem exigir o processamento completo da rede. Além disso, o modelo adota a técnica DFlash de speculative decoding, recurso que antecipa tokens prováveis para reduzir a latência por palavra gerada, e oferece janela de contexto de até um milhão de tokens, permitindo que agentes preservem informações acumuladas ao longo de sessões longas.

A proposta do Nemotron 3.5 Lightning se encaixa em uma abordagem de sistema de modelos, na qual diferentes etapas de um fluxo agentic são direcionadas a modelos distintos conforme sua complexidade. Tarefas que exigem planejamento estratégico ou orquestração de sub-agentes continuam demandando modelos de fronteira, enquanto atividades repetitivas e especializadas, como classificar alertas, extrair dados de formulários ou verificar políticas, podem ser conduzidas por modelos menores e mais rápidos. O Lightning foi desenhado justamente para assumir esse segundo grupo, que costuma representar grande parte do volume de chamadas em ambientes corporativos.

Nos benchmarks publicados pela NVIDIA, as variantes do modelo em BF16 e NVFP4 mantiveram resultados próximos em tarefas de raciocínio e uso agentic. No MMLU Pro, a versão BF16 alcançou 81,94 contra 81,62 da NVFP4. No GPQA Diamond, os números foram 75,44 e 75,57, respectivamente. No SWE-bench Verified, voltado à resolução de problemas de engenharia de software, a versão NVFP4 registrou 52,80, ligeiramente acima dos 51,56 da BF16. No PinchBench, a BF16 obteve 85,37, enquanto a NVFP4 chegou a 83,43. No IFBench, a NVFP4 superou a BF16 com 72,88 ante 71,88. Já no AA-LCR, a BF16 alcançou 52,00 e a NVFP4, 49,19. A NVIDIA informa que os procedimentos e comandos utilizados nessas avaliações estão documentados no NeMo Gym.

O modelo é aberto e foi treinado em conjuntos de dados públicos, o que permite às organizações customizá-lo com o framework NVIDIA NeMo para ferramentas, fluxos e políticas específicas de cada domínio. As organizações mantêm a propriedade dos pesos resultantes e podem implantá-los onde seus agentes operam. A versão disponibilizada no SageMaker JumpStart não expõe opções de customização diretamente pela interface, mas o pós-treinamento pode ser conduzido externamente.

Entre os casos de uso corporativos destacados estão assistentes pessoais de longa duração para gestão de e-mails, agendas e reservas, com possibilidade de execução local para dados contextuais. No setor financeiro, o modelo pode ser aplicado em extração de dados de documentos, verificação de regras de política, monitoramento de sinais de risco e preparação de resumos estruturados. Em operações de cibersegurança, o objetivo é enriquecer alertas, classificar incidentes, consultar logs, validar controles e correlacionar indicadores para analistas. No setor de telecomunicações, o modelo pode triar alarmes de rede, otimizar configurações e responder perguntas de faturamento. No varejo, a aplicação envolve enriquecimento de catálogos, resolução de exceções de estoque e atendimento a questões sobre pedidos, devoluções e programas de fidelidade.

A implantação pode ser feita diretamente pelo Amazon SageMaker Studio, buscando por Nemotron 3.5 Lightning no catálogo JumpStart, selecionando o tipo de instância desejada e criando o endpoint. Também é possível implantar a partir da página do modelo no Hugging Face ou usando o SageMaker Python SDK, com identificadores específicos para as variantes NVFP4 e BF16. Após o uso, o endpoint deve ser excluído para evitar cobranças contínuas.

Com a chegada ao SageMaker JumpStart, o Nemotron 3.5 Lightning amplia o leque de opções abertas para empresas que desejam implementar agentes de inteligência artificial com alto desempenho, mantendo controle sobre os dados e a customização dos modelos. A combinação de arquitetura MoE, contexto ampliado e técnicas de decodificação especulativa posiciona o modelo como peça especializada dentro de estratégias mais amplas de orquestração de múltiplos modelos.

PUBLICIDADE

Leitura recomendada

Comentários

Nenhum comentário ainda. Seja o primeiro a comentar!