Pular para o conteúdo
Atualizado em 3 min de leitura

Nvidia lança Nemotron 3.5 Lightning, modelo aberto de 30B que roda em uma GPU

MoE de 30 bilhões de parâmetros com apenas 3 bilhões ativos chega com pesos abertos no Hugging Face, junto do NeMo Switchyard, roteador de modelos para agentes.

Por Pedro Milagre · Especialista em Inteligência Artificial

Nvidia lança Nemotron 3.5 Lightning, modelo aberto de 30B que roda em uma GPU

A Nvidia lançou nesta terça-feira (11) o Nemotron 3.5 Lightning, modelo aberto de 30 bilhões de parâmetros voltado à execução de tarefas de agentes de IA — e leve o bastante para rodar em uma única GPU, de uma GeForce RTX 5090 a um DGX Spark. Junto dele veio o NeMo Switchyard, biblioteca de código aberto que roteia cada requisição de um agente para o modelo mais eficiente da tarefa.

O Lightning é um mixture-of-experts (MoE) que ativa apenas 3 bilhões de parâmetros por token, com arquitetura híbrida que intercala camadas Mamba-2, camadas MoE e blocos seletivos de atenção. Segundo o model card no Hugging Face, o modelo foi treinado com mais de 20 trilhões de tokens, aceita contexto de até 1 milhão de tokens e sai em duas versões, BF16 e NVFP4 (quantização mais compacta para as GPUs mais recentes). Os pesos estão no Hugging Face e no ModelScope sob a licença permissiva OpenMDW-1.1, liberados para uso comercial, e o modelo também aparece como microsserviço NIM no build.nvidia.com, além de funcionar em ferramentas locais como Ollama, llama.cpp e LM Studio.

Nos números da própria Nvidia, o modelo entrega velocidade de saída até quatro vezes maior que a de modelos abertos de porte semelhante. No benchmark agêntico PinchBench, completou um lote de dez mil tarefas cerca de 30% mais rápido que o Qwen 3.6 35B, com 86% de acurácia. A lista de hardware suportado vai de GPUs de data center (H100, H200, GB200) a placas de consumo e dispositivos de borda, incluindo RTX 5090, estações RTX PRO, o mini-supercomputador DGX Spark e módulos Jetson.

A segunda peça do anúncio ataca o custo dos agentes de longa duração. O NeMo Switchyard decide, a cada etapa de um fluxo agêntico, qual modelo deve responder, com base em critérios de qualidade, latência e custo. A biblioteca traz roteadores que dispensam treinamento — um classificador por LLM com afinidade de sessão, um roteador de estágio que observa as chamadas de ferramenta recentes e um roteador de escalonamento, que começa no modelo barato e só promove a requisição para um modelo maior quando a dificuldade persiste. A lógica é dividir o trabalho: um modelo grande de raciocínio, como o Nemotron 3 Ultra, planeja e orquestra, enquanto o Lightning executa o grosso das tarefas repetitivas — ler arquivo, chamar ferramenta, validar resultado, repetir o que falhou. Segundo a Nvidia, a combinação mantém acurácia de fronteira reduzindo o custo de conclusão de tarefas a cerca de um terço do uso isolado de um modelo topo de linha. Empresas como LangChain, LiteLLM, Cognition, Kong e Siemens aparecem entre as parceiras da integração.

Por que importa

Agentes de IA que rodam horas a fio multiplicam o consumo de tokens, e a conta de API em dólar pesa — especialmente para empresas brasileiras. Um modelo aberto que executa tarefas agênticas em uma RTX 5090 ou em um DGX Spark local, sem custo por token e com licença liberada para uso comercial, muda a matemática de quem constrói automações internas, revisão de código ou triagem de alertas. E o Switchyard formaliza uma prática que times de agentes já improvisavam na mão: usar o modelo caro só quando é realmente necessário.

O contexto

O lançamento estende a família Nemotron, a aposta da Nvidia em modelos abertos que, não por acaso, alimentam a demanda por suas GPUs. A empresa vem publicando pesos, dados e técnicas de treinamento das versões recentes e posiciona o Lightning diretamente contra os modelos abertos da série Qwen, hoje referência na faixa de 30 a 35 bilhões de parâmetros. A disponibilidade imediata em Hugging Face, ModelScope, OpenRouter e provedores de inferência hospedada indica que a estratégia é ocupar rápido a camada de execução dos agentes, um dos segmentos que mais cresce em consumo de inferência.

Fontes

  1. [1]https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
  2. [2]https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
  3. [3]https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
  4. [4]https://www.marktechpost.com/2026/08/11/nvidia-ai-releases-nemotron-3-5-lightning-and-nemo-switchyard/

Sobre o autor

Pedro Milagre

Pedro Milagre

Especialista em Inteligência Artificial

Newsletter

O que tá acontecendo na IA, contado sem enrolação

Grátis, em bom português, direto da redação — só o que aconteceu de verdade, do jeito que a gente conversa.

Sem spam, sem encheção. Sai quando quiser.

Leia também