Pular para o conteúdo
Atualizado em 3 min de leitura

Nvidia lança Nemotron 3.5 Lightning, modelo aberto de 30B que roda em uma GPU

MoE de 30 bilhões de parâmetros com apenas 3 bilhões ativos chega com pesos abertos no Hugging Face, junto do NeMo Switchyard, roteador de modelos para agentes.

Por Redação Atualiza IA (com IA)

Nvidia lança Nemotron 3.5 Lightning, modelo aberto de 30B que roda em uma GPU

A Nvidia lançou nesta terça-feira (11) o Nemotron 3.5 Lightning, modelo aberto de 30 bilhões de parâmetros voltado à execução de tarefas de agentes de IA — e leve o bastante para rodar em uma única GPU, de uma GeForce RTX 5090 a um DGX Spark. Junto dele veio o NeMo Switchyard, biblioteca de código aberto que roteia cada requisição de um agente para o modelo mais eficiente da tarefa.

O Lightning é um mixture-of-experts (MoE) que ativa apenas 3 bilhões de parâmetros por token, com arquitetura híbrida que intercala camadas Mamba-2, camadas MoE e blocos seletivos de atenção. Segundo o model card no Hugging Face, o modelo foi treinado com mais de 20 trilhões de tokens, aceita contexto de até 1 milhão de tokens e sai em duas versões, BF16 e NVFP4 (quantização mais compacta para as GPUs mais recentes). Os pesos estão no Hugging Face e no ModelScope sob a licença permissiva OpenMDW-1.1, liberados para uso comercial, e o modelo também aparece como microsserviço NIM no build.nvidia.com, além de funcionar em ferramentas locais como Ollama, llama.cpp e LM Studio.

Nos números da própria Nvidia, o modelo entrega velocidade de saída até quatro vezes maior que a de modelos abertos de porte semelhante. No benchmark agêntico PinchBench, completou um lote de dez mil tarefas cerca de 30% mais rápido que o Qwen 3.6 35B, com 86% de acurácia. A lista de hardware suportado vai de GPUs de data center (H100, H200, GB200) a placas de consumo e dispositivos de borda, incluindo RTX 5090, estações RTX PRO, o mini-supercomputador DGX Spark e módulos Jetson.

A segunda peça do anúncio ataca o custo dos agentes de longa duração. O NeMo Switchyard decide, a cada etapa de um fluxo agêntico, qual modelo deve responder, com base em critérios de qualidade, latência e custo. A biblioteca traz roteadores que dispensam treinamento — um classificador por LLM com afinidade de sessão, um roteador de estágio que observa as chamadas de ferramenta recentes e um roteador de escalonamento, que começa no modelo barato e só promove a requisição para um modelo maior quando a dificuldade persiste. A lógica é dividir o trabalho: um modelo grande de raciocínio, como o Nemotron 3 Ultra, planeja e orquestra, enquanto o Lightning executa o grosso das tarefas repetitivas — ler arquivo, chamar ferramenta, validar resultado, repetir o que falhou. Segundo a Nvidia, a combinação mantém acurácia de fronteira reduzindo o custo de conclusão de tarefas a cerca de um terço do uso isolado de um modelo topo de linha. Empresas como LangChain, LiteLLM, Cognition, Kong e Siemens aparecem entre as parceiras da integração.

Por que importa

Agentes de IA que rodam horas a fio multiplicam o consumo de tokens, e a conta de API em dólar pesa — especialmente para empresas brasileiras. Um modelo aberto que executa tarefas agênticas em uma RTX 5090 ou em um DGX Spark local, sem custo por token e com licença liberada para uso comercial, muda a matemática de quem constrói automações internas, revisão de código ou triagem de alertas. E o Switchyard formaliza uma prática que times de agentes já improvisavam na mão: usar o modelo caro só quando é realmente necessário.

O contexto

O lançamento estende a família Nemotron, a aposta da Nvidia em modelos abertos que, não por acaso, alimentam a demanda por suas GPUs. A empresa vem publicando pesos, dados e técnicas de treinamento das versões recentes e posiciona o Lightning diretamente contra os modelos abertos da série Qwen, hoje referência na faixa de 30 a 35 bilhões de parâmetros. A disponibilidade imediata em Hugging Face, ModelScope, OpenRouter e provedores de inferência hospedada indica que a estratégia é ocupar rápido a camada de execução dos agentes, um dos segmentos que mais cresce em consumo de inferência.

Como fazemos esta matéria: produzida com apoio de inteligência artificial a partir das fontes citadas e pode ir ao ar sem revisão humana prévia. Erros apontados são corrigidos conforme nossa política editorial.

Manda pra quem precisa ler

Fontes

  1. [1]https://developer.nvidia.com/blog/nvidia-nemotron-3-5-lightning-delivers-fast-accurate-specialized-task-execution-for-long-running-agents/
  2. [2]https://blogs.nvidia.com/blog/nemotron-lightning-switchyard-rtx-dgx/
  3. [3]https://huggingface.co/nvidia/NVIDIA-Nemotron-3.5-Lightning-30B-A3B-BF16
  4. [4]https://www.marktechpost.com/2026/08/11/nvidia-ai-releases-nemotron-3-5-lightning-and-nemo-switchyard/

Newsletter

O que tá acontecendo na IA, contado sem enrolação

Notícias e guias de IA em português, grátis, todo dia às 7h30 no seu e-mail.

Sem spam. Sai quando quiser. Privacidade

Guias práticos

Todos os guias

Leia também