Vera Rubin NVL72 estreia no MLPerf com 3,7x mais vazão

Vera Rubin NVL72 estreia no MLPerf com 3,7x mais vazão

A NVIDIA divulgou em 16 de setembro de 2026 os resultados de sua participação na rodada MLPerf Inference v6.1. A empresa estreou o sistema Vera Rubin NVL72 em uma submissão de prévia.

Segundo a NVIDIA, a nova plataforma entrega até 3,7 vezes mais vazão que o GB300 NVL72, seu antecessor direto na família de racks com 72 GPUs interligadas. Os números recolocam a economia da inferência no centro da disputa entre fornecedores de hardware para inteligência artificial.

A pergunta que importa é quantos tokens é possível gerar por real investido em infraestrutura.

Vera rubin nvl72 na estreia

A submissão de prévia cobriu dois dos benchmarks mais exigentes da suíte: DeepSeek-R1 e Qwen3-VL.

No caso do Qwen3-VL, o ganho de até 3,7x sobre o GB300 NVL72 aparece nos três cenários medidos: offline, servidor e interativo. O modelo rodou sobre vLLM e o framework open source de inferência NVIDIA Dynamo.

Já no DeepSeek-R1, com a biblioteca TensorRT-LLM, a vazão chega a ser 2,5 vezes maior que a do GB300 NVL72.

Os resultados da plataforma NVIDIA vêm das entradas 6.1-0106 e 6.1-0074, recuperadas do site da MLCommons em 16 de setembro de 2026.

Na prática, cada rack Vera Rubin NVL72 gera mais tokens, atende mais usuários e produz mais receita que um rack GB300 NVL72, com custo por token menor.

A empresa credita o desempenho ao co-design de hardware e software. Os Tensor Cores e o Transformer Engine da geração Vera Rubin aceleram as fases de prefill e decode da inferência.

A precisão NVFP4 reduz o consumo de memória em pesos, atenção e KV cache, elevando a vazão com perda mínima de qualidade na saída.

Escala com eficiência

Eficiência de escala é a medida de quanto cada GPU adicional se converte em vazão real.

A submissão de DeepSeek-R1 da NVIDIA saiu de um único rack GB300 NVL72, com 72 GPUs, para quatro racks, totalizando 288 GPUs. Atingiu 99% de eficiência de escala no cenário offline, com a vazão crescendo de forma quase proporcional ao hardware acrescentado.

Esses resultados estão nas entradas 6.1-0073 e 6.1-0074.

O dado importa porque dobrar a contagem de GPUs não garante dobrar o desempenho. Se o acréscimo de aceleradores rendesse apenas um ganho percentual de um dígito, o custo da infraestrutura cresceria muito além do retorno em performance.

Para que a escala funcione, arquitetura, interconexão e software precisam avançar juntos. É aí que entram os interconnects de alta largura de banda dentro do rack, a rede de alta velocidade entre racks e a orquestração eficiente de requisições entre nós.

Otimização contínua de software

A NVIDIA afirma que as otimizações de software incluídas nas submissões do MLPerf Inference v6.1 entregaram até 1,6x mais desempenho em relação à rodada v6.0.

Segundo a empresa, o trabalho de otimização continuou depois do envio dos resultados e seguiu gerando ganhos adicionais. É um argumento para quem precisa justificar o investimento em infraestrutura já instalada.

A submissão do Vera Rubin também fez uso intenso de serving desagregado, que separa prefill e decode. Combinou isso com paralelismo de especialistas em larga escala para distribuir a carga pelas camadas de mixture-of-experts que sustentam modelos como DeepSeek-R1 e Qwen3-VL.

Essas técnicas só funcionam em escala de rack graças ao domínio de scale-up NVL72, baseado no NVLink de sexta geração e no NVLink Switch. Segundo o material divulgado, o sistema entrega taxas de pacotes até 10x maiores e latência 3x menor que Ethernet de prateleira.

Agentes mudam a régua dos benchmarks

Agentes de IA, que raciocinam, planejam e agem em múltiplas etapas, estão redesenhando a forma de medir desempenho de inferência.

Em testes desenhados para capturar essa mudança, como o SemiAnalysis AgentX, o Vera Rubin NVL72 apresentou desempenho 30 vezes superior ao GB300 NVL72 na avaliação de prévia.

A NVIDIA também antecipa que o futuro benchmark MLPerf Endpoints deve trazer medição padronizada para cargas agênticas, indo além do que os testes tradicionais de vazão conseguem captar.

O ecossistema de parceiros acompanha o movimento. A Nebius também submeteu resultados de prévia do Vera Rubin NVL72 e apresentou bom desempenho na mesma rodada.

Por que isso importa

Por trás de desempenho, eficiência de escala e velocidade de software existe um conceito que a NVIDIA chama de fungibilidade de plataforma. A mesma infraestrutura roda qualquer modelo e qualquer carga, do treinamento à inferência, de sistemas de recomendação ao raciocínio, de linguagem a vídeo, mantendo a utilização alta.

Para organizações que decidem onde colocar seus recursos de IA, três fatores definem a economia de inferência no longo prazo: vazão, escala e ritmo de otimização.

Fontes e links

Matéria publicada originalmente em NVIDIA

Últimas Notícias

Dario Amodei, da Anthropic, janta com Trump na Casa Branca
Agentes da OpenAI tentam 'forçar' site de estatísticas da ONU
Engram: sampler com IA transforma alucinações em música
IA em hospitais soma US$ 942 milhões em custos, diz seguradora