À medida que Rubin é altamente aguardado, Nvidia continua otimizando Blackwell e a eficiência energética do GB200 quadruplica em três meses
A Nvidia está estendendo o ciclo de vida da plataforma Blackwell por meio de otimizações contínuas de sua pilha de software, ao mesmo tempo em que prepara terreno para a implantação em larga escala da próxima geração da arquitetura Rubin.
Com a aceleração do lançamento da nova plataforma Rubin, a Nvidia revelou que, em apenas três meses, quadruplicou a eficiência do GB200 NVL72 em throughput por megawatt (TPS/MW) executando o modelo DeepSeek R1 0528. Esse resultado é fruto de 38 otimizações importantes realizadas em quatro meses, apoiadas por mais de 250 mil testes de configuração simulada e um total de 1,4 milhão de horas de validação otimizando GPUs.
Paralelamente, a plataforma GB300 “Blackwell Ultra” continua a quebrar recordes em benchmarks de treinamento de IA. Com 256 GPUs, o GB300 NVL72 atingiu um recorde histórico de 1648 TFLOPs por GPU na tarefa de pré-treinamento do DeepSeek-V3 671B, aproximadamente três vezes mais que os 606 TFLOPs do GB200, desempenho esse que, nos últimos seis meses, já aumentou 1,5 vez.
A eficiência energética do GB200 salta significativamente, otimizações cobrem mais de 90% dos modelos
Segundo a Nvidia, a série de otimizações direcionadas à plataforma GB200 NVL72 permitiu que, ao executar DeepSeek R1 0528 (configuração 1K entrada/1K saída), o throughput por megawatt quadruplicasse em apenas três meses.

A base desse salto foi a realização, em quatro meses, de 38 grandes iterações de otimização. Essas melhorias passaram por mais de 250 mil testes de configuração simulada e acumularam 1,4 milhão de horas de validação prática em GPUs. A Nvidia destacou que mais de 90% dessas otimizações podem ser reaproveitadas em outros modelos de sua linha de produtos de IA, não sendo customizadas para uma única tarefa.
Isso significa que clientes de data centers existentes podem obter ganhos expressivos de eficiência energética apenas atualizando o software, sem trocar o hardware — um benefício direto para gigantes da nuvem e corporações altamente sensíveis ao custo computacional.
GB300 bate novo recorde de treinamento, ganho de performance de 1,5 vez em seis meses
No treino de IA, o GB300 NVL72 também demonstra desempenho robusto. Com 256 GPUs, utilizando o framework Megatron Core para pré-treinar o modelo DeepSeek-V3 671B, o GB300 NVL72 atingiu throughput de 1648 TFLOPs por GPU, saltando de 606 TFLOPs no GB200 para quase três vezes mais, estabelecendo um novo recorde global para essa tarefa.

É importante destacar que esse resultado não se trata de um limite fixo de hardware. Sob o framework Megatron Core, o GB300 NVL72 passou de 1088 TFLOPs/GPU em novembro de 2025 para 1648 TFLOPs/GPU em junho de 2026 — um ganho acumulado de aproximadamente 1,5 vez em seis meses.

Na otimização conjunta com frameworks de IA populares, a colaboração da Nvidia com as comunidades PyTorch e JAX também trouxe ganhos expressivos. Com TorchTitan (stack de treinamento nativo PyTorch), o desempenho do GB300 NVL72 no treinamento do DeepSeek-V3 671B avançou seis vezes em relação à configuração base não otimizada, aumentando de 199 TFLOPs/GPU para 1197 TFLOPs/GPU. No JAX, o avanço foi ainda mais impressionante: até julho de 2026, o throughput por GPU atingiu 4082 Tokens/s, correspondendo a 1025 TFLOPs/GPU, cerca de 10 vezes maior do que os 418 Tokens/s de janeiro de 2026.

Eficiência de escalonamento próxima ao limite teórico, rede de 800 Gb/s é fundamental
A eficiência de escalonamento em cenários de treinamento em larga escala sempre foi um dos principais parâmetros para medir a utilidade da infraestrutura de IA. De acordo com a Nvidia, no intervalo de 256 a 1024 GPUs, o GB300 NVL72 manteve eficiência próxima ao limite teórico nos três principais frameworks: 98,5% com Megatron Core e 97% tanto com TorchTitan quanto JAX.
A Nvidia atribui esse desempenho à rede Scale-Out de 800 Gb/s integrada nos racks do NVL72. A interconexão de alta velocidade determina diretamente o custo de comunicação em treinamentos multi-nó e, portanto, impacta a eficiência global de escalonamento, tornando essa infraestrutura de rede o elemento-chave por trás do alto desempenho cross-framework observado.

Plataforma Rubin acelera implantação, otimizações Blackwell continuam em andamento
No contexto deste anúncio de avanços, a próxima geração da plataforma Vera Rubin da Nvidia já iniciou implantação global. Segundo relatos, o Vera Rubin NVL72 multiplicou por cerca de 10 vezes o throughput de tokens em relação ao Blackwell: o GB200 NVL72 processa cerca de 80.000 tokens/s, enquanto o Vera Rubin NVL72 pode chegar a 800.000 tokens/s sob o mesmo consumo de 150MW.
No entanto, a plataforma Blackwell já está instalada em inúmeros data centers ao redor do mundo, e a estratégia da Nvidia segue a da geração Hopper: além de lançar a nova plataforma, investe em extrair ainda mais potencial do hardware já instalado por meio de otimizações de software. Tal abordagem não só prolonga o ciclo de retorno dos investimentos de hardware dos clientes, mas também reforça o vínculo da Nvidia no ecossistema de infraestrutura de IA. Para o mercado, diante do avanço simultâneo de Blackwell e Rubin, a Nvidia constrói uma barreira de software que dificulta o avanço dos concorrentes no curto prazo.
Aviso Legal: o conteúdo deste artigo reflete exclusivamente a opinião do autor e não representa a plataforma. Este artigo não deve servir como referência para a tomada de decisões de investimento.
Talvez também goste
O valor de mercado das novas potências nucleares na bolsa dos EUA evapora mais de 30 bilhões de dólares! SMR representa o futuro da energia nuclear, mas o lucro de 2,1 bilhões de dólares dos vendidos a descoberto acende um alerta para avaliação e entrega
SMR representa o futuro da energia nuclear, mas os vendedores a descoberto lucraram impressionantes US$ 2,1 bilhões! O capital está migrando da busca pelo conceito de SMR para a validação das licenças e do fluxo de caixa. A aposta dos vendedores a descoberto trouxe lucros significativos e, sem dúvida, impacta negativamente o sentimento e a avaliação de curto prazo de líderes inovadores do setor nuclear como a Oklo. No entanto, isso não significa uma negação da lógica de crescimento positivo a longo prazo da indústria nuclear, impulsionada pela onda de infraestrutura para IA.

Keysight Technologies (KEYS.US) Teleconferência do Q3: IA impulsiona negócios de cabos para o centro das atenções; executivos dizem que a oferta não acompanha a demanda
Keysight Technologies (KEYS.US) anunciou os resultados do terceiro trimestre do ano fiscal de 2026 e realizou uma teleconferência de resultados financeiros.

A integradora de tecnologia de defesa Lyntris (LYNX.US) capta US$ 297,5 milhões em IPO com desconto, e o “boom” de listagem das ações de defesa enfrenta retorno à racionalidade na avaliação
A empresa de tecnologia de defesa Lyntris e seus apoiadores arrecadaram US$ 297,5 milhões por meio de uma oferta pública inicial.

Mina de ouro com mais de 200 metros de profundidade e teor de ouro de 1,68g/t, perfuração supera expectativas! Valorização da mina de ouro de cem toneladas na Ásia Central da Silvercorp Metals (SVM.US) acelera remodelação de valuation
A Silvery, baseada em sólidos resultados de exploração e um plano de desenvolvimento claro, está alcançando um duplo efeito positivo de recuperação de valorização e liberação de lucros, completando gradualmente uma transformação acelerada para se tornar uma produtora diversificada de metais preciosos de alta qualidade.

