Nvidia põe em produção o Groq 3 LPX, primeiro chip derivado da compra da Groq, focado em inferência rápida
Desde 24/8 em produção plena, o LPX usa 256 chips com SRAM por rack para acelerar respostas de IA; a Nebius será a primeira nuvem a oferecer.
A Nvidia anunciou em 24 de agosto de 2026, na conferência Hot Chips, que o Groq 3 LPX, acelerador dedicado à geração de respostas de modelos de IA, entrou em produção plena. O sistema é o primeiro produto comercial derivado da compra, por US$ 20 bilhões, dos ativos da startup Groq em dezembro, descrita pela Quartz como o maior negócio já fechado pela Nvidia. A empresa posiciona o LPX como extensão da plataforma Vera Rubin, e não como substituto das suas GPUs.
Por que um chip só para gerar tokens
A inferência de modelos de linguagem tem duas fases: o processamento do contexto de entrada e a geração dos tokens de saída, chamada de decode. A segunda depende muito da velocidade de acesso à memória e define quão rápido um agente conclui cada etapa de trabalho. O LPX ataca esse gargalo com memória SRAM dentro do próprio chip. Segundo a página do produto, cada rack reúne 256 aceleradores LPU, e cada um traz 500 MB de SRAM, 150 TB/s de largura de banda de SRAM e 2,5 TB/s de interconexão. Por rack, são 128 GB de SRAM, 12 TB de memória DDR5, 40 PB/s de banda de SRAM e 640 TB/s de interconexão entre chips. A Quartz informa, citando a CNBC, que o chip é fabricado pela Samsung.
Os números de desempenho
A Nvidia afirma que o LPX alcançou 3.400 tokens de saída por segundo no modelo aberto Gemma 4 31B com contexto de 100 mil tokens, em testes da empresa independente Artificial Analysis, e que oferece resposta quatro vezes mais rápida que a alternativa mais próxima em cargas sensíveis à latência. Esta última comparação é da própria Nvidia, sem detalhamento público da plataforma de referência. Na página do produto, a fabricante projeta que a combinação de um rack Vera Rubin NVL72 com o LPX entrega até 35 vezes mais vazão por megawatt em modelos de trilhões de parâmetros, número marcado como projeção sujeita a mudança.
Quem vai usar e quando
A Nebius é a primeira nuvem de IA a adotar o LPX, por meio do serviço Nebius Token Factory. Segundo a Quartz, que cita a CNBC, os racks da Nebius devem entrar em operação ainda em 2026, junto a processadores Vera e GPUs Rubin. A própria Groq, que segue operando uma nuvem de inferência, planeja estar entre os primeiros clientes depois da Nebius. O diretor sênior da Nvidia Dion Harris disse à imprensa que o LPX permite a provedores criar faixas premium de serviço para clientes que exigem a menor latência, e reforçou que as GPUs continuam essenciais para treinar modelos.
O que observar
O anúncio não traz preço nem consumo de energia por rack, e não foram localizadas medições independentes além do teste citado da Artificial Analysis. A estratégia também cria uma divisão de trabalho mais explícita dentro dos data centers: GPUs com memória HBM para treino e processamento de contexto, e LPUs com SRAM para responder rápido. Para empresas que contratam inferência por token, o efeito prático deve aparecer primeiro em ofertas de baixa latência de provedores como a Nebius, ainda sem data de disponibilidade geral divulgada.
Fontes
- NVIDIA Newsroom — NVIDIA Groq 3 LPX Now in Full Production With World-Class Speed for Agentic AI (24/08/2026)
- NVIDIA — NVIDIA Groq 3 LPX — Interactive AI Inference Accelerator (página do produto) (consultada em 08/10/2026)
- Quartz — Nvidia’s AI inference chip from its $20 billion Groq deal enters full production (24/08/2026)
Imagem destacada: ilustração gerada por computador, sem valor documental.


