Site Local

Portal de notícias de tecnologia

Nvidia põe em produção o Groq 3 LPX, primeiro chip derivado da compra da Groq, focado em inferência rápida

Desde 24/8 em produção plena, o LPX usa 256 chips com SRAM por rack para acelerar respostas de IA; a Nebius será a primeira nuvem a oferecer.

Nvidia põe em produção o Groq 3 LPX, primeiro chip derivado da compra da Groq, focado em inferência rápida

A Nvidia anunciou em 24 de agosto de 2026, na conferência Hot Chips, que o Groq 3 LPX, acelerador dedicado à geração de respostas de modelos de IA, entrou em produção plena. O sistema é o primeiro produto comercial derivado da compra, por US$ 20 bilhões, dos ativos da startup Groq em dezembro, descrita pela Quartz como o maior negócio já fechado pela Nvidia. A empresa posiciona o LPX como extensão da plataforma Vera Rubin, e não como substituto das suas GPUs.

Por que um chip só para gerar tokens

A inferência de modelos de linguagem tem duas fases: o processamento do contexto de entrada e a geração dos tokens de saída, chamada de decode. A segunda depende muito da velocidade de acesso à memória e define quão rápido um agente conclui cada etapa de trabalho. O LPX ataca esse gargalo com memória SRAM dentro do próprio chip. Segundo a página do produto, cada rack reúne 256 aceleradores LPU, e cada um traz 500 MB de SRAM, 150 TB/s de largura de banda de SRAM e 2,5 TB/s de interconexão. Por rack, são 128 GB de SRAM, 12 TB de memória DDR5, 40 PB/s de banda de SRAM e 640 TB/s de interconexão entre chips. A Quartz informa, citando a CNBC, que o chip é fabricado pela Samsung.

Os números de desempenho

A Nvidia afirma que o LPX alcançou 3.400 tokens de saída por segundo no modelo aberto Gemma 4 31B com contexto de 100 mil tokens, em testes da empresa independente Artificial Analysis, e que oferece resposta quatro vezes mais rápida que a alternativa mais próxima em cargas sensíveis à latência. Esta última comparação é da própria Nvidia, sem detalhamento público da plataforma de referência. Na página do produto, a fabricante projeta que a combinação de um rack Vera Rubin NVL72 com o LPX entrega até 35 vezes mais vazão por megawatt em modelos de trilhões de parâmetros, número marcado como projeção sujeita a mudança.

Quem vai usar e quando

A Nebius é a primeira nuvem de IA a adotar o LPX, por meio do serviço Nebius Token Factory. Segundo a Quartz, que cita a CNBC, os racks da Nebius devem entrar em operação ainda em 2026, junto a processadores Vera e GPUs Rubin. A própria Groq, que segue operando uma nuvem de inferência, planeja estar entre os primeiros clientes depois da Nebius. O diretor sênior da Nvidia Dion Harris disse à imprensa que o LPX permite a provedores criar faixas premium de serviço para clientes que exigem a menor latência, e reforçou que as GPUs continuam essenciais para treinar modelos.

O que observar

O anúncio não traz preço nem consumo de energia por rack, e não foram localizadas medições independentes além do teste citado da Artificial Analysis. A estratégia também cria uma divisão de trabalho mais explícita dentro dos data centers: GPUs com memória HBM para treino e processamento de contexto, e LPUs com SRAM para responder rápido. Para empresas que contratam inferência por token, o efeito prático deve aparecer primeiro em ofertas de baixa latência de provedores como a Nebius, ainda sem data de disponibilidade geral divulgada.

Fontes

Imagem destacada: ilustração gerada por computador, sem valor documental.

Deixe comentário

Seu endereço de e-mail não será publicado. Os campos necessários são marcados com *.

Fique por dentro

As principais notícias de tecnologia, todos os dias

Siga o portal nas redes sociais e acompanhe IA, cibersegurança, cloud, hardware e o mercado de tecnologia em primeira mão.