Nvidia integra chips Groq 3 LPX para acelerar respostas de IA em sua infraestrutura
Leia mais
Olhar Digital
olhardigital.com.br

Nvidia integra chips Groq 3 LPX para acelerar respostas de IA em sua infraestrutura

A Nvidia iniciou a produção do rack Groq 3 LPX e planeja colocá-lo em operação ainda neste ano na neocloud Nebius. Essa tecnologia foi incorporada à empresa após a aquisição de ativos da Groq por um valor de US$ 20 bilhões, representando a maior compra já efetuada pela Nvidia.

O principal objetivo dessa implementação é focar na inferência de baixa latência, o que permite diminuir o tempo entre o envio de uma solicitação pelo usuário e a obtenção da resposta de um sistema de inteligência artificial. Esta funcionalidade é particularmente importante em contextos de programação, onde qualquer demora pode ser notada de forma imediata.

Nos racks Groq 3 LPX instalados na Nebius, os equipamentos serão posicionados ao lado dos processadores Vera e das GPUs Rubin. Dion Harris, diretor sênior da Nvidia, confirmou que esses dispositivos estarão disponíveis ainda neste ano.

A arquitetura desenvolvida pela Groq incorpora 500 MB de memória SRAM de alta velocidade diretamente no próprio chip. Dessa forma, a tecnologia visa mitigar os gargalos causados pelo acesso à memória durante a execução dos modelos de IA.

Cada rack é composto por 256 chips Groq 3. Segundo dados fornecidos pela Nvidia, o sistema atinge uma taxa de até 3.400 tokens por segundo, um número obtido através de um teste de desempenho realizado pela Artificial Analysis.

Função específica dos chips Groq

A tecnologia Groq desempenha um papel mais especializado. Seus chips são direcionados primariamente para a fase de "decode" da inferência, que é a responsável por gerar os tokens que constituem a resposta final de um modelo.

As GPUs, por sua vez, mantêm seu uso tanto no treinamento quanto na inferência, oferecendo maior versatilidade para lidar com diversos modelos e tecnologias. Para Harris, não há necessidade de eliminar uma tecnologia em favor da outra; trata-se de utilizar o processador adequado e com o custo correto para cada parte da demanda de trabalho.

A estratégia proposta é, portanto, distribuir as tarefas de acordo com as características inerentes a cada tipo de processador.

No mercado, a Nvidia compete com outras companhias que buscam acelerar a geração de respostas por IA. A AMD anunciou planos de integrar seus sistemas em escala de rack com chips da Cerebras, empresa que recentemente realizou oferta pública de ações. A OpenAI também participou dessa competição, apresentando seu modo Ultrafast, que promete 750 tokens por segundo e é "alimentado pela Cerebras".

Expansão dos sistemas Vera Rubin

Paralelamente, a Nvidia está aumentando os envios dos sistemas Vera Rubin, cuja produção havia sido iniciada anteriormente. Em março, durante o evento de lançamento dos sistemas Vera Rubin e Groq 3 LPX, Jensen Huang declarou que destinaria um quarto do espaço de data centers voltado para aplicações de programação aos chips Groq.

Huang ressaltou na ocasião: "O restante do meu data center é 100% Vera Rubin". Com a introdução da Groq, a Nvidia adquire uma opção dedicada para agilizar uma etapa específica da inferência. As GPUs permanecem como a fundação de seus sistemas, enquanto os novos racks assumem responsabilidades onde o tempo de resposta é um fator determinante.

Popular