Nvidia интегрирует чипы Groq 3 LPX для ускорения ответов ИИ в своей инфраструктуре
Подробнее
Olhar Digital
olhardigital.com.br

Nvidia интегрирует чипы Groq 3 LPX для ускорения ответов ИИ в своей инфраструктуре

Nvidia начала производство стоек Groq 3 LPX и планирует ввести их в эксплуатацию уже в этом году в облаке Nebius. Эта технология была включена в компанию после приобретения активов Groq за 20 миллиардов долларов США, что стало самой крупной покупкой в истории Nvidia.

Основная цель этого внедрения — сосредоточиться на инференсе с низкой задержкой, что позволяет сократить время между отправкой пользователем запроса и получением ответа от системы искусственного интеллекта. Эта функция особенно важна в контексте программирования, где любая задержка может быть замечена немедленно.

В стойках Groq 3 LPX, установленных в Nebius, оборудование будет размещено рядом с процессорами Vera и GPU Rubin. Дион Харрис, старший директор Nvidia, подтвердил, что эти устройства станут доступны уже в этом году.

Архитектура, разработанная Groq, включает 500 МБ высокоскоростной памяти SRAM непосредственно в чипе. Таким образом, технология направлена на смягчение узких мест, вызванных доступом к памяти во время выполнения моделей ИИ.

Каждая стойка состоит из 256 чипов Groq 3. По данным Nvidia, система достигает скорости до 3400 токенов в секунду, показатель, полученный в результате теста производительности, проведенного Artificial Analysis.

Специальная функция чипов Groq

Технология Groq выполняет более специализированную роль. Ее чипы предназначены в первую очередь для фазы «декодирования» инференса, которая отвечает за генерацию токенов, составляющих окончательный ответ модели.

GPU, в свою очередь, сохраняют свое использование как для обучения, так и для инференса, предлагая большую универсальность для работы с различными моделями и технологиями. По словам Харриса, нет необходимости устранять одну технологию в пользу другой; речь идет об использовании подходящего процессора с правильной стоимостью для каждой части рабочей нагрузки.

Предлагаемая стратегия, таким образом, заключается в распределении задач в соответствии с присущими каждому типу процессора характеристиками.

На рынке Nvidia конкурирует с другими компаниями, стремящимися ускорить генерацию ответов ИИ. AMD объявила о планах интеграции своих систем в масштабе стоек с чипами Cerebras, компании, которая недавно провела первичное публичное размещение акций. OpenAI также участвовала в этой конкуренции, представив свой режим Ultrafast, который обещает 750 токенов в секунду и «питается Cerebras».

Расширение систем Vera Rubin

Параллельно Nvidia увеличивает поставки систем Vera Rubin, производство которых было начато ранее. В марте, во время мероприятия по запуску систем Vera Rubin и Groq 3 LPX, Дженсен Хуанг заявил, что четверть пространства центров обработки данных, предназначенного для приложений программирования, будет выделена под чипы Groq.

Хуанг подчеркнул в тот момент: «Остальная часть моего центра обработки данных — это 100% Vera Rubin». С появлением Groq Nvidia получает выделенный вариант для ускорения определенного этапа инференса. GPU остаются основой ее систем, в то время как новые стойки берут на себя обязанности там, где время отклика является определяющим фактором.

Популярное