Эксперт NVIDIA обсудил экономику токенов в развитии приложений искусственного интеллекта
Подробнее
YourStory [india, en]
yourstory.com

Эксперт NVIDIA обсудил экономику токенов в развитии приложений искусственного интеллекта

По мере того как приложения на базе искусственного интеллекта выходят за рамки простого ответа на запросы и начинают выполнять функции агентов, писать код и управлять физическими системами, экономика токенов становится предметом растущей озабоченности для бизнеса и разработчиков.

Джигар Халани, старший директор по архитектуре и инженерии корпоративных решений в NVIDIA South Asia, выступая на мероприятии YourStory's DevSparks Hyderabad 2026, подробно разобрал формирующуюся «токен-экономику», разделив ее на четыре составляющие: полезность, спрос, предложение и монетизация.

Он подчеркнул, что ключевой принцип заключается в том, что проблема возникает тогда, когда происходит чрезмерное расходование ресурсов, что побуждает к мысли об экономии.

Потребление токенов демонстрирует быстрый рост. Халани сообщил, что изначально NVIDIA планировала использовать 16 триллионов токенов в течение 2026 года, однако к августу этот показатель уже превысил 18 триллионов, не считая использования токенов через такие инструменты, как Microsoft Copilot.

Для разработчиков, по мнению Халани, первоочередным вопросом является не выбор самой большой модели, а определение наиболее подходящей модели для выполнения конкретной задачи. Он отметил, что простой запрос не всегда требует использования крупной модели.

При переходе к более сложным задачам возникают значительные проблемы с задержкой, а требуемая пропускная способность снижается, и тип необходимой модели становится гораздо более сложным.

Таким образом, выбор моделей, основанный на типе рабочей нагрузки, а не на использовании одной универсальной модели, может стать важной частью управления затратами на ИИ.

Сторона спроса усложняется по мере того, как организации переходят к агентному ИИ. Приложение ИИ может генерировать токены не только в ответ на первоначальный запрос пользователя, но и в процессе рассуждений, обратной связи, вызовов инструментов и повторных циклов работы агента.

Халани посоветовал руководителям ИТ-служб (CIO и CTO) рассматривать спрос на токены через относительно простую формулу: количество одновременных пользователей, количество запросов на пользователя и среднее количество токенов, потребляемых за один запрос. Далее организациям необходимо учитывать типы рабочих нагрузок, паттерны использования и возможность обслуживания запросов через кэш вместо генерации новых токенов.

Он добавил, что чем больше можно использовать кэш вместо создания нового токена, тем больше можно сократить расходы, по крайней мере, на пятую или восьмую часть. Это, по его словам, является текущим рыночным стандартом для оценки потенциальной экономии в токен-экономике.

Управление предложением, объяснил Халани, требует оптимизации на трех уровнях: эффективности модели, эффективности системы и эффективности программного обеспечения. Он заявил, что времена, когда знание систем и оборудования было приемлемым для резюме, прошли, утверждая, что разработчики все чаще должны понимать базовые системы, лежащие в основе их приложений. «Наступила новая эра».

Это подразумевает необходимость осмысления памяти, сетевых соединений, хранения данных и распределения рабочих нагрузок между графическими процессорами (GPU). Например, для больших моделей вопрос заключается не только в количестве используемых GPU, но и в том, как они взаимодействуют друг с другом, и следует ли размещать их в одном или разных стойках.

Этот сдвиг потенциально может затронуть и сам ноутбук. Халани предположил, что компании могут начать оценивать возможность запуска небольших моделей ИИ локально на устройствах сотрудников, что уменьшит необходимость отправлять каждый запрос в API, облако или внутреннюю фабрику ИИ.

Однако для Халани более значимая возможность лежит за пределами простого снижения стоимости токенов. Он считает, что будущее заключается не в том, сколько токенов используется и насколько повышается эффективность, а в том, какие данные подаются, какая модель обучается или проходит пост-тренировку, делая ее все более умной, чтобы в ответ дать более интеллектуальный токен.

Это может привести к тому, что Халани назвал «прилипанием» клиентов. Чем лучше система ИИ понимает возвращающегося клиента, тем ценнее она становится для него, и, возможно, тем охотнее он готов за нее платить.

«Именно здесь вступит в игру монетизация токенов, и это будет самый прибыльный бизнес, который вы сможете вести», — заключил он.

Поскольку расширяются агентный и физический ИИ, инфраструктура, лежащая в их основе, будет становиться все более сложной. Для разработчиков границы между программным обеспечением, моделями, оборудованием и экономикой начинают стираться.

Похожие сюжеты

Локальная обработка ИИ требует большого объема оперативной памяти, что влияет на стоимость устройств
Подробнее
iol.co.za

Локальная обработка ИИ требует большого объема оперативной памяти, что влияет на стоимость устройств

Несмотря на то, что многие пользователи еще не убеждены в преимуществах искусственного интеллекта, неоспоримым является то, какой объем ресурсов потребляет эта технология. Речь идет конкретно об оперативной памяти (RAM), или «единой памяти», как ее предпочитает Apple, а не о пространстве долговременного хранения.

Простая истина заключается в том, что локальные задачи ИИ требуют огромного количества памяти, что коренным образом меняет принципы проектирования компьютеров, планшетов и смартфонов. Функции ИИ, встроенные непосредственно в устройство, например, интегрированные возможности ChatGPT от Apple, нуждаются в мгновенном доступе к вычислительной мощности системы.

Чтобы обеспечивать быстрые и плавные ответы, эти модели ИИ должны находиться непосредственно в активной памяти устройства. Когда системе требуется быстрый доступ к информации, индексация и обработка этих данных требуют быстрого временного рабочего пространства, которым и является оперативная память.

Можно провести аналогию: RAM подобна поверхности физического стола; чем больше стол, тем больше документов можно одновременно разместить для работы. Диск жесткого диска или SSD, напротив, выступает в роли файлового шкафа под столом, где хранятся большинство файлов долгосрочно.

Для обработки этих новых, более тяжелых рабочих нагрузок производители техники активно «обеспечивают будущее» своих последних моделей, оснащая их значительно большим объемом памяти. Этот внезапный рост спроса естественным образом привел к повышению цен на эти жизненно важные компоненты во всей технологической отрасли.

Следовательно, эти высокие цены на RAM теперь увеличивают розничные расходы на все, начиная от современных смартфонов и ноутбуков, и заканчивая медиаплеерами и консолями для высокопроизводительных игр. В центре этого повсеместного роста цен находится локальный ИИ — технология, которая еще не полностью завоевала симпатии многих обычных потребителей.

Популярное