Генерация видео стала одной из самых обсуждаемых тем в сфере искусственного интеллекта в 2026 году. Такие разработки, как ByteDance Seedance 2.0, MiniMax H3 и Seedance 2.5, подняли китайские команды в мировые рейтинги, а области применения расширяются в киноиндустрии, создании коротких драматических сюжетов и электронной коммерции.
Однако за громкими заявлениями скрываются технические проблемы: стоимость инференса остается высокой, растет сложность многопоточного понимания видео, а универсальные графические процессоры (GPU) тратят вычислительную мощность, энергию и время на задачи, не соответствующие их первоначальному назначению.
Компания SmarCo HT Tech, одна из первых китайских команд, внедривших архитектуру потоковой передачи данных (dataflow), представила свой новый чип Jingang GC3. Этот чип оснащен 12 ядрами RISC-V, обеспечивает 200 TOPS вычислений INT8 и имеет 128 ГБ унифицированной памяти LPDDR5 ECC. Технический директор Wu Dongdong заявил, что чип «рожден для видео»: один и тот же кремниевый массив, способный декодировать и кодировать множество потоков, может выполнять модели генерации видео, а его подсистема памяти спроектирована для обработки промежуточных тензоров, требуемых современными видеотрансформерами.
Wu объяснил, почему стандартные GPU уступают в задачах видеоанализа. При анализе видео сырые потоки поступают на сервер, декодируются в кадры, а затем обрабатываются с помощью инференса на GPU. Он отметил, что узким местом редко являются чистые FLOPS; скорее, проблема заключается в задержке перемещения каждого кадра между блоками памяти и вычислительными блоками при работе с множеством параллельных потоков.
В случае генерации видео GPU запускает диффузионную или трансформерную модель, которая создает кадры, а затем кодировщик их сжимает. Хотя сама модель требует больших вычислительных ресурсов, каждый промежуточный результат все равно должен считываться и записываться, а эти тензоры могут достигать сотен гигабайт. Чрезмерное частое чтение приводит к простою кремния.
Это архитектурное расхождение лежит в основе обеих проблем. Центральные процессоры (CPU) и GPU являются машинами фон Неймана с счетчиком программы, который последовательно проходит через инструкции. Такая конструкция управления очень универсальна, что делает ее посредственной для работы с видео. Параллелизм на уровне пикселей и матриц опережает возможности центрального контроллера по планированию задач, что приводит к насыщению трафика памяти. Множество ядер тратят больше времени на ожидание барьеров, чем на полезную работу.
Архитектура потоковой передачи данных кардинально меняет эту модель. Программа представляется в виде графа операций, где зависимости данных выступают в роли ребер. Инструкция выполняется в тот момент, когда становятся доступны ее входные данные, без участия счетчика программы, определяющего очередность. Wu сравнил это с производственной линией: каждая станция начинает работу, как только поступают детали, и немедленно передает результат дальше, без центрального диспетчера и почти без простоя.
Jingang GC3 объединяет потоковую передачу данных в качестве вычислительного движка с RISC-V в качестве управляющего ядра и унифицированной памятью для путей CPU, VPU, GPU и NPU. В настоящее время отрасль проверяет на практике, может ли потоковая передача данных заменить управляемый поток в качестве основного механизма для вычислений ИИ. Jingang GC3 является ответом SmarCo HT Tech на этот вопрос, используя видео как полигон для доказательства.

