Ant Group выпустила мультимодель Ling-3.0-flash-VL с циклом обратной связи по визуальным данным
Подробнее
Pandaily
pandaily.com

Ant Group выпустила мультимодель Ling-3.0-flash-VL с циклом обратной связи по визуальным данным

Компания Ant Group представила и открыла для общественности модель Ling-3.0-flash-VL, которая является первой нативной мультимодальной моделью в линейке Ling. Выпуск произошел через организацию inclusionAI на платформах Hugging Face и ModelScope.

Модель построена на основе бэкбона Ling-3.0-flash типа mixture-of-experts и имеет общий размер 124 миллиарда параметров, при этом активируется около 5,5 миллиардов параметров на каждый токен. Она способна принимать на вход изображения, текст и видео, а компания указывает контекстное окно в 256 тысяч токенов для обработки длинных документов и видеоматериалов. Веса в форматах BF16 и FP8 были опубликованы 9 сентября, а вскоре планируются версии в форматах FP4 и INT4.

Ключевым дизайнерским решением стала реализация цикла обратной связи, основанного на зрении. Этот цикл рассматривает восприятие не как разовый этап создания подписи, а как неотъемлемую часть непрерывного рабочего процесса. Модель инструктируется наблюдать, действовать, проверять и корректировать свои результаты на основе визуально отображенных или сгенерированных данных.

Ant Group позиционирует эту модель для автоматизации графических интерфейсов пользователя (GUI), генерации кода фронтенда и анализа медицинских отчетов. В тестах, связанных с преобразованием изображений в веб-страницы, модель продемонстрировала способность восстанавливать взаимосвязи между компонентами и макетом, после чего она пересматривала сгенерированный код, сравнивая его с результатами рендеринга. Под псевдонимом linthium в Image-to-WebDev Arena, Ant Group сообщила, что ее показатель превзошел показатели GPT-5.4.

Как агент GUI, модель умеет разбирать структуру интерфейса и связывать действия между различными инструментами. В сценариях клинических отчетов она предназначена для консолидации информации из разных документов и выявления рисков, а не только для обобщения содержимого одной страницы.

По заявлениям Ant Group, совместное обучение с использованием нативных мультимодальных данных улучшило как текстовые возможности, так и визуальные навыки модели. Согласно индексу Artificial Analysis Intelligence Index v4.1.1, Ling-3.0-flash-VL получила оценку 42, что на четыре балла выше, чем текстовая версия Ling-3.0-flash.

Материалы Hugging Face структурируют оценку по трем направлениям: понимание, рассуждение и действие. Эти направления включают работу со сложными макетами и документами, многоэтапные проверки, основанные на доказательствах, и выполнение задач, управляемых интерфейсом. Такой подход соответствует стратегическому замыслу компании о том, что открытые мультимодальные веса должны помогать агентам замыкать циклы в программном и клиническом рабочих процессах, а не просто отвечать на статические визуальные вопросы.

Архитектура модели сочетает энкодер зрения произвольного разрешения и двухслойный проектор с временным кодированием VideoRoPE, за которым следует 42-слойный гибридный языковой ствол. Этот ствол чередует блоки KDA и gated MLA в соотношении 5:1. Благодаря разреженной MoE, вычислительная нагрузка остается низкой даже при длительных сессиях визуального чата и истории действий агента.

Демонстрации доступны на Ling Studio. Наряду с весами, документированы рецепты для SGLang и форка vLLM, настроенного под Ling, включая парсеры для рассуждений и вызова инструментов, адаптированные под шаблон чата Ling-3.

Для разработчиков этот открытый релиз представляет собой не просто очередного создателя подписей, а ранний открытый мультимодальный стек Ling, который интегрирует зрение в процессы планирования и верификации для агентных задач. Это также первый открытый релиз Ling, который включает нативный мультимодальный путь с явным циклом обратной связи по зрению, а не просто прикрепленный пакет визуальных функций.

Популярное