TaichuAI выпустила открытую мультимодальную модель ZDTaichu5.0-9B для пространственного понимания
Подробнее
Pandaily
pandaily.com

TaichuAI выпустила открытую мультимодальную модель ZDTaichu5.0-9B для пространственного понимания

Компания TaichuAI сделала модель ZDTaichu5.0-9B общедоступной. Эта мультимодальная фундаментальная модель имеет приблизительно 9 миллиардов параметров и предназначена для общего визуального понимания, пространственного рассуждения, использования агентских инструментов и исследований в области воплощенного ИИ.

Архитектура модели объединяет языковой бэкбон Qwen3.5-9B с кодировщиком зрения C-RADIOv4-H. Модель принимает на вход текст, а также одно или несколько изображений и видео любого разрешения, поддерживая длину контекста до 128 тысяч токенов. Издание, которое обобщила TMTPost 15 сентября, было сосредоточено на восприятии пространства в реальном мире, преобразованиях между разными видами и планировании задач для воплощенных систем.

Согласно публичной карточке модели, TaichuAI демонстрирует первоклассные результаты среди примерно 10-миллиардных общих VLMs по широкому спектру визуальных задач, а также расширяет свои возможности в пространственных, воплощенных и агентских сценариях. Среди отмеченных показателей в области пространства и воплощенности выделяются ViewSpatial 62.50, MMSI-Bench 47.20, MindCube-tiny 78.27, ERQA 48.00 и RoboSpatial 56.00.

В отношении наборов для агентов и инструкций, указанных в примечаниях к оценке на карточке, TAU2-Bench достигает показателя 87.70, а средний показатель Claw-Eval составляет 71.40, при этом IFEval показывает 93.70. Механизм энтропийно-приоритированного адаптивного рекурсивного рассуждения описывается как механизм, который выделяет дополнительные шаги уточнения латентных переменных для более сложных токенов.

Возможности модели охватывают распознавание оптических символов (OCR) и понимание документов, математику на изображениях, тонкие двумерные взаимосвязи, ассоциацию нескольких видов, восприятие трехмерных сцен и перспективы, а также отслеживание множества изображений и видео в рамках длинного окна контекста, включая планирование многоэтапного использования инструментов. При этом фактическое выполнение инструментов остается обязанностью хост-приложения.

Темы пространственного обучения, перечисленные на карточке, включают относительные отношения, плотный подсчет и рамки, движение камеры и упорядочивание глубины, эгоцентрические против аллоцентрических видов, а также высокоуровневое определение возможностей и планирование действий для адаптации в стиле VLA.

Веса модели размещены на Hugging Face по адресу TaichuAI/ZDTaichu5.0-9B под лицензией NVIDIA Open Model License, сохраняя при этом уведомления Apache-2.0 от Qwen3.5. Для обслуживания используется кастомная ветка vLLM 0.26.0 и образ Docker от TaichuAI для обеспечения конечных точек, совместимых с OpenAI, с рекомендуемыми настройками выборки для пространственной привязки и общих задач.

Как и в случае с другими моделями, представленными вендорами, внешним лабораториям следует рассматривать показатели бенчмарков как заявленные при указанных подсказках и судьях до момента появления результатов независимого воспроизведения. Однако сочетание среднеразмерной открытой мультимодальной контрольной точки, акцента на пространстве и агентах, а также готовой упаковки vLLM предоставляет исследователям конкретный артефакт для оценки.

Популярное