Shanghai AI Lab выпустила научную мультимодальную модель Intern-S2-397B с декодером памяти
Подробнее
Pandaily
pandaily.com

Shanghai AI Lab выпустила научную мультимодальную модель Intern-S2-397B с декодером памяти

Shanghai AI Laboratory представила свою научно ориентированную мультимодальную базовую модель Intern-S2-397B с открытыми весами на платформах Hugging Face и ModelScope. Анонс состоялся после презентации на Форуме инноваций Пуцян 13 сентября 2026 года и лабораторного брифинга 21 сентября.

Официальное английское наименование лаборатории — Shanghai AI Laboratory / Intern-S2. Этот релиз отличается от недавних публикаций лаборатории, таких как Atria Dawn, Intern Physical World Model W0 и NCP-ArchPreview, поскольку он представляет собой выпуск весов научной модели с архитектурой, а не анонс очередного агента или модели мира.

Модель Intern-S2 предназначена для выполнения научных задач с длительным горизонтом и циклов агентов. Материалы лаборатории подчеркивают наличие подключаемого Декодера Памяти (Memory Decoder), который позволяет присоединять модули предметной области без необходимости переобучения всей базовой модели. Например, использование Intern-MemDec-4B в биологических экспериментах повысило средние показатели по Биологическим Инструкциям примерно с 56.92 до 60.32, сохраняя при этом общие результаты на уровне основной модели.

На Hugging Face указано, что карта Intern-S2-397B содержит около 403 миллиардов параметров. Модель прошла визуальное предварительное обучение на страницах необработанной научной литературы, многодоменное научное обучение с подкреплением в более чем 20 областях, а также обучение с подкреплением агента с длительным горизонтом в изолированных средах. Для работы предусмотрены пути обслуживания через LMDeploy, vLLM и SGLang, а также задокументирована официальная конечная точка API Intern.

Shanghai AI Laboratory сообщает, что Intern-S2 глубоко оптимизирована совместно с вычислительным стеком Ascend от Huawei по аспектам вычислений, связи и памяти. Кроме того, модель будет интегрирована в платформу научных открытий Intern DuanYan лаборатории, которая охватывает области наук о жизни, материалов, полупроводников и смежных дисциплин. Согласно заявлениям вендора, Intern-S2 занимает первое место среди моделей с открытым исходным кодом по знаниям, коду и наборам агентов, демонстрируя сильные результаты в задачах по биологии и материаловедению; однако эти цифры пока являются данными лаборатории до проведения независимых тестов.

Для исследовательских групп конечным результатом является доступ к загружаемым весам Intern-S2-397B, сопровождаемым документацией по Декодеру Памяти и примечанием о сотрудничестве с Ascend. Таким образом, это открытая мультимодальная базовая модель, обновленная для использования сообществом, а не просто анонс, основанный на закрытом API.

Похожие сюжеты

Робот-модель Lexiang Aether продемонстрировал работу на открытом воздухе в течение часа во время трансляции барбекю
Подробнее
pandaily.com

Робот-модель Lexiang Aether продемонстрировал работу на открытом воздухе в течение часа во время трансляции барбекю

Компания Lexiang Technology, которая также фигурирует в корпоративных материалах на английском языке как JoyIn Technology, провела публичное стресс-тестирование своей воплощенной модели Aether 16 сентября в районе Миньханг города Шанхай. Два гуманоидных робота выполняли цикл обслуживания шаурмы более часа подряд.

В ходе этого испытания роботы занимались приемом заказов, координацией работы на кухне, подачей блюд и реагированием на изменения, вносимые живыми клиентами. Сессия транслировалась в прямом эфире как непрерывное испытание в открытой среде, а не как короткая демонстрация.

Модель Aether позиционируется как кросс-воплощенная модель с приблизительно 4 миллиардами параметров. Lexiang утверждает, что обучение использовало около 200 часов видеоматериалов с участием людей и не требовало данных о демонстрации реальных роботов. Вместо этого компания опиралась на стек оценки состояния, основанный на энергии, потоковую память для длительных задач и явную самомодель тела робота, что позволяет одной и той же политике управлять различными морфологиями.

Ранее индустрия уже обратила внимание на совместное восстановление после сбоев, показанное в нередактированном клипе с двумя роботами в комнате для уборки под кодовым названием MVP.

Во время стрима барбекю один робот отвечал за подтверждение заказа и обслуживание гостей, в то время как второй управлял приготовлением на гриле. Изменения в заказе, например, уменьшение количества специй, требовали от принимающего заказ сотрудника повторно проинструктировать повара и поддерживать движение воды и салфеток.

Lexiang представила этот тест на открытом воздухе продолжительностью более часа как более сложную публичную проверку по сравнению со студийными демонстрациями, поскольку на рыночных прилавках, освещении и вмешательстве зрителей невозможно полностью прописать сценарий, а ошибки фиксируются в реальном времени.

Компания еще не опубликовала полный технический отчет, который позволил бы третьим сторонам воспроизвести заявление об отсутствии данных роботов или заявленные показатели успеха без предварительного обучения. Однако сессия 16 сентября установила конкретный публичный артефакт: задачу по обслуживанию на открытом воздухе с участием двух роботов и кросс-воплощением, которая длилась более часа под пристальным вниманием, что является полезным доказательством для сравнения с лабораторными демонстрациями до появления независимых бенчмарков.

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0
Подробнее
pandaily.com

Xiaomi открыла модель воплощенного мирового фундамента и набор для обучения Robotics-U0

Компания Xiaomi сделала доступным для общественности свой продукт Xiaomi-Robotics-U0 — авторегрессивную фундаментальную модель воплощенного мира. Эта модель рассматривает синтез, ориентированный на роботов, не просто как узкоспециализированный процесс генерации траекторий, а как продолжение генерации изображений и видео на основе фундаментальных моделей.

Согласно официальным материалам, основная линия модели содержит около 38 миллиардов параметров и постоянно обучается для достижения воплощенного интеллекта. Дополнительные публичные веса, включая варианты Xiaomi-Robotics-U0-4B и FlashAR, доступны на платформах Hugging Face и ModelScope, а также предоставляется код для инференса, демонстрации через Gradio и релизы обучения FSDP, датированные началом сентября.

В рамках одного фреймворка следующего токена данная модель объединяет несколько функций: генерацию изображений из текста, редактирование изображений из любого источника, создание многовидовых сцен, воплощенный контролируемый трансфер и генерацию воплощенного видео. Xiaomi утверждает, что этот стек сохраняет фундаментальную визуальную семантику, одновременно добавляя способность к рассуждению, ориентированному на роботов, посредством стадий обучения — как одношаговых, так и последовательных. Эти стадии включают потоки подзадач-целей, чередующиеся друг с другом, а также воплощенное видео с частотой 1, 3 и 5 кадров в секунду.

Архитектурные заметки указывают на использование токенизации изображений IBQ и мультимодального словаря, который поддерживает авторегрессивное масштабирование между различными модальностями. Эта архитектура построена на компонентах, происходящих от линий Qwen3-32B и EMU3.5.

Вторым важным аспектом является эффективность инференса. Технология FlashAR+ заменяет последовательное декодирование токенов изображения на антидиагональную параллельную генерацию и используется совместно с пакетной обработкой vLLM. Xiaomi сообщает о возможном ускорении генерации изображений размером 1024x1024 до почти 83 раз быстрее, что снижает задержку для одного образца с примерно 450,8 секунд до 5,44 секунд на заявленном оборудовании.

Страницы возможностей заявляют, что показатели побед в многовидовых сценах и трансфере превосходят GPT-Image-2 при внутреннем разделении данных на сложные и простые. Кроме того, UNIS (Xiaomi-Robotics-U0) занимает первое место среди более чем 100 моделей на WorldArena с показателем EWMScore_P, равным 73,64.

В области применения, данные для переноса стиля из модели смешиваются с реальными демонстрационными наборами для последующего обучения политики. Xiaomi сообщает об увеличении прогресса по задачам вмешательства с приблизительно 36,9% до 63,2% при использовании фонов и освещения, которые не использовались в обучении, при этом снижение по сравнению с базовым лабораторным уровнем было меньшим.

Хотя контрольные точки для генерации видео все еще догоняют релизы изображений и трансфера, команды должны проверить условия лицензирования, выбор движка FlashAR и воспроизводимость WorldArena сторонних разработчиков, прежде чем использовать открытые веса как готовый завод по данным для производственных роботов.

Популярное