AgiBot представила модель GE-Act 2.0 с масштабированием данных в 100 раз
Подробнее
Pandaily
pandaily.com

AgiBot представила модель GE-Act 2.0 с масштабированием данных в 100 раз

Компания AgiBot выпустила GE-Act 2.0 — модель, которая является нативной моделью мирового действия и была обучена исключительно на данных манипуляции в воплощенном виде, а не адаптирована из существующего видеогенератора. Компания утверждает, что этот релиз представляет собой первое систематическое исследование возможности того, что модель мирового действия может открыть новые навыки для реальных роботов по мере увеличения часов обучения в два порядка величины — с примерно 300 часов до 30 000 часов, без необходимости тонкой настройки под конкретную задачу или использования демонстрационных клипов во время оценки.

В отличие от существующих систем, которые присоединяют головку действия к замороженной видеомодели, GE-Act 2.0 одновременно обучает представление зрения, прогнозирование будущего и прогнозирование действий на данных роботов. При тестировании сцены, фоны, освещение и экземпляры объектов исключаются из обучающего процесса. В рамках этого протокола нулевого выстрела, охватывающего 100 атомарных задач и около 20 семейств навыков на двух воплощениях, успешность росла с увеличением объема данных: на платформе G1-OP общая успешность увеличилась с 17,1% до 44,1%, а на G2-90D — с 13,4% до 31,1%, причем прирост оставался заметным между уровнями в 5000 и 30 000 часов.

Компания подчеркивает явление «зажигания» для тонких навыков. Задачи, демонстрировавшие ненулевую успешность, расширились с 39 до 76 на G1-OP и с 24 до 72 на G2-90D. Такие действия, как складывание полотенца, вкладывание бумажных стаканчиков, снятие и замена колпачков ручек и составление букета в новых сценах, стали надежно проявляться только после достижения самого большого уровня данных. Также наблюдался кросс-воплощенный перенос: G1-OP предоставила более половины обучающих данных, тогда как G2-90D составила менее 2%, однако более редкое тело все равно выиграло около 17,7 процентных пунктов по мере роста общих данных.

Архитектурно, визуальный кодировщик CoAE сжимает каждый кадр размером 256 на 384 в 24 токена, сохраняя при этом семантические, движенческие и локальные структурные подсказки. Одношаговый визуальный планировщик предсказывает полный фрагмент будущего, а модель обратной динамики преобразует предсказанное изменение в действия; AgiBot указывает, что это занимает около 104 миллисекунд на один чанк действия на RTX 5090. Метод Knowledge-Aligned Selective Optimization отбирает несколько будущих сценариев и сохраняет тот, который наиболее соответствует записанным действиям, чтобы уменьшить расхождение между планированием и действием.

Рецепт данных включает смешивание неполных потоков: часы видеоинструкций для предварительного обучения мировой модели (включая эгоцентричные кадры без меток действий), часы траектории для обратной динамики, которые включают сбои и прогоны, и полностью парные часы видеоинструкций и действий для совместного обучения. В стеке GE от AgiBot GE-Sim нацелен на оценку политики и построение среды, в то время как GE-Act преобразует предсказанные будущие состояния в движение робота. После необязательной тонкой настройки AgiBot сообщает о показателе 60,52% в тестах вне распределения RoboTwin и 0,770 в следовании инструкциям GenieSim, опережая несколько сравниваемых базовых моделей. Материалы проекта доступны по адресу ge-act-v2.github.io.

Похожие сюжеты

Как агентский ИИ трансформирует стартапы, переводя данные в автономные решения
Подробнее
yourstory.com

Как агентский ИИ трансформирует стартапы, переводя данные в автономные решения

На встрече Snowflake Startup Mixer, прошедшей 17 июля в Хайдарабаде, собрались основатели стартапов, технологические руководители и инвесторы. Центральной темой мероприятия было преобразование данных в принятие решений и последующие действия. В рамках панельной дискуссии, демонстрации продукта и нетворкинга обсуждалось, как стартапы выходят за рамки простого сбора и анализа данных, создавая интеллектуальные системы, способные самостоятельно принимать решения с помощью агентского ИИ.

Панельная сессия под названием «Стартапы, работающие круглосуточно: создание компаний, которые никогда не спят» была модерирована Шивани Мутанной, старшим директором по партнерству контента в YourStory. В ней приняли участие Уткарш Шарма, креативный директор-ассоциат Pocket FM; Кишор Индукури, основатель и генеральный директор Sid’s Farm; Абхишек Дешпанде, операционный директор и соучредитель Recykal; а также Киран Каллури, партнер Dallas Venture Capital.

Дискуссия началась с вопроса о том, что именно означает понятие «круглосуточная работа». Для участников дискуссии это не означало, что сотрудники работают 24 часа в сутки, а скорее создание систем, которые продолжают выполнять критически важные рабочие процессы даже после того, как команды завершили свою работу.

В случае с Pocket FM, который обслуживает аудиторию в разных странах, производство контента фактически никогда не останавливается. ИИ стал неотъемлемым помощником на протяжении всего творческого процесса, ускоряя производство при сохранении качества. Компания использует ИИ для генерации материалов, обработки активов и поддержки производства, при этом люди остаются ответственными за качество и повествование.

Аналогичная концепция применяется в Sid’s Farm. Благодаря тысячам ежедневных доставок, перемещений сырья и взаимодействий с клиентами, данные непрерывно поступают от ферм и производственных объектов в логистические сети и к потребителям. Индукури объяснил, что ИИ помогает компании достаточно быстро интерпретировать эти данные, чтобы реагировать до того, как мелкие операционные проблемы превратятся в более серьезные.

В Recykal рабочий день начинается до рассвета, когда сборщики отходов начинают свои маршруты, и продолжается допоздна, пока грузы перемещаются по городам. Каждый этап генерирует операционные данные, предоставляя возможности для оптимизации решений в цепочке поставок, которая редко бывает остановлена.

С точки зрения инвестора, Каллури отметил, что ключевое различие лежит между компаниями, которые просто используют инструменты ИИ, и теми, которые фундаментально построены вокруг операций, поддерживаемых ИИ. Если удаление ИИ оставляет рабочие процессы в значительной степени неизменными, компания использует ИИ в основном для повышения эффективности. Однако, если отсутствие ИИ требует полной переработки самого бизнеса, тогда организация может считаться по-настоящему ИИ-нативной.

По мере того как ИИ глубже интегрируется в бизнес-процессы, стартапы также переосмысливают масштабирование. Для Recykal ИИ перестал рассматриваться как отдельная технологическая инициатива, а стал общекорпоративным требованием. Дешпанде заявил: «У нас есть внутренний мандат. Каждый понедельник должна появиться новая инициатива ИИ. Мы должны обсуждать это, и любой может ее предложить, от стажера до CXO».

Он пояснил, что компания картировала каждую бизнес-функцию, определила повторяющиеся процессы, подходящие для ИИ, и использовала многолетние операционные данные для перепроектирования рабочих процессов. Результаты оказались существенными: Recykal увеличил годовой доход с 400–500 крор до 1 400 крор при увеличении штата с примерно 80 до 128 сотрудников.

В Pocket FM Шарма подчеркнул, что руководство позиционировало ИИ как инструмент поддержки, а не как замену творческим специалистам. Компания инвестировала в инструменты генерации аудио, видео и изображений с помощью ИИ, одновременно обеспечивая, чтобы люди продолжали проводить проверки качества и сохранять эмоциональный опыт, которого ожидают зрители. Создание историй, состоящих из сотен или даже тысяч эпизодов, по-прежнему требует человеческого суждения, при этом ИИ ускоряет производство, а не заменяет креативность.

В Sid’s Farm усилия по внедрению ИИ сосредоточены на операциях, ориентированных на потребителя. Индукури отметил: «Там, где мы активно используем ИИ, или область, на которую мы постоянно смотрим, — это потребительская сторона». Молочная отрасль ежедневно генерирует огромное количество операционных данных. ИИ все чаще помогает прогнозировать спрос, сокращать потери, оптимизировать планирование производства и динамически регулировать запасы по каналам доставки.

Каллури добавил, что эти примеры демонстрируют, что отличает долговечные компании, использующие ИИ, от предприятий, которые лишь оборачивают существующие языковые модели. Он предупредил: «Если отсутствует способность захватывать эти процессы, то это красные флаги, которые мы видим. И это не компании, которые смогут масштабироваться и расти. Они могут добиться успеха с одним конкретным клиентом и в очень специфическом случае, но если им нужно расширять свой бизнес и атаковать весь TAM, это становится очень сложным, если они не имеют этих основ».

Для инвесторов более сильными показателями долгосрочного масштабирования являются владение дифференцированными данными, построение надежных рабочих процессов и внедрение ИИ во все продукты, функции выхода на рынок и внутренние операции, а не просто брендирование компании как ИИ-ориентированной.

Поскольку стартапы автоматизируют все больше рабочих процессов, все более важным становится вопрос: где должен заканчиваться ИИ и где люди должны сохранять контроль? Панелисты сошлись во мнении, что, хотя ИИ может значительно ускорить выполнение задач, критически важные бизнес-решения по-прежнему требуют человеческого надзора.

Дешпанде предостерег от принятия результатов работы ИИ как неоспоримых. «Мне кажется, что ИИ — это „дающий согласие“, поэтому мы должны быть очень умны. Нужен человеческий вмешательство. Вы не можете заменить людей. Фундаментально, вы должны четко понимать, чего хотите».

Индукури сообщил, что Sid’s Farm интегрирует ИИ в подбор персонала, поддержку клиентов и оперативное планирование, но считает, что ИИ должен сначала обрабатывать рутинные запросы, прежде чем передавать более сложные ситуации людям. Например, служба поддержки может автоматически отвечать на вопросы о доставке или статусе заказа, в то время как недовольные клиенты или проблемы, связанные с качеством, должны направляться в человеческие команды. Вместо замены сотрудников ИИ позволяет им сосредоточиться на проблемах, требующих суждения, эмпатии и контекста.

Обсуждение также подчеркнуло, что одних технологий недостаточно для определения успеха стартапов. Основателям необходимы дисциплинированные организации, надежные процессы, высококачественные данные и четкое понимание того, где ИИ создает реальную бизнес-ценность. Дешпанде заметил, что ИИ уже меняет подход стартапов к талантам: «Я видел, как стажер дает лучший результат, чем человек с 10-летним опытом. Молодое поколение адаптируется быстрее».

Он добавил, что сами основатели должны стать активными пользователями ИИ, прежде чем ожидать, что их команды примут новые инструменты. Успех зависит от определения правильных бизнес-проблем в первую очередь; только тогда ИИ сможет дать значимые результаты, а не добавить ненужную сложность.

Вечер завершился живой демонстрацией под названием «Чертеж: от данных к действию с помощью агентских рабочих процессов», представленной Акшатом Париком, Харишем Чинтакунтой и Наведеей Оджа из Snowflake. Сессия продемонстрировала, как стартапы могут значительно сократить время, необходимое для создания приложений на базе ИИ, объединяя корпоративные данные с возможностями агентского ИИ. Используя Snowflake Cortex Code, специализированного агента кодирования ИИ для рабочих нагрузок данных и ИИ, докладчики показали, как разработчики могут перейти от запроса на естественном языке к готовому к производству приложению за считанные минуты.

Приведенный пример использования для обнаружения мошенничества в финтех-сфере проиллюстрировал этот процесс. Один запрос сгенерировал приложение, которое принимало данные о клиентах и транзакциях, рассчитывало баллы риска мошенничества, создавало панели мониторинга и формировало рабочее пространство для расследования на основе ИИ. Помимо панелей мониторинга, пользователи могли задавать вопросы о тенденциях мошенничества, поведении клиентов и шаблонах транзакций на естественном языке. ИИ разбивал эти запросы на несколько шагов рассуждения перед генерацией действенных выводов.

Команда также осветила гибкость моделей Snowflake. Вместо того чтобы привязывать организации к одной базовой модели, платформа поддерживает несколько ведущих моделей, включая Claude, Llama, DeepSeek, Mistral и OpenAI, позволяя бизнесу выбирать подходящую модель для каждой задачи, сохраняя при этом данные в рамках безопасной системы управления. На протяжении всего вечера оставалось ясным одно послание: ИИ больше не просто помогает стартапам работать быстрее. Он все чаще становится частью того, как проектируются и функционируют предприятия. Стартапы начинают встраивать ИИ в основу своих продуктов, рабочих процессов и повседневного принятия решений, вместо того чтобы рассматривать его как отдельный инструмент.

Zhipu AI представила GLM-5.3-Flash, модель, ранее известная как 'Ox Alpha'
Подробнее
pandaily.com

Zhipu AI представила GLM-5.3-Flash, модель, ранее известная как 'Ox Alpha'

В течение нескольких дней разработчики искусственного интеллекта по всему миру пытались выяснить личность модели Ox Alpha — загадочного продукта, который внезапно появился на платформе OpenRouter без указания разработчика, раскрытия параметров или технического отчета. Эта модель быстро поднялась в списке трендов платформы благодаря своим способностям в генерации кода, сложном рассуждении и выполнении длительных задач агента.

На прошлой неделе секрет был раскрыт: Ox Alpha оказалась новейшим релизом от Zhipu AI — моделью GLM-5.3-Flash. Модель впервые была размещена на OpenRouter анонимно 20 августа в рамках практического слепого тестирования. В течение этого периода ее провайдер предоставил бесплатно около 100 триллионов токенов ежедневной сервисной мощности, что привлекло большое количество реальных пользователей. Соучредитель Stripe Патрик Коллисон назвал это 'очень впечатляющим'. Примечательно, что Zhipu заявила, что весь трафик, сгенерированный во время анонимного запуска, обслуживался крупным кластером, развернутым на отечественных чипах ИИ.

GLM-5.3-Flash представляет собой модель типа 'mixture-of-experts' с общим количеством параметров в 320 миллиардов, при этом на каждом шаге инференса активно используется лишь около 18 миллиардов. Это отличается от серии GLM-4.5, которая имеет 320 миллиардов общих и 32 миллиарда активных параметров, а количество слоев снижено с 92 до 45. Приставка 'Flash' в названии указывает на архитектуру, разработанную для сохранения производительности, близкой к флагманской, при одновременном снижении вычислительной нагрузки на каждый токен.

Кроме того, это первая нативно мультимодальная модель в семействе GLM-5, способная принимать текст, изображения, видео и файлы в контекстном окне объемом примерно в один миллион токенов. Она была обучена на мультимодальном корпусе из 30 триллионов токенов. Чтобы сделать инференс на миллион токенов доступным, Zhipu объединила линейное внимание со разреженным вниманием — подход, который компания называет первой гибридной архитектурой такого рода в открытой передовой модели, а также добавила IndexPool для уменьшения накладных расходов индексатора. Компания оценивает, что вычислительная нагрузка внимания снижается примерно на треть, а кеш KV — примерно на четверть по сравнению с GLM-5.3.

Тесты показывают сильные стороны модели в работе с кодом и задачами агента: она показала 63.4 балла в DeepSWE v1.1 против 46.2 у GLM-5.2, 48.8 балла в AutomationBench против 26.2, а также 84.3 балла в Terminal-Bench 2.1. Веса модели теперь доступны на Hugging Face под разрешительной лицензией MIT, с поддержкой локального развертывания через SGLang, vLLM и связанные фреймворки. Отказавшись от раскрытия информации при запуске, Zhipu позволила разработчикам вынести суждение, основанное исключительно на фактической производительности модели.

Популярное