Команда Института автоматизации при Китайской академии наук (CASIA) представила модель мира под названием PhiZero. Эта модель разделяет задачу понимания физической динамики от задачи отрисовки кадров. Статья, озаглавленная «PhiZero: A World Model Built Around Physical Language», была опубликована на arXiv и начала распространяться среди сообщества воплощенного ИИ на этой неделе.
Мировые модели, которые прогнозируют будущие видеокадры последовательно, склонны объединять две существенно разные проблемы в одном пространстве предсказания. Внешний вид сцены, включая ее текстуры, освещение и фон, использует ту же емкость параметров, что и динамика, перемещающая объекты во времени. Группа CASIA утверждает, что именно это смешение является причиной того, что пиксельные мировые модели часто генерируют визуально убедительные кадры, которые при просмотре подряд отклоняются от физической правдоподобности.
PhiZero делит конвейер предсказания на два этапа. Первый этап принимает текущее состояние мира и действие, после чего выдает короткую последовательность дискретных токенов, которую авторы называют «физическим языком». Второй этап использует эти токены в качестве сжатого плана движения, и только затем отрисовывает следующие кадры. Модуль токенизатора, построенный на основе Q-Former уровня перехода и конечной скалярной квантизации (FSQ), генерирует эти дискретные токены. Декодер диффузии повторно использует внешний вид первого кадра в качестве высокочастотного априорного знания, позволяя языковым токенам сосредоточить свою емкость на движении, а не на текстуре.
Степень сжатия весьма значительна. Для клипа продолжительностью четыре секунды и состоящего из 33 кадров, PhiZero использует 256 токенов физического языка, взятых из словарного запаса размером около 25 000 единиц. В сравнении с этим, VAE Wan2.2 требует 44 800 непрерывных визуальных токенов для того же клипа. Это представляет собой примерно 175-кратное уменьшение количества токенов, которые должна потреблять и предсказывать мировая модель. Качество реконструкции остается сопоставимым с другими высокосжатыми видео-токенизаторами.
Последствия этого подхода структурны. Если мировые модели смогут рассуждать о коротких, дискретных траекториях состояний, а не о длинных, непрерывных потоках пикселей, то робототехника, автономное вождение и агенты воплощенного ИИ получат представление, которое ближе к языку программирования, чем к видеокодеку. Вклад PhiZero заключается не столько в самой цифре 175 раз, сколько в ставке на то, что физический язык, подобно естественному языку, может служить основой, на которой мировые модели композируют свои решения.



