Китайская академия наук (CAS ICT) представила систему социального интеллекта ZhiJing, которая включает в себя модель Zing и оценочный бенчмарк SoMBench. Эта разработка направлена на решение проблемы неспособности искусственного интеллекта понимать социальный контекст, эмоции и невысказанные сигналы.
Преодоление социальных пробелов ИИ
В отличие от моделей вроде GPT-5.5, которые демонстрируют высокую производительность в профессиональном письме, или DeepSeek в кодировании, ИИ часто выдает неуклюжие ответы в социальных ситуациях. ZhiJing рассматривает социальное познание как самостоятельную инженерную задачу.
Бенчмарк SoMBench
Первый компонент системы — это SoMBench, который служит эталоном для оценки социального интеллекта. Он декомпозирует абстрактное понятие понимания людей на три основные области, 17 подразмеров и 71 детальную задачу. Эти задачи охватывают моделирование отношений, понимание эмоций, нормы общества и рассуждения о убеждениях. Бенчмарк содержит 3481 тщательно проверенный пример, использующий многотиповую перекрестную проверку, включая вопросы с выбором одного, множественного выбора, суждения и открытого типа, а также методы пертурбации опций и обнаружения ярлыков для точного выявления ошибок модели.
Результаты тестирования и сложности
Тестирование на 20 ведущих моделях показало, что самая сильная модель достигла лишь 72,08% точности, при этом ни одна из них не смогла приблизиться к порогу в 90%, что подтверждает, что социальный интеллект остается малоисследованной областью. Наиболее сложные вызовы включают одновременное рассуждение о неявных намерениях, эмоциональных изменениях, социальных нормах, ролевых связях и невысказанных словах.
Инновации методологии Zing
Методология Zing включает три ключевых новшества. Первое — это цикл данных FLARE: когда обнаруживаются слабые места, FLARE генерирует новые образцы, нацеленные на устранение этого пробела в возможностях. Второе — двухэтапное обучение, которое сначала обеспечивает общую основу через дистилляцию с несколькими учителями и Mixed-Reward GRPO, а затем проводит специализированное усиление для эмоций, намерений и социальных норм. Третье новшество, On-Policy Distillation (OPD), решает классический риск катастрофического забывания в обучении с подкреплением. OPD вводит ограничения распределения токенов учителя на онлайн-траекториях, позволяя обучающей модели исследовать более эффективные пути, не отклоняясь от проверенных шаблонов рассуждений. Таким образом, фреймворк работает комплексно: FLARE определяет, что нужно изучить, двухэтапное обучение определяет, когда это делать, а OPD определяет, от кого учиться и чего не забывать.
Производительность Zing-27B
Модель Zing-27B продемонстрировала композитный результат по пяти бенчмаркам на уровне 79,80%, превзойдя GPT-5.5, который показал 78,44%. Zing-27B имеет преимущества в отслеживании рекурсивных убеждений HiToM (на 4,08 процентных пункта больше) и EmoBench (на 5,62 процентных пункта больше). Это первая модель размером менее 100 миллиардов параметров, которая обошла GPT-5.5 в задаче HiToM, тем самым утверждая социальный интеллект как отдельную инженерную дисциплину.