A Academia Chinesa de Ciências (CAS ICT) apresentou o sistema de inteligência social ZhiJing, que inclui o modelo Zing e o benchmark de avaliação SoMBench. Este desenvolvimento visa resolver o problema da incapacidade da inteligência artificial de compreender o contexto social, as emoções e os sinais não ditos.
Superando Lacunas Sociais da IA
Ao contrário de modelos como o GPT-5.5, que demonstram alto desempenho em escrita profissional, ou o DeepSeek em codificação, a IA frequentemente fornece respostas desajeitadas em situações sociais. O ZhiJing trata a cognição social como uma tarefa de engenharia independente.
Benchmark SoMBench
O primeiro componente do sistema é o SoMBench, que serve como padrão para avaliar a inteligência social. Ele decompõe o conceito abstrato de compreensão humana em três áreas principais, 17 subdomínios e 71 tarefas detalhadas. Estas tarefas abrangem modelagem de relações, compreensão de emoções, normas sociais e raciocínio sobre crenças. O benchmark contém 3481 exemplos rigorosamente verificados, utilizando verificação cruzada multimodais, incluindo perguntas de múltipla escolha única, múltipla escolha, julgamento e abertas, bem como métodos de perturbação de opções e detecção de rótulos para identificar erros do modelo com precisão.
Resultados de Teste e Desafios
Testes em 20 modelos líderes mostraram que o modelo mais forte alcançou apenas 72,08% de precisão, e nenhum deles conseguiu se aproximar do limiar de 90%, confirmando que a inteligência social permanece uma área pouco explorada. Os desafios mais complexos incluem o raciocínio simultâneo sobre intenções implícitas, mudanças emocionais, normas sociais, relações de papéis e palavras não ditas.
Inovações da Metodologia Zing
A metodologia Zing inclui três inovações chave. A primeira é o ciclo de dados FLARE: quando falhas são detectadas, o FLARE gera novas amostras direcionadas para eliminar essa lacuna de capacidade. A segunda é o treinamento em duas etapas, que primeiro estabelece uma base geral através de destilação com múltiplos professores e Mixed-Reward GRPO, e depois realiza um reforço especializado para emoções, intenções e normas sociais. A terceira inovação, On-Policy Distillation (OPD), resolve o risco clássico de esquecimento catastrófico no aprendizado por reforço. O OPD introduz restrições de distribuição de tokens do professor em trajetórias online, permitindo que o modelo de treinamento explore caminhos mais eficientes sem desviar dos padrões de raciocínio testados. Assim, o framework funciona de forma integrada: o FLARE determina o que deve ser aprendido, o treinamento em duas etapas determina quando isso deve ser feito, e o OPD determina de quem aprender e o que não esquecer.
Desempenho do Zing-27B
O modelo Zing-27B demonstrou um resultado composto em cinco benchmarks no nível de 79,80%, superando o GPT-5.5, que obteve 78,44%. O Zing-27B tem vantagens no rastreamento de crenças recursivas HiToM (4,08 pontos percentuais a mais) e EmoBench (5,62 pontos percentuais a mais). Este é o primeiro modelo com menos de 100 bilhões de parâmetros que superou o GPT-5.5 na tarefa HiToM, afirmando assim a inteligência social como uma disciplina de engenharia separada.

