AI最尴尬的短板,中国科学院出手了量子位
GPT-5.5能写专业论文,DeepSeek-V4-Pro能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。
但把同样的AI放进一次家庭聚餐、一场团队会议、一次医患对话,它往往表现得生硬、不合时宜。
不是知识不够,是“读懂人心”的能力还没跟上。这正是社会心智长期缺失带来的真实困境,也是从“任务执行”走向“社会协作”时必须补上的一课。
7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队,正式发布知境社会心智大模型技术体系。
这不是又一个大模型刷榜的故事,而是一份关于社会心智如何成为独立工程能力的完整答卷。
知境要做的,正是为现有大模型补上这块短板——给模型增加“情商”与可信任感,让AI在关键场合靠得住、信得过。
先体检,再开方:SoMBench给AI做“社会心智CT”
治病之前先诊断。知境团队做的第一件事,是建立一份足够精细的“体检表”SoMBench。
SoMBench把笼统的“懂不懂人”拆解成3大一级维度、17个二级维度、71项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的完整光谱。
3481道经过十余名人类专家评审、严格保留的实例,构成了一张社会心智的“能力地图”。
更重要的是,SoMBench不仅会告诉你“考了多少分”,还告诉你“错在了哪”。
通过单选、多选、判断、开放题的多题型交叉验证,以及选项扰动、捷径检测、受控改写等手段,SoMBench能精准定位模型的错误模式,例如:是推理链断了?还是靠表面模式蒙对了?这为后续的训练指明了靶子。
20个顶级大模型在SoMBench上测试,最强模型正确率仅72.08%,无一达到90%天花板,社会心智的“无人区”,名副其实。
为什么社会心智这么难?
因为同一场景里,AI要同时处理角色关系、隐含意图、情绪变化、社会规范、未说出口的话等多层推理——普通大模型根本理不清这些弯弯绕绕。
Zing的“训练密码”:让目标随能力一起进化
体检表有了,接下来怎么练?
知境团队没有走“堆数据、堆算力”的老路,而是设计了一套会“自我进化”的训练系统。
密码一:FLARE数据飞轮——错题本比课本更重要
传统训练是“准备一批数据,训完拉倒”。
Zing的做法是让评测像导航仪一样指出方向,而不是直接“透题”。
当模型在诊断集上暴露短板时,FLARE会定位到具体认知维度,再针对性合成全新的训练样本——语义、场景、推理路径都与原题不同,但瞄准同一种能力缺陷。
这就好比发现学生几何薄弱,就出套新几何题,而不是反复做同一张卷子。
候选样本还须经过多轮过滤,只保留模型当前无法轻易答对、但经过推理能够学会的中高难度样本。
这就是FLARE的核心逻辑:哪里弱就练哪里,但每次练的都是新题。
密码二:两阶段训练——先“通识”,再“专精”
第一阶段:通用社会心智打底。
模型首先利用多教师蒸馏构建高质量冷启动数据,通过答案门控、推理深度过滤保留有效推理轨迹;
随后采用Mixed-Reward GRPO强化学习框架,根据任务类型、训练阶段和推理质量,动态组合过程奖励、可验证奖励和拒绝采样——奖励目标随模型能力变化而调整,不是一成不变的KPI。
第二阶段:专项能力强化。
针对情绪理解、意图推断、社会规范、视角采择等薄弱环节,先用两轮监督微调注入领域知识,再用困难样本持续校准。
目标是:增强专项能力的同时,不丢失已学会的通用推理。
密码三:OPD在线蒸馏——边学新招,边不忘老本
强化学习最大的风险是“学新的,忘旧的”。
Zing的解决方案是OPD(On-Policy Distillation):在在线轨迹上引入教师模型的token级分布约束,让学生模型在探索更优路径的同时,不偏离已验证的有效推理模式。
GRPO负责“往前冲”,OPD负责“别跑偏”。
两者作用于同一批采样轨迹,既鼓励探索,也守住边界。
FLARE决定“学什么”,两阶段训练决定“什么时候学”,OPD决定“向谁学、不忘什么”。
Zing构建的不是一个静态训练流程,而是一套随模型能力状态持续自适应的进化系统。
数据说话:这套“密码”管用吗?
训练方法再漂亮,最终要拿成绩说话。在5项国际权威社会心智评测基准上,Zing给出了硬核答案。
△知境·Zing在5项社会心智能力评测中的性能对比表
Zing-27B,多模态模型综合均值超越GPT-5.5
Zing-27B五项综合均值79.80,超越GPT-5.5的78.44。
尤其在HiToM(+4.08pp)和EmoBench(+5.62pp)上优势明显。
HiToM评测的是“我知道你知道我知道”的递归信念追踪,阶数越高难度指数级增长——Zing-27B是首个在该基准上超越GPT-5.5的百亿参数级公开模型。
Zing-32B,文本模型比肩DeepSeek-V4-Pro
Zing-32B综合均值76.32,略超DeepSeek-V4-Pro的75.90。
EmoBench上78.13对71.88的6.25个百分点领先尤为突出,证明了专项社会心智训练在情感理解维度上能够形成显著的结构化优势。
Zing-8B/14B,小模型大心智
8B模型在HiToM上达到78.08,14B模型达到80.00,分别超越同尺寸基座模型近12和8个百分点,甚至超过参数量为其数十倍的更大模型。
递归阶数越高,差距越明显——Zing-8B在三阶和四阶信念推理上分别提升21.67和22.08个百分点。
这些结果指向同一个结论:社会心智能力的提升,来自训练方法的结构化设计,而非参数的简单堆砌。
△知境·Zing在高阶信念推理评测中的性能对比表
SoMBench作为知境自研的最难社会心智基准,当前模型仍有较大提升空间——这也正是下一步训练迭代的重点方向。


