AI最尴尬的短板,中国科学院出手了
GPT-5.5能写专业论文不假,DeepSeek-V4-Pro能生成复杂代码也是事实,具身机器人甚至能完成基础的物理操作。语言智能和工具智能,都已经跑出了自己的赛道。
但把同样的AI放进一次家庭聚餐、一场团队会议、一次医患对话,它往往表现得生硬、不合时宜。不是知识储备不够,是“读懂人心”的能力还没跟上。
这恰恰是社会心智长期缺失带来的真实困境,也是从“任务执行”走向“社会协作”时必须补上的一课。
7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队,正式发布了
知境社会心智大模型技术体系
社会心智如何成为独立工程能力
先体检,再开方:SoMBench给AI做“社会心智CT”
治病之前先诊断。知境团队做的第一件事,是建立一份足够精细的“体检表”
SoMBench
SoMBench把笼统的“懂不懂人”拆解成
3大一级维度、17个二级维度、71项细粒度任务

3481道经过十余名人类专家评审、严格保留的实例,构成了一张社会心智的“能力地图”。
更重要的是,SoMBench不仅会告诉你“考了多少分”,还告诉你“
错在了哪
20个顶级大模型在SoMBench上测试,最强模型正确率仅72.08%,无一达到90%天花板。社会心智的“无人区”,名副其实。
为什么社会心智这么难?

Zing的“训练密码”:让目标随能力一起进化
体检表有了,接下来怎么练?知境团队没有走“堆数据、堆算力”的老路,而是设计了一套
会“自我进化”的训练系统
密码一:FLARE数据飞轮——错题本比课本更重要
传统训练是“准备一批数据,训完拉倒”。Zing的做法是让评测像导航仪一样指出方向,而不是直接“透题”。当模型在诊断集上暴露短板时,FLARE会定位到具体认知维度,再针对性合成
全新的训练样本
哪里弱就练哪里,但每次练的都是新题

密码二:两阶段训练——先“通识”,再“专精”
第一阶段:
通用社会心智打底
奖励目标随模型能力变化而调整,不是一成不变的KPI
第二阶段:
专项能力强化
密码三:OPD在线蒸馏——边学新招,边不忘老本
强化学习最大的风险是“学新的,忘旧的”。Zing的解决方案是
OPD(On-Policy Distillation)
既鼓励探索,也守住边界
FLARE决定“学什么”,两阶段训练决定“什么时候学”,OPD决定“向谁学、不忘什么”。Zing构建的不是一个静态训练流程,而是一套
随模型能力状态持续自适应的进化系统
数据说话:这套“密码”管用吗?
训练方法再漂亮,最终要拿成绩说话。在5项国际权威社会心智评测基准上,Zing给出了硬核答案。
△知境·Zing在5项社会心智能力评测中的性能对比表Zing-27B,多模态模型综合均值超越GPT-5.5
Zing-27B五项综合均值
79.80
78.44
Zing-27B是首个在该基准上超越GPT-5.5的百亿参数级公开模型
Zing-32B,文本模型比肩DeepSeek-V4-Pro
Zing-32B综合均值
76.32
75.90
Zing-8B/14B,小模型大心智
8B模型在HiToM上达到
78.08
80.00
这些结果指向同一个结论:社会心智能力的提升,来自
训练方法的结构化设计
△知境·Zing在高阶信念推理评测中的性能对比表SoMBench作为知境自研的最难社会心智基准,当前模型仍有较大提升空间——这也正是下一步训练迭代的重点方向。
Actio:把“懂人心”从参数里“捞”出来
模型学会了,部署时怎么不掉链子?知境的答案是
Actio
△知境·Actio系统总览图真实交互场景中不缺信息,缺的是
恰当的信息
- :76项分层心理与社交技能(20宏观+56微观),按需路由
PRISM
- :显式记录“谁、何时、相信什么”,版本化更新
Starling Memory
- :跨任务可复用的推理经验,三级回退激活
SAGE
- :社会文化知识按需检索,验证信用分配
Gated RAG
一次典型推理经历四步:理解任务并识别心智需求 → 并行检索技能、知识与记忆 → 排序裁剪组合后引导推理 → 离线沉淀有效经验。Actio像经验丰富的社工,
知道什么时候该调用哪块能力
让AI在真实场景中不仅“会想”,还能“做对”,配得上用户的托付。
应用前景:从实验室走向真实场景
具身智能——给机器人装“心眼”
物理AI解决“身体”的问题,社会心智AI解决“心眼”的问题。知境的小参数模型(8B/14B)为端侧部署提供了可能,未来可探索
家庭看护、儿童陪伴、协作机器人
复杂决策推演——重大选择的“预演沙盘”
在事关重大的决策场景中,理解“各方会怎么想、怎么做”往往比算清账目更重要。知境的社会心智能力未来可应用于政策沟通、危机管理、组织变革等领域的推演,能够帮助决策者在行动前,提前看见不同选择可能引发的连锁反应。
人机共生——统一心智协议
当多个智能体(人类、机器人、AI Agent)需要长期协作时,最大的风险不是能力不足,而是“你以为我懂了,我以为你懂了”的认知错位。知境的社会心智建模框架,未来可为多智能体系统提供统一的心智状态表达与共享协议,让不同的智能体在同一个社会认知坐标系下协作。
一条新赛道,已经铺好了
知境团队真正想回答的问题是:
社会心智能不能像语言理解、代码生成一样,被定义为一种可以持续测量、训练和改进的工程能力?
- SoMBench建立了能力坐标系,把“懂不懂人”分解为可定位的认知缺口;
- Zing依据诊断结果组织自适应训练,让社会推理从提示词诱导的临时行为,转化为模型参数中的稳定能力;
- Actio则通过技能、心智状态、经验和社会知识的动态组织,为部署提供可选择、可检查的支持。
三者共同指向一条技术路线:
社会智能不再只是模型表现出来的一种模糊“情商”,而开始成为具有评测工具、训练方法和运行时接口的工程对象。
当然,这条路才刚刚开始。训练收益能否跨任务、跨文化迁移,Actio能否在长期真实交互中保持稳定与合宜,仍需要更广泛的验证。但至少,“懂人心”这件事,终于从玄学走向了系统工程。
符号空间拼智商,物理空间拼行动力,心智空间拼的是“读空气”的能力,这是AI赢得人类信任的关键一跃。语言智能之后,社会智能正在成为通用人工智能的下一个核心赛道。知境为这条赛道,提供了从评测到训练到部署的完整工程基础。