中科院发布知境社会心智技术体系,AI 补上“读空气”短板
中科院提出社会心智技术体系,让 AI 从“任务执行”走向“社会协作”,解决读懂人心的工程化难题。
大模型能写论文写代码,但在家庭聚餐、团队会议中表现生硬,因为缺乏社会心智——理解角色关系、隐含意图、情绪变化的能力。中科院知境团队提出 SoMBench 评测、FLARE 进化训练、Actio 运行时框架,让 AI 能持续测量和提升这项能力。
正文摘录
GPT-5.5 能写专业论文,DeepSeek-V4-Pro 能生成复杂代码,具身机器人能完成基础物理操作,语言智能和工具智能都已经跑出了自己的赛道。 但把同样的 AI 放进一次家庭聚餐、一场团队会议、一次医患对话,它往往表现得生硬、不合时宜。 不是知识不够,是“读懂人心”的能力还没跟上。这正是社会心智长期缺失带来的真实困境,也是从“任务执行”走向“社会协作”时必须补上的一课。 7 月 24 日,中国科学院计算技术研究所智能算法安全全国重点实验室“知境”团队,正式发布 知境社会心智大模型技术体系。 这不是又一个大模型刷榜的故事,而是一份关于 社会心智如何成为独立工程能力 的完整答卷。 知境要做的,正是为现有大模型补上这块短板——给模型增加“情商”与可信任感,让 AI 在关键场合靠得住、信得过。 治病之前先诊断。知境团队做的第一件事,是建立一份足够精细的“体检表”—— SoMBench。 SoMBench 把笼统的“懂不懂人”拆解成 3 大一级维度、17 个二级维度、71 项细粒度任务,覆盖从基础信念推断到高阶情绪理解、从社会规范到关系建模的完整光谱。 3481 道经过十余名人类专家评审、严格保留的实例,构成了一张社会心智的“能力地图”。 更重要的是,SoMBench 不仅会告诉你“考了多少分”,还告诉你“ 错在了哪”。 通过单选、多选、判断、开放题的多题型交叉验证,以及选项扰动、捷径检测、受控改写等手段,SoMBench 能精准定位模型的错误模式,例如:是推理链断了?还是靠表面模式蒙对了?这为后续的训练指明了靶子。 20 个顶级大模型在 SoMBench 上测试,最强模型正确率仅 72.08%,无一达到 90% 天花板,社会心智的“无人区”,名副其实。