AI情商工程化:中科院知境如何破解社会心智缺失难题
在人工智能飞速发展的今天,我们见证了一个又一个技术奇迹。GPT-5.5能够撰写逻辑严密的专业论文,DeepSeek-V4-Pro可以生成复杂的系统级代码,具身机器人也能在物理世界中完成精细的操作任务。然而,当我们将这些看似无所不能的AI放入一个真实的家庭聚餐场景,或者一场充满微妙情绪波动的团队会议中时,它们往往显得格格不入。这种生硬与不合时宜,并非源于知识储备的匮乏,而是因为它们尚未真正具备“读懂人心”的能力。这正是当前AI面临的最大尴尬短板——社会心智的长期缺失。
从单纯的任务执行者走向复杂的社会协作者,是AI进化的必经之路,而补上“社会心智”这一课,则是跨越这道鸿沟的关键。2026年7月,中国科学院计算技术研究所智能算法安全全国重点实验室的“知境”团队,正式发布了知境社会心智大模型技术体系。这不仅仅是一次模型参数的更新,更是一场关于如何将抽象的“情商”转化为独立、可测量、可训练的工程技术能力的深刻变革。
要解决一个问题,首先必须能够精准地定义和测量它。长期以来,“懂不懂人”是一个模糊的主观判断,缺乏统一的量化标准。知境团队推出的SoMBench,正是为了解决这一痛点而设计的“社会心智CT扫描仪”。这套评测基准并没有停留在表面,而是将笼统的社会认知能力拆解为3大一级维度、17个二级维度以及71项细粒度任务。从基础的信念推断到高阶的情绪理解,从隐性的社会规范到动态的关系建模,SoMBench构建了一张覆盖完整光谱的能力地图。
更为重要的是,SoMBench不仅仅提供一个分数,它能精准定位模型的错误模式。通过单选、多选、判断及开放题的多题型交叉验证,结合选项扰动和捷径检测等手段,研究人员可以清晰地看到模型是在哪一步推理链断裂,还是仅仅依靠表面模式蒙混过关。在对20个顶级大模型的测试中,最强模型的正确率仅为72.08%,无一达到90%的天花板。这一数据残酷地揭示了社会心智领域的“无人区”状态:同一场景下,AI需要同时处理角色关系、隐含意图、情绪变化及未说出口的潜台词,这种多层并行的复杂推理远超普通大模型的处理极限。
面对如此复杂的挑战,传统的“堆数据、堆算力”策略已难以为继。知境团队设计的Zing训练系统,核心在于其“自我进化”的能力。其中,FLARE数据飞轮机制彻底改变了传统训练范式。它不再依赖静态的数据集,而是像导航仪一样,根据模型在诊断集上暴露的具体短板,针对性地合成全新的训练样本。这些样本在语义和场景上与原题不同,但瞄准的是同一种认知缺陷。这种“哪里弱练哪里,且每次都是新题”的策略,确保了模型是在真正学习推理逻辑,而非死记硬背答案。
在训练策略上,Zing采用了两阶段进阶法。第一阶段通过多教师蒸馏构建高质量的冷启动数据,并利用Mixed-Reward GRPO强化学习框架,根据任务类型和推理质量动态调整奖励目标。这意味着奖励机制不是一成不变的KPI,而是随着模型能力的提升而进化的引导信号。第二阶段则聚焦于专项能力的强化,针对情绪理解、意图推断等薄弱环节进行监督微调和困难样本校准,确保在增强专项能力的同时,不丢失通用的推理基础。
此外,强化学习中常见的“灾难性遗忘”问题,在Zing系统中通过OPD(On-Policy Distillation)在线蒸馏技术得到了有效缓解。OPD在在线轨迹上引入教师模型的token级分布约束,让学生在探索更优路径的同时,不偏离已验证的有效推理模式。GRPO负责向前探索,OPD负责守住边界,两者协同作用,构建了一个随模型能力状态持续自适应的进化系统。
技术的有效性最终需要通过数据来验证。在五项国际权威社会心智评测基准上,Zing系列模型展现了惊人的竞争力。Zing-27B多模态模型的综合均值达到79.80,超越了GPT-5.5的78.44。特别是在HiToM基准上,Zing-27B成为首个在该项高阶递归信念追踪任务上超越GPT-5.5的百亿参数级公开模型。HiToM评测的是“我知道你知道我知道”这类高阶心理理论能力,难度随阶数指数级增长,Zing在此处的优势证明了其在深层社会推理上的结构化突破。
而在文本模型方面,Zing-32B的综合均值略超DeepSeek-V4-Pro,尤其在EmoBench情感理解基准上领先超过6个百分点。更令人瞩目的是小参数模型的表现,Zing-8B和14B模型在高阶信念推理上的提升幅度甚至超过了参数量为其数十倍的更大模型。这一现象有力地证明,社会心智能力的提升主要得益于训练方法的结构化设计,而非单纯的参数规模扩张。
然而,模型在实验室中的优异表现并不等于在真实场景中的可靠交付。为了解决部署时的稳定性问题,知境团队提出了Actio显式心智状态部署架构。Actio的核心理念是“按需调用”,它通过Harness统一编排核心,根据任务的心智变量和推理需求,选择性激活PRISM心理技能库、Starling记忆模块、SAGE推理经验库以及Gated RAG社会知识库。这种机制避免了将所有信息盲目塞入上下文窗口,而是像经验丰富的社工一样,知道在什么时刻调用哪块能力,从而确保AI在真实交互中不仅“会想”,更能“做对”。
这一技术体系的落地,为多个领域带来了深远的影响。在具身智能领域,小参数模型的端侧部署能力使得家庭看护机器人和协作机器人能够实时进行社会推理,懂得何时该安静、如何表达关怀,从而真正融入人类生活。在复杂决策推演中,社会心智能力可以帮助政策制定者和企业管理者在行动前预演各方的心理反应和连锁效应,降低决策风险。而在未来的人机共生环境中,统一的心智协议将消除人类与多个AI智能体之间的认知错位,实现更高效、更信任的协作。
知境团队的探索回答了一个根本性问题:社会智能能否像语言理解一样,成为一种可工程化的能力?通过SoMBench建立坐标系,Zing实现自适应训练,Actio提供运行时支持,三者共同构建了一条清晰的技术路线。社会智能不再是一种模糊的“情商”表现,而是成为了具有明确评测工具、训练方法和接口标准的工程对象。
当然,这条道路才刚刚起步。训练收益在不同文化和任务间的迁移能力,以及Actio在长期真实交互中的稳定性,仍需更广泛的验证。但可以肯定的是,“懂人心”这件事已经从玄学走向了系统工程。在符号空间拼智商、物理空间拼行动力之后,心智空间拼的是“读空气”的能力。这是AI赢得人类信任的关键一跃,也是通用人工智能下一个核心赛道的起点。知境为这一赛道铺设了坚实的工程基础,预示着一个人机和谐共生的新时代正在悄然到来。