AI社交短板如何破局?中科院Zing大模型重构社会心智工程化路径
从任务执行到社会协作:AI缺少的最后一块拼图
当前,人工智能领域正经历着前所未有的分化与深化。在语言智能和工具智能赛道上,以GPT-5.5、DeepSeek-V4-Pro为代表的大模型已经展现出了惊人的专业深度,它们能够撰写复杂的学术论文,生成高维度的代码,甚至驱动具身机器人完成精密的物理操作。然而,当我们将这些“全能选手”置入一个家庭聚餐、一场充满张力的团队会议,或是一次需要高度共情的医患对话中时,其表现往往显得生硬、刻板,甚至不合时宜。
这种错位并非源于知识储备的匮乏,而是源于对“人心”理解能力的滞后。社会心智(Social Mind)的长期缺失,成为了AI从单纯的“任务执行者”向“社会协作者”转型的最大瓶颈。2026年7月24日,中国科学院计算技术研究所智能算法安全全国重点实验室的“知境”团队,正式发布了知境社会心智大模型技术体系。这一举措标志着社会心智不再仅仅是模型在特定提示下偶然展现的模糊特质,而是开始成为一项可测量、可训练、可部署的独立工程能力。
精准诊断:SoMBench建立社会心智的“能力地图”
任何工程化的改进都始于精准的评估。知境团队首先构建了SoMBench,这是一套专为社会心智设计的精细化评测基准。与传统评测仅关注最终答案正确率不同,SoMBench将抽象的“懂不懂人”拆解为3个一级维度、17个二级维度以及71项细粒度任务。这构成了一个覆盖从基础信念推断、高阶情绪理解、社会规范遵循到关系建模的完整光谱。
SoMBench的核心价值在于其诊断精度。它不仅仅给出分数,更通过单选、多选、判断及开放题的多题型交叉验证,结合选项扰动、捷径检测等对抗性手段,精准定位模型的错误模式。例如,模型是因为推理链条断裂而失误,还是仅仅依靠表面模式的巧合蒙对了答案?这种颗粒度极细的诊断,为后续的训练指明了靶点。
测试数据显示,包括20个顶级大模型在内的现有主流模型在SoMBench上的最高正确率仅为72.08%,无一突破90%的天花板。这一结果揭示了社会心智的“无人区”现状:在同一社交场景中,AI需要同时处理角色关系、隐含意图、情绪动态、社会规范以及未言明的潜台词等多层复杂推理,这对普通大模型的认知架构提出了极高要求。
训练革新:Zing模型的自适应进化系统
面对SoMBench揭示的差距,知境团队并未遵循传统的“堆数据、堆算力”路线,而是设计了Zing模型,其核心在于一套具备自我进化能力的训练系统。该系统通过FLARE数据飞轮、两阶段训练框架以及OPD在线蒸馏三大密码,实现了社会心智能力的结构性提升。
FLARE(Feedback-Driven Large-scale Adaptive Reasoning Enhancement)数据飞轮的设计理念是“错题本比课本更重要”。当模型在诊断集上暴露短板时,FLARE不会简单地重复类似题目,而是定位具体的认知维度,针对性合成语义、场景、推理路径均不同但瞄准同种缺陷的新样本。这种机制确保模型始终在“最近发展区”进行训练,既不过于简单导致无效学习,也不过于困难导致无法收敛。
训练过程分为两个阶段。第一阶段旨在构建通用社会心智基础。模型利用多教师蒸馏构建冷启动数据,通过答案门控和推理深度过滤保留高质量推理轨迹。随后,采用Mixed-Reward GRPO(Group Relative Policy Optimization)强化学习框架,动态组合过程奖励、可验证奖励和拒绝采样。这里的奖励目标并非固定不变,而是随模型能力的提升进行动态调整。
第二阶段则聚焦专项能力强化。针对情绪理解、意图推断、社会规范等薄弱环节,通过监督微调注入领域知识,并利用困难样本进行持续校准。为防止强化学习常见的“灾难性遗忘”问题,团队引入了OPD(On-Policy Distillation)机制。OPD在在线轨迹上引入教师模型的token级分布约束,如同给模型装上了“导航边界”,鼓励其在探索更优推理路径的同时,不偏离已验证的有效推理模式。GRPO负责“往前冲”,OPD负责“别跑偏”,两者协同作用,确保了模型在增强专项能力的同时,稳固通用推理根基。
部署优化:Actio架构实现心智状态的显式管理
模型训练完成仅是第一步,如何在真实交互场景中保持稳定的表现是另一大挑战。知境团队提出的Actio架构,旨在将“懂人心”从隐式的参数空间中“捞”出来,实现显式的心智状态管理。
真实交互场景中的痛点在于信息过载而非信息匮乏,缺的是“恰当的信息”。Actio以Harness为统一编排核心,根据任务的心智变量和推理需求,选择性激活四类支撑模块:
- PRISM:包含76项分层心理与社交技能(20项宏观+56项微观),根据任务需求进行路由。
- Starling Memory:显式记录“谁、何时、相信什么”,并支持版本化更新,确保对人物关系和信念状态的精准追踪。
- SAGE:提供跨任务可复用的推理经验,具备三级回退激活机制,以应对复杂多变的情境。
- Gated RAG:社会文化知识按需检索,并通过信用分配机制验证信息的可靠性。
一次典型的推理经历包括理解任务识别心智需求、并行检索技能知识与记忆、排序裁剪组合引导推理、以及离线沉淀有效经验四个步骤。这种机制类似于经验丰富的社工,知道在何时调用何种能力,而非将所有信息堆砌在上下文中。其核心目标是让AI在真实场景中不仅“会想”,更能“做对”,从而赢得用户的信任与托付。
性能实证:小模型的大心智突破
Zing系列模型在多项国际权威社会心智评测基准上取得了突破性进展。数据显示,Zing-27B在五项综合均值达到79.80,超越了GPT-5.5的78.44。特别是在HiToM(高阶递归信念追踪)和EmoBench(情绪理解)上,优势尤为显著。在HiToM基准上,Zing-27B成为首个超越GPT-5.5的百亿参数级公开模型,证明了其在处理“我知道你知道我知道”这类高阶社交推理上的强大能力。
文本模型Zing-32B综合均值为76.32,略超DeepSeek-V4-Pro的75.90。其在EmoBench上的78.13得分,比DeepSeek-V4-Pro高出6.25个百分点,彰显了专项社会心智训练在情感理解维度上的结构化优势。
更为引人注目的是小模型的表现。Zing-8B和Zing-14B在HiToM上的得分分别达到78.08和80.00,超越同尺寸基座模型近12和8个百分点,甚至在某些高阶信念推理任务上超过了参数量数十倍的更大模型。这一结果有力地证明了社会心智能力的提升主要来源于训练方法的结构化设计,而非简单的参数堆砌。
应用前景:从实验室走向泛化场景
知境团队的社会心智技术体系,为多个前沿领域的应用提供了新的可能。
在具身智能领域,物理AI解决了“身体”的问题,而社会心智AI则解决“心眼”的问题。知境的小参数模型(8B/14B)为端侧部署提供了可行性,未来有望应用于家庭看护、儿童陪伴、协作机器人等需要实时社会推理的场景。让机器不仅会动,更懂得察言观色,知道谁需要帮助、何时该保持安静、如何表达才恰当。
在复杂决策推演方面,社会心智能力可用于政策沟通、危机管理、组织变革等领域的沙盘推演。理解“各方会怎么想、怎么做”往往比单纯的账目计算更重要,这种能力能帮助决策者提前预见不同选择可能引发的连锁反应。
在人机共生与多智能体系统方面,当多个智能体(人类、机器人、AI Agent)需要长期协作时,最大的风险是认知错位——“你以为我懂了,我以为你懂了”。知境的社会心智建模框架,未来可为多智能体系统提供统一的心智状态表达与共享协议,使不同的智能体能在同一个社会认知坐标系下高效协作。
结语:社会智能的工程化新时代
知境团队所回答的核心问题是:社会心智能否像语言理解或代码生成一样,被定义为一种持续测量、训练和改进的工程能力?
答案已然清晰。SoMBench建立了能力坐标系,将模糊的社会认知转化为可定位的认知缺口;Zing依据诊断结果组织自适应训练,将临时性的提示词诱导转化为模型参数中的稳定能力;Actio则通过动态组织技能、心智状态与知识,为部署提供了可检查、可干预的支持。
这条技术路线标志着社会智能从玄学走向系统工程。符号空间拼智商,物理空间拼行动力,而心智空间拼的是“读空气”的能力。这是AI赢得人类深层信任的关键一跃。随着训练收益跨任务、跨文化迁移能力的验证,以及Actio在长期真实交互中稳定性的进一步检验,社会智能正逐步成为通用人工智能不可或缺的下一个核心赛道。知境团队所提供的从评测到训练再到部署的完整工程基础,无疑为这条新赛道铺设了坚实的基石。