ComBodied Agents:Agentic AI 如何从‘替人做事’转向‘助人成长’?
在人工智能日益深度介入日常生活的今天,一个根本性问题浮出水面:当智能体(Agent)越来越擅长替人完成任务,这种“做得更多”是否真的意味着“对人更好”?答案并非理所当然。近期,来自Mila、蒙特利尔大学、新加坡科技研究局(A*STAR)、牛津大学、剑桥大学、清华大学等16家顶尖科研机构的22位学者联合发表论文《ComBodied Agents: a New Paradigm of Human-Centric Agentic AI》,提出了一种全新的Agentic AI范式——伴身智能体(ComBodied Agents),试图从根本上重新定义AI与人的关系。

这一范式的提出,源于对现实场景中AI局限性的深刻洞察。例如,一位老人漏服药物,传统数字智能体可能仅发送提醒,具身智能体或许能将药片递到面前。但两者都未能触及问题的核心:老人是遗忘、误解医嘱、遭遇副作用,还是经过理性思考后主动拒绝?面对这些可能性,AI下一步应如何行动——是继续提醒、解释说明、联系家属、转交医生,还是尊重其自主选择、暂时不干预?现有系统往往缺乏对人类复杂状态的理解与响应机制,暴露出以任务为中心的设计逻辑在健康、教育、陪伴等高敏感场景中的结构性缺陷。

ComBodied Agents 的核心理念在于将优化目标从“外部任务状态”转向“人的长期状态轨迹”与“主体性保留”。这里的“伴身”(Combodied)融合了“伴侣”(Companion)与“身体”(Body),但其内涵远超一个更会聊天的虚拟助手。它要求AI持续感知、建模并预测用户在身体、行为、认知、情绪、社会关系及生活情境等多个维度的动态变化,并在此基础上提供适时、适度、可授权的支持。关键不在于使用了多少传感器或多模态数据,而在于系统最终服务于谁的利益——是任务的完成效率,还是人的长期福祉与自主能力。

为实现这一转向,论文提出了一个闭环技术框架,包含四大核心能力:人类状态感知(Human-State Perception)、纵向记忆(Longitudinal Memory)、个人世界模型(Personal World Model, PWM)以及干预规划与实施(Intervention Planning and Delivery)。这一框架强调从原始观察到干预决策之间的严谨推理链:观察 → 事件重建 → 状态推断 → 轨迹预测 → 获准干预。例如,心率升高只是一个原始信号;结合运动数据和恢复时间,可重建“运动后心率异常恢复缓慢”的事件;再对比个体基线,才可能推断出疲劳状态;PWM则进一步模拟不同干预策略(如建议休息、调整强度或继续观察)对未来健康、目标进展及主体性的影响。重要的是,推断出风险并不等于获得行动许可——干预必须建立在明确授权、安全边界和不确定性评估之上。

纵向记忆是支撑长期理解的关键。不同于仅存储对话历史或偏好的传统记忆系统,ComBodied Agent的记忆包含状态轨迹、目标承诺、人际关系、历次干预及其用户反馈(即“干预-响应记忆”)。尤其关键的是,系统必须记录用户对推断的纠正、删除请求或“不要记住”的指令。没有这层反馈闭环,长期记忆反而可能固化错误假设,导致支持策略偏离真实需求。例如,若某次提醒被用户明确拒绝,系统应将其视为负向信号,而非简单归因于“用户未看到通知”。

个人世界模型(PWM)是整个框架的智能中枢。它并非追求构建一个高保真、全维度的“数字孪生”,而是聚焦于当前支持目标所需的有限状态空间,进行目的有界(purpose-bounded)的建模。PWM的核心功能是比较多种未来轨迹:在“不干预”“先澄清”“立即提醒”“延迟建议”等选项下,用户的依从性、技能发展、情绪状态、关系质量及主体性将如何演化?模型输出的是带有校准不确定性的概率分布,而非确定性预言。更重要的是,PWM只负责预测,不掌握决策权。最终行动必须在一个受约束的可采纳动作集合中选择,该集合由用户同意范围、安全阈值、可逆性及人工升级机制共同界定。这意味着,即使某项干预预测收益很高,若其越界、不可逆或风险不明,系统也应保持克制。

随着AI持续接触健康、情绪、位置等高度敏感信息,数据主权与决策权归属成为系统设计的核心议题。论文据此提出三阶段部署演进路径:从云端中心(推理与记忆均在云端),到边云协同(本地维护安全边界与轻量记忆),最终迈向边缘原生(Edge-Native)——即纵向记忆、PWM、偏好与安全策略的权威版本完全保存在用户设备侧。在这一架构下,用户可随时检查、纠正、导出、重置甚至迁移自己的模型状态;云端提供的知识或计算结果需经本地治理层重新解释后方可生效。这种“本地优先”并非排斥云端,而是确保关于“我是谁”的最终解释权始终掌握在用户手中,防止模型漂移或短期情绪波动永久扭曲系统行为。

相应地,ComBodied Agents的评测体系也必须超越传统指标。单次任务成功率、响应速度或物理安全性仅是底线要求。真正的评估应覆盖五大维度:系统可靠性、模型质量、干预适当性、人类长期结果及主体性保护。其中,主体性保护被细化为八项可操作标准:用户是否保有对目标与行动的实质控制?能否质疑或删除系统推断?是否理解选项依据与风险?长期使用后,其自我效能与判断力是增强还是削弱?是否存在认知或情感上的过度依赖?行动是否可撤销与追溯?系统是否尊重“不要推断”等边界?以及,它是在强化真实人际关系,还是取而代之?值得注意的是,在此框架下,“更慢”有时反而是更优选择——多一次确认、提供替代方案或主动移交人类专家,可能比无摩擦自动化更能体现对主体性的尊重。
论文还前瞻性地指出,ComBodied Agents面临多重挑战。首先,个体状态建模需处理稀疏、有偏且非稳态的数据,如何区分相关性与因果效应仍是难题。其次,同一底座模型在不同关系场景(如自我管理、家庭照护、职场协作)中需动态调整角色(工具、教练、倡导者等),其记忆范围、主动性与权限必须清晰可辨。更严峻的是伦理风险:精准识别用户脆弱状态(如孤独、焦虑)若被商业目标(如提升停留时长或付费转化)所驱动,极易滑向操纵;过度代劳可能侵蚀用户技能与信心;而情感认同若缺乏边界,则可能削弱其应对真实人际冲突的能力。因此,系统目标必须严格锚定于用户福祉,而非参与度或自动化程度。
目前,这一理论框架正通过Zilo Ring智能戒指等硬件产品走向实践。作为论文第一作者丁强刚创立的弦指科技的核心项目,Zilo Ring尝试在用户授权下,融合生理节律、行为模式与情境信息,构建轻量级的个人世界模型,探索边缘原生架构下的长期陪伴可能。这标志着ComBodied Agents不仅是学术构想,更是一套可落地的技术语言与设计边界。
归根结底,真正以人为中心的Agentic AI,不应以“人退出了多少环节”来证明自身强大。它的价值,应体现在长期互动之后——用户依然能够理解系统逻辑、自主做出选择、纠正错误、恢复控制、发展能力,并维系真实的人际联结,按照自己不断演进的价值观生活。更好的智能体,不是让人变得可有可无,而是让人更有能力成为自己。