环境式病历+智能体:医疗AI如何从答题转向真实临床行动
医疗AI的新战场:不是答题,是行动
过去几年,医疗AI的主流评估方式很像一场闭卷考试:给模型一段完整的病例描述,让它从几个选项中选出正确诊断。MedQA、USMLE这些基准一度成为衡量模型医学能力的标尺。但医生在真实世界里并不是这样工作的。
他们面对的是信息不全的患者,需要一边问诊、一边查体、一边安排检查,逐步拼凑出诊断图景。这个过程充满不确定性、时间压力和资源约束。于是,一个更贴近现实的问题浮现出来:AI能不能在动态、不完整的临床环境中,像医生一样思考并采取一系列连贯行动?
答案指向一个新方向:“环境式病历 + 智能体”(Ambient EHR + Agent)。这不是两个技术的简单叠加,而是一次范式的根本转移——从静态知识检索转向动态环境交互,从单轮问答转向长程序列决策。
什么是“环境式”和“智能体”?
环境式:让AI融入工作流,而不是打断它
“环境式”(Ambient)的核心在于无感嵌入。最典型的例子是“环境式AI病历助手”(Ambient Scribe)。它在医生和患者对话时,默默在后台录音、转录,并自动生成结构化的病历草稿。医生只需花几分钟审核修改,而不是花十几分钟低头打字。
这种模式的目标很明确:把医生的注意力从电脑屏幕拉回患者身上。它不主动提问,也不干预诊疗,只是被动地记录和整理。正因为这种低侵入性,Ambient Scribe被认为是生成式AI在医疗领域第一个真正落地的大规模应用。
智能体:从应答工具到主动决策者
如果说环境式定义了AI的“存在方式”,那么智能体(Agent)则定义了它的“能力层级”。
在AI术语中,智能体是一个能感知环境、推理判断并执行动作的程序。在医疗场景下,这意味着它不再是一个你问它答的聊天机器人,而是一个能扮演“住院医师”角色的虚拟实体。它会主动向“患者”询问症状,调阅“实验室”的检查结果,甚至决定是否需要请“放射科”会诊。
这些动作不是孤立的,而是一个有逻辑、有时序的决策链。比如,先问主诉,再根据回答决定查体部位,然后根据查体结果开血常规或影像检查。这种序列化行为,正是医生临床思维的体现。
两者结合:构建新一代医疗AI范式
当环境式的工作模式遇上智能体的决策能力,就催生了一个全新的研究和应用框架:
- 输入不再是完整病例,而是零散、动态更新的信息流(如对话片段、逐步返回的检验报告)。
- 输出不再是单一答案,而是一系列结构化的动作指令(如“询问胸痛性质”、“开具心电图”)。
- 评估不再只看最终诊断对错,还要看决策过程是否合理、高效、安全。
这标志着医疗AI的重心,从“知道什么”转向了“怎么做”。
评估基准的进化:从选择题到模拟医院
为了支撑这种新范式,研究者们开发了一系列更复杂的评估环境。它们不再是简单的问答数据集,而是模拟了医院工作流的“数字沙盒”。
早期尝试:揭示静态与动态的巨大鸿沟
2024年,斯坦福和约翰霍普金斯大学推出的 AgentClinic 是一个里程碑。它首次构建了一个开源的、多模态的模拟临床环境。在这个环境里,AI必须通过与“患者”(由另一个语言模型扮演)对话来收集信息。
结果令人震惊:那些在MedQA上得分超过80%的顶尖模型,在AgentClinic中的诊断准确率骤降至不到10%。这清晰地表明,静态知识测试和动态决策能力之间,存在一道巨大的鸿沟。
同年,加州大学旧金山分校提出的 AI-SCI框架 则借鉴了医学生的OSCE(客观结构化临床考试)和自动驾驶的“碰撞测试”理念,呼吁建立基于蒙特卡洛模拟的临床安全测试环境,重点评估AI在极端或罕见情况下的鲁棒性。
中期发展:引入时间、协作与自进化
随着研究深入,评估环境开始加入更多现实维度。
清华大学AIR团队的 Agent Hospital 引入了“时间加速”机制,让智能体能在模拟环境中快速经历成百上千个病例,实现“自进化”。其MedAgent-Zero策略在MedQA上达到了93.06%的准确率,但更重要的是,它展示了在动态环境中学习和优化决策路径的能力。
MIT和Google合作的 MDAgents 则探索了多智能体协作。系统内部分工为“初级医生”、“专科顾问”、“药剂师”等角色,通过协商共同完成复杂病例的处理。在10个不同的基准测试中,它有7个取得了最佳成绩,证明了分工协作在复杂医疗任务中的价值。
港中文的 MedChain 聚焦于序列化临床决策本身。它构建了一个包含12,163个病例的数据集,覆盖了从初步评估、鉴别诊断、检查安排、治疗计划到随访建议的完整5阶段工作流,为评估AI的长程规划能力提供了基础。
当前前沿:CP-Env与ClinEnv
到了2025-2026年,评估基准走向成熟和标准化。
上海交大与港中文联合发布的 CP-Env(Clinical Pathway Environment)提出了一个三层评估框架:
- 动作级:评估每个具体动作(如开某项检查)的合理性。
- 路径级:评估整个临床决策路径的效率和逻辑性。
- 结果级:评估最终诊断和治疗方案的准确性。
它使用可控的模拟医院环境,可以精确复现和测试特定的临床场景。
而2026年由佐治亚理工学院和北京大学推出的 ClinEnv,则更进一步,直接基于真实的电子健康记录(EHR)轨迹构建模拟环境。它不仅模拟了门诊,还包含了纵向的住院过程,并同时提供过程指标(如决策步骤数、成本)和结果指标(如诊断准确率)。在业界公认的7个关键维度(真实EHR、多阶段、主动信息获取、结构化动作、确定性评分、过程指标、结果指标)上,ClinEnv是目前唯一全部达标的基准。
新范式下的核心挑战
尽管前景广阔,这条新路径也面临严峻挑战。
首先是评估的可靠性问题。在动态环境中,最终结果受初始条件、随机事件和动作序列的共同影响。如何设计一个公平、可复现、且能反映真实临床价值的评分标准,仍是难题。许多早期基准依赖另一个大模型作为“裁判”来评判动作好坏,这本身就可能引入新的偏见和不稳定性。
其次是安全性与伦理风险。一个能主动开检查、下医嘱的AI,一旦出错,后果远比答错一道选择题严重。如何在模拟环境中充分测试其在边缘案例、对抗性输入下的表现,确保其“行动”的底线安全,是临床落地的前提。
最后是与真实工作流的整合。Ambient Scribe之所以能快速落地,是因为它只做“记录”这一件事,且不干扰医生。而一个主动决策的智能体,如何与医生协同?是作为第二意见,还是作为实习生?它的建议以何种形式呈现才不会增加认知负担?这些问题的答案,将决定这项技术最终能否走出实验室。
结语
“环境式病历+智能体”的范式转移,本质上是医疗AI从“纸上谈兵”走向“实战演练”的必然过程。它迫使研究者直面临床实践的复杂性和动态性,不再满足于模型在理想化数据上的高分。
CP-Env、ClinEnv等新一代基准的出现,为这场实战演练提供了标准化的“训练场”和“裁判规则”。虽然挑战重重,但这条路径无疑更接近医疗AI的终极目标:不是取代医生,而是成为一个能在真实、嘈杂、信息不全的临床环境中,可靠地辅助医生做出更好决策的智能伙伴。