从生成到执行:京东WAIC揭秘物理AI落地全链路

0 阅读

跨越数字与实体的鸿沟:AI落地的新范式

当人工智能行业的注意力仍聚焦于大语言模型在文本生成上的参数竞赛时,一场更为深刻的变革正在物理世界中悄然发生。2026年7月,在上海举办的世界人工智能大会(WAIC)上,京东通过系统性的技术展示,揭示了一条不同于主流科技巨头的演进路径:不再单纯追求虚拟世界的内容生产力,而是致力于打通AI接入物理世界的“最后一米”。

photoLink

这一战略转向的核心,在于解决长期困扰行业的“知行分离”难题。过去,AI擅长创造数字内容,却难以在复杂的现实环境中执行具体任务。京东此次亮出的全链路布局,标志着AI从“观察者”向“行动者”的身份转换。这不仅是对技术边界的拓展,更是对产业应用逻辑的重构。通过整合底层模型、海量真实数据以及丰富的线下场景,京东正在尝试构建一个可感知、可决策、可执行的智能物理世界运营中心。

photoLink

模型矩阵重构:从感知理解到实时操控

photoLink

在WAIC展区,京东首次完整展示了其JoyAI模型矩阵,这是支撑物理AI落地的核心技术底座。与以往单点突破不同,此次展示强调了模型在语音、图像、视频及实时交互领域的全面覆盖,特别是针对“动手办事”能力的针对性补全。

其中最引人瞩目的两大实时视频编辑模型,揭示了AI在处理动态物理信息时的新突破。JoyAI-Video-Edit模型支持流式处理,能够在预览的同时进行实时修改,无需漫长的渲染等待。这一能力对于机器人仿真训练、环境数据处理至关重要,因为它模拟了人类在观察动态场景时的即时反馈机制。

京东亮相WAIC:全景落地物理AI,亮出动手办事真功夫

与此同时,JoyAI-Talker实时语音交互模型的发布,解决了人机交互中的情感与逻辑断层。该模型不仅具备低延迟对话和工具调用能力,更引入了情绪识别和长期记忆机制。这意味着AI不再是机械执行指令的工具,而是能够理解语境、记忆历史交互并做出高情商回应的智能体。

截至2026年上半年,京东已建立起包含7个基础模型的完整体系,涵盖空间图像编辑、多模态交互及实时交互等维度。这些模型并非孤立存在,而是以JoyAI基座大模型为核心,形成了一个能够理解三维空间、具备物理操作规划的具身智能系统。

三层演进逻辑:让AI“附身”并“具身”

京东集团副总裁段楠提出的三层演进逻辑,清晰地勾勒了AI从云端走向物理世界的路径。第一层是基于互联网数据构建的基础模型,负责语言、代码及多模态的理解与生成,这是AI的“大脑”。

第二层是“附身智能”,即将AI能力嵌入电脑、手机、可穿戴设备及家电中。这一阶段的关键在于实时多模态交互,让设备能够像人的感官一样,实时捕捉周围环境信息并做出响应。例如,京东物流的“超脑”不仅处理数字订单,更通过统一调度决策仓库布局和库存,实现了对物理世界的实时干预。

第三层则是“具身智能”,将模型扩展至机器人等实体硬件。这是最具挑战性的环节,要求AI具备空间理解、物理操作和自主规划能力。在医疗场景下,京东健康依托“京医千询”升级的AI医生“大为”,以及在工业供应链中推出的“AI智采管家”,都是这一逻辑在具体垂直领域的成功实践。这些应用表明,AI的价值不再局限于信息处理,而是直接转化为生产力的提升。

数据破局:构建千万小时人类经验库

具身智能发展的最大瓶颈,并非算法本身,而是缺乏高质量、大规模的真实世界数据。行业普遍面临“数据易采集,优质数据稀缺”的痛点,不同机器人本体之间的数据互操作性极差,导致模型泛化能力受限。

针对这一痛点,京东在WAIC上宣布开源行业规模最大的第一视角数据集EgoLive。这一举措旨在将人类在真实生活和作业现场的经验,转化为具身模型可学习的“燃料”。京东自主研发了量产级第一视角采集设备,依托其在零售、物流、工业全产业链的场景资源,计划在两年内完成1000万小时的数据采集目标。

这套数据基础设施不仅关注数据量,更强调数据的全链路闭环。从采集、处理、标注到训练、验证,京东建立了一套标准化的数据处理流程。在展区展示的“机器人学习链路”中,观众佩戴JoyEgoCam完成货架作业,原始视频经过结构化处理后,成为机器人的训练教材。系统据此构建数字孪生空间,让机器人在虚拟环境中反复训练,最终在实体货架前完成高精度的理货与补货任务。

实测数据显示,接入京东高质量数据集后,具身模型的任务泛化性和操作准确率实现了两位数级别的提升。这种基于真实场景数据的训练方式,有效避免了模型在实验室环境中的“自嗨”现象,确保了技术向产业落地的有效性。

场景落地:打造去中心化的AI Home

技术的最终归宿是服务人类。在WAIC上,京东首次公开亮相的JoyInside全场景AI Home,展示了AI如何融入日常生活。与传统全屋智能“人主动指令、设备被动执行”的模式不同,AI Home构建了一个拥有独立角色的家庭成员集群。

在这个空间中,每个智能硬件都植入了独立的AI大脑,成为具有不同属性的“AI角色”。它们不再依赖统一中控的调度,而是基于实时感知的用户状态,自主判断需求并协同工作。例如,AI投影台灯能自动识别孩子的学习状态并提供扫题答疑;当用户表示口渴时,智能茶吧机会根据预设习惯匹配水温出水。这种去中心化的交互逻辑,极大地提升了用户体验的自然度和流畅度。

目前,JoyInside已与近200家品牌达成合作,预计2026年全年接入硬件设备将突破1000万台。数据反馈显示,学习教育类产品的周均交互次数超过百次,用户粘性显著高于传统智能硬件。未来,京东还将拓展至智能睡眠、卫浴健康等更多场景,推动分布式智能体验覆盖全家庭生活。

产业启示:从“能生成”到“能做成”

京东在WAIC上的展示,为人工智能行业的发展提供了重要的产业启示。当行业还在纠结于AI能生成多少文本、图片时,真正的价值在于AI能在物理世界中完成多少实际任务。

这一转型需要三个关键要素的协同:首先是高质量、合规的数据生态。京东通过开源部分数据和共建联盟,降低了行业获取高质量具身数据的门槛,同时严格遵循数据合规要求,建立了隐私保护体系。其次是具备物理操作能力的模型体系。JoyAI矩阵的完善,使得AI能够理解复杂的物理规则和空间关系。最后是丰富的线下场景支撑。京东依托其强大的供应链和零售网络,为技术提供了天然的试验场和落地场景。

这种“数据+模型+场景”的闭环模式,正在重塑物理世界的运营效率。从物流仓储的自动化调度,到医疗健康的智能化服务,再到家庭生活的主动式关怀,AI正在从屏幕背后走向前台,成为推动产业降本增效、提升生活品质的核心力量。

随着2026年下半年旗舰级模型的推出,京东在物理世界交互的能力将持续升级。这不仅是一家企业的技术演进,更是整个AI行业从虚拟走向实体、从感知走向行动的缩影。在未来的竞争中,谁能更高效地让AI“动手办事”,谁就能在物理智能的新赛道上占据先机。