京东WAIC亮相:从参数内卷到物理落地,具身智能的破局之道
物理AI的拐点:跳出参数内卷,回归产业本质
在人工智能技术高速迭代的当下,行业普遍陷入了一种“参数焦虑”。各大厂商竞相堆砌模型规模,追求在特定基准测试中的高分,却往往忽略了技术最终需要服务于真实的物理世界。这种“数字自嗨”的现象,导致了大量优质算力与数据资源被消耗在无法落地的虚拟场景中,而现实生产与生活领域的智能化改造进程却因缺乏高质量数据和有效交互手段而缓慢推进。
2026年7月,在上海举办的世界人工智能大会(WAIC)上,京东集团提交了一份不同的答卷。不同于常规的流量入口争夺或纯软件生态展示,京东首次系统性地向公众和行业展示了其面向物理世界的全链路技术布局。这一布局的核心不在于模型参数的绝对规模,而在于如何打通从“能说会画”到“动手办事”的技术断点,以及如何将AI能力真正嵌入到复杂的物理交互环境中。

京东集团副总裁段楠在交流中清晰地阐述了这一技术演进的逻辑:从基础模型的底层构建,到附身智能的实时交互,再到具身智能的空间操作,这是一条层层递进、最终指向物理世界深度融合的技术路径。这种路径选择,体现了京东作为拥有深厚供应链积淀的企业,在AI时代对于“技术价值”的重新定义——AI的价值不再仅仅体现在生成内容的丰富度上,更体现在对物理世界效率的提升和对真实生活服务的优化上。

JoyAI矩阵:构建全场景物理交互的能力底座
要解决物理世界的交互难题,首先需要解决的是感知与认知的全面性问题。在过去,大模型虽然在文本、图像和视频生成上取得了突破性进展,但在实时性、多模态同步以及工具调用方面仍存在局限。京东在本次大会上展出的JoyAI模型矩阵,正是为了补齐这些关键短板。
其中,JoyAI-Talker实时语音交互模型展示了高智商与高情商并存的特性。它不仅仅是一个简单的语音转文字工具,而是具备低延迟对话、情绪识别、长期记忆以及复杂工具调用能力的智能体。这意味着,它可以像人类助手一样,理解上下文语境,并在对话过程中自主调动外部资源,完成从信息查询到任务执行的完整闭环。这种全双工的自然交互能力,是AI进入家庭、客服、医疗等需要高频情感交流场景的基础。
与此同时,JoyAI-Video-Edit流式视频编辑模型的发布,则填补了实时视频处理能力的空白。传统视频生成需要漫长的渲染时间,无法适应实时决策的需求。JoyAI-Video-Edit支持边预览边实时修改,无需长时间等待渲染。这一能力对于机器人仿真训练、环境数据处理以及内容创作至关重要,它使得AI能够基于实时的视觉反馈进行动态调整,从而更精准地应对物理世界中的突发状况。
截至2026年上半年,京东已推出包括Joy-Image-Edit、JoyAI-Echo、JoyAI-VL-Interaction在内的7个具备全球领先水平的基础模型。这些模型并非孤立存在,而是以JoyAI基座大模型为核心,形成了一个覆盖语音、图像、视频、实时交互、世界模型和具身智能的完整体系。例如,在物流领域,物流“超脑”通过统一调度决策,能够在几分钟内为上亿包裹规划出最优路径;在医疗领域,“京医千询”驱动的AI医生实现了诊疗服务的升级;在工业领域,“AI智采管家”则深入供应链前端,提升了采购效率。这些应用场景证明,基础模型已经具备了介入复杂产业现场的能力,成为AI焕新物理世界的坚实底座。

数据破局:千万小时具身数据开源计划
如果说模型是具身智能的“大脑”,那么高质量的数据就是其成长的“燃料”。当前,具身智能发展的最大瓶颈在于真实世界优质数据的稀缺。虽然数据采集并非难事,但经过清洗、标注、结构化后的高可用数据却凤毛麟角。此外,不同形态的机器人本体之间,数据往往难以直接复用,导致每次训练都需要从零开始,极大地限制了技术的泛化能力。
针对这一行业痛点,京东在WAIC期间宣布开源行业最大的人类视角数据集EgoLive。这一举措旨在将来自真实生活与作业现场的第一视角经验,转化为具身模型可以学习的数据燃料。京东集团副总裁龚义成介绍,京东通过打通“采集-处理-标注-训练-验证”的全链路闭环,构建了具备量产级第一视角采集能力的硬件设施。
依托京东在零售、物流、工业等全产业链的海量场景资源,京东计划在两年内完成1000万小时的数据采集目标。这些数据涵盖了第一视角手部动作轨迹、多模态感知数据等全维度信息,能够支持跨本体的模型泛化训练。在WAIC展区,观众可以清晰地看到这一数据基础设施的运作流程:通过佩戴JoyEgoCam完成货架作业,原始视频经过结构化处理变成机器人的“教材”,系统在数字孪生空间中让机器人进行反复训练和评测,最终由星辰智能理货机器人在实体货架前完成商品整理。
更关键的是,京东采取了开放的共建模式。京东并不试图覆盖所有数据采集场景,而是专注于解决“行业最重”的基础数据问题,并与其他细分场景的优秀数据企业共建具身数据联盟。这种分工协作的模式,避免了重复造轮子,加速了整个行业的数据生态建设。同时,京东在数据合规方面也建立了严格的体系,从场景报备、用户授权到算法层的自动脱敏,确保了数据使用的安全性与合法性,为行业的健康发展扫清了障碍。
AI Home:去中心化的分布式智能体验
技术的最终归宿是服务于人。京东在WAIC上展示的另一个亮点,是首个JoyInside全协同AI Home场景。这一场景覆盖了客厅、厨房、学习区和卧室,代表了京东在消费生活领域的最新探索。
传统的智能家居往往陷入“人主动下发指令、设备被动执行”的交互逻辑中,用户体验割裂且繁琐。JoyInside则打破了这一范式,实现了全空间硬件围绕家庭成员需求的自主协同响应。在这个空间中,AI投影台灯可以自动识别孩子的学习状态并辅助扫题答疑;当用户随口说出“口渴”,智能茶吧机会根据预设水温自动出水。整个过程中,用户无需手动下发指令,家电基于对实时感知状态的判断,主动提供服务。
京东科技AI创新业务负责人戴文军指出,JoyInside不是传统意义上的“工具集合”,而是一个拥有独立角色的“家庭成员集群”。每个智能硬件都植入了独立的AI大脑,成为具有不同属性的“AI角色”。它们自主判断用户需求,并在分布式架构下自动协同完成任务。这种去中心化的设计,不仅提高了系统的鲁棒性,也极大地提升了用户体验的自然度和流畅度。
据统计,JoyInside已接入近200家品牌硬件,2026年全年接入总量预计突破1000万台。用户数据显示,学习教育类产品周均交互次数超过百次,用户粘性显著高于传统智能硬件。未来,随着智能睡眠健康、卫浴场景联动等创新产品的落地,分布式智能体验将全面覆盖家庭生活场景,真正实现AI从云端走向终端,从模型能力转化为可感知的服务价值。

结语:从“能生成什么”到“能做成什么”
京东在WAIC上的表现,清晰地传递出一个信号:人工智能的下半场竞争,将是物理世界落地能力的竞争。通过构建涵盖数据、模型、场景和基础设施的完整闭环,京东正在探索一条不同于互联网大厂的技术路线。
这条路线不追求虚高的参数,而是扎根于真实的产业土壤;不局限于虚拟世界的生成,而是致力于解决物理世界的实际问题。无论是物流的高效调度、医疗的精准辅助,还是家庭的智能协同,京东都在尝试回答一个核心问题:AI如何从屏幕上走下来,变成推动物理世界高效运转的实际力量?
在AI从数字内容生产向物理世界操作延伸的拐点期,京东的探索为行业提供了一个有价值的样本。它表明,只有当AI能够真正理解物理规律、适应复杂环境并自主完成任务时,其潜力才能得到最大的释放。对于整个行业而言,这或许标志着我们正从一个关注“AI能生成什么”的时代,迈向一个关注“AI能做成什么”的新阶段。