Intern-S2-397B发布,亮源新创实现机器人跨本体导航

2 阅读

Intern-S2-397B:面向科学智能的大模型

上海人工智能实验室近期发布了 Intern-S2-397B,一个参数规模达3970亿的多模态基础模型。该模型明确瞄准科学智能(Scientific AI)和长程智能体(Long-horizon Agent)两大方向。

大黑

从技术路径看,Intern-S2-397B 不仅扩大了预训练数据量,还在强化学习和交互环境构建上做了针对性优化。这类模型的目标不是泛泛地回答问题,而是能在复杂科研任务中持续推理、调用工具、验证假设——比如自动设计实验流程、分析高维数据或撰写技术报告。

值得注意的是,397B 的参数量级在当前开源或半开源模型中属于第一梯队。不过参数规模只是基础,真正考验的是模型在专业领域的“做事能力”。目前官方尚未公布具体基准测试结果,但社区对其在数学、物理、生物等学科任务上的表现已有较高期待。

机器人导航的跨本体泛化突破

亮源新创团队在 Physical AI 领域取得了一项实用进展:他们的导航模型能在不重新训练的情况下,直接部署到四种不同结构的机器人本体上。这种能力被称为“跨本体泛化”(Cross-embodiment Generalization)。

实现这一效果的关键在于训练数据。团队收集了2000多个真实世界场景,并在仿真环境中进行大规模训练。模型学到的不是某一款机器人的运动特性,而是更底层的空间理解与路径规划逻辑。因此,当面对轮式、足式甚至机械臂等不同形态的机器人时,系统能自动调整控制策略。

“零样本适配”意味着节省了大量针对每款机器人单独调参的时间和算力成本。这对服务机器人、仓储物流或特种作业场景尤为重要——现实中很难为每种新机型从头训练导航系统。目前该技术已在内部测试中验证可行性,下一步可能是开放API或与硬件厂商合作落地。

Local Code:更快的本地代码推理

Draw Things 推出了 Local Code 的公开测试版,主打在用户本地设备上高效执行代码相关任务。该项目基于其自研的本地推理引擎,重点优化了代码生成和补全时的预填充(prefill)阶段

根据官方宣称,在支持的模型上,Local Code 的预填充速度比现有方案快 1.2 至 1.6 倍。预填充是生成式AI处理长输入提示时的关键瓶颈,尤其在代码场景中,上下文往往包含大量函数定义和注释。提速后,开发者能更快获得补全建议或错误修正,体验更接近传统IDE的即时响应。

Local Code 目前支持主流开源代码模型,并强调隐私性——所有推理均在本地完成,无需上传代码到云端。这对于处理企业内部代码或敏感项目的开发者来说是个重要卖点。测试版已开放下载,后续可能集成到 Draw Things 的主应用中。

AI音乐会背后的算力账单

一场近期举办的 AI 音乐会引发了行业对生成式内容成本的关注。据制作方透露,整场演出所消耗的 Token 成本约为 100 万元人民币

这个数字听起来惊人,但拆解来看并不意外。AI 音乐会通常涉及多模态生成:音乐旋律、歌词、编曲、视觉特效、实时互动等环节都依赖大模型。若使用高精度模型处理长时间音频或高清视频,Token 消耗量会指数级增长。

更重要的是,这100万元反映的是推理成本,而非训练成本。随着生成式AI从演示走向规模化生产,这类“运行时开销”将成为项目预算的重要组成部分。未来,如何通过模型压缩、缓存复用或专用硬件来降低单位内容的生成成本,可能会成为技术竞争的新焦点。

技术趋势观察

这几项进展共同指向一个方向:AI 正从“通用问答”向“专业做事”演进。无论是科学模型、机器人导航还是本地代码工具,核心诉求都是在特定领域可靠地完成任务,而非仅仅输出流畅文本。

同时,本地化部署的重要性日益凸显。Local Code 强调隐私与速度,而亮源新创的导航模型也需在边缘设备实时运行。这推动了对轻量化、高效推理引擎的需求,也促使开发者更关注模型的实际部署成本。

最后,100万元的 Token 账单提醒我们:生成式AI的“免费午餐”正在结束。当创意产业开始认真核算 AI 的边际成本时,技术方案必须证明其经济可持续性——这或许会加速专用模型和混合架构(云+端)的发展。

目前,Intern-S2-397B 已在 Hugging Face 开放部分访问权限,亮源新创未公布模型细节但表示将推进商业化合作,Local Code 测试版则可供开发者直接试用。这些项目虽处于不同阶段,但都试图回答同一个问题:AI 如何真正嵌入人类的工作流,而不是停留在炫技层面?