OpenAI推图像生成新模型,曹操出行上线AI打车,达芬奇接入Claude

1 阅读

OpenAI 图像生成模型升级:延迟减半,支持草图编辑

OpenAI 最近发布了 ChatGPT Images 2.5,这是其图像生成能力的一次重要迭代。新版本在细节表现、光照处理和纹理还原上都有明显提升,同时将生成延迟降低了一半左右。对普通用户来说,这意味着从输入提示到看到结果的等待时间大幅缩短。

image.png

更实用的是新增的 Sketch(草图)功能。用户现在可以上传手绘草图或简单线稿,模型会基于这个结构生成完整图像,而不是完全依赖文字描述。这种方式特别适合有明确构图但不擅长写提示词的人。比如画一个角色姿势,再让 AI 补充服装、背景和光影。

image.png

另一个改进是图片内评论标注。用户可以在图像上圈出具体区域并添加修改意见,比如“把帽子颜色改成红色”或“放大左侧建筑”。系统能理解这些空间指令,并只调整指定部分,避免整体重绘导致风格不一致。这对需要反复微调的设计工作很友好。

OpenAI 还同步推出了两款 API 模型:一个侧重速度和成本,适合批量生成;另一个追求高保真度,用于专业创作。开发者可以根据场景灵活选择,不必在性能和质量之间做单一取舍。

曹操出行联手豆包,AI 打车服务落地三城

曹操出行和字节跳动旗下的豆包大模型合作,在北京、杭州、苏州上线了 AI 打车服务。用户在豆包里聊本地生活话题——比如“附近有什么好吃的川菜”或“去西湖怎么走”——系统会自动识别出行意图,直接生成打车方案,并跳转到曹操出行完成叫车。

这种整合省去了用户手动打开打车 App、输入目的地的步骤。背后是豆包对对话上下文的理解能力:它不仅能提取地点信息,还能结合用户之前的提问判断真实需求。例如,如果用户先问“灵隐寺几点关门”,接着问“怎么去”,系统就知道目的地是灵隐寺而非泛指杭州。

双方计划后续加入智能车控功能,比如通过语音调节车内空调或播放音乐。长期目标还包括 Robotaxi(自动驾驶出租车)能力的探索。目前服务仅限三个城市,但团队表示会根据使用数据逐步扩展到其他一线和新一线城市。

达芬奇剪辑软件接入两大 AI 编码助手

Blackmagic Design 发布的 DaVinci Resolve 21.1 版本,首次集成了 Anthropic 的 Claude Code 和 OpenAI 的 ChatGPT Codex。这两个工具主要面向使用 Fusion(达芬奇内置的视觉特效模块)的用户,帮助编写节点脚本或自动化重复操作。

1.png

比如,用户可以用自然语言描述“给所有镜头加 LUT 并输出 ProRes 422”,AI 会生成对应的 Python 脚本。对于不熟悉编程的剪辑师,这降低了自动化门槛;对高级用户,则节省了查文档的时间。

除了 AI 功能,21.1 版还原生支持富士 X-Trans、徕卡 M 系列和索尼 A7 系列相机的 RAW 格式,无需额外转码即可直接剪辑。多机位工作流也做了优化,切换不同角度时的同步更稳定,尤其适合活动或访谈类内容的后期制作。

智元机器人加码触觉感知,入股模感科技

具身智能公司智元机器人近期投资了模感科技,后者专注于柔性电子皮肤和多模态触觉系统。传统机器人主要依赖视觉和力控,但在抓取易碎品或识别材质时仍有局限。模感科技的电磁超材料电子皮肤能同时感知压力、滑动、温度甚至纹理,相当于给机械臂装上了“指尖神经”。

这次入股是智元在感知层的关键布局。此前他们已投资智身科技(做运动控制算法),并与蓝思科技合作量产人形机器人本体。从感知到决策再到执行,产业链闭环逐渐成型。不过触觉数据的采集和训练成本很高,如何规模化仍是挑战。

京东押注物理 AI,五年内采购超 300 万台机器人

在 JDD 大会上,京东宣布启动“物理 AI 加速计划”,核心是建设全球最大的物理世界运营中心。具体包括六个方向:数据、机器、制造、销售、物流、服务。其中最硬核的目标是两年内采集超过一千万小时的人类真实场景操作数据——比如分拣包裹、摆放货架、送货上门等动作视频。

硬件方面,京东计划未来五年采购 300 万台具身机器人、100 万台无人配送车和 10 万架物流无人机。这些设备将首先部署在京东自己的仓库和配送网络中,验证可靠性后再向外部开放。曹鹏强调,物理 AI 的关键不是单点技术突破,而是让 AI 在真实环境中持续学习和迭代。

联通魅族推“小魔方”AI 手机:4 英寸屏,全语音交互

中国联通和魅族联合发布的“小魔方”是一款主打语音交互的 AI 终端。机身仅 99 克,配备 4 英寸方形屏幕,几乎不用手动操作。系统基于云智 OS,所有功能——打电话、发消息、查天气、订外卖——都可通过语音触发。

它还支持 AI 实时翻译通话,比如对方说英语,用户听到的是中文语音,反之亦然。无障碍接听功能则能自动总结来电内容,适合听障人士或会议中不方便接电话的场景。存储方面提供 2TB 云端空间,本地和云端身份可一键切换,比如工作号和个人号共用一台设备。

不过这类极简设计牺牲了屏幕体验,更适合做备用机或长辈机。目前售价和上市时间尚未公布。

DeepSeek 下调 Flash 模型价格,空闲时段输出每百万 token 4 元

国产大模型公司 DeepSeek 宣布对 Flash 系列进行调价。降幅最大的是缓存命中时的输入价格:空闲时段从 0.05 元/千 token 降至 0.02 元,高峰时段从 0.10 元降至 0.04 元,相当于六折。缓存未命中时的输入价格也降了三分之一。

输出价格方面,空闲时段从 4.5 元/百万 token 降到 4 元,高峰时段从 9 元降到 8 元。虽然降幅不如输入端明显,但在当前行业普遍降价的背景下,这对高频调用的开发者仍是利好。DeepSeek 表示,调价得益于推理效率优化和 GPU 资源利用率提升。

首部 AIGC 漫改武侠片《山竹刀》上线

电影《山竹刀》号称首部 AIGC 漫改武侠大片,已在多个平台独家上线。故事改编自同名漫画,讲述女侠芷竹护送医女李小若穿越险境,途中两人从互相戒备到彼此救赎。影片大量使用 AI 生成画面,尤其在场景构建和动作设计上减少了传统手绘工作量。

制作团队透露,他们用定制模型统一了美术风格,避免不同镜头间出现画风跳跃。长镜头打斗戏通过 AI 补帧实现流畅运镜,而人物表情则保留手工调整以确保情绪准确。这种“AI 效率+人工把控”的混合流程,可能是未来中等成本动画的主流模式。

不过观众评价两极:有人称赞视觉新颖,也有人认为叙事节奏受技术限制显得仓促。无论如何,这是一次将 AIGC 应用于长时序内容的实质性尝试。