商汤U1 Pro实测:国产AI生图能改到商用交付吗

0 阅读

生完图还能继续改,才是真本事

现在AI画图工具不少,但很多人卡在一个痛点:图生成了,却没法按需调整。改一处,其他地方就崩;调两次,人物五官就错位。商汤刚正式发布的U1 Pro(全称SenseNova U1 Pro),主打的就是“能改”——不仅能改,还能连续改、精准改,直到达到可直接用在商业场景的程度。

文章配图

目前U1 Pro已在商汤自家的“小浣熊”平台开放体验,企业客户也能通过API或SenseNova Studio调用。我们拿到测试权限后,在Studio里做了几轮实测,看看它到底能不能扛住真实工作流里的反复折腾。

文章配图

生活照秒变纸质插画,局部改色不翻车

文章配图

第一轮测试从一张普通生活照开始。上传实拍人像后,输入提示词要求转成“纸质质感插画”,几分钟内就出图了。人物轮廓、光影关系基本保留,整体呈现出类似手绘纸张的肌理,没有出现常见的肢体扭曲或背景糊成一团的问题。

文章配图

但这只是热身。真正的考验是局部修改:把人物深色外套里露出的黑色圆领T恤改成白色,且限定范围仅在敞开外套之间、颈部到腰部可见的部分。难点在于T恤、皮带、裤子全是黑色,胸前还有胸牌遮挡,AI很容易误判边界。

文章配图

结果U1 Pro准确识别了T恤区域,只改颜色,没动周围任何元素。衣服褶皱、阴影过渡自然,连胸牌反光都没受影响。这说明模型对图像语义的理解已经超出了简单像素填充,能区分不同物体的物理边界。

文章配图

四张参考图揉成一张微缩咖啡店海报

文章配图

接下来挑战多图融合。我们提供四张独立图片:一家店铺门面、一只特定花纹的猫、一个带图案的咖啡杯,以及一张海报版式草图。要求U1 Pro把它们合成一张“猫咪经营的微缩咖啡店”宣传图,并严格分配每张参考图的作用。

文章配图

比如,店铺要按1:12比例做成桌面模型,猫要变成系围裙的店长坐在门口,杯子缩小后放在桌上,版式只借鉴分区逻辑。还得加上指定文字:“街角补给站”“今天,先喝一杯再出发”“桂花拿铁 28元”“营业时间 08:00—20:00”,不能编地址或二维码。

文章配图

最终生成的图完全符合要求:建筑结构、猫的毛色花纹、杯子造型都忠实还原,透视统一,光影来自左上方,有合理的接触阴影。文字清晰可读,整体呈现手工模型的真实质感,不像拼贴。这证明U1 Pro能同时处理多个视觉源,并按指令分配权重,而不是简单堆叠元素。

文章配图

连续三次修改,指哪打哪不跑偏

文章配图

真实工作中,修改往往不止一次。于是我们对刚生成的咖啡店海报连续动刀。

文章配图

第一次,只改价格:“桂花拿铁 28元” → “26元”。字体、颜色、位置完全保留,仅替换数字,毫无违和感。

文章配图

第二次,换主标题:“今天,先喝一杯再出发” → “今天的好心情,从这一杯开始”。新标题在原区域合理换行,字号微调以适应长度,但字体风格和视觉层级没变,也没遮挡任何主体。

文章配图

第三次,改杯子颜色:杯身底色从原色换成深墨绿,但保留形状、把手、图案、材质和光照。结果杯子确实变了色,其他部分纹丝不动。

文章配图

三轮下来,店铺、猫咪、桌椅、背景全都稳如泰山。这种“局部编辑稳定性”正是当前多数AI生图工具的短板——U1 Pro显然在这方面下了功夫。

文章配图

八格连续动作,为AI视频打基础

文章配图

更高阶的测试是生成连续动作序列。我们上传一张猫的照片,要求输出4×2共八格横版图,表现同一只毛毡猫从合上电脑到离开办公桌的全过程。每格动作必须连贯,角色特征(额头花纹、围巾、尾巴纹路)全程一致,背景、镜头、光线固定。

文章配图

文章配图

文章配图

文章配图

结果八格动作流畅衔接:从坐姿操作电脑,到压下屏幕、跳下凳子、迈步离开,每个关键帧都准确。猫的毛毡质感、围巾颜色、办公桌比例全部统一,没有出现角色漂移或场景突变。这种能力对AI视频生成很有价值——先用U1 Pro生成稳定的关键帧序列,再喂给视频模型,能大幅降低动作抖动问题。

无素材也能做科普图?它真去查了NASA

最后一项测试最硬核:不给任何参考图,只靠一段文字提示,让U1 Pro自己查资料做科普海报。主题是“月亮为什么会变脸?”,要求核实NASA官方信息,解释月光来源、月相成因、与月食区别,并用八枚饼干状月亮展示完整月相循环。

令人意外的是,U1 Pro真的调用了外部知识。生成的图不仅月相顺序、亮面方向(北半球视角)正确,还明确标注“暗面仍为完整圆形”,避免常见误解。三条解释短句简洁准确:“月光是反射的太阳光”“月相变化因视角不同”“普通月相≠地球影子”。配色安静,文字清晰,完全适配手机阅读。

更关键的是,模型在图外附上了实际参考的NASA页面标题和链接,没编造来源。这说明U1 Pro具备“检索-验证-整合”能力,不是闭门造车。

可交付性,才是生图AI的终极门槛

回看这些测试,核心价值不在“画得像”,而在“改得稳”。电商从业者常需要拿白底产品图生成场景图——杯型、图案必须100%匹配实物,否则会引发客诉。U1 Pro能基于商品图重构生活场景,同时锁定关键特征不变,这对品牌方很实用。

同样,两句话生成威尼斯电影节新闻海报,信息全靠自主检索,排版专业,也体现了面向真实需求的交付能力。商汤把这套流程称为“创作管线”:从理解需求、补全信息、处理素材,到生成编辑、检查修正,一气呵成。

现在的AI生图早已过了“惊艳一下”的阶段。用户要的是能嵌入工作流、经得起反复修改、最终直接落地的工具。U1 Pro或许不是唯一做到这点的模型,但它证明了国产AI在可控性和稳定性上,已经摸到了商用交付的门槛。