豆包 2.1 Pro 实测:看图写代码、建 3D 星球,还能还原手绘草图

3 阅读

从一张提示词开始:AI 做出了可交互的 3D 山西导览

国庆中秋双节临近,有人还在纠结去哪儿玩。有意思的是,现在 AI 已经能帮你规划路线了——我们只给模型一段文字提示,它就交出了一份可移动、可点击的 3D 山西旅行导览。

文章配图

提示很简单:收集山西旅游信息,绘制一份清晰好看的 3D 景点地图,支持交互点击,了解各景点位置、看点和游玩建议。

文章配图

结果令人意外:首页是山水风格的汇总界面,进入后能看到按真实海拔起伏构建的地形,配色清爽,信息基本准确,还推荐了四条主题路线——比如古建线、晋商线、自然风光线等。这不是静态图片,而是一个能在浏览器里自由拖拽、缩放、点击查看详情的 Web 应用。

图片

背后是字节刚上线的新版豆包 2.1 Pro(版本号 0915)。该模型 API 已在火山方舟全量开放,豆包工作也同步接入。官方称其重点升级了四个方向:多模态 Coding、Agent 专业任务交付、面向 3D 与专业图文的多模态理解,以及 Token 效率。其中最引人注目的是“多模态编程”——让模型看着设计稿、图纸甚至录屏来写代码,并能根据运行画面自动调整。

图片

跟着小王子建星球:从昼夜循环到会飞的玫瑰

文章配图

为了测试这种能力,我们决定用《小王子》的故事串起一系列任务。第一站,是他的 B612 星球。

文章配图

这颗星球很小,有三座火山、几棵猴面包树和一朵骄傲的玫瑰。我们的要求是:设计一个可放在桌上的微缩星球摆件,支持旋转和昼夜变化。

图片

模型生成的结果很有“摆件感”:星球表面细节丰富,玫瑰会缓缓绽放,光影过渡柔和。更妙的是,它把昼夜循环速度设为一天 44 次——呼应书中“小王子一天看了 44 次日落”的情节。整个场景用 WebGL 实现,加载快,交互流畅。

文章配图

过程中,模型还会自主截图当前画面,分析哪里不对,再回头修改代码。比如最初玫瑰颜色偏暗,它通过比对参考图调整了材质参数;又比如初始旋转轴偏移,它通过坐标校准修正。这种“看—做—验—改”的闭环,正是多模态 Agent 的核心能力。

文章配图

从五视图重建城堡:连屋顶都能打开看内部

图片

星球有了,房子也不能马虎。我们找来一张小王子城堡的外观五视图(前、后、左、右、顶),要求模型据此重建 3D 模型,并生成合理的室内布局,还要支持打开屋顶查看。

文章配图

结果虽未 100% 复刻原图,但空间关系还原得很准:塔楼高度、窗户分布、门廊结构都对得上。模型还额外加了自动旋转和墙体半透明功能,方便观察内部。点击屋顶,它会缓缓升起,露出里面的楼梯、房间和家具布局——这些细节虽未在提示中明确要求,但符合“可查看内部”的逻辑延伸。

图片

这说明模型不仅识别了图纸中的几何信息,还理解了“用户想看什么”。这种对使用场景的预判,是传统代码生成工具难以做到的。

文章配图

给小王子送台“iPhone Duo”:折叠屏里玩 Foldy Bird

文章配图

安顿好家,怎么联系小王子?我们决定送他一台苹果刚“发布”的 iPhone Duo——当然是数字版的。

长图滚动查看

任务更复杂:提供三张图片和两个视频,展示一款折叠屏手机的开合方式,以及一个通过折叠操作游玩的 Flappy Bird 游戏。模型需读懂视频中的动作逻辑,再生成可交互程序。

图片

最终成品中,数字 iPhone Duo 有两块屏幕,点击侧边可展开。主界面有多个图标,其中一个就是 Flappy Bird。点击后,游戏启动:小鸟的翅膀会随屏幕折叠角度扇动,穿过一个个管道。有趣的是,模型给游戏起了个新名字:Foldy Bird

交互逻辑基本跑通,但外形更像 Surface Duo 而非 iPhone。这说明模型对“苹果设计语言”的理解仍有偏差,但在动作逻辑和游戏机制上抓得很准——它看懂了“折叠=控制”这一核心玩法。

回到现实:一张平面图,就能生成带交互的 3D 房子

小王子的故事讲完,我们转向更实际的需求:现实中,很多人只有一张图——可能是建筑平面图、庭院设计图,甚至是随手画的草稿。

先试建筑平面图。我们给模型一张标准住宅平面图,包含墙体、门窗、家具标注等。它成功将其转化为 3D 模型,并自动加入隐藏屋顶、视角切换和自动旋转功能。更重要的是,它正确解读了图例:比如虚线代表推拉门,实心矩形是衣柜,L 形符号是厨房操作台。

据字节介绍,新版模型对工程图纸中的尺寸标注、公差符号识别精度有所提升,也能更准确地解析 CAD 工件等 3D 物体。这次测试印证了这一点——它不只是“画出来”,而是“理解了”图纸背后的建造逻辑。

接着是庭院设计。我们提供一张庭院布局图,要求模拟春夏秋冬四季风貌。模型生成的场景中,春天有樱花飘落,夏天绿荫浓密,秋天银杏金黄,冬天则覆盖薄雪。植被、光照、地面材质都随季节动态变化,且过渡自然。

最后是一张我们自己手绘的潦草草图:一个带侧边栏、中央工作区和个人设置的桌面布局。提示要求支持多主题切换,包括极简、像素画、水墨、莫兰迪色、Atom 编辑器经典风、Aurora Gradient 和赛博朋克等。

结果超出预期:所有主题都实现了,切换流畅。我个人最喜欢赛博朋克风——霓虹蓝紫配色、故障动画、浮动窗口,很有未来感。而且它还提供了字体、布局密度、快捷键等深度设置,真能当日常工作台用。

民间测试加码:“鹈鹕骑自行车”也能 3D 化

测试尾声,我们用了 AI 圈流传已久的民间考题:Simon Willison 的 “Generate an SVG of a pelican riding a bicycle”。这次我们加码:要求生成 3D 像素风版本。

模型先输出一版 2D 动画,确认理解任务后,再给出 3D 结果。鹈鹕的身体比例、长喙特征、双腿蹬车的姿态都表现到位。背景树木与主体有合理透视,镜头环绕时,鹈鹕与自行车的空间关系始终保持稳定——没有出现穿模或错位。

虽然像素风格略显粗糙,但作为从文字+简单指令生成的 3D 场景,完成度已经很高。这再次证明其在空间理解和动作建模上的进步。

背后的技术:多模态 + Agent + 高效 Token

回看这次更新,豆包 2.1 Pro 0915 基于 Seed-Evolving 最新版固定而来。后者自今年 6 月公开后,三个月内高频迭代,多模态编程能力已达国内领先水平。

核心亮点有两个:

一是更懂复杂代码仓库。官方披露,在开源游戏 Luanti(约 38.7 万行代码、1000 个历史 Issue)的自主修复中,模型调度多个子 Agent 连续运行近 36 小时,完成根因定位与跨文件修复,83% 的任务达到可合并标准。

二是“看图写代码”。它能直接解析设计稿、操作录屏,转成前端代码和游戏逻辑。一个案例中,一套无文档的老 ERP 系统,仅凭一段操作录屏和几张草图,模型就读懂了约 28 万行 Java 代码,开发出移动端页面并跑通完整业务链路。

支撑这些的是多模态理解能力的提升。前面的城堡五视图、平面图、iPhone Duo 视频等测试,考的正是这项能力。

在 Agent 方面,模型强化了证据溯源、权威信源检索和数据核验,幻觉明显减少。例如在“iPhone Duo 首年出货量预测”任务中,它派出 4 个子智能体分别调研供应链、市场报告、竞品数据和历史趋势,最终产出详实分析,并明确标出哪些信息无法核实。

成本上也有优化:新版图像和视频推理的 Token 消耗比上一代减少 30% 以上。这对需要反复截图、对照画面的任务(如看录屏写代码)来说,大幅降低了使用门槛。

目前,开发者可在火山方舟调用 Doubao-Seed-2.1-pro-0915 模型;普通用户下载最新版“豆包工作”,选择“豆包 2.1 Pro(0915 新版)”即可体验。

编程正在长出“眼睛”

编程从来就不只是文本的事。真实工程中的大量知识,藏在设计图、软件界面、操作录屏,甚至老员工的手势习惯里。前端工程师的日常,很大一部分就是把设计师的 Figma 文件一点点变成代码。只会读文字的编程模型,天然缺了一条腿。

多模态补上的,正是这条腿。

从技术演进看,编程正越来越多地与视觉、空间理解结合。AI 编程要走向生产级落地,必须能“看见”世界。现在的趋势是:编程智能体开始带着一双“眼睛”去工作——看界面、看图片、理解视觉反馈,再决定代码怎么写。

同时,编程能力本身也不再只为“做软件”服务,它正成为 AI 解决通用任务的工具。无论是建 3D 星球、模拟庭院四季,还是还原手绘草图,底层都是代码在驱动。

从字节的布局看,豆包 2.1 Pro 的更新,凸显其在多模态领域的整合优势:将 Seed Audio(音频)、Seedance(视频)、Seedream(图像)等技术积累,转化为面向真实工作场景的生产力。豆包大模型正在融合“编程模型”与“通用 Agent”能力,服务更多元的创作与办公需求。

更深的变化发生在人机关系上。过去几十年,是人在学机器的语言:写代码、写 PRD、写接口文档,把想法层层翻译成机器能执行的格式。

现在,机器开始学着看懂人的表达:一张随手画的草图,一段录下来的操作,一次屏幕演示,都可以直接成为开发的起点。

从人读懂机器,到机器读懂人。当模型有了“眼睛”,代码就成了它的“手”。