本地模型连上GIMP画画,Vidu S2推实时视频互动,TabPFN-3.5支持百万行表格
本地模型开始“动手”了
最近有个挺有意思的实践:有人把本地运行的语言模型通过MCP(Model Context Protocol)连上了GIMP——那个开源的图像编辑软件。你只要用自然语言说“画一只戴墨镜的猫坐在沙滩上”,模型就能调用GIMP的脚本接口,一步步完成图层创建、颜色填充、滤镜应用等操作,最后生成一张图。

这背后用的是llama.cpp跑的本地模型,整个流程不需要联网。虽然生成效果还比不上Stable Diffusion这类专用图像模型,但关键在于它展示了桌面软件被Agent化的可能性。以前我们总说AI要“行动”,现在它真的开始点鼠标、调菜单、写脚本了。这种模式特别适合对隐私敏感或需要离线工作的场景,比如设计师在内网环境里快速试错草图,或者研究人员处理不能外传的数据。
更妙的是,这套方案不依赖特定模型。只要你能把模型跑起来,再写个适配器对接MCP,理论上任何支持脚本的软件——Blender、LibreOffice、甚至Excel——都能变成AI可操控的工具。这比单纯调API灵活得多,也更贴近“智能体”的原始定义:能感知环境、做出决策、执行动作。
Vidu S2:视频不只是生成,还能互动
Vidu S2这次更新的重点不是画质提升,而是交互能力。它同时推出了三项新功能:实时互动、实时视频编辑和空间视频探索。简单说,你现在可以一边生成视频,一边调整镜头角度、修改角色动作,甚至让观众通过点击或语音改变剧情走向。
比如生成一段城市街景,系统会保留3D空间信息,你可以在后期任意切换视角,从俯拍变成第一人称行走。如果用于产品展示,用户能直接“走进”虚拟展厅,拿起商品旋转查看。这种能力背后是Vidu对视频内容做了结构化解析,不再把视频当成一串像素帧,而是带语义的时空对象。
空间视频探索尤其值得注意。它允许用户在生成的视频中自由移动视点,类似VR体验但不需要头显。这对教育、房地产或旅游行业可能有实际价值——学生可以“走进”历史场景,买家能在线看房并随意走动。不过目前这类功能对算力要求较高,普通用户可能还得等优化版本。
表格模型卷到百万行
TabPFN-3.5的发布让表格数据处理有了新选择。它号称在TabArena等评测中领先,最大支持100万行数据、2万个特征列。要知道,传统机器学习模型处理几万行就容易卡顿,而它能直接吃下整个CSV文件不用采样。
开发者还推出了Fast版本,推理速度提升约6倍。这对需要快速响应的场景很实用,比如金融风控系统要在毫秒级判断交易是否异常,或者电商后台实时推荐商品。TabPFN系列一直主打“无需特征工程”,输入原始表格就能输出预测,这次升级后连超大规模数据也能扛住。
不过要注意,它主要适用于结构化数据分类/回归任务,不适合文本或图像。如果你手头有一堆Excel表格要做预测分析,又不想折腾复杂的预处理流程,这类模型确实省事。项目已在Reddit开源,感兴趣可以自己试试效果。
小模型也有大用处
有个开发者用450亿token从头训练了个4400万参数的语言模型,量化后体积只有19.8MB。更惊人的是,它在普通CPU上能达到1900 token每秒的推理速度。这意味着什么?一部老款笔记本就能流畅运行,甚至手机都可能带得动。
虽然参数量小,但它证明了“够用就好”的思路。很多场景根本不需要百亿参数大模型——比如客服机器人回答固定问题、IoT设备做简单指令识别、或者嵌入式系统处理传感器日志。小模型的优势在于低延迟、低功耗、易部署,而且不容易胡说八道(因为知识库有限)。
这位开发者把训练代码和模型都公开了,给想尝试定制轻量模型的人提供了参考。未来可能会出现更多针对垂直领域的微型模型,比如专门处理医疗报告的、只懂法律条文的、甚至只为某个游戏服务的AI。它们不追求通用性,但在特定任务上又快又准。
NVIDIA解释MoE的“省电”逻辑
NVIDIA最近发了一条技术说明,解释为什么MoE(Mixture of Experts)模型每个token只激活部分参数。以一个300亿参数的MoE为例,实际每步计算只用到约30亿参数。这带来三个好处:
首先是吞吐量提升。GPU不用加载全部参数,计算单元能更快完成单次推理,整体QPS(每秒查询数)更高。其次是显存占用降低。虽然模型总参数多,但激活的部分少,显存压力小,甚至能在消费级显卡上跑更大模型。最后是部署成本下降。同样的硬件能服务更多用户,或者用更小的集群达到相同性能。
不过MoE也有代价:路由机制增加了复杂度,不同专家之间的协调可能影响一致性。但对大多数应用场景来说,这种“按需激活”的设计比稠密模型更划算。这也解释了为什么越来越多新模型转向MoE架构——不是为了炫技,而是实打实的效率考量。
企业Agent的真正难点
LangChain创始人Harrison Chase提了个尖锐观点:企业级AI和消费级AI的根本区别不在模型大小,而在身份认证与权限管理。个人用AI随便问问题没关系,但企业里谁能看到客户数据?谁能修改财务报表?多个部门协作时如何分配操作权限?
他举例说,一个销售Agent可能需要访问CRM系统,但只能看自己负责的客户;而HR Agent能查员工档案,却不能碰薪资模块。这种细粒度控制远比技术实现复杂,涉及组织架构、合规要求和审计追踪。目前LangChain正在探索托管Deep Agents的认证方案,试图把OAuth、RBAC(基于角色的访问控制)这些传统IT安全机制融入Agent工作流。
这其实戳中了当前企业AI落地的痛点。很多公司买了大模型API,却发现没法安全地接入内部系统。要么权限开太大导致数据泄露风险,要么限制太死让AI形同虚设。解决这个问题可能比优化模型更重要——毕竟再聪明的Agent,没有合法身份也是“黑户”。
硬件也在配合本地化
LACT(Local AI Control Toolkit)项目最近有个PR,打算让NVIDIA显卡突破默认功耗下限。比如RTX 5090这类高端卡,通常有最低功耗限制防止不稳定,但本地推理其实不需要满血运行。调低功耗后,既能省电又能减少发热,对长时间跑模型的用户很友好。
这个改动看似微小,却反映了趋势:硬件开始为本地AI优化。以前显卡只追求峰值性能,现在开发者更关心能效比和稳定性。类似的功能未来可能会集成到驱动里,让用户一键切换“高性能”和“静音推理”模式。对普通用户来说,这意味着在家跑模型不再需要吵闹的风扇和高额电费。
综合来看,这一轮AI进展有两个明显方向:一是向下沉,让小模型、本地部署、低功耗设备也能发挥作用;二是向实处走,从单纯生成内容转向实际操作软件、处理结构化数据、解决企业权限问题。比起空谈“通用人工智能”,这些细节改进反而更可能改变日常工作流。