Meta Muse个人Agent上线,GPT-Image-2.5编辑能力增强
Meta推出可持续执行任务的个人Agent Muse
Meta最近上线了名为Muse的个人AI Agent服务。每位用户会被分配一台专属的云端Linux电脑,这台虚拟机可以在后台持续运行,不受用户是否在线的影响。Muse的设计目标是让AI能够长时间推进复杂任务,比如自动完成一个完整的网页开发流程,或者连续几天监控某个数据源的变化。

这个Agent能跨浏览器、终端和日程系统进行操作。例如,它可以打开浏览器搜索资料,把结果复制到终端里运行脚本处理,再根据处理结果更新用户的日历安排。这种连续执行的能力,解决了以往AI工具只能响应单次请求的局限。
值得注意的是,Muse并非简单的自动化脚本。它具备一定的决策能力,可以根据任务进展动态调整下一步操作。比如在网页开发任务中,如果发现某个依赖库版本不兼容,它会尝试寻找替代方案或回退到旧版本,而不是直接报错退出。
目前Muse仍处于早期测试阶段,主要面向开发者和技术用户开放。Meta希望通过这种方式探索个人AI助手的长期价值,而不仅仅是提供即时问答服务。
GPT-Image-2.5精准编辑能力获社区关注
OpenAI的GPT-Image-2.5模型在图像编辑方面有了明显进步。社区用户整理了15组精准编辑提示词,覆盖了局部替换、A/B素材对比和连续分镜等场景。这些提示词的核心思路是明确指定图像中哪些区域需要修改,哪些区域必须保持不变。
实测结果显示,GPT-Image-2.5在多轮编辑中的一致性确实有所增强。比如先修改人物衣服颜色,再调整背景色调,两次操作后人物面部特征和姿势基本保持一致,不会出现明显的漂移现象。
不过,用户也指出涂抹感改善有限。当编辑区域边界比较复杂时(比如头发与背景交界处),仍然可能出现模糊或不自然的过渡。这说明虽然可控性提升了,但底层图像生成质量仍有提升空间。
一个典型的精准编辑提示词结构包含三个部分:原始图像描述、修改区域定位、新内容描述。例如:“这张照片中穿蓝色衬衫的男人(坐标x1,y1到x2,y2)改为穿红色毛衣,其他部分完全不变”。这种明确的指令大大减少了AI的自由发挥空间,提高了编辑的准确性。
Muse Spark 1.3 Max进入WebDev性价比前沿
在代码生成和网页开发领域,Meta的Muse Spark 1.3 Max模型表现抢眼。根据LMArena发布的Code Arena WebDev排行榜,该模型在性能和价格的综合评估中进入了Pareto前沿。
Pareto前沿意味着在这个价位上,很难找到比它性能更好的模型;同样,在这个性能水平上,也很难找到更便宜的选择。对于需要大量调用AI进行网页开发的团队来说,这是一个重要的参考指标。
Muse Spark 1.3 Max特别擅长处理现代前端框架的代码生成,比如React、Vue和Svelte。它不仅能生成基础组件,还能理解复杂的交互逻辑和状态管理需求。在测试中,它成功完成了包含路由、API调用和表单验证的完整页面开发任务。
价格方面,Muse Spark 1.3 Max的定价策略相对灵活,提供了按token计费和套餐包两种选择。对于中小规模的开发团队,套餐包的单位成本更低;而对于大型项目,按需计费可能更合适。
WebMCP让网站向智能代理暴露原生交互工具
Browser Use团队推出的WebMCP技术,旨在解决AI代理操作网页时的可靠性问题。传统方式下,AI需要通过模拟点击和键盘输入来操作网页,这种方式容易因为页面加载延迟或元素位置变化而失败。
WebMCP的核心思想是让网站主动向AI代理暴露原生交互工具。比如电商网站可以提供“add_to_cart(product_id)”这样的函数,AI代理只需调用一次就能完成添加购物车操作,而不需要模拟点击“加入购物车”按钮的整个过程。
这种设计大幅降低了操作成本。原本可能需要多次尝试才能成功的复杂操作(比如填写多步骤表单),现在通过一次工具调用就能完成。更重要的是,执行可靠性显著提升,因为原生工具的接口比UI元素更稳定。
目前WebMCP还处于概念验证阶段,主要在一些测试网站上部署。但它的思路很有启发性——与其让AI艰难地适应现有网页,不如让网页主动适配AI的需求。
社区扩展Qwen与LLaDA本地推理能力
在本地推理工具方面,社区开发者推出了两个值得关注的项目。MLX-serve现在支持Qwen3.8模型,能够在Apple M5 Max 128GB设备上运行百万上下文的推理。这对于需要处理长文档的用户来说是个好消息,意味着可以在本地完成以前只能在云端进行的长文本分析。
另一个项目minnow专注于LLaDA2.2模型的快速推理。它提供了一个轻量级的推理服务器,启动速度快,内存占用低。测试显示在同等硬件条件下,minnow的推理速度比标准实现快约30%。
这两个项目的共同特点是都针对特定模型进行了深度优化。MLX-serve利用Apple芯片的Metal加速能力,而minnow则通过算子融合和内存布局优化来提升性能。这反映了本地AI工具的发展趋势——从通用框架转向针对特定模型的专用优化。
对于普通用户来说,这些工具降低了在本地运行大模型的门槛。不需要昂贵的GPU,普通的MacBook Pro就能流畅运行Qwen3.8,处理日常的文本生成和分析任务。
OpenAI上线小企业ChatGPT插件合集
OpenAI面向小企业用户推出了16款ChatGPT插件的合集。这些插件覆盖了日常运营中的常见需求,比如客户支持、社交媒体管理、财务记录和库存跟踪。
其中比较实用的包括自动回复客户邮件的插件,可以根据邮件内容分类并生成合适的回复草稿;还有社交媒体调度插件,能够根据业务类型推荐最佳发布时间,并自动生成适合不同平台的文案格式。
这些插件的设计理念是降低小企业的技术使用门槛。很多小企业主没有专门的IT人员,但又需要数字化工具来提升效率。通过ChatGPT插件,他们可以用自然语言的方式与这些工具交互,而不需要学习复杂的软件操作。
不过需要注意的是,这些插件目前主要面向英语市场,对中文和其他语言的支持还有限。而且部分插件需要连接第三方服务(比如Shopify或QuickBooks),在国内使用可能会遇到网络或合规问题。
DeepSeek模型官方与OpenRouter渠道出现明显价差
社区用户发现DeepSeek的DSV4 Flash 0731模型在不同渠道的价格差异很大。通过OpenRouter调用的价格显著低于DeepSeek官方定价,有时甚至只有官方价格的三分之一。
具体来看,DeepSeek官方的V4 Flash模型在高峰时段的输出价格仍然比涨价前贵3倍左右。而OpenRouter提供的相同模型,输入输出价格都要便宜得多。这种价差的原因尚不明确,可能是OpenRouter通过批量采购获得了更优惠的批发价,或者是DeepSeek官方在不同渠道采用了差异化的定价策略。
对于开发者来说,这种价差直接影响了成本控制。如果应用对延迟要求不高,通过OpenRouter调用DeepSeek模型可以大幅降低运营成本。但也要考虑服务稳定性和技术支持的问题——官方渠道通常能提供更好的SLA保障。
值得注意的是,这种跨渠道价差现象在AI模型市场越来越普遍。除了DeepSeek,其他模型提供商如Anthropic和Cohere也存在类似情况。开发者在选择调用渠道时,需要综合考虑价格、性能、稳定性和合规性等多个因素。
英矽智能药物早期数据呈现生物年龄下降信号
AI制药公司英矽智能公布了其候选药物rentosertib的早期临床数据。在一项探索性研究中,研究人员使用6种不同的衰老时钟来评估药物效果,结果显示受试者在用药第4周时平均生物年龄下降了3至4岁,个别案例最高达到6岁。
需要强调的是,这些数据来自小规模的早期试验,尚未经过大规模验证。生物年龄的测量本身也存在方法学争议,不同的衰老时钟可能给出不同的结果。但即便如此,能在多种评估方法下都观察到一致的年轻化趋势,仍然是个值得关注的信号。
Rentosertib是英矽智能利用AI平台发现的候选药物,靶向与细胞衰老相关的通路。传统药物研发通常需要10-15年时间,而AI辅助的方法有望将这个周期缩短到几年。如果后续临床试验证实了这些早期结果,这将是AI在药物发现领域的一个重要里程碑。
不过业内专家也提醒要谨慎解读这些数据。生物年龄下降并不等同于实际健康改善,还需要观察临床终点指标(比如疾病发生率、死亡率等)是否真的有所改善。目前英矽智能计划开展更大规模的II期临床试验来验证这些初步发现。