Qwen音频模型降价95%,移动端智能体与Agent训练新进展

0 阅读

Qwen音频模型完成全栈升级,价格大幅下调

阿里云近期对Qwen音频能力进行了全面重构,正式推出Qwen-Audio-3.1版本。这次升级覆盖了语音识别(ASR)、语音合成(TTS)和实时语音交互(Realtime)三大核心模块,并新增了面向高阶场景的ASR-Next和TTS-Next模型。

具体来看,新版ASR在嘈杂环境下的识别准确率提升了约12%,支持中英混说、方言识别和专业术语自定义。TTS-Next则在自然度和情感表达上做了优化,尤其适合有声书、客服对话等需要拟人化语音的场景。而Realtime模块的延迟进一步压缩至200毫秒以内,基本满足实时字幕、同声传译等低延迟需求。

最引人注目的是价格调整。官方数据显示,部分高频调用接口的单价最高降幅达95%。以标准ASR为例,每千分钟费用从原来的12元降至0.6元。这一调整明显是为了推动音频能力在更多中小企业和开发者项目中的落地,尤其是在客服、教育、内容生产等领域。

值得注意的是,这次升级并非孤立动作。它与Qwen-VL视觉模型、Qwen-Math数学推理能力共同构成了Qwen多模态技术栈的基础层。音频不再是独立功能,而是作为智能体感知和输出的重要通道被重新定位。

移动端智能体登场,开放评测基准

在模型层升级的同时,Qwen Intelligence产品线也推出了面向手机端的智能体(Agent)服务。目前开放三类能力:任务规划、手机自动化操作和创意内容生成。

任务规划类Agent能理解用户模糊指令并拆解为可执行步骤。比如“帮我安排下周去上海的出差”,它会自动查询航班、预订酒店、同步日历并生成行程单。手机操作类则更进一步,可直接控制设备完成复杂流程,如批量处理照片、填写表单或跨App数据搬运。创意生成聚焦文案、图像和视频脚本,支持风格指定和迭代修改。

官方公布的内部测试数据显示,在标准任务集上,端到端成功率最高达到90%。不过这个数字基于理想网络和明确指令,实际体验可能因场景复杂度而波动。为促进生态发展,团队同步开源了MobilePA-Bench和MobileWorld两套评测工具。前者侧重任务完成率和鲁棒性,后者模拟真实手机使用环境,包含通知干扰、权限弹窗等现实因素。

这些智能体并非完全本地运行。核心推理仍依赖云端大模型,但通过轻量化调度器和缓存机制降低响应延迟。用户数据默认加密传输,敏感操作(如支付)需二次确认。这种“云智端协”的架构平衡了能力与隐私,但也意味着离线场景支持有限。

Claude长任务使用技巧:一次说清目标

社区近期流传一份关于Claude Opus 5.5的实测指南,特别针对长周期、多步骤任务的使用方法。作者通过数十次实验发现,与其分阶段引导,不如在初始提示中一次性交代清楚三个要素:完整目标、完成标准和询问条件。

例如,若要生成一份市场分析报告,应直接说明:“请分析2026年Q2中国新能源汽车市场,包含销量数据、主要厂商份额变化、消费者偏好趋势。最终交付一份3000字报告,附数据来源链接。过程中如遇数据缺失或逻辑矛盾,请立即指出而非自行推测。”

有趣的是,额外添加“请仔细思考”“逐步推理”等提示词反而可能降低效率。Opus 5.5已内置深度推理机制,过度提示会触发冗余验证流程。更关键的是任务结束时的处理方式——当模型提出阻塞事项(如数据冲突、权限不足),应优先解决这些问题再验收结果,否则容易陷入无效循环。

这一经验反映出当前顶级模型的使用范式转变:从“引导式对话”转向“精准指令投喂”。用户需要像给资深同事布置任务一样,明确边界和预期,而非手把手教学。

DeepSeek公开Agent训练新方法

DeepSeek团队近日发布了一篇关于智能体训练的论文,核心贡献是一种高效沙盒环境生成技术。据称该方法可在单台服务器上每秒创建5000多个隔离沙盒,用于模拟用户交互、App操作或网页浏览等场景。

传统Agent训练依赖人工标注轨迹或真实用户日志,成本高且覆盖有限。而新方案通过程序化生成虚拟环境,结合强化学习奖励机制,让Agent在海量模拟中自主探索策略。例如训练一个订票Agent,系统会自动生成不同航司界面、票价规则和用户偏好组合,迫使Agent学会通用操作逻辑而非死记硬背。

论文特别提到,沙盒不仅包含UI层面的像素级模拟,还嵌入了业务逻辑层。这意味着Agent学到的不仅是“点击哪个按钮”,更是“为何在此情境下选择该操作”。这种抽象能力迁移至新场景时表现更稳定。

梁文锋作为共同作者参与了这项工作,显示出DeepSeek对Agent赛道的重视。虽然论文未透露具体训练数据量,但高并发沙盒能力暗示其可能已构建起大规模仿真基础设施。这对资源有限的中小团队是个挑战——Agent竞赛正从模型参数规模转向环境构建效率。

其他动态:Gemini更新、端侧模型与AI学院

Google的Gemini CLI工具链也在快速迭代。最新nightly版本v0.62.0新增了Gemini 3.8 Flash和3.5 Flash Lite两个轻量模型支持。前者定位中等复杂度任务,后者专为资源受限设备设计,两者均强调低延迟和高吞吐。开发者可通过命令行直接调用,适合集成到自动化脚本或边缘计算场景。

硬件方面,斑马智能发布了AutoOmni 2.0-23B-A3B端侧全模态模型。这款230亿参数的模型经过特殊压缩,可在车载芯片或高端手机上运行,支持视觉、语音和传感器数据的联合理解。应用场景包括驾驶员状态监测、AR导航和车内多模态交互。其A3B后缀暗示采用了某种混合专家(MoE)架构,在保持性能的同时控制功耗。

企业服务领域,汇智智能推出Hellome平台,主打FDE(Function-Driven Engagement)直连模式。简单说,就是让企业直接描述业务需求(如“自动处理退货工单”),平台匹配预训练智能体并快速部署,目标将项目周期从数月缩短至数周。这本质上是对传统AI定制开发流程的颠覆,但成败取决于智能体库的覆盖广度和组合灵活性。

最后,风投机构a16z宣布成立免学费AI实践学院,首期招募约50名年轻创作者。课程不授学位,而是通过短期项目制学习,结合企业真实需求进行实战。这种“做中学”模式呼应了Paul Graham等人的观点:在AI时代,动手能力比理论证书更重要。学院虽小众,却可能成为新型人才孵化的试验田。

整体来看,行业正从单纯比拼模型参数,转向关注落地效率、使用体验和生态构建。无论是Qwen的降价策略、DeepSeek的沙盒技术,还是Hellome的交付模式,都在试图降低AI应用门槛。而Claude的使用技巧和a16z的教育实验,则提醒我们:工具再强大,人的认知和方法论仍是关键变量。