Runway上线AI创意人才平台DIFFUSE,ElevenLabs推医疗语音模型
医疗语音模型走向临床落地
ElevenLabs最近发布了Scribe v2 Medical,这是专为临床音频场景优化的语音转文字模型。相比基础版Scribe,新版本在医疗术语识别上的词错误率降低了18%。对于医生问诊、查房记录这类对准确性要求极高的场景,这点改进很关键。
更值得注意的是,Scribe v2 Medical通过了HIPAA合规认证。这意味着医疗机构可以直接用它处理受保护的健康信息,而不用担心数据泄露风险。系统还支持在请求完成后立即删除音频和转录内容,进一步保障患者隐私。目前该服务通过ElevenAPI提供,价格从每小时0.22美元起。
医疗语音识别一直是个难题。专业术语多、口音差异大、背景噪音复杂,普通语音模型很容易出错。这次ElevenLabs专门针对临床场景微调,说明生成式AI正在从通用能力转向垂直领域深耕。不过0.22美元/小时的价格对大规模医院部署来说可能还是偏高,后续能否降价将影响实际 adoption。
Runway搭建AI创意人才市场
Runway推出了DIFFUSE平台,目标是连接代理机构、品牌和工作室与AI原生创意人才。所谓“AI原生”,指的是那些从一开始就用生成式AI工具进行创作的设计师、视频师和艺术家。他们熟悉提示词工程、模型微调和工作流编排,能高效产出符合商业需求的内容。
这个平台的出现很有意思。过去几年,Runway自己就是创意AI工具的代表,Gen-2视频生成让很多创作者尝到了甜头。现在他们往前走了一步——不只提供工具,还要搭建整个生态。DIFFUSE有点像创意界的Upwork,但专门服务于AI增强型工作流。
对品牌方来说,找到真正懂AI创作的人并不容易。很多人只是会点几下按钮,但缺乏系统性的创意能力和项目经验。DIFFUSE如果能做好人才筛选和质量把控,确实能解决这个痛点。不过平台如何定义和验证“AI原生创意人才”的标准,还有待观察。
具身智能迈出实用一步
墨奇智能发布了MoRA具身模型和MORPHI KINO轮式双臂机器人。演示视频里,机器人能连续完成开门、取物、放置等一系列长程任务,整个过程由端侧模型驱动,不需要云端干预。
具身智能(Embodied AI)一直是AI圈的热门方向,但多数还停留在实验室阶段。墨奇这次强调“全栈”能力——从数据采集、模型训练到端侧部署和执行,都自己搞定。特别是端侧运行这点很重要,意味着机器人能在没有网络的环境下稳定工作,这对实际应用场景很关键。
MORPHI KINO采用轮式底盘加双臂设计,看起来更适合室内环境操作。虽然离家庭普及还有距离,但在仓储、实验室或特定工业场景,这种能自主完成多步骤任务的机器人已经有明确价值。不过官方没提具体价格和交付时间,商业化进度还不明朗。
开发者工具链持续完善
Cloudflare推出了Worker Previews功能,为AI代理的代码修改提供隔离预览环境。简单说,每次AI自动生成或修改代码后,系统会先在一个独立沙箱里测试,确认没问题再部署到生产环境。这能大幅降低自动部署带来的回归风险。
随着AI编程助手越来越普及,开发者经常让AI直接改代码。但AI也会犯错,一个不小心就可能把整个服务搞崩。Worker Previews相当于给AI代理加了个安全阀,让它在“试错”时不影响真实用户。这对依赖AI进行持续集成的团队特别有用。
另一边,AWS分享了生成式AI端点的成本优化方法。他们建议通过并发度扫描来选择合适的SageMaker实例类型,在满足延迟要求的前提下找到性价比最高的配置。很多团队一开始会过度配置资源,导致成本飙升。这套方法论能帮他们更精细地控制开支。
消费品牌开始用AI替代人力
Confido刚完成了5500万美元B轮融资,这家公司专门为消费品牌构建AI workforce,自动化处理财务、销售和需求规划等后台任务。据说已经服务了多家知名品牌,但没透露具体客户名单。
所谓AI workforce,其实就是一套垂直领域的智能体系统。比如自动分析销售数据、预测库存需求、生成财务报告等。传统上这些工作需要大量人力,现在用AI可以7x24小时不间断处理,而且出错率更低。
不过消费品牌的业务逻辑往往很复杂,涉及季节性波动、营销活动、供应链变化等多种因素。AI能否真正理解这些上下文,而不仅仅是套用模板,是成败关键。Confido拿到这笔钱后,估计会重点打磨行业know-how,而不是单纯堆模型参数。
国内Personal Agent产品即将上线
Today AI将在国内全量上线,据内测用户反馈,这是国内较早贯彻Personal Agent理念的产品。它强调上下文获取能力、自然交互体验和日常任务执行,比如自动整理会议纪要、跟踪待办事项、跨应用协调日程等。
Personal Agent和普通聊天机器人的区别在于主动性。它不只是被动回答问题,而是能主动感知用户需求,在合适时机提供帮助。要做到这点,需要深度集成操作系统和各类应用,同时保证隐私安全。Today AI具体怎么实现这些,还得等正式版出来才能验证。
另外,商汤发布了U1 Pro图像生成模型,主打高质量国产多模态能力。从放出的样图看,细节表现确实不错,尤其在人物和场景一致性上比早期国产模型进步明显。不过和Midjourney、DALL·E 3这些国际顶尖水平比,还有差距。但作为国产替代选项,已经能满足不少商业需求。
整体来看,AI正从炫技阶段转向务实落地。无论是医疗语音、创意生产还是机器人控制,大家开始关注具体场景的痛点和ROI,而不是单纯追求技术指标。这种转变对行业长期发展是好事——毕竟,能解决问题的技术才有价值。