豆包2.1Pro上线火山方舟,Vidu S2支持实时视频编辑,vivo蓝心大模型升级

1 阅读

豆包2.1Pro 0915上线火山方舟,飞书引入团队智能体

字节跳动旗下企业服务产品近期完成一轮关键升级。火山引擎将豆包大模型更新至2.1Pro 0915版本,并同步优化了API接入体验。这次更新重点强化了模型在复杂任务中的稳定性,尤其是在证据溯源和数据核验方面的能力。这意味着当用户要求模型回答一个需要引用来源或验证事实的问题时,新版本能更可靠地提供可追溯的依据。

与此同时,飞书8.0版本正式上线,最大的变化是引入了名为“豆包工作伙伴”的团队智能体。过去AI助手多以个人为单位提供服务,比如帮某位员工写邮件或整理会议纪要。而新推出的团队智能体则试图打破这一边界——它能跨成员共享上下文,协助整个小组协同完成任务。例如,在项目推进过程中,它可以自动汇总各成员的进度、识别阻塞点,并建议下一步行动。

技术层面,豆包2.1Pro还增强了多模态编程能力。现在它不仅能理解代码片段,还能分析整个代码仓库的结构,识别潜在问题,并生成修复建议和对应的测试用例。这对开发团队来说是个实用功能,尤其在维护大型项目时能节省不少排查时间。

生数科技发布Vidu S2,支持实时视频编辑与VR适配

生数科技近日发布了Vidu S2视频生成大模型系列,包含Avatar和Editing两个核心方向。Vidu S2-Avatar主打高交互性的数字人生成,用户可以通过语音指令控制角色的表情、动作和口型,同时支持动态参考图输入——也就是说,你上传一张人物照片,模型就能基于这张图生成符合其特征的动态视频。

更值得关注的是Vidu S2-Editing模型。它实现了对视频流的实时编辑能力,无需预先渲染整段视频即可进行风格迁移、虚拟试穿、人物替换或背景更换。比如在直播场景中,主播可以即时切换虚拟背景,或者让服装品牌在用户试穿环节直接叠加新款服饰效果。这种低延迟的编辑能力对算力和算法都提出了很高要求。

此外,生数科技还在探索VR头显环境下的空间视频生成与编辑。他们尝试让模型理解三维空间关系,从而在VR设备中生成具有深度感的视频内容。虽然目前仍处于早期阶段,但这一方向若能成熟,将极大提升沉浸式体验的真实感。

vivo蓝心大模型全面升级,四大模型覆盖端云协同

在2026年vivo开发者大会上,蓝心大模型迎来全面升级,一口气推出四大核心模型,分别针对不同场景优化。

首先是Blue LM-RealTime语音大模型。它在嘈杂环境、方言口音以及中英文混说等复杂语音输入场景下表现更稳定。实测显示,即使在地铁站或菜市场这类高噪声环境中,识别准确率也比上一代提升明显。

其次是Blue LM-Nano端侧大模型。这个模型运行在手机本地,能实时感知用户行为并沉淀个人记忆。比如它会记录你常去的地点、偏好的应用使用习惯、甚至对话中的关键信息,并在后续交互中调用这些记忆。由于数据不上传云端,隐私性更强。

云侧则由Blue LM-Flash和Blue LM-Pro支撑。两者通过vivo自研的Agentic引擎与系统级Harness深度协同,充当手机的“任务中控”。当你发出“订明天早上去上海的机票,顺便查下浦东机场停车费”这样的复合指令时,它能自动拆解任务、调用多个App接口,并整合结果返回给你。这种跨应用、跨设备的任务执行能力,是当前智能体发展的关键方向之一。

image.png

谷歌推进多语言AI战略,目标覆盖300种语言

image.png

谷歌近期公布了其多语言AI新战略,核心目标是让全球每一种语言都能被AI听见和理解。目前其技术已支持超过300种语言,覆盖全球约86%的人口。其中,实时口语翻译功能可在70种语言间无缝切换,且延迟控制在可接受范围内。

image.png

特别值得注意的是谷歌的“1,000种语言计划”。该项目聚焦低资源语种——即那些缺乏大规模文本或语音数据的语言,如部分非洲或南太平洋岛国语言。谷歌通过与当地社区合作,收集开源语音数据,并开发轻量级模型来适配这些语言。同时,他们在无障碍设计上也做了优化,比如为听障用户提供更精准的语音转文字服务。

image.png

这一战略不仅是技术展示,也带有明显的生态意图。随着AI助手在全球普及,谁能更好地支持本地语言,谁就更可能赢得区域市场。

中文互联网基础语料4.0发布,120GB高质量数据上线

由中央网信办指导、多家行业单位联合推进的“中文互联网基础语料4.0”项目正式发布。此次上线的数据总量达120GB,全部经过清洗、去重和可信度评估,主要用于大模型训练。

与早期版本相比,4.0版本更强调数据的多样性和权威性。除了常规网页内容,还纳入了学术论文、政府公报、行业标准等高质量文本。项目组表示,这批语料将优先向国内合规的大模型研发机构开放,旨在为产业提供更可靠的基础数据支撑。

不过也有业内人士指出,单纯增加数据量并不足以解决模型幻觉或偏见问题,关键在于数据的标注质量和使用方式。未来是否会有配套的评估机制,仍有待观察。

OpenAI被曝人工审核用户聊天记录,隐私争议再起

据媒体报道,OpenAI内部存在一个名为“Lily项目”的人工审核机制。该项目安排审核员查阅ChatGPT用户的聊天记录,目的是评估模型输出质量。然而,这些记录中可能包含用户的个人信息、敏感对话甚至私密内容。

问题在于,OpenAI并未在用户协议中明确告知聊天内容可能被人工审阅。尽管公司声称审核员需签署保密协议,且数据会做脱敏处理,但实际操作中是否存在漏洞尚不清楚。此前已有类似案例——某语音助手公司的承包商曾泄露用户录音。

这一事件再次引发对AI服务隐私边界的讨论。当用户以为自己在和机器对话时,背后是否有人在看?平台是否有义务提前说明?这些问题或许需要更透明的规则来解答。

Claude升级中小企业版,打通27个主流商业软件

Anthropic对其面向中小企业的Claude版本进行了重大更新,推出了43项预设工作流,并与27个主流商业软件实现深度集成。这些工作流覆盖销售、客服、财务、人力资源等多个场景。例如,销售团队可以一键从CRM中提取客户信息,生成个性化跟进邮件;客服人员则能自动从知识库调取解决方案,缩短响应时间。

集成的软件包括Slack、Salesforce、Zendesk、QuickBooks等常用工具。Claude能在这些应用之间传递数据,形成闭环操作。比如当Zendesk收到新工单,Claude可自动分析问题类型,分配给对应负责人,并在Slack中通知团队。

安全方面,Anthropic强调所有数据传输均采用端到端加密,且企业可自主控制数据留存策略。不过,对于预算有限的小公司来说,这类高级功能是否值得付费,仍是现实考量。

Google推出Gemini 3.8 Live,实现“边说边想”交互

Google最新发布的Gemini 3.8 Live在语音交互上迈出关键一步。传统语音助手往往需要等用户说完一整句话才开始处理,而Gemini 3.8 Live能在语音流持续输入的过程中同步进行深度推理。这意味着它可以在你说完问题前就开始组织答案,大幅降低响应延迟。

其Extended Thinking版本更进一步,支持“边说边想”模式。当面对复杂数理推导或需要多步验证的任务时,模型会在后台持续思考,即使用户暂停说话也不会中断推理过程。实测显示,在实时调试代码错误或解答多条件逻辑题时,这种能力显著提升了效率。

Google表示,新一代Live系列模型已在Pixel手机和Workspace套件中逐步部署。未来这类低延迟、高智力的语音交互可能会成为智能设备的标准配置。