千问推Qwen3.8-Omni-Flash,智谱发布GLM-5.3-FlashX,谷歌Gemini4Pro开测

0 阅读

千问上线 Qwen3.8-Omni-Flash:1M上下文,多模态能力再升级

阿里云千问团队发布了新一代全模态模型 Qwen3.8-Omni-Flash。这个版本最引人注目的变化是支持高达100万(1M)token的上下文长度,同时能处理文本、图像、音频和视频输入。在官方公布的30项基准评测中,该模型平均性能提升超过26%,尤其在音视频理解任务上表现接近谷歌的Gemini3.8 Flash。

image.png

除了能力增强,API调用成本也大幅下调。音频输入处理价格降低了98%,音视频混合输入更是便宜了93%。这意味着开发者可以用更低的成本构建复杂的多模态应用,比如长视频摘要、跨模态检索或实时会议记录系统。千问团队还同步开源了配套工具链,方便用户搭建端到端的工作流。

image.png

值得注意的是,这次更新并非简单堆参数,而是通过架构优化实现效率与性能的平衡。例如,在保持高吞吐的同时,推理延迟控制在可接受范围内,适合对响应速度有要求的在线服务。

image.png

智谱推出 GLM-5.3-FlashX:速度拉满,性价比仍是王牌

image.png

智谱AI在BigModel平台上推出了GLM-5.3-FlashX。这款模型主打一个“快”字——最高输出速度达到200 tokens每秒。对于需要高并发响应的企业级应用来说,这相当于把生成瓶颈进一步向后推。

智谱一直强调“智能、价格、速度”三位一体的策略。GLM-5.3-FlashX在维持原有推理能力和亲民定价的基础上,重点优化了生成效率。这意味着同样的硬件资源下,单台服务器能服务更多用户,或者在相同负载下降低延迟。

从实际场景看,这种提速对客服对话、实时内容生成、批量数据处理等高吞吐需求特别有用。比如电商平台的自动回复系统,原本每秒处理50个请求,现在可能轻松翻倍。智谱没有透露具体技术细节,但业内推测可能采用了更激进的KV缓存压缩或动态批处理策略。

谷歌 Gemini4Pro 开测:SVG 生图能力让人眼前一亮

谷歌正在以“gemini-3.8-flash”的名义在多个基准平台测试其下一代旗舰模型 Gemini4Pro(内部代号 Argon)。虽然名字里带“3.8”,但多方线索表明这其实是 Gemini 4 系列的先行版本。

测试中最惊艳的部分是 SVG(可缩放矢量图形)生成能力。Gemini4Pro 能准确理解复杂几何关系,比如嵌套结构、对称布局或多层路径组合,并输出符合规范的代码。有网友上传了一张手绘草图,模型不仅还原了基本形状,还自动优化了锚点分布和路径闭合逻辑。

目前测试版可能还不是最终形态。有开发者指出,某些边缘案例仍会出错,比如处理非标准字体或渐变填充时。但整体来看,谷歌在结构化图形生成上的进展确实领先。如果正式版如期发布,设计工具、教育软件甚至工程制图领域都可能迎来新玩法。

苹果 AI 服务器细节浮出水面:自研芯片 + NVLink Fusion

苹果正悄悄重返服务器市场,计划推出面向企业AI训练和推理的专用服务器。据供应链消息,该项目代号为 Baltra,将搭载苹果自研的 M8 Ultra 芯片,并采用台积电3纳米N3E工艺制造。

更关键的是,苹果正在评估是否引入英伟达的 NVLink Fusion 技术。这项技术允许不同架构的芯片(比如苹果的M系列和英伟达GPU)通过高速互连共享内存,从而绕过传统PCIe带宽限制。如果成真,这将是苹果罕见地在核心硬件上依赖外部方案。

不过也有分析师认为,苹果可能只是短期过渡。长期来看,公司更倾向于完全自主的AI基础设施,包括芯片、互联和软件栈。Baltra项目或许是为了加速Apple Intelligence的落地,同时为未来自研AI芯片争取时间。

特斯拉推送新版软件:豆包语音助手覆盖更多车型

特斯拉发布了2026.26.200.11版本车载系统更新,最大亮点是将豆包大模型驱动的语音助手扩展到Model 3 Highland和Model Y后驱版等更多车型。此前该功能仅限高配车型。

除了语音交互,本次更新还包含十余项功能改进。宠物模式新增温度区间自定义;盲点警报在变道时会结合导航路线预判风险;行车记录仪支持自动标记急刹或碰撞片段;家长控制功能则允许远程限制车辆最高速度或禁用部分娱乐应用。

安全方面,修复了三个中高危漏洞,涉及蓝牙配对和USB媒体解析模块。有趣的是,Apple Music操作逻辑也做了调整——现在说“下一首”会跳过当前播放列表末尾的广告曲目,而不是机械执行指令。

钉钉创始人陈航转战百望股份:年薪10万的非执行董事

前钉钉CEO陈航近日出任百望股份非执行董事,年薪仅10万元。这一数字远低于其在阿里系的薪酬水平,明显带有象征性质。但他的加入对百望意义不小。

百望股份专注于企业财税数字化,客户包括大量央企和上市公司。随着AI在发票识别、税务合规、财务分析等场景渗透,公司急需既懂企业服务又熟悉大模型落地的人才。陈航在钉钉期间主导了多项B端AI功能开发,比如智能报销和合同审查,经验高度匹配。

虽然不参与日常管理,但作为董事会成员,他可能在产品战略和生态合作上提供关键建议。考虑到阿里与百望在电子发票领域已有合作,这次任职或许也是双方深化协同的信号。

腾讯内测 Chatterfly:语音转文字,数据只留本地

腾讯低调启动了AI语音助手 Chatterfly 的内测。这款工具主打“开口即成稿”,能在会议、访谈、课堂等场景实时转写语音,并自动整理成结构化文本。

与多数云端方案不同,Chatterfly 强调本地化处理。所有语音转写记录和原始录音文件都保存在用户电脑上,不会上传服务器。这对处理敏感信息的用户(如律师、医生或企业高管)是个重要卖点。

目前内置6种场景Skill,包括会议纪要、工作汇报、采访提纲等。系统还能持续学习用户的术语习惯——比如你总把“KPI”读作“key performance indicator”,它后续就会按此转写。不过内测名额有限,主要面向腾讯文档和企业微信的深度用户。

人形机器人 Booster K1 探索版开售:38999元面向开发者

加速进化公司推出的 Booster K1 探索版人形机器人已在京东上架,标价38999元。这款产品定位明确:不是消费玩具,而是给开发者用的具身智能实验平台。

机身高约95厘米,重19.5公斤,采用轻量化合金框架。头部配备双目深度相机和环形麦克风阵列,能实现精准的空间感知和声源定位。底层搭载豆包大模型,支持自然语言对话和任务分解,比如你说“把红色积木放到蓝色盒子左边”,它能理解颜色、位置和动作关系。

开放性是最大优势。官方提供完整的API文档和SDK,支持Python和ROS接入。OTA升级机制确保后续能追加新功能,比如最近就推送了手势识别模块。虽然离通用家务还有距离,但对研究运动控制、人机交互或AI决策的团队来说,这个价位提供了难得的实体载体。