微信开源WeKnora知识库框架,ChatGPT插件登陆Word,阶跃星辰推Step5Preview

0 阅读

微信AI开源WeKnora:知识库能“动手”了

微信AI团队最近开源了知识管理框架 WeKnora,当前版本为 0.8.0。这个项目的目标很实在:让知识库不只是被动回答问题,还能主动“做事”。传统知识库往往止步于检索,而 WeKnora 想打通从文档解析到安全执行的完整链路。

它首先用 anydoc 模块处理各种格式的原始文档——PDF、Word、网页甚至扫描件都能导入,自动提取结构化内容。接着通过 GraphRAG 技术,把零散信息组织成知识图谱,明确实体之间的关系。这样一来,回答“张三负责哪个项目”这类关联性问题就更准了。

最关键的是 Skill Sandbox Runtime。系统能把知识封装成可执行的“技能”,比如“查询某客户合同到期日”或“生成周报模板”,并在隔离沙箱中运行,确保不会误操作真实系统。执行结果可验证、可追溯,形成闭环。整个流程覆盖了解析、组织、检索、执行和记忆五个环节,算是目前少有的端到端知识操作系统尝试。

ChatGPT正式入驻Word,免费用户也能用

OpenAI 推出了官方 ChatGPT Word 插件,全球所有账号均可使用,包括免费用户。这意味着你在写文档时,可以直接调用 ChatGPT 来整理会议笔记、生成摘要、调整语气,甚至润色段落。

不过功能有分层:免费用户能用基础写作辅助,而 Plus 和企业用户则可解锁高级能力,比如引用文档上下文生成内容。值得注意的是,该插件与 Codex 等工具共享 API 额度,高频使用者需留意配额消耗。

现在 Word 里已经挤进了三套主流 AI:微软自家的 Copilot、Anthropic 的 Claude,再加上 OpenAI 的 ChatGPT。三家在同一个文档界面里“同台厮杀”,用户切换成本极低,AI 的调用门槛被进一步拉平。对开发者来说,这也意味着办公场景的 AI 接入标准正在快速统一。

阶跃星辰发布Step5Preview,成本大降

阶跃星辰推出了新一代基座模型 Step5Preview,重点优化 AI 编程、软件工程、金融分析等专业场景下的任务表现。据官方数据,该模型在 AA 综合智能指数中已进入全球开源模型前三。

最引人注目的是成本控制:单次任务费用仅为 Anthropic 最新旗舰 Claude Opus5 的 1/8。模型采用稀疏 MoE(Mixture of Experts)架构,总参数量达 6000 亿,但每次推理仅激活约 270 亿参数,兼顾性能与效率。它还支持 100 万 token 的超长上下文,并原生融合文本与视觉输入能力,适合处理带图表的技术文档或财报。

该模型计划于 10 月 15 日正式开源,若如期发布,将成为开源社区中少有的高性价比多模态大模型选择。

智谱AI回应ZCode数据上传争议

智谱AI旗下代码助手 ZCode 近期因“代码库索引”功能引发用户担忧。有开发者发现,该功能默认开启后会将本地代码上传至云端用于生成知识库。尽管官方强调数据在生成 Wiki 后立即销毁、不留存,但默认上传机制仍引发信任危机。

对此,智谱AI已发布说明并致歉,确认漏洞已修复。更重要的是,他们宣布将开源 ZCode 客户端代码,并邀请第三方安全机构进行独立审查。这一举措意在重建开发者信任——毕竟在代码工具领域,数据隐私是底线。

B站上线AI无限竞技场,GPT-6暂居榜首

B站推出了“AI无限竞技场”测评榜单,汇集上百个大模型,在真实使用场景中比拼能力。与传统基准测试不同,这个榜单不设固定维度,而是由 UP 主自主命题——比如“用三国演义风格写特斯拉财报分析”或“模拟客服处理投诉”,更贴近实际应用。

首轮测试中,GPT-6 多次登顶,综合表现领先。这种由社区驱动的评测方式,或许能更真实地反映模型在复杂、模糊任务中的鲁棒性,也给中小模型提供了曝光机会。

千问推Qwen3.8-LiveTranslate,同传延迟降至2.3秒

通义千问发布了新一代同声传译模型 Qwen3.8-LiveTranslate。它在四个关键维度上做了升级:翻译质量、延迟、说话人识别和语音合成。

字均延迟从 2.8 秒压缩到 2.3 秒,接近人类同传水平。新模型支持实时说话人分离,多人交替发言时能准确区分每句话归属,并在合成语音时保留原说话人的音色特征。此外,原文与译文可同步显示在同一画面,方便用户边听边核对。

技术上,它采用 Hybrid MoE 架构,分为 Thinker(理解)和 Talker(生成)两个模块,在覆盖 14 个语向的多说话人评测集 Omnilingua-MSpeaker 上表现优异。目前支持 60 种语言,API 已上线千问平台。

SpaceXAI推Grok语音转写2.0,错误率减半

SpaceXAI(注:应为 xAI,埃隆·马斯克旗下团队)发布了 Grok Voice Transcribe 2.0。新版模型将语音转文本的错误率降低约 50%,但价格维持不变。

它已深度集成到特斯拉车机系统和客服电话场景中,支持说话人分离、精确时间戳等实用功能。在多个公开语音识别榜单上,其准确率排名第一。对于需要高精度转写的行业(如医疗记录、法庭听证),这类低成本高精度工具可能带来显著效率提升。

DeepSeek明确节假日计费规则

DeepSeek 公布了调休日与节假日的 API 计费细则:这些时段全天按低谷价计费。结合中秋国庆假期,开发者可享受连续十天的半价窗口。

同时,其新模型 V4.1 Flash 在性能上超越旗舰版 V4Pro,但价格更低。在空闲时段,输入输出成本极低,适合高并发、低延迟要求的应用场景。这对预算敏感的创业团队是个利好。

办公与开发场景成AI主战场

从本期动态看,AI 竞争正快速向具体场景下沉。无论是 Word 里的三巨头混战,还是 WeKnora 尝试打通知识执行闭环,都说明通用大模型已进入“落地深水区”。

开发者不再只关心参数规模,而是关注:能否安全执行?成本是否可控?是否适配工作流?像 Step5Preview 强调 Agentic 能力、ZCode 回应隐私质疑、Qwen 同传保留音色,都是对真实需求的回应。

image.png

未来几个月,随着更多模型开源和工具链完善,AI 在编程、办公、客服等领域的渗透速度可能会进一步加快。

image.png

image.png