ChatGPT Work实测:从对话到交付,OpenAI能否凭此逆转AI办公格局?
随着人工智能技术从“对话助手”向“任务执行者”演进,2026年下半年的AI办公市场迎来了关键的分水岭。OpenAI于7月9日同步发布了GPT-5.6模型、全新桌面应用以及核心产品ChatGPT Work,其官方定位非常明确:不再止步于生成文本,而是直接交付表格、文档、PPT乃至可分享的网站。这一动作被广泛视为对Anthropic旗下Claude Cowork的直接回应,毕竟后者在2026年初便确立了这一新品类的先发优势。为了探究这两款旗舰级AI办公工具的真实实力,我们选取了三个极具代表性的职场场景进行了盲测,旨在剥离营销光环,还原技术本质。

场景一:复杂信息整合与动态行程规划

在第一个测试场景中,我们要求两款AI为即将到来的世界人工智能大会(WAIC)制定一份“非平均用力”的会前攻略。核心诉求包括:自主查询大会信息、筛选高价值展位、规划每日路线,并生成可直接用于现场执行的计划表。

ChatGPT Work耗时约18分50秒,最终交付了一份具备交互功能的卡片式指南。其策略显得极具攻击性,明确列出“跳过清单”,如排队超过12分钟的表演或无负责人到场的展台,并设定了严格的10分钟展位停留标准及邀约话术。然而,在信息准确性上,ChatGPT出现了明显的遗漏,如完全忽略了张江片区的核心算力展区,且过早锁定“AI视频”主线,导致规划视野受限。尽管在追问调整时因额度耗尽出现过中断,但其最终仍完成了重排任务。
相比之下,Claude Cowork仅用时6分钟,交付了一份结构严谨的Markdown文档。其优势在于视野的全面性,覆盖了三地四馆,并包含了购票渠道、社交活动建议等实用细节。虽然其提供的方案更为通用,缺乏ChatGPT那种极具操作性的“排雷”策略,但在信息完整度上表现更佳。
综合对比,ChatGPT Work在“交付物”的可操作性上略胜一筹,其生成的交互式界面更符合现代职场人对数字化工具的审美,尽管在信息检索的全面性上仍有瑕疵。
场景二:深度人物侧写与多媒体内容生成
第二个测试旨在考察AI在处理海量非结构化数据并转化为特定风格内容时的能力。我们以公众人物罗永浩为对象,要求AI基于公开资料编写一份《罗永浩使用指南》,并最终制作成美观的网页。

ChatGPT Work生成的内容呈现出浓厚的商业特稿风格,排版克制,逻辑严密。它针对产品、工程、公关等不同岗位提供了差异化的沟通建议,并标注了资料来源的可信度。在网页化呈现上,ChatGPT采用了类似纸质手册的设计语言,支持打印样式设置,甚至实现了本地进度存储和一键复制汇报模板的功能。更重要的是,它利用新推出的Sites功能,生成了公开的分享链接,实现了从内容创作到分发的闭环。

Claude Cowork则偏向新媒体爆款风格,运用圆角卡片、Emoji图标及时间轴设计,阅读体验流畅。虽然视觉吸引力强,但模板感较重,缺乏针对特定受众的深度定制感。在功能完备性上,Claude未提供如ChatGPT那样的打印优化和本地状态保存功能。
这一轮测试中,ChatGPT Work展现出了更强的“成品意识”。它不仅仅是在生成文字,而是在构建一个包含交互、分享、打印等多维度功能的产品包,这更符合企业级用户对“即拿即用”工具的期待。
场景三:竞品互调与自我反思能力
第三个场景极具挑战性:要求两款AI互相调研,制作一份对比ChatGPT Work与Claude Cowork的PPT。此举旨在观察AI在处理元认知任务时的客观性及专业度。

ChatGPT Work生成了一份16页的PPT,结构类似专业咨询报告。其标题直接提炼结论,并在显眼位置指出“Work上线仅1天,评价基于早期信号”,体现了严谨的审慎态度。它还坦诚地将“与Codex共用额度”列为自身短板,建议生产型试点优先使用Cowork。

Claude Cowork则交付了一份12页的研究报告,侧重于数据罗列,如定价、市场份额及企业采用率。有趣的是,两者均未出现明显的“护短”现象。Claude不仅承认Cowork在初期版本中曾发生误删用户文件及演示注入攻击的事故,还客观记录了竞争对手的优势。
尽管两份PPT在视觉呈现上均略显密集,难以直接投屏演示,但在内容的深度和客观性上,ChatGPT Work通过更清晰的结构梳理和更深刻的自我剖析,展现了更接近专业分析师的思维模式。
深度解析:AI办公从“聊天”到“交付”的范式转移
综合三轮实测,可以清晰地观察到当前AI办公领域的两个核心趋势。首先,交付完成度的竞争已成为胜负手。GPT-5.6 Sol结合ChatGPT Work,虽然在Token消耗和运行速度上不占优势,但在最终产物的完整性、多模态整合(如图文排版、网页生成)以及独特功能(如Sites)上,展现了压倒性的工程化能力。对于追求“一键交付”的企业用户而言,这种能力直接转化为生产力。

其次,工具整合与用户体验的矛盾日益凸显。OpenAI将Chat、Work、Codex整合进同一应用,虽然强化了工作流的连贯性,但也对习惯传统聊天界面的老用户造成了体验割裂。旧应用“ChatGPT Classic”的边缘化以及额度消耗过快的问题,正在引发社区的不满。相比之下,Claude Cowork在桌面端的权限控制和文件处理上依然保持着其一贯的稳健风格,尤其适合处理本地复杂文件包的整理与转换。

从市场战略来看,这已不再是单纯的大语言模型能力比拼,而是“办公入口”生态的争夺。OpenAI试图通过降低Agent的使用门槛,将普通用户的日常交互转化为工作引擎;Anthropic则聚焦于构建一个受控、安全的桌面工作空间。尽管双方在功能上日益趋同,但OpenAI凭借其在生成内容的多样性及分发能力上的积累,在2026年的这场角逐中确实实现了有力追赶。

然而,必须清醒地认识到,当前的AI Agent在真实职业场景下的任务完成率虽已接近九成,但在处理杂乱无章的真实文件时,准确率仍不足一半。这意味着,AI员工目前仍处于“试用期”,人类监督者无法完全脱手。对于用户而言,选择ChatGPT Work还是Claude Cowork,不应基于品牌偏好,而应基于具体的任务属性:若需从信息到成品的快速转化,ChatGPT Work是更优解;若侧重本地数据的深度整理与安全处理,Claude Cowork则更为稳妥。

OpenAI此次的产品迭代,标志着AI从“聊天机器人”向“超级员工”角色转变的关键一步。虽然痛点依然存在,但技术进化的速度已不可逆转。对于真正打算引入AI协作的企业和个人来说,这仅仅是高质量自动化工作流时代的开端。