中国电信TeleAgent实测进IDC企业级通用Agent前三
IDC用近百道真实任务考Agent,TeleAgent冲进前三
以往大模型评测多依赖标准化Benchmark,比如数学、代码、常识问答等单项打分。但企业级通用Agent要面对的是真实办公环境里杂乱无章的任务流——写邮件、排日程、处理脏数据、从万字材料生成PPT,甚至跨天执行多步骤流程。

IDC这次没走老路。它设计了近百道非公开任务,直接测试Agent能不能把事情“办完”。不仅要看输出结果,还要核验系统状态、文件内容是否真的符合要求。比如一道题要求Agent处理3755行格式混乱的数据表,另一道则要从约3万字的会议纪要中提炼要点,自动生成11页结构清晰的PPT。

在这套严苛考法下,中国电信的TeleAgent常规任务得分3.49、复杂任务3.36,在九项能力维度中,“任务表现”拿到5分满分,“成本效率”则是所有参评产品中最高的。

值得注意的是,TeleAgent今年4月才在内部试用桌面端,7月V1.0正式对外发布,到9月用户已接近120万。一个央企出品的Agent,为何能在短时间内跑出这样的成绩?
模型只是基础,工程系统才是关键
IDC报告里提到一个概念:Agent Harness。简单说,就是围绕大模型搭建的一整套执行框架。模型负责理解与推理,但真正让任务跑下去的,是背后的工程链路。
TeleAgent的高分项,基本都能在这条链路上找到对应。
首先是上下文管理。Agent执行长任务时,对话历史、工具返回结果、打开的文档会不断塞进上下文。如果全堆着,Token很快爆掉;若压缩太狠,又可能把用户最初的要求给丢了。
TeleAgent的做法是分级处理:先对低价值的旧工具输出做轻量剪枝;若仍超限,则调用专用压缩模型处理整段内容。系统还会实时监测上下文长度,一旦接近窗口上限,自动压缩后再继续执行。目前其上下文窗口已突破400K。
但企业办公常跨天、跨项目,单次会话的记忆远远不够。于是团队又加了autoDream长期记忆模块。它会定期整理近期对话,将新信息与已有记忆合并,保留项目背景、用户习惯和偏好。第二天用户重新打开时,Agent能立刻接上昨天的进度,不用从头解释。
底层实现上,TeleAgent没直接套用开源Coding Agent框架。其核心内核包含约3万行自研Go代码,专门适配了Windows PowerShell、麒麟、统信等国产操作系统。因为做PPT、写周报、处理Excel,和在代码库里找Bug,本质是两套工作逻辑。
成本效率靠智能路由,安全靠隔离与权限控制
企业用Agent,绕不开“贵不贵”的问题。TeleAgent为此设计了一套ModelRouter系统。
每次请求进来,系统会根据模态、长度、关键词判断任务复杂度,再分配到轻量、均衡或旗舰三档模型。翻译、格式化这类简单任务走轻量模型;PPT生成、文档撰写用均衡档;深度研究、复杂方案才调旗舰模型。
这套路由机制让推理成本降低约40%。简单任务响应控制在3-5秒,路由延迟低于10ms。再加上PD分离、KV Cache复用和负载感知调度等优化,TeleAgent在成本效率维度拿下了评测最高分。
但更关键的是安全。当Agent能操作文件、调用系统、修改数据时,一次错误可能造成实际损失。
TeleAgent从设计初期就强调安全:所有Skill上线前需经过来源验证、病毒扫描和漏洞检测;短期记忆与长期记忆分开管理;文件读写被限制在指定工作目录;高危命令(如删除、格式化)会被监控拦截;代码和文件操作尽可能在隔离沙箱中完成。
正因如此,TeleAgent成为首批通过中国信通院智能体安全评测的产品之一。在中国电信研究院内部测试中,通过率达98.2%;与外部安全厂商联合进行的28个场景、336个测试用例里,通过率高达99.7%。
这些能力其实是环环相扣的:上下文和Harness决定任务能不能跑完,模型路由决定花多少钱,安全机制决定企业敢不敢真用。而这三点,恰恰是通用Agent从Demo走向日常办公必须跨过的门槛。
央企底子+互联网打法,催生快速迭代
很多人以为TeleAgent是追风口的产物,其实中国电信布局智能体已有一年多。
2024年底,集团启动星辰智能体平台建设;2025年4月,该平台被定为集团级基础设施;同年8月推出星辰超级智能体网页版,开始探索自主式Agent。随着技术演进,团队逐步将Coding增强、Skill体系和桌面环境整合进来,最终在2026年4月推出TeleAgent桌面端内测。
虽然出身央企,但TeleAgent的产品方法带着明显的互联网色彩。
负责开发的中电信人工智能公司有1200多人,九成以上来自社会化招聘,不少成员曾就职于头部互联网或AI企业,平均年龄仅30岁出头。公司给予核心团队较大自主权:方向未定时可先试错做体验,早期不强求收入,而是看重用户口碑。
组织方式也变了。过去央企做跨部门产品,常陷于冗长协同链条。TeleAgent团队则把资源决策集中,让懂电信业务的人和有产品经验的人直接在一线配合。
更重要的是,中国电信庞大的组织体量提供了天然试验场。集团内部员工众多,业务涵盖办公、网络、政企、云、号卡、宽带等,TeleAgent每天面对的都是真实需求,而非预设演示。
比如内部的Skill广场,目前已上架5.6万个技能,被添加近200万次,参与开发的员工达2万人。有人围绕宽带套餐制作自动查询Skill,有人用Agent生成符合内部模板的PPT,一线运维人员甚至拿它做摄像头巡检和电表识别。这些原本需要立项开发的小工具,现在由业务人员自己就能搞定。
这种“内部即市场”的模式,让产品在真实复杂环境中快速迭代。普通员工、专业岗位、系统权限、敏感数据——这些问题若在内部都跑不通,对外推广更难规模化。
企业Agent进入落地深水区
IDC今年4月的调研显示,48.5%的企业已进入通用Agent的评估、试点或使用阶段。其中96.9%的应用集中在办公自动化,流程自动化、知识管理和数据分析紧随其后。
这意味着市场正从“能不能做”转向“好不好用、安不安全、划不划算”。而中国电信恰好同时具备两套能力:一方面拥有云、算力、安全、政企客户和复杂业务场景;另一方面吸收了互联网产品的快速迭代、用户反馈和成本优化方法。
TeleAgent冲进IDC评测前三,不是偶然。它反映了一个趋势:运营商正在变成AI原生组织。中国电信早已不是传统意义上的通信服务商,而是一个Full of AI的智能体平台构建者。
目前TeleAgent桌面端已开放下载,官网地址为 https://www.teleai.com.cn/product/teleagent。对于正在评估企业Agent的公司来说,这个由央企打造、经受过百万级内部用户考验的产品,或许值得放进候选清单。