6.85 分背后:一份央企 Agent 评测报告,和企业级 Agent 真正的胜负手
一份署名 IDC 的评测报告,让中国电信的 TeleAgent 成了"央企做 AI"的最新样本。但这份报告真正值得读的地方不在排名,而在于它和它的传播稿之间,藏着企业级 Agent 从 demo 走向生产环境时那道没人愿意明说的分水岭。
一、先把 PR 稿拆成事实
这次研究的起点是一篇公众号文章:量子位《起猛了,央企做的企业级通用Agent,排进了国内前三!》,讲 IDC 发布国内首份《中国企业级通用Agent产品技术评估》,中国电信 TeleAgent 排名第三。
这篇文章有明确的 PR 属性——文末附产品下载地址、引导"一键三连",且文中数据高于同日官方口径。所以本文的第一件事不是复述它,而是把它拆成可验证的事实。
1.1 交叉验证后站得住的部分
| 事实 | 验证情况 |
|---|---|
| IDC 确发布《中国企业级通用Agent产品技术评估》 | 属实。IDC 官网可查(文档号 CHC54893926),研究经理孙振亚 |
| 评测覆盖九大维度、11 款主流及开源产品、近百道非公开任务 | 属实。极客公园、大模型之家等多源一致 |
| 评测口径:统一模型、统一仿真工具、统一数据基线,"开箱即测试、无提示词优化、失败后不追加人工指令" | 属实。多源一致 |
| TeleAgent 综合 6.85 分、位列第三;第一名 7.30 分 | 属实。DoNews、每日经济新闻、极客公园、光明网一致 |
| 「任务表现」5 分最高档(其他产品普遍 3 分);「成本效率」4 分(普遍约 2 分) | 属实。多源一致 |
| 2026 年 7 月 WAIC 中国电信人工智能生态论坛正式发布 | 属实。新浪财经 |
| IDC 调研:48.5% 受访企业已进入通用 Agent 评估、试点或使用阶段 | 属实。报告通稿引用 |
也就是说,"IDC 报告真实存在、TeleAgent 综合第三、任务表现拿到满分档"这三件事是成立的。这已经比大多数厂商 PR 稿扎实。
1.2 但有一处口径,一周内出现了五个版本
原文说 TeleAgent"用户规模已经接近 120 万"。我把同一时段所有公开表述拉了出来:
| 时点 | 表述 | 来源 |
|---|---|---|
| 2026-08-13 | 累计用户 61.42 万 | 搜狐(媒体开放日前) |
| 2026-09-16 | 注册用户破 100 万 | 每日经济新闻(天翼 AI 媒体开放日现场) |
| 2026-09-16 | 注册用户突破 110 万 | 大模型之家、极客公园(同批通稿) |
| 2026-09-16 | 注册用户已突破 118 万 | DoNews(同批通稿) |
| 2026-09-16 | 接近 120 万 | 量子位(原文) |
同一天、同一场媒体开放日、同一个产品,公开数字从 100 万一路漂到 120 万。
这不是"谁在造假"的问题,而是一个很典型的传播现象:厂商在开放日给出一个保守的官方口径(破 100 万),各渠道拿到通稿素材后各自加码,越靠后的传播环节数字越"好看"。跨过 100 万这个整数关口后,"破百万"的新闻价值已经兑现,剩下的 10 万、18 万、20 万,是纯粹的修辞。
同类现象还出现在 Skill 数量上:对外通稿说 5 万(大模型之家)/ 4 万余个(每经),而原文引用的内部数据是"Skill 广场累计上架 5.6 万个技能、被添加近 200 万次"。这三个数字并不矛盾——它们分别对应"对外可用的技能"和"内部广场的历史上架总量",但通稿混用时不会告诉你这个区别。
一条可复用的经验:读厂商数据时,先问三个问题——口径是什么(注册/活跃/累计)、时点是什么、谁在说(官方/通稿/转载)。三个答案里有一个缺失,数字的可信度就要打对折。
1.3 原文中属于"厂商自述"、无第三方验证的指标
这些数字在原文里被当作结论使用,但来源都是厂商自己:
- 上下文窗口突破 400K、核心内核约 3 万行自研 Go 代码
- ModelRouter 智能路由把推理成本降低约 40%、简单任务响应 3–5 秒、路由延迟低于 10ms
- 安全评测通过率:信通院内部评测 98.2%、与外部厂商联合 28 个场景 336 个用例通过率 99.7%
- "日均 Token 消耗优于同类产品"(IDC 稿中的表述,但未给具体数值)
这些不是错误,而是在当前阶段无法被独立验证的单一信源信息。按"真实第一"的原则,引用时必须标注来源是厂商自述。
二、6.85 分,到底测的是什么
这是全文最关键的一节。因为如果只记住"第三名",你等于什么都没读到。
2.1 一套刻意反"应试"的评测
IDC 这次的设计有几个细节值得单独拎出来:
- 统一模型:所有参评产品在同一个基座模型上跑
- 统一仿真工具 + 统一 MCP 仿真环境:工具调用能力在同一个仿真环境里比
- 近百道非公开任务:题目不公开,无法针对性优化
- "开箱即测试、无提示词优化、失败后不追加人工指令":不允许运营团队在场外救场
这套规则针对的正是过去两年 Agent 评测的一大顽疾——分数可以被"调"出来。提示词工程、人工追加指令、针对公开 benchmark 的定向优化,都能把 demo 成绩抬得很高,但搬到真实办公环境里一文不值。
IDC 用"统一模型"这一条,把所有产品拉到了同一起跑线,也等于宣告:这次不测模型,只测模型外面那套系统。
2.2 九维度与分数结构
评测维度包括:任务表现、成本效率、交互体验、多智能体编排、记忆与工作空间、可观测、安全可控、工具与技能、生态与开放性。
TeleAgent 的得分结构如下:
| 维度 | TeleAgent | 参评产品普遍水平 |
|---|---|---|
| 任务表现 | 5 分(最高档) | 3 分 |
| 成本效率 | 4 分 | 约 2 分 |
| 交互体验 / 多智能体编排 / 记忆与工作空间 / 可观测 / 安全可控 | 均高于普遍水平 | — |
| 综合 | 6.85 分 | 第一名 7.30 分 |
几个值得注意的细节:
- 综合差距极小:与第一名差 0.45 分;在"常规任务"上只差 0.04 分。这说明在目标明确、路径确定的日常办公任务上,头部产品的差距已经被抹平。
- 差距在"复杂任务"里:常规任务几乎打平,总分却差 0.45——意味着差异集中爆发在长链路、多步骤、易出错的复杂任务上。
- 成本效率的分差最悬殊:4 分 vs 普遍 2 分,这是相对优势最大的一项。
- 分制不透明:九维度各自的权重、如何加权成 6.85 分,报告未公开。所以"6.85"这个数字本身不适合做精确的跨产品比较,只能看相对位置和分档。
2.3 报告里那句最值钱的话
IDC 在报告中的一句结论,比所有分数都重要:
"Agent Harness 能力决定了各家产品的任务表现情况。"
以及:
"复杂长链路任务的完成情况,尤其在上下文溢出和过程异常时任务能否继续顺利完成,相关 Harness 工程的设计起到决定性作用。"
Agent Harness 指的是围绕大模型搭起来的一整套执行系统:上下文管理、工具调度、任务状态管理、异常处理、结果核验、执行环境控制。
这解释了一个现象——为什么"统一模型"之后,各家还能拉开 0.45 分的差距,而且差距全在复杂任务上。因为短任务里,模型理解对了就做完了;一旦任务拉长到几十步、几十次工具调用,决定成败的就不再是模型智力,而是这套系统的工程成熟度:
- 上下文堆到接近上限时,是压缩、是剪枝,还是直接崩掉
- 工具调用超时/报错时,是重试、换路径、恢复进度,还是从头再来
- 权限不足时,是越权、合理停止,还是编造一个结果
TeleAgent 在这条链路上的动作是:对低价值旧工具输出做轻量剪枝,上下文仍过长时交给压缩模型处理,并实时监测窗口占用、触发上限前先压缩;跨会话场景用长期记忆(autoDream)定期整理并合并记忆。这些恰好都是 Harness 层面的工程动作,而不是模型层面的能力。
这就是本次评测的真正结论:企业级 Agent 的竞争已经换赛道了,从"谁的模型强"换成了"谁的执行系统稳"。
三、三个公关稿集体回避的盲区
一份厂商 PR 稿最有价值的部分,往往不是它说了什么,而是它没说什么。
盲区一:前两名是谁?11 款参评产品是哪些?
所有通稿(量子位、DoNews、极客公园、大模型之家、光明网、新浪财经)统一只表述"位列第三",第一名(7.30 分)和第二名的身份完全没有披露,11 款参评产品名单也没有任何一家公开。
这是本次传播中最关键的沉默。原因不难推测:
- 对厂商而言,"央企排进前三"是一个足够漂亮的标题,而"第三名,第一是某互联网大厂"则会削弱叙事。
- 但反过来看,这个缺口恰恰是读者最需要的信息。因为如果前两名是阿里、字节或腾讯的办公 Agent,那么"央企跑赢互联网大厂"的隐含暗示就不成立,"央企也能做出第一梯队产品"才是准确表述。
结论:不要把"第三名"读成"央企击败了大厂"。它更准确的解读是"央企进入了第一梯队"。 这两者的差别很大。
盲区二:模型与工程的叙事错位
通稿里有两条并行的叙事,但它们在逻辑上互相削弱:
- 叙事 A(评测):IDC 用统一模型评测,证明 Agent Harness 决定任务表现,工程能力是关键。
- 叙事 B(卖点):TeleAgent 依托"自研星辰大模型 + 国产智算底座","全栈国产化"是核心护城河。
如果评测统一了模型,那么这次高分证明的是工程能力,而不是模型能力。而全栈自研的价值在评测里恰恰是无法体现的。
这不代表"国产底座"不重要——对企业客户(尤其是政企),自主可控是硬门槛。但要说清楚:它是一张准入证,不是一个得分项。 把"安全可控、自主可控"当成产品竞争力的证明,是很多国产 AI 产品通稿的通病。
顺带补一个客观事实(这部分是有据可查的):星辰大模型体系确实成绩不俗——它是国内首个全国产、全尺寸、全开源的语义基础大模型,入选 2025 年度央企十大国之重器,基于全国产万卡集群和国产训练框架完成预训练,Hugging Face 累计下载量破百万。这是真实的工程成绩,但它与"TeleAgent 在 IDC 拿第三"之间,不是因果关系。
盲区三:IDC 这类"厂商评估"的边界
需要给读者一个方法论提醒:IDC 的此类技术评估,与独立的第三方盲测有本质区别。
- 这类报告通常依赖厂商配合:产品问卷、现场演示、环境对接
- 参评往往是厂商主动报名而非市场招募
- 报告的主要受众是企业选型方和厂商市场部门,具有明确的商业属性
这不是说报告没有价值——恰恰相反,它设计的评测方法论(九维度 + 反应试规则)本身很有参考价值。但它的结论应当被理解为**"方向性参考"**,而不是"行业客观排名"。
如何正确使用这类报告:看维度定义和方法论 → 拿它当自检清单 → 在自己的真实业务场景里做 POC。不要拿综合分直接做采购决策。
四、TeleAgent 的非常规路径:把公司变成试验场
抛开排名,TeleAgent 这个案例真正有研究价值的,是它的组织方式和验证环境——这部分在原文里有不少一手信息,且逻辑自洽。
4.1 不是追风口,是攒了一年多的平台
从时间线看,TeleAgent 并非 2026 年才临时立项:
| 时间 | 动作 |
|---|---|
| 2024 年底 | 开始建设星辰智能体平台 |
| 2025 年 4 月 | 平台被确定为集团智能体基础设施 |
| 2025 年 8 月 | 推出星辰超级智能体网页版,尝试自主式 Agent |
| 2026 年 4 月 | TeleAgent 桌面端进入公司内部试用 |
| 2026 年 7 月 | WAIC 中国电信人工智能生态论坛正式发布 |
从平台到产品,积累了约一年半。 这与"看到 Agent 风口快速追出来"的直觉判断不同。
4.2 一个"内部用户池即测试场"的飞轮
这是整个案例里最有意思的部分,也是它相对互联网创业公司最难被复制的优势:
- 中国电信本身拥有大量员工,内部业务覆盖办公、网络、政企、云、号卡、宽带等多个条线
- 内部 Skill 广场累计上架 5.6 万个技能、被添加近 200 万次,参与开发贡献的员工达 2 万人
- 员工自建的技能非常"接地气":围绕宽带、号卡等主营业务做 Skill,用 Agent 生成内部格式的 PPT,一线员工直接拿去做摄像头巡检和电表识别
这意味着,TeleAgent 每天面对的是真实需求,而不是为了演示效果提前设计好的任务。原文有一句话说得很准:"内部既成了早期最大的用户池,也成了一个相当复杂的企业 Agent 测试场。"
对比一下三家办公 Agent 的实测结论(后面会展开):横评中被诟病的三个问题分别是数据口径偏差、事实性错误、信源质量——这三类问题,恰好只有在真实、高频、有真实业务后果的场景里才会被暴露和修正。内部 2 万人、200 万次调用构成的反馈回路,就是用来磨这三类问题的。
4.3 央企体制 × 互联网打法的混合体
原文披露的组织细节值得记录:
- 中电信人工智能公司约 1200 多人,其中九成以上来自社会化招聘,吸收了头部互联网公司和 AI 企业的研发人才,平均年龄 30 岁出头
- 产品团队给核心骨干留出了较大的自主招聘和技术探索空间
- 内部对早期产品的要求不是先算收入,而是先要用户口碑
- 组织方式上,把资源决策集中起来,让熟悉电信业务的人和有互联网产品经验的人在一线直接配合
同时,央企身份带来两个真实约束与优势:
约束:安全必须前置。桌面端 4 月已可内部试用,但团队又花了两个月做安全测试和能力优化,直到 7 月才正式推出。对互联网产品这是不可想象的节奏。
优势:验证资源。产品已完成 Windows、macOS、Linux(银河麒麟、统信 UOS 官方兼容性认证)多终端适配,这是政企采购的硬性门槛;采用本地驻留架构,数据完全存储在本地硬盘、无上传下载流程——这条对财务、商业机密、个人隐私类场景的吸引力,是云端产品难以对标的。
这构成了 TeleAgent 的差异化定位:不去和办公三强抢"最聪明的助理",而是占住"数据不出机 + 信创适配 + 央企合规"这个生态位。 结合它"合同审查、采购查询、合规审批"等政企预置技能,这个定位是清晰的。
五、把 TeleAgent 放回牌桌:真正的对手是谁
5.1 办公 Agent 三强已经就位
2026 年夏天,三家互联网巨头把办公 Agent 集中收口:
| 产品 | 归属 | 关键节点 | 基因(36氪实测归纳) |
|---|---|---|---|
| WorkBuddy | 腾讯 | 先发 | "产品效率"——快、全、自动化 |
| 千问办公 | 阿里 | 8 月 3 日公测 | "行业与政企"——最懂专业视角 |
| 豆包工作 | 字节 | 8 月 25 日发布 | "内容与体验"——视觉精致、场景化强 |
一份基于真实任务的横评(以"收集某公司最新新闻并输出海报"为统一题目)暴露了三家的共同短板:
- WorkBuddy:信息覆盖最广、交付最完整(有可归档 .md 文件),但数据口径出现偏差,需要人工二次核实
- 豆包工作:核实意识最强(先规划→再搜索→再核实→后输出),视觉交付最精致,但海报曾出现股票代码渲染错误,且无独立文件产出
- 千问办公:交互式确认机制降低返工,最贴合专业身份,但核心风险信息大量引用"股吧"这类非权威信源,并遗漏了重要正面事件
这三份"体检报告"很有价值:都强在流程与交付形态,都弱在事实可靠性。 而这正好印证了 IDC 的结论——真正的差距在长链路复杂任务里,在异常处理、结果核验、状态恢复这些不显眼的地方。
5.2 市场的盘子有多大
- 中国企业级 AI 智能体市场:2025 年 212 亿元 → 2026 年预计 449 亿元 → 2029 年有望突破 3320 亿元,年复合增长率约 107%
- 2026 年 7 月,AI 效率办公赛道月活跃用户 1.02 亿;办公赛道总使用次数同比增长 112.4%(QuestMobile)
- 政策推力:2026 年全国两会上,"智能体"首次写入国务院政府工作报告;"十五五"规划纲要提出深化拓展"人工智能+"
5.3 但企业落地的真实进度,远没有市场增速乐观
这里有两组需要对照起来看的数据,它们来自同一家机构,却常被混用:
| 口径 | 数据 | 含义 |
|---|---|---|
| 通用 Agent 评估/试点/使用 | 48.5% | 已经"碰过"Agent 的企业占比 |
| 处于了解评估和试点阶段 | 60% | 还没真正上生产 |
| 已纳入核心业务流 | 仅 18% | 真正进主流程的 |
"近半数企业在用 Agent"和"仅不到两成进了核心业务流",描述的是同一件事的两面。 前者是想象力,后者是现实。
IDC 为此提出了 COMPASS 模型(Collaboration / Orchestration / Monitoring / Perception / Analysis / Sedimentation / Scalability,七维),对应企业价值链上三层效率约束:
- 信息输入层(Perception):非标文档、手写单据、会议录音怎么变成结构化数据
- 信息处理层(Analysis / Orchestration / Monitoring / Collaboration):跨系统取数、动态编排、异常监控、跨部门协同
- 信息资产化层(Sedimentation / Scalability):把个人经验变成组织可复用资产,并支撑弹性扩展
值得注意的一个巧合:提出 COMPASS 模型的 IDC 研究经理孙振亚,也正是《中国企业级通用Agent产品技术评估》报告的研究经理。 也就是说,"评测九维度"和"落地七维"出自同一套研究框架的两面——一面用来给产品打分,一面用来帮企业找切入点。这个关联,通稿里没有人告诉你。
对企业选型方的实际含义:不要问"哪个 Agent 最强",要问"我这条业务流卡在 COMPASS 的哪一层"。卡在信息输入层,你需要的是多模态提取能力;卡在编排层,你需要的是跨系统工具调用与流程生成能力;卡在资产化层,你需要的是记忆与知识沉淀机制。先定位约束,再挑产品,能避开 80% 的选型陷阱。
六、可迁移的结论
6.1 Harness 工程的三个观察刻度
如果 IDC 那句"Agent Harness 决定任务表现"是对的,那么评估一个 Agent 产品时,应该盯的就不是模型参数,而是这三个地方:
刻度一:上下文溢出时的行为。 任务跑到第 50 步、上下文逼近上限时,它是压缩、剪枝,还是开始遗忘最初的需求?长任务失忆(requirement drift)是企业场景最难容忍的失败模式——用户交代了十条约束,跑到最后只剩三条还在生效。
刻度二:异常后的恢复方式。 工具报错、权限不足、环境变化时,它是重试、换路径、部分交付,还是直接崩溃/越权操作?IDC 在评测中明确把"面对模糊指令、工具异常、权限不足和环境变化时,能否恢复执行、交付部分结果或合理停止"纳入考核——"合理停止"也是合格表现,这一点常被忽略。
刻度三:结果的可核验性。 IDC 的做法是"任务跑完后继续核验系统状态和最终文件",而不只看 Agent 自称完成。同理,企业采购时要问的是:执行过程有没有留痕?能不能按任务/用户/部门做用量归因?结果能不能被独立复核?
6.2 给企业选型方的五个问题
- 是统一模型评测还是各用各的模型? 决定了你看到的是工程能力还是模型能力。
- 复杂任务的失败率是多少? 只看平均分没用,要看长链路任务的稳定性和失败后的行为。
- 成本能不能按部门和任务归因? 这是能否规模化的前提——试点阶段的成本不可持续,规模化后会被指数放大。
- 数据驻留在哪里? 本地驻留、私有化部署、云端,对应完全不同的合规边界。
- 技能(Skill)从哪来、谁维护、怎么审计? 技能是 Agent 的能力资产,也是新的供应链风险面。
6.3 三句话小结
第一,这份报告最有价值的不是"6.85 分排第三",而是它用统一模型的反应试设计,把行业竞争的焦点从模型拉到了工程系统上。 企业级 Agent 已经过了比"谁的模型聪明"的阶段,进入比"谁的执行系统稳"的阶段。
第二,央企做 AI 的真实优势不在模型,在验证环境。 2 万员工贡献 5.6 万个技能构成的内部用户池,是创业公司花钱也买不到的测试场。这套"内部先跑通、再对外输出"的路径,可能会成为政企 AI 产品的一条标准打法。
第三,读任何厂商评测稿,先做三件事:查信源性质、拆数据口径、找它没说的部分。 这篇稿子里的 120 万用户、400K 上下文、降本 40%,都需要用这三个动作过一遍。
附:主要信息来源
一手/官方
- IDC《中国企业级通用Agent产品技术评估》报告摘要(文档号 CHC54893926)— idc.com
- IDC《企业 Agent 如何落地?COMPASS 七维方法论与 MarketGlance 选型参考》
- 天翼 AI 开放平台 TeleAgent 产品页 — teleai.com.cn
- 每日经济新闻《中国电信星辰超级智能体 TeleAgent 注册用户破百万》(2026-09-16,媒体开放日现场)
交叉验证来源
- DoNews《IDC 发布 Agent 评估报告:中国电信 AI 全栈能力再获权威验证》(2026-09-16)
- 极客公园《TeleAgent 星辰超级智能体获 IDC 综合第三,任务表现达到满分档》
- 大模型之家《IDC 发布企业级通用 Agent 报告:TeleAgent 星辰超级智能体综合第三》
- 光明网科技、新浪财经同题报道(2026-09-17)
行业与竞品
- 36氪/中智观察《字节豆包工作、腾讯 WorkBuddy、阿里千问办公体验手记》(2026-08-26 时间截面)
- QuestMobile AI 效率办公赛道数据、财联社办公 Agent 三强报道
- 中国企业级 AI 智能体市场规模测算(2025 年 212 亿 → 2026E 449 亿 → 2029E 3320 亿)
站内延伸阅读
- 《控制流归谁,上下文给谁:Agent 工程的四条第一性原理》
- 《大模型能力提升路线图:从"堆参数"到训练全栈 + 外层程序》
- 《RSI vs 智能体自进化:同一个闭环,两种野心》
- 《当 1,200 个智能体自己建了留言板:OpenAI–Hugging Face 事件技术全解》
关于未公开项的处理:IDC 报告的第一名(7.30 分)与第二名身份、11 款参评产品名单,截至本文写作时(2026-09-17)在所有公开渠道均未披露。本文不做推测,仅标注事实缺口。
读者留言
COMMENTS 暂无还没有留言,来说第一句?