OpenAI在最新一期Enterprise Signals里甩出一个数字:使用量最高的10%企业,人均产出的token数已经是中位水平企业的8.3倍,今年1月这个比例还只有2.6倍。配合这个数字,OpenAI讲了三个案例——做会计事务所agent的Basis把新员工入职从两小时压缩到30分钟,销售自动化公司Clay给每个客户账户配了常驻subagent,开发者工具公司Exa Labs用Codex自动巡逻代码生态、生成PR、跑测试。故事讲得漂亮:企业AI正在从“帮你写点东西”变成“替你把活干完”。
问题是,这套叙事里最关键的那个数字,经不起细看。
8.3倍量的是什么,不是什么
先说清楚口径。OpenAI所谓的“frontier firms”,是每个月按人均输出token数重新排名一次、取前10%的企业;“typical firms”则是45到55百分位区间的企业。这是一个每月动态重排的队列,不是同一批公司从1月追踪到现在的纵向对比。今天排进前10%的公司,未必是1月那批。
更关键的是,OpenAI自己在报告里承认,token数是一个“不完美的代理指标”,不等于生产力、不等于ROI、不等于任务完成率,也不等于产出质量。这句话很容易被读者划过去,但它几乎推翻了8.3倍的说服力。
agentic workflow本身就是多步骤、长任务,天然会比单轮问答产生更多token。OpenAI披露的另一个数字也印证了这点:截至今年6月,agentic用量已占企业客户Codex加ChatGPT合并输出token的64%。也就是说,8.3倍里有多少是“企业真的把更多重要工作交给了AI”,又有多少只是“workflow结构变了、单位任务本身就更耗token”,这份报告没有拆开算。
三个案例好看,但代表不了大多数
Basis、Clay、Exa的案例确实具体:入职时间从两小时缩到半小时,销售每晚省一小时收件箱整理,代码生态巡逻从人工变成自动PR。但这三家公司都是OpenAI自己挑出来、发在自己官方渠道上的,本质是精选的最佳实践样本,不是随机抽样。三个案例都只呈现了成功的那一面,没有一个字提到失败率或人工纠错成本。
独立的生产环境研究给出了完全不同的信号。一份覆盖306名从业者、26个领域的调研发现,可靠性是企业agent开发中排名第一的挑战,比任何单一采用率数字都更值得盯着。原因很直接:多步骤任务的成功率是复合衰减的。如果每一步的成功率是98%,十步任务的端到端成功率会掉到约82%;如果每一步只有95%,十步之后就只剩六成左右。demo里跑一次成功很容易,生产环境里天天跑、跑上千次,衰减才会显形。
- 风险.三个案例只展示成功结果,没有披露失败率和人工纠错成本,直接套用到自家部署可能高估回报。
三家平台,同一套自报叙事
这不只是OpenAI一家的问题。Microsoft的Work Trend Index说81%的企业领导者预计未来一年半会中度或深度整合agent,24%称已经全组织部署——这是执行意图,不是持续使用或正向ROI的证据。Anthropic在自己的报告里称80%的受访企业获得了“可衡量的经济回报”,但这也是企业自己填的问卷,没有第三方审计。OpenAI这边则是企业客户座位数突破七百万、ChatGPT Enterprise席位同比涨了约九倍。
三家公司用的指标各不相同:token量、整合意图、自报回报率、席位数。这些数字彼此不可比,却都被包装成同一个结论——“企业agent正在跃迁”。
三套自报指标,讲的是同一个故事,却谁也证明不了谁
对企业决策者来说,真正该盯的不是token涨了多少倍,也不是厂商问卷里的回报率,而是每次成功完成一项任务的实际成本——把人工纠错、重跑、审核的时间都算进去。Basis、Clay、Exa的经验值得参考:把workflow拆成可复用的技能、给agent持久化上下文、留出人工审核点,这些做法是对的方向。但方向对,不代表企业普遍已经跑通。8.3倍这个数字,更像是厂商挑着讲的开场白,不是行业已经交卷的成绩单。
- 建议.评估agent项目时,先问“失败一次要花多少人工纠错时间”,再看token或座位数涨了多少。
