02 — Independent research
The Gains Are Real
效益是真的,这点有非厂商证据
如果只有厂商说有效,这一页的结论会是「无法判断」。但独立研究确实测到了效益,
而且用的是客观量测而非问卷。
客服人员的生产力提升,以每小时解决件数量测,不是自陈。
Method
某 Fortune 500 企业的 5,172 名客服人员,实地实验,客观计数。非厂商委托。
0.55→ 0.14
教育程度造成的落差(标准差)
AI 提升所有人的表现,但对教育程度较低者的提升幅度大得多,
使两群人之间的差距从 0.548 个标准差缩小到 0.139。
Method
随机对照实验,1,174 名 25–45 岁成人,NBER 工作论文 w34851。
跨写作、客服、软件开发、会计、法律与翻译的文献回顾则显示,任务完成时间缩短
15% 至 50% 以上,且对经验较少者的效益不成比例地大。
要注意的是:这些研究量的是特定任务的完成时间或吞吐量,
厂商数字讲的是每周省下的总时数。两者不是同一件事,
把它们并列比大小是误导。
03 — How it was measured
Self-Reported Time Is Unreliable
人对自己省下多少时间的判断并不可靠
这是整页最重要的一节。前面所有的厂商数字,
全部是自陈或以自陈为基础的建模——而自陈恰好是下面这项研究证明不可靠的测量方式。
同一批人,同一段工作。实际慢了 19%,事后却认为自己快了 20%——
认知与实际之间差了近 40 个百分点,而且方向是相反的。
Method
METR,2025 年 7 月。随机对照试验,16 名资深开发者、246 项成熟开源项目的真实任务,客观计时。
Limits
样本仅 16 人;领域是软件开发,不能直接外推到一般知识工作;
METR 自己已将此结果标示为历史数据,
并正在重新设计实验,理由是它不必然反映当前的工具与工作流。
这不否定 AI 的效益——第 02 节的客观量测已经证明效益存在。
它否定的是「问用户省下多少时间」这种测量方式,
而那正是第 01 节四组数字的来源。
05 — Questions
Common Questions
你可能想问
导入 Google Workspace AI 的投资报酬率是多少?
Forrester 于 2026 年 2 月发布、由 Google 委托的 TEI 研究报告三年期投资报酬率 416%、净现值 1.237 亿美元、回收期低于六个月。该数字建立在六位决策者、五家组织的访谈之上,并投射至一个 20,000 人的假想复合组织,因此它是一个财务模型而非一次量测。
员工每周实际能省下多少时间?
Forrester 的研究记载平均每位 Gemini 用户每周省下 3 小时,注意是用户而非全体员工。Google 的 Gemini at Work 调查则记载 105 分钟,样本为 18 家企业、3,200 余份问卷,数据汇整于 2024 年 7 月。两者都是自陈数字。
这些效益数据有独立第三方的证据吗?
有。一项针对某 Fortune 500 企业 5,172 名客服人员的实地实验,以每小时解决件数客观量测到生产力提升 15%,技能最低五分位者提升 36%。NBER 的随机对照实验(1,174 名成人)亦显示 AI 缩小教育程度造成的生产力落差,从 0.548 个标准差降至 0.139。这两项研究均非厂商委托。
为什么自陈的时间节省数字需要打折扣?
METR 于 2025 年 7 月发表的随机对照试验中,16 名资深开发者在 246 项真实任务上使用 AI 工具时实际慢了 19%,但事后自评认为快了 20%,认知与实际相差近 40 个百分点且方向相反。该研究样本小、领域限于软件开发,且 METR 已将结果标示为历史数据,但它足以说明以问卷询问用户省下多少时间并不可靠。
那企业该如何判断导入是否值得?
在自己的组织中量测,而且量测必须在导入之前设计好,否则导入后已无对照组可用。具体做法包括:挑出可客观计数的任务(件数、周期时间、返工率)、在任何人拿到工具之前先取基线、保留对照组或分批导入、并将自陈数字与客观数字分开记录——两者的落差本身就是重要信号。
06 — Measurement
Answer With Measurement
用量测回答,不要用演示文稿回答
把三节的结论放在一起:效益是真的,有客观量测支持;
但厂商公布的数字全部来自自陈,而自陈在唯一一项客观计时的试验里错得离谱。
所以那些数字不能用来预测你的组织会发生什么——
它们甚至不是为了那个目的而产生的。
能回答那个问题的只有一件事:在你自己的组织里量测。
而量测必须在导入之前就设计好——
导入之后才想量,你已经没有对照组了。
What that takes
-
挑出可客观计数的任务——件数、周期时间、返工率,而不是「感觉有没有比较快」
-
先取基线,在任何人拿到工具之前
-
留一组对照,或至少分批导入,让前后差异不是只跟季节性比
-
把自陈与客观数字分开记录——两者的落差本身就是最有价值的信号
这是我们提供的服务之一:在你导入 Workspace AI 之前,
协助你设计出一套导入后真的能拿来做决策的量测。
如果量测结果显示效益不如预期,那也是一个结论——而且比 416% 更值钱,因为它是你的。