Google Workspace — Adoption

Manual versus Automated 手动 vs 自动:效率革命

厂商公布的导入效益数字都很漂亮。这一页要处理的不是它们是真是假, 而是它们测的是什么,以及那个测法能不能预测你的组织会发生什么。

01 — Vendor figures

What the Vendors Claim 手动与自动之间,他们说差了多少

以下四组是被引用最广的数据。我们逐一回到原始出处核对过, 数字全部属实——但广为流传的转述版本有数处与原文不符,一并在下面标明。

每一组都附上调查方法、样本规模与数据年份。看数字之前先看这三项,是这一页想示范的事。

416%

三年期投资报酬率。同一份报告另载净现值 1.237 亿美元、回收期低于六个月。

Source

The Total Economic Impact™ Of Google Workspace with Gemini, Forrester Consulting(Google 委托)

Method

六位决策者、五家组织的访谈,投射至一个 20,000 人、年营收 40 亿美元的假想复合组织 · 2026 年 2 月

这是 TEI 方法论的标准做法,但它不是大样本研究。六次访谈支撑的是一个财务模型,不是一次量测。

3小时/周

平均每位Gemini 用户每周省下的时间,年计 150 小时。

Source

同上(Forrester TEI)

Method

同上;此数字为模型输入而非独立量测 · 2026 年 2 月

常见的转述是「每位员工」。原文是「每位用户」——未用户不在分母里,两者差距取决于采用率。

105分钟/周

用户自陈省下的时间。同一份调查中,75% 的每日用户表示工作质量提升。

Source

Gemini at Work,Google 企业客户调查

Method

18 家企业、3,200 余份问卷;试点自 2023 年 12 月起,数据汇整于 · 2024 年 7 月

常被称为「全球量化普查」。它是 18 家客户试点参与者的问卷,不是普查;而且数据至今已两年。

130,000小时

七个月内累积回收的工时。

Source

Macquarie Bank 客户案例,Google Cloud 新闻稿

Method

客户自述;涵盖 5,000 名员工中的约 80% · 2025 年 10 月

常被转述为「全行导入 Workspace,自动化信件与表单」。实际使用的是 Gemini Enterprise 而非 Workspace,回报的用途是草拟报告、摘要财务文档、从数据集产生洞察。

Disclosure

上述四份来源全部由 Google 委托或发布,主题是 Google 自家产品。 没有一份是独立第三方。这不代表数字是假的——我们核对过,它们不是—— 但它决定了这些数字该用什么权重去读。

02 — Independent research

The Gains Are Real 效益是真的,这点有非厂商证据

如果只有厂商说有效,这一页的结论会是「无法判断」。但独立研究确实测到了效益, 而且用的是客观量测而非问卷

+15%

技能最低五分位:+36%

客服人员的生产力提升,以每小时解决件数量测,不是自陈。

Method

某 Fortune 500 企业的 5,172 名客服人员,实地实验,客观计数。非厂商委托。

0.55→ 0.14

教育程度造成的落差(标准差)

AI 提升所有人的表现,但对教育程度较低者的提升幅度大得多, 使两群人之间的差距从 0.548 个标准差缩小到 0.139。

Method

随机对照实验,1,174 名 25–45 岁成人,NBER 工作论文 w34851。

跨写作、客服、软件开发、会计、法律与翻译的文献回顾则显示,任务完成时间缩短 15% 至 50% 以上,且对经验较少者的效益不成比例地大。

要注意的是:这些研究量的是特定任务的完成时间或吞吐量, 厂商数字讲的是每周省下的总时数。两者不是同一件事, 把它们并列比大小是误导。

03 — How it was measured

Self-Reported Time Is Unreliable 人对自己省下多少时间的判断并不可靠

这是整页最重要的一节。前面所有的厂商数字, 全部是自陈或以自陈为基础的建模——而自陈恰好是下面这项研究证明不可靠的测量方式。

事前预期

快 24%

实际量测

慢 19%

事后自评

快 20%

同一批人,同一段工作。实际慢了 19%,事后却认为自己快了 20%—— 认知与实际之间差了近 40 个百分点,而且方向是相反的

Method

METR,2025 年 7 月。随机对照试验,16 名资深开发者、246 项成熟开源项目的真实任务,客观计时。

Limits

样本仅 16 人;领域是软件开发,不能直接外推到一般知识工作; METR 自己已将此结果标示为历史数据, 并正在重新设计实验,理由是它不必然反映当前的工具与工作流。

这不否定 AI 的效益——第 02 节的客观量测已经证明效益存在。 它否定的是「问用户省下多少时间」这种测量方式, 而那正是第 01 节四组数字的来源。

05 — Questions

Common Questions 你可能想问

导入 Google Workspace AI 的投资报酬率是多少?

Forrester 于 2026 年 2 月发布、由 Google 委托的 TEI 研究报告三年期投资报酬率 416%、净现值 1.237 亿美元、回收期低于六个月。该数字建立在六位决策者、五家组织的访谈之上,并投射至一个 20,000 人的假想复合组织,因此它是一个财务模型而非一次量测。

员工每周实际能省下多少时间?

Forrester 的研究记载平均每位 Gemini 用户每周省下 3 小时,注意是用户而非全体员工。Google 的 Gemini at Work 调查则记载 105 分钟,样本为 18 家企业、3,200 余份问卷,数据汇整于 2024 年 7 月。两者都是自陈数字。

这些效益数据有独立第三方的证据吗?

有。一项针对某 Fortune 500 企业 5,172 名客服人员的实地实验,以每小时解决件数客观量测到生产力提升 15%,技能最低五分位者提升 36%。NBER 的随机对照实验(1,174 名成人)亦显示 AI 缩小教育程度造成的生产力落差,从 0.548 个标准差降至 0.139。这两项研究均非厂商委托。

为什么自陈的时间节省数字需要打折扣?

METR 于 2025 年 7 月发表的随机对照试验中,16 名资深开发者在 246 项真实任务上使用 AI 工具时实际慢了 19%,但事后自评认为快了 20%,认知与实际相差近 40 个百分点且方向相反。该研究样本小、领域限于软件开发,且 METR 已将结果标示为历史数据,但它足以说明以问卷询问用户省下多少时间并不可靠。

那企业该如何判断导入是否值得?

在自己的组织中量测,而且量测必须在导入之前设计好,否则导入后已无对照组可用。具体做法包括:挑出可客观计数的任务(件数、周期时间、返工率)、在任何人拿到工具之前先取基线、保留对照组或分批导入、并将自陈数字与客观数字分开记录——两者的落差本身就是重要信号。

06 — Measurement

Answer With Measurement 用量测回答,不要用演示文稿回答

把三节的结论放在一起:效益是真的,有客观量测支持; 但厂商公布的数字全部来自自陈,而自陈在唯一一项客观计时的试验里错得离谱。 所以那些数字不能用来预测你的组织会发生什么—— 它们甚至不是为了那个目的而产生的。

能回答那个问题的只有一件事:在你自己的组织里量测。 而量测必须在导入之前就设计好—— 导入之后才想量,你已经没有对照组了。

What that takes

  • 挑出可客观计数的任务——件数、周期时间、返工率,而不是「感觉有没有比较快」
  • 先取基线,在任何人拿到工具之前
  • 留一组对照,或至少分批导入,让前后差异不是只跟季节性比
  • 把自陈与客观数字分开记录——两者的落差本身就是最有价值的信号

这是我们提供的服务之一:在你导入 Workspace AI 之前, 协助你设计出一套导入后真的能拿来做决策的量测。 如果量测结果显示效益不如预期,那也是一个结论——而且比 416% 更值钱,因为它是你的。