02 — Independent research
The Gains Are Real
效益是真的,這點有非廠商證據
如果只有廠商說有效,這一頁的結論會是「無法判斷」。但獨立研究確實測到了效益,
而且用的是客觀量測而非問卷。
客服人員的生產力提升,以每小時解決件數量測,不是自陳。
Method
某 Fortune 500 企業的 5,172 名客服人員,實地實驗,客觀計數。非廠商委託。
0.55→ 0.14
教育程度造成的落差(標準差)
AI 提升所有人的表現,但對教育程度較低者的提升幅度大得多,
使兩群人之間的差距從 0.548 個標準差縮小到 0.139。
Method
隨機對照實驗,1,174 名 25–45 歲成人,NBER 工作論文 w34851。
跨寫作、客服、軟體開發、會計、法律與翻譯的文獻回顧則顯示,任務完成時間縮短
15% 至 50% 以上,且對經驗較少者的效益不成比例地大。
要注意的是:這些研究量的是特定任務的完成時間或吞吐量,
廠商數字講的是每週省下的總時數。兩者不是同一件事,
把它們並列比大小是誤導。
03 — How it was measured
Self-Reported Time Is Unreliable
人對自己省下多少時間的判斷並不可靠
這是整頁最重要的一節。前面所有的廠商數字,
全部是自陳或以自陳為基礎的建模——而自陳恰好是下面這項研究證明不可靠的測量方式。
同一批人,同一段工作。實際慢了 19%,事後卻認為自己快了 20%——
認知與實際之間差了近 40 個百分點,而且方向是相反的。
Method
METR,2025 年 7 月。隨機對照試驗,16 名資深開發者、246 項成熟開源專案的真實任務,客觀計時。
Limits
樣本僅 16 人;領域是軟體開發,不能直接外推到一般知識工作;
METR 自己已將此結果標示為歷史資料,
並正在重新設計實驗,理由是它不必然反映當前的工具與工作流。
這不否定 AI 的效益——第 02 節的客觀量測已經證明效益存在。
它否定的是「問使用者省下多少時間」這種測量方式,
而那正是第 01 節四組數字的來源。
05 — Questions
Common Questions
你可能想問
導入 Google Workspace AI 的投資報酬率是多少?
Forrester 於 2026 年 2 月發布、由 Google 委託的 TEI 研究報告三年期投資報酬率 416%、淨現值 1.237 億美元、回收期低於六個月。該數字建立在六位決策者、五家組織的訪談之上,並投射至一個 20,000 人的假想複合組織,因此它是一個財務模型而非一次量測。
員工每週實際能省下多少時間?
Forrester 的研究記載平均每位 Gemini 使用者每週省下 3 小時,注意是使用者而非全體員工。Google 的 Gemini at Work 調查則記載 105 分鐘,樣本為 18 家企業、3,200 餘份問卷,資料彙整於 2024 年 7 月。兩者都是自陳數字。
這些效益數據有獨立第三方的證據嗎?
有。一項針對某 Fortune 500 企業 5,172 名客服人員的實地實驗,以每小時解決件數客觀量測到生產力提升 15%,技能最低五分位者提升 36%。NBER 的隨機對照實驗(1,174 名成人)亦顯示 AI 縮小教育程度造成的生產力落差,從 0.548 個標準差降至 0.139。這兩項研究均非廠商委託。
為什麼自陳的時間節省數字需要打折扣?
METR 於 2025 年 7 月發表的隨機對照試驗中,16 名資深開發者在 246 項真實任務上使用 AI 工具時實際慢了 19%,但事後自評認為快了 20%,認知與實際相差近 40 個百分點且方向相反。該研究樣本小、領域限於軟體開發,且 METR 已將結果標示為歷史資料,但它足以說明以問卷詢問使用者省下多少時間並不可靠。
那企業該如何判斷導入是否值得?
在自己的組織中量測,而且量測必須在導入之前設計好,否則導入後已無對照組可用。具體做法包括:挑出可客觀計數的任務(件數、週期時間、返工率)、在任何人拿到工具之前先取基線、保留對照組或分批導入、並將自陳數字與客觀數字分開記錄——兩者的落差本身就是重要訊號。
06 — Measurement
Answer With Measurement
用量測回答,不要用簡報回答
把三節的結論放在一起:效益是真的,有客觀量測支持;
但廠商公布的數字全部來自自陳,而自陳在唯一一項客觀計時的試驗裡錯得離譜。
所以那些數字不能用來預測你的組織會發生什麼——
它們甚至不是為了那個目的而產生的。
能回答那個問題的只有一件事:在你自己的組織裡量測。
而量測必須在導入之前就設計好——
導入之後才想量,你已經沒有對照組了。
What that takes
-
挑出可客觀計數的任務——件數、週期時間、返工率,而不是「感覺有沒有比較快」
-
先取基線,在任何人拿到工具之前
-
留一組對照,或至少分批導入,讓前後差異不是只跟季節性比
-
把自陳與客觀數字分開記錄——兩者的落差本身就是最有價值的訊號
這是我們提供的服務之一:在你導入 Workspace AI 之前,
協助你設計出一套導入後真的能拿來做決策的量測。
如果量測結果顯示效益不如預期,那也是一個結論——而且比 416% 更值錢,因為它是你的。