표본은 16명에 지나지 않고 영역이 소프트웨어 개발이라 일반 지식 노동에 그대로 넓힐 수 없습니다.METR 자신이 이 결과를 지난 데이터로 다루고 있습니다. 지금의 도구와 일하는 방식을 반드시 비추지는 않는다는 이유로 실험을 다시 설계하는 중입니다.
이것이 AI의 효과를 부정하지는 않습니다 —— 02절의 객관적 계측이 효과가 있음을 보였습니다. 부정되는 것은 '사용자에게 얼마나 시간이 남았는지 묻는' 측정 방식이며, 그것이 바로 01절 네 숫자의 출처입니다.
05 — Questions
Common Questions자주 묻는 것들
Google Workspace의 AI를 넣으면 투자수익률은 얼마나 되나요
Forrester가 2026년 2월에 공표한 Google 의뢰 TEI 보고서에서는 3년 투자수익률 416%, 순현재가치 1억 2,370만 달러, 회수 기간 6개월 미만으로 나옵니다. 이 숫자는 의사결정자 6명·5개 조직 인터뷰를 바탕으로 직원 20,000명의 가상 복합 조직에 투영한 것입니다. 즉 측정이 아니라 재무 모델입니다.
직원은 실제로 주당 얼마나 시간을 아낄 수 있나요
Forrester 연구에는 Gemini 사용자 1인당 주 3시간으로 적혀 있습니다. 전체 직원이 아니라 사용자라는 점에 주의하세요. Google의 Gemini at Work 조사에서는 105분이고, 표본은 18개 사·3,200여 건, 데이터 취합은 2024년 7월입니다. 둘 다 자기 보고 숫자입니다.
벤더 아닌 증거가 있나요
있습니다. 어느 Fortune 500 기업의 상담 인력 5,172명을 대상으로 한 현장 실험에서는 시간당 해결 건수라는 객관 지표로 생산성이 15% 올랐고, 기술 하위 5분위 층에서는 36% 올랐습니다. NBER의 무작위 대조 시험(성인 1,174명)에서도 학력에 따른 생산성 격차가 0.548 표준편차에서 0.139로 좁아졌습니다. 둘 다 벤더 의뢰가 아닙니다.
자기 보고한 절약 시간을 깎아서 읽어야 하는 이유는 무엇인가요
METR이 2025년 7월에 공표한 무작위 대조 시험에서, 숙련 개발자 16명이 246건의 실제 작업에 AI를 썼을 때 실제로는 19% 느려졌지만 본인은 나중에 20% 빨라졌다고 답했습니다. 인식과 실제가 40 포인트 가까이 벌어졌고 방향도 반대입니다. 표본이 작고 영역도 소프트웨어 개발에 한정되며 METR 자신이 결과를 지난 데이터로 두고 있지만, 사용자에게 묻는 측정 방식이 믿을 만하지 않음을 보이기에는 충분합니다.
그러면 기업은 도입할 값어치가 있는지 어떻게 판단해야 하나요
자기 조직에서 재는 것입니다. 그리고 그 측정은 도입 전에 설계해 두어야 합니다. 넣고 나면 대조군이 남지 않습니다. 구체적으로는 객관적으로 셀 수 있는 작업을 고르고(건수, 소요 시간, 재작업률), 누군가 도구를 손에 쥐기 전에 기준값을 잡고, 대조군을 남기거나 단계적으로 넣고, 자기 보고 숫자와 객관 숫자를 따로 기록하는 것 —— 이 둘의 벌어짐 자체가 중요한 실마리입니다.
06 — Measurement
Answer With Measurement자료가 아니라 계측으로 답한다
세 절의 결론을 나란히 둡니다. 효과는 진짜이고 객관적인 계측이 그것을 받칩니다. 그러나 벤더의 숫자는 모두 자기 보고에서 나왔고, 그 자기 보고는 유일한 객관 계시 시험에서 크게 빗나갔습니다. 그러니 그 숫자들은 당신의 조직에 무슨 일이 일어날지 맞히는 데 쓸 수 없습니다—— 애초에 그러라고 만든 숫자가 아닙니다.
그 물음에 답할 수 있는 것은 하나뿐입니다. 자기 조직에서 재는 것. 그리고 측정은 도입 전에 설계해 두어야 합니다. 넣고 나서 재려 할 때는 대조군이 이미 없습니다.
What that takes
객관적으로 셀 수 있는 작업을 고른다—— 건수, 소요 시간, 재작업률. '빨라진 것 같다'가 아니라
먼저 기준값을 잡는다. 누군가 도구를 손에 쥐기 전에
대조군을 남긴다. 적어도 단계적으로 넣어, 전후 차이가 계절 변동과의 비교에 그치지 않도록
자기 보고와 객관 숫자를 따로 기록한다—— 이 둘의 벌어짐 자체가 가장 값어치 있는 실마리입니다
이것이 저희가 하는 일 가운데 하나입니다. Workspace의 AI를 넣기 전에, 넣고 나서 정말 판단에 쓸 수 있는 계측을 설계하도록 돕습니다. 결과가 기대만 못 하다면 그것도 하나의 결론입니다. 게다가 416%보다 값어치가 있습니다. 당신의 것이니까요.