AI 효율화 미도입 팀이 올해 치르는 비용
AI 효율화를 시작하지 않은 팀을 위해 도입하지 않을 때의 결과와 얻을 수 있는 것, ROI 기준을 정리했다.
중국어 원문을 AI로 번역했습니다. 고유명사와 수치는 원문 표기를 우선하며, 중요한 판단에는 아래 출처 원문을 함께 확인하세요.
서두
연말 회고를 하다 보면 옆 팀이 자랑하듯 올린 숫자를 보게 된다. 같은 예산, 같은 인원, 비슷한 업무량인데 납기 속도는 한참 차이가 난다. 그래서 특별 예산을 편성해 팀에 AI 도구 좌석을 한 묶음 사서 뿌렸다. 석 달이 지나도 팀은 여전히 그 인원으로 야근하고, 산출물은 변함이 없고, 일부 도구는 구석에서 먼지만 쌓인다.
이 장면을 나는 여러 번 봤다. 개발 효율 거버넌스를 하던 때부터 나는 한 가지 규칙성을 관찰했다. 도구를 뿌린다고 효율이 오르지 않고, 효율이 올랐다고 회사가 돈을 버는 것도 아니다. 지난 2년간 우리는 팀을 이끌며 AI 워크벤치를 직접 구축해서, 위의 이 사슬을 한 마디씩 뚫어냈고, 여러 고객 현장에서 거듭 검증했다. 오늘 이 글은 한 가지 질문에만 답한다.
AI 효율화를 하지 않으면 어떻게 되는가? 하면 무엇을 얻는가?
겁주지도 않고, 떡밥도 던지지 않는다. 아래는 실제 데이터와 세 가지 이야기다.
당신도 AI 효율화를 추진하고 있다면, 이 계산을 끝낸 뒤 문말에 바로 대조해볼 수 있는 자체 점검 체크리스트가 있다.
AI 효율화는 "도구 배포"가 아니다
"AI 효율화"를 두 층으로 나눠 보면, 대부분의 팀은 첫 번째 층에서 멈춘다.
- 개인 층 : 모든 엔지니어에게 Copilot / Claude Code를 지급해 개인이 일하는 속도를 높인다. 효과는 빠르지만 천장이 낮다. 이는 "일하는" 그 구간만 최적화한다.
- 조직 층 : 팀 안의 암묵적 경험을 재사용 가능한 자산으로 고정하고, 이 자산들을 자동화된 흐름으로 엮어, AI를 "사람의 일을 돕는" 존재에서 "조직을 대신해 프로세스를 돌리는" 존재로 만든다. 회사 장부에서 돈이 보이는 곳은 이 층이다.
대다수 책임자는 "도구를 사면 = AI 효율화를 시작한 것"이라고 생각한다. 내 판단은 이렇다. 도구를 뿌리는 것은 그저 구매 명세서를 한 장 연 것일 뿐, 효율화와는 두 계단 차이다. 아래에서 말할 세 가지 이야기가 바로 이 두 계단 위의 실제 상황이다.
먼저 세 가지를 보자: 안 하면 어떻게 되는가
나는 "3년 뒤엔 도태된다"는 식의 말을 지어내지 않는다. 현장에서 오래 몸 담근 사람으로서, 내가 보는 것은 이미 벌어지고 있는 세 가지 일이다.
사실 하나: 과업 층의 효율화 ≠ 조직의 효율화
한 가지 데이터가 있다. 사무직은 약 60%의 정력을 "조율"에 쓴다. 정렬, 재촉, 진화(불 끄기), 회고 같은 것에 말이다. 실제로 일하는 데는 약 40%만 쓴다. 임금이 높을수록 조율 비중이 높다.
이것이 바로 많은 회사가 "곳곳에서 연기가 나는데 불은 붙지 않는" 이유다. 모든 사람이 AI를 쓰고, 모든 사람이 시간을 아꼈다고 말하지만, 전체를 놓고 보면 회사 전체 효율은 변함없고 장부에 돈도 늘지 않는다. 아낀 시간은 어디로 갔나? 조율 층이 먹어버렸다. 개인이 코드를 쓰는 시간이 3일에서 1일로 줄어도 소용없다. 왜냐하면 요구사항 정렬은 여전히 두 차례 리뷰를 기다리고, 부서 간 데이터는 여전히 메일로 오가고, 배포는 여전히 일주일짜리 윈도를 잡아야 하기 때문이다.
암달의 법칙으로 보면 더 명확하다. 한 구간만 최적화하면 전체 기여는 제한적이다. 병목이 일하는 구간에 없는데 당신이 일하는 구간을 최적화하면, 전체 수익은 0에 수렴한다.
그래서 첫 번째 실제 계산은 이렇다. 당신이 아낀 시간은 조율 층에 조용히 흡수되고 있고, 당신은 대개 그것을 느끼지 못한다.
사실 둘: 팀 속도는 사람에게 붙어 있어, 고정하지 않으면 끊긴다
당신 팀의 지금 실제 속도는 상당 부분 몇몇 시니어 직원의 머릿속과 입에 붙어 있다. 이 시스템의 함정이 어디인지, 누구에게 결정을 요청해야 하는지, 어느 라인의 인터페이스에 어떤 약속이 숨어 있는지 말이다. 이 경험들은 한 번도 글로 적힌 적이 없다.
결과는 이렇다. 이런 사람들이 휴가를 가거나, 전보되거나, 떠나면 속도는 그 자리에서 곤두박질치고, 신입이 들어와 똑같은 것을 처음부터 다시 밟는다. 이건 AI 시대의 병이 아니라, 줄곧 존재해 온 조직의 취약점이다. 차이는 이렇다.
과거에는 경험을 고정하는 것이 매우 비쌌다. 문서를 쓰고, 위키를 세우고, 리뷰 회의를 열어야 했고, 대부분 3주를 버티지 못했다. 지금은 한 조각의 경험을 재사용 가능한 Skill(지시 + 컨텍스트 약속 + 품질 검사 지점)로 만드는 비용이 한 자릿수만큼 낮다. 이 일을 하지 않으면, 당신은 "사람이 떠나면 지식이 끊긴다"는 비용을 치르게 된다. 이는 AI와 무관하지만, AI가 오늘 가장 저렴한 해법을 줬다.
사실 셋: 체계적이지 않은 "실행"은 기본적으로 돈을 태우는 것과 같다
가장 뼈아픈 항목이다. MIT의 한 조사는 매우 달갑지 않은 수치를 내놨다. 약 95%의 생성형 AI 시범 도입이 손익계산서에 영향이 0이었고, 더 신뢰할 만한 기준으로도 전환에 성공한 곳은 약 30%에 불과했다.
이게 무엇을 뜻하나? 그저 도구를 뿌리고, 검증도 붙이지 않고, 귀속도 붙이지 않고, 프로세스 개조도 붙이지 않은 채, 개인이 자발적으로 쓰기를 바라면, "했다"와 "안 했다"의 장부는 거의 똑같고, 돈은 실지로 태워졌다. 그 token 소모는 끝내 "어디에 썼고 무엇을 산출했는가"라는 답조차 찾아낼 수 없다.
그래서 진짜 문제는 애초에 "할 것인가 말 것인가"가 아니라 "어떻게 해야 결과가 나오는가"다. 안 하면 어떻게 되나? 문을 닫지는 않는다. 하지만 당신은 앞의 두 계산에 계속 돈을 내게 되고, 무감각하게 낸다.
하면 무엇을 얻는가
수익 하나: 셈할 수 있는 ROI
많은 책임자가 나에게 효율화를 어떻게 셈하느냐고 묻는다. 내가 실제로 써 본 기준을 하나 주겠다. 다섯 마디 사슬이다.
소모 → 귀속 → 산출 → 성능 → 가치
- 소모 : token을 얼마나, 돈을 얼마나 썼는가, 캐시 적중률은 얼마인가(게이트웨이 하나면 셀 수 있다)
- 귀속 : 각 소모가 어떤 시나리오(기능 작성 / 버그 수정 / 코드 리뷰)에 대응하고, 어느 티켓에 매달려 있는가 — 이것이 결정적 고리다
- 산출 : 어떤 소모가 커밋, PR, 수정된 문제로 바뀌었는가(Git과 티켓의 연관 파이프라인을 연결해야 한다)
- 성능 : 단일 과업에 얼마인가, 과업 주기가 베이스라인보다 얼마나 짧아졌는가
- 가치 : ROI = (절약한 공수 × 인력 단가 − token 비용) ÷ token 비용, 여기에 연간 순이익과 회수 기간을 환산한다
이 사슬의 함정은 3단 도약에 있다. 소모는 도구에 내장돼 있고, 귀속은 스스로 붙여야 하고, 산출은 스스로 파이프라인을 붙여야 한다. 대다수 회사는 "귀속"에서 막힌다. 돈을 썼지만, 돈이 어느 시나리오에 쓰였고 산출이 어느 티켓에 떨어졌는지 말하지 못한다. 듣기 좋게 말하면 이렇다. 당신은 ROI를 셈하지 못하는 게 아니라, 셈할 자격조차 아직 세우지 못한 것이다. 기록이 없기 때문이다.
수익 둘: 같은 사람으로 산출 두 배(1단계)
이것이 우리가 "먼저 증분 침투, 기존 업무 방식을 전복하지 않음"으로 걸어간 실제 경로다. 세 가지 층이다.
- 개인 도구 : 코딩, 문서, 검색, 테스트, review, 먼저 모든 사람이 돌아가게 한다
- Skill 고정 : 빈도 높고 재사용 가능한 동작을 표준화된 스킬 자산으로 포장한다, 버전 관리, 롤백 가능, 내부 공유
- Workflow 연결 : Skill을 흐름으로 엮는다, 각 노드마다 스킬 하나에 선택적 인간 승인 게이트 하나를 더하고, 단계적으로 자동화 비율을 높인다
1단계에서 무엇을 얻는지는 한 문장이다. 같은 사람으로, 산출 두 배. 이건 현학이 아니다. "코드 작성은 대략 전체 문제의 20%에 불과하다", 나머지 여덟 할은 영향 판단, 방안 검증, 배포 조율에 있고, 바로 이것이 Skill과 Workflow가 받아낼 수 있는 부분이다.
일선 데이터는 더 구체적이다. Factory는 고객 환경에서 프로젝트 수준 추정치를 하나 내놨다. 약 15%~20%의 작업은 이미 엔드투엔드로 완전 자율 완료가 가능하고, 또 다른 약 30%~40%는 "낮게 달린 열매"에 속한다. 문서, 간단한 테스트, 패턴이 명확한 마이그레이션 유지보수 같은 것으로, Agent가 바로 착수할 수 있다. 다시 말해, 자율주행급 Agent를 기다릴 필요 없이, 이 두 등급을 먼저 따내면 팀은 이미 한 바퀴 앞서 있다.
Skill 고정 층은 실무에서 어떤 모습인가? 우리가 직접 구축한 AI 워크벤치에서 각 Skill은 생성, 평가부터 버전 롤백까지 완전한 관리 흐름을 갖는다. 데이터베이스에 저장되고, 버전 이력을 지니고, 평가에는 전용 방안이 있고, 드라이런과 사람 수정 부분 채점을 지원한다. 이것이야말로 Skill이 '한 조각의 Prompt'에서 '거버넌스 가능하고 롤백 가능한 팀 자산'으로 바뀌는 실제 형태다.
수익 셋: 인지 대역폭을 돌파하는 계산(2단계)
1단계는 사람이 더 빨리 하게 만드는 것이다. 2단계는 조직 방식을 바꾼다. AI가 작업의 주력이고, 사람은 거버넌서다. 계획, 분해, 실행, 검증을 Agent에게 맡겨 병렬로 돌리고, 사람은 목표 설정, 승인, 검수만 한다.
가장 직관적인 수익은 IT 데이터에 있지 않다. 사람의 희소성이 "실행 능력"에서 "거버넌스 능력"으로 이동한다. 과거에 사업 라인을 하나 더 맡으려면 한 팀을 증원해야 했다. 지금은 늘려야 하는 것이 Agent의 동시성과 거버넌스 품질이다. 이 계산이야말로 비선형 성장이다.
의사결정 체크리스트(대조 자체 점검)
아직 시작하지 않은 책임자에게, 6개, 각 항목은 즉석에서 답할 수 있다.
- 팀이 지난 분기에 AI에 쓴 돈이 각각 어느 몇 개 비즈니스 시나리오에 대응하는지 말할 수 있는가?
- 내일 모든 AI 도구를 꺼버리면, 어떤 구체적 프로세스 가 느려질지 말할 수 있는가 — "전체적으로 영향이 있을 것 같다"가 아니라?
- 팀에서 가장 값진 경험이 사람의 머리와 입 외의 다른 곳에 자리 잡고 있는가?
- 배포 전에 AI의 저급한 오류를 잡아낼 수 있는 점검 리스트를 가지고 있는가(reviewer가 육안으로 버티는 것이 아니라)?
- 사람이 개입하지 않고 AI가 처음부터 끝까지, 검증 안전판까지 갖춘 채 해낼 수 있는 작업 등급이 하나라도 있는가?
- 당신의 책임자 평가에 "AI에게 일을 시키게 하기"가 가중치를 차지하는가, 아니면 수작업 코드량만 보는가?
6개 모두 아니오 = 당신은 아직 조율 층의 비효율과 지식의 유실에 비용을 내고 있다. 3개 이상 답했다 = 당신은 사실 이미 시작한 것이다, 다만 아직 그것을 장부의 한 줄로 만들지 못했을 뿐이다.
맺음말
한 문장으로 마무리한다. AI 효율화를 하지 않으면 당장 문을 닫지는 않지만, 당신은 이미 세 가지에 비용을 내고 있다. 조율 층의 비효율, 진척 속에 붙잡지 못한 지식, 그리고 행방을 밝힐 수 없는 token 청구서다. 그리고 올바른 첫걸음은 하룻밤 사이에 Agent를 올리는 것이 아니라, 첫 번째 데이터(소모와 귀속)를 기록하는 데 있다.
당신이 지금 할 수 있는 세 가지 작은 일:
- 팀이 AI의 매 호출에 시나리오와 티켓을 달게 한다(로컬 런처로 귀속 정보를 주입하는 것이라도)
- 빈도 높은 동작 하나를 골라 첫 번째 Skill로 고정하고, 그 입력, 출력, 검사 지점을 명확히 쓴다
- 위의 6개 리스트로 팀에 15분 자체 점검을 한 번 시킨다
더 나아가고 싶다면 세 가지 입구가 있다.
- 위의 6개 자체 점검 리스트와 ROI 기준을, 바로 대조해 쓸 수 있는 표 버전으로 정리해 뒀다 — 나에게 비밀 메시지를 보내면 보내주겠다
- 30분 교류 한 번, 당신 팀의 현황에 맞춰 어느 라인에서 시작하는 게 가장 빠른지 본다
- 우리가 직접 구축한 이 워크벤치(Skill 관리 + 평가 + Workflow 오케스트레이션)에 관심이 있다면, 실제로 돌아가는 형태를 볼 수 있게 Demo를 약속할 수 있다