AI 사용은 넓지만 이익으로 이어진 기업은 소수이다. 조직의 88%가 AI를 쓰지만(AI Index 2026), 영업이익(EBIT) 영향은 37%, 고성과 기업은 약 6%이다(McKinsey 2026). 효과는 업무 흐름의 재설계와 조직의 조건에 달려 있다(DORA 2025).
개발·비개발 조직 모두 AI를 적용하고 있지만, 효과는 아직 검증 전이다. AXE는 실습 지원, 사용 가시화, 정본 데이터 구축, 배포 환경, 보안·거버넌스를 지원해 왔다. 5월 진단과 7월 인터뷰에서는 소수만 많이 쓰는 모습이 보였다. 비슷한 것을 각자 만들고, 결과물과 정본을 믿지 못하는 모습도 보였다.
지금의 적용이 주요 업무에서 의미 있는 성과를 만드는지 확인한다. '적용은 넓지만 가치는 소수'인 간극이 미리디에도 있는지 본다. 점수 대신 막힌 곳과 원인을 찾아 투자·지원 우선순위를 정한다. 진단 결과는 보상·승진·인사평가에 쓰지 않는다. 단일 점수나 그룹(결과를 비교하는 조직 단위) 순위도 만들지 않는다.
적용과 역량이 함께 있어야 성과가 나고, 성과가 쌓여 회사의 가치가 된다. 적용과 성과는 주요 워크플로우마다 확인한다. 개인 역량은 사람 단위, 조직 역량은 전사 단위로 판정한다. 예를 들어 AI로 사내 데이터를 조회해도 사람마다 값이 달랐다. 정본 SQL을 쓰는 사내 조회 연결(Databricks MCP)을 제공한 뒤에야 같은 값이 나왔다.
| 요소 | 확인하는 것 | 방법 |
|---|---|---|
| 적용 | 주요 워크플로우의 적용 수준과 정착도 | AX 챔피언 인터뷰, 업무 기록 증빙 |
| 개인 역량 | 사람별, 공통 4개 + 도구 활용 6개 | 증빙 기반 개인 설문(실제 행동과 사례) |
| 조직 역량 | 전사, 5개 영역 | AXE 스쿼드가 전사 자료로 판정 |
| 성과 | 워크플로우별 성과 | 적용과 함께 인터뷰·업무 기록으로 확인 |
| 가치 | 다음 단계 | 측정 기반을 갖춘 뒤 측정(2027 상반기) |
직접 만들어 쓰는 수준 이상과 '성과가 났다'는 판정은 증빙이 있을 때만 한다. 설문 응답만으로는 분포를 본다.
진단 기준과 설문·인터뷰지를 확정한다. 그룹·직무별 주요 워크플로우를 정한다
AX 챔피언 인터뷰와 업무 기록 증빙으로 워크플로우별 적용 수준과 성과를 함께 확인한다
개인 역량은 설문으로, 조직 역량은 전사 자료로 판정한다. 막힌 곳이 분명하면 결정에 따라 개선을 먼저 시작한다
진단 결과를 분석해 목적에 답하고 To-be 초안(개선 후 업무 흐름)을 만든다. 부족한 성과 증빙도 보완한다. 2단계 후반과 병행한다
진단 결과와 To-be 초안을 보고한다. 리더십이 투자·지원과 개선 착수를 결정한다
역할 AXE 스쿼드(워크플로우 확정, 판정, To-be 제안) · AX 챔피언·업무 책임자(확인, 증빙 제공) · 리더십(결정)
가치 경로의 각 요소를 어느 단계에서 확인하고 판정하는지 보여 준다. 세로축은 가치 경로, 가로축은 수행 단계이다. 진단 결과 분석은 2단계부터 진단과 함께 진행한다. 막힌 곳이 분명한 워크플로우는 결정에 따라 개선을 먼저 시작한다.
영역별 진단 결과로 막힌 곳을 찾고 원인을 가린다. 진단 이후 이를 근거로 투자·지원을 결정한다.
| 어디서 | 무엇을 확인 | 확인 결과 예시(가상) | 결정 예시(가상) |
|---|---|---|---|
| 적용·성과 | 적용 수준·정착도와 성과 | 고객 문의 분류는 AI가 초안만 돕는 보조 단계에 머물고, 처리 시간이 그대로다 | 분류·응답 단계까지 AI가 맡도록 개선 대상으로 지정 |
| 개인 역량 | 그룹별로 낮은 역량과 그 원인 | 사업·운영 그룹은 주어진 지표는 조회하지만, 새 데이터(테이블·뷰)를 만드는 일은 어려워한다 | Databricks 사용 방법 핸즈온 진행 |
| 조직 역량 | 전사에서 약한 영역과 근거 | 사람·조직문화 영역에서, 잘 만든 Skill·자동화가 만든 팀 안에만 머물고 다른 그룹으로 공유되지 않는다 | 공유 저장소와 사례 공유 자리를 정례화하는 일을 전사 과제로 지정 |
| 교차 분석 | 막힌 원인이 개인, 조직, 워크플로우 구조 중 어디에 있는가 | 적용과 개인 역량은 높은데 성과가 낮다. AI 결과물을 기존 검수·인계 단계가 다시 처리한다 | 해당 워크플로우의 검수·인계 단계 재설계 |
예시는 가상 사례이며 실제 진단 결과가 아니다.
| 구분 | 지난 진단 (2026년 5월) | 이번 진단 |
|---|---|---|
| 보는 것 | 6개 영역의 성숙도 점수 (요약 5.21/10) | 가치 경로의 작동 상태와 막힌 곳 |
| 근거 | 10개 조직·19명 인터뷰의 진술 | 챔피언 인터뷰, 증빙 기반 설문, 전사 자료 증빙 |
| 대상 | 비개발 직군 중심 | 개발 직군을 포함한 전사 모든 직군 |
| 범위 | 인지·사용 중심 | 적용부터 성과까지 확인, 가치는 다음 단계 |
| 역량 | 영역별 점수 | 개인(공통 4개, 도구 활용 6개)과 조직(전사, 5개 영역)을 나눠 판정 |
| 진단 결과 | 전사 요약 점수 | 막힌 곳과 원인별 투자·지원 방향 |
이번 진단은 전사 종합 점수를 내지 않는다. 지난 진단의 발견은 다시 확인할 가설로 쓴다.
외부 조사는 같은 결론을 보인다. AI 사용은 넓지만 사업 성과로 이어진 기업은 소수이다. 성과를 낸 기업은 업무 흐름을 다시 설계했다. 결과를 확인하고 바로잡는 체계와 믿을 수 있는 정본도 함께 갖췄다.
미리디에서도 비슷한 신호가 보였다. 아래 신호는 5월 진단과 7월 인터뷰 당시의 표본에서 나왔다. 그 뒤 정본 데이터 구축과 보안·거버넌스 정비가 진행되었다. AI 적용도 계속 넓어지고 있다. 그래서 이번 진단에서 지금 시점으로 다시 확인한다.
| 주제 | 외부(출처) | 미리디 신호(당시 시점) | 진단에서 지금 확인할 것 |
|---|---|---|---|
| 사용과 성과의 간극 | 조직의 88%가 AI를 쓰지만(AI Index 2026), EBIT(이자·세금 차감 전 영업이익) 영향을 보고한 곳은 37%, 고성과 기업은 약 6%이다(McKinsey 2026). 대규모로 가치를 내는 기업은 5%, 의미 있는 가치를 얻지 못한 기업은 60%이다(BCG 2025) | 5월 기준 그룹 평균 활용 점수는 3.15/10으로, 소수만 많이 쓰고 다수는 조금 썼다. "10 하던 거 100 하는데, 다른 사람은 여전히 1"(5월 진단, 7월 인터뷰) | 적용이 주요 워크플로우의 성과로 이어졌는가 |
| 업무 흐름의 재설계 | 고성과 기업의 약 4분의 3은 AI 때문에 업무 흐름을 근본적으로 재설계했다. 나머지 기업은 4분의 1이다(McKinsey 2026) | 일부 업무에서 앱·자동화를 만들고 있지만, 그것이 업무 흐름을 바꾸는 재설계 수준인지는 확인되지 않았다(9월 활동 현황) | 업무 흐름을 바꾸는 재설계 수준까지 적용했는가 |
| 만든 것의 정착과 재사용 | 에이전트 AI 프로젝트의 40% 이상이 비용, 불분명한 가치, 위험 통제 부족으로 2027년까지 취소될 전망이다(Gartner 2025) | 비슷한 문제를 4개 그룹이 각자 해결하고 있고, 만든 것이 서로 공유되지 않는다(7월 인터뷰) | 만든 것이 다른 그룹으로 공유·확산되는가(조직 역량: 사람·조직문화) |
| 결과 검증과 신뢰 | 효과는 결과를 모니터링하기 쉬운 업무에서 크다(AI Index 2026). 숙련자는 AI를 쓴 결과의 품질이 조금 떨어졌다(Generative AI at Work 2025) | 환각을 겪은 뒤 결과를 믿지 못해, 결국 사람이 다시 확인하거나 직접 처리한다. 검증 부담이 크다(7월 인터뷰) | 개인의 결과 검증, 결과 검증을 받쳐 주는 조직 조건(조직 역량: 업무 흐름·운영, 거버넌스·신뢰) |
| 정본과 데이터 | 데이터 거버넌스의 문화적 과제를 무시하는 조직의 60%가 2027년까지 AI 거버넌스에 실패할 전망이다(Gartner 2026) | 7월에는 컨플루언스·위키의 신뢰도와 매출 데이터 정합성에 불신이 있었다. 이후 정본 데이터를 구축하며 개선하고 있다(7월 인터뷰, 9월 현황) | 정본 데이터 구축 이후 주요 워크플로우의 정본 신뢰 수준(조직 역량: 데이터·지식·플랫폼) |
| 조직 조건과 기반 | AI는 강한 팀의 강점과 약한 팀의 문제를 함께 키우는 증폭기이다. 효과는 내부 플랫폼, 업무 흐름의 명확성, 팀 정렬에서 나온다(DORA 2025) | 5월 기준 AI 가이드 인지율은 2.75/10으로 10개 조직 모두 낮았다. 이후 사내 배포 인프라를 구축했고, 보안 정책과 거버넌스를 정비하고 있다(5월 진단, 9월 현황) | 가이드 인지, 사용 기준·권한, 실행 환경(조직 역량: 거버넌스·신뢰, 데이터·지식·플랫폼) |
미리디 신호의 출처는 AXE 내부 자료인 「2026년 5월 AX 진단」(10개 조직·19명), 「AX 챔피언 1차 인터뷰」(2026년 7월, 9개 그룹), 「2026년 9월 활동 현황」이다. 당시 시점의 표본 신호이므로 전사로 일반화하지 않는다. 이번 진단에서 지금의 수준을 다시 확인한다.
이 진단은 만드는 역량보다 검증하고 개선하는 역량과 그 조건을 더 무겁게 본다. AI로 초안, 자동화, 앱을 만드는 비용은 크게 낮아졌다. 그러나 결과가 맞는지 확인하고 고치는 비용은 줄지 않는다. 확인이 따라가지 못하면 만든 것이 늘어도 성과로 이어지지 않는다. 오류와 재작업이 아낀 시간을 다시 가져가기 때문이다. 그래서 만든 에이전트·자동화의 개수가 아니라, 검증을 거쳐 계속 쓰이는 결과물만 성과로 본다. 검토와 수정에 든 시간도 업무 시간에 넣는다.
진단은 주요 워크플로우 단위로 적용과 성과를 보고, 역량은 사람과 전사 단위로 본다. 네 질문은 수행 단계의 순서를 따른다.
무엇을 어느 단위로, 왜 보는가
| 무엇 | 보는 단위 | 근거 |
|---|---|---|
| 적용 | 주요 워크플로우 | AI의 영향은 직무가 아니라 과업 단위로 판단한다(ILO 2025). 성과를 가르는 것은 업무 흐름의 재설계이다(McKinsey 2026) |
| 성과 | 주요 워크플로우 | 워크플로우가 분모가 된다. 그래서 결과를 보기 전에 워크플로우를 고정한다 |
| 개인 역량 | 사람 | 역량 수준은 개인의 속성으로 정의한다(SFIA, DigComp) |
| 조직 역량 | 전사 | 조직의 조건은 적용·성과와 나눠 본다(DORA AI Capabilities, Microsoft 성숙도 모델). 근거가 전사 정책·환경·운영 기록이므로 전사 단위로 판정한다 |
| 가치 | 다음 단계(2027 상반기) | 기준값과 비교하고 검토·수정 비용까지 재야 한다(Microsoft 가치 측정 가이드, DORA ROI). 비용 가시성과 기준선을 갖춘 뒤 측정한다 |
외부 프레임워크는 업무 분류, AI 적용, 조직 조건, 개인 역량, 가치 측정 가운데 한두 측면에 강점이 있다. 미리디 진단은 각 측면에서 검증된 방식을 빌려 오고, 이를 같은 주요 워크플로우 기준으로 연결한다. 가치는 DORA ROI, Microsoft 가치 측정 가이드, Forrester TEI의 측정 원칙을 따른다. 가치 측정은 2027 상반기에 구체화한다.
| 프레임워크 | 업무·과업 | AI 적용 | 조직 조건 | 개인 역량 | 가치 측정 | 미리디가 차용하는 것 |
|---|---|---|---|---|---|---|
| APQC 산업 공통 PCF 8.0 | ● | ○ | 조직마다 이름이 다른 업무를 공통 분류에 대응시켜 누락과 중복을 점검하는 참고 지도 | |||
| US OPM 직무 분석 | ● | ● | 업무에서 사람이 맡을 행동으로부터 필요한 역량과 기대 수준을 정하는 방식 | |||
| ILO 생성형 AI 노출 지수(2025) | ● | ○ | 직무가 아니라 과업 단위로 AI 적용 영역을 판단하는 관점. 노출 점수를 실제 적용률로 쓰지 않는다 | |||
| DORA AI Capabilities Model | ● | ● | ○ | 적용, 조직 조건, 성과를 나눠 측정하는 구조. 비개발 업무는 해당 분야 지표로 다시 정의한다 | ||
| Microsoft 에이전트 AI 도입 성숙도 모델 | ○ | ○ | ● | ○ | 축별로 현재 상태를 보고, 점수가 아니라 차이와 투자 우선순위로 쓰는 방식 | |
| NIST AI RMF · ISO/IEC 42001 | ● | 현재·목표 프로필의 차이를 찾는 방식, AI의 역할 범위와 사람의 검토·승인 책임 기준 | ||||
| SFIA 9 · DigComp 3.0 | ● | 개인 단계를 자율성과 영향 범위로 나누는 방식, 전 직원 공통의 안전한 사용·정보 평가 | ||||
| DORA ROI of AI-assisted Software Development(2026) | ○ | ○ | ● | 조직 조건 → 전달 성과 → 비재무 가치 → 재무 가치의 흐름. 생성 시간만 재지 않고 검토·수정·초기 적응·유지 비용을 포함하며, 확보한 여력과 현금 절감을 구분하고, 하나의 ROI 숫자 대신 범위와 손익분기 조건을 본다 | ||
| Microsoft 에이전트 가치 측정 가이드 | ○ | ● | 효율·품질·매출·전략의 네 가치 동인. 이론상 절감 시간만으로 가치를 주장하지 않고, 사용 → 운영 지표 → 사업 성과의 증거 사슬과 적용 전 기준값·비교군을 둔다 | |||
| Forrester TEI | ● | 편익·비용·유연성(이후 확장의 선택권)·위험(추정의 불확실성)을 함께 보고, 편익과 비용을 같은 무게로 다룬다 | ||||
| 미리디 AX 진단 | ● | ● | ● | ● | ● | 다섯 측면을 같은 주요 워크플로우 기준으로 연결한다 |
● 주로 다룸 · ○ 일부 다룸 · 빈칸 다루지 않음. 외부 모델의 결함이 아니라 목적과 분석 단위가 다르기 때문이다. 외부 모델의 단계와 미리디의 수준 단계는 일대일로 대응하지 않는다. 외부 사례의 평균 효과나 예시 금액은 미리디의 목표나 기대 효과로 옮기지 않는다.
주요 워크플로우에 AI가 어디까지 들어갔고, 자리 잡았고, 무엇을 바꾸고 있는지 확인한다. 가치 경로의 적용과 성과를 같은 워크플로우에서 함께 본다. 그래야 적용은 높은데 성과가 없는 곳, 성과는 났지만 정착하지 않은 곳을 가려낼 수 있다.
주요 워크플로우는 그룹·직무가 반복해서 수행하고, 결과의 중요도가 높은 업무 흐름이다. 과업 하나보다 넓고, 직무 전체보다 좁다.
| 예시 | 판단 | 이유 |
|---|---|---|
| 콘텐츠 제작, 고객 문의 분석, 캠페인 성과 분석 | ○ | 시작과 끝, 결과를 받는 사람이 분명한 반복 업무 |
| 마케팅 업무 전체 | × | 너무 넓다. 여러 워크플로우로 나눈다 |
| 메일 제목 한 줄 작성 | × | 너무 좁다. 워크플로우 안의 한 단계이다 |
그룹마다 3~5개를 정한다(기준안). 잘된 업무만 고르지 않도록, 막힌 업무와 아직 AI를 적용하지 않은 업무를 1건 이상 넣는다. 워크플로우는 결과를 보기 전에 고정한다.
적용은 워크플로우에서 AI를 어느 수준으로, 얼마나 정착해 쓰는지를 본다. AI를 쓰는 업무 단계의 수도 함께 기록한다(예: 7단계 중 3단계).
적용 수준
예를 들어 보조는 기획서 초안을 AI와 대화하며 다듬는 경우이다. 부분 전환은 요청서가 들어오면 자동화 흐름이 초안을 만들고 담당자가 승인하는 경우이다. 재설계는 요청부터 배포까지 단계를 줄이고, 사람은 기준 설정과 최종 검수만 맡는 경우이다. 근거는 세 가지이다. augmentation과 automation의 구분(Anthropic Economic Index), Deploy와 Reshape의 구분(BCG), 고성과 기업의 약 4분의 3이 업무 흐름을 재설계했다는 조사(McKinsey 2026).
정착도
| 정착도 | 판단 기준 |
|---|---|
| 시험 | 한두 번 써 봤거나 시범 중이다 |
| 간헐 | 일부 사람이 필요할 때 쓰며, 정한 절차는 없다 |
| 정착 | 정한 절차로 팀이 4주 이상 반복해 쓴다 |
적용 수준은 정착도가 간헐 이상인 사용으로 판정한다. 시험만 있으면 '미적용(시험 중)'으로 기록한다. 정착하지 않은 적용은 성과로 이어지기 어려우므로 따로 표시한다.
성과는 적용으로 워크플로우의 결과가 실제로 바뀌었는지를 본다. 워크플로우마다 아래 지표에서 주된 지표를 1~2개 고른다. 속도나 처리량을 고르면 품질을 함께 본다.
| 지표 | 무엇을 보나 | 측정 예 |
|---|---|---|
| 속도 | 요청부터 받는 사람이 받아들일 때까지 걸린 시간 | 리드타임(중앙값), 대기 시간 |
| 품질 | 받는 사람이 결과물을 그대로 쓸 수 있는가 | 고치지 않고 쓴 비율, 반려·재작업률 |
| 처리량·투입 | 같은 사람 시간으로 끝낸 일의 양 | 완료 건수, 건당 작업 시간(검토·수정 포함) |
성과 판정값
| 판정값 | 판정 기준 |
|---|---|
| 개선 | 주된 지표가 좋아졌고, 품질 조건도 충족하며, 중대한 부작용이 없다 |
| 변화 없음 | 비교 자료가 충분하고, 주된 지표의 변화가 허용 범위 안에 있다 |
| 악화 | 주된 지표가 나빠졌거나, 품질 조건을 충족하지 못했다 |
| 혼재 | 일부는 좋아지고 다른 중요한 지표는 나빠졌다 |
| 미확인 | 비교 근거가 부족하다. AI를 적용하지 않은 워크플로우도 미확인으로 두고 이유를 적는다 |
'개선'은 업무 기록 증빙이 있을 때만 판정한다. 체감은 체감으로 따로 적는다. 판정값의 합계는 워크플로우 수와 같다. 효과의 지속·확산은 이번 회차에서 판정하지 않는다.
| 연구 (설계·표본) | 잰 지표 | 결과 | 이 진단에 주는 시사점 |
|---|---|---|---|
| Noy & Zhang 2023 (Science, 사전등록 무작위 실험, 대학 졸업 전문직 453명, 직무별 글쓰기 과제) | 소요 시간, 평가자가 매긴 품질 | ChatGPT를 쓴 집단은 소요 시간이 40% 줄고 품질이 18% 올랐다. 작업자 사이의 격차도 줄었다 | 속도와 품질을 함께 잰다 |
| Brynjolfsson 외 2025 (QJE, 고객지원 상담원 5,172명, AI 순차 도입 현장 자료) | 시간당 해결 건수, 고객 반응, 직원 유지 | 시간당 해결 건수가 평균 15% 늘었고, 효과는 경험·숙련에 따라 달랐다. 고객 반응이 나아지고 직원 유지율이 올랐다 | 처리량을 품질·경험과 함께 보고, 효과의 확산을 확인한다 |
| Dell'Acqua 외 2023 (HBS 워킹페이퍼, BCG 컨설턴트 758명, 사전등록 무작위 실험, 18개 과제) | 완료 과제 수, 소요 시간, 품질, 정답률 | AI가 잘하는 과제에서 12.2% 더 많이, 25.1% 더 빨리 끝냈고 품질은 40% 이상 높았다. 평균 아래 집단은 43%, 평균 위 집단은 17% 나아졌다. AI가 못하는 과제에서는 정답률이 19%p 낮았다 | 품질을 반드시 함께 본다. AI가 못하는 과제에서는 품질이 떨어질 수 있다 |
| Peng 외 2023 (통제 실험, JavaScript로 HTTP 서버 구현 과제) | 과제 완료 시간 | GitHub Copilot을 쓴 집단이 55.8% 더 빨리 끝냈다 | 속도는 실제 완료 시간으로 잰다 |
| METR 2025 (무작위 배정, 숙련 오픈소스 개발자 16명, 실제 이슈 246건) | 실제 완료 시간과 본인 체감 | 사전에는 24% 단축을 기대했고, 사후에도 20% 빨라졌다고 믿었지만 실제로는 19% 더 오래 걸렸다 | 체감 설문이 아니라 업무 기록으로 잰다 |
측정 원칙. 속도나 처리량은 품질과 함께 본다. AI가 못하는 과제에서는 정답률이 떨어졌다. DORA는 처리량과 불안정성을 짝으로 본다. SPACE는 생산성을 "a single metric or dimension"으로 잴 수 없다고 한다. 체감이 아니라 기록으로 잰다. Microsoft 가치 측정 가이드도 절감 시간만으로 가치를 주장하는 'time-savings trap'을 경계한다.
AXE가 워크플로우를 문의해 초안을 만들고, AX 챔피언 인터뷰에서 확인한 뒤 판정한다.
AXE가 그룹·직무별 주요 워크플로우를 문의해 초안 목록을 만든다(0단계)
워크플로우마다 시작과 끝, 결과를 받는 사람, 업무 단계를 초안으로 적는다
AX 챔피언 인터뷰(60분)에서 단계별 AI 사용, 정착 여부, 바뀐 결과와 근거를 확인한다(1단계)
AXE가 근거로 적용 수준·정착도·성과를 판정한다. 근거가 없으면 미확인으로 둔다
인터뷰에서 묻는 것
| 질문 | 확인하는 것 |
|---|---|
| 이 업무는 어디서 시작해 누구에게 끝나나요? | 업무 흐름과 결과를 받는 사람 |
| 어느 단계에서 AI를 쓰고, AI가 무엇을 맡나요? | 적용 수준, AI를 쓰는 단계 수 |
| 정해진 절차로 팀이 계속 쓰고 있나요? | 정착도 |
| AI를 쓰기 전과 비교해 무엇이 바뀌었나요? | 주된 지표와 변화 |
| 그 변화를 보여 줄 기록이 있고, 누가 확인해 줄 수 있나요? | 비교 근거, 받는 사람의 확인 |
인터뷰 뒤 부족한 성과 증빙은 3단계에서 보완한다.
기록지는 워크플로우 한 건당 한 행이다. 인터뷰 중에 채우고, 판정 칸은 AXE가 채운다.
| 구분 | 항목 | 적는 내용 | 누가 |
|---|---|---|---|
| 기본 | WF-ID, 그룹·직무, 업무명 | 업무명은 '시작 → 끝'으로 적는다 | AXE 초안 |
| 기본 | 결과를 받는 사람, 선정 유형 | 선정 유형: 잘된 업무 / 막힌 업무 / 미적용 업무 | AXE 초안, 챔피언 확인 |
| 적용 | AI를 쓰는 단계 | 전체 단계 수 중 AI를 쓰는 단계 수와 단계 이름 | 챔피언 응답 |
| 적용 | 적용 수준, 정착도 | 챔피언 응답과 AXE 판정을 나눠 적는다 | AXE 판정 |
| 성과 | 주된 지표, 비교 근거 | 지표 1~2개, 근거 자료 ID(티켓·산출물·반려 이력) | 챔피언 응답 |
| 성과 | 받는 사람의 확인, 판정값 | 확인함 / 요청함 / 없음, 다섯 판정값 중 하나 | AXE 판정 |
| 막는 조건 | 막는 조건과 사례 | 자료 / 도구 / 권한 / 시간 / 검수 / 없음 | 챔피언 응답 |
| 가치 | 이어질 가치(방향) | 유형 하나와 한 줄 설명. 판정하지 않는다(가치 탭 참조) | 챔피언 응답 |
| 상태 | 확정 여부 | 확정 / 미확인(사유) | AXE |
작성 예시(가상)
| 항목 | 기록 |
|---|---|
| 업무명 | 고객 문의 접수 → 분류 → 답변 발송 (CX 그룹, 받는 사람: 고객) |
| AI를 쓰는 단계 | 5단계 중 1단계(답변 초안 작성) |
| 적용 수준 · 정착도 | 보조 · 정착(팀 매크로로 매일 사용) |
| 성과 | 주된 지표: 속도(첫 답변까지 시간). 상담 시스템 기록상 변화 없음 |
| 막는 조건 | 분류 단계에 필요한 과거 문의 데이터 접근 권한이 없다 |
| 이어질 가치(방향) | 시간 재투입: 줄어든 답변 시간을 VIP 문의 대응에 쓴다 |
| 상태 | 확정 |
기록지를 모으면 그룹별 적용 수준 분포, 정착도 분포, 성과 판정값 분포가 나온다. 이것이 개요의 진단 결과(적용·성과)가 된다. 실제 결과가 나오면 아래 예시와 같은 구성의 리포트를 만든다.
| 인터뷰 정보 | 기록 | ||
|---|---|---|---|
| 그룹 | 인터뷰 일시 | ||
| AX 챔피언·업무 책임자 | 진행자·기록자 | ||
| 증빙 확인 방식 | 화면 보기 / 가린 사본 / 구두 설명 | 워크플로우 고정일 | |
| WF-ID | 그룹·직무 | 업무명(시작 → 끝) | 결과를 받는 사람 | 선정 유형 | AI를 쓰는 단계 | 적용 수준 | 정착도 | 주된 지표 | 비교 근거·자료 ID | 받는 사람 확인 | 성과 판정값 | 막는 조건 | 이어질 가치(방향) | 상태 |
|---|---|---|---|---|---|---|---|---|---|---|---|---|---|---|
| WF-01 | 잘된 / 막힌 / 미적용 | __단계 중 __단계 | 미적용 / 미적용(시험 중) / 보조 / 부분 전환 / 재설계 | 시험 / 간헐 / 정착 | 속도 / 품질 / 처리량·투입 | 확인함 / 요청함 / 없음 | 개선 / 변화 없음 / 악화 / 혼재 / 미확인 | 자료 / 도구 / 권한 / 시간 / 검수 / 없음 | 시간 재투입 / 품질·경험 / 사업 KPI / 새 업무 / 재무 | 확정 / 미확인(사유) | ||||
| WF-02 | ||||||||||||||
| WF-03 | ||||||||||||||
| WF-04 |
첫 행의 보기는 고를 수 있는 값이다. 적용 수준·정착도·성과 판정값은 챔피언 응답과 AXE 판정을 '응답 → 판정'으로 나눠 적는다. 인터뷰 뒤 15분 안에 사실, 챔피언의 진술, 진행자의 해석을 나눠 정리한다.
기록지를 모으면 아래 구성의 리포트를 만든다. 실제 결과가 나오면 같은 구성으로 실제 수치와 사례를 채운다.
그림 1. 그룹군별 적용 수준 분포 (워크플로우 48개, 가상)
표 1. 적용 수준에서 자주 발견된 패턴 (가상)
| 자주 발견된 패턴 | 근거 수치 | 인사이트 | 결정 예시 |
|---|---|---|---|
| AI가 초안·요약만 맡고, 업무 흐름은 그대로이다 | 보조 22/36 (61%) | 적용이 얕은 원인은 흐름을 바꾸지 않은 데 있다 | 보조 워크플로우 가운데 우선 대상을 부분 전환 지원 대상으로 지정 |
| 개발 그룹군만 부분 전환 이상이 절반을 넘는다 | 개발 7/12 (58%), 다른 그룹군 14~25% | 단계 전체를 맡길 도구가 있는 곳만 깊어졌다 | 개발 그룹군의 재설계 사례를 다른 그룹군에 공유 |
| 흐름을 바꾼 곳일수록 정착한다 | 정착: 부분 전환 이상 10/14, 보조 6/22 | 흐름을 바꾸면 팀의 반복 사용으로 이어진다 | 정착한 워크플로우의 절차를 템플릿으로 배포 |
표 2. 적용 수준 × 성과 판정값 (건수, 진할수록 많음, 가상)
| 적용 수준 | 개선 | 변화 없음 | 악화 | 혼재 | 미확인 | 합계 |
|---|---|---|---|---|---|---|
| 미적용 | 0 | 0 | 0 | 0 | 12 | 12 |
| 보조 | 2 | 6 | 0 | 1 | 13 | 22 |
| 부분 전환 | 4 | 3 | 1 | 1 | 2 | 11 |
| 재설계 | 2 | 0 | 0 | 0 | 1 | 3 |
| 합계 | 8 | 9 | 1 | 2 | 28 | 48 |
표 3. 성과 판정에서 자주 발견된 패턴 (가상)
| 자주 발견된 패턴 | 근거 수치 | 인사이트 | 결정 예시 |
|---|---|---|---|
| 개선은 부분 전환 이상에 몰려 있다 | 개선 비율: 부분 전환 이상 6/14 (43%), 보조 2/22 (9%) | 성과는 적용의 넓이가 아니라 깊이를 따른다 | 투자 대상을 적용 깊이 기준으로 고른다 |
| 보조 단계는 대부분 변화가 없다 | 보조에서 판정한 9건 가운데 6건이 변화 없음 | 개인 작업은 빨라졌지만 워크플로우 결과는 그대로이다 | 개인이 줄인 시간은 가치 탭의 연결 방향(시간 재투입)으로 기록 |
| 적용했지만 성과를 비교할 기록이 없다 | 적용 36개 가운데 16개가 미확인 | 성과가 없는 것이 아니라, 확인 수단이 없다 | 3단계에서 미확인 16개의 비교 기록 보완 요청 |
| 검수 없이 깊이만 올린 곳에서 품질이 떨어졌다 | 부분 전환에서 악화 1건, 혼재 1건 | 검수 단계 없이 전환하면 품질 위험이 커진다 | 부분 전환 지원에 검수 기준을 함께 넣음 |
표 4. 주요 블로커 (복수 응답, 가상)
| 블로커 | 건수 | 원인 유형 | 주로 나온 곳 | 연결되는 진단 |
|---|---|---|---|---|
| 권한 | 16건 | 환경 | 사업·운영 9건 | 조직 역량: 사용기준·권한 |
| 자료 | 14건 | 환경 | 사업·운영 5건 | 조직 역량: 업무맥락접근 |
| 검수 | 9건 | 운영 | 부분 전환 워크플로우 | 조직 역량: 품질·위험관리 |
| 시간 | 8건 | 운영 | 모든 그룹군 | 조직 역량: 책임·자원 |
| 도구 | 5건 | 도구 | 프로덕트·디자인 | 조직 역량: 제작·연동·실행환경 |
최종 결과와 시사점
| 시사점 | 근거 | 담당·시점 (예시) |
|---|---|---|
| 보조에서 부분 전환으로 업무 흐름 재설계를 지원한다. 보조 워크플로우 가운데 우선 대상 5개를 고른다 | 개선 비율 43% 대 9%, 정착 10/14 대 6/22 | AXE 스쿼드, 진단 직후(12월) |
| 사업·운영 그룹군의 권한·자료 접근을 먼저 연다. 필요한 데이터와 권한 요청 경로를 정한다 | 권한·자료 14건, 미적용 36% | AXE 스쿼드·데이터 담당, 2027년 1분기 |
| 성과 비교 기록을 업무 기록의 기본값으로 만든다. 기록지의 성과 칸을 팀 업무 기록 양식에 넣는다 | 미확인 16개 | AXE 스쿼드·AX 챔피언, 다음 진단 전 |
진단 목적 점검: 이 결과가 진단 목적에 답하는가
| 진단 목적 질문 | 이번 결과의 답 | 답의 확신 | 보완 방법 |
|---|---|---|---|
| 어디까지 적용됐나 | 48개 가운데 36개에 적용했고, 61%가 보조이다. 개발 그룹군만 부분 전환 이상이 절반을 넘는다 | 충분 | – |
| 성과로 이어지나 | 흐름을 바꾼 곳에서는 이어진다(개선 43%). 다만 적용한 곳의 44%(16개)는 확인하지 못했다 | 부분 | 3단계에서 비교 기록을 보완한다 |
| 무엇이 막나 | 자료·권한 접근(30건)과 검수·시간 같은 운영(17건)이 막는다 | 부분 | 개인 역량·조직 역량 결과와 교차해 원인을 확정한다 |
| 어디에 투자하나 | 흐름 재설계 지원, 사업·운영 접근, 비교 기록의 순서이다 | 부분 | 조직 역량 결과와 합쳐 우선순위를 확정한다 |
가상 데이터이며 실제 진단 결과가 아니다.
진단 이후 개선할 워크플로우의 순서를 정할 때 쓰는 도구이다. 이번 진단에서는 적용 우선순위를 보지 않는다.
우선순위는 두 축으로 판단한다. 워크플로우를 단계로 나눠 보고, 워크플로우 단위로 모은다. 축마다 아래 기준을 확인해 높음과 낮음으로 판정한다.
| 축 | 판단 기준 | 판정 | 근거 |
|---|---|---|---|
| 개선 가치 | ① 업무량·소요 시간의 비중이 크다 ② 자주 반복된다 ③ 대기·병목·재작업이 있다 ④ 결과가 고객이나 다른 팀의 일에 영향을 준다 | 4개 중 2개 이상이면 높음(기준안) | Desirability(IDEO), Business Value(Gartner) |
| AI 적합성 | ① 과업이 문서·코드·데이터·언어 중심이다 ② 필요한 자료에 디지털로 접근할 수 있다(사내 도구·연동 포함) ③ 결과를 사람이 확인하기 쉽다 ④ 오류의 영향을 검수로 막을 수 있다 | ①이 충족되고 나머지 중 2개 이상이면 높음(기준안) | ILO는 과업마다 생성형 AI로 수행할 수 있는 정도를 점수로 매긴다(ILO 2025). 도구와 연동이 붙으면 더 빨리 끝낼 수 있는 과업이 약 15%에서 47~56%로 늘어난다(Eloundou 외). 효과는 결과를 모니터링하기 쉬운 업무에서 크다(AI Index 2026) |
우선순위 사분면
사분면은 Gartner AI Use-Case Prism의 네 범주(Likely Wins, Calculated Risks, Marginal Gains, Selective Exceptions)를 따른다. 외부 레퍼런스와 선도 기업 사례는 AI 적합성을 판단하는 증빙으로 쓴다. 비슷한 업무에서 선도 사례가 있으면 적합성 판단의 근거가 강해진다.
개인 AX 역량은 실제 업무에서 AI의 역할을 판단하고, 필요한 결과물을 구성하며, 결과와 위험을 확인하고 개선할 수 있는 능력이다. 이 명세는 이 능력을 AX 공통 역량 4개와 AI 도구 활용 역량 6개, 모두 10개의 역량으로 나누어 진단한다. 10개 역량은 개발 직군과 비개발 직군에 모두 적용한다.
개인 역량 10개의 관계 구조
아래 그림은 10개 역량의 관계를 보여 준다. 한 업무 사례에서 판단·검증·안전·탐색 방법은 AX 공통 역량으로, 만든 결과물은 AI 도구 활용 역량으로 나누어 보며, 같은 사실을 두 번 판정하지 않는다. 데이터 역량 세 개는 결과물이 이어지지만 판정은 역량마다 따로 한다. 전수·확산은 조직 역량에서 본다.
역량 기준은 사내에서 제공하는 환경을 전제로 적용한다. 어시스턴트는 Claude를 중심으로 하고 ChatGPT 경험을 함께 포함한다. 데이터 역량은 사내 custom MCP와 Databricks, AI 코딩 제작은 Claude Code·Codex와 GitHub/Gitea·Cloudflare 등 담당 환경, 업무 자동화는 n8n을 기준으로 한다. 구체적인 기능은 루브릭의 실제 기능 수행 예와 설문의 행동 문장에 적었으며, 기능 개수로 레벨을 판정하지 않는다.
개발 직군의 특성은 별도 역량을 두지 않고 AI 코딩 제작의 직군별 루브릭에 담는다. 이전 버전에서는 제품 AI 기능 개발·품질 평가·보안을 별도 역량으로 두었으나, 모든 개발자가 하는 일이 아니어서 이 명세의 진단 범위에서 뺐다.
AX 공통 역량은 판단과 수행 방법을, AI 도구 활용 역량은 구성과 결과물을 본다. 10개 역량은 개발과 비개발 직군에 모두 적용한다.
| 구분 | 역량 | 판정 대상 |
|---|---|---|
| AX 공통 | 활용 판단·설계 | AI에 맡길 부분과 사람이 판단할 부분을 정하고, 업무 목적에 맞는 자료·제약·완료 조건·작업 순서를 구성한다. |
| AX 공통 | 결과 검증 | AI 결과의 근거·오류·누락·업무 품질을 확인하고 사용·수정·보류를 결정한다. |
| AX 공통 | 안전 사용 | 데이터·권한·실행·공유의 허용 범위를 판단하고 필요한 보호·확인·대응을 수행한다. |
| AX 공통 | 기술 탐색·학습 | 새로운 AI 기능을 실제 업무에 시험하고, 기존 방식과 비교해 채택·미채택을 판단한다. |
| AI 도구 활용 | 어시스턴트 업무 활용·구성 | 어시스턴트 안의 업무용 자료·지침·재사용 절차와 문서 결과 |
| AI 도구 활용 | 데이터 확보 | 업무용 데이터셋·테이블·뷰·메타데이터 |
| AI 도구 활용 | 데이터 분석 | 질의·분석 절차·분석 결과 |
| AI 도구 활용 | 대시보드 생성·공유 | 지표·차트·필터와 공유·갱신을 갖춘 대시보드 |
| AI 도구 활용 | AI 코딩 제작 | 스크립트·앱·업무 도구와 필요한 제작·적용 구성 |
| AI 도구 활용 | 업무 자동화 | 일정·이벤트로 실행되는 업무 처리 흐름 |
레벨은 수행 난도를 나타내는 축이다. 같은 L1~L5 번호를 쓰더라도 AX 공통 역량과 AI 도구 활용 역량은 관찰하는 측면이 다르므로 레벨 이름을 따로 둔다.
table2-1. 레벨 공통 기준
| 레벨 | AX 공통 역량 | 관찰 기준 | AI 도구 활용 역량 | 관찰 기준 |
|---|---|---|---|---|
| L1 | 도움 수행 | 구체적인 안내·예시를 받아 수행한다. | 사용 | 제공된 기능·결과물·구성을 사용한다. |
| L2 | 기본 자립 | 익숙하고 명확한 업무에서 기본 행동을 독립적으로 수행한다. | 수정 | 기존 조건·설정·결과물을 수정한다. |
| L3 | 업무 맞춤 | 업무 조건에 맞게 방법을 구성하고 확인한다. | 직접 구성 | 필요한 결과물을 직접 구성해 적용·검증한다. |
| L4 | 복잡한 상황 대응 | 비정형 조건·예외·실패에 맞춰 방법을 조정한다. | 결합과 예외 처리 | 기능을 결합하고 예외·실패를 처리한다. |
| L5 | 고도화·검증 | 기존 한계를 해결할 방식을 설계하고 검증한다. | 재설계와 검증 | 복잡한 요구에 맞추어 재설계하고 조건별로 검증한다. |
수준 사이의 구분 원칙
상태값: 하지 않았거나 확인되지 않은 경우
수행하지 않았거나 확인되지 않은 경우는 레벨이 아니라 상태로 기록한다. 상태값은 아래 네 가지이며, 응답자에게 보여 주는 상태 보기도 이 네 가지에 맞춘다. 응답자에게는 문항마다 '해 본 경험이 없다' 보기 하나를 '해 본 적 있다' 보기와 나란히 보여 준다. 이 보기를 고르면 네 가지 세부 이유 중 하나를 고르게 한다.
table2-2. 상태값 정의
| 상태 | 운영 코드 | 정의 | 응답자 보기 문구 |
|---|---|---|---|
| 경험 없음 | NOT_PERFORMED | 최근 3개월 동안 해당 행동을 수행하지 않았다. 필요한 상황과 기회가 있었지만 하지 못한 경우도 여기에 포함한다. | 필요한 상황은 있었지만 하지 못했다 |
| 기회 없음 | NO_OPPORTUNITY | 업무에서 해당 행동이 필요한 상황이나 기회가 없었다. | 필요한 상황이나 기회가 없었다 |
| 환경 제약 | ENV | 자료·도구·권한 등 환경 때문에 수행하기 어려웠다. | 자료·도구·권한 등 환경 때문에 하기 어려웠다 |
| 미확인 | U | 응답자가 판단하지 못했거나, 응답과 증빙으로 레벨을 확인할 수 없다. | 잘 모르겠다(판단하기 어렵다) |
역량을 펼치면 정의, 레벨별 행동(루브릭), 증빙, 판정 경계를 볼 수 있다. 표는 가로로 스크롤된다.
AX 공통 역량 4개
AX 공통 역량 4개는 개발·비개발 모두 같은 정의와 레벨 기준을 사용하며, 직군에 따라 별도의 상위 기준을 추가하지 않는다. 직군에 따라 달라지는 것은 업무 사례와 증빙의 형식뿐이다. 4개 역량 모두에 같은 경계 원칙을 적용한다. L3는 업무에 맞춘 수행을, L4는 복잡한 조건과 실패에 대한 조정을, L5는 기존 한계의 분석과 개선 검증을 확인한다. 단순한 설명 능력이나 자신감은 판정 근거가 아니다.
정의: AI에 맡길 부분과 사람이 판단할 부분을 정하고, 업무 목적에 맞는 자료·제약·완료 조건·작업 순서를 구성한다.
table3-1. 활용 판단·설계 레벨 기준
| 레벨 | 이름 | 관찰할 행동 |
|---|---|---|
| L1 | 도움 수행 | 구체적인 안내와 요청 예시를 받아 업무를 수행한다. |
| L2 | 기본 자립 | 익숙하고 명확한 업무에서 AI에 맡길 일을 정하고 목적·형식을 전달한다. |
| L3 | 업무 맞춤 | 자기 업무에서 AI와 사람의 역할을 나누고, 필요한 자료·제약·완료 조건·작업 순서를 직접 구성한다. |
| L4 | 복잡한 상황 대응 | 자료가 상충하거나 요구가 바뀌는 상황에서 작업을 재분해하고, 확인 지점·예외 경로를 조정해 해결한다. |
| L5 | 고도화·검증 | 기존 접근으로 해결되지 않는 문제의 원인을 분석해 수행 방식을 재설계하고, 대표·예외 사례에서 기존 한계가 해결됐는지 검증한다. |
증빙: 업무 분해·역할 구분, 입력 자료와 지침, 변경 전후 작업 절차, 실제 적용 결과
판정 경계: L3는 업무에 맞춘 수행, L4는 복잡한 조건·실패 조정, L5는 기존 한계 분석과 개선 검증을 확인한다. 단순한 설명 능력·자신감은 판정 근거가 아니다.
정의: AI 결과의 근거·오류·누락·업무 품질을 확인하고 사용·수정·보류를 결정한다.
table3-2. 결과 검증 레벨 기준
| 레벨 | 이름 | 관찰할 행동 |
|---|---|---|
| L1 | 도움 수행 | 확인할 항목과 방법을 안내받아 오류를 찾는다. |
| L2 | 기본 자립 | 익숙한 업무의 중요한 수치·주장을 원본과 대조하고 명백한 오류를 수정한다. |
| L3 | 업무 맞춤 | 업무에 맞는 검증 방법과 품질 기준(정확도·일관성·유용성 등)을 정해 근거·오류·누락을 확인한다. 확인한 근거를 설명하며 결과의 사용·수정·보류를 결정한다. |
| L4 | 복잡한 상황 대응 | 그럴듯한 오류·상충하는 근거·경계 조건을 발견하고, 추가 대조·시험으로 검증의 빈틈을 보완한다. 여러 단계로 처리하는 작업에서는 단계마다 품질 확인 지점을 둔다. |
| L5 | 고도화·검증 | 기존 검증이 놓치는 실패 유형을 분석해 검증 방식을 개선하고, 실제 실패·회귀 사례에서 검출 능력과 한계를 확인한다. 개선 범위에는 단계별 품질 확인 지점의 설계를 포함한다. |
증빙: 원본 대조, 테스트와 리뷰, 오류 발견·수정·보류 기록, 개선한 검증의 실제 검출 기록
판정 경계: L3는 업무에 맞춘 수행, L4는 복잡한 조건·실패 조정, L5는 기존 한계 분석과 개선 검증을 확인한다. 단순한 설명 능력·자신감은 판정 근거가 아니다.
정의: 데이터·권한·실행·공유의 허용 범위를 판단하고 필요한 보호·확인·대응을 수행한다.
table3-3. 안전 사용 레벨 기준
| 레벨 | 이름 | 관찰할 행동 |
|---|---|---|
| L1 | 도움 수행 | 안내받은 금지 정보·허용 도구·공유 기준을 적용한다. |
| L2 | 기본 자립 | 익숙한 업무에서 허용 범위를 확인하고, 민감정보를 제거하거나 모호한 작업을 보류한다. 입력하면 안 되는 개인정보·기밀 정보의 유형을 알고, 실제 요청을 작성할 때 해당 정보를 제외한다. |
| L3 | 업무 맞춤 | 입력·접근·실행·공유의 허용 범위를 판단하고, 필요한 보호 조치·확인·보류를 수행한다. |
| L4 | 복잡한 상황 대응 | 여러 도구 연결·외부 자료·자동 실행에서 새로운 위험을 식별하고, 담당 범위의 권한·확인·대체 경로를 조정한다. AI 에이전트에 작업을 맡길 때는 행동 범위 제한·실행 전 승인·오류 복구 절차를 둔다. |
| L5 | 고도화·검증 | 기존 대응으로 통제되지 않는 위험 경로를 분석해 담당 업무의 보호·승인·중단·복구 방식을 재설계하고, 위험·실패 상황에서 작동 여부를 검증한다. |
증빙: 정보 제거·권한·승인 설정, 예외 상담·보류 기록, 안전한 대체 경로와 통제 작동 확인
판정 경계: L3는 업무에 맞춘 수행, L4는 복잡한 조건·실패 조정, L5는 기존 한계 분석과 개선 검증을 확인한다. 단순한 설명 능력·자신감은 판정 근거가 아니다.
정의: 새로운 AI 기능을 실제 업무에 시험하고, 기존 방식과 비교해 채택·미채택을 판단한다.
table3-4. 기술 탐색·학습 레벨 기준
| 레벨 | 이름 | 관찰할 행동 |
|---|---|---|
| L1 | 도움 수행 | 안내받은 기능을 제시된 예제로 시험한다. |
| L2 | 기본 자립 | 새로운 기능을 익숙한 업무에 사용해 보고 적합성을 판단한다. |
| L3 | 업무 맞춤 | 필요한 새 기능을 스스로 찾아 실제 업무에서 기존 방식과 비교하고, 채택·미채택을 판단한다. |
| L4 | 복잡한 상황 대응 | 복잡한 과제에서 여러 기능·구성을 비교하고, 실패 원인에 따라 입력·설정·조합을 바꿔 적합한 방식을 찾는다. |
| L5 | 고도화·검증 | 기존 시험으로 구분하기 어려운 대안의 성능·한계·비용·위험을 확인할 비교 방법을 구성하고, 다양한 조건에서 선택 근거의 유효성을 검증한다. 비교에는 비용 대비 효과 분석을 포함한다. |
증빙: 업무 과제·비교 조건, 시험 결과, 채택·미채택 근거, 실패 후 재시험·조정 기록
판정 경계: L3는 업무에 맞춘 수행, L4는 복잡한 조건·실패 조정, L5는 기존 한계 분석과 개선 검증을 확인한다. 단순한 설명 능력·자신감은 판정 근거가 아니다.
AI 도구 활용 역량 6개
AI 도구 활용 역량 6개는 역량마다 구체 수행 루브릭과 실제 기능을 통한 수행 예를 함께 제시한다. 기능 예는 루브릭을 실제 수행에 연결하기 위한 예시이다. 해당 기능을 사용했다는 사실만으로 레벨을 확정하지 않으며, 나열한 기능을 모두 사용할 것을 요구하지 않는다. 사용한 도구·기능의 개수도 점수로 환산하지 않는다.
AI 코딩 제작을 제외한 5개 역량은 개발·비개발에 같은 루브릭을 적용한다. AI 코딩 제작은 실제 책임 범위가 직군에 따라 다르므로 직군별 루브릭을 사용한다. 업무 자동화는 루브릭이 같고, 수행 예와 설문 행동만 직군별로 나눈다.
정의: 업무에 맞는 자료·지침·재사용 절차를 구성해 문서 업무를 수행한다.
직군 적용: 개발·비개발에 같은 루브릭을 적용한다.
table4-1. 어시스턴트 업무 활용·구성 루브릭
| 레벨 | 구체 수행 루브릭 | 실제 기능을 통한 수행 예 |
|---|---|---|
| L1 사용 | 제공된 요청 예시나 공유 구성을 사용해 초안·요약을 얻고, 필요한 내용을 확인한다. 자료·지침·처리 절차를 본인이 구성하지는 않는다. | Claude 파일 업로드로 추출·요약하거나 공유 Skill을 실행한다(ChatGPT 파일 분석·업무용 GPT 사용). |
| L2 수정 | 기존 요청·지침·참고 자료를 자기 업무의 대상·형식·조건에 맞게 수정하고 결과를 확인한다. 이미 정해진 업무 절차 안에서 수정해 사용한다. | 기존 Projects 자료·프로젝트 지침·Skill 지침을 업무에 맞게 수정한다(ChatGPT Projects·GPT 지침/지식 자료 수정). |
| L3 직접 구성 | 업무 목적·참고 자료·작성 기준·완료 조건을 담은 재사용 구성을 직접 만들고 실제 문서 업무에 적용한다. 결과의 누락·형식을 확인해 구성을 수정한다. | Projects의 자료·프로젝트 지침 또는 반복 업무 Skill을 직접 구성해 적용·검증한다(ChatGPT Project·업무용 GPT 구성). |
| L4 결합과 예외 처리 | 여러 자료와 처리 단계를 연결하고, 자료 간 충돌·필수 입력 누락·업무 조건 변화에 대응하도록 구성한다. 문제가 생긴 단계를 찾아 자료·지침·절차를 조정한다. | Projects 자료·Skill 절차·허용된 Connectors 조회를 결합하고 자료 충돌·입력 누락에 대응한다(ChatGPT Projects·GPTs·Apps를 업무에 필요한 범위에서 조합). 허용된 Connectors로 사내 문서를 조회해 근거와 함께 답하는 질의응답 구성도 포함한다. |
| L5 재설계와 검증 | 기존 구성에서 반복되는 누락·맥락 혼선·품질 편차의 원인을 분석해 자료 선택과 처리 절차를 재설계한다. 대표 업무와 예외 사례를 같은 기준으로 비교해 개선 효과와 남은 한계를 확인한다. | Project·Skill의 자료 선택·처리 절차를 개선하고 대표·예외 입력으로 변경 전후 결과를 비교한다(ChatGPT의 대응 구성도 같은 방식으로 검증). |
증빙: 업무용 자료·지침, 변경 전후 문서, 누락·충돌 사례와 수정 결과
판정 경계: 문서 업무 구성을 본다. 분석 결과는 데이터 분석, 실행 가능한 앱은 AI 코딩 제작, 일정·이벤트 실행 흐름은 업무 자동화로 판정한다.
정의: 업무 목적에 맞는 데이터를 찾아 사용 가능한 자료로 구성하고 정의·갱신 조건을 관리한다.
직군 적용: 개발·비개발에 같은 루브릭을 적용한다.
table4-2. 데이터 확보 루브릭
| 레벨 | 구체 수행 루브릭 | 실제 기능을 통한 수행 예 |
|---|---|---|
| L1 사용 | 제공된 KPI 조회·데이터셋을 사용하고 대상·기간·단위를 확인한다. 필요한 자료를 본인이 새로 구성하지는 않는다. | 사내 custom MCP의 KPI 조회를 사용하거나 Databricks에서 제공된 데이터셋을 확인한다. |
| L2 수정 | 기존 조회의 기간·대상·필터·컬럼을 수정해 필요한 자료를 추출한다. 결과가 요청한 범위와 일치하는지 확인한다. | 사내 MCP 조회 조건이나 Databricks SQL Editor의 기간·필터·컬럼을 수정해 추출한다. |
| L3 직접 구성 | 업무에 필요한 출처·정의를 찾아 데이터셋이나 뷰를 직접 구성한다. 출처·기간·단위·사용 조건을 설명하는 메타데이터를 남기고 결과를 확인한다. | Databricks SQL Editor로 업무용 데이터셋·뷰를 만들고 테이블·컬럼의 정의·출처·기간·단위 메타데이터를 기록한다. |
| L4 결합과 예외 처리 | 여러 자료의 연결 기준·기간·집계 단위를 맞추고, 누락·중복·갱신 문제를 확인하는 절차를 구성한다. 자료 변경으로 생긴 문제를 찾아 수정한다. | SQL Editor·Notebooks에서 자료 결합과 누락·중복 확인을 구성하고 갱신 문제를 처리한다. |
| L5 재설계와 검증 | 반복되는 자료 변경·갱신 실패·결합 오류의 원인을 분석해 데이터 구성을 개선한다. 출처나 형식이 달라지는 조건에서 결과·갱신·복구를 시험하고 개선한 구성의 유효성을 확인한다. | 데이터셋·뷰·갱신 절차를 개선하고 자료 형식 변경·누락·갱신 실패 조건에서 결과와 복구를 확인한다. |
증빙: 조회 조건·데이터셋·뷰, 출처·정의·갱신 메타데이터, 결합·오류·복구 기록
판정 경계: 사내 MCP가 보장하는 원천 KPI 정합성을 다시 검증하거나 지표를 임의로 재정의하도록 요구하지 않는다. 조회 선택과 본인이 수행한 가공·결합을 확인한다. 분석 해석은 데이터 분석으로 판정한다.
정의: 분석 질문·계산·비교 절차를 구성하고 결과를 검증해 업무 판단에 사용한다.
직군 적용: 개발·비개발에 같은 루브릭을 적용한다.
table4-3. 데이터 분석 루브릭
| 레벨 | 구체 수행 루브릭 | 실제 기능을 통한 수행 예 |
|---|---|---|
| L1 사용 | 제공된 분석 질문이나 결과를 사용해 필요한 수치를 확인한다. 분석 조건과 계산을 본인이 구성하지는 않는다. | 사내 MCP로 KPI를 조회하거나 Claude에 허용된 파일의 기본 집계를 요청한다(ChatGPT 데이터 분석 포함). |
| L2 수정 | 기존 질문·쿼리·분석의 기간·대상·조건을 수정해 집계·비교한다. 수정한 조건이 결과에 반영됐는지 확인한다. | Databricks SQL Editor의 기존 쿼리 조건·집계를 수정하거나 기존 Notebook 분석을 수정한다. |
| L3 직접 구성 | 업무 질문에 맞는 지표·비교 기준·계산 또는 쿼리를 직접 구성한다. 분모·기간·집계 단위와 결과를 확인하고 업무 질문에 대한 해석을 제시한다. | Claude에 테이블·컬럼 설명과 분석 목적을 제공해 SQL을 만들고 Databricks에서 실행·수정·검증한다. 파일 분석·Notebooks의 AI 지원 코드 작성도 포함한다(ChatGPT 대응 경험 포함). |
| L4 결합과 예외 처리 | 여러 자료와 분석 단계를 연결해 복합 질문을 해결한다. 결측·중복·기간 차이·집단 차이가 결과에 미치는 영향을 확인하고 분석을 수정한다. | SQL Editor·Notebooks에서 여러 자료와 분석 단계를 연결하고 분모·결측·중복 영향 등을 확인한다. |
| L5 재설계와 검증 | 기존 분석이 잘못된 결론을 내리는 조건이나 재현이 어려운 원인을 찾아 절차를 개선한다. 대안 가정·조건 변화·민감도를 비교해 결론이 유지되는 범위와 한계를 확인한다. | 쿼리·Notebook·파일 분석 절차를 개선하고 같은 자료의 대안 가정·조건별 결과를 재현·비교한다. |
증빙: 질문·쿼리·분석 파일, 계산·조건, 검증·해석·조건별 비교 결과
판정 경계: SQL이나 코드 문법의 난도만으로 레벨을 올리지 않는다. 분석 목적과 결과의 타당성을 본다. 사용 가능한 원자료 구성은 데이터 확보, 지표 화면은 대시보드로 구분한다.
정의: 업무 판단에 필요한 지표 화면을 구성하고 사용·공유·갱신을 확인한다.
직군 적용: 개발·비개발에 같은 루브릭을 적용한다.
table4-4. 대시보드 생성·공유 루브릭
| 레벨 | 구체 수행 루브릭 | 실제 기능을 통한 수행 예 |
|---|---|---|
| L1 사용 | 공유된 대시보드의 지표를 읽고 필터로 필요한 범위를 조회한다. 화면과 지표를 본인이 제작하지는 않는다. | Databricks AI/BI 대시보드에서 지표를 읽고 필터를 사용한다. |
| L2 수정 | 기존 차트·필터·표시 조건을 자기 업무에 맞게 수정한다. 수정 후 표시되는 값과 범위를 확인한다. | 기존 대시보드의 차트·필터·표시 조건을 편집한다. |
| L3 직접 구성 | 업무 질문에 맞는 데이터·지표·차트·필터를 직접 구성한다. 필요한 공유·갱신을 설정하고 원자료와 화면의 수치·동작을 확인한다. | 대시보드의 데이터셋·지표·차트·필터를 만들고 Publish·공유 및 필요한 예약 갱신을 확인한다. |
| L4 결합과 예외 처리 | 여러 지표·조회 조건을 함께 구성하고, 화면 간 수치 불일치·필터 간 충돌·갱신·공유 문제를 찾아 해결한다. 실제 사용자의 조회 경로에서 동작을 확인한다. | 여러 지표·필터를 구성하고 데이터셋 불일치·갱신·공유 권한 문제를 찾아 수정한다. |
| L5 재설계와 검증 | 기존 화면이 잘못된 판단을 유도하거나 변경에 취약한 원인을 분석해 지표·화면·갱신 구성을 개선한다. 데이터·필터·권한·갱신 실패 조건을 시험해 개선 효과와 오류 대응을 확인한다. | 대시보드 데이터·화면·갱신 구성을 개선하고 필터·권한·갱신 실패 조건별 동작을 비교 검증한다. |
증빙: 대시보드·지표 정의, 공유·갱신 설정, 조건별 확인·수정 기록
판정 경계: 차트 수나 화면의 화려함으로 레벨을 판정하지 않는다. 의사결정에 필요한 지표의 정확성과 조회·공유·갱신 동작을 본다.
정의: AI를 활용해 실행 가능한 코드·앱을 만들거나 변경하고 검증해 적용한다.
직군 적용: 레벨의 의미는 두 직군에 공통이지만, 실제 책임 범위가 다르므로 직군별 수행 루브릭을 사용한다. 비개발 직군도 L5에 도달할 수 있으며, 이를 위해 제품 개발자가 될 것을 요구하지 않는다. 개발자에게 공통으로 기대하는 AI 엔지니어링(요구·기존 구조·맥락 제공, 코드·테스트 검토, 재현 가능한 검사, 검토 가능한 변경, 담당 범위의 전달·실패 대응)은 이 역량에서 확인한다.
table4-5. AI 코딩 제작 직군별 루브릭
| 레벨 | 비개발: 업무용 도구 제작 | 개발: 기존 제품·코드 변경과 안정 전달 | 실제 기능을 통한 수행 예 |
|---|---|---|---|
| L1 사용 | 제공된 AI 제작 코드·앱을 안내에 따라 실행하고 결과를 확인한다. 코드와 제작 구성을 직접 변경하지는 않는다. | 제공된 AI 개발 작업 구성을 사용해 코드·검사를 실행하고 결과를 확인한다. 기존 제품의 변경을 본인이 구성하지는 않는다. | Claude Code·Codex 등으로 제공된 코드·실행 구성을 사용해 실행·검사한다. |
| L2 수정 | AI의 도움으로 기존 스크립트·템플릿의 입력·출력·기능을 수정한다. 실행 오류를 해결하고 변경한 기능이 동작하는지 확인한다. | AI의 도움으로 기존 코드·테스트를 제한된 범위에서 수정한다. 실행 오류를 해결하고 변경한 기능과 관련 검사를 확인한다. | Claude Code·Codex로 기존 코드·테스트를 수정하고 오류를 해결한다. |
| L3 직접 구성 | 업무용 스크립트·앱을 직접 구성하고 실제 입력으로 기능을 시험한다. 오류를 수정하고 허용된 환경에 적용해 업무에 사용한다. | 요구사항·기존 구조·의존성을 반영한 변경을 구성한다. 코드와 테스트를 검토하고 관련 회귀를 확인해 담당 개발 절차에 반영하거나 검토 가능한 변경으로 인계한다. | Claude Code·Codex로 요구와 맥락을 제공해 코드를 구성하고 테스트·변경 검토를 수행한다. 업무 도구는 허용된 Cloudflare 적용, 제품 변경은 담당 저장소·전달 절차를 따른다. |
| L4 결합과 예외 처리 | 여러 데이터·외부 기능·상태 처리를 연결한 도구를 구성한다. 입력 오류·접근 권한·연결 실패·변경 영향을 처리하고 적용 후 동작을 확인한다. | 여러 모듈·인터페이스에 걸친 변경을 구성하고 영향·회귀·성능·보안 문제를 해결한다. 필요한 검사를 재현 가능하게 연결하고 담당 범위의 적용·실패 대응을 확인한다. | CLAUDE.md·AGENTS.md의 작업 지침, 필요한 MCP 연결·검사 명령을 작업에 연결하고 변경·실패에 대응한다. MCP 같은 표준 프로토콜로 데이터베이스·API·파일 등 외부 시스템을 연결하는 경우를 포함한다. 제품 변경은 GitHub/Gitea의 검토·필요한 CI 검사로 확인한다. |
| L5 재설계와 검증 | 기존 제작 방식이나 도구의 반복 오류·변경 취약성·성능 한계를 분석해 구조와 제작·검사 절차를 개선한다. 대표·경계·실패 조건에서 기능·성능·복구와 개선 효과를 검증한다. | 기존 AI 개발 방식에서 반복되는 맥락 누락·잘못된 변경·검사 누락을 분석해 맥락·작업·검사·피드백 구성을 개선한다. 대표 변경과 경계·회귀·실패 조건을 비교해 변경 품질과 전달 안정성의 개선을 검증한다. | 작업 지침·제작/검사 Skill·필요한 Hooks 또는 실행 스크립트를 개선하고, 대표 변경·실패·회귀 사례로 전후 결과를 검증한다. 모든 기능 사용을 요구하지 않는다. |
증빙: 코드·변경 기록·제작 지침, 테스트 결과, 적용·오류·복구·개선 기록
판정 경계: SQL 분석은 데이터 분석, 일정·이벤트 흐름은 업무 자동화로 판정한다. AI가 코드를 작성했어도 본인의 요구·구성·검증·수정 책임이 확인되면 제작으로 인정한다.
정의: 정해진 일정·이벤트에 따라 업무를 처리하는 흐름을 구성하고 실패에 대응한다.
직군 적용: 개발·비개발에 같은 루브릭을 적용한다. 본인이 직접 담당하는 시스템 연동이 있으면 그 사례의 검증에서 인터페이스·인증·중복·실패·복구 증빙을 확인한다.
두 직군의 레벨 기준은 같고, 수행 수단과 행동 보기만 다르다. 비개발은 n8n 중심의 자동화 흐름을 묻는다. 개발은 코드 기반 자동 실행을 묻는다.
table4-6. 업무 자동화 루브릭
| 레벨 | 구체 수행 루브릭 | 수행 예(비개발: n8n) | 수행 예(개발: 코드 기반 자동 실행) |
|---|---|---|---|
| L1 사용 | 제공된 자동화 흐름을 실행하거나 처리 결과를 사용하고 결과를 확인한다. 실행 흐름을 직접 구성하지는 않는다. | n8n의 제공된 워크플로우를 실행하거나 결과를 사용한다. | 팀이 만든 GitHub/Gitea Actions 워크플로나 Databricks 예약 Job을 실행하고 로그로 결과를 확인한다. |
| L2 수정 | 기존 흐름의 일정·대상·조건·입출력을 자기 업무에 맞게 수정한다. 수정한 조건으로 실행되는지 확인한다. | n8n Templates의 일정·조건·연결·입출력을 수정한다. | 기존 워크플로·Job의 cron 일정·트리거·입력 인자·환경 변수를 수정하고 실행을 확인한다. |
| L3 직접 구성 | 일정·이벤트에서 시작해 자료 조회·AI 처리·결과 전달까지 필요한 흐름을 직접 구성한다. 실제 입력으로 전체 과정을 실행하고 결과와 실행 기록을 확인한다. | n8n Schedule Trigger 또는 Webhook, 연결 노드·AI 처리 단계를 조합하고 Executions에서 실행 결과를 확인한다. | Actions·Cloudflare Workers Cron Triggers·Databricks Jobs 등으로 일정·이벤트에서 시작하는 작업을 코드로 구성한다. 조회·AI 모델 호출·전달까지 잇고 실행 기록을 확인한다. |
| L4 결합과 예외 처리 | 여러 서비스·조건 분기·승인·오류 처리·재시도를 업무에 필요한 범위에서 연결한다. 어느 단계에서 실패했는지 찾아 흐름을 수정하고 다시 확인한다. AI 에이전트가 도구를 실행하는 흐름에서는 행동 범위 제한·실행 전 승인·오류 복구 절차를 둔다. | n8n 조건 분기·Error Workflow·재시도·필요한 승인 단계를 구성하고 Executions에서 실패 원인을 확인한다. AI Agent의 도구 범위를 제한하고 도구 실행 전 사람의 승인을 받도록 구성한다. | 조건 분기·재시도·타임아웃·승인 단계·실패 알림을 넣고 로그로 실패 단계를 찾아 수정한다. AI가 외부 시스템에 쓰는 단계에는 권한 제한이나 승인을 둔다. |
| L5 재설계와 검증 | 기존 흐름의 반복 실패·중복 처리·지연·잘못된 실행 원인을 분석해 흐름과 실행 통제를 개선한다. 개선한 흐름에는 단계별 품질 확인 지점을 설계해 둔다. 연결 중단·잘못된 입력·중복 요청·승인 거절 등 해당 업무의 실패 조건에서 중단·재시도·복구를 검증한다. | n8n 흐름과 승인·중복 처리 방지·복구 구성을 개선하고 연결 실패·중복 요청·승인 거절 조건에서 검증한다. | 반복 실패·중복·지연 원인을 분석해 실행 구조·모니터링을 개선한다. 개선 구조에는 단계별 품질 확인 지점과 중복 처리 방지를 둔다. 연결 실패·중복 이벤트·승인 거절 조건에서 검증한다. |
증빙: 자동화 흐름·설정, 실행 기록, 실패·수정·승인·중복·복구 확인 결과. 개발 직군은 워크플로·Job 정의와 실행 로그로 확인한다.
판정 경계: 자동 실행이나 AI 노드 사용만으로 L3를 확정하지 않는다. 본인이 전체 흐름을 구성하고 실제 결과를 검증했는지 본다. 코드·앱 제작과 자동 처리 흐름의 증빙을 분리한다.
역량 사이의 판정 경계
AX 공통 역량은 판단과 수행 방법을 보고, AI 도구 활용 역량은 구성과 결과물을 본다. 두 영역은 서로 다른 측면이므로 하나의 배타적인 분류나 총점으로 다루지 않는다. 같은 사례에서 서로 다른 관찰 사실을 확인할 수는 있으나, 같은 행동이나 결과물을 두 번 판정하지 않는다.
table5-1. 역량 사이의 판정 경계
| 경계 | 구분 기준 |
|---|---|
| 활용 판단·설계 ↔ 어시스턴트 구성 | 무엇을 맡길지 정한 판단 ↔ 실제 자료·지침·절차 구성 |
| 결과 검증 ↔ 검사 구현 | 검사 적절성과 사용 여부 판단 ↔ 검사 코드·실행 구성 구현 |
| 안전 사용 ↔ 기술적 설정 | 허용 범위·대응 판단 ↔ 구현한 권한·승인·실행 설정 |
| 기술 탐색 ↔ 기능 넓이 | 대안 시험·채택 판단 ↔ 실제 수행한 기능 범위 |
| 데이터 확보 ↔ 분석 | 데이터셋·뷰가 주된 결과 ↔ 분석 결과가 주된 결과 |
| 분석 ↔ 대시보드 | 분석 질문과 결과 ↔ 지표 화면·공유·갱신 구성 |
| 코딩 제작 ↔ 자동화 | 업무용 코드·앱 ↔ 일정·이벤트 업무 처리 흐름 |
복합 사례는 독립적으로 확인할 수 있는 결과물과 행동으로 나누어 판정한다. AI가 SQL을 작성했더라도 분석이 목적이면 데이터 분석로 분류한다. 반복 문서 업무를 위한 Skill은 어시스턴트 업무 활용·구성에, 제작·검사를 위한 Skill은 AI 코딩 제작에 배치한다. 개선·운영·전수 교육은 별도 역량으로 추가하지 않는다.
AX 공통 역량의 직군 적용
AX 공통 역량 4개는 두 직군의 기준이 완전히 같다. 개발자의 코드 리뷰와 비개발자의 원문 대조는 서로 다른 검증 방법이지만, 결과 검증에서는 같은 L3·L4·L5 원칙으로 판정한다. 개발 직군이라는 이유만으로 AX 공통 역량에 테스트나 CI 구현을 추가로 요구하지 않는다.
table5-2. AX 공통 역량의 직군별 사례와 판정 원칙
| 공통 역량 | 비개발의 사례 | 개발의 사례 | 판정 원칙 |
|---|---|---|---|
| 활용 판단·설계 | 보고서에서 AI 초안과 사람의 판단을 구분 | 코드 변경에서 AI 작업과 사람의 검토를 구분 | 업무 조건·역할·완료 조건·예외 대응 기준 동일 |
| 결과 검증 | 요약·수치·분모·원문 대조 | 코드 리뷰·테스트 결과·회귀 확인 | 검증 방법의 적절성과 실패 발견·개선 기준 동일 |
| 안전 사용 | 민감정보 제거·공유 범위 확인 | 비밀정보·명령·연결 권한 확인 | 허용 범위 판단·보호·보류·대응 기준 동일 |
| 기술 탐색·학습 | 문서 구성 대안의 품질·수정 부담 비교 | 개발 도구·맥락 구성 대안의 변경 품질 비교 | 실제 과제 비교·채택 판단·실패 후 개선 기준 동일 |
AI 도구 활용 역량의 직군 적용
같은 직군 안에서도 업무가 다르므로, 직군만을 이유로 데이터·대시보드·자동화의 기술 난도를 높이지 않는다.
table5-3. AI 도구 활용 역량의 직군별 적용 차이
| 역량 | 비개발 | 개발 | 무엇이 달라지는가 |
|---|---|---|---|
| 어시스턴트 업무 활용·구성 | 문서·보고·기획 업무의 자료·지침 구성 | 개발 관련 문서·설계 정리의 자료·지침 구성 | 루브릭 동일. 코드 제작·검사 구성은 AI 코딩 제작으로 판정 |
| 데이터 확보 | KPI·업무 자료를 목적에 맞게 추출·구성 | 개발 과제의 데이터·스키마·연결 조건을 목적에 맞게 구성 | 루브릭 동일. 데이터 플랫폼 구축을 개발자 전원에게 요구하지 않음 |
| 데이터 분석 | 업무 지표·집단·기간 비교와 해석 | 제품·운영·실험·성능 자료의 비교와 해석 | 루브릭 동일. 코드 문법·자료 크기만으로 상향하지 않음 |
| 대시보드 생성·공유 | 업무·의사결정 지표 화면 제작 | 제품·운영 지표 화면 제작 | 루브릭 동일. 개발자에게 대시보드 제작을 일괄 상위 요구하지 않음 |
| AI 코딩 제작 | 자신의 업무를 위한 스크립트·앱을 제작·적용 | 기존 코드·설계·의존성에 맞는 변경을 검증해 안정 전달 | 직군별 루브릭. 개발은 기존 구조 적합성·회귀·변경 검토·전달 증빙을 확인 |
| 업무 자동화 | n8n으로 조회·문서·알림·승인 등의 업무 흐름 구성 | 코드 기반 자동 실행(Actions·예약 Job 등)으로 일정·이벤트 작업 구성 | 레벨 기준 동일, 수행 수단과 설문 행동만 직군별. 직접 담당하는 시스템 연동이 있으면 인터페이스·인증·중복·실패·복구 증빙을 확인 |
업무 자동화의 레벨 원칙은 두 직군이 같고, 수단만 다르다. 비개발은 n8n으로, 개발은 코드 기반 자동 실행으로 수행한다. 예를 들어 L3는 두 직군 모두 전체 흐름의 구성·실행·검증이 필요하다. 개발자가 API를 직접 연결했다면 요청·응답·인증 처리를 그 사례의 검증에 포함한다. L4는 관련 예외와 재시도를, L5는 기존 실패 원인의 개선과 중복·연결 실패·복구 조건의 검증을 확인한다. 개발자 모두에게 API·비동기·고부하 처리를 요구하는 별도의 보편 기준은 만들지 않는다. 같은 코드를 질문 9와 질문 10에서 두 번 판정하지 않는다. 질문 9 개발 묶음은 코드 변경의 품질과 전달을 본다. 질문 10 개발 묶음은 그 코드가 일정·이벤트로 실행되고 실패에 대응하는 운영 흐름을 본다.
AX 공통 역량에서는 판단의 적절성을, AI 도구 활용 역량에서는 구현한 코드·검사·전달 구성을 확인하므로 같은 사실을 중복으로 판정하지 않는다. 직접 운영 배포 권한이 없다면 검증된 변경, 리뷰, 인계 기록으로 확인한다. 업무용 도구는 전사 AX 배포 환경을, 제품 변경은 담당 제품의 전달 절차를 따른다. 비개발 직군이 실제 개발 역할을 맡은 사례라면 그 책임 범위에 맞는 검증을 확인하며, 직군만을 이유로 수행 상한을 두지 않는다.
설문 화면은 개인 역량 설문에서 직접 볼 수 있다.
설문 공통 규칙
문항 형식: 누적 사다리
질문 1~10은 모두 같은 누적 사다리로 답한다. 상위 단계를 수행한 사람은 하위 단계의 행동도 수행했을 가능성이 높다. 한 단계만 고르는 방식으로는 여러 단계에 걸친 경험을 표현할 수 없다. 10문항이 같은 방식이므로 응답자 안내도 단순해진다.
사다리의 단계 이름은 응답자가 바로 이해할 수 있는 행동 문장으로 쓴다. 단계 이름은 역량 영역마다 다르다. 각 단계는 table2-1에서 번호가 같은 레벨에 대응한다.
첫 선택에서는 '해 본 적 있다'와 '해 본 경험이 없다' 중 하나를 고른다. '해 본 경험이 없다'를 고르면 세부 이유 4개(table2-2의 상태값) 중 하나를 고른다. 이 경우 행동 체크와 사례는 건너뛴다.
table8-1. 문항의 단계
| 단계 | 내용(질문 1~10 공통) |
|---|---|
| 1. 첫 선택 | '해 본 적 있다'와 '해 본 경험이 없다' 중 하나를 고른다. '해 본 경험이 없다'를 고르면 세부 이유를 받는다. |
| 2. 행동 체크 | 누적 사다리: 1단계 행동 3개부터 보여 준다. 한 단계에서 2개 이상 체크하면 다음 단계 행동이 열린다. |
| 3. 사례 | 자기보고 레벨이 L3 이상이면 항목별 사례를 필수로 받는다. 앞에서 쓴 사례를 다시 지정할 수 있다. |
| 4. 적용 상태 | 한 번·여러 번·정기 중 하나를 고른다. 사례와 별개이다. |
체크 결과는 질문 1~10 모두 아래와 같이 처리한다. 이 처리는 자기보고 후보를 정하는 규칙이며, 확인 레벨은 판정 절차에 따라 AXE 스쿼드가 판정한다.
table8-2. 체크 결과의 처리
| 체크 결과 | 기록 |
|---|---|
| 1단계부터 끊기지 않고 2개 이상 체크한 가장 높은 단계 | 그 단계를 자기보고 레벨로 인정한다. 하위 단계의 행동을 하나 빠뜨려도 레벨이 내려가지 않는다. |
| 1단계에서 1개만 체크 | L1을 잠정 기록하고, AXE 스쿼드 검토 대상으로 표시한다. |
| 1단계에서 하나도 체크하지 않음 | 응답을 마칠 수 없다. 행동을 체크하거나 '해 본 경험이 없다'를 고르게 한다. |
누적 사다리는 높은 단계의 사람이 낮은 단계의 일도 대개 해 봤다는 전제를 10개 역량 모두에 둔다. 사다리는 이 전제를 응답으로 확인한다. 자기 단계를 높게 고르는 과대보고도 줄인다. 체크한 행동 전체가 기록되므로 어떤 행동과 기능을 쓰는지도 함께 집계할 수 있다.
자기보고 레벨이 L3 이상이면 사례를 아래 항목으로 나눠 받는다. 필수 항목은 각각 10자 이상 입력해야 한다.
칸마다 해당 역량에 맞춘 예시를 보여 준다. 앞 질문에서 쓴 사례를 다시 지정할 수도 있다. 이때도 역량마다 판정에 쓰는 사실은 구분한다.
질문 5(어시스턴트 업무 활용·구성)를 예로 들면, 응답자 화면은 다음과 같다. 응답자가 3단계까지 채운 경우를 보여 준다.
질문 5. 최근 3개월 동안 Claude(또는 ChatGPT)를 실제 업무에 활용한 경험을 알려 주세요.
해 본 것을 모두 체크해 주세요. 한 단계에서 2개 이상 체크하면 다음 단계가 열립니다.
1단계 · 써 봤다: [x] 파일을 올려 요약·추출을 받았다 [ ] 공유받은 Skill로 초안을 얻었다 [x] 받은 결과가 맞는지 확인했다
2단계 · 고쳐 썼다: [x] [x] [x]
3단계 · 직접 만들었다: [x] [x] [ ]
4단계 · 결합하고 예외까지 처리했다: [ ] [ ] [ ]
사례(필수) 고객 정보·개인정보·사내 기밀은 적지 마세요.
적용 상태
위 예의 자기보고 레벨은 L3이므로 항목별 사례를 받는다. 1단계에서 공유 Skill 행동을 체크하지 않았지만 2개를 체크했으므로 1단계를 채운 것으로 본다. 질문 1~4도 같은 화면을 쓴다. 단계 이름만 '1단계 · 도움을 받아 했다'처럼 AX 공통 역량의 단계 이름으로 표시한다.
응답자 안내문
최근 3개월 동안의 실제 업무 경험을 기준으로 답해 주세요. AI의 도움을 받았더라도 본인이 목적과 조건을 정하고 결과를 확인·수정한 경험은 포함합니다. 실제 업무에 적용하지 않은 교육·연습 경험은 제외해 주세요. 결과는 본인 피드백과 지원 설계에만 사용하며 보상·승진·인사평가에 사용하지 않습니다.
답하는 방법: 10개 문항 모두 같은 방식으로 답합니다. '해 본 적 있다'를 고르면 1단계 행동부터 해 본 것을 모두 체크해 주세요. 한 단계에서 2개 이상 체크하면 다음 단계가 열립니다. 해 본 경험이 없다면 '해 본 경험이 없다'를 고르고 그 이유를 골라 주세요. 3단계 이상까지 체크하면 사례를 항목별로 적어 주세요.
기본 정보: 이름, 사내 이메일, 소속 그룹을 적어 주세요.
기본 정보의 소속 그룹은 [조직 운영 및 소속 확인] 위키의 그룹 목록을 쓴다. DX개발그룹과 CP개발그룹을 고르면 질문 9·10에 개발용 단계 보기와 행동을 보여 준다. 이 분기는 응답자에게 따로 안내하지 않는다. 사례에 고객 정보·개인정보·사내 기밀을 적지 말라는 안내는 사례 입력 칸에 둔다.
표의 레벨 열은 설계용이며 응답자에게 표시하지 않는다. '해 본 경험이 없다'의 세부 이유는 상태값 표의 응답자 보기 문구를 쓴다.
질문 1 (활용 판단·설계)
AI에 맡길 부분과 사람이 판단할 부분을 정하고, 필요한 자료와 작업 순서를 구성한 경험이 있는지 알려 주세요.
예: 실적 보고서에서 데이터 조회·초안은 AI에 맡기고, 지표 해석과 최종 승인은 사람이 수행하도록 구성한 경험
table8-3. 질문 1 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 안내나 요청 예시를 받아 AI에 업무를 맡겼다. | 안내받은 요청 예시를 사용해 AI에 업무를 요청했다. | AI에 맡길 일을 동료나 안내 자료의 도움을 받아 정했다. | 안내받은 순서에 따라 AI 결과를 업무에 반영했다. |
| L2 | 익숙한 업무에서 AI에 맡길 일을 스스로 정하고 요청했다. | 익숙한 업무에서 AI에 맡길 일을 스스로 골랐다. | 요청에 결과물의 목적을 적어 전달했다. | 요청에 원하는 출력 형식(표, 분량 등)을 지정했다. |
| L3 | 내 업무에 맞게 AI와 사람의 역할, 자료, 작업 순서를 직접 구성했다. | 업무에서 AI가 맡을 부분과 내가 판단할 부분을 나누어 정했다. | 필요한 참고 자료와 제약 조건을 골라 AI에 제공했다. | 완료 조건과 작업 순서를 정해 AI 작업을 진행했다. |
| L4 | 자료끼리 내용이 다르거나 요구가 바뀐 상황에서 작업을 다시 나누어 해결했다. | 자료끼리 내용이 다를 때 기준을 정해 작업을 다시 나누었다. | 업무 요구가 바뀐 뒤 AI 작업 순서와 지침을 조정했다. | 예외 상황에 대비해 중간 확인 단계나 별도 처리 방법을 추가했다. |
| L5 | 기존 방식으로 풀리지 않던 문제의 원인을 찾아 수행 방식을 다시 설계하고 검증했다. | 기존 AI 활용 방식이 반복해서 실패한 원인을 분석했다. | 분석한 원인을 바탕으로 업무를 나누는 방식과 수행 방식을 다시 설계했다. | 대표 사례와 예외 사례에 새 방식을 적용해 한계가 해결됐는지 확인했다. |
질문 2 (결과 검증)
AI 결과의 근거·수치·오류·누락을 확인하고 사용·수정·보류를 결정한 경험이 있는지 알려 주세요.
예: 요약의 누락을 원문에서 발견하거나, 분석의 분모 오류를 확인하거나, AI가 고친 코드 때문에 원래 되던 기능이 고장 난 것을 찾아낸 경험
table8-4. 질문 2 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 안내받은 확인 항목에 따라 AI 결과의 오류를 찾았다. | 안내받은 확인 항목 목록에 따라 AI 결과를 읽었다. | 안내받은 방법으로 AI 결과에서 틀린 내용을 찾았다. | 찾은 오류를 안내에 따라 수정했다. |
| L2 | 익숙한 업무에서 AI 결과의 중요한 수치·주장을 원본과 대조했다. | AI 결과의 중요한 수치를 원본 자료와 대조했다. | AI 결과의 핵심 주장이 원문에 있는지 확인했다. | 대조에서 발견한 명백한 오류를 직접 수정했다. |
| L3 | 업무에 맞는 확인 방법과 품질 기준으로 AI 결과를 확인하고 사용 여부를 정했다. | 업무에 맞는 확인 방법을 골라 AI 결과의 근거·오류·누락을 확인했다. | 정확도·일관성·유용성 등 품질 기준을 세워 AI 결과에 적용했다. | AI 결과를 수정 없이 쓸 수 있는지 근거를 들어 판단했다. |
| L4 | 그럴듯한 오류나 서로 맞지 않는 근거를 찾아내 추가로 대조·시험했다. | 그럴듯해 보이지만 틀린 AI 결과를 찾아냈다. | 서로 맞지 않는 근거나 예외적인 경우를 추가로 대조하거나 시험해 확인했다. | 여러 단계로 처리한 작업에서 단계마다 품질 확인 지점을 두었다. |
| L5 | 기존 확인 방법이 놓치는 오류 유형을 찾아 확인 방식을 개선하고 검증했다. | 기존 확인 방법이 반복해서 놓친 오류 유형을 분석했다. | 단계별 품질 확인 지점을 포함해 확인 방식을 다시 설계했다. | 실제로 틀렸던 사례에 개선한 확인 방식을 적용해 오류를 잡는지 확인했다. |
질문 3 (안전 사용)
AI에 제공할 정보와 접근·실행·공유 범위를 확인하고, 필요한 조치를 한 경험이 있는지 알려 주세요.
예: 입력 금지 개인정보·기밀을 빼고 요청을 작성하거나, 자동 전송을 승인 뒤 실행하도록 조정하거나, 허용 여부를 담당자에게 확인한 경험
table8-5. 질문 3 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 안내받은 금지 정보·허용 도구 기준에 따라 AI를 사용했다. | 안내받은 금지 정보 목록에 따라 해당 정보를 AI 요청에서 뺐다. | 회사가 허용한 AI 도구만 업무에 사용했다. | 안내받은 공유 기준에 따라 AI 결과의 공유 대상을 정했다. |
| L2 | 익숙한 업무에서 입력하면 안 되는 정보를 스스로 빼고 AI를 사용했다. | 요청 전에 자료에 개인정보·기밀 정보가 있는지 스스로 확인했다. | 확인한 개인정보·기밀 정보를 지우거나 가린 뒤 요청을 작성했다. | 허용 여부가 모호한 작업은 확인될 때까지 보류했다. |
| L3 | 입력·접근·실행·공유 범위를 판단하고 필요한 보호 조치를 했다. | 업무 자료를 AI에 넣어도 되는 범위를 자료별로 판단했다. | AI가 접근하거나 실행할 수 있는 범위를 업무에 필요한 만큼으로 정했다. | AI 결과를 다른 팀이나 외부에 공유하기 전에 공유 범위를 확인했다. |
| L4 | 여러 도구 연결이나 자동 실행에서 새 위험을 찾아 권한·승인·대체 경로를 조정했다. | 여러 도구 연결·외부 자료·자동 실행에서 새 위험을 찾아 AI의 행동 범위를 제한했다. | 위험한 실행 앞에 사람이 승인하는 단계를 두었다. | 오류가 생기면 실행을 멈추고 복구하는 대체 경로를 마련했다. |
| L5 | 기존 대응으로 막지 못한 위험의 원인을 분석해 보호·중단·복구 방식을 다시 설계하고 검증했다. | 기존 보호 조치로 막지 못한 위험이 어디서 생기는지 분석했다. | 담당 업무의 보호·승인·중단·복구 방식을 다시 설계했다. | 위험·실패 상황을 다시 만들어 보고 새 보호 조치가 작동하는지 확인했다. |
질문 4 (기술 탐색·학습)
새로운 AI 기능을 실제 업무에 시험하고, 기존 방식과 비교해 사용할지 판단한 경험이 있는지 알려 주세요.
예: 새 Skill을 기존 작업 방식과 같은 자료로 비교하고 품질·수정 부담을 확인해 채택하거나 제외한 경험
table8-6. 질문 4 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 안내받은 새 AI 기능을 제시된 예제로 시험했다. | 안내받은 새 기능을 교육이나 공지의 예제로 실행했다. | 예제 실행 결과가 안내와 같은지 확인했다. | 시험 중 막힌 부분을 안내 자료나 동료에게 물어 해결했다. |
| L2 | 새 AI 기능을 익숙한 업무에 써 보고 계속 쓸지 판단했다. | 새 AI 기능을 익숙한 업무 하나에 직접 써 보았다. | 새 기능을 쓴 결과에서 잘된 점과 부족한 점을 확인했다. | 확인한 내용을 바탕으로 그 업무에 계속 쓸지 정했다. |
| L3 | 필요한 새 기능을 직접 찾아 기존 방식과 비교하고 채택 여부를 정했다. | 업무 문제를 해결할 새 AI 기능을 스스로 찾았다. | 같은 업무 자료로 새 기능과 기존 방식의 결과를 비교했다. | 품질·수정 부담의 비교 결과를 근거로 채택이나 제외를 정했다. |
| L4 | 여러 기능·구성을 비교하고 실패 원인에 따라 설정·조합을 바꾸어 맞는 방식을 찾았다. | 복잡한 과제에 맞는 여러 기능이나 구성을 함께 비교했다. | 시험이 실패했을 때 실패 원인을 찾았다. | 실패 원인에 따라 입력·설정·조합을 바꾸어 다시 시험했다. |
| L5 | 대안의 성능·한계·비용·위험을 비교하는 방법을 만들고 여러 조건에서 선택 근거를 검증했다. | 기존 시험으로 구분하기 어려운 대안을 비교할 방법과 기준을 만들었다. | 대안별 성능·한계·위험과 비용 대비 효과를 분석했다. | 여러 조건에서 다시 시험해 선택 근거가 유지되는지 확인했다. |
질문 5 (어시스턴트 업무 활용·구성)
최근 3개월 동안 Claude(또는 ChatGPT)를 실제 업무에 활용한 경험이 있는지 알려 주세요. 주로 사용하는 도구를 기준으로 답해 주세요.
table8-7. 질문 5 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | Claude(ChatGPT)에 파일을 올리거나 공유받은 Skill로 초안·요약을 얻었다. | Claude에 업무 파일을 올려 요약이나 추출을 받았다(ChatGPT 포함). | 동료가 공유한 Skill을 실행해 초안을 얻었다(업무용 GPT 포함). | 받은 초안·요약에서 필요한 내용이 맞는지 확인했다. |
| L2 | 기존 Project 지침이나 Skill 지침을 내 업무에 맞게 고쳐 썼다. | 기존 Project의 지침을 내 업무의 대상·형식에 맞게 수정했다(ChatGPT Projects 포함). | 기존 Skill의 지침이나 참고 자료를 내 업무 조건에 맞게 수정했다(GPT 지침 포함). | 수정한 구성으로 만든 결과가 의도대로 나오는지 확인했다. |
| L3 | 업무용 Project나 반복 업무 Skill을 직접 만들어 실제 문서 업무에 적용했다. | 업무 목적·참고 자료·완료 조건을 담은 Project나 반복 업무 Skill을 직접 만들었다(ChatGPT Project·업무용 GPT 포함). | 직접 만든 구성을 실제 문서 업무에 적용했다. | 결과의 누락·형식 오류를 확인해 구성을 수정했다. |
| L4 | Project 자료·Skill·Connectors를 결합하고 자료 충돌·입력 누락에 대응하도록 구성했다. | Project 자료와 Skill 절차, 허용된 Connectors 조회를 한 작업에 결합했다(ChatGPT Apps 포함). | 허용된 Connectors로 사내 문서를 조회해 근거와 함께 답하는 질의응답을 구성했다. | 자료 충돌이나 필수 입력 누락이 생긴 단계를 찾아 자료·지침을 조정했다. |
| L5 | 기존 구성의 반복 오류 원인을 찾아 다시 설계하고, 변경 전후 결과를 비교했다. | Project·Skill 결과에서 반복되는 누락·맥락 혼선의 원인을 분석했다. | 분석한 원인에 맞게 자료 선택과 처리 절차를 다시 설계했다. | 대표 입력과 예외 입력으로 변경 전후 결과를 비교했다. |
질문 6 (데이터 확보)
업무에 필요한 데이터를 찾아 쓸 수 있는 자료로 만든 경험이 있는지 알려 주세요. AI의 도움을 받은 경험을 포함합니다.
table8-8. 질문 6 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 사내 custom MCP의 KPI 조회나 제공된 Databricks 데이터셋을 사용했다. | 사내 custom MCP로 제공된 KPI를 조회했다. | Databricks에서 제공된 데이터셋을 열어 필요한 값을 찾았다. | 조회한 데이터의 대상·기간·단위를 확인했다. |
| L2 | 기존 조회의 기간·필터·컬럼을 수정해 필요한 데이터를 추출했다. | 기존 MCP 조회의 기간이나 대상 조건을 바꾸어 조회했다. | Databricks SQL Editor에서 기존 쿼리의 필터·컬럼을 수정해 추출했다. | 추출 결과가 요청한 범위와 일치하는지 확인했다. |
| L3 | 업무용 데이터셋이나 뷰를 직접 만들고 출처·정의 메타데이터를 남겼다. | 업무에 필요한 테이블·컬럼의 출처와 정의를 찾았다. | SQL Editor로 업무용 데이터셋이나 뷰를 직접 만들었다. | 출처·정의·기간·단위를 설명하는 메타데이터를 기록했다. |
| L4 | 여러 자료를 결합하고 누락·중복·갱신 문제를 확인하는 절차를 만들었다. | 여러 자료의 연결 키·기간·집계 단위를 맞추어 결합했다. | 결합 결과의 누락·중복을 확인하는 절차를 만들었다. | 원천 자료 변경으로 생긴 갱신 문제를 찾아 수정했다. |
| L5 | 반복되는 자료 변경·갱신 실패의 원인을 찾아 데이터 구성을 개선하고 검증했다. | 반복되는 자료 변경·갱신 실패·결합 오류의 원인을 분석했다. | 데이터셋·뷰·갱신 절차를 원인에 맞게 개선했다. | 형식 변경·누락·갱신 실패 조건에서 결과와 복구를 시험했다. |
질문 7 (데이터 분석)
분석 질문을 세우고 계산·비교해 업무 판단에 사용한 경험이 있는지 알려 주세요. AI의 도움을 받은 경험을 포함합니다.
table8-9. 질문 7 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 사내 MCP나 Claude(ChatGPT)로 필요한 수치와 기본 집계를 확인했다. | 사내 custom MCP로 KPI 수치를 조회했다. | Claude에 허용된 파일을 올려 기본 집계를 요청했다(ChatGPT 포함). | 받은 수치가 필요한 대상·기간의 값인지 확인했다. |
| L2 | 기존 쿼리나 Notebook 분석의 조건을 수정해 집계·비교했다. | Databricks SQL Editor의 기존 쿼리에서 기간·대상 조건을 수정했다. | 기존 Notebook 분석의 집계 조건을 수정해 다시 실행했다. | 수정한 조건이 결과에 반영됐는지 확인했다. |
| L3 | 업무 질문에 맞는 지표와 계산을 직접 구성하고 결과를 검증해 해석했다. | 업무 질문에 맞는 지표와 비교 기준을 직접 정했다. | Claude에 테이블·컬럼 설명과 분석 목적을 주고 만든 SQL을 Databricks에서 실행·수정했다(ChatGPT 포함). | 분모·기간·집계 단위를 확인한 뒤 결과를 업무 질문에 맞게 해석했다. |
| L4 | 여러 자료와 분석 단계를 연결하고 결측·중복·기간 차이의 영향을 확인했다. | 여러 자료와 분석 단계를 연결해 복합 질문을 분석했다. | 결측·중복이 결과에 미치는 영향을 확인했다. | 기간·집단 차이의 영향을 반영해 분석과 해석을 수정했다. |
| L5 | 기존 분석이 잘못된 결론을 내는 원인을 찾아 절차를 개선하고 조건별로 검증했다. | 기존 분석이 잘못된 결론을 내거나 재현되지 않는 원인을 찾았다. | 찾은 원인에 맞게 쿼리·Notebook·분석 절차를 개선했다. | 대안 가정과 조건별 결과를 비교해 결론이 유지되는 범위를 확인했다. |
질문 8 (대시보드 생성·공유)
업무 판단에 필요한 지표 화면을 만들거나 고친 경험이 있는지 알려 주세요. AI의 도움을 받은 경험을 포함합니다.
table8-10. 질문 8 단계 보기와 행동
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 공유된 Databricks AI/BI 대시보드의 지표를 필터로 조회했다. | 공유받은 Databricks AI/BI 대시보드에서 필요한 지표를 읽었다. | 대시보드 필터로 필요한 기간·대상을 조회했다. | 조회한 지표의 정의나 기준 시점을 확인했다. |
| L2 | 기존 대시보드의 차트·필터·표시 조건을 업무에 맞게 수정했다. | 기존 대시보드의 차트를 업무에 맞게 수정했다. | 기존 필터나 표시 조건을 업무에 맞게 바꾸었다. | 수정 후 표시되는 값과 범위를 확인했다. |
| L3 | 데이터·지표·차트·필터를 직접 구성하고 공유·갱신을 설정했다. | 업무 질문에 맞는 데이터셋·지표·차트·필터를 직접 만들었다. | 대시보드를 Publish하고 공유 권한과 필요한 예약 갱신을 설정했다. | 원자료와 화면의 수치가 일치하는지 확인했다. |
| L4 | 여러 지표·필터를 함께 구성하고 수치 불일치·갱신·공유 문제를 해결했다. | 여러 지표와 조회 조건을 한 대시보드에 함께 구성했다. | 화면 간 수치 불일치나 필터 충돌을 찾아 수정했다. | 갱신 실패나 공유 권한 문제를 찾아 해결했다. |
| L5 | 잘못된 판단을 유도하는 화면 구성의 원인을 찾아 개선하고 실패 조건에서 검증했다. | 기존 화면이 잘못된 판단을 유도하거나 변경에 취약한 원인을 분석했다. | 지표·화면·갱신 구성을 원인에 맞게 개선했다. | 필터·권한·갱신 실패 조건별로 개선한 화면의 동작을 확인했다. |
질문 9 (AI 코딩 제작)
AI를 활용해 실행 가능한 코드·앱을 만들거나 변경한 경험이 있는지 알려 주세요. AI의 도움을 받은 경험을 포함합니다.
직군 응답에 따라 아래 두 표 중 하나의 단계 보기와 행동 묶음만 표시한다. 이 안내는 설문 구현용이며 응답자에게 표시하지 않는다.
table8-11. 질문 9 단계 보기와 행동(비개발)
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 제공된 AI 제작 코드·앱(Claude Artifacts 포함)을 실행해 결과를 확인했다. | 제공된 스크립트를 안내에 따라 실행했다. | 공유받은 Claude Artifacts 앱을 업무에 사용했다. | 실행 결과가 기대한 결과와 같은지 확인했다. |
| L2 | Claude Code(Codex·Cursor·Copilot 포함)로 기존 스크립트·템플릿을 수정하고 오류를 해결했다. | Claude Code(Codex·Cursor·Copilot 포함)로 기존 스크립트·템플릿의 입력·출력·기능을 수정했다. | 수정 중 생긴 실행 오류를 AI 도움으로 해결했다. | 변경한 기능이 실제로 동작하는지 확인했다. |
| L3 | 업무용 스크립트·앱을 직접 만들어 시험하고 허용된 환경에 적용해 사용했다. | Claude Code(Codex·Cursor·Copilot 포함)로 업무용 스크립트·앱을 직접 만들었다. | 실제 업무 입력으로 기능을 시험하고 오류를 수정했다. | 배포 토큰(/mivault-cf-token)을 받아 만든 도구를 Cloudflare에 올리고 업무에 사용했다. |
| L4 | 데이터·외부 기능을 연결한 도구를 만들고 입력 오류·권한·연결 실패를 처리했다. | 업무 도구에 MCP 등으로 여러 데이터나 외부 기능을 연결했다. | 입력 오류와 접근 권한 문제를 처리하는 기능을 넣었다. | 외부 연결이 실패하는 상황을 처리하도록 도구를 수정했다. |
| L5 | 도구의 반복 오류나 성능 한계를 분석해 구조와 검사 절차를 개선하고 검증했다. | 도구의 반복 오류·변경 취약성·성능 한계의 원인을 분석했다. | 분석한 원인에 맞게 도구 구조와 제작·검사 절차를 개선했다. | 대표·경계·실패 입력으로 기능·성능·복구를 검증했다. |
table8-12. 질문 9 단계 보기와 행동(개발)
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 제공된 Claude Code(Codex·Cursor·Copilot 포함) 작업 구성으로 코드·검사를 실행했다. | 팀이 제공한 Claude Code(Codex·Cursor·Copilot 포함) 작업 구성으로 코드를 실행했다. | 제공된 테스트·검사 명령을 AI 도구로 실행했다. | 실행·검사 결과를 읽고 실패 여부를 확인했다. |
| L2 | Claude Code(Codex·Cursor·Copilot 포함)로 기존 코드·테스트를 제한된 범위에서 수정했다. | Claude Code(Codex·Cursor·Copilot 포함)로 기존 코드·테스트를 제한된 범위에서 수정했다. | 수정 중 생긴 실행 오류를 AI 도움으로 해결했다. | 변경한 기능과 관련 검사가 통과하는지 확인했다. |
| L3 | 요구·기존 구조를 반영한 변경을 구성하고 검토 가능한 변경으로 전달했다. | CLAUDE.md·AGENTS.md 등으로 요구사항·기존 구조·의존성을 AI에 제공했다. | AI가 만든 코드와 테스트를 검토하고 관련 회귀를 확인했다. | 변경을 GitHub/Gitea 등에서 검토 가능한 변경으로 전달했다. |
| L4 | 여러 모듈·인터페이스에 걸친 변경을 구성하고 회귀·성능·보안 문제를 해결했다. | 여러 모듈·인터페이스에 걸친 변경을 AI와 함께 구성했다. | MCP로 데이터베이스·API 등 필요한 외부 시스템을 AI 작업에 연결했다. | 검사 명령·CI를 연결해 회귀·성능·보안 문제를 찾아 해결했다. |
| L5 | AI 개발 방식의 반복 문제를 분석해 맥락·작업·검사 구성을 개선하고 검증했다. | AI 개발에서 반복되는 맥락 누락·잘못된 변경·검사 누락의 원인을 분석했다. | 작업 지침·제작/검사 Skill·필요한 Hooks를 원인에 맞게 개선했다. | 대표 변경과 회귀·실패 사례로 개선 전후의 변경 품질을 비교했다. |
질문 10 (업무 자동화)
정해진 일정이나 이벤트에 따라 업무를 처리하는 흐름을 만든 경험이 있는지 알려 주세요. AI의 도움을 받은 경험을 포함합니다.
직군 응답에 따라 아래 두 표 중 하나의 단계 보기와 행동 묶음만 표시한다. 이 안내는 설문 구현용이며 응답자에게 표시하지 않는다.
table8-13. 질문 10 단계 보기와 행동(비개발)
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | n8n의 제공된 워크플로우를 실행하거나 처리 결과를 사용했다. | 제공된 n8n 워크플로우를 실행했다. | 자동화 흐름이 보낸 처리 결과를 업무에 사용했다. | 처리 결과가 맞는지 확인했다. |
| L2 | 기존 흐름이나 템플릿의 일정·조건·입출력을 수정했다. | n8n Templates나 기존 흐름의 실행 일정·대상을 수정했다. | 기존 흐름의 조건이나 입출력 형식을 업무에 맞게 바꾸었다. | 수정한 조건으로 흐름이 실행되는지 확인했다. |
| L3 | 일정·이벤트에서 결과 전달까지 이어지는 흐름을 직접 만들어 실행했다. | n8n의 Schedule Trigger·Webhook이나 Claude 예약 작업으로 시작하는 흐름을 직접 만들었다. | 자료 조회·AI 처리·결과 전달 단계를 한 흐름으로 연결했다. | Executions에서 실제 입력의 실행 결과와 기록을 확인했다. |
| L4 | 조건 분기·승인·오류 처리·재시도를 넣고 실패한 단계를 고쳤다. | 조건 분기·재시도와 필요한 승인 단계를 흐름에 넣었다. | AI Agent 노드가 실행할 수 있는 도구와 범위를 제한했다. | Error Workflow와 Executions로 실패한 단계를 찾아 흐름을 고쳤다. |
| L5 | 반복 실패·중복 처리 원인을 찾아 흐름을 개선하고 실패 조건에서 검증했다. | 흐름의 반복 실패·중복 처리·잘못된 실행 원인을 분석했다. | 단계마다 품질 확인 지점을 두도록 흐름과 실행 통제를 다시 설계했다. | 연결 실패·중복 요청·승인 거절 조건에서 중단·재시도·복구를 검증했다. |
table8-14. 질문 10 단계 보기와 행동(개발)
| 레벨 | 단계 보기 | 행동 1 | 행동 2 | 행동 3 |
|---|---|---|---|---|
| L1 | 팀이 만든 예약·이벤트 실행 작업을 실행하거나 결과를 사용했다. | 팀이 만든 GitHub/Gitea Actions 워크플로나 예약 Job을 수동 실행하거나 재실행했다. | 자동 실행 작업이 남긴 알림·리포트·적재 데이터를 업무에 사용했다. | 실행 로그에서 작업의 성공·실패 여부를 확인했다. |
| L2 | 기존 자동 실행 작업의 일정·트리거·입력·설정을 수정했다. | 기존 워크플로·Job의 cron 일정이나 트리거 조건을 수정했다. | 기존 작업의 입력 인자·환경 변수·대상 범위를 업무에 맞게 바꾸었다. | 수정한 설정으로 작업이 실행되는지 로그로 확인했다. |
| L3 | 일정·이벤트에서 결과 전달까지 이어지는 자동 실행 작업을 코드로 직접 만들었다. | Claude Code(Codex·Cursor·Copilot 포함)로 cron·웹훅·큐 이벤트로 실행되는 작업을 직접 만들었다(Actions, Cloudflare Workers Cron Triggers, Databricks Jobs 등). | 자료 조회·AI 모델 호출·결과 전달 단계를 한 작업으로 연결했다. | 실제 입력으로 실행하고 로그·실행 기록에서 결과를 확인했다. |
| L4 | 조건 분기·재시도·승인 단계·실패 알림을 넣고 실패한 단계를 고쳤다. | 조건 분기와 실패 시 재시도·타임아웃을 작업에 넣었다. | AI가 외부 시스템에 쓰거나 발송하는 단계 앞에 권한 제한이나 사람의 승인 단계를 두었다. | 실패 알림과 로그로 실패한 단계를 찾아 작업을 고쳤다. |
| L5 | 반복 실패·중복 처리·지연의 원인을 분석해 실행 구조와 모니터링을 개선하고 검증했다. | 자동 실행 작업의 반복 실패·중복 처리·지연 원인을 분석했다. | 단계마다 품질 확인 지점과 중복 처리 방지를 두도록 실행 구조와 모니터링을 다시 설계했다. | 연결 실패·중복 이벤트·승인 거절 조건에서 중단·재시도·복구를 시험했다. |
판정 원칙
table6-1. 판정 질문
| 확인 | 판정 질문 |
|---|---|
| 실제 수행 | 최근 실제 업무에서 수행했는가? 연습·계획과 구분되는가? |
| 본인 기여 | AI가 수행한 부분과 본인의 판단·구성·검증·수정이 구분되는가? |
| 레벨 구분 | 기본 수행 / 수정 / 직접 구성 / 복잡한 조건 대응 / 기존 한계 개선·검증 중 무엇이 확인되는가? |
| 검증 | 결과 확인·오류 수정·사용 판단이 구체적인가? 상위 단계는 예외·실패와 개선 검증이 확인되는가? |
| 환경 | 권한·자료·기회 제약 때문에 못한 것인가? 확인되지 않은 것인가? |
table6-2. 근거 유형
| 근거 유형 | 설명 | 판정에 쓸 수 있는 레벨 |
|---|---|---|
| 자기보고 | 누적 사다리로 체크한 행동, 응답 간 일관성 | L1~L2 잠정 판정 |
| 사례 | 항목별 사례(업무 상황·목적, AI가 한 일, 본인이 구성·확인·수정한 일, 결과)와 선택 링크 | L3 이상 판정의 기본 근거 |
| 산출물·설정 | 문서·코드·대시보드·흐름 설정 등 확인 가능한 결과물 | L3 이상 |
| 로그 | 실행 기록·변경 기록·검토 기록 | L3 이상 |
| 확인 조합 | 위 근거와 챔피언·업무 책임자의 확인을 함께 사용 | L4·L5 판정에 권장 |
링크 제출은 선택이며, 민감한 자료는 안전한 대체 증빙(화면 일부, 요약 설명, 담당자 확인)으로 받을 수 있다. 같은 사례를 여러 역량에 다시 사용할 수 있지만, 역량마다 판정에 쓰는 사실은 구분한다.
검토 절차
LLM 보조평가는 선택 수단이다. 쓰더라도 후보 레벨과 근거 문장 추출에만 쓰고, 확정 판정은 AXE 스쿼드가 한다.
적용 상태는 해당 역량의 행동을 실제 업무에 얼마나 반복해서 적용했는지를 나타낸다. 적용 상태는 레벨과 별도로 기록하며, 레벨을 올리거나 내리는 조건으로 쓰지 않는다. 4주 반복과 같은 기간 조건을 L3의 조건으로 사용하지 않는다.
table7-1. 적용 상태 값
| 적용 상태 | 의미 |
|---|---|
| 한 번 | 해당 행동을 실제 업무에 한 번 적용했다. |
| 여러 번 | 해당 행동을 실제 업무에 여러 번 적용했으나 정해진 주기는 없다. |
| 정기 | 해당 행동을 정해진 업무 주기에 따라 반복해서 적용한다. |
설문에서는 세 가지 중 하나를 선택하게 하며, 기간이나 주기를 서술하도록 요구하지 않는다. 적용 상태는 사례 입력과 별개이다.
table7-2. 수행 기록 규칙
| 기록 | 규칙 |
|---|---|
| 수행 깊이 | 자기보고 후보 레벨과 증빙 확인 레벨을 분리한다. 도구·기능 수로 레벨을 계산하지 않는다. |
| 수행 범위 | 해당 사례에서 본인이 구성한 부분과 AI·공유 구성·다른 사람이 수행한 부분을 기록한다. 모든 기능 사용을 요구하지 않는다. |
| 적용 상태 | 한 번·여러 번·정기 중 하나를 레벨과 별도로 기록한다. |
| 상태값 | 경험 없음·기회 없음·환경 제약·미확인을 레벨과 별도로 기록한다. |
| AI 기여 | 일반 도구 사용과 AI를 활용한 업무 수행·제작을 구분한다. 소프트웨어 경력만으로 AI 역량을 판정하지 않는다. |
목표 수준
설계 확정 후 진행할 일
table7-3. 설계 확정 후 후속 사항
| 구분 | 후속 사항 | 이 명세와의 관계 |
|---|---|---|
| 목표 설정 | 개발·비개발의 역량별 목표와 NA 적용 범위 결정 | 설계 확정 후, 설문 발송 전에 결정한다. |
| 수집 운영 | 대상·조직정보·수집 일정·문의 담당자·원자료 접근자·보관/삭제일 | 설문 발송 전에 필요하다. 역량과 루브릭을 다시 정하는 일은 아니다. |
| 판정 운영 | 사례 검토자·추가 확인 방식·상위 판정 검토 절차·LLM 보조평가 사용 여부 | 확인 레벨을 확정하기 위한 운영 준비이다. |
| 구현·이관 | 실제 설문 분기·집계 도구·통합 프레임워크 반영 | 문서 명세를 시스템에 옮기는 일이다. 이 문서는 수집 시스템이 아니다. |
기록은 사람×역량 한 건당 한 행이다. 설문 응답, 사례, AXE 스쿼드의 확인 판정을 함께 남긴다. 필드 이름은 시스템 이관용이다.
table9-1. 개인 역량 데이터 사전
| 필드 | 기록 |
|---|---|
| respondent_id / group / job_type | 식별자·조직·개발/비개발. 원자료는 제한된 담당자만 접근한다. |
| competency_id | 운영용 코드(I01~I04, HA1, HB1~HB3, HC1, HC2). 응답자 화면에는 숨긴다. |
| selected_stage | 질문 1~10 모두 누적 응답(LADDER) 또는 상태값 |
| checked_behaviors | 2단계에서 체크한 행동 id 목록(예: HA1-L3-1, HA1-L3-3) |
| provisional_l1 | 1단계에서 1개만 체크해 L1을 잠정 기록하고 검토 표시를 남겼는지 여부(true/false) |
| self_level / confirmed_level | 누적 사다리로 정한 자기보고 후보 / 증빙 확인 레벨. 상태로 기록한 경우와 미확인은 null이며 0점으로 변환하지 않는다. |
| status | 레벨이 판정된 경우 ASSESSED, 그 밖에는 NOT_PERFORMED / NO_OPPORTUNITY / ENV / U 중 하나 |
| evidence_basis | 자기보고 / 사례 / 산출물·설정 / 로그 / 확인 조합 |
| behaviors / scope | 표시한 행동 묶음(질문 9·10은 비개발·개발 묶음 구분)과 사례의 책임 범위. 같은 행동의 Claude·ChatGPT 수행을 중복 가산하지 않는다. |
| adoption_state | 한 번 / 여러 번 / 정기. 레벨과 별도로 기록한다. |
| case_task / case_ai / case_contribution / case_result / reference | 사례 항목(업무 상황·목적, AI가 한 일, 본인이 구성·확인·수정한 일, 결과)과 선택 링크. 필수 항목은 각각 10자 이상이다. |
| target_level / target_version / target_na | 확정된 직군 목표와 버전, 업무상 필요 없음(NA) 적용 여부. 미정이면 null이다. |
| review_note / support_need | 확인 근거·불확실성·추가 질문·교육/코칭/자료/권한/실행 지원 필요 |
작성 예시(가상)
| 항목 | 기록 |
|---|---|
| 응답자 | 가상응답자-041 (사업·운영 그룹군, 비개발) |
| 역량 | 데이터 확보 |
| 자기보고 레벨 | L3 (1~3단계를 끊기지 않고 채움) |
| 적용 상태 | 여러 번 |
| 사례: 업무 | 프로모션 효과 분석용 데이터 준비 |
| 사례: AI가 한 일 | 사내 MCP로 주문 테이블을 조회하고 SQL 초안을 받았다 |
| 사례: 본인이 한 일 | 대상 기간과 제외 조건을 정하고, 결과 건수를 대시보드와 대조해 취소 주문 조건을 고쳤다 |
| 사례: 결과 | 반나절 걸리던 추출이 30분으로 줄었다 |
| 확인 레벨 · 근거 유형 | L2 · 사례(뷰를 직접 만든 기록이 없어 L3은 미확인으로 둔다) |
| 지원 필요 | Databricks에서 뷰를 만들고 메타데이터를 남기는 실습 |
집계 화면은 개인 역량 리포트에서 가상 데이터로 미리 볼 수 있다. 실제 응답이 모이면 아래 예시와 같은 구성의 리포트를 만든다.
공개와 사용 원칙
보고 방식
2.6 (45%)이다.응답과 확인 판정을 모으면 아래 구성의 리포트를 만든다. 실제 결과가 나오면 같은 구성으로 실제 수치와 사례를 채운다. 실제 집계 화면은 개인 역량 리포트에 있다.
표 1. 역량별 평균 레벨 (L3 이상 비율), 응답 312명 (가상)
| 영역 | 역량 | 평균 레벨 (L3 이상 비율) |
|---|---|---|
| AX 공통 역량 | 활용 판단·설계 | 2.6 (44%) |
| AX 공통 역량 | 결과 검증 | 2.0 (24%) |
| AX 공통 역량 | 안전 사용 | 2.9 (55%) |
| AX 공통 역량 | 기술 탐색·학습 | 2.3 (31%) |
| AI 도구 활용 역량 | 어시스턴트 업무 활용·구성 | 3.0 (52%) |
| AI 도구 활용 역량 | 데이터 확보 | 2.1 (22%) |
| AI 도구 활용 역량 | 데이터 분석 | 2.2 (25%) |
| AI 도구 활용 역량 | 대시보드 생성·공유 | 1.8 (14%) |
| AI 도구 활용 역량 | AI 코딩 제작 | 1.9 (18%) |
| AI 도구 활용 역량 | 업무 자동화 | 1.6 (11%) |
두 영역은 나눠서 본다. 영역 평균과 10개 역량의 합산 평균은 만들지 않는다. 자기보고 기준이며, 확인 판정 뒤에는 확인 L3 이상 비율을 함께 쓴다.
표 2. 자주 발견된 패턴 (가상)
| 자주 발견된 패턴 | 근거 수치 | 인사이트 | 결정 예시 |
|---|---|---|---|
| 어시스턴트 활용과 안전 사용이 가장 강하다 | 3.0 (52%), 2.9 (55%) | 문서 업무의 AI 사용과 기본 안전 수칙은 업무에 자리 잡았다 | L3 이상 사례를 사내 사례로 공유하고 작성자를 발표자 후보로 둔다 |
| 만들지만 결과 확인은 기본 수준이다 | 도구 활용 L3 이상 168명 중 결과 검증 L2 이하 71명 (42%) | 산출물 품질의 위험 신호이다. 조직의 품질·위험관리 L1과 맞물린다 | 이 대상에게 결과 검증 교육과 리뷰 체크리스트를 먼저 제공한다 |
| 주어진 지표는 조회하지만 새 데이터는 만들지 못한다 | 사업·운영 그룹군 데이터 확보 L1~L2 81%, '데이터셋·뷰를 직접 만들었다' 체크 9% | 새 테이블·뷰를 만드는 방법을 모른다 | Databricks 사용 방법 핸즈온을 연다 |
| 역량보다 환경이 막는다 | 환경 제약: 데이터 확보 18%, 대시보드 12%, 업무 자동화 10% | 자료·권한이 없어 해 보지 못한 사람이 많다 | 교육보다 권한·도구 지원을 먼저 검토한다 |
| 만들었지만 반복하지 않는다 | 대시보드 L3 이상 가운데 '한 번 적용' 58% | 만든 결과물이 반복 업무로 이어지지 않았다 | 정기 적용 사례를 공유하고, 막는 이유를 인터뷰로 확인한다 |
| 그룹마다 차이가 크다 | 업무 자동화 L3 이상: CX그룹 24%, 전사 11% | 그룹 단위 지원이 필요할 수 있다. 응답자가 적은 그룹은 우연한 차이일 수 있다 | AX 챔피언과 그룹 맞춤 지원을 논의한다 |
표 3. 주요 블로커: 조직 역량 결과와의 교차 (가상)
| 개인 역량에서 나온 블로커 | 이어지는 조직 역량 | 해석 |
|---|---|---|
| 데이터 확보의 환경 제약 18% | 업무맥락접근 L2 | 필요한 자료가 작업에 닿지 않는다. 교육으로 풀리지 않는다 |
| 결과 검증 L2 이하 42% (만드는 사람 중) | 품질·위험관리 L1 | 개인도 조직도 검수 기준이 없다 |
| 대시보드 '한 번 적용' 58% | 지식 공유·확산 L2 | 만든 것이 팀의 반복 업무로 퍼지지 않는다 |
최종 결과와 시사점
| 시사점 | 근거 | 담당·시점 (예시) |
|---|---|---|
| 결과 검증 교육과 리뷰 체크리스트를 먼저 제공한다. 대상은 만들지만 확인이 약한 71명이다 | 검증 차이 42% | AXE 스쿼드, 2027년 1분기 |
| Databricks 사용 방법 핸즈온을 연다. 사업·운영 그룹군부터 시작한다 | 데이터 확보 L1~L2 81% | AXE 스쿼드·데이터 담당, 진단 직후 |
| 데이터 접근 권한 경로를 정비한다. 조직 역량의 업무맥락접근 개선과 함께 한다 | 환경 제약 18% | AXE 스쿼드, 2027년 1분기 |
진단 목적 점검: 이 결과가 진단 목적에 답하는가
| 진단 목적 질문 | 이번 결과의 답 | 답의 확신 | 보완 방법 |
|---|---|---|---|
| 어디까지 적용됐나 | 개인 쪽에서는 문서 업무가 L3 근처이고, 제작·자동화는 L2 아래이다 | 부분 | 확인 판정 뒤 확인 L3 이상 비율로 다시 본다 |
| 성과로 이어지나 | 개인 역량 결과만으로는 답하지 않는다. 적용·성과 리포트와 교차해서 본다 | – | – |
| 무엇이 막나 | 개인 쪽은 결과 검증과 새 데이터 만들기, 환경 쪽은 데이터 접근이다 | 충분 | – |
| 어디에 투자하나 | 검증 교육, Databricks 핸즈온, 권한 경로의 순서이다 | 부분 | 조직 역량 결과와 합쳐 최종 확정한다 |
가상 데이터이며 실제 진단 결과가 아니다.
외부 프레임워크는 수준을 구분하는 원칙을, 기업 사례는 상위 행동의 예를 제공한다. 이 기준의 5단계 문장과 문항, 증빙 규칙은 미리디가 자체 설계했다.
| 출처 | 종류 | 가져온 부분 | 적용 위치 |
|---|---|---|---|
| Anthropic, "AI Fluency: Framework & Foundations" | 프레임워크 | 4D 프레임워크(Delegation, Description, Discernment, Diligence)의 위임·요구 전달·결과 판별·책임 있는 사용 행동. 5단계 척도의 근거는 아니다. | 3장 AX 공통 역량 4개의 행동 영역 |
| SFIA Foundation, "Levels of responsibility" (SFIA 9) | 프레임워크 | 지도 아래 수행(Follow)에서 독립·복잡 수행으로 올라가는 7단계 책임 수준의 구분 원칙. SFIA 7단계와 미리디 5단계의 번호는 대응하지 않는다. | 2.1절 레벨 축, 2.2절 구분 원칙 |
| SFIA Foundation, "Core software engineering competencies" (SFIA 9) | 프레임워크 | 요구사항·설계·통합·기능/비기능 테스트·릴리스·배포 등 16개 핵심 역량. 개발 직군 기준에서 설계·테스트·통합 범위가 빠지지 않았는지 점검하는 데 사용했다. | 4.5절 AI 코딩 제작 개발 루브릭, 5.3절 |
| European Commission JRC, "DigComp 3.0" | 프레임워크 | 인지 요구·과제 복잡성·자율성의 조합으로 정의한 4개 숙련 단계(Basic, Intermediate, Advanced, Highly advanced). 미리디 5단계로 직접 대응하지 않는다. | 2.1절 AX 공통 역량 레벨 이름(도움 수행에서 고도화로) |
| Zapier, "One year later: Raising the AI fluency bar for every Zapier hire" | 기업 사례 | 기대 최저 수준을 일회성 프롬프트가 아닌 반복 가능한 시스템과 핵심 업무 적용으로 정의한 사례. Zapier 기준에 포함된 측정 가능한 성과는 이 명세의 개인 레벨 조건으로 가져오지 않았다. | 2.1절 L2~L3 기본 활용 기준, 2.2절 |
| Anthropic, "Effective context engineering for AI agents" | 기업 사례 | 추론 시점에 필요한 정보를 선별·유지하는 맥락 구성 전략 | 활용 판단·설계 L3~L4, 어시스턴트 업무 활용·구성 L3~L4, AI 코딩 제작 개발 L4~L5 |
| Anthropic, "Equipping agents for the real world with Agent Skills" | 기업 사례 | 지침·스크립트·자료를 묶은 재사용 Skill, 대표 과제에서 부족한 점을 찾아 점진적으로 개선하는 방식 | 어시스턴트 업무 활용·구성 L3·L5, AI 코딩 제작 L5, 기술 탐색·학습 L3 |
| Anthropic, "Demystifying evals for AI agents" | 기업 사례 | 채점 기준, 환경의 최종 상태(outcome) 확인, 회귀 평가(regression evals) | 결과 검증 L4~L5, AI 코딩 제작 L4~L5 |
| n8n, "How Formula Bot uses n8n to turn a solo-founded startup into an enterprise-ready data platform" | 기업 사례 | 요청에 따라 연결 흐름을 선택하는 오케스트레이션, 스키마 정보 활용, 템플릿화한 재사용 연결, Webhook 기반 비동기 처리. 공급사 공개 사례이며 개인 수준의 인증 자료가 아니다. | 업무 자동화 L4~L5 |
| n8n, "How BeGlobal cut time-to-market for their commercial offer creation with n8n" | 기업 사례 | 대화형 요구 수집·상품 데이터 조회·이미지 생성·제안서 작성을 연결한 업무 흐름 재설계 사례. 미리디의 기능 도입이나 성과를 뜻하지 않는다. | 업무 자동화 L5, 활용 판단·설계 L5 |
| Anthropic, "Extend Claude Code" | 기능 문서 | CLAUDE.md·Skills·MCP·Hooks·Subagents의 명칭과 역할 | AI 코딩 제작 기능 예, 질문 9 |
| Databricks, "Dashboards" | 기능 문서 | AI/BI 대시보드의 데이터셋·시각화·필터·게시·공유 기능 | 대시보드 생성·공유 기능 예, 질문 8 |
| n8n Docs, "View all executions" | 기능 문서 | 실행 이력 조회, 상태(Failed·Running·Success·Waiting)별 필터, 실패한 실행의 재시도 | 업무 자동화 L3~L4 기능 예, 질문 10 |
| n8n Docs, "Human-in-the-loop for tools" | 기능 문서 | AI Agent가 특정 도구를 실행하기 전에 사람의 승인을 받도록 구성하는 기능 | 업무 자동화 L4~L5, 안전 사용 L4~L5 |
| Levelica Inc., "AI 활용 레벨 가이드" (v7, 2026-07-26 업데이트) | 기업 자료(참고 체크리스트) | 보강 항목으로 입력 금지 정보 제외, 품질 기준과 사용 판단 근거, 에이전트 실행 통제(행동 범위 제한·실행 전 승인·오류 복구)를 차용했다. 표준 프로토콜 연결과 사내 문서 질의응답, 단계별 품질 확인 지점, 비용 대비 효과 분석, 다음 단계 안내도 차용했다. 상용 자가 점검 가이드이며 타당도 검증 자료가 아니다. 레벨 구조·수치 기준·지식 항목·체크 수 기반 판정과 영향 범위 축(L5~L7)은 차용하지 않았다. | 결과 검증 L3~L5, 안전 사용 L2·L4, 기술 탐색·학습 L5, 어시스턴트 업무 활용·구성 L4, AI 코딩 제작 L4, 업무 자동화 L4~L5, 8.4절 질문 3, 9.2절 |
| Workera, "7 out of 10 employees dangerously underestimate or overestimate their skill levels, new analysis finds" (2024) | 진단 방식 근거 | 22,000건 이상의 영역 평가에서 자기 수준을 정확히 추정한 비율은 11%였고, 56%는 과소평가, 32%는 과대평가했다. 30점 허용 오차를 두어도 10명 중 7명(71%)이 부정확했다. | 6.1절 판정 원칙(L3 이상 증빙 요구) |
외부 프레임워크와 레벨 번호가 같더라도 같은 기준이 아니다. 기능 문서는 기능이 있다는 사실만 확인하며, 미리디가 그 기능을 도입했다는 뜻이 아니다.
회사가 개인의 AI 적용을 반복·확산시키는 조건을 갖췄는지 전사 단위로 확인한다. 적용이 낮거나 성과가 한 사람에게서 멈춘 곳은 원인이 조직의 조건에 있을 수 있다. 이 탭은 그 조건을 5개 영역 15개 역량으로 나눠 본다.
조직 역량은 가치 경로에서 적용과 개인 역량을 받쳐 준다. 개인 역량이 '한 사람이 할 수 있는가'를 본다면, 조직 역량은 '사람이 바뀌어도 반복되는가'를 본다.
조직 역량 구조도
다섯 영역은 역량을 묶는 분류이다. 영역 단위의 등급은 만들지 않는다.
| 영역 | 정의 | 핵심 질문 | 선정 이유 |
|---|---|---|---|
| 전략·리더십 | AI 적용의 목표, 책임과 자원, 투자 판단 | 무엇을 왜 먼저 하고, 누가 책임지며, 효과를 보고 자원을 조정하는가? | 가치를 내는 기업은 리더가 방향과 자원을 직접 정한다(McKinsey State of AI) |
| 업무흐름·운영 | 업무 흐름의 설계, 작은 실험, 변경과 복구 | 업무 흐름을 AI 기준으로 다시 짜고, 작게 시험하고, 틀리면 되돌리는가? | 성과는 도구보다 업무 흐름의 재설계에서 나온다(McKinsey, DORA) |
| 데이터·지식·플랫폼 | 정본 지식, 업무 맥락 접근, 제작·실행 환경 | 사람과 AI가 믿을 수 있는 자료에 닿고, 만든 것을 실행할 환경이 있는가? | AI 효과는 데이터와 내부 플랫폼의 품질에 달려 있다(DORA AI Capabilities Model) |
| 거버넌스·신뢰 | 사용 기준과 권한, 자산 가시성, 품질·위험 관리 | 무엇이 허용되는지 알고, 쓰는 것을 파악하며, 위험을 통제하는가? | 신뢰할 수 있는 사용은 기준·책임·모니터링을 요구한다(NIST AI RMF, ISO/IEC 42001) |
| 사람·조직문화 | 학습 지원, 실험과 신뢰의 문화, 지식 공유 | 배울 시간이 있고, 실패를 드러낼 수 있으며, 잘된 방법이 퍼지는가? | AI 가치의 대부분은 기술보다 사람과 프로세스의 변화에서 나온다(BCG) |
15개 역량
| 영역 | 역량 | 한 줄 정의 | 핵심 질문 |
|---|---|---|---|
| 전략·리더십 | 목표·우선순위 | 사업·업무 목표와 과제 선택의 연결 | 어떤 업무를 왜 먼저 바꾸며, 무엇이 확인되면 계속·변경·중단하는가? |
| 전략·리더십 | 책임·자원 | 결정·실행·운영의 책임과 실제 시간·예산 | 누가 결정하고 운영하며, 그 사람이 일을 수행할 시간과 자원을 실제로 갖고 있는가? |
| 전략·리더십 | 가치측정·투자조정 | 총 투입·효과·불확실성을 반영한 자원 결정 | 어떤 가치가 확인됐으며, 아직 모르는 부분을 포함해 다음 투자 결정을 어떻게 내렸는가? |
| 업무흐름·운영 | E2E업무설계 | 여러 사람 사이 인계와 요청부터 최종 수용까지 전체 흐름의 품질·병목 | 수신자의 완료 조건에 맞춰 준비·검수·인계·예외를 연결하고 병목을 관리하는가? |
| 업무흐름·운영 | 작은실험·검증 | 작은 범위에서 가설과 판정 기준을 검증 | 성공·실패를 무엇으로 판단하며, 적은 비용으로 다음 결정을 내릴 수 있는가? |
| 업무흐름·운영 | 변경·예외·복구 | 변경 추적, 예외 대응, 중단·복원, 운영 인수·대체 담당 | 변경으로 문제가 생기면 누가 무엇을 멈추고 어떤 상태로 되돌리는가? |
| 데이터·지식·플랫폼 | 지식품질 | 원본·최신성·정합성·갱신 책임 | 사람이든 AI든 같은 질문에 현재 유효한 근거를 찾고 상충을 해결할 수 있는가? |
| 데이터·지식·플랫폼 | 업무맥락접근 | 필요한 정보가 적정 권한으로 작업에 도달 | 필요한 맥락이 실제 작업에 도달하며, 접근 실패와 누락을 알 수 있는가? |
| 데이터·지식·플랫폼 | 제작·연동·실행환경 | 이용·제작·테스트·배포·운영을 지원하는 환경 | 현업이 필요한 것을 만들고 연결하고 운영하는 과정에서 어떤 환경·지원 병목을 겪는가? |
| 거버넌스·신뢰 | 사용기준·권한 | 허용 범위와 권한·상담 경로의 실제 적용 | 현업은 지금 하려는 사용·공유·실행이 가능한지 판단하고 모호할 때 해결할 수 있는가? |
| 거버넌스·신뢰 | 활용·자산가시성 | 사용 목적·자산·오너·상태·비용의 파악 | 무엇을 누가 어떤 업무에 쓰며, 공유·운영 중인 자산과 공백을 확인할 수 있는가? |
| 거버넌스·신뢰 | 품질·위험관리 | 영향에 맞는 검증·책임·모니터링·대응 | 리스크를 인지하며, 누가 무엇을 확인하고 문제가 나타나면 사용을 멈추거나 조정할 수 있는가? |
| 사람·조직문화 | 학습·성장 지원 | 역량을 배우고 실무에 쓸 시간·코칭·연습 기회 | 필요한 역량을 배우고 실무에 쓸 시간·코칭·연습 기회가 있는가? |
| 사람·조직문화 | 실험·신뢰 문화 | AI 시도와 실패의 공개, 리더의 장려와 보호 | AI 시도와 실패를 드러내도 불이익이 없고, 리더가 시도를 장려하고 보호하는가? |
| 사람·조직문화 | 지식 공유·확산 | 잘된 방법의 공유와 다른 사람의 자립 사용 | 잘된 방법이 챔피언과 동료를 통해 퍼지고, 다른 사람이 스스로 쓰게 되는가? |
조직 역량의 수준은 운영 수준(임시 → 일부 반복 → 정착 → 측정·개선)으로 나눈다. 이번 진단의 평가 범위는 전사이다. 아래 루브릭의 '평가 범위'는 전사를 뜻한다.
| 수준 | 한 줄 의미 | 이 수준이면 회사는 | 외부 기업 분포(대략) |
|---|---|---|---|
| L1 임시·개별 대응 | 필요한 운영이 없고 개인의 임시 대응에 기댄다 | AI 효과가 개인의 열의에 달려 있다 | 도입 초기 |
| L2 국소 반복 | 일부 팀만 같은 방법을 반복한다 | 잘하는 팀과 못하는 팀의 차이가 크다 | 다수(BCG laggards 60%의 모습) |
| L3 정의·정착 | 전사에 책임·기준·절차가 정해져 일상적으로 쓰인다 | 사람이 바뀌어도 같은 방식이 유지된다 | 확대 중인 기업(BCG scalers 35%의 모습) |
| L4 측정·개선 | 지표로 운영을 고치고, 조건이 바뀌어도 효과가 유지되는지 확인한다 | 숫자로 무엇을 늘리고 멈출지 정한다 | 상위권(고성과 기업 약 6%에 근접) |
| L5 선도 | 전사 범위에서 사업 지표로 효과가 확인되고, 외부 선도 사례와 견줄 수 있다 | AI가 사업 성과를 내는 방식이 외부 선도 기업과 비슷하다 | 상위 약 5%(BCG future-built) |
외부 분포는 BCG(2025)와 McKinsey 조사를 이 단계에 대략 대응시킨 것이며, 같은 기준으로 잰 값이 아니다. L5는 '세계 최고'가 아니라 외부 선도 사례와 견줄 수 있는 수준이다.
단계는 순서만 있는 범주이며 등간격 점수가 아니다. 각 역량의 요건을 모두 충족한 가장 높은 수준으로 판정한다. L5는 범위(전사 또는 핵심 사업), 성과(사업 지표), 외부 기준(공개 사례·벤치마크 비교)을 모두 충족할 때만 판정한다. 첫 회차에는 대부분 L1~L3로 판정될 것으로 본다.
영역을 펼치면 역량마다 정의, 핵심 질문, L1~L5 기준, L4·L5 필수 증빙을 볼 수 있다. 표는 가로로 스크롤된다.
| 역량 | 정의 | 핵심 질문 | L1 | L2 | L3 | L4 | L5 | 필수 증빙(L4·L5) |
|---|---|---|---|---|---|---|---|---|
| 목표·우선순위 | AI 적용을 사업·업무 목표와 연결하고, 수신자 가치·필요성·실행 조건에 따라 할 일과 하지 않을 일을 정하는 역량 | 어떤 업무를 왜 먼저 바꾸며, 무엇이 확인되면 계속·변경·중단하는가? | 업무 목표와 선정 기준이 없거나 개인의 관심·도구 유행에 따라 과제가 정해지는 상태가 확인된다 | 일부 과제는 업무 문제와 기대 효과를 적고 반복 선정하지만 팀별 선택 기준과 우선순위가 일관되지 않다 | 평가 범위의 과제마다 수신자·문제·완료 조건·기대 결과·선정 이유가 합의되고 정기 우선순위 결정에 사용된다 | 목표 대비 결과·미확인·기회비용을 주기적으로 검토해 우선순위를 유지·변경·중단하고, 여러 결정 주기에 걸쳐 선정 방식을 개선하며, 시장·도구·업무량이 바뀐 뒤에도 목표 기여가 유지되는지 확인한다 | AI 적용이 전사의 기본 업무 방식으로 선언되어 있고, 전사 또는 핵심 사업 전반의 과제 선정과 인력·예산 결정에서 "AI로 먼저 할 수 있는가"를 검토하는 것이 기본 절차이며, 그 우선순위의 효과가 매출·비용·출시 속도 같은 사업 지표로 확인되고 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 날짜가 있는 과제 목록과 선정 기준, 목표·결과의 비교 기록, 실제 유지·재배치·중단 결정과 오너 확인, 선정 기준의 개정 이력, 두 개선 주기의 결정과 후속 결과, 조건 변화에 따른 재선정 사례와 효과 확인; L5: 전사 또는 핵심 사업 전반에 적용된 AI 우선 검토 절차와 인력·예산 결정 기록, 우선순위 결정과 연결된 사업 지표의 변화 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 책임·자원 | 과제의 의사결정·현업 실행·공통 지원·운영 책임을 나누고 필요한 시간·예산·권한을 실제 배정하는 역량 | 누가 결정하고 운영하며, 그 사람이 일을 수행할 시간과 자원을 실제로 갖고 있는가? | 책임이 비어 있거나 개인의 자원봉사·초과 노력으로 과제를 유지하는 상태가 확인된다 | 일부 과제에 담당자와 시간이 배정되지만 지원 범위·운영 책임·대체 담당이 사례마다 달라진다 | 평가 범위의 현업 오너·AXE 지원·승인·운영 역할과 자원 배정, 요청·에스컬레이션 경로가 정해져 실제 작동한다 | 요청량·대기·지원 시간·운영 부담·업무 결과를 함께 보고 담당·시간·예산을 조정하며, 반복 조정으로 특정인 의존과 지원 병목을 줄이고, 담당자 교체·요청 증가 뒤에도 책임과 수행 품질이 유지되는지 확인한다 | 전사 또는 핵심 사업 전반에서 인력·예산 배정이 AI 적용을 전제로 이루어지고 책임과 대체 담당이 어느 조직에서나 같은 방식으로 작동하며, 배분의 효과가 비용·출시 속도 같은 사업 지표로 측정·유지되고 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 책임 분담과 실제 일정·예산, 지원·운영 투입 기록, 자원 조정 결정과 해당 현업의 확인, 자원·역할 배분의 두 개선 주기, 대체 담당·인수 실행 기록, 요청량·인력 변화 후 대기·품질·부담 확인; L5: 전사 또는 핵심 사업 범위의 AI 전제 인력·예산 배정 기록, 배분 결정과 연결된 사업 지표의 변화 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 가치측정·투자조정 | 실제 사용·품질·총 투입·편익과 불확실성을 측정해 유지·확대·수정·중단 및 투자 배분을 결정하는 역량 | 어떤 가치가 확인됐으며, 아직 모르는 부분을 포함해 다음 투자 결정을 어떻게 내렸는가? | 효과 확인이 없거나 사용량·제작 수·절감시간 진술만으로 투자하는 상태가 확인된다 | 일부 사례에 전후 수치가 있지만 기준선·품질·전체 비용·비교 조건이 일관되지 않다 | 평가 범위의 과제에 주효과·품질 조건·기준선·기간·총 사람 투입·증분 비용·미확인 기록과 검토 책임이 정착한다 | 반복 결과와 불확실성을 검토해 투자 규모·지원 방식·중단 여부를 결정·집행하고, 예측과 실현 가치의 차이를 분석해 측정·선정·투자 방식을 개선하며, 새로운 적용 조건에서도 판단이 유효한지 확인한다 | 전사 또는 핵심 사업 전반의 AI 투자를 매출·비용·출시 속도·고객 경험 같은 사업 지표로 배분하고 회수하며, 투자별 효과가 유지되는지 추적하고, 그 측정·배분 방식을 외부 공개 사례나 벤치마크와 비교할 수 있어 외부에 공유할 만하다 | L4: 원자료에 연결된 결과·비용 비교, 비교 가능성·불확실성 기록, 자원 집행과 연결된 결정서, 예측·실현 차이와 수정 이유, 두 개선 주기의 투자와 후속 결과, 새 업무·규모에서의 재검증; L5: 전사 AI 투자 목록과 사업 지표 기준의 배분·회수 기록, 투자별 사업 지표 효과의 유지 확인, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 역량 | 정의 | 핵심 질문 | L1 | L2 | L3 | L4 | L5 | 필수 증빙(L4·L5) |
|---|---|---|---|---|---|---|---|---|
| E2E업무설계 | 여러 사람 사이의 인계와 요청부터 최종 수용까지 전체 흐름에서 준비·생성·검수·예외를 연결하고, 그 흐름의 품질과 병목을 개선하는 역량 | 수신자의 완료 조건에 맞춰 준비·검수·인계·예외를 연결하고 병목을 관리하는가? | 요청·수신자·최종 완료가 불명확하거나 생성 단계만 개별 개선하는 상태가 확인된다 | 일부 흐름의 단계와 인계를 반복 정리하지만 수용 기준·예외·책임 경계가 빠져 있다 | 평가 범위의 시작·끝·수신자·입출력·검수·인계·예외와 책임을 합의하고 실제 업무에 적용한다 | 요청부터 수용까지의 사람 투입·시간·반환·품질을 측정해 병목을 고르고 단계·역할·인계를 조정하며, 개선 뒤 병목이 다른 단계로 옮겨 가는지와 업무량·유형·수신자가 바뀐 뒤의 수용을 반복해 확인한다 | 전사 또는 핵심 사업의 주요 업무 흐름이 AI를 전제로 재설계되어 있고, 새 업무도 처음부터 사람과 AI의 분담을 설계하며, 그 효과가 출시 속도·비용·고객 경험 같은 사업 지표로 유지되고 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 현재 흐름도와 수용 기준, 단계별 투입·대기·반환 기록, 병목 개선 결정과 수신자 확인, 두 개선 주기의 전체 흐름 전후 비교, 후속 단계의 부담 확인, 바뀐 업무 조건에서의 재수용 기록; L5: 전사 또는 핵심 사업의 AI 전제 재설계 흐름 목록과 신규 업무의 분담 설계 기록, 재설계 흐름과 연결된 사업 지표의 전후 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 작은실험·검증 | 검증할 가설을 작은 범위로 나누고 사전에 정한 품질·효과·중단 기준으로 다음 행동을 결정하는 역량 | 성공·실패를 무엇으로 판단하며, 적은 비용으로 다음 결정을 내릴 수 있는가? | 데모·시도가 있으나 판정 기준 없이 확대하거나 멈추는 상태가 확인된다 | 일부 과제에서 작은 시험과 확인을 반복하지만 가설·대조 조건·품질 기준이 사람마다 다르다 | 평가 범위의 실험에 가설·대상·기간·기준선·수용/중단 기준·책임자를 정하고 근거로 채택·수정·중단한다 | 판단까지 걸린 시간·투입·품질·결과를 추적해 실험 크기와 우선순위를 조정하고, 누적된 성공·실패에서 적용 경계를 찾아 실험 설계를 개선하며, 새로운 과업·도구 조건에서 그 경계를 다시 검증한다 | 전사 또는 핵심 사업 전반에서 작은 실험과 사전 판정 기준이 AI 과제의 기본 절차로 쓰이고, 실험 결과에 따른 채택·중단이 출시 속도·비용 같은 사업 지표의 개선으로 확인되며, 실험 운영 방식을 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 사전 실험 계획·판정 기준, 완료·미완료 실험 기록, 결과에 따른 실제 의사결정과 실험 방식 조정, 두 개선 주기의 가설·설계 변경, 실패·중단 사례를 포함한 학습 기록, 새 조건에서의 재시험 결과; L5: 전사 또는 핵심 사업 범위의 실험 목록과 판정 기록, 채택·중단 결정과 연결된 사업 지표 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 변경·예외·복구 | 앱·자동화·프롬프트·지침의 변경을 추적하고 예외 상황에서 중단·수동 대체·이전 상태 복원을 수행하며, 운영을 넘겨받는 사람(운영 인수)과 대체 담당을 정해 두는 역량 | 변경으로 문제가 생기면 누가 무엇을 멈추고 어떤 상태로 되돌리는가? | 변경 내역·예외 경로·복원 방법이 없거나 제작자 기억에 의존하는 상태가 확인된다 | 일부 자산에 버전·백업·수동 대안이 있으나 사용자 공유와 복구 확인이 일정하지 않다 | 평가 범위의 변경·승인·테스트·버전, 예외 담당·중단·복원 절차가 정해지고 실제 사례 또는 시연으로 확인된다 | 변경 실패·예외·복구 시간·영향을 추적해 변경·테스트·대응 방식을 조정하고, 반복되는 실패 원인을 줄인 효과를 검증하며, 도구·담당자·연동이 바뀐 뒤에도 복구와 업무 연속성을 확인한다 | 전사 또는 핵심 사업의 AI 자산 전반에 변경·중단·복원과 운영 인수 절차가 공통으로 적용되어 빠른 변경과 안정된 운영이 함께 유지되고, 장애·중단이 고객 경험·비용에 미치는 영향이 측정되며, 변경·복구 성과를 외부 벤치마크와 비교할 수 있다 | L4: 변경·버전 이력, 예외·복구 기록 또는 기록된 훈련, 운영 인수 기록과 대체 담당 지정, 영향·복구 시간 검토와 개선 결정, 두 개선 주기의 원인·재발·복구 결과, 새로운 조건에서의 복구 시연, 최신 대체 절차와 담당자 확인; L5: 전사 또는 핵심 사업 범위의 공통 변경·복구 절차 적용 기록, 장애·중단의 고객·비용 영향 기록, 변경 빈도·복구 시간의 외부 벤치마크 대비 기록 또는 외부 공유 자료 |
| 역량 | 정의 | 핵심 질문 | L1 | L2 | L3 | L4 | L5 | 필수 증빙(L4·L5) |
|---|---|---|---|---|---|---|---|---|
| 지식품질 | 업무에 필요한 데이터·문서·규칙의 신뢰할 원본, 최신성, 정합성, 갱신 책임을 유지하는 역량 | 사람이든 AI든 같은 질문에 현재 유효한 근거를 찾고 상충을 해결할 수 있는가? | 핵심 정보가 없거나 어떤 자료가 원본·현행인지 알 수 없는 상태가 확인된다 | 일부 자료에 오너·갱신·정리가 반복되지만 필요한 지식 전체의 품질 기준은 불완전하다 | 평가 범위의 필수 정보에 원본·오너·유효 시점·갱신·폐기·상충 처리 기준이 있고 실제 사용된다 | 누락·오래된 정보·상충·오답의 원인을 표본으로 추적해 우선 수정하고 업무 영향을 확인하며, 반복되는 문제의 생성 원인을 개선해 신규 정보·업무 변경 뒤에도 유효성을 확인한다 | 전사 또는 핵심 사업의 필수 지식과 데이터가 AI가 바로 쓸 수 있는 형태(원본·오너·유효 시점을 도구가 확인할 수 있는 형태)로 관리되고, 지식 품질이 고객 응대·출시 속도 같은 사업 지표와 연결되어 측정되며, 관리 방식을 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 필수 정보 목록·원본·오너, 품질 문제와 업무 영향 기록, 갱신·수정 후 재확인, 두 개선 주기의 문제 원인·갱신 체계 변경·결과, 신규·변경 정보의 품질 확인과 폐기 이력; L5: 전사 또는 핵심 사업 범위의 AI 사용 가능 지식 목록과 품질 기록, 지식 품질과 연결된 사업 지표 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 업무맥락접근 | 해당 업무의 사람이거나 AI 도구가 필요한 정보를 필요한 시점에 적정 권한과 출처를 유지하며 가져오는 역량 | 필요한 맥락이 실제 작업에 도달하며, 접근 실패와 누락을 알 수 있는가? | 필요한 자료에 접근하지 못하거나 개인 복사·우회에 의존하는 상태가 확인된다 | 일부 업무에서 수동 제공·검색·연동을 반복하지만 역할별 권한·출처·누락 확인이 일정하지 않다 | 평가 범위의 필수 맥락·권한·제공 방식·출처 확인·접근 지원이 정해지고 실제 사용자·도구에서 작동한다 | 검색·접근 실패, 누락·상충, 맥락 확보 시간과 업무 영향을 측정해 접근 경로를 개선하고, 새로운 업무·권한·연동 조건에서도 정보 유효성과 접근 경계를 확인한다 | 전사 또는 핵심 사업의 사람과 AI 도구가 필요한 사내 맥락을 적정 권한으로 셀프서비스로 가져오고, 맥락 확보의 개선이 출시 속도·고객 경험 같은 사업 지표로 확인되며, 접근 방식을 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 업무별 필수 정보·권한표, 실제 검색·제공 시연, 실패·소요·업무 영향 기록, 개선 결정, 두 개선 주기의 접근 경로와 결과, 신규·변경 권한에서의 테스트, 누락·과다 노출 방지 확인; L5: 전사 또는 핵심 사업 범위의 셀프서비스 접근 경로와 사용 기록, 맥락 확보와 연결된 사업 지표 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 제작·연동·실행환경 | 현업의 AI 이용, 앱·자동화 제작, 테스트, 연동, 실행·배포·운영을 적정한 공통 도구와 지원으로 가능하게 하는 역량 | 현업이 필요한 것을 만들고 연결하고 운영하는 과정에서 어떤 환경·지원 병목을 겪는가? | 개인 계정·우회·제작자 기기에 의존하거나 업무에 필요한 실행 환경이 없는 상태가 확인된다 | 일부 팀에 도구·연동·지원이 제공돼 반복 사용되지만 테스트·실행·배포·운영 경계가 불완전하다 | 평가 범위에 맞는 승인 도구·계정·연동·테스트·실행·배포·운영 지원이 마련되고 이용·제작·운영 역할이 반복 이용한다 | 실행 실패·대기·지원 투입·비용·이용자 피드백을 측정해 공통 환경과 지원을 조정하고, 신규 제작자·규모·도구가 바뀐 뒤에도 현업의 수행과 운영 효율이 유지되는지 확인한다 | 전사 또는 핵심 사업의 현업이 공통 환경에서 AI 앱·자동화를 셀프서비스로 만들고 배포·운영하며, 그 효과가 출시 속도·비용 같은 사업 지표로 측정·유지되고, 환경 운영 방식을 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 사용 가능한 환경·지원 목록, 평가 범위의 이용·제작·운영자에 대한 실제 실행 확인(해당 범위에 비개발 제작·운영자가 있으면 포함한다), 실패·대기·비용·지원 기록과 조정 결정, 두 개선 주기의 환경 변경·사용자 결과, 신규 이용자나 도구·규모 변화 후 신뢰성·부담 확인; L5: 전사 또는 핵심 사업 범위의 현업 셀프서비스 제작·배포 기록, 공통 환경과 연결된 사업 지표 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 역량 | 정의 | 핵심 질문 | L1 | L2 | L3 | L4 | L5 | 필수 증빙(L4·L5) |
|---|---|---|---|---|---|---|---|---|
| 사용기준·권한 | 도구·데이터·외부 전달·실행 권한의 허용 범위를 이해하기 쉽게 정하고 실제 상황에서 적용·상담·변경하는 역량 | 현업은 지금 하려는 사용·공유·실행이 가능한지 판단하고 모호할 때 해결할 수 있는가? | 기준·권한·문의 경로가 없거나 사람마다 다른 설명에 의존하는 상태가 확인된다 | 일부 안내·승인과 상담이 반복되지만 실제 업무 유형·권한 변경·예외까지 일관되게 다루지 못한다 | 평가 범위의 허용 도구·입력·공유·실행 권한, 승인·상담·예외 경로를 찾을 수 있고 실제 사례에서 적용한다 | 반복 혼동·승인 대기·예외·권한 오류를 추적해 기준·기본 설정·안내를 조정하고, 같은 문제가 줄었는지 확인하며, 새로운 도구·데이터·외부 사용 조건에도 기준을 갱신해 적용을 검증한다 | 전사 또는 핵심 사업 전반에서 사용 기준과 권한이 기본 설정과 자동 승인으로 적용되어 빠른 확산과 통제가 동시에 작동하고, 승인 대기의 감소가 출시 속도 같은 사업 지표로 확인되며, 기준을 외부 공개 기준이나 벤치마크와 비교할 수 있다 | L4: 현행 기준과 권한·승인 기록, 사용자 상황 판단 확인, 문의·예외·대기 기록과 기준 변경 결정, 두 개선 주기의 기준·설정 변경과 재발 확인, 새 사용 조건의 검토·안내·적용 기록; L5: 전사 또는 핵심 사업 범위의 자동 적용 기준·권한 설정 기록, 승인 대기·확산 속도와 연결된 사업 지표 기록, 외부 공개 기준·벤치마크 대비 기록 또는 외부 공유 자료 |
| 활용·자산가시성 | 업무에 쓰는 AI 도구·앱·자동화·공유 자산의 목적, 오너, 이용 대상, 운영 상태, 비용·영향 범위를 파악하고 갱신하며, 자산마다 유지와 문제 처리를 맡는 자산 오너를 지정하는 역량 | 무엇을 누가 어떤 업무에 쓰며, 공유·운영 중인 자산과 공백을 확인할 수 있는가? | 실제 사용하는 도구·자산·오너를 알 수 없거나 개인 기억에 의존하는 상태가 확인된다 | 일부 팀·지원 과제 목록이 반복 갱신되지만 미등록·중단·공유 자산과 실제 사용을 대조하지 못한다 | 평가 범위의 등록 기준·필수 정보·갱신 책임·상태 구분이 정해지고 사용 중·시험·중단 자산을 현업과 대조한다 | 등록 범위·정보 유효성·미상 오너·휴면·중복·비용을 주기적으로 검토해 정비·지원·통합을 결정하고, 누락이 생기는 원인을 개선하며, 새 제작 경로·자산·조직 변화 뒤에도 목록과 실제 운영이 일치하는지 확인한다 | 전사 AI 도구·자산의 목적·오너·상태·비용이 자동으로 수집·갱신되고, 자산별 비용과 효과가 사업 지표와 연결되어 통합·중단 결정에 쓰이며, 가시성 수준을 외부 공개 사례나 벤치마크와 비교할 수 있다 | L4: 범위가 명시된 자산·사용 목록, 자산별 오너 지정 기록, 현업 표본 대조와 미확인 수, 갱신·정리·지원 결정과 실행 기록, 두 개선 주기의 등록·갱신 절차 변경과 누락·정확성 확인, 새로운 제작·공유 경로의 반영 기록; L5: 전사 범위의 자동 수집 자산 목록과 정확성 확인, 자산별 비용·효과와 사업 지표를 연결한 결정 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 공유 자료 |
| 품질·위험관리 | 결과의 업무·고객 영향에 맞춰 품질·오류·데이터·권리 위험을 확인하고 최종 책임·모니터링·대응을 운영하는 역량 | 리스크를 인지하며, 누가 무엇을 확인하고 문제가 나타나면 사용을 멈추거나 조정할 수 있는가? | 결과 수용·검증 책임이 없거나 개인 감각에 의존하는 상태가 확인된다 | 일부 업무에 검수표·테스트·담당이 있지만 영향 수준·예외·운영 중 확인이 일관되지 않다 | 평가 범위의 품질·위험 기준, 검증 방법, 사람의 최종 책임, 중단·보고·대응이 정해져 실제 사용된다 | 오류·재작업·반환·사고와 근접 사례·검수 부담을 측정해 영향에 따라 검증·통제를 조정하고, 반복되는 실패 원인을 줄인 효과를 검증하며, 모델·데이터·사용자·업무 영향이 바뀐 뒤에도 품질 기준과 대응을 다시 검증한다 | 전사 또는 핵심 사업의 AI 결과물에 영향 수준별 평가·모니터링·중단이 자동으로 작동해 빠른 확산과 품질 통제가 동시에 유지되고, 품질·사고가 고객 경험·비용 같은 사업 지표로 측정되며, 통제 방식을 외부 공개 기준이나 벤치마크와 비교할 수 있다 | L4: 위험·품질 기준과 검수·테스트, 실제 수용·반환·사고 또는 훈련 기록, 원인 검토와 통제 변경, 두 개선 주기의 실패 원인·통제 변경·후속 결과, 변경 조건에서의 평가·모니터링·중단 시연; L5: 전사 또는 핵심 사업 범위의 자동 평가·모니터링 기록, 품질·사고와 연결된 고객·비용 지표 기록, 외부 공개 기준·벤치마크 대비 기록 또는 외부 공유 자료 |
| 역량 | 정의 | 핵심 질문 | L1 | L2 | L3 | L4 | L5 | 필수 증빙(L4·L5) |
|---|---|---|---|---|---|---|---|---|
| 학습·성장 지원 | 구성원이 업무에 필요한 개인 역량(공통 역량과 도구 활용 역량)을 배우고 실무에 쓰도록 업무 시간 안의 학습 시간·코칭·연습 기회·후속 확인을 제공하고, 어려움의 원인에 맞게 지원을 조정하는 역량 | 필요한 역량을 배우고 실무에 쓸 시간·코칭·연습 기회가 있는가? | 학습 시간·코칭·연습 기회가 없거나 개인의 자발적 학습에 의존하는 상태가 확인된다 | 일부 구성원에게 교육·코칭·실습이 반복되지만 대상·시간 배정·실무 적용의 확인이 팀마다 다르다 | 평가 범위의 구성원에게 필요한 역량과 학습 경로, 업무 시간 안의 학습·연습 시간, 코칭 요청 경로, 실무 적용의 후속 확인이 정해지고 실제 운영된다 | 학습 참여와 실무 적용·자립, 환경 장애, 지원 투입을 반복 확인해 코칭·교육·도구·업무 설계 가운데 필요한 지원을 조정하고, 그 조정이 실무 수행에 준 변화를 검증하며, 새 도구·직군·담당자 조건에서도 학습 기회와 실무 적용이 유지되는지 확인한다 | 전사 구성원이 업무 시간 안에서 AI 역량을 배우고 실무에 쓰는 것이 기본 규범으로 운영되고, 역량 향상이 생산성·출시 속도 같은 사업 지표의 변화로 확인되며, 학습 체계를 외부 공개 사례나 벤치마크와 비교할 수 있고 외부에서 참조될 만하다 | L4: 학습·연습 시간의 배정 기록, 코칭·실습 기록, 실무 적용의 후속 확인, 지원 변경 결정, 두 개선 주기의 지원 방법과 실무 수행 변화, 새 조건에서의 학습 기회·실무 적용 확인. 수강 인원·만족도만으로는 충족하지 않는다; L5: 전사 범위의 학습 시간 배정과 실무 적용 기록, 역량 향상과 연결된 사업 지표 기록, 외부 공개 사례·벤치마크 대비 기록 또는 외부 발표·공유 자료 |
| 실험·신뢰 문화 | 구성원이 AI 시도와 실패·중단을 불이익 없이 드러내고, 리더가 시도를 장려하고 보호하며, 실패를 비난 대신 원인 확인과 학습으로 다루는 역량 | AI 시도와 실패를 드러내도 불이익이 없고, 리더가 시도를 장려하고 보호하는가? | 시도와 실패의 공유 기록이 없거나, 실패를 개인 책임으로만 다루거나, 시도가 리더의 승인 없이 개인 재량에 맡겨진 상태가 확인된다 | 일부 팀에서 시도와 실패를 공유하고 회고하지만, 리더의 승인·보호 방식과 공유 범위가 사람마다 다르다 | 평가 범위에서 시도를 승인하는 방식, 실패·중단 사례의 공유 경로, 비난 없는 회고 방식이 정해지고 실제 사례에 적용된다 | 공유된 실패·중단 사례, 회고의 후속 조치, 리더의 시도 승인·보호 결정을 주기적으로 검토해 공유 방식과 승인 기준을 조정하고, 회고 결과가 다음 시도에 반영되는지와 리더·구성원 교체나 실패 사고 뒤에도 공유와 시도가 이어지는지 확인한다 | 실험과 실패 공유가 전사 규범으로 자리 잡아 모든 조직의 리더가 시도를 장려하고 보호하며, 실험에서 나온 개선이 사업 지표의 변화로 이어진 기록이 있고, 실패 공유 방식이 외부에서 참조되거나 외부 공개 사례와 비교할 수 있다 | L4: 날짜가 있는 실패·중단 사례의 공유 기록, 리더의 시도 승인·보호 결정 기록, 회고 기록과 후속 조치, 공유·승인 방식의 조정 결정, 두 개선 주기의 회고·기준 변경과 후속 시도, 리더 교체나 실패 사고 뒤의 공유·시도 기록; L5: 전사 범위의 실패·중단 공유 기록과 리더의 보호 결정, 실험 결과와 연결된 사업 지표 기록, 외부 공개 사례 대비 기록 또는 외부 발표·공유 자료. 설문 응답만 있으면 U로 판정한다 |
| 지식 공유·확산 | 잘된 방법·템플릿·Skill·자동화·해결 경험을 챔피언과 동료가 공유하고 전수해, 만든 사람 밖의 구성원이 적용 조건을 이해하고 스스로 반복 사용하게 하며, 지원이 특정인에게 몰리지 않게 하는 역량 | 잘된 방법이 챔피언과 동료를 통해 퍼지고, 다른 사람이 스스로 쓰게 되는가? | 잘된 방법이 만든 사람에게 머물거나, 소수 개인에게 비공식 문의가 몰리는 상태가 확인된다 | 일부 챔피언·동료 모임에서 사례 공유가 반복되고 일부 동료가 도움을 받아 다시 쓰지만, 공유 경로·적용 조건·받은 사람의 후속 확인이 불명확하다 | 평가 범위의 챔피언 역할과 시간, 공유 경로, 공유 자산의 적용 조건·가이드·문의 경로가 정해지고, 받은 사람이 스스로 반복 사용하는지 확인한다 | 공유 자산의 타인 반복 사용·효과·이탈, 문의·대행 부담, 받은 사람의 재현을 측정해 공유·전수 방식을 조정하고, 지원 부담이 분산되는지와 챔피언 교체나 새 조직 참여 뒤에도 자립 사용과 효과가 유지되는지 확인한다 | 잘된 방법이 전사 공통 자산으로 채택되어 여러 조직이 스스로 반복 사용하고, 확산 효과가 비용·출시 속도 같은 사업 지표로 측정되며, 내부 사례가 외부 발표·공유를 거쳐 외부에서 참조된다 | L4: 공유 자산과 대상 사용자 목록, 타인 반복 사용·효과 확인, 받은 사람의 재현 기록, 문의·대행 부담 기록, 확산·수정·중단 결정, 두 개선 주기의 공유·전수 방식과 후속 결과, 챔피언 교체나 신규 조직에서의 자립 사용·효과 확인; L5: 전사 공통 자산의 채택 조직·사용자 기록, 확산과 연결된 사업 지표 기록, 외부 발표·공유 자료와 외부 참조 기록 |
| 항목 | 정한 내용 |
|---|---|
| 진단 단위 | 전사. 그룹별로 판정하지 않는다 |
| 이유 | 근거가 전사 정책·환경·운영 기록이다. 그룹이 달라도 같은 환경과 기준을 쓴다 |
| 판정 대상 | 회사가 실제로 제공·운영하는 조건. 문서가 있어도 쓰이지 않으면 낮게 판정한다 |
| 판정 | AXE 스쿼드. 두 판정자가 교차 검토한다 |
| 확인 협조 | 자료를 가진 담당 팀(정보보호, 데이터, 플랫폼 등) |
AXE 스쿼드가 전사 자료를 증빙으로 모으고, 두 판정자가 차례로 판정한다. 말이나 설문만 있으면 미확인(U)으로 둔다.
영역별 증빙 출처 (예)
| 영역 | 미리디에서 확인할 자료 |
|---|---|
| 전략·리더십 | AX 목표·과제 목록(OKR, Jira), 라이선스·예산 결정 기록 |
| 업무흐름·운영 | 워크플로우 진단 기록지(적용·성과), 실험 계획과 판정 기록, 변경·복구 기록 |
| 데이터·지식·플랫폼 | 전사 지표 테이블 가이드, 사내 데이터 조회 연결(Databricks MCP), 배포 환경(Cloudflare)과 Gitea |
| 거버넌스·신뢰 | AI 서비스 사용 가이드라인, AI 도구 등록 대장과 금지 목록, 보안성 검토 기록 |
| 사람·조직문화 | 핸즈온·교육 기록, 챔피언 미팅 기록, 공유 저장소와 플러그인 마켓플레이스 사용 기록 |
AXE가 영역별 전사 자료를 모으고, 담당 팀에 빠진 자료를 요청한다
판정자 A가 역량별 수준과 근거를 적는다. LLM은 후보 수준과 근거 문장 추출에만 쓴다
판정자 B가 같은 증빙으로 다시 판정한다. 다르면 합의하고 이유를 남긴다
수준을 확정한다. 근거가 부족하면 U, 해당 없으면 NA로 둔다
한 증빙을 여러 역량의 근거로 쓸 수 있다. 다만 같은 사실로 두 역량을 판정하지 않고, 역량마다 확인한 사실을 나눠 적는다.
기록지는 역량 한 개당 한 행이다. 15개 역량을 모두 적고, 판정 근거와 지원 필요를 함께 남긴다.
| 항목 | 적는 내용 |
|---|---|
| 역량 | 15개 역량 가운데 하나 |
| 판정 수준 | L1~L5, U(미확인), NA(해당 없음) |
| 근거 요약 | 그 수준으로 판정한 사실 한두 줄 |
| 증빙 ID·출처 | 문서·기록의 위치 |
| 판정자 A·B | 각자의 판정과, 다를 때 합의한 이유 |
| 지원 필요 | 다음 수준으로 가는 데 필요한 투자·지원 |
작성 예시(가상)
| 항목 | 기록 |
|---|---|
| 역량 | 지식 공유·확산 |
| 판정 수준 | L2 국소 반복 |
| 근거 요약 | 챔피언 미팅에서 사례 공유가 반복된다. 다만 받은 사람이 스스로 다시 쓰는지 확인한 기록이 없다 |
| 증빙 ID·출처 | 챔피언 미팅 기록, 공유 저장소 사용 기록 |
| 판정자 A·B | L2 · L2(일치) |
| 지원 필요 | 공유 자산의 적용 조건·가이드 정비, 사례 공유 자리 정례화 |
| 역량 | 판정 수준 | 근거 요약 | 증빙 ID·출처 | 판정자 A | 판정자 B·합의 | 지원 필요 |
|---|---|---|---|---|---|---|
| 목표·우선순위 | ||||||
| 책임·자원 | ||||||
| 가치측정·투자조정 | ||||||
| E2E업무설계 | ||||||
| 작은실험·검증 | ||||||
| 변경·예외·복구 | ||||||
| 지식품질 | ||||||
| 업무맥락접근 | ||||||
| 제작·연동·실행환경 | ||||||
| 사용기준·권한 | ||||||
| 활용·자산가시성 | ||||||
| 품질·위험관리 | ||||||
| 학습·성장 지원 | ||||||
| 실험·신뢰 문화 | ||||||
| 지식 공유·확산 |
판정 수준: L1~L5 / U(미확인) / NA(해당 없음)
영역별 수준과 근거를 요약하고, 약한 영역을 투자·개선 우선순위로 정리한다. 실제 판정이 끝나면 아래 예시와 같은 구성의 리포트를 만든다.
| 결과물 | 보여 주는 방법 |
|---|---|
| 영역별 수준 | 레이더 차트(5개 영역). 영역 안의 역량 수준 분포를 함께 보여 준다 |
| 역량별 수준 | 히트맵(영역 × 역량), 미확인과 해당 없음을 구분해 표시 |
| 개요와 종합 인사이트 | 약한 영역, 그 근거, 투자·개선 우선순위 |
15개 역량의 판정 기록지를 모으면 아래 구성의 리포트를 만든다. 실제 판정이 끝나면 같은 구성으로 실제 수준과 근거를 채운다.
그림 1. 5개 영역 수준 (영역 안 역량 수준의 평균, 가상)
표 1. 영역 × 역량 수준 (진할수록 높음, 가상)
| 영역 | 역량과 수준 | ||
|---|---|---|---|
| 전략·리더십 | 목표·우선순위 L2 | 책임·자원 L2 | 가치측정·투자조정 L1 |
| 업무흐름·운영 | E2E업무설계 L2 | 작은실험·검증 L1 | 변경·예외·복구 L2 |
| 데이터·지식·플랫폼 | 지식품질 L2 | 업무맥락접근 L2 | 제작·연동·실행환경 L3 |
| 거버넌스·신뢰 | 사용기준·권한 L2 | 활용·자산가시성 L1 | 품질·위험관리 L1 |
| 사람·조직문화 | 학습·성장 지원 L3 | 실험·신뢰 문화 L2 | 지식 공유·확산 L2 |
표 2. 영역 수준에서 자주 발견된 패턴 (가상)
| 자주 발견된 패턴 | 근거 수치 | 인사이트 | 결정 예시 |
|---|---|---|---|
| 만드는 조건은 L3, 확인하는 조건은 L1이다 | 제작·연동·실행환경 L3, 학습·성장 지원 L3 / L1 4개 | 도구와 학습에는 투자했지만, 결과를 재고 통제하는 운영은 없다 | 다음 투자는 도구 추가가 아니라 확인·통제 운영에 둔다 |
| 거버넌스·신뢰가 가장 낮다 | 영역 평균 1.3 (L1 2개, L2 1개) | 무엇을 누가 쓰는지, 품질 문제가 어디서 나는지 전사가 모른다 | 거버넌스·신뢰를 첫 투자 영역으로 지정 |
| 배우지만 퍼지지 않는다 | 학습·성장 지원 L3, 지식 공유·확산 L2 | 잘 만든 Skill·자동화가 만든 팀 안에만 머문다 | 공유 저장소와 사례 공유 자리를 정례화 |
표 3. L1 역량의 판정 근거와 다음 수준의 증빙 (가상)
| 역량 | L1로 판정한 근거 | 다음 진단에서 L2로 볼 증빙 |
|---|---|---|
| 가치측정·투자조정 | AI 비용의 기준선과 효과 기록이 없다 | 조직별 AI 비용 보고 1회 이상, 워크플로우 기준선 기록 |
| 작은실험·검증 | 시험 결과를 남기는 양식이 없다 | 시험 기록 양식과 채택·중단 기록 3건 이상 |
| 활용·자산가시성 | 등록 대장과 사용 기록이 따로 있다 | 두 기록을 합친 자산 목록과 월간 사용 현황 |
| 품질·위험관리 | 검수 기준과 중단 절차가 없다 | 영향이 큰 업무의 검수 기준과 중단 절차 문서 |
표 4. 주요 블로커: 적용·성과 결과와의 교차 (가상)
| 적용·성과에서 나온 블로커 | 이어지는 조직 역량 | 해석 |
|---|---|---|
| 검수 9건, 부분 전환의 악화 1건 | 품질·위험관리 L1 | 검수 기준이 없어 전환할수록 품질 위험이 커진다 |
| 권한 16건 | 사용기준·권한 L2 | 전사 기준은 있지만 그룹별 권한 요청 절차가 없다 |
| 자료 14건 | 업무맥락접근 L2 | 정본 자료는 일부에만 있고, 사업·운영 업무 자료는 연결되지 않았다 |
| 성과 미확인 16개 | 가치측정·투자조정 L1 | 기준선이 없어 성과를 회사가 확인할 수단이 없다 |
최종 결과와 투자·개선 우선순위
| 우선순위 | 근거 | 담당·시점 (예시) |
|---|---|---|
| 1. 자산·사용 가시성. 등록 대장과 사용 기록을 하나로 묶어 무엇을 누가 쓰는지 본다 | 활용·자산가시성 L1, 거버넌스·신뢰 1.3 | AXE 스쿼드, 2027년 1분기 |
| 2. 품질·위험 기준. 영향이 큰 업무부터 검수 기준과 중단 절차를 정한다 | 품질·위험관리 L1, 검수 블로커 9건 | AXE 스쿼드·업무 책임자, 2027년 1분기 |
| 3. 가치 측정 기반. 비용 가시성과 기준선을 만든다. 2027 가치 측정의 선결 조건과 같다 | 가치측정·투자조정 L1, 성과 미확인 16개 | AXE 스쿼드, 2027년 상반기 |
진단 목적 점검: 이 결과가 진단 목적에 답하는가
| 진단 목적 질문 | 이번 결과의 답 | 답의 확신 | 보완 방법 |
|---|---|---|---|
| 어디까지 적용됐나 | 적용·성과 리포트가 답한다. 조직 역량은 적용을 받치는 조건이 만드는 쪽에서만 갖춰졌음을 보여 준다 | – | – |
| 성과로 이어지나 | 확인하는 조건이 L1이라, 성과가 나도 회사가 확인하고 확산할 수단이 없다 | 부분 | 가치 측정 기반을 만든 뒤 다시 확인한다 |
| 무엇이 막나 | 거버넌스·신뢰와 확인하는 조건 4개이다. 적용·성과의 블로커와 원인이 같다 | 충분 | – |
| 어디에 투자하나 | 자산·사용 가시성, 품질·위험 기준, 가치 측정 기반의 순서이다 | 부분 | 개인 역량 결과와 합쳐 최종 확정한다 |
가상 데이터이며 실제 진단 결과가 아니다.
조직 역량의 영역과 수준 기준은 아래 외부 프레임워크를 바탕으로 미리디에 맞게 정했다.
| 출처 | 가져온 부분 | 적용 위치 |
|---|---|---|
| DORA AI Capabilities Model (2025) | AI 효과를 조직 역량·운영 환경과 연결하는 구조, 데이터·내부 플랫폼·작은 단위 작업 | 업무흐름·운영, 데이터·지식·플랫폼 |
| McKinsey, The State of AI (2026) | 업무 흐름 재설계, 리더의 방향 설정과 자원 배분, 고성과 기업 비율(약 6%) | 전략·리더십, 업무흐름·운영 |
| BCG, The Widening AI Value Gap (2025) | AI 가치의 대부분이 사람·프로세스 변화에서 나온다는 관점, 기업 성숙도 분포(5%·35%·60%) | 사람·조직문화 |
| NIST AI RMF 1.0 | 거버넌스·책임·모니터링, 현재와 목표 상태의 차이를 찾는 방식 | 거버넌스·신뢰 |
| ISO/IEC 42001 | AI의 역할 범위와 사람의 검토·승인 책임 | 거버넌스·신뢰 |
| Microsoft 에이전트 AI 도입 성숙도 모델 | 축별 현재 상태를 점수가 아닌 투자 우선순위로 쓰는 방식, 수준 단계 구분 | 수준 기준, 결과와 해석 |
외부 모델의 단계와 미리디의 수준 단계는 일대일로 대응하지 않는다.
가치는 성과가 회사 목표와 사업 결과에 기여한 정도이다. 가치 경로의 마지막 단계로, 재무 가치와 비재무 가치를 함께 본다.
| 구분 | 이번 회차 (2026년 10~12월) | 다음 단계 (2027년 상반기) |
|---|---|---|
| 하는 일 | 워크플로우마다 성과가 어떤 가치로 이어질지 연결 방향만 기록한다 | 측정 기반을 갖춘 뒤 가치를 측정한다 |
| 하지 않는 일 | 가치를 측정하거나 판정하지 않는다 | 하나의 숫자로 합산하지 않는다 |
| 산출물 | 워크플로우별 연결 방향 목록, 선결 조건 점검표 | 워크플로우 2~3개의 첫 가치 보고 |
성과는 워크플로우의 결과가 바뀌었는지를 보고, 가치는 그 변화가 회사에 무엇을 남겼는지를 본다. 같은 워크플로우를 다른 관점에서 본 것이므로, 두 단계의 수치를 서로 더하지 않는다.
| 구분 | 성과 | 가치 |
|---|---|---|
| 묻는 것 | 워크플로우 결과가 바뀌었는가 | 그 변화가 회사에 무엇을 남겼는가 |
| 단위 | 워크플로우의 처리 시간, 품질, 처리량 | 재투입한 시간, 품질·경험, 사업 KPI, 금액 |
| 누가 확인하는가 | AXE 스쿼드가 업무 기록으로 판정한다 | 확인 책임자와 KPI 담당자가 인정한다 |
| 언제 | 이번 회차(2026년 10~12월) | 2027년 상반기 |
| 예 | 첫 답변 시간이 건당 12분에서 8분으로 줄었다 | 줄어든 시간으로 VIP 문의 대응을 늘려 재문의가 줄었다 |
성과가 가치로 이어지는 경로
환산 예시 (가상)
| 단계 | 기록 | 확인 방법 |
|---|---|---|
| 성과 | 고객 문의 첫 답변 시간이 건당 12분에서 8분으로 줄었다. 월 3,000건이다 | 상담 시스템 기록, 적용 전후 비교 |
| 여력 | 월 200시간(4분 × 3,000건) | 계산값. 아직 가치가 아니다 |
| ① 재투입 | 200시간 가운데 120시간(60%)을 VIP 문의 대응에 썼다 | 팀장 확인, 업무 배정 기록 |
| 비재무 가치 | VIP 재문의율이 18%에서 14%로 줄었다 | CS 지표, KPI 담당자 인정 |
| ② 귀속 | 4%p 가운데 AI 적용의 몫을 50%로 본다(2%p) | 같은 기간 다른 변화(정책, 인력) 확인 |
| 재무 가치 | 재문의 감소로 줄어든 상담 비용과 이탈 방지 매출을 월 150만~400만 원으로 추정한다 | 낮음·높음 두 시나리오 |
| ③ 비용 차감 | 추가 비용 월 100만 원(라이선스·토큰, 검토 시간)을 빼면 순편익은 월 50만~300만 원이다 | 비용 가시성 자료 |
모든 수치는 설명을 위한 가상값이다. 2027 상반기 측정 설계 때 실제 기준선과 비용 자료로 바꾼다. 여력 200시간에 인건비를 곱한 값은 현금 절감이 아니다.
조직 역량의 가치측정·투자조정은 이 경로를 회사가 실제로 운영하는 능력이다. 셋을 구분해야 측정 체계는 갖췄지만 효과가 없는 상태를 드러낼 수 있다.
적용·성과 인터뷰에서 워크플로우마다 '이어질 가치' 한 칸을 함께 적는다. 이 기록이 2027 상반기 측정의 출발점이 된다.
| 항목 | 정한 내용 |
|---|---|
| 적는 곳 | 적용·성과 탭의 워크플로우 진단 기록지 '이어질 가치(방향)' 칸 |
| 적는 내용 | 가치 유형 하나와 한 줄 설명 |
| 가치 유형 | 시간 재투입 / 품질·경험 / 사업 KPI / 새로 가능해진 업무 / 재무(비용·매출) |
| 누가 | AX 챔피언이 답하고, AXE 스쿼드가 기록한다 |
| 판정 | 하지 않는다. 기록한 방향은 확인된 가치가 아니다 |
작성 예시(가상)
| 워크플로우 | 성과 | 이어질 가치(방향) |
|---|---|---|
| 고객 문의 접수 → 답변 발송 | 첫 답변까지 시간 변화 없음 | 시간 재투입: 줄어든 답변 시간을 VIP 문의 대응에 쓴다 |
| 주간 실적 보고서 작성 | 작성 시간 개선 | 품질·경험: 보고 수치의 정합성이 오른다 |
| 상세 페이지 시안 제작 | 미확인 | 사업 KPI: 출시 속도와 전환율로 이어진다 |
진단 결과에는 유형별 기록 건수만 보고한다. 성과가 '개선'이 아닌 워크플로우의 방향도 기록해, 측정 대상을 고를 때 쓴다.
가치 지표는 외부 가치 측정 체계(Microsoft 가치 측정 가이드, DORA ROI, Forrester TEI, AWS CAF 편익 관리)에 맞춰 근거를 붙였다. 가치는 성과에서 비재무 가치(시간 재투입, 품질·고객·직원 경험, 새로 가능해진 업무)를 거쳐 재무 가치(비용, 매출)로 이어지는 순서로 본다. 아래 가치 유형은 방향을 정한 후보이며, 지표와 측정 방법은 2027 상반기에 확정한다. 이번 회차에는 워크플로우별 연결 방향만 기록한다.
| 지표 | 무엇을 보나 | 측정 예 (예시, 워크플로우마다 정함) | 근거 |
|---|---|---|---|
| 가치 등록과 측정 계획 | 성과가 어떤 가치로 이어지는지, 무엇으로 언제 누가 확인할지 | 연결 방향, 지표·기준선, 확인 시점, 확인 책임자, 판정 조건을 등록 | AWS CAF 편익 관리의 편익 등록부(benefits register), SMART 결과, 선행·후행 지표 구분. Microsoft 가치 측정 가이드의 가치 동인별 선행·후행 지표. DORA ROI 23쪽(자기 조직의 가정을 명시) |
| 시간 여력과 재투입 | 줄어든 사람 시간을 실제로 어디에 다시 썼는가 | 처리량·투입 지표에서 줄어든 건당 시간 × 건수, 재투입한 업무와 그 결과(관리자 확인) | Microsoft 가치 측정 가이드의 Efficiency(돌려받은 생산 시간을 더 가치 있는 일에 재투입)와 관리자 사례 수집. DORA ROI 24~25쪽(확보한 여력의 재투자, 여력과 현금 절감의 구분). BCG AI at Work: 주 8시간을 절약한다는 응답이 42%이지만, 절반 이상이 그 시간을 더 전략적인 일에 쓰지 않는다 |
| 품질·고객·직원 경험 | 받는 사람, 고객, 직원의 경험이 기준선보다 나아졌는가 | 받는 사람 만족도, 고객 불만·재문의, 직원 경험 설문 | Microsoft 가치 측정 가이드의 Quality(오류 감소, 일관성)와 Strategic(employee sentiment). Brynjolfsson 외 2025: 고객 반응이 개선되고 직원 유지율이 올랐다. SPACE: 만족·웰빙을 생산성의 한 차원으로 둔다 |
| 사업 KPI 연결 | KPI 오너가 인정하는 사업 지표로 이어지는가 | 처리 비용, 전환율, 출시 속도 같은 KPI의 기준선 대비 변화와 귀속 범위 | DORA ROI 22쪽(조직 조건 → 전달 성과 → 비재무 가치 → 재무 가치). Microsoft 가치 측정 가이드의 Revenue 산식에 있는 귀속 할인(attribution discount). AWS CAF 편익 관리의 사업 KPI 정렬 |
| 새로 가능해진 업무 | 예전에 못 하던 일이 실제로 쓰이고 가치를 만드는가 | 이전 제약 → 새 가능성 → 실사용 → 효과의 사례 기록 | Microsoft 가치 측정 가이드의 Strategic(new capabilities shipped). BCG Invent(AI로 새 제품·서비스와 매출원을 만든다). AWS CAF 편익 관리의 새 매출원. DORA ROI 46쪽(저비용 실험의 선택 가치). 가치에 둔 배치는 정본의 자체 판단이다 |
| 재무 ROI | 근거 있는 재무 편익이 추가 비용을 넘는가 | (근거 있는 재무 편익 − 추가 비용) ÷ 추가 비용을 범위와 시나리오로 | Forrester TEI(비용·편익·유연성·위험의 네 요소). DORA ROI 30~34쪽(직접비, 초기 적응, 검증, 유지 비용 포함)과 37쪽(가치·비용 시나리오) |
측정 원칙. 원칙은 세 가지이다. 첫째, 적용 → 성과 → 비재무 가치 → 재무 가치의 순서로 증거를 잇는다(Microsoft 가치 측정 가이드, DORA ROI 22쪽). 둘째, 확보한 여력은 현금이 아니며, 실제로 재투입한 것을 확인해야 가치로 본다(DORA ROI 24~25쪽, Microsoft의 time-savings trap, BCG AI at Work). 셋째, 효과의 귀속과 중복 계상에 주의하고, 하나의 숫자 대신 범위와 시나리오로 낸다(DORA ROI 23·37쪽, Microsoft의 귀속 할인, Forrester TEI의 위험 요소).
시간 여력을 인건비로 환산한 값은 현금 절감이 아니다. 같은 시간 여력을 인건비 절감과 매출 증가에 이중으로 더하지 않는다. 경험 지표나 KPI의 변화를 AI 적용만의 효과로 해석하지 않는다.
가치를 실제로 재려면 아래 네 가지가 먼저 갖춰져야 한다. 재무 가치는 비용 가시성과 귀속 설계 없이 산정하지 않는다. 비재무 가치는 기준선과 확인 책임자가 있으면 먼저 볼 수 있다.
| 선결 조건 | 왜 필요한가 | 지금 상태와 연결 |
|---|---|---|
| 전사 비용 가시성 | 재무 ROI의 분모이다. AI 지출(라이선스, API·토큰)을 조직·워크플로우 단위로 나눠 볼 수 있어야 한다. 검토·수정·유지 같은 사람 투입도 비용에 들어간다(DORA ROI 30~34쪽) | AI 게이트웨이 전환 검토와 연결한다. 조직 역량의 활용·자산가시성(비용 파악 포함)에서 현재 수준을 판정한다 |
| 기준선 기록 | 비교의 출발점이다. 적용 전 값이 없으면 변화를 말할 수 없다 | 이번 진단의 성과 기록이 기준선의 출발점이 된다. 심층 측정 전에 워크플로우별 표본 기록을 시작한다 |
| 확인 책임자·KPI 연계 | 가치를 인정할 책임자와 사업 지표 자료가 있어야 한다 | 이번 회차의 연결 방향 기록에서 사업 KPI 유형을 모아, 2027 상반기에 KPI 담당자를 정한다 |
| 귀속·비교 설계 | 변화 가운데 AI 효과로 볼 부분을 정해야 과대 추정과 중복 계상을 막는다(Microsoft 가치 측정 가이드의 귀속 할인, Forrester TEI의 위험 요소) | 2027 상반기에 비교 기간·비교 조직 등 설계를 정한다 |
선결 조건이 부족하다는 사실 자체를 진단 결과로 보고한다. 조직 역량의 가치측정·투자조정과 활용·자산가시성 판정, 그리고 성과에서 가치로 이어지지 않는 막힌 곳으로 다룬다.