ADsP 2과목 데이터 분석 기획 핵심요약: CRISP-DM·KDD·SEMMA·분석 방법론·데이터 거버넌스 총정리

ADsP 2과목인 데이터 분석 기획은 데이터를 직접 분석하는 기술보다 어떤 문제를 어떤 절차와 방법으로 분석할 것인지 설계하는 과정을 이해하는 과목입니다.

1과목이 데이터와 빅데이터의 기본 개념을 이해하는 영역이라면 2과목에서는 분석 프로젝트를 실제로 시작하기 전에 필요한 기획, 방법론, 우선순위, 조직, 데이터 관리체계를 다룹니다.

특히 시험에서는 각각의 개념을 아는 것만큼 단계의 순서와 서로 비슷한 방법론의 차이를 정확하게 구분하는 것이 중요합니다.

먼저 다음 흐름을 기억해두면 전체 구조를 이해하기 쉽습니다.

아직 학습 전 이해가 되지 않는 내용이나 추가로 설명이 필요한 경우 하단 하위 페이지를 참고 하시면 좋습니다.

분석할 문제를 찾는다
↓
분석 방법을 결정한다
↓
분석 방법론에 따라 수행한다
↓
분석 과제의 우선순위를 정한다
↓
조직과 데이터 환경을 준비한다
↓
데이터를 표준화하고 관리한다
↓
분석 결과를 실제 업무에 적용한다

시험 직전이라면 특히 다음 내용을 먼저 기억합니다.

분석 기획 4사분면
Optimization · Insight · Solution · Discovery

KDD
Selection → Preprocessing → Transformation
→ Data Mining → Interpretation/Evaluation

SEMMA
Sample → Explore → Modify → Model → Assess

CRISP-DM
업무 이해 → 데이터 이해 → 데이터 준비
→ 모델링 → 평가 → 전개

하향식
문제 탐색 → 문제 정의 → 해결방안 탐색 → 타당성 검토

분석 준비도
분 · 인 · 기 · 데 · 문 · IT

성숙도
도입 → 활용 → 확산 → 최적화

1장 분석 기획이란 무엇인가#

데이터 분석을 시작한다고 해서 곧바로 데이터를 수집하고 분석 모델을 만드는 것은 아닙니다.

먼저 무엇을 해결하려고 하는지, 어떤 데이터를 활용할 것인지, 어떤 방법을 적용할 것인지 정해야 합니다.

이 과정을 분석 기획이라고 볼 수 있습니다.

분석 기획에서는 크게 두 가지 질문을 생각합니다.

What
무엇을 분석할 것인가?

How
어떻게 분석할 것인가?

이 두 질문을 알고 있는지 여부에 따라 분석 상황을 네 가지로 구분할 수 있습니다.


2장 분석 기획 4사분면이란 무엇인가 ★★★#

분석 기획 4사분면은 분석 대상인 What과 분석 방법인 How를 알고 있는지에 따라 분석 유형을 구분합니다.

What을 아는가?
How를 아는가?

이 두 조건을 조합하면 네 가지 경우가 만들어집니다.

분석 유형 What How 의미
Optimization O O 대상과 방법을 모두 알고 있음
Insight O X 대상은 알지만 방법을 모름
Solution X O 방법은 있지만 적용 대상을 모름
Discovery X X 대상과 방법 모두 불명확

Optimization — 최적화#

What O
How O

무엇을 분석해야 하는지도 알고 있고 분석 방법도 알고 있습니다.

따라서 이미 존재하는 업무나 분석을 더 효율적으로 개선하는 것이 핵심입니다.

예를 들어 기존 배송 경로와 최적화 알고리즘이 이미 존재한다면:

배송시간을 더 줄이려면 어떻게 해야 하는가?

같은 문제가 Optimization에 해당할 수 있습니다.

Insight — 통찰#

What O
How X

무엇을 알고 싶은지는 명확하지만 어떻게 분석해야 할지는 모르는 상황입니다.

예:

고객 이탈 원인은 알고 싶다.
↓
어떤 분석 방법이 적합한지는 아직 모른다.

Solution — 솔루션#

What X
How O

분석 방법이나 기술은 알고 있지만 이를 어느 문제에 적용해야 할지가 명확하지 않은 상황입니다.

예를 들어 특정 예측 알고리즘을 사용할 수 있지만:

이 알고리즘을 어떤 업무 문제에 적용할 것인가?

를 찾아야 하는 상황입니다.

Discovery — 발견#

What X
How X

분석 대상과 방법이 모두 명확하지 않습니다.

따라서 데이터를 탐색하면서 새로운 문제나 기회를 발견해야 합니다.

4사분면 빠른 암기#

O / O
→ Optimization

O / X
→ Insight

X / O
→ Solution

X / X
→ Discovery

3장 하향식과 상향식 분석은 어떻게 연결되는가#

분석 접근 방법은 크게 하향식 Top-down과 상향식 Bottom-up으로 구분할 수 있습니다.

첨부 자료에서는 분석 기획 4사분면과 다음과 같이 연결해 설명합니다.

Optimization
Solution
→ 하향식

Insight
Discovery
→ 상향식

하향식 접근#

이미 문제를 어느 정도 알고 있는 상태에서 해결방법을 찾아가는 방식입니다.

문제
↓
분석
↓
해결책

즉 Problem Solving 성격이 강합니다.

상향식 접근#

데이터를 먼저 탐색하면서 새로운 패턴이나 문제를 발견합니다.

Data
↓
Pattern
↓
Insight
↓
새로운 문제 발견

즉 Problem Creation과 연결됩니다.


4장 분석 방법론이란 무엇인가 ★★☆#

분석 프로젝트를 담당자마다 다른 방식으로 수행하면 결과와 품질이 일관되기 어렵습니다.

따라서 분석 작업을 일정한 절차와 기준에 따라 수행할 수 있도록 분석 방법론을 사용합니다.

첨부 자료에서는 분석 방법론을 네 가지 구성요소로 설명합니다.

절차
방법
도구와 기법
템플릿과 출력물

절차#

Procedure.

분석을 어떤 단계와 순서로 수행할 것인지를 정의합니다.

방법#

Method.

각 단계에서 어떤 분석 방법을 사용할지 정의합니다.

도구와 기법#

Tools & Techniques.

분석을 수행하기 위해 사용하는 기술과 도구입니다.

템플릿과 출력물#

Templates & Outputs.

분석 결과와 산출물을 어떤 형태로 작성할 것인지를 정의합니다.

시험 함정#

첨부 자료에서는 다음을 주의하도록 정리합니다.

목적 Purpose
→ 분석 방법론의 4가지 구성요소가 아님

5장 KDD 프로세스란 무엇인가 ★★★#

KDD는 Knowledge Discovery in Databases의 약자입니다.

Database 안에 존재하는 데이터에서 유용한 지식과 패턴을 발견하는 과정을 설명합니다.

KDD는 다섯 단계로 구성됩니다.

Selection
↓
Preprocessing
↓
Transformation
↓
Data Mining
↓
Interpretation / Evaluation

1단계 Selection — 데이터 선택#

분석에 사용할 대상 데이터셋을 선택합니다.

전체 데이터
↓
분석 대상 데이터셋 선택

2단계 Preprocessing — 전처리#

데이터에 존재하는 문제를 찾아 정리합니다.

예:

결측치
이상값
Noise
오류 데이터

3단계 Transformation — 변환#

분석에 적합하도록 데이터를 변환합니다.

첨부 자료에서는 특히 변수 선택과 차원 축소를 Transformation의 핵심으로 설명합니다.

4단계 Data Mining — 데이터 마이닝#

분석 목적에 적합한 기법을 적용하여 데이터에서 패턴을 찾습니다.

5단계 Interpretation/Evaluation — 해석과 평가#

분석 결과를 해석하고 분석 목적에 적합한 결과인지 평가합니다.

KDD에서 가장 헷갈리는 부분#

Selection
→ 데이터셋 선택

Transformation
→ 변수 선택

입니다.

시험에서:

KDD의 Selection 단계에서는 변수를 선택한다.

라고 나오면 첨부 자료의 기준에서는 틀린 설명입니다.

KDD 5단계 빠른 암기#

선택
↓
전처리
↓
변환
↓
마이닝
↓
해석·평가

6장 SEMMA란 무엇인가 ★★☆#

SEMMA는 SAS Institute에서 제안한 데이터 마이닝 방법론입니다.

이름 자체가 다섯 단계의 앞글자로 구성됩니다.

S
Sample

E
Explore

M
Modify

M
Model

A
Assess

따라서 순서 자체를 그대로 암기하면 편합니다.

Sample
→ Explore
→ Modify
→ Model
→ Assess

Sample — 표본 추출#

분석 가능한 크기의 Sample을 추출합니다.

필요하면 Training·Validation·Test 데이터로 나눌 수 있습니다.

Explore — 탐색#

데이터의 분포와 특성을 살펴봅니다.

기초 통계
분포
Pattern
이상치
Visualization

등을 확인합니다.

Modify — 수정#

분석하기 좋은 형태로 데이터를 수정합니다.

변수 변환
변수 생성
변수 선택
결측치 처리

등이 포함됩니다.

Model — 모델링#

분석 Model을 만듭니다.

예:

회귀
의사결정나무
신경망

Assess — 평가#

만들어진 Model의 성능을 평가합니다.

SEMMA 시험 포인트#

SEMMA는:

Sample부터 시작

합니다.

따라서:

SEMMA의 첫 단계는 Business Understanding이다.

라는 설명은 첨부 자료 기준으로 맞지 않습니다.


7장 CRISP-DM이란 무엇인가 ★★★#

CRISP-DM은 Cross Industry Standard Process for Data Mining의 약자입니다.

특정 산업에만 한정되지 않고 데이터 마이닝과 분석 프로젝트에 폭넓게 활용할 수 있도록 설계된 방법론입니다.

총 여섯 단계입니다.

Business Understanding
↓
Data Understanding
↓
Data Preparation
↓
Modeling
↓
Evaluation
↓
Deployment

한국어로 기억하면:

업무 이해
↓
데이터 이해
↓
데이터 준비
↓
모델링
↓
평가
↓
전개

입니다.

1단계 업무 이해#

Business Understanding.

비즈니스 목적과 현재 상황을 파악하고 분석 목표를 설정합니다.

핵심 질문은:

왜 이 분석을 하는가?

입니다.

2단계 데이터 이해#

Data Understanding.

초기 데이터를 수집하고 데이터의 특징과 품질을 살펴봅니다.

초기 데이터 수집
데이터 탐색
데이터 품질 확인

3단계 데이터 준비#

Data Preparation.

실제 분석에 사용할 Dataset을 구성합니다.

데이터 선택
정제
통합
변환
Formatting

등이 이루어집니다.

4단계 모델링#

Modeling.

적합한 모델링 기법을 선택하고 실제 분석 Model을 만듭니다.

5단계 평가#

Evaluation.

분석 결과와 Model이 실제 목적에 맞는지 평가합니다.

첨부 자료에서는 모델 적용성 평가도 Evaluation 단계에 포함한다고 설명합니다.

6단계 전개#

Deployment.

분석 결과를 실제 업무에 적용하기 위한 계획을 수립합니다.

배포
Monitoring
유지보수 계획

등을 고려합니다.

CRISP-DM은 단방향이 아니다#

CRISP-DM은:

1 → 2 → 3 → 4 → 5 → 6

으로 한 번 진행하고 끝나는 완전한 일방향 구조가 아닙니다.

필요하다면 이전 단계로 돌아가 데이터를 다시 준비하거나 Model을 수정할 수 있습니다.

데이터 준비
↔
모델링
↔
평가

처럼 반복적인 피드백이 발생할 수 있습니다.


8장 KDD·SEMMA·CRISP-DM 차이#

ADsP 2과목에서 세 방법론은 반드시 비교해서 기억하는 것이 좋습니다.

방법론 단계 특징
KDD 5단계 데이터에서 지식을 발견하는 과정
SEMMA 5단계 SAS Institute가 제안한 데이터 마이닝 중심 방법론
CRISP-DM 6단계 비즈니스 문제 해결과 산업 적용 중심

순서 비교#

KDD

Selection
Preprocessing
Transformation
Data Mining
Interpretation/Evaluation
SEMMA

Sample
Explore
Modify
Model
Assess
CRISP-DM

Business Understanding
Data Understanding
Data Preparation
Modeling
Evaluation
Deployment

가장 빠른 구분법#

KDD
→ Selection 시작

SEMMA
→ Sample 시작

CRISP-DM
→ Business Understanding 시작

9장 빅데이터 분석 방법론이란 무엇인가 ★★★#

첨부 자료의 빅데이터 분석 방법론은 세 가지 계층 구조를 가집니다.

Phase
↓
Task
↓
Step

그리고 전체 분석 흐름을 다섯 단계로 구분합니다.

분석 기획
↓
데이터 준비
↓
데이터 분석
↓
배포
↓
관리

분석 기획#

Planning.

비즈니스 이해
프로젝트 범위 설정
위험 관리 계획

등을 수행합니다.

데이터 준비#

Preparing.

필요 데이터 정의
데이터 수집
데이터 정제

가 이루어집니다.

데이터 분석#

Analyzing.

실제 분석 기법을 적용하고 Model을 만듭니다.

배포#

Deploying.

만들어진 Model이나 분석 결과를 실제 환경에 적용합니다.

관리#

Managing.

분석 프로젝트와 품질을 지속적으로 관리합니다.

시험에서 중요한 부분#

첨부 자료에서는 특히:

데이터 준비
↔
데이터 분석

사이에서 피드백이 많이 발생한다고 설명합니다.

또한:

필요 데이터 정의
→ 데이터 준비 단계

로 정리하고 있습니다.


10장 분석 프로젝트의 위험 대응 방법 ★★★#

분석 프로젝트에서는 기술만큼 위험 관리도 중요합니다.

첨부 자료에서는 위험 대응을 네 가지로 구분합니다.

회피
전이
완화
수용

회피 Avoid#

위험의 원인을 제거합니다.

예:

위험한 기능 자체를 제외

전이 Transfer#

위험의 부담을 다른 주체로 이전합니다.

예:

보험
Outsourcing

완화 Mitigate#

위험이 발생할 가능성이나 영향을 줄입니다.

예:

Backup
이중화

수용 Accept#

위험이 존재한다는 사실을 인정하고 발생했을 때 대응할 방법을 준비합니다.

예:

비상 대응 계획

빠른 암기#

회
전
완
수

11장 하향식 접근법이란 무엇인가 ★★★#

하향식 접근법은 이미 인식한 문제에서 출발해 해결방안을 찾아가는 방식입니다.

쉽게 표현하면:

문제가 무엇인가?
↓
왜 발생하는가?
↓
어떻게 해결할 것인가?

의 흐름입니다.

첨부 자료에서는 네 단계로 설명합니다.

문제 탐색
↓
문제 정의
↓
해결방안 탐색
↓
타당성 검토

1단계 문제 탐색#

Problem Discovery.

어떤 문제를 어떤 목적으로 해결해야 하는지를 탐색합니다.

핵심 질문:

무엇을 해야 하는가?
왜 해야 하는가?

2단계 문제 정의#

Problem Definition.

찾아낸 비즈니스 문제를 실제 데이터 분석이 가능한 형태의 문제로 구체화합니다.

3단계 해결방안 탐색#

Solution Search.

정의된 문제를 해결하기 위한 분석 방법과 대안을 찾습니다.

4단계 타당성 검토#

Feasibility Study.

실제 수행할 가치와 가능성이 있는지를 검토합니다.

첨부 자료에서는:

경제적 타당성
데이터 타당성
기술적 타당성

등을 고려합니다.

하향식 접근 핵심#

문제부터 출발
Problem Solving
Why 중심

으로 기억합니다.


12장 하향식 문제 탐색 방법#

하향식 접근법에서 문제를 찾는 방법도 시험에 등장합니다.

첨부 자료에서는 세 가지를 제시합니다.

비즈니스 모델 기반 탐색#

비즈니스 모델을 기준으로 분석 기회를 찾습니다.

업무
제품
고객

등의 영역을 살펴봅니다.

외부 참조 모델 탐색#

외부의 성공 사례와 경쟁사 사례를 참고합니다.

Best Practice
Benchmarking
경쟁사 사례

등이 대표적입니다.

유스케이스 탐색#

데이터 분석으로 문제를 해결한 Use Case를 기반으로 새로운 분석 과제를 찾습니다.

시험 함정#

첨부 자료에서는:

데이터 기반 탐색
→ 상향식

으로 구분합니다.

따라서 하향식의 문제 탐색 방법과 혼동하지 않도록 합니다.


13장 STEEP 분석이란 무엇인가#

분석 기회를 찾을 때 기업 외부의 환경을 살펴볼 수 있습니다.

첨부 자료에서는 STEEP을 다음과 같이 정리합니다.

S
Social

T
Technological

E
Economic

E
Environmental

P
Political

즉:

사회
기술
경제
환경
정치

환경을 살펴보는 것입니다.


14장 상향식 접근법이란 무엇인가 ★★★#

상향식 접근법은 문제를 먼저 정의하지 않고 데이터를 탐색하면서 새로운 패턴이나 문제를 발견하는 방식입니다.

Data
↓
Pattern
↓
Insight
↓
새로운 문제 또는 기회

첨부 자료에서는 상향식 접근법을 비지도 학습 기반, What 중심, Problem Creation과 연결해 설명합니다.

하향식과 가장 큰 차이#

하향식
문제 → 데이터

상향식
데이터 → 문제 발견

입니다.


15장 디자인 사고 5단계#

첨부 자료에서는 상향식 접근과 함께 디자인 사고의 다섯 단계를 설명합니다.

공감
↓
정의
↓
아이디어화
↓
시제품
↓
검증

공감 Empathize#

실제 사용자와 이해관계자를 관찰하고 요구사항을 이해합니다.

정의 Define#

관찰 결과를 정리해 핵심 문제를 정의합니다.

아이디어화 Ideate#

문제를 해결할 수 있는 다양한 아이디어를 만듭니다.

시제품 Prototype#

완벽한 결과물을 만들기보다 빠르게 시험해볼 수 있는 Prototype을 만듭니다.

검증 Test#

실제 사용자를 대상으로 시험하고 Feedback을 받습니다.

필요하면 다시 이전 단계로 돌아갑니다.

디자인 사고의 특징#

첨부 자료에서는 디자인 사고가:

발산
+
수렴

과정을 반복한다고 설명합니다.


16장 프로토타입 접근법이란 무엇인가#

Prototype 방식은 완성된 결과물을 처음부터 만들기보다 빠르게 시험 가능한 모형을 먼저 만드는 방식입니다.

가설 생성
↓
실험 설계
↓
Prototype
↓
실제 환경 Test
↓
Feedback
↓
통찰

초기 요구사항이 명확하지 않거나 빠르게 검증해야 할 때 활용할 수 있습니다.


17장 하향식과 상향식 차이 총정리#

구분 하향식 상향식
시작점 문제 데이터
영어 Top-down Bottom-up
목적 Problem Solving Problem Creation
중심 질문 Why What
관련 성격 지도학습 기반 비지도학습 기반
방식 문제를 해결 패턴을 찾아 문제 발견
대표 개발 접근 Waterfall Prototype·Spiral

빠르게 기억하면:

Top-down
→ 문제부터

Bottom-up
→ 데이터부터

입니다.


18장 분석 마스터플랜이란 무엇인가 ★★☆#

기업에는 분석하고 싶은 문제가 매우 많습니다.

하지만 모든 분석 과제를 동시에 수행할 수는 없습니다.

따라서 전사 차원에서 분석 과제를 정리하고 우선순위를 결정하여 실행계획을 만드는 분석 마스터플랜이 필요합니다.

첨부 자료에서는 크게 두 가지 평가 기준을 제시합니다.

시급성
난이도

시급성#

현재 기업 전략이나 업무에서 얼마나 빨리 해결해야 하는지를 평가합니다.

첨부 자료에서는 Value와 연결해 설명합니다.

난이도#

분석 과제를 실제로 수행하기 얼마나 어려운지를 평가합니다.

첨부 자료에서는:

Volume
Variety
Velocity

와 연결합니다.


19장 분석 과제의 ROI 요소#

분석 프로젝트에서는 투입되는 비용과 얻을 수 있는 가치를 비교할 수 있습니다.

첨부 자료에서는 다음 구조로 정리합니다.

투자 비용 요소
→ Volume
→ Variety
→ Velocity

비즈니스 효과
→ Value

따라서:

3V
→ 비용 측면

Value
→ 효과 측면

으로 기억할 수 있습니다.

시험 함정#

첨부 자료에서는 Visuality를 ROI 요소로 포함하지 않습니다.

또한 Value는 투자 비용 요소가 아니라 비즈니스 효과와 연결합니다.


20장 분석 과제 우선순위는 어떻게 정하는가#

분석 마스터플랜에서는 시급성과 난이도를 함께 고려합니다.

핵심적으로는:

시급하고 쉬운 분석
→ 우선 추진

시급하지만 어려운 분석
→ 중기적으로 추진

시급하지 않은 분석
→ 장기 검토

하는 방식으로 접근합니다.

첨부 자료에서는 특히 쉽고 시급한 과제를 우선 추진하는 형태로 정리하고 있습니다.


21장 ISP 방식과 비ISP 방식의 차이#

ISP 방식#

ISP는 Information Strategy Planning, 즉 정보전략계획을 의미합니다.

전사 전략을 기반으로 분석 계획을 수립합니다.

기업 전략
↓
정보전략
↓
분석과제

특징:

하향식
전략 중심
중장기 관점

비ISP 방식#

현재 업무 현황과 현업 요구를 기반으로 분석 과제를 발굴합니다.

특징:

상향식
현업 중심
단기 성과 중심

빠른 비교#

ISP
→ 전략
→ 하향식

비ISP
→ 현업
→ 상향식

22장 분석 로드맵 수립 순서#

첨부 자료에서는 분석 Roadmap 수립 과정을 다음 순서로 정리합니다.

분석 과제 발굴
↓
우선순위 평가
↓
단계별 이행계획 수립
↓
비용·인력 추정
↓
Risk 대응계획

Roadmap은 단순히 분석 주제 목록을 만드는 것이 아니라 언제, 어떤 순서로, 어떤 자원을 사용해 수행할 것인지까지 결정하는 과정입니다.


23장 분석 준비도란 무엇인가 ★★★#

분석을 잘하려면 Model이나 분석기법만 준비되어 있다고 충분하지 않습니다.

기업 전체가 분석을 수행할 준비가 되어 있는지를 살펴봐야 합니다.

첨부 자료에서는 분석 준비도를 여섯 가지로 구분합니다.

분석 업무
분석 인력 및 조직
분석 기법
분석 데이터
분석 문화
IT 인프라

암기:

분
인
기
데
문
IT

즉:

분인기데문IT

입니다.

분석 업무#

현재 조직에서 어떤 분석을 수행하고 있는지를 확인합니다.

사실 분석
예측
Simulation
최적화

분석 인력과 조직#

데이터 분석 전문가와 분석 조직이 존재하는지 확인합니다.

분석 기법#

업무에 적합한 분석 방법론과 Library 등이 확보되어 있는지 확인합니다.

분석 데이터#

분석에 필요한 데이터가 충분하고 신뢰할 수 있는지 확인합니다.

첨부 자료에서는 외부 데이터 활용 체계도 포함해 설명합니다.

분석 문화#

조직의 의사결정이 데이터를 기반으로 이루어지는지를 봅니다.

IT 인프라#

분석을 수행할 기술적 기반이 존재하는지를 평가합니다.

예:

EAI
ETL
Server
Storage
Big Data 환경

24장 분석 성숙도란 무엇인가#

첨부 자료에서는 CMMI 기반 성숙도를 네 단계로 설명합니다.

도입
↓
활용
↓
확산
↓
최적화

도입 단계#

분석의 필요성을 인식하기 시작한 단계입니다.

활용 단계#

일부 업무에서 분석을 사용하기 시작합니다.

확산 단계#

분석이 조직 전체로 확산되고 체계가 만들어집니다.

최적화 단계#

분석을 적극적으로 활용해 업무 혁신과 경쟁우위를 만들어냅니다.

빠른 암기#

도
활
확
최

입니다.


25장 분석 준비도와 성숙도 매트릭스#

준비도와 성숙도를 함께 고려하면 조직의 분석 수준을 더 구체적으로 판단할 수 있습니다.

첨부 자료에서는 다음 네 유형을 사용합니다.

준비형
도입형
정착형
확산형

핵심은 분석 역량을 단순히 기술 보유 여부만으로 판단하지 않고 현재 성숙도와 미래 분석을 수행할 준비 수준을 동시에 본다는 점입니다.


26장 데이터 거버넌스란 무엇인가 ★★☆#

데이터가 기업의 중요한 자산이 되면서 데이터를 단순히 저장하는 것만으로는 부족합니다.

누가 관리하고, 어떤 규칙으로 사용하며, 어떤 이름과 기준으로 저장할 것인지 정해야 합니다.

이러한 전사적인 데이터 관리체계를 데이터 거버넌스라고 합니다.

첨부 자료에서는 데이터 거버넌스를:

전사 차원의 데이터에 대해 정책과 지침, 표준화, 조직과 책임 등을 정의하는 관리체계

로 설명합니다.

핵심 목적은 다음과 같습니다.

데이터 품질 확보

데이터 일관성 유지

데이터 보안 강화

가장 중요한 단어#

전사 차원

입니다.

특정 한 부서만 사용하는 관리정책이 아니라 조직 전체의 데이터 관리 기준을 만드는 것입니다.


27장 데이터 거버넌스 구성요소 5가지#

첨부 자료에서는 데이터 거버넌스를 다섯 요소로 설명합니다.

조직
프로세스
시스템
데이터
인력 자원

조직 Organization#

누가 데이터를 관리할 것인지 역할과 책임을 정의합니다.

프로세스 Process#

데이터를 어떻게 생성하고 사용하고 관리할 것인지 절차를 정의합니다.

시스템 System#

데이터 관리를 지원하는 IT 시스템과 Tool을 의미합니다.

데이터 Data#

실제로 관리해야 하는 데이터입니다.

대표적으로:

Master Data
Metadata
Standard Data

등이 있습니다.

인력 자원 Human Resource#

데이터 관리자와 전문가를 육성하고 교육합니다.

시험 함정#

첨부 자료에서는:

Data Resource

가 아니라:

Human Resource
인력 자원

이라고 구분합니다.


28장 마스터 데이터와 메타데이터의 차이는 무엇인가#

마스터 데이터#

Master Data.

기업 업무에서 기준이 되는 핵심 데이터입니다.

예:

고객
상품
공급업체
조직

메타데이터#

Metadata.

쉽게 표현하면:

데이터에 대한 데이터

입니다.

예를 들어 Database의 특정 Column이 있다고 가정해보겠습니다.

customer_id

Metadata에는 다음과 같은 정보가 포함될 수 있습니다.

Column 이름
Data Type
업무적 의미
생성 시점
관리 부서

즉 실제 고객 데이터가 아니라 고객 데이터를 설명하는 정보입니다.


29장 메타데이터에는 어떤 종류가 있는가 ★★★#

첨부 자료에서는 Metadata를 세 종류로 구분합니다.

업무 메타데이터

기술 메타데이터

운영 메타데이터

업무 메타데이터#

Business Metadata.

업무 관점에서 데이터의 의미를 설명합니다.

예:

고객ID
→ 회원을 구분하는 고유 식별번호

담당 부서
→ 마케팅팀

기술 메타데이터#

Technical Metadata.

기술적인 구조와 저장 정보를 설명합니다.

예:

Table 이름

Column 이름

Data Type

Index

저장 위치

운영 메타데이터#

Operational Metadata.

데이터가 실제 시스템에서 어떻게 생성되고 변경되고 사용되는지에 관한 정보입니다.

예:

최근 갱신시간

Batch 실행시간

접근 횟수

변경 이력

빠른 구분#

업무 Metadata
→ 무슨 뜻인가

기술 Metadata
→ 어떻게 저장되어 있는가

운영 Metadata
→ 언제·어떻게 운영되고 있는가

30장 데이터 사전·데이터 카탈로그·온톨로지 차이#

비슷하게 보이지만 역할이 서로 다릅니다.

데이터 사전#

Data Dictionary.

개별 데이터 항목의 의미와 속성, 형식, 규칙 등을 정의합니다.

고객번호
Data Type
길이
업무 정의
허용값

같은 정보를 관리합니다.

데이터 카탈로그#

Data Catalog.

조직 내부에 어떤 데이터가 존재하는지를 쉽게 찾고 탐색할 수 있도록 합니다.

핵심 질문은:

필요한 데이터가 어디에 있는가?

입니다.

온톨로지#

Ontology.

단순한 데이터 목록을 넘어 개념과 개념 사이의 관계까지 표현합니다.

예:

고객
↓ 구매한다
상품

상품
↓ 속한다
상품분류

처럼 의미적인 관계를 표현할 수 있습니다.

시험에서 구분#

Data Dictionary
→ 데이터 항목 정의

Data Catalog
→ 데이터 자산 검색·탐색

Ontology
→ 개념과 관계 표현

중요한 함정#

Metadata = Data Dictionary

는 아닙니다.

Metadata가 더 넓은 개념이고 Data Dictionary는 데이터를 설명하고 관리하기 위한 구체적인 도구 가운데 하나로 이해합니다.


31장 데이터 표준화란 무엇인가 ★★☆#

기업마다 같은 의미의 데이터를 서로 다른 이름으로 사용하면 문제가 발생합니다.

예를 들어:

고객번호
회원번호
사용자ID
CUSTOMER_ID
USER_NO

가 사실상 같은 의미를 나타낼 수도 있습니다.

이를 그대로 방치하면 시스템 통합과 데이터 분석이 어려워집니다.

그래서 조직 전체에서 사용할 데이터 이름과 규칙을 정합니다.

첨부 자료에서는 데이터 표준화 업무를 다음과 같이 제시합니다.

데이터 표준 용어 설정

명명 규칙 수립

Metadata 구축

Data Dictionary 구축

그리고 표준화 과정에서:

표준 단어 사전
표준 Domain 사전
표준 Code

등을 관리합니다.


32장 데이터 분석 조직구조에는 무엇이 있는가 ★★★#

첨부 자료에서는 데이터 분석 조직을 세 가지 형태로 구분합니다.

집중 구조
기능 구조
분산 구조

집중 구조#

별도의 독립적인 분석 전담조직을 만드는 방식입니다.

장점:

전사 전략에 따른 분석 가능
분석 과제의 우선순위 조정 가능
전문성 집중

단점으로는 현업 조직과 업무가 중복되면서 이중화·이원화 문제가 발생할 가능성을 제시합니다.

기능 구조#

별도의 분석 전문조직을 만들지 않고 기존 업무 부서에서 분석을 수행합니다.

장점:

현업 전문성 활용

가능성이 높습니다.

반면 전사적인 핵심 분석이 어려울 수 있고 기존 업무나 과거 실적 분석에 제한될 가능성이 있습니다.

분산 구조#

분석 전문가를 각 현업 조직에 배치하는 방식입니다.

장점:

현업과 밀접

빠른 Action

Best Practice 공유 가능

등이 있습니다.

반면 부서 사이 역할 분담이 불명확해질 위험이 있습니다.

조직구조 빠른 비교#

구조 핵심
집중 분석 전문가를 중앙에 모음
기능 각 업무 부서가 자체 분석
분산 분석 인력을 현업 부서에 배치

33장 데이터 기반 의사결정을 방해하는 요소#

첨부 자료에서는 기업의 합리적인 의사결정을 방해하는 요소로 다음을 제시합니다.

고정관념

편향

프레이밍 효과

고정관념#

과거 경험이나 기존 생각에 지나치게 의존해 새로운 정보를 받아들이지 못하는 문제입니다.

편향#

Bias.

특정 방향으로 사고와 판단이 치우치는 현상입니다.

프레이밍 효과#

Framing Effect.

같은 사실이라도 어떻게 표현하느냐에 따라 사람의 판단이 달라지는 현상입니다.

예를 들어 같은 결과를:

성공률 90%

라고 표현하는 것과:

실패율 10%

이라고 표현하는 것은 수치상 같은 의미이지만 사람이 받아들이는 느낌은 달라질 수 있습니다.


34장 분석 프로젝트에서 고려할 5가지 영역#

첨부 자료에서는 분석 프로젝트를 다섯 영역에서 바라봅니다.

Data Size

Data Complexity

Speed

Analytic Complexity

Accuracy & Precision

Data Size#

처리해야 할 데이터의 규모입니다.

Data Complexity#

데이터의 구조와 출처가 얼마나 복잡한지를 봅니다.

Speed#

얼마나 빠르게 분석 결과를 만들어야 하는지를 의미합니다.

예:

Batch 분석

Near Real-time

Real-time

Analytic Complexity#

분석 자체가 얼마나 복잡한지를 평가합니다.

단순 통계
vs
복잡한 고급 Model

Accuracy & Precision#

분석 결과에 요구되는 정확성과 정밀도를 고려합니다.

빠른 암기#

D
D
S
A
A

즉:

Data Size
Data Complexity
Speed
Analytic Complexity
Accuracy

순서입니다.


35장 Waterfall·Prototype·Spiral의 차이#

첨부 자료에서는 분석 프로젝트 방식과 접근법도 비교합니다.

Waterfall#

폭포수 방식입니다.

단계를 순서대로 완료한 후 다음 단계로 넘어가는 방식입니다.

특징:

하향식

요구사항이 명확한 경우

이전 단계로 돌아가기 어려움

Prototype#

초기에 시제품을 빠르게 만든 후 Feedback을 받아 개선합니다.

특징:

상향식

요구사항이 불명확한 경우

빠른 검증

Spiral#

나선형 방식은 반복적으로 시스템을 발전시키면서 위험을 분석합니다.

첨부 자료에서는 특히:

대규모

고위험 Project

반복·점증적 개발

Risk 분석

과 연결합니다.


36장 ADsP 2과목 핵심 비교표#

개념 핵심
Optimization What O / How O
Insight What O / How X
Solution What X / How O
Discovery What X / How X
KDD Selection부터 시작하는 5단계
SEMMA Sample부터 시작하는 5단계
CRISP-DM Business Understanding부터 시작하는 6단계
하향식 문제부터 출발
상향식 데이터부터 출발
Problem Solving 하향식
Problem Creation 상향식
ROI 비용 Volume·Variety·Velocity
ROI 효과 Value
준비도 분인기데문IT
성숙도 도입→활용→확산→최적화
Governance 전사 데이터 관리체계
Master Data 업무의 기준 데이터
Metadata 데이터를 설명하는 데이터
Data Dictionary 데이터 항목 정의
Data Catalog 데이터 자산 검색
Ontology 개념과 관계 표현
집중 구조 중앙 분석조직
기능 구조 현업 자체 분석
분산 구조 분석가를 현업에 배치

37장 ADsP 2과목 시험에서 자주 헷갈리는 부분#

KDD의 Selection과 Transformation#

Selection
→ 데이터셋 선택

Transformation
→ 변수 선택·변환

SEMMA 시작 단계#

SEMMA
→ Sample부터 시작

Business Understanding은 CRISP-DM과 연결합니다.

CRISP-DM 적용성 평가#

모델 적용성 평가
→ Evaluation

입니다.

하향식과 상향식#

하향식
→ 문제부터

상향식
→ 데이터부터

위험 대응#

회피
전이
완화
수용

ROI#

Volume
Variety
Velocity
→ 투자 비용

Value
→ 비즈니스 효과

준비도#

분석 업무
인력 및 조직
기법
데이터
문화
IT 인프라

성숙도#

도입
활용
확산
최적화

Metadata#

Business Metadata
Technical Metadata
Operational Metadata

분석 조직#

집중
기능
분산

38장 ADsP 2과목 5분 최종 암기#

시험 직전이라면 아래 부분부터 확인합니다.

4사분면

O/O
Optimization

O/X
Insight

X/O
Solution

X/X
Discovery
KDD

Selection
Preprocessing
Transformation
Data Mining
Interpretation/Evaluation
SEMMA

Sample
Explore
Modify
Model
Assess
CRISP-DM

업무 이해
데이터 이해
데이터 준비
모델링
평가
전개
빅데이터 분석 방법론

Planning
Preparing
Analyzing
Deploying
Managing
위험 대응

회피
전이
완화
수용
하향식

문제 탐색
문제 정의
해결방안 탐색
타당성 검토
상향식

데이터 탐색
Pattern 발견
Insight
새로운 문제 발견
디자인 사고

공감
정의
아이디어화
시제품
검증
분석 준비도

분
인
기
데
문
IT
분석 성숙도

도입
활용
확산
최적화
데이터 거버넌스

조직
프로세스
시스템
데이터
인력 자원
Metadata

업무
기술
운영
분석 조직

집중
기능
분산

ADsP 2과목 데이터 분석 기획 FAQ#

ADsP 2과목 데이터 분석 기획에서는 무엇을 공부하는가#

분석 문제를 어떻게 발굴하고 분석 프로젝트를 어떤 절차로 수행할 것인지 공부합니다. 분석 기획 4사분면, KDD·SEMMA·CRISP-DM, 빅데이터 분석 방법론, 하향식·상향식 접근법, 분석 마스터플랜, 분석 준비도와 성숙도, 데이터 거버넌스와 분석 조직 등이 핵심입니다.

CRISP-DM 6단계 순서는 무엇인가#

다음 순서입니다.

업무 이해
→ 데이터 이해
→ 데이터 준비
→ 모델링
→ 평가
→ 전개

CRISP-DM은 반드시 한 방향으로만 진행하는 것이 아니라 필요하면 이전 단계로 돌아가는 반복 구조를 가질 수 있습니다.

KDD 5단계 순서는 무엇인가#

Selection
→ Preprocessing
→ Transformation
→ Data Mining
→ Interpretation/Evaluation

입니다.

Selection에서는 데이터셋을 선택하고 Transformation에서 변수 선택과 데이터 변환 등을 수행한다는 차이를 기억하는 것이 중요합니다.

SEMMA 5단계 순서는 무엇인가#

SEMMA라는 이름 자체를 이용하면 쉽습니다.

Sample
Explore
Modify
Model
Assess

입니다.

KDD와 SEMMA와 CRISP-DM은 무엇이 다른가#

KDD는 데이터에서 지식을 발견하는 과정에 초점을 두고, SEMMA는 SAS Institute에서 제안한 데이터 마이닝 중심의 방법론이며, CRISP-DM은 비즈니스 이해부터 실제 전개까지 포함하는 분석 프로젝트 방법론입니다.

시험에서는 무엇보다 단계 수와 시작 단계를 구분하는 것이 중요합니다.

KDD
5단계
Selection 시작

SEMMA
5단계
Sample 시작

CRISP-DM
6단계
Business Understanding 시작

하향식 접근법과 상향식 접근법은 무엇이 다른가#

하향식은 문제를 먼저 정의한 후 해결방법을 찾는 방식이고 상향식은 데이터를 먼저 탐색하면서 새로운 문제나 패턴을 발견하는 방식입니다.

Top-down
문제 → 분석 → 해결

Bottom-up
데이터 → Pattern → Insight

분석 준비도 6요소는 무엇인가#

다음 여섯 가지입니다.

분석 업무
분석 인력 및 조직
분석 기법
분석 데이터
분석 문화
IT 인프라

분인기데문IT로 암기할 수 있습니다.

분석 성숙도 단계는 무엇인가#

첨부 학습자료에서는 다음 네 단계로 정리합니다.

도입
→ 활용
→ 확산
→ 최적화

데이터 거버넌스란 무엇인가#

기업 전체의 데이터를 일정한 정책과 표준에 따라 관리하기 위한 체계입니다.

데이터 품질, 표준화, 책임, 조직, 관리절차, 시스템과 인력 등을 함께 다룹니다.

마스터 데이터와 메타데이터는 무엇이 다른가#

Master Data는 고객·상품·공급업체처럼 기업 업무에서 기준이 되는 핵심 데이터입니다.

Metadata는 Table·Column·업무 의미·Data Type·변경시간처럼 다른 데이터를 설명하는 데이터입니다.

데이터 사전과 데이터 카탈로그의 차이는 무엇인가#

Data Dictionary는 개별 데이터 항목의 의미와 규칙을 정의하는 데 초점을 둡니다.

Data Catalog는 조직에 존재하는 데이터 자산을 검색하고 찾는 데 초점을 둡니다.

분석 조직에는 어떤 구조가 있는가#

첨부 자료에서는 다음 세 가지를 제시합니다.

집중 구조
기능 구조
분산 구조

집중 구조는 중앙 분석조직을 두고, 기능 구조는 현업 부서가 직접 분석하며, 분산 구조는 분석 전문가를 각 현업 조직에 배치합니다.


자기 점검#

다음 질문에 바로 답할 수 있다면 ADsP 2과목의 핵심 구조를 상당 부분 이해한 것입니다.

  1. Optimization·Insight·Solution·Discovery의 What과 How 조합을 구분할 수 있는가?
  2. KDD 5단계를 순서대로 말할 수 있는가?
  3. KDD에서 Selection과 Transformation의 차이를 설명할 수 있는가?
  4. SEMMA 5단계를 순서대로 말할 수 있는가?
  5. CRISP-DM 6단계를 순서대로 말할 수 있는가?
  6. CRISP-DM이 단방향 프로세스가 아닌 이유를 설명할 수 있는가?
  7. 빅데이터 분석 방법론의 Phase·Task·Step 구조를 기억하는가?
  8. 회피·전이·완화·수용을 구분할 수 있는가?
  9. 하향식 접근의 4단계를 말할 수 있는가?
  10. 하향식과 상향식 접근의 차이를 설명할 수 있는가?
  11. 디자인 사고 5단계를 말할 수 있는가?
  12. 분석 마스터플랜에서 시급성과 난이도의 의미를 구분할 수 있는가?
  13. 분석 준비도 6요소를 말할 수 있는가?
  14. 분석 성숙도 4단계를 순서대로 말할 수 있는가?
  15. 데이터 거버넌스의 의미를 설명할 수 있는가?
  16. 업무·기술·운영 Metadata를 구분할 수 있는가?
  17. Data Dictionary·Data Catalog·Ontology의 차이를 설명할 수 있는가?
  18. 집중·기능·분산 분석조직의 특징을 구분할 수 있는가?
  19. 고정관념·편향·Framing Effect의 차이를 설명할 수 있는가?
  20. Waterfall·Prototype·Spiral 방식을 구분할 수 있는가?

이 글을 마치며#

ADsP 2과목 데이터 분석 기획은 암기할 용어가 많아 처음에는 서로 비슷하게 느껴질 수 있습니다.

하지만 개별 용어를 따로 외우기보다 분석 프로젝트가 만들어지는 전체 흐름으로 이해하면 훨씬 정리가 쉽습니다.

문제를 찾는다
↓
분석 방법을 정한다
↓
적합한 방법론으로 분석한다
↓
과제의 우선순위를 정한다
↓
조직과 데이터를 준비한다
↓
데이터 관리체계를 만든다
↓
분석 결과를 업무에 적용한다

방법론은 다음 세 개를 반드시 비교합니다.

KDD
→ 데이터 지식 발견

SEMMA
→ Sample부터 시작하는 데이터 마이닝 과정

CRISP-DM
→ 비즈니스 이해부터 실제 전개까지

문제 접근 방식은:

하향식
→ 문제를 먼저 알고 해결

상향식
→ 데이터에서 문제와 기회를 발견

으로 구분합니다.

기업 차원으로 올라가면:

분석 마스터플랜
→ 무엇부터 분석할 것인가

분석 준비도·성숙도
→ 우리 조직이 분석할 준비가 되었는가

데이터 거버넌스
→ 데이터를 어떻게 지속적으로 관리할 것인가

라는 질문으로 연결됩니다.

결국 ADsP 2과목의 핵심은 단순히 CRISP-DM이나 KDD 순서를 외우는 것이 아니라 기업이 분석 문제를 찾고, 프로젝트를 기획하고, 데이터를 관리하며, 분석을 실제 업무로 연결하는 전체 구조를 이해하는 것입니다.

시험 직전에는 4사분면 → KDD → SEMMA → CRISP-DM → 하향식·상향식 → 준비도·성숙도 → 데이터 거버넌스 순으로 다시 확인하면 2과목의 큰 흐름을 빠르게 복습할 수 있습니다.

이 페이지의 목차