CRISP-DM이란? 데이터 분석 6단계와 업무이해·데이터준비·모델링·평가·전개 쉽게 이해하기
1장 CRISP-DM이란 무엇인가#
CRISP-DM은 Cross Industry Standard Process for Data Mining의 약자입니다.
이름 그대로 특정 산업에만 한정하지 않고 다양한 산업의 데이터 분석과 데이터 마이닝 프로젝트에 적용할 수 있도록 만든 표준 프로세스입니다.
처음 접하면 이름이 길고 복잡해 보이지만, 실제 구조는 매우 직관적입니다.
데이터 분석 프로젝트를 시작한다고 생각해봅시다.
처음부터 모델을 만드는 것이 아니라 먼저 다음 질문부터 확인해야 합니다.
- 우리가 해결하려는 업무 문제는 무엇인가?
- 어떤 데이터가 있는가?
- 그 데이터는 분석할 수 있는 상태인가?
- 어떤 모델을 사용할 것인가?
- 만든 결과가 실제로 쓸 만한가?
- 최종적으로 어떻게 현업에 적용할 것인가?
CRISP-DM은 이 흐름을 6단계로 정리합니다.
- Business Understanding
- Data Understanding
- Data Preparation
- Modeling
- Evaluation
- Deployment
한글로는 다음과 같습니다.
업무 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개
ADsP에서는 이 순서와 각 단계의 역할을 정확하게 구분하는 것이 중요합니다.
2장 CRISP-DM 6단계 한눈에 보기#
| 단계 | 영어 | 핵심 작업 |
|---|---|---|
| 1 | Business Understanding | 업무 목적과 분석 목표 설정 |
| 2 | Data Understanding | 데이터 수집·탐색·품질 확인 |
| 3 | Data Preparation | 분석용 데이터 선택·정제·통합 |
| 4 | Modeling | 모델링 기법 선택·모델 구축 |
| 5 | Evaluation | 분석 결과와 적용 가능성 평가 |
| 6 | Deployment | 실제 적용·모니터링·유지보수 계획 |
시험 직전에는 다음 한 줄로 기억하면 좋습니다.
업무 → 데이터 → 준비 → 모델 → 평가 → 전개
3장 Business Understanding 업무 이해란 무엇인가#
CRISP-DM의 첫 번째 단계는 Business Understanding입니다.
한글로는 업무 이해입니다.
이 단계에서는 가장 먼저:
우리가 왜 이 분석을 하는가?
를 확인합니다.
데이터 분석은 기술적으로 흥미로운 모델을 만드는 것이 목적이 아닙니다.
기업이나 조직이 실제로 해결하려는 문제와 연결되어야 합니다.
예를 들어 온라인 쇼핑몰에서:
최근 재구매율이 떨어지고 있다.
는 문제가 발생했다고 하겠습니다.
이 경우 먼저 확인해야 할 것은:
- 재구매율 감소 원인은 무엇인가?
- 분석으로 무엇을 알고 싶은가?
- 최종적으로 어떤 업무 의사결정을 지원할 것인가?
입니다.
주요 작업#
제공된 ADsP 학습자료에서는 다음 작업을 포함합니다.
- 업무 목적 파악
- 상황 파악
- 데이터 마이닝 목표 설정
핵심#
Business Understanding = 업무 문제와 분석 목표를 정의
입니다.
4장 왜 CRISP-DM은 업무 이해부터 시작할까#
데이터가 있다고 해서 무조건 분석을 시작하는 것은 좋은 접근이 아닙니다.
예를 들어 회사에 고객 데이터 1억 건이 있다고 하겠습니다.
그런데 분석 목적이 없다면:
- 어떤 데이터를 써야 하는지
- 어떤 변수를 중요하게 봐야 하는지
- 어떤 모델을 만들어야 하는지
- 어떤 결과가 좋은 결과인지
판단하기 어렵습니다.
그래서 CRISP-DM에서는 먼저 비즈니스 문제를 이해합니다.
즉:
문제 정의가 먼저이고 분석은 그다음
입니다.
이 점이 SEMMA와 비교할 때도 중요한 차이입니다.
SEMMA는 Sample부터 시작하지만 CRISP-DM은 Business Understanding부터 시작합니다.
5장 Data Understanding 데이터 이해란 무엇인가#
두 번째 단계는 Data Understanding입니다.
한글로는 데이터 이해입니다.
Business Understanding에서 분석 목적을 정했다면 이제 다음 질문을 합니다.
우리에게 어떤 데이터가 있는가?
이 단계에서는 초기 데이터를 수집하고 데이터를 실제로 살펴봅니다.
주요 작업#
- 초기 데이터 수집
- 데이터 기술 분석
- 데이터 탐색
- 데이터 품질 확인
입니다.
즉 단순히 데이터를 가져오는 것에 그치지 않고 데이터가 어떤 특징을 가지고 있는지 이해하는 단계입니다.
6장 Data Understanding에서 데이터 품질을 왜 확인할까#
데이터 분석 결과는 입력 데이터의 품질에 큰 영향을 받습니다.
예를 들어 고객 나이에 다음 값이 있다고 하겠습니다.
| 고객 | 나이 |
|---|---|
| A | 25 |
| B | 31 |
| C | NULL |
| D | 999 |
여기에는:
- 결측치
- 이상값 가능성
이 존재합니다.
이런 문제를 모르고 모델링을 시작하면 분석 결과가 왜곡될 수 있습니다.
그래서 Data Understanding 단계에서는 먼저:
- 어떤 값이 존재하는가
- 데이터 분포는 어떤가
- 결측치는 있는가
- 이상한 값은 있는가
를 확인합니다.
핵심#
Data Understanding = 데이터가 어떤 상태인지 파악
입니다.
7장 업무 이해와 데이터 이해의 차이#
둘은 CRISP-DM의 시작 단계이기 때문에 헷갈릴 수 있습니다.
Business Understanding#
질문은:
무엇을 해결할 것인가?
입니다.
Data Understanding#
질문은:
어떤 데이터가 있는가?
입니다.
따라서:
업무 이해 = 문제
데이터 이해 = 데이터
로 구분하면 쉽습니다.
8장 Data Preparation 데이터 준비란 무엇인가#
세 번째 단계는 Data Preparation입니다.
한글로는 데이터 준비입니다.
데이터 이해 단계에서 데이터 상태를 확인했다면 이제 실제 분석에 사용할 수 있도록 데이터를 정리합니다.
주요 작업#
제공된 학습자료에서는 다음을 포함합니다.
- 분석용 데이터셋 선택
- 데이터 정제
- 데이터 통합
- 포맷팅
즉 원본 데이터를 그대로 모델에 넣는 것이 아니라 분석 가능한 형태로 만드는 단계입니다.
9장 데이터 준비에서는 어떤 작업을 할까#
예를 들어 고객 이탈 모델을 만든다고 생각해봅시다.
원본 데이터에는 다음과 같은 문제가 있을 수 있습니다.
- 중복 고객
- 결측값
- 서로 다른 날짜 형식
- 여러 시스템에 분산된 데이터
이 경우 Data Preparation 단계에서:
- 필요한 데이터만 선택
- 잘못된 데이터 정리
- 여러 데이터 통합
- 형식 통일
을 수행합니다.
예:
2026/09/28
2026-09-28
20260928
처럼 날짜 형식이 제각각이라면 하나의 형식으로 통일할 수 있습니다.
핵심#
Data Preparation = 모델링에 사용할 데이터를 실제로 준비
입니다.
10장 Data Understanding과 Data Preparation 차이#
둘은 시험에서 자주 헷갈릴 수 있습니다.
Data Understanding#
데이터를 살펴본다.
- 수집
- 탐색
- 기술
- 품질 확인
Data Preparation#
데이터를 손질한다.
- 선택
- 정제
- 통합
- 포맷팅
쉽게 표현하면:
Data Understanding = 상태 파악
Data Preparation = 실제 정리
입니다.
11장 Modeling 모델링이란 무엇인가#
네 번째 단계는 Modeling입니다.
이 단계에서는 준비된 데이터를 이용해 실제 분석 모델을 만듭니다.
주요 작업#
제공된 ADsP 학습자료에서는:
- 모델링 기법 선택
- 테스트 계획 설계
- 모델 작성
을 포함합니다.
예를 들어 고객 이탈 예측 문제라면:
- 어떤 분석기법을 사용할 것인지 결정하고
- 모델을 어떻게 검증할지 계획하고
- 실제 모델을 구축
합니다.
핵심#
Modeling = 분석 모델을 설계하고 구축
입니다.
12장 모델링 기법 선택은 왜 중요할까#
문제에 따라 적절한 모델이 다를 수 있습니다.
예를 들어:
- 고객 이탈 예측
- 매출 예측
- 고객 그룹화
- 이상거래 탐지
는 서로 다른 문제입니다.
따라서 분석 목적에 맞는 방법을 선택해야 합니다.
중요한 것은 무조건 복잡한 모델을 사용하는 것이 아니라 문제에 맞는 모델을 선택하는 것입니다.
CRISP-DM에서는 이런 작업을 Modeling 단계에서 수행합니다.
13장 테스트 계획도 Modeling 단계인가#
제공된 학습자료에서는 테스트 계획 설계를 Modeling 단계의 주요 작업으로 정리합니다.
즉 모델을 만들기 전에:
- 어떤 기준으로 모델을 평가할 것인가
- 어떤 데이터를 이용해 테스트할 것인가
- 어떤 성능 기준을 사용할 것인가
등을 계획할 수 있습니다.
시험 핵심#
모델링 기법 선택 + 테스트 계획 + 모델 작성
→ Modeling
으로 연결합니다.
14장 Evaluation 평가란 무엇인가#
다섯 번째 단계는 Evaluation입니다.
모델을 만들었다고 해서 바로 현업에 적용하면 안 됩니다.
이 단계에서는:
- 분석 결과가 제대로 나왔는지
- 업무 목적에 부합하는지
- 실제 현업에 적용할 수 있는지
를 평가합니다.
제공된 학습자료에서는 특히 다음 두 가지를 강조합니다.
- 분석 결과 평가
- 모델 적용성 평가
핵심#
Evaluation = 결과와 실제 적용 가능성을 평가
입니다.
15장 모델 적용성 평가는 어느 단계인가#
ADsP에서 매우 중요한 함정입니다.
다음 문장은 틀립니다.
모델 적용성 평가는 Modeling 단계에서 수행한다.
모델 적용성 평가는:
Evaluation 단계
입니다.
Modeling에서는 모델을 만들고, Evaluation에서는 그 모델이 실제로 적용할 수 있는지 판단합니다.
따라서:
Modeling = 만든다
Evaluation = 쓸 수 있는지 평가한다
라고 구분하면 쉽습니다.
16장 모델링과 평가를 구분하는 방법#
Modeling#
질문:
어떤 모델을 만들 것인가?
Evaluation#
질문:
만든 모델이 실제로 좋은가?
따라서:
Modeling → 구축
Evaluation → 검증
으로 기억합니다.
특히 시험에서는:
모델 적용성 평가 = Evaluation
을 반드시 기억해야 합니다.
17장 Deployment 전개란 무엇인가#
마지막 단계는 Deployment입니다.
한글로는 전개라고 합니다.
분석 결과가 좋은 것으로 평가되었다면 이제 실제 업무에 사용할 계획을 세워야 합니다.
주요 작업#
제공된 학습자료에서는:
- 전개 계획 수립
- 모니터링 계획
- 유지보수 계획
을 포함합니다.
즉 분석 결과를 실제 현업에 적용하는 단계입니다.
18장 Deployment를 가장 쉽게 이해하면#
고객 이탈 모델을 만들었다고 생각해봅시다.
모델 정확도가 좋고 비즈니스 적용 가능성도 확인했습니다.
하지만 실제 서비스에서 사용하려면 다음을 결정해야 합니다.
- 언제 모델을 실행할 것인가?
- 결과를 어느 시스템에 전달할 것인가?
- 담당자는 결과를 어떻게 사용할 것인가?
- 모델 성능은 어떻게 모니터링할 것인가?
- 성능이 떨어지면 어떻게 수정할 것인가?
이러한 실제 적용 계획이 Deployment입니다.
핵심#
Deployment = 분석 결과를 실제 업무에 사용
입니다.
19장 전개가 끝나면 모든 분석이 끝나는가#
CRISP-DM의 중요한 특징은 단계가 완전히 일방향으로 끝나는 구조가 아니라는 점입니다.
실제 적용 이후에도:
- 데이터가 변하거나
- 모델 성능이 떨어지거나
- 비즈니스 상황이 바뀌면
다시 앞 단계로 돌아갈 수 있습니다.
즉:
업무 이해
→ 데이터 이해
→ 데이터 준비
→ 모델링
→ 평가
→ 전개
로 진행하지만 필요하다면 이전 단계로 다시 돌아갑니다.
20장 CRISP-DM은 단방향 프로세스가 아니다#
ADsP에서 자주 출제되는 핵심입니다.
다음 설명은 틀립니다.
CRISP-DM은 각 단계를 한 번씩 순서대로 실행하고 이전 단계로 돌아갈 수 없다.
CRISP-DM은 필요에 따라 반복 Iteration과 피드백이 가능한 구조입니다.
예를 들어 모델링 단계에서 성능이 좋지 않다고 하겠습니다.
이때:
Modeling
→ Data Preparation
으로 돌아가 변수나 데이터를 다시 정리할 수 있습니다.
또 평가 단계에서 비즈니스 목표와 맞지 않는다고 판단되면:
Evaluation
→ Business Understanding
으로 돌아가 분석 목적을 다시 검토할 수도 있습니다.
핵심#
CRISP-DM = 반복·순환 가능
입니다.
21장 단계 간 피드백 구조란 무엇인가#
CRISP-DM은 각 단계가 서로 완전히 독립되어 있지 않습니다.
예를 들어:
데이터 이해 후#
필요한 데이터가 부족하다는 것을 발견할 수 있습니다.
그러면 업무 목표를 다시 검토할 수 있습니다.
데이터 준비 후#
새로운 데이터 문제가 발견될 수 있습니다.
다시 Data Understanding으로 돌아갈 수 있습니다.
모델링 후#
성능이 좋지 않을 수 있습니다.
다시 Data Preparation으로 돌아가 변수를 수정할 수 있습니다.
평가 후#
비즈니스 목표와 맞지 않을 수 있습니다.
앞 단계로 돌아갈 수 있습니다.
이런 구조를 피드백과 반복이 가능한 순환 구조라고 이해하면 됩니다.
22장 CRISP-DM을 요리에 비유하면 쉽게 이해할 수 있다#
CRISP-DM의 6단계는 요리 순서에 비유하면 매우 쉽습니다.
1. Business Understanding#
무슨 요리를 만들까?
목표를 정합니다.
2. Data Understanding#
어떤 재료가 있지?
재료 상태를 확인합니다.
3. Data Preparation#
재료를 손질한다.
씻고 자르고 준비합니다.
4. Modeling#
요리한다.
실제 조리를 수행합니다.
5. Evaluation#
맛을 본다.
잘 만들어졌는지 확인합니다.
6. Deployment#
손님에게 서빙한다.
실제로 사용합니다.
이 비유를 기억하면 6단계 순서를 훨씬 쉽게 복원할 수 있습니다.
23장 쇼핑몰 고객 이탈 분석으로 CRISP-DM 이해하기#
온라인 쇼핑몰에서 고객 이탈률이 높아졌다고 가정해봅시다.
1단계 Business Understanding#
문제를 정의합니다.
최근 고객 이탈률이 높아졌다.
목표:
이탈 가능성이 높은 고객을 사전에 파악한다.
2단계 Data Understanding#
사용 가능한 데이터를 확인합니다.
- 회원 정보
- 구매 이력
- 접속 기록
- 고객센터 문의
데이터 품질도 확인합니다.
3단계 Data Preparation#
분석할 데이터를 정리합니다.
- 결측치 처리
- 데이터 통합
- 필요한 데이터 선택
- 형식 통일
4단계 Modeling#
고객 이탈 예측 모델을 구축합니다.
5단계 Evaluation#
모델 성능을 확인합니다.
그리고 실제 고객 관리 업무에 사용할 수 있는지 평가합니다.
6단계 Deployment#
모델을 실제 CRM이나 마케팅 시스템과 연결합니다.
이후 성능을 지속적으로 모니터링합니다.
24장 CRISP-DM의 핵심은 모델링만이 아니다#
CRISP-DM을 처음 배우면 Modeling이 가장 중요한 단계처럼 느껴질 수 있습니다.
하지만 전체 6단계 가운데 모델링은 한 단계에 불과합니다.
실제로는:
- 문제 정의
- 데이터 이해
- 데이터 준비
- 결과 평가
- 현업 적용
까지 모두 중요합니다.
즉 CRISP-DM은 단순한 모델 생성 방법론이라기보다 데이터 분석 프로젝트 전체를 관리하는 프로세스에 가깝습니다.
25장 CRISP-DM과 SEMMA의 가장 큰 차이#
두 방법론은 출발점에서 큰 차이가 있습니다.
CRISP-DM#
시작:
Business Understanding
즉 비즈니스 문제를 먼저 이해합니다.
SEMMA#
시작:
Sample
즉 데이터를 표본 추출하는 단계에서 시작합니다.
따라서 시험에서 다음 문장이 나오면 주의합니다.
SEMMA는 Business Understanding 단계로 시작한다.
틀립니다.
Business Understanding은 CRISP-DM의 첫 단계입니다.
26장 CRISP-DM과 KDD의 차이#
제공된 학습자료에서는 세 방법론의 성격을 다음과 같이 구분합니다.
KDD#
- 5단계
- 학술적 접근
- 데이터베이스 기반
- 데이터 마이닝 프로세스 중심
CRISP-DM#
- 6단계
- 산업 컨소시엄
- 산업 표준
- 비즈니스 문제 해결 중심
- 반복·순환 가능
따라서:
KDD → 지식 발견
CRISP-DM → 비즈니스 문제 해결
로 기억하면 쉽습니다.
27장 KDD·CRISP-DM·SEMMA 3대 방법론 비교#
| 방법론 | 개발 주체 | 단계 수 | 핵심 특징 |
|---|---|---|---|
| KDD | 학계 Fayyad | 5단계 | 학술적·데이터 마이닝 프로세스 중심 |
| CRISP-DM | 산업 컨소시엄 | 6단계 | 산업 표준·비즈니스 문제 해결·반복 가능 |
| SEMMA | SAS Institute | 5단계 | SAS 기반·탐색·모델링 중심 |
단계 수만 비교하면:
5 → 6 → 5
입니다.
즉:
KDD 5
CRISP-DM 6
SEMMA 5
입니다.
28장 CRISP-DM 6단계와 KDD 5단계 비교#
CRISP-DM#
- Business Understanding
- Data Understanding
- Data Preparation
- Modeling
- Evaluation
- Deployment
KDD#
- Selection
- Preprocessing
- Transformation
- Data Mining
- Interpretation / Evaluation
CRISP-DM에는 업무 이해와 전개 단계가 명확하게 포함되어 있다는 점이 특징입니다.
반면 KDD는 데이터에서 지식을 발견하는 데이터 마이닝 과정에 더 초점을 맞춥니다.
29장 CRISP-DM 6단계와 SEMMA 5단계 비교#
CRISP-DM#
업무 이해
→ 데이터 이해
→ 데이터 준비
→ 모델링
→ 평가
→ 전개
SEMMA#
Sample
→ Explore
→ Modify
→ Model
→ Assess
SEMMA는 데이터 탐색과 모델링 중심이고, CRISP-DM은 비즈니스 문제부터 실제 전개까지 포함하는 더 넓은 분석 프로젝트 흐름으로 제공된 학습자료에서 구분합니다.
30장 단계 이름을 보고 바로 역할 찾기#
시험에서는 영어 단계명을 그대로 제시할 수 있습니다.
Business Understanding#
→ 업무 목적과 분석 목표 설정
Data Understanding#
→ 초기 데이터 수집·탐색·품질 확인
Data Preparation#
→ 데이터 선택·정제·통합·포맷팅
Modeling#
→ 모델링 기법 선택·모델 구축
Evaluation#
→ 분석 결과와 모델 적용성 평가
Deployment#
→ 전개·모니터링·유지보수 계획
이 연결을 바로 떠올릴 수 있어야 합니다.
31장 가장 많이 헷갈리는 Data Understanding과 Data Preparation#
두 단계는 이름도 비슷하고 데이터 관련 작업을 모두 수행하기 때문에 헷갈릴 수 있습니다.
Data Understanding#
본다
- 수집
- 기술
- 탐색
- 품질 확인
Data Preparation#
고친다
- 선택
- 정제
- 통합
- Formatting
쉽게 말하면:
Understanding = 이해
Preparation = 준비
입니다.
32장 가장 많이 헷갈리는 Modeling과 Evaluation#
Modeling#
모델을 만든다
Evaluation#
모델이 좋은지 평가한다
특히 다음 표현은 Evaluation입니다.
모델 적용성 평가
이것을 Modeling으로 선택하지 않도록 주의해야 합니다.
33장 Evaluation과 Deployment는 어떻게 다른가#
Evaluation#
질문:
실제로 사용할 만한가?
Deployment#
질문:
그렇다면 실제로 어떻게 사용할 것인가?
입니다.
따라서:
Evaluation → 사용 가능성 판단
Deployment → 실제 사용
으로 구분합니다.
34장 CRISP-DM은 왜 산업 표준이라고 하는가#
제공된 ADsP 학습자료에서는 CRISP-DM을 산업 전반에 걸쳐 범용적으로 적용할 수 있는 표준 프로세스로 설명합니다.
즉 특정 기업이나 특정 분석도구 하나에만 종속된 프로세스가 아니라 여러 산업의 분석 프로젝트에 적용할 수 있다는 점이 특징입니다.
이를 시험에서는:
CRISP-DM = 산업 표준
으로 연결해 기억합니다.
35장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. CRISP-DM은 5단계다#
틀립니다.
CRISP-DM은 6단계입니다.
함정 2. CRISP-DM은 데이터 이해부터 시작한다#
틀립니다.
첫 단계는:
Business Understanding
입니다.
함정 3. 모델 적용성 평가는 Modeling 단계다#
틀립니다.
정답은:
Evaluation
입니다.
함정 4. Deployment는 모델을 만드는 단계다#
틀립니다.
Deployment는 실제 적용과 전개 계획을 수립하는 단계입니다.
함정 5. CRISP-DM은 단방향이다#
틀립니다.
필요하면 이전 단계로 돌아갈 수 있는 반복·순환 구조입니다.
함정 6. 데이터 품질 확인은 Data Preparation이다#
제공된 학습자료에서는 데이터 품질 확인을 Data Understanding의 주요 작업으로 정리합니다.
함정 7. 데이터 통합은 Data Understanding이다#
제공된 학습자료에서는 데이터 통합을 Data Preparation 단계와 연결합니다.
36장 CRISP-DM 핵심 비교표#
| 단계 | 가장 쉬운 의미 | 핵심 키워드 |
|---|---|---|
| Business Understanding | 무슨 문제를 풀까 | 목표·상황·분석 목적 |
| Data Understanding | 어떤 데이터가 있나 | 수집·탐색·품질 |
| Data Preparation | 데이터를 손질한다 | 선택·정제·통합 |
| Modeling | 모델을 만든다 | 기법 선택·테스트·모델 |
| Evaluation | 결과를 검증한다 | 결과·적용성 평가 |
| Deployment | 실제 사용한다 | 전개·모니터링·유지보수 |
37장 시험 직전 30초 암기#
1. Business Understanding#
→ 업무 이해
→ 목표 설정
2. Data Understanding#
→ 데이터 이해
→ 수집·탐색·품질 확인
3. Data Preparation#
→ 데이터 준비
→ 선택·정제·통합
4. Modeling#
→ 모델링
→ 기법 선택·모델 작성
5. Evaluation#
→ 평가
→ 결과 평가·모델 적용성 평가
6. Deployment#
→ 전개
→ 실제 적용·모니터링·유지보수
한 줄 암기:
업무 → 데이터 → 준비 → 모델 → 평가 → 전개
38장 요리 비유로 시험 직전 복습#
업무 이해
→ 무슨 요리를 만들까?
데이터 이해
→ 어떤 재료가 있지?
데이터 준비
→ 재료 손질
모델링
→ 요리하기
평가
→ 맛보기
전개
→ 손님에게 서빙
이 비유만 기억해도 단계 순서를 복원하기 쉽습니다.
CRISP-DM FAQ#
CRISP-DM이란 무엇인가#
Cross Industry Standard Process for Data Mining의 약자로 다양한 산업의 데이터 분석과 데이터 마이닝 프로젝트에 적용할 수 있는 표준 프로세스입니다.
CRISP-DM은 몇 단계인가#
총 6단계입니다.
- Business Understanding
- Data Understanding
- Data Preparation
- Modeling
- Evaluation
- Deployment
CRISP-DM의 첫 단계는 무엇인가#
Business Understanding, 즉 업무 이해입니다.
Business Understanding에서는 무엇을 하는가#
업무 목적과 상황을 파악하고 데이터 마이닝 목표를 설정합니다.
Data Understanding에서는 무엇을 하는가#
초기 데이터를 수집하고 데이터 기술·탐색·품질 확인을 수행합니다.
Data Preparation에서는 무엇을 하는가#
분석용 데이터셋을 선택하고 데이터를 정제·통합·포맷팅합니다.
Modeling에서는 무엇을 하는가#
모델링 기법을 선택하고 테스트 계획을 설계하며 실제 모델을 구축합니다.
Evaluation에서는 무엇을 하는가#
분석 결과를 평가하고 모델이 실제 업무에 적용 가능한지 평가합니다.
모델 적용성 평가는 어느 단계인가#
Evaluation 단계입니다.
Modeling 단계가 아닙니다.
Deployment에서는 무엇을 하는가#
전개 계획을 수립하고 모니터링 및 유지보수 계획을 마련합니다.
CRISP-DM은 단방향인가#
아닙니다.
필요에 따라 이전 단계로 돌아가 반복할 수 있는 피드백 구조를 가집니다.
CRISP-DM과 SEMMA의 가장 큰 차이는 무엇인가#
CRISP-DM은 Business Understanding부터 시작하여 비즈니스 문제 해결과 실제 전개까지 포함합니다. SEMMA는 Sample부터 시작하며 데이터 탐색과 모델링에 초점을 둡니다.
CRISP-DM과 KDD의 차이는 무엇인가#
제공된 학습자료에서는 KDD를 학술적 데이터 마이닝 프로세스 중심으로, CRISP-DM을 산업 표준의 비즈니스 문제 해결 중심 프로세스로 구분합니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- CRISP-DM의 전체 영어 명칭을 말할 수 있는가?
- CRISP-DM이 몇 단계인지 알고 있는가?
- 6단계를 순서대로 말할 수 있는가?
- Business Understanding에서 무엇을 하는지 설명할 수 있는가?
- Data Understanding과 Data Preparation의 차이를 설명할 수 있는가?
- 데이터 품질 확인이 어느 단계인지 알고 있는가?
- 데이터 정제·통합이 어느 단계인지 알고 있는가?
- 테스트 계획 설계가 어느 단계인지 알고 있는가?
- 모델 적용성 평가가 Evaluation이라는 것을 알고 있는가?
- Deployment의 주요 작업을 설명할 수 있는가?
- CRISP-DM이 단방향이 아니라는 것을 알고 있는가?
- 단계 사이에 피드백과 반복이 가능하다는 것을 설명할 수 있는가?
- KDD·CRISP-DM·SEMMA의 단계 수를 구분할 수 있는가?
- CRISP-DM이 Business Understanding부터 시작한다는 것을 기억하고 있는가?
이 글을 마치며#
CRISP-DM의 핵심은 단순히 모델을 만드는 것이 아닙니다.
먼저:
무슨 문제를 해결해야 하는가
를 이해합니다.
이것이:
Business Understanding
입니다.
그다음:
어떤 데이터가 있는가
를 확인합니다.
Data Understanding
입니다.
분석할 수 있도록 데이터를 손질합니다.
Data Preparation
그 데이터로 모델을 만듭니다.
Modeling
만든 모델이 실제로 좋은지 확인합니다.
Evaluation
마지막으로 실제 업무에 적용합니다.
Deployment
전체 흐름은 다음 한 줄로 정리할 수 있습니다.
문제를 이해하고 → 데이터를 이해하고 → 데이터를 준비하고 → 모델을 만들고 → 평가하고 → 실제로 사용한다.
ADsP 시험에서는 마지막으로 세 가지를 반드시 기억합니다.
CRISP-DM은 6단계다.
첫 단계는 Business Understanding이다.
모델 적용성 평가는 Evaluation 단계다.
그리고 가장 중요한 특징은:
CRISP-DM은 일방향으로 한 번만 진행하는 구조가 아니라 필요하면 이전 단계로 돌아갈 수 있는 반복·순환형 프로세스
라는 점입니다.