CRISP-DM이란? 데이터 분석 6단계와 업무이해·데이터준비·모델링·평가·전개 쉽게 이해하기

1장 CRISP-DM이란 무엇인가#

CRISP-DM은 Cross Industry Standard Process for Data Mining의 약자입니다.

이름 그대로 특정 산업에만 한정하지 않고 다양한 산업의 데이터 분석과 데이터 마이닝 프로젝트에 적용할 수 있도록 만든 표준 프로세스입니다.

처음 접하면 이름이 길고 복잡해 보이지만, 실제 구조는 매우 직관적입니다.

데이터 분석 프로젝트를 시작한다고 생각해봅시다.

처음부터 모델을 만드는 것이 아니라 먼저 다음 질문부터 확인해야 합니다.

  • 우리가 해결하려는 업무 문제는 무엇인가?
  • 어떤 데이터가 있는가?
  • 그 데이터는 분석할 수 있는 상태인가?
  • 어떤 모델을 사용할 것인가?
  • 만든 결과가 실제로 쓸 만한가?
  • 최종적으로 어떻게 현업에 적용할 것인가?

CRISP-DM은 이 흐름을 6단계로 정리합니다.

  1. Business Understanding
  2. Data Understanding
  3. Data Preparation
  4. Modeling
  5. Evaluation
  6. Deployment

한글로는 다음과 같습니다.

업무 이해 → 데이터 이해 → 데이터 준비 → 모델링 → 평가 → 전개

ADsP에서는 이 순서와 각 단계의 역할을 정확하게 구분하는 것이 중요합니다.


2장 CRISP-DM 6단계 한눈에 보기#

단계 영어 핵심 작업
1 Business Understanding 업무 목적과 분석 목표 설정
2 Data Understanding 데이터 수집·탐색·품질 확인
3 Data Preparation 분석용 데이터 선택·정제·통합
4 Modeling 모델링 기법 선택·모델 구축
5 Evaluation 분석 결과와 적용 가능성 평가
6 Deployment 실제 적용·모니터링·유지보수 계획

시험 직전에는 다음 한 줄로 기억하면 좋습니다.

업무 → 데이터 → 준비 → 모델 → 평가 → 전개


3장 Business Understanding 업무 이해란 무엇인가#

CRISP-DM의 첫 번째 단계는 Business Understanding입니다.

한글로는 업무 이해입니다.

이 단계에서는 가장 먼저:

우리가 왜 이 분석을 하는가?

를 확인합니다.

데이터 분석은 기술적으로 흥미로운 모델을 만드는 것이 목적이 아닙니다.

기업이나 조직이 실제로 해결하려는 문제와 연결되어야 합니다.

예를 들어 온라인 쇼핑몰에서:

최근 재구매율이 떨어지고 있다.

는 문제가 발생했다고 하겠습니다.

이 경우 먼저 확인해야 할 것은:

  • 재구매율 감소 원인은 무엇인가?
  • 분석으로 무엇을 알고 싶은가?
  • 최종적으로 어떤 업무 의사결정을 지원할 것인가?

입니다.

주요 작업#

제공된 ADsP 학습자료에서는 다음 작업을 포함합니다.

  • 업무 목적 파악
  • 상황 파악
  • 데이터 마이닝 목표 설정

핵심#

Business Understanding = 업무 문제와 분석 목표를 정의

입니다.


4장 왜 CRISP-DM은 업무 이해부터 시작할까#

데이터가 있다고 해서 무조건 분석을 시작하는 것은 좋은 접근이 아닙니다.

예를 들어 회사에 고객 데이터 1억 건이 있다고 하겠습니다.

그런데 분석 목적이 없다면:

  • 어떤 데이터를 써야 하는지
  • 어떤 변수를 중요하게 봐야 하는지
  • 어떤 모델을 만들어야 하는지
  • 어떤 결과가 좋은 결과인지

판단하기 어렵습니다.

그래서 CRISP-DM에서는 먼저 비즈니스 문제를 이해합니다.

즉:

문제 정의가 먼저이고 분석은 그다음

입니다.

이 점이 SEMMA와 비교할 때도 중요한 차이입니다.

SEMMA는 Sample부터 시작하지만 CRISP-DM은 Business Understanding부터 시작합니다.


5장 Data Understanding 데이터 이해란 무엇인가#

두 번째 단계는 Data Understanding입니다.

한글로는 데이터 이해입니다.

Business Understanding에서 분석 목적을 정했다면 이제 다음 질문을 합니다.

우리에게 어떤 데이터가 있는가?

이 단계에서는 초기 데이터를 수집하고 데이터를 실제로 살펴봅니다.

주요 작업#

  • 초기 데이터 수집
  • 데이터 기술 분석
  • 데이터 탐색
  • 데이터 품질 확인

입니다.

즉 단순히 데이터를 가져오는 것에 그치지 않고 데이터가 어떤 특징을 가지고 있는지 이해하는 단계입니다.


6장 Data Understanding에서 데이터 품질을 왜 확인할까#

데이터 분석 결과는 입력 데이터의 품질에 큰 영향을 받습니다.

예를 들어 고객 나이에 다음 값이 있다고 하겠습니다.

고객 나이
A 25
B 31
C NULL
D 999

여기에는:

  • 결측치
  • 이상값 가능성

이 존재합니다.

이런 문제를 모르고 모델링을 시작하면 분석 결과가 왜곡될 수 있습니다.

그래서 Data Understanding 단계에서는 먼저:

  • 어떤 값이 존재하는가
  • 데이터 분포는 어떤가
  • 결측치는 있는가
  • 이상한 값은 있는가

를 확인합니다.

핵심#

Data Understanding = 데이터가 어떤 상태인지 파악

입니다.


7장 업무 이해와 데이터 이해의 차이#

둘은 CRISP-DM의 시작 단계이기 때문에 헷갈릴 수 있습니다.

Business Understanding#

질문은:

무엇을 해결할 것인가?

입니다.

Data Understanding#

질문은:

어떤 데이터가 있는가?

입니다.

따라서:

업무 이해 = 문제

데이터 이해 = 데이터

로 구분하면 쉽습니다.


8장 Data Preparation 데이터 준비란 무엇인가#

세 번째 단계는 Data Preparation입니다.

한글로는 데이터 준비입니다.

데이터 이해 단계에서 데이터 상태를 확인했다면 이제 실제 분석에 사용할 수 있도록 데이터를 정리합니다.

주요 작업#

제공된 학습자료에서는 다음을 포함합니다.

  • 분석용 데이터셋 선택
  • 데이터 정제
  • 데이터 통합
  • 포맷팅

즉 원본 데이터를 그대로 모델에 넣는 것이 아니라 분석 가능한 형태로 만드는 단계입니다.


9장 데이터 준비에서는 어떤 작업을 할까#

예를 들어 고객 이탈 모델을 만든다고 생각해봅시다.

원본 데이터에는 다음과 같은 문제가 있을 수 있습니다.

  • 중복 고객
  • 결측값
  • 서로 다른 날짜 형식
  • 여러 시스템에 분산된 데이터

이 경우 Data Preparation 단계에서:

  • 필요한 데이터만 선택
  • 잘못된 데이터 정리
  • 여러 데이터 통합
  • 형식 통일

을 수행합니다.

예:

2026/09/28

2026-09-28

20260928

처럼 날짜 형식이 제각각이라면 하나의 형식으로 통일할 수 있습니다.

핵심#

Data Preparation = 모델링에 사용할 데이터를 실제로 준비

입니다.


10장 Data Understanding과 Data Preparation 차이#

둘은 시험에서 자주 헷갈릴 수 있습니다.

Data Understanding#

데이터를 살펴본다.

  • 수집
  • 탐색
  • 기술
  • 품질 확인

Data Preparation#

데이터를 손질한다.

  • 선택
  • 정제
  • 통합
  • 포맷팅

쉽게 표현하면:

Data Understanding = 상태 파악

Data Preparation = 실제 정리

입니다.


11장 Modeling 모델링이란 무엇인가#

네 번째 단계는 Modeling입니다.

이 단계에서는 준비된 데이터를 이용해 실제 분석 모델을 만듭니다.

주요 작업#

제공된 ADsP 학습자료에서는:

  • 모델링 기법 선택
  • 테스트 계획 설계
  • 모델 작성

을 포함합니다.

예를 들어 고객 이탈 예측 문제라면:

  • 어떤 분석기법을 사용할 것인지 결정하고
  • 모델을 어떻게 검증할지 계획하고
  • 실제 모델을 구축

합니다.

핵심#

Modeling = 분석 모델을 설계하고 구축

입니다.


12장 모델링 기법 선택은 왜 중요할까#

문제에 따라 적절한 모델이 다를 수 있습니다.

예를 들어:

  • 고객 이탈 예측
  • 매출 예측
  • 고객 그룹화
  • 이상거래 탐지

는 서로 다른 문제입니다.

따라서 분석 목적에 맞는 방법을 선택해야 합니다.

중요한 것은 무조건 복잡한 모델을 사용하는 것이 아니라 문제에 맞는 모델을 선택하는 것입니다.

CRISP-DM에서는 이런 작업을 Modeling 단계에서 수행합니다.


13장 테스트 계획도 Modeling 단계인가#

제공된 학습자료에서는 테스트 계획 설계를 Modeling 단계의 주요 작업으로 정리합니다.

즉 모델을 만들기 전에:

  • 어떤 기준으로 모델을 평가할 것인가
  • 어떤 데이터를 이용해 테스트할 것인가
  • 어떤 성능 기준을 사용할 것인가

등을 계획할 수 있습니다.

시험 핵심#

모델링 기법 선택 + 테스트 계획 + 모델 작성

→ Modeling

으로 연결합니다.


14장 Evaluation 평가란 무엇인가#

다섯 번째 단계는 Evaluation입니다.

모델을 만들었다고 해서 바로 현업에 적용하면 안 됩니다.

이 단계에서는:

  • 분석 결과가 제대로 나왔는지
  • 업무 목적에 부합하는지
  • 실제 현업에 적용할 수 있는지

를 평가합니다.

제공된 학습자료에서는 특히 다음 두 가지를 강조합니다.

  • 분석 결과 평가
  • 모델 적용성 평가

핵심#

Evaluation = 결과와 실제 적용 가능성을 평가

입니다.


15장 모델 적용성 평가는 어느 단계인가#

ADsP에서 매우 중요한 함정입니다.

다음 문장은 틀립니다.

모델 적용성 평가는 Modeling 단계에서 수행한다.

모델 적용성 평가는:

Evaluation 단계

입니다.

Modeling에서는 모델을 만들고, Evaluation에서는 그 모델이 실제로 적용할 수 있는지 판단합니다.

따라서:

Modeling = 만든다

Evaluation = 쓸 수 있는지 평가한다

라고 구분하면 쉽습니다.


16장 모델링과 평가를 구분하는 방법#

Modeling#

질문:

어떤 모델을 만들 것인가?

Evaluation#

질문:

만든 모델이 실제로 좋은가?

따라서:

Modeling → 구축

Evaluation → 검증

으로 기억합니다.

특히 시험에서는:

모델 적용성 평가 = Evaluation

을 반드시 기억해야 합니다.


17장 Deployment 전개란 무엇인가#

마지막 단계는 Deployment입니다.

한글로는 전개라고 합니다.

분석 결과가 좋은 것으로 평가되었다면 이제 실제 업무에 사용할 계획을 세워야 합니다.

주요 작업#

제공된 학습자료에서는:

  • 전개 계획 수립
  • 모니터링 계획
  • 유지보수 계획

을 포함합니다.

즉 분석 결과를 실제 현업에 적용하는 단계입니다.


18장 Deployment를 가장 쉽게 이해하면#

고객 이탈 모델을 만들었다고 생각해봅시다.

모델 정확도가 좋고 비즈니스 적용 가능성도 확인했습니다.

하지만 실제 서비스에서 사용하려면 다음을 결정해야 합니다.

  • 언제 모델을 실행할 것인가?
  • 결과를 어느 시스템에 전달할 것인가?
  • 담당자는 결과를 어떻게 사용할 것인가?
  • 모델 성능은 어떻게 모니터링할 것인가?
  • 성능이 떨어지면 어떻게 수정할 것인가?

이러한 실제 적용 계획이 Deployment입니다.

핵심#

Deployment = 분석 결과를 실제 업무에 사용

입니다.


19장 전개가 끝나면 모든 분석이 끝나는가#

CRISP-DM의 중요한 특징은 단계가 완전히 일방향으로 끝나는 구조가 아니라는 점입니다.

실제 적용 이후에도:

  • 데이터가 변하거나
  • 모델 성능이 떨어지거나
  • 비즈니스 상황이 바뀌면

다시 앞 단계로 돌아갈 수 있습니다.

즉:

업무 이해
→ 데이터 이해
→ 데이터 준비
→ 모델링
→ 평가
→ 전개

로 진행하지만 필요하다면 이전 단계로 다시 돌아갑니다.


20장 CRISP-DM은 단방향 프로세스가 아니다#

ADsP에서 자주 출제되는 핵심입니다.

다음 설명은 틀립니다.

CRISP-DM은 각 단계를 한 번씩 순서대로 실행하고 이전 단계로 돌아갈 수 없다.

CRISP-DM은 필요에 따라 반복 Iteration과 피드백이 가능한 구조입니다.

예를 들어 모델링 단계에서 성능이 좋지 않다고 하겠습니다.

이때:

Modeling
→ Data Preparation

으로 돌아가 변수나 데이터를 다시 정리할 수 있습니다.

또 평가 단계에서 비즈니스 목표와 맞지 않는다고 판단되면:

Evaluation
→ Business Understanding

으로 돌아가 분석 목적을 다시 검토할 수도 있습니다.

핵심#

CRISP-DM = 반복·순환 가능

입니다.


21장 단계 간 피드백 구조란 무엇인가#

CRISP-DM은 각 단계가 서로 완전히 독립되어 있지 않습니다.

예를 들어:

데이터 이해 후#

필요한 데이터가 부족하다는 것을 발견할 수 있습니다.

그러면 업무 목표를 다시 검토할 수 있습니다.

데이터 준비 후#

새로운 데이터 문제가 발견될 수 있습니다.

다시 Data Understanding으로 돌아갈 수 있습니다.

모델링 후#

성능이 좋지 않을 수 있습니다.

다시 Data Preparation으로 돌아가 변수를 수정할 수 있습니다.

평가 후#

비즈니스 목표와 맞지 않을 수 있습니다.

앞 단계로 돌아갈 수 있습니다.

이런 구조를 피드백과 반복이 가능한 순환 구조라고 이해하면 됩니다.


22장 CRISP-DM을 요리에 비유하면 쉽게 이해할 수 있다#

CRISP-DM의 6단계는 요리 순서에 비유하면 매우 쉽습니다.

1. Business Understanding#

무슨 요리를 만들까?

목표를 정합니다.

2. Data Understanding#

어떤 재료가 있지?

재료 상태를 확인합니다.

3. Data Preparation#

재료를 손질한다.

씻고 자르고 준비합니다.

4. Modeling#

요리한다.

실제 조리를 수행합니다.

5. Evaluation#

맛을 본다.

잘 만들어졌는지 확인합니다.

6. Deployment#

손님에게 서빙한다.

실제로 사용합니다.

이 비유를 기억하면 6단계 순서를 훨씬 쉽게 복원할 수 있습니다.


23장 쇼핑몰 고객 이탈 분석으로 CRISP-DM 이해하기#

온라인 쇼핑몰에서 고객 이탈률이 높아졌다고 가정해봅시다.

1단계 Business Understanding#

문제를 정의합니다.

최근 고객 이탈률이 높아졌다.

목표:

이탈 가능성이 높은 고객을 사전에 파악한다.

2단계 Data Understanding#

사용 가능한 데이터를 확인합니다.

  • 회원 정보
  • 구매 이력
  • 접속 기록
  • 고객센터 문의

데이터 품질도 확인합니다.

3단계 Data Preparation#

분석할 데이터를 정리합니다.

  • 결측치 처리
  • 데이터 통합
  • 필요한 데이터 선택
  • 형식 통일

4단계 Modeling#

고객 이탈 예측 모델을 구축합니다.

5단계 Evaluation#

모델 성능을 확인합니다.

그리고 실제 고객 관리 업무에 사용할 수 있는지 평가합니다.

6단계 Deployment#

모델을 실제 CRM이나 마케팅 시스템과 연결합니다.

이후 성능을 지속적으로 모니터링합니다.


24장 CRISP-DM의 핵심은 모델링만이 아니다#

CRISP-DM을 처음 배우면 Modeling이 가장 중요한 단계처럼 느껴질 수 있습니다.

하지만 전체 6단계 가운데 모델링은 한 단계에 불과합니다.

실제로는:

  • 문제 정의
  • 데이터 이해
  • 데이터 준비
  • 결과 평가
  • 현업 적용

까지 모두 중요합니다.

즉 CRISP-DM은 단순한 모델 생성 방법론이라기보다 데이터 분석 프로젝트 전체를 관리하는 프로세스에 가깝습니다.


25장 CRISP-DM과 SEMMA의 가장 큰 차이#

두 방법론은 출발점에서 큰 차이가 있습니다.

CRISP-DM#

시작:

Business Understanding

즉 비즈니스 문제를 먼저 이해합니다.

SEMMA#

시작:

Sample

즉 데이터를 표본 추출하는 단계에서 시작합니다.

따라서 시험에서 다음 문장이 나오면 주의합니다.

SEMMA는 Business Understanding 단계로 시작한다.

틀립니다.

Business Understanding은 CRISP-DM의 첫 단계입니다.


26장 CRISP-DM과 KDD의 차이#

제공된 학습자료에서는 세 방법론의 성격을 다음과 같이 구분합니다.

KDD#

  • 5단계
  • 학술적 접근
  • 데이터베이스 기반
  • 데이터 마이닝 프로세스 중심

CRISP-DM#

  • 6단계
  • 산업 컨소시엄
  • 산업 표준
  • 비즈니스 문제 해결 중심
  • 반복·순환 가능

따라서:

KDD → 지식 발견

CRISP-DM → 비즈니스 문제 해결

로 기억하면 쉽습니다.


27장 KDD·CRISP-DM·SEMMA 3대 방법론 비교#

방법론 개발 주체 단계 수 핵심 특징
KDD 학계 Fayyad 5단계 학술적·데이터 마이닝 프로세스 중심
CRISP-DM 산업 컨소시엄 6단계 산업 표준·비즈니스 문제 해결·반복 가능
SEMMA SAS Institute 5단계 SAS 기반·탐색·모델링 중심

단계 수만 비교하면:

5 → 6 → 5

입니다.

즉:

KDD 5

CRISP-DM 6

SEMMA 5

입니다.


28장 CRISP-DM 6단계와 KDD 5단계 비교#

CRISP-DM#

  1. Business Understanding
  2. Data Understanding
  3. Data Preparation
  4. Modeling
  5. Evaluation
  6. Deployment

KDD#

  1. Selection
  2. Preprocessing
  3. Transformation
  4. Data Mining
  5. Interpretation / Evaluation

CRISP-DM에는 업무 이해와 전개 단계가 명확하게 포함되어 있다는 점이 특징입니다.

반면 KDD는 데이터에서 지식을 발견하는 데이터 마이닝 과정에 더 초점을 맞춥니다.


29장 CRISP-DM 6단계와 SEMMA 5단계 비교#

CRISP-DM#

업무 이해
→ 데이터 이해
→ 데이터 준비
→ 모델링
→ 평가
→ 전개

SEMMA#

Sample
→ Explore
→ Modify
→ Model
→ Assess

SEMMA는 데이터 탐색과 모델링 중심이고, CRISP-DM은 비즈니스 문제부터 실제 전개까지 포함하는 더 넓은 분석 프로젝트 흐름으로 제공된 학습자료에서 구분합니다.


30장 단계 이름을 보고 바로 역할 찾기#

시험에서는 영어 단계명을 그대로 제시할 수 있습니다.

Business Understanding#

→ 업무 목적과 분석 목표 설정

Data Understanding#

→ 초기 데이터 수집·탐색·품질 확인

Data Preparation#

→ 데이터 선택·정제·통합·포맷팅

Modeling#

→ 모델링 기법 선택·모델 구축

Evaluation#

→ 분석 결과와 모델 적용성 평가

Deployment#

→ 전개·모니터링·유지보수 계획

이 연결을 바로 떠올릴 수 있어야 합니다.


31장 가장 많이 헷갈리는 Data Understanding과 Data Preparation#

두 단계는 이름도 비슷하고 데이터 관련 작업을 모두 수행하기 때문에 헷갈릴 수 있습니다.

Data Understanding#

본다

  • 수집
  • 기술
  • 탐색
  • 품질 확인

Data Preparation#

고친다

  • 선택
  • 정제
  • 통합
  • Formatting

쉽게 말하면:

Understanding = 이해

Preparation = 준비

입니다.


32장 가장 많이 헷갈리는 Modeling과 Evaluation#

Modeling#

모델을 만든다

Evaluation#

모델이 좋은지 평가한다

특히 다음 표현은 Evaluation입니다.

모델 적용성 평가

이것을 Modeling으로 선택하지 않도록 주의해야 합니다.


33장 Evaluation과 Deployment는 어떻게 다른가#

Evaluation#

질문:

실제로 사용할 만한가?

Deployment#

질문:

그렇다면 실제로 어떻게 사용할 것인가?

입니다.

따라서:

Evaluation → 사용 가능성 판단

Deployment → 실제 사용

으로 구분합니다.


34장 CRISP-DM은 왜 산업 표준이라고 하는가#

제공된 ADsP 학습자료에서는 CRISP-DM을 산업 전반에 걸쳐 범용적으로 적용할 수 있는 표준 프로세스로 설명합니다.

즉 특정 기업이나 특정 분석도구 하나에만 종속된 프로세스가 아니라 여러 산업의 분석 프로젝트에 적용할 수 있다는 점이 특징입니다.

이를 시험에서는:

CRISP-DM = 산업 표준

으로 연결해 기억합니다.


35장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. CRISP-DM은 5단계다#

틀립니다.

CRISP-DM은 6단계입니다.

함정 2. CRISP-DM은 데이터 이해부터 시작한다#

틀립니다.

첫 단계는:

Business Understanding

입니다.

함정 3. 모델 적용성 평가는 Modeling 단계다#

틀립니다.

정답은:

Evaluation

입니다.

함정 4. Deployment는 모델을 만드는 단계다#

틀립니다.

Deployment는 실제 적용과 전개 계획을 수립하는 단계입니다.

함정 5. CRISP-DM은 단방향이다#

틀립니다.

필요하면 이전 단계로 돌아갈 수 있는 반복·순환 구조입니다.

함정 6. 데이터 품질 확인은 Data Preparation이다#

제공된 학습자료에서는 데이터 품질 확인을 Data Understanding의 주요 작업으로 정리합니다.

함정 7. 데이터 통합은 Data Understanding이다#

제공된 학습자료에서는 데이터 통합을 Data Preparation 단계와 연결합니다.


36장 CRISP-DM 핵심 비교표#

단계 가장 쉬운 의미 핵심 키워드
Business Understanding 무슨 문제를 풀까 목표·상황·분석 목적
Data Understanding 어떤 데이터가 있나 수집·탐색·품질
Data Preparation 데이터를 손질한다 선택·정제·통합
Modeling 모델을 만든다 기법 선택·테스트·모델
Evaluation 결과를 검증한다 결과·적용성 평가
Deployment 실제 사용한다 전개·모니터링·유지보수

37장 시험 직전 30초 암기#

1. Business Understanding#

→ 업무 이해

→ 목표 설정

2. Data Understanding#

→ 데이터 이해

→ 수집·탐색·품질 확인

3. Data Preparation#

→ 데이터 준비

→ 선택·정제·통합

4. Modeling#

→ 모델링

→ 기법 선택·모델 작성

5. Evaluation#

→ 평가

→ 결과 평가·모델 적용성 평가

6. Deployment#

→ 전개

→ 실제 적용·모니터링·유지보수

한 줄 암기:

업무 → 데이터 → 준비 → 모델 → 평가 → 전개


38장 요리 비유로 시험 직전 복습#

업무 이해

→ 무슨 요리를 만들까?

데이터 이해

→ 어떤 재료가 있지?

데이터 준비

→ 재료 손질

모델링

→ 요리하기

평가

→ 맛보기

전개

→ 손님에게 서빙

이 비유만 기억해도 단계 순서를 복원하기 쉽습니다.


CRISP-DM FAQ#

CRISP-DM이란 무엇인가#

Cross Industry Standard Process for Data Mining의 약자로 다양한 산업의 데이터 분석과 데이터 마이닝 프로젝트에 적용할 수 있는 표준 프로세스입니다.

CRISP-DM은 몇 단계인가#

총 6단계입니다.

  1. Business Understanding
  2. Data Understanding
  3. Data Preparation
  4. Modeling
  5. Evaluation
  6. Deployment

CRISP-DM의 첫 단계는 무엇인가#

Business Understanding, 즉 업무 이해입니다.

Business Understanding에서는 무엇을 하는가#

업무 목적과 상황을 파악하고 데이터 마이닝 목표를 설정합니다.

Data Understanding에서는 무엇을 하는가#

초기 데이터를 수집하고 데이터 기술·탐색·품질 확인을 수행합니다.

Data Preparation에서는 무엇을 하는가#

분석용 데이터셋을 선택하고 데이터를 정제·통합·포맷팅합니다.

Modeling에서는 무엇을 하는가#

모델링 기법을 선택하고 테스트 계획을 설계하며 실제 모델을 구축합니다.

Evaluation에서는 무엇을 하는가#

분석 결과를 평가하고 모델이 실제 업무에 적용 가능한지 평가합니다.

모델 적용성 평가는 어느 단계인가#

Evaluation 단계입니다.

Modeling 단계가 아닙니다.

Deployment에서는 무엇을 하는가#

전개 계획을 수립하고 모니터링 및 유지보수 계획을 마련합니다.

CRISP-DM은 단방향인가#

아닙니다.

필요에 따라 이전 단계로 돌아가 반복할 수 있는 피드백 구조를 가집니다.

CRISP-DM과 SEMMA의 가장 큰 차이는 무엇인가#

CRISP-DM은 Business Understanding부터 시작하여 비즈니스 문제 해결과 실제 전개까지 포함합니다. SEMMA는 Sample부터 시작하며 데이터 탐색과 모델링에 초점을 둡니다.

CRISP-DM과 KDD의 차이는 무엇인가#

제공된 학습자료에서는 KDD를 학술적 데이터 마이닝 프로세스 중심으로, CRISP-DM을 산업 표준의 비즈니스 문제 해결 중심 프로세스로 구분합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. CRISP-DM의 전체 영어 명칭을 말할 수 있는가?
  2. CRISP-DM이 몇 단계인지 알고 있는가?
  3. 6단계를 순서대로 말할 수 있는가?
  4. Business Understanding에서 무엇을 하는지 설명할 수 있는가?
  5. Data Understanding과 Data Preparation의 차이를 설명할 수 있는가?
  6. 데이터 품질 확인이 어느 단계인지 알고 있는가?
  7. 데이터 정제·통합이 어느 단계인지 알고 있는가?
  8. 테스트 계획 설계가 어느 단계인지 알고 있는가?
  9. 모델 적용성 평가가 Evaluation이라는 것을 알고 있는가?
  10. Deployment의 주요 작업을 설명할 수 있는가?
  11. CRISP-DM이 단방향이 아니라는 것을 알고 있는가?
  12. 단계 사이에 피드백과 반복이 가능하다는 것을 설명할 수 있는가?
  13. KDD·CRISP-DM·SEMMA의 단계 수를 구분할 수 있는가?
  14. CRISP-DM이 Business Understanding부터 시작한다는 것을 기억하고 있는가?

이 글을 마치며#

CRISP-DM의 핵심은 단순히 모델을 만드는 것이 아닙니다.

먼저:

무슨 문제를 해결해야 하는가

를 이해합니다.

이것이:

Business Understanding

입니다.

그다음:

어떤 데이터가 있는가

를 확인합니다.

Data Understanding

입니다.

분석할 수 있도록 데이터를 손질합니다.

Data Preparation

그 데이터로 모델을 만듭니다.

Modeling

만든 모델이 실제로 좋은지 확인합니다.

Evaluation

마지막으로 실제 업무에 적용합니다.

Deployment

전체 흐름은 다음 한 줄로 정리할 수 있습니다.

문제를 이해하고 → 데이터를 이해하고 → 데이터를 준비하고 → 모델을 만들고 → 평가하고 → 실제로 사용한다.

ADsP 시험에서는 마지막으로 세 가지를 반드시 기억합니다.

CRISP-DM은 6단계다.

첫 단계는 Business Understanding이다.

모델 적용성 평가는 Evaluation 단계다.

그리고 가장 중요한 특징은:

CRISP-DM은 일방향으로 한 번만 진행하는 구조가 아니라 필요하면 이전 단계로 돌아갈 수 있는 반복·순환형 프로세스

라는 점입니다.

이 페이지의 목차