SEMMA란? SAS 데이터 마이닝 5단계와 KDD·CRISP-DM 차이 쉽게 이해하기
1장 SEMMA란 무엇인가#
SEMMA는 SAS Institute에서 개발한 데이터 마이닝 방법론입니다.
SEMMA라는 이름은 5단계의 첫 글자를 따서 만든 것입니다.
S → Sample
E → Explore
M → Modify
M → Model
A → Assess
한국어로 연결하면 다음과 같습니다.
표본 추출 → 탐색 → 수정 → 모델링 → 평가
ADsP에서는 이 다섯 단계의 순서와 각 단계의 역할을 정확하게 구분하는 것이 중요합니다.
특히 CRISP-DM과 달리 비즈니스 이해 Business Understanding 단계로 시작하지 않는다는 점이 시험에서 자주 함정으로 등장합니다.
2장 SEMMA 5단계 전체 흐름#
SEMMA의 전체 과정은 다음과 같습니다.
- Sample
- Explore
- Modify
- Model
- Assess
각 단계의 역할을 정리하면 다음과 같습니다.
| 단계 | 한글 | 핵심 내용 |
|---|---|---|
| Sample | 표본 추출 | 분석 가능한 크기의 표본 추출 |
| Explore | 탐색 | 데이터 분포·패턴·이상치 탐색 |
| Modify | 수정 | 변수 변환·생성·선택, 결측치 처리 |
| Model | 모델링 | 분석 모델 구축 |
| Assess | 평가 | 모델 성능과 활용 가치 평가 |
시험 직전에는 다음 한 줄로 기억하면 됩니다.
샘플 → 탐색 → 수정 → 모델 → 평가
3장 Sample 표본 추출이란 무엇인가#
SEMMA의 첫 번째 단계는 Sample입니다.
대규모 데이터를 모두 분석하는 대신 분석 목적에 맞는 적절한 크기의 표본을 추출합니다.
예를 들어 고객 데이터가 1억 건 있다고 생각해봅시다.
모든 데이터를 처음부터 사용하면 다음과 같은 문제가 생길 수 있습니다.
- 분석시간 증가
- 컴퓨팅 자원 증가
- 모델 실험 속도 저하
그래서 전체 데이터를 대표할 수 있는 적절한 Sample을 추출하여 분석을 진행할 수 있습니다.
핵심#
Sample = 분석 가능한 규모의 표본 추출
입니다.
4장 Sample 단계에서 데이터 분할도 이루어진다#
제공된 ADsP 학습자료에서는 Sample 단계에서 데이터를 다음과 같이 나누는 것도 함께 설명합니다.
- 훈련 데이터
- 검증 데이터
- 테스트 데이터
훈련 데이터#
모델을 학습시키는 데 사용합니다.
검증 데이터#
모델이나 설정을 조정하고 비교하는 데 활용할 수 있습니다.
테스트 데이터#
최종 모델의 성능을 확인하는 데 사용합니다.
즉 Sample 단계는 단순히 일부 데이터를 뽑는 것뿐 아니라 모델링을 위한 데이터 분할의 출발점으로 이해할 수 있습니다.
5장 왜 표본을 추출하는가#
데이터가 많다고 해서 항상 모든 데이터를 처음부터 사용해야 하는 것은 아닙니다.
예를 들어 여러 모델을 비교하고 있다고 생각해봅시다.
매번 1억 건의 데이터를 모두 사용하면 분석 속도가 매우 느려질 수 있습니다.
적절한 표본을 사용하면:
- 빠르게 데이터를 탐색하고
- 여러 분석 방법을 실험하고
- 모델을 비교
하기 쉬워집니다.
따라서 SEMMA의 첫 단계가 Sample인 것은 효율적인 데이터 마이닝 작업과 연결됩니다.
6장 Explore 탐색이란 무엇인가#
두 번째 단계는 Explore입니다.
이 단계에서는 데이터를 본격적으로 살펴보며 어떤 특징이 있는지 확인합니다.
대표적인 작업은 다음과 같습니다.
- 데이터 분포 확인
- 데이터 패턴 탐색
- 이상치 탐색
- 기초 통계 확인
- 시각화
즉 데이터를 분석하기 전에:
이 데이터는 어떤 모습을 가지고 있는가?
를 이해하는 단계입니다.
핵심#
Explore = 데이터의 특성과 패턴 탐색
입니다.
7장 Explore 단계에서 데이터 분포를 보는 이유#
예를 들어 고객 구매금액 데이터가 있다고 하겠습니다.
대부분의 고객은 1만 원에서 10만 원 정도를 구매하지만 일부 고객은 1,000만 원 이상을 구매할 수도 있습니다.
평균값 하나만 보면 이러한 특징을 알아차리기 어렵습니다.
그래서:
- 평균
- 중앙값
- 최솟값
- 최댓값
- 분포
- 이상치
등을 확인합니다.
필요하다면:
- 히스토그램
- 상자그림
- 산점도
같은 시각화를 사용할 수 있습니다.
즉 Explore는 데이터를 이해하기 위한 탐색 과정입니다.
8장 Explore와 데이터 시각화는 어떤 관계인가#
데이터 탐색에서는 숫자만 보는 것보다 그래프를 함께 사용하면 패턴을 쉽게 파악할 수 있습니다.
예를 들어:
히스토그램
→ 연속형 데이터의 분포 확인
상자그림
→ 이상치와 분포 확인
산점도
→ 두 변수 사이의 관계 확인
처럼 활용할 수 있습니다.
따라서 제공된 학습자료에서도 Explore 단계에 기초 통계와 시각화를 포함하고 있습니다.
9장 Modify 수정이란 무엇인가#
세 번째 단계는 Modify입니다.
이 단계에서는 탐색한 데이터를 실제 모델링에 적합하도록 수정합니다.
대표적인 작업은 다음과 같습니다.
- 변수 변환
- 변수 생성
- 변수 선택
- 결측치 처리
- 데이터 전처리
즉:
데이터의 문제와 구조를 확인했으니 이제 모델링하기 좋은 형태로 바꾼다.
는 단계입니다.
핵심#
Modify = 데이터와 변수를 모델링에 적합하게 수정
입니다.
10장 변수 변환이란 무엇인가#
기존 변수의 값을 다른 형태로 변환하는 작업입니다.
예를 들어 나이를 그대로 사용할 수도 있지만 다음처럼 범주화할 수 있습니다.
25세 → 20대
37세 → 30대
52세 → 50대
또는 지나치게 큰 수치의 분포를 조정하는 등 분석 목적에 맞춰 데이터를 변환할 수도 있습니다.
제공된 학습자료에서는 이런 작업을 Modify와 연결합니다.
11장 변수 생성이란 무엇인가#
기존 데이터를 이용해 새로운 변수를 만드는 작업입니다.
예를 들어 쇼핑몰에 다음 데이터가 있다고 하겠습니다.
- 총 구매금액
- 구매 횟수
이를 이용해:
평균 구매금액 = 총 구매금액 ÷ 구매 횟수
와 같은 새로운 변수를 만들 수 있습니다.
이렇게 분석에 도움이 되는 새로운 변수를 만들어내는 작업도 Modify 단계에 포함됩니다.
12장 변수 선택이란 무엇인가#
모든 변수를 반드시 모델에 사용할 필요는 없습니다.
예를 들어 고객 데이터에 200개의 변수가 있지만 실제 고객 이탈과 관련 있는 변수는 일부일 수 있습니다.
필요한 변수를 선택하면:
- 분석 복잡도 감소
- 불필요한 정보 감소
- 모델 해석 용이성 증가
등의 효과를 기대할 수 있습니다.
따라서:
Modify = 변수 변환 + 생성 + 선택
을 함께 기억하면 좋습니다.
13장 결측치 처리는 어느 단계인가#
SEMMA에서는 결측치 처리와 데이터 전처리를 Modify 단계와 연결합니다.
예를 들어 고객 나이가 다음과 같다고 하겠습니다.
| 고객 | 나이 |
|---|---|
| A | 25 |
| B | NULL |
| C | 31 |
B 고객의 나이가 비어 있습니다.
이런 결측치를:
- 제거하거나
- 특정 값으로 대체하거나
- 분석 목적에 맞게 처리
할 수 있습니다.
시험 핵심#
SEMMA에서 결측치 처리 → Modify
입니다.
14장 Model 모델링이란 무엇인가#
네 번째 단계는 Model입니다.
이 단계에서는 수정된 데이터를 이용해 실제 분석 모델을 구축합니다.
제공된 ADsP 학습자료에서는 대표적으로 다음 기법을 제시합니다.
- 회귀
- 의사결정나무
- 신경망
즉:
데이터에서 패턴을 학습하고 예측하거나 분류할 모델을 만든다.
는 단계입니다.
핵심#
Model = 분석 모델 구축
입니다.
15장 Model 단계에서 하는 일을 사례로 이해하기#
온라인 쇼핑몰에서 고객 이탈을 예측한다고 생각해봅시다.
Modify 단계에서:
- 최근 구매일
- 구매 횟수
- 평균 구매금액
- 고객센터 문의 횟수
같은 변수를 준비했습니다.
Model 단계에서는 이 데이터를 이용해 고객이:
- 이탈할 가능성이 높은지
- 계속 이용할 가능성이 높은지
예측하는 모델을 만듭니다.
사용할 수 있는 방법은 문제에 따라 달라질 수 있습니다.
제공된 학습자료에서는 회귀, 의사결정나무, 신경망 등을 대표 사례로 제시합니다.
16장 Assess 평가란 무엇인가#
마지막 단계는 Assess입니다.
모델을 만들었다고 해서 바로 사용할 수 있는 것은 아닙니다.
모델이 실제로 얼마나 잘 작동하는지 평가해야 합니다.
제공된 학습자료에서는 대표적으로 다음을 확인합니다.
- 정확도
- 향상도
- ROI
- 곡선을 이용한 검증
즉:
만든 모델이 실제로 쓸 만한가?
를 판단하는 단계입니다.
핵심#
Assess = 모델 성능과 활용 가치 평가
입니다.
17장 정확도는 무엇을 의미하는가#
정확도 Accuracy는 모델이 얼마나 올바르게 예측했는지를 나타내는 대표적인 지표입니다.
예를 들어 100명의 고객을 예측했는데 90명을 올바르게 예측했다면 단순하게는 높은 정확도를 가진 모델이라고 생각할 수 있습니다.
다만 SEMMA 학습에서는 세부 공식보다 Assess 단계에서 모델의 성능을 평가한다는 역할을 먼저 기억하는 것이 중요합니다.
18장 향상도란 무엇인가#
제공된 학습자료에서는 Assess 단계의 평가 요소로 향상도도 제시합니다.
핵심은 모델을 사용했을 때 기존 방식과 비교해 얼마나 더 효과적인 결과를 얻을 수 있는지를 확인하는 관점입니다.
즉 단순히 모델이 예측을 수행한다는 사실보다 실제로 얼마나 개선된 성과를 제공하는가를 보는 것입니다.
19장 ROI는 왜 평가할까#
ROI는 Return on Investment, 즉 투자수익률입니다.
데이터 마이닝 모델이 아무리 기술적으로 훌륭하더라도 구축과 운영에 큰 비용이 들고 실제 비즈니스 가치를 만들어내지 못한다면 활용하기 어려울 수 있습니다.
예를 들어 모델 구축 비용이 매우 큰데 실제 매출 증가 효과가 거의 없다면 투자 대비 효과가 낮을 수 있습니다.
따라서 Assess에서는 기술적인 모델 성능뿐 아니라 실제 활용 가치도 고려할 수 있습니다.
20장 SEMMA 전체 과정을 쇼핑몰 사례로 이해하기#
쇼핑몰에서 고객 이탈 예측 모델을 만든다고 생각해봅시다.
1단계 Sample#
전체 고객 데이터 가운데 분석할 표본을 선택합니다.
그리고 훈련·검증·테스트 데이터로 분할합니다.
2단계 Explore#
데이터를 살펴봅니다.
- 구매금액 분포
- 방문 빈도
- 이상치
- 변수 사이의 관계
등을 탐색합니다.
3단계 Modify#
모델링에 적합하게 데이터를 정리합니다.
- 결측치 처리
- 변수 변환
- 새로운 변수 생성
- 변수 선택
을 수행합니다.
4단계 Model#
고객 이탈을 예측하는 모델을 만듭니다.
예를 들어 회귀나 의사결정나무 등의 모델을 구축할 수 있습니다.
5단계 Assess#
모델의 성능과 활용 가능성을 평가합니다.
전체 흐름은 다음과 같습니다.
표본 → 탐색 → 수정 → 모델링 → 평가
입니다.
21장 SEMMA는 왜 비즈니스 이해로 시작하지 않을까#
CRISP-DM과 비교할 때 가장 중요한 차이입니다.
CRISP-DM은 Business Understanding, 즉 비즈니스 이해 단계로 시작합니다.
반면 SEMMA는:
Sample
부터 시작합니다.
따라서 시험에서:
SEMMA는 비즈니스 이해 단계로 시작한다.
라고 나오면 틀린 설명입니다.
시험 핵심#
SEMMA → Sample부터 시작
CRISP-DM → Business Understanding부터 시작
으로 구분합니다.
22장 SEMMA의 이름 자체가 순서다#
SEMMA는 각 단계의 첫 글자를 그대로 연결한 이름입니다.
S
Sample
E
Explore
M
Modify
M
Model
A
Assess
따라서 영어 약어만 기억해도 전체 순서를 복원할 수 있습니다.
쉬운 암기#
S-E-M-M-A
→ 샘플-탐색-수정-모델-평가
입니다.
23장 KDD와 SEMMA의 차이는 무엇인가#
두 방법론 모두 5단계이기 때문에 시험에서 혼동하기 쉽습니다.
KDD 5단계#
- Selection
- Preprocessing
- Transformation
- Data Mining
- Interpretation / Evaluation
SEMMA 5단계#
- Sample
- Explore
- Modify
- Model
- Assess
단계 수는 같지만 이름과 강조점은 다릅니다.
제공된 학습자료에서는:
KDD → 학술적, 데이터베이스 기반
SEMMA → SAS 도구 기반, 모델링 중심
으로 구분합니다.
24장 KDD와 SEMMA를 가장 쉽게 구분하면#
KDD는 데이터를 선택하고 정제하여 지식을 발견하는 데이터 마이닝 프로세스에 초점을 둡니다.
SEMMA는 Sample을 시작으로 데이터를 탐색하고 수정한 뒤 모델을 만들고 평가하는 흐름을 강조합니다.
시험에서는 다음 조합이 중요합니다.
KDD
→ Fayyad
→ 학계
→ 5단계
SEMMA
→ SAS Institute
→ 5단계
→ 모델링 중심
입니다.
25장 CRISP-DM이란 무엇인가#
CRISP-DM은 데이터 마이닝과 분석 프로젝트에서 사용하는 대표적인 방법론 가운데 하나입니다.
제공된 학습자료에서는 다음 특징을 강조합니다.
산업 컨소시엄
6단계
산업 표준
반복·순환 가능
그리고 가장 중요한 출발 단계는:
Business Understanding
입니다.
따라서 SEMMA와 비교할 때:
CRISP-DM = 비즈니스 문제 중심
SEMMA = 데이터 탐색·모델링 중심
으로 이해하면 쉽습니다.
26장 KDD·CRISP-DM·SEMMA 3대 방법론 비교#
| 방법론 | 개발 주체 | 단계 수 | 핵심 특징 |
|---|---|---|---|
| KDD | 학계 Fayyad | 5단계 | 학술적·데이터베이스 기반 |
| CRISP-DM | 산업 컨소시엄 | 6단계 | 산업 표준·반복과 순환 |
| SEMMA | SAS Institute | 5단계 | SAS 도구 기반·모델링 중심 |
ADsP에서는 이 비교표를 그대로 기억해두는 것이 좋습니다.
27장 단계 수로 구분하면#
시험에서는 단계 수를 바꿔 출제할 수 있습니다.
KDD#
5단계
CRISP-DM#
6단계
SEMMA#
5단계
따라서:
5 - 6 - 5
로 기억할 수 있습니다.
순서는:
KDD → CRISP-DM → SEMMA
입니다.
즉:
KDD 5
CRISP-DM 6
SEMMA 5
입니다.
28장 개발 주체로 구분하면#
KDD#
제공된 학습자료에서는 학계 Fayyad와 연결합니다.
CRISP-DM#
산업 컨소시엄
SEMMA#
SAS Institute
따라서 다음처럼 기억하면 됩니다.
KDD → 학계
CRISP-DM → 산업
SEMMA → SAS
입니다.
29장 분석 목적과 특징으로 구분하면#
KDD#
Knowledge Discovery
→ 데이터에서 지식 발견
CRISP-DM#
Business Problem
→ 비즈니스 문제 해결
SEMMA#
Data Exploration & Modeling
→ 데이터 탐색과 모델링
쉽게 줄이면:
KDD = 발견
CRISP-DM = 비즈니스
SEMMA = 모델링
입니다.
30장 KDD와 SEMMA 단계의 차이를 나란히 보면#
| KDD | SEMMA |
|---|---|
| Selection | Sample |
| Preprocessing | Explore |
| Transformation | Modify |
| Data Mining | Model |
| Interpretation / Evaluation | Assess |
두 방법론은 정확히 같은 단계가 1:1로 대응한다고 단순화해서 외우기보다 각 방법론의 고유한 순서를 따로 기억하는 것이 안전합니다.
KDD는:
Selection → Preprocessing → Transformation → Data Mining → Interpretation/Evaluation
SEMMA는:
Sample → Explore → Modify → Model → Assess
입니다.
31장 SEMMA에서 가장 헷갈리는 단계는 Explore와 Modify다#
Explore#
데이터를 살펴보는 단계입니다.
- 분포
- 패턴
- 이상치
- 기초 통계
- 시각화
Modify#
데이터를 실제로 수정하는 단계입니다.
- 변수 변환
- 변수 생성
- 변수 선택
- 결측치 처리
- 전처리
즉:
Explore = 본다
Modify = 바꾼다
라고 기억하면 매우 쉽습니다.
32장 Model과 Assess를 구분하는 방법#
Model#
모델을 만든다.
Assess#
모델을 평가한다.
따라서:
Model → 구축
Assess → 검증
이라고 연결합니다.
시험에서:
모델의 정확도와 ROI를 평가한다.
라고 나오면:
Assess
입니다.
33장 Sample과 Explore를 구분하는 방법#
Sample#
분석할 데이터를 뽑는다.
Explore#
뽑은 데이터를 살펴본다.
즉 전체 흐름의 첫 두 단계는:
뽑고 → 본다
입니다.
그다음:
바꾸고 → 모델 만들고 → 평가
합니다.
이를 한 문장으로 연결하면:
데이터를 뽑아서 살펴보고, 수정한 뒤 모델을 만들고 평가한다.
가 됩니다.
34장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. SEMMA는 Business Understanding으로 시작한다#
틀립니다.
SEMMA는:
Sample
부터 시작합니다.
Business Understanding은 CRISP-DM과 연결합니다.
함정 2. SEMMA는 6단계 방법론이다#
틀립니다.
SEMMA는 5단계입니다.
함정 3. SEMMA는 SAS Institute가 개발했다#
맞습니다.
SEMMA와 SAS를 반드시 연결합니다.
함정 4. Explore에서 모델을 구축한다#
틀립니다.
모델 구축은:
Model
단계입니다.
함정 5. Modify에서 모델 성능을 평가한다#
틀립니다.
모델 평가는:
Assess
입니다.
함정 6. 결측치 처리는 Explore에서 한다#
제공된 학습자료 기준에서는 결측치 처리를:
Modify
단계와 연결합니다.
함정 7. Assess에서는 표본을 추출한다#
틀립니다.
표본 추출은:
Sample
단계입니다.
35장 SEMMA 5단계 핵심 비교표#
| 단계 | 핵심 질문 |
|---|---|
| Sample | 어떤 데이터를 뽑을 것인가? |
| Explore | 데이터에는 어떤 특징이 있는가? |
| Modify | 데이터를 어떻게 바꿀 것인가? |
| Model | 어떤 모델을 만들 것인가? |
| Assess | 모델이 얼마나 좋은가? |
질문 형태로 외우면 순서를 기억하기 쉽습니다.
36장 시험 직전 30초 암기#
SEMMA#
S = Sample
→ 표본 추출
→ 훈련·검증·테스트 분할
E = Explore
→ 분포·패턴·이상치
→ 통계·시각화
M = Modify
→ 변수 변환·생성·선택
→ 결측치·전처리
M = Model
→ 회귀·의사결정나무·신경망
→ 모델 구축
A = Assess
→ 성능 평가
→ 정확도·향상도·ROI
한 줄 암기#
샘플 → 탐색 → 수정 → 모델 → 평가
37장 3대 방법론 시험 직전 암기#
KDD#
Fayyad
5단계
학술적·데이터베이스 기반
CRISP-DM#
산업 컨소시엄
6단계
산업 표준
반복·순환 가능
SEMMA#
SAS Institute
5단계
SAS 도구 기반
모델링 중심
단계 수 암기:
5 → 6 → 5
입니다.
SEMMA FAQ#
SEMMA란 무엇인가#
SEMMA는 SAS Institute에서 개발한 데이터 마이닝 방법론으로 Sample, Explore, Modify, Model, Assess의 5단계로 구성됩니다.
SEMMA의 5단계는 무엇인가#
순서대로:
- Sample
- Explore
- Modify
- Model
- Assess
입니다.
SEMMA는 무엇의 약자인가#
각 단계의 첫 글자를 연결한 이름입니다.
Sample · Explore · Modify · Model · Assess
입니다.
Sample 단계에서는 무엇을 하는가#
분석 가능한 크기의 표본을 추출하고 제공된 학습자료에서는 훈련·검증·테스트 데이터 분할도 함께 연결합니다.
Explore 단계에서는 무엇을 하는가#
데이터 분포, 패턴, 이상치를 탐색하고 기초 통계와 시각화를 통해 데이터를 이해합니다.
Modify 단계에서는 무엇을 하는가#
변수 변환·생성·선택, 결측치 처리, 데이터 전처리 등을 수행합니다.
Model 단계에서는 무엇을 하는가#
회귀, 의사결정나무, 신경망 등의 기법을 이용해 분석 모델을 구축합니다.
Assess 단계에서는 무엇을 하는가#
모델의 성능을 평가합니다. 제공된 학습자료에서는 정확도, 향상도, ROI 등을 평가 요소로 제시합니다.
SEMMA는 Business Understanding으로 시작하는가#
아닙니다.
SEMMA는 Sample부터 시작합니다.
Business Understanding은 CRISP-DM의 시작 단계와 연결합니다.
SEMMA는 몇 단계인가#
5단계입니다.
SEMMA는 누가 개발했는가#
SAS Institute가 개발한 데이터 마이닝 방법론입니다.
KDD와 SEMMA의 단계 수는 같은가#
둘 다 5단계입니다.
다만 단계명과 강조점은 다릅니다.
CRISP-DM은 몇 단계인가#
제공된 학습자료 기준 6단계입니다.
KDD·CRISP-DM·SEMMA를 가장 쉽게 구분하는 방법은 무엇인가#
KDD → 학계·5단계
CRISP-DM → 산업 표준·6단계
SEMMA → SAS·5단계
로 기억하면 쉽습니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- SEMMA의 개발 주체를 말할 수 있는가?
- SEMMA의 5단계를 순서대로 말할 수 있는가?
- Sample 단계의 역할을 설명할 수 있는가?
- Explore에서 어떤 작업을 하는지 알고 있는가?
- Modify에서 결측치와 변수를 처리한다는 것을 알고 있는가?
- Model 단계에서 실제 분석 모델을 구축한다는 것을 알고 있는가?
- Assess가 모델 성능 평가 단계라는 것을 알고 있는가?
- Explore와 Modify를 구분할 수 있는가?
- Model과 Assess를 구분할 수 있는가?
- SEMMA가 Business Understanding으로 시작하지 않는다는 것을 알고 있는가?
- KDD와 SEMMA가 모두 5단계라는 것을 기억하고 있는가?
- CRISP-DM이 6단계라는 것을 알고 있는가?
- KDD·CRISP-DM·SEMMA의 개발 주체를 구분할 수 있는가?
- 세 방법론의 특징을 각각 한 문장으로 설명할 수 있는가?
이 글을 마치며#
SEMMA는 이름 자체에 전체 프로세스가 들어 있습니다.
Sample
→ 데이터를 뽑고
Explore
→ 데이터를 살펴보고
Modify
→ 데이터를 수정하고
Model
→ 모델을 만들고
Assess
→ 모델을 평가합니다.
따라서 가장 쉬운 암기 문장은 다음과 같습니다.
뽑고 → 보고 → 바꾸고 → 만들고 → 평가한다.
ADsP 시험에서는 특히 다음 세 가지를 확실하게 기억하면 됩니다.
첫째:
SEMMA = SAS Institute
둘째:
SEMMA = 5단계
셋째:
Business Understanding으로 시작하지 않고 Sample부터 시작
합니다.
마지막으로 3대 방법론은 다음처럼 정리할 수 있습니다.
KDD = 학계·5단계·지식 발견
CRISP-DM = 산업·6단계·비즈니스 문제 해결
SEMMA = SAS·5단계·탐색과 모델링
시험 직전에는 다음 두 줄만 기억해도 핵심을 빠르게 복원할 수 있습니다.
SEMMA = S-E-M-M-A
Sample → Explore → Modify → Model → Assess