SEMMA란? SAS 데이터 마이닝 5단계와 KDD·CRISP-DM 차이 쉽게 이해하기

1장 SEMMA란 무엇인가#

SEMMA는 SAS Institute에서 개발한 데이터 마이닝 방법론입니다.

SEMMA라는 이름은 5단계의 첫 글자를 따서 만든 것입니다.

S → Sample

E → Explore

M → Modify

M → Model

A → Assess

한국어로 연결하면 다음과 같습니다.

표본 추출 → 탐색 → 수정 → 모델링 → 평가

ADsP에서는 이 다섯 단계의 순서와 각 단계의 역할을 정확하게 구분하는 것이 중요합니다.

특히 CRISP-DM과 달리 비즈니스 이해 Business Understanding 단계로 시작하지 않는다는 점이 시험에서 자주 함정으로 등장합니다.


2장 SEMMA 5단계 전체 흐름#

SEMMA의 전체 과정은 다음과 같습니다.

  1. Sample
  2. Explore
  3. Modify
  4. Model
  5. Assess

각 단계의 역할을 정리하면 다음과 같습니다.

단계 한글 핵심 내용
Sample 표본 추출 분석 가능한 크기의 표본 추출
Explore 탐색 데이터 분포·패턴·이상치 탐색
Modify 수정 변수 변환·생성·선택, 결측치 처리
Model 모델링 분석 모델 구축
Assess 평가 모델 성능과 활용 가치 평가

시험 직전에는 다음 한 줄로 기억하면 됩니다.

샘플 → 탐색 → 수정 → 모델 → 평가


3장 Sample 표본 추출이란 무엇인가#

SEMMA의 첫 번째 단계는 Sample입니다.

대규모 데이터를 모두 분석하는 대신 분석 목적에 맞는 적절한 크기의 표본을 추출합니다.

예를 들어 고객 데이터가 1억 건 있다고 생각해봅시다.

모든 데이터를 처음부터 사용하면 다음과 같은 문제가 생길 수 있습니다.

  • 분석시간 증가
  • 컴퓨팅 자원 증가
  • 모델 실험 속도 저하

그래서 전체 데이터를 대표할 수 있는 적절한 Sample을 추출하여 분석을 진행할 수 있습니다.

핵심#

Sample = 분석 가능한 규모의 표본 추출

입니다.


4장 Sample 단계에서 데이터 분할도 이루어진다#

제공된 ADsP 학습자료에서는 Sample 단계에서 데이터를 다음과 같이 나누는 것도 함께 설명합니다.

  • 훈련 데이터
  • 검증 데이터
  • 테스트 데이터

훈련 데이터#

모델을 학습시키는 데 사용합니다.

검증 데이터#

모델이나 설정을 조정하고 비교하는 데 활용할 수 있습니다.

테스트 데이터#

최종 모델의 성능을 확인하는 데 사용합니다.

즉 Sample 단계는 단순히 일부 데이터를 뽑는 것뿐 아니라 모델링을 위한 데이터 분할의 출발점으로 이해할 수 있습니다.


5장 왜 표본을 추출하는가#

데이터가 많다고 해서 항상 모든 데이터를 처음부터 사용해야 하는 것은 아닙니다.

예를 들어 여러 모델을 비교하고 있다고 생각해봅시다.

매번 1억 건의 데이터를 모두 사용하면 분석 속도가 매우 느려질 수 있습니다.

적절한 표본을 사용하면:

  • 빠르게 데이터를 탐색하고
  • 여러 분석 방법을 실험하고
  • 모델을 비교

하기 쉬워집니다.

따라서 SEMMA의 첫 단계가 Sample인 것은 효율적인 데이터 마이닝 작업과 연결됩니다.


6장 Explore 탐색이란 무엇인가#

두 번째 단계는 Explore입니다.

이 단계에서는 데이터를 본격적으로 살펴보며 어떤 특징이 있는지 확인합니다.

대표적인 작업은 다음과 같습니다.

  • 데이터 분포 확인
  • 데이터 패턴 탐색
  • 이상치 탐색
  • 기초 통계 확인
  • 시각화

즉 데이터를 분석하기 전에:

이 데이터는 어떤 모습을 가지고 있는가?

를 이해하는 단계입니다.

핵심#

Explore = 데이터의 특성과 패턴 탐색

입니다.


7장 Explore 단계에서 데이터 분포를 보는 이유#

예를 들어 고객 구매금액 데이터가 있다고 하겠습니다.

대부분의 고객은 1만 원에서 10만 원 정도를 구매하지만 일부 고객은 1,000만 원 이상을 구매할 수도 있습니다.

평균값 하나만 보면 이러한 특징을 알아차리기 어렵습니다.

그래서:

  • 평균
  • 중앙값
  • 최솟값
  • 최댓값
  • 분포
  • 이상치

등을 확인합니다.

필요하다면:

  • 히스토그램
  • 상자그림
  • 산점도

같은 시각화를 사용할 수 있습니다.

즉 Explore는 데이터를 이해하기 위한 탐색 과정입니다.


8장 Explore와 데이터 시각화는 어떤 관계인가#

데이터 탐색에서는 숫자만 보는 것보다 그래프를 함께 사용하면 패턴을 쉽게 파악할 수 있습니다.

예를 들어:

히스토그램

→ 연속형 데이터의 분포 확인

상자그림

→ 이상치와 분포 확인

산점도

→ 두 변수 사이의 관계 확인

처럼 활용할 수 있습니다.

따라서 제공된 학습자료에서도 Explore 단계에 기초 통계와 시각화를 포함하고 있습니다.


9장 Modify 수정이란 무엇인가#

세 번째 단계는 Modify입니다.

이 단계에서는 탐색한 데이터를 실제 모델링에 적합하도록 수정합니다.

대표적인 작업은 다음과 같습니다.

  • 변수 변환
  • 변수 생성
  • 변수 선택
  • 결측치 처리
  • 데이터 전처리

즉:

데이터의 문제와 구조를 확인했으니 이제 모델링하기 좋은 형태로 바꾼다.

는 단계입니다.

핵심#

Modify = 데이터와 변수를 모델링에 적합하게 수정

입니다.


10장 변수 변환이란 무엇인가#

기존 변수의 값을 다른 형태로 변환하는 작업입니다.

예를 들어 나이를 그대로 사용할 수도 있지만 다음처럼 범주화할 수 있습니다.

25세 → 20대

37세 → 30대

52세 → 50대

또는 지나치게 큰 수치의 분포를 조정하는 등 분석 목적에 맞춰 데이터를 변환할 수도 있습니다.

제공된 학습자료에서는 이런 작업을 Modify와 연결합니다.


11장 변수 생성이란 무엇인가#

기존 데이터를 이용해 새로운 변수를 만드는 작업입니다.

예를 들어 쇼핑몰에 다음 데이터가 있다고 하겠습니다.

  • 총 구매금액
  • 구매 횟수

이를 이용해:

평균 구매금액 = 총 구매금액 ÷ 구매 횟수

와 같은 새로운 변수를 만들 수 있습니다.

이렇게 분석에 도움이 되는 새로운 변수를 만들어내는 작업도 Modify 단계에 포함됩니다.


12장 변수 선택이란 무엇인가#

모든 변수를 반드시 모델에 사용할 필요는 없습니다.

예를 들어 고객 데이터에 200개의 변수가 있지만 실제 고객 이탈과 관련 있는 변수는 일부일 수 있습니다.

필요한 변수를 선택하면:

  • 분석 복잡도 감소
  • 불필요한 정보 감소
  • 모델 해석 용이성 증가

등의 효과를 기대할 수 있습니다.

따라서:

Modify = 변수 변환 + 생성 + 선택

을 함께 기억하면 좋습니다.


13장 결측치 처리는 어느 단계인가#

SEMMA에서는 결측치 처리와 데이터 전처리를 Modify 단계와 연결합니다.

예를 들어 고객 나이가 다음과 같다고 하겠습니다.

고객 나이
A 25
B NULL
C 31

B 고객의 나이가 비어 있습니다.

이런 결측치를:

  • 제거하거나
  • 특정 값으로 대체하거나
  • 분석 목적에 맞게 처리

할 수 있습니다.

시험 핵심#

SEMMA에서 결측치 처리 → Modify

입니다.


14장 Model 모델링이란 무엇인가#

네 번째 단계는 Model입니다.

이 단계에서는 수정된 데이터를 이용해 실제 분석 모델을 구축합니다.

제공된 ADsP 학습자료에서는 대표적으로 다음 기법을 제시합니다.

  • 회귀
  • 의사결정나무
  • 신경망

즉:

데이터에서 패턴을 학습하고 예측하거나 분류할 모델을 만든다.

는 단계입니다.

핵심#

Model = 분석 모델 구축

입니다.


15장 Model 단계에서 하는 일을 사례로 이해하기#

온라인 쇼핑몰에서 고객 이탈을 예측한다고 생각해봅시다.

Modify 단계에서:

  • 최근 구매일
  • 구매 횟수
  • 평균 구매금액
  • 고객센터 문의 횟수

같은 변수를 준비했습니다.

Model 단계에서는 이 데이터를 이용해 고객이:

  • 이탈할 가능성이 높은지
  • 계속 이용할 가능성이 높은지

예측하는 모델을 만듭니다.

사용할 수 있는 방법은 문제에 따라 달라질 수 있습니다.

제공된 학습자료에서는 회귀, 의사결정나무, 신경망 등을 대표 사례로 제시합니다.


16장 Assess 평가란 무엇인가#

마지막 단계는 Assess입니다.

모델을 만들었다고 해서 바로 사용할 수 있는 것은 아닙니다.

모델이 실제로 얼마나 잘 작동하는지 평가해야 합니다.

제공된 학습자료에서는 대표적으로 다음을 확인합니다.

  • 정확도
  • 향상도
  • ROI
  • 곡선을 이용한 검증

즉:

만든 모델이 실제로 쓸 만한가?

를 판단하는 단계입니다.

핵심#

Assess = 모델 성능과 활용 가치 평가

입니다.


17장 정확도는 무엇을 의미하는가#

정확도 Accuracy는 모델이 얼마나 올바르게 예측했는지를 나타내는 대표적인 지표입니다.

예를 들어 100명의 고객을 예측했는데 90명을 올바르게 예측했다면 단순하게는 높은 정확도를 가진 모델이라고 생각할 수 있습니다.

다만 SEMMA 학습에서는 세부 공식보다 Assess 단계에서 모델의 성능을 평가한다는 역할을 먼저 기억하는 것이 중요합니다.


18장 향상도란 무엇인가#

제공된 학습자료에서는 Assess 단계의 평가 요소로 향상도도 제시합니다.

핵심은 모델을 사용했을 때 기존 방식과 비교해 얼마나 더 효과적인 결과를 얻을 수 있는지를 확인하는 관점입니다.

즉 단순히 모델이 예측을 수행한다는 사실보다 실제로 얼마나 개선된 성과를 제공하는가를 보는 것입니다.


19장 ROI는 왜 평가할까#

ROI는 Return on Investment, 즉 투자수익률입니다.

데이터 마이닝 모델이 아무리 기술적으로 훌륭하더라도 구축과 운영에 큰 비용이 들고 실제 비즈니스 가치를 만들어내지 못한다면 활용하기 어려울 수 있습니다.

예를 들어 모델 구축 비용이 매우 큰데 실제 매출 증가 효과가 거의 없다면 투자 대비 효과가 낮을 수 있습니다.

따라서 Assess에서는 기술적인 모델 성능뿐 아니라 실제 활용 가치도 고려할 수 있습니다.


20장 SEMMA 전체 과정을 쇼핑몰 사례로 이해하기#

쇼핑몰에서 고객 이탈 예측 모델을 만든다고 생각해봅시다.

1단계 Sample#

전체 고객 데이터 가운데 분석할 표본을 선택합니다.

그리고 훈련·검증·테스트 데이터로 분할합니다.

2단계 Explore#

데이터를 살펴봅니다.

  • 구매금액 분포
  • 방문 빈도
  • 이상치
  • 변수 사이의 관계

등을 탐색합니다.

3단계 Modify#

모델링에 적합하게 데이터를 정리합니다.

  • 결측치 처리
  • 변수 변환
  • 새로운 변수 생성
  • 변수 선택

을 수행합니다.

4단계 Model#

고객 이탈을 예측하는 모델을 만듭니다.

예를 들어 회귀나 의사결정나무 등의 모델을 구축할 수 있습니다.

5단계 Assess#

모델의 성능과 활용 가능성을 평가합니다.

전체 흐름은 다음과 같습니다.

표본 → 탐색 → 수정 → 모델링 → 평가

입니다.


21장 SEMMA는 왜 비즈니스 이해로 시작하지 않을까#

CRISP-DM과 비교할 때 가장 중요한 차이입니다.

CRISP-DM은 Business Understanding, 즉 비즈니스 이해 단계로 시작합니다.

반면 SEMMA는:

Sample

부터 시작합니다.

따라서 시험에서:

SEMMA는 비즈니스 이해 단계로 시작한다.

라고 나오면 틀린 설명입니다.

시험 핵심#

SEMMA → Sample부터 시작

CRISP-DM → Business Understanding부터 시작

으로 구분합니다.


22장 SEMMA의 이름 자체가 순서다#

SEMMA는 각 단계의 첫 글자를 그대로 연결한 이름입니다.

S

Sample

E

Explore

M

Modify

M

Model

A

Assess

따라서 영어 약어만 기억해도 전체 순서를 복원할 수 있습니다.

쉬운 암기#

S-E-M-M-A

→ 샘플-탐색-수정-모델-평가

입니다.


23장 KDD와 SEMMA의 차이는 무엇인가#

두 방법론 모두 5단계이기 때문에 시험에서 혼동하기 쉽습니다.

KDD 5단계#

  1. Selection
  2. Preprocessing
  3. Transformation
  4. Data Mining
  5. Interpretation / Evaluation

SEMMA 5단계#

  1. Sample
  2. Explore
  3. Modify
  4. Model
  5. Assess

단계 수는 같지만 이름과 강조점은 다릅니다.

제공된 학습자료에서는:

KDD → 학술적, 데이터베이스 기반

SEMMA → SAS 도구 기반, 모델링 중심

으로 구분합니다.


24장 KDD와 SEMMA를 가장 쉽게 구분하면#

KDD는 데이터를 선택하고 정제하여 지식을 발견하는 데이터 마이닝 프로세스에 초점을 둡니다.

SEMMA는 Sample을 시작으로 데이터를 탐색하고 수정한 뒤 모델을 만들고 평가하는 흐름을 강조합니다.

시험에서는 다음 조합이 중요합니다.

KDD

→ Fayyad

→ 학계

→ 5단계

SEMMA

→ SAS Institute

→ 5단계

→ 모델링 중심

입니다.


25장 CRISP-DM이란 무엇인가#

CRISP-DM은 데이터 마이닝과 분석 프로젝트에서 사용하는 대표적인 방법론 가운데 하나입니다.

제공된 학습자료에서는 다음 특징을 강조합니다.

산업 컨소시엄

6단계

산업 표준

반복·순환 가능

그리고 가장 중요한 출발 단계는:

Business Understanding

입니다.

따라서 SEMMA와 비교할 때:

CRISP-DM = 비즈니스 문제 중심

SEMMA = 데이터 탐색·모델링 중심

으로 이해하면 쉽습니다.


26장 KDD·CRISP-DM·SEMMA 3대 방법론 비교#

방법론 개발 주체 단계 수 핵심 특징
KDD 학계 Fayyad 5단계 학술적·데이터베이스 기반
CRISP-DM 산업 컨소시엄 6단계 산업 표준·반복과 순환
SEMMA SAS Institute 5단계 SAS 도구 기반·모델링 중심

ADsP에서는 이 비교표를 그대로 기억해두는 것이 좋습니다.


27장 단계 수로 구분하면#

시험에서는 단계 수를 바꿔 출제할 수 있습니다.

KDD#

5단계

CRISP-DM#

6단계

SEMMA#

5단계

따라서:

5 - 6 - 5

로 기억할 수 있습니다.

순서는:

KDD → CRISP-DM → SEMMA

입니다.

즉:

KDD 5

CRISP-DM 6

SEMMA 5

입니다.


28장 개발 주체로 구분하면#

KDD#

제공된 학습자료에서는 학계 Fayyad와 연결합니다.

CRISP-DM#

산업 컨소시엄

SEMMA#

SAS Institute

따라서 다음처럼 기억하면 됩니다.

KDD → 학계

CRISP-DM → 산업

SEMMA → SAS

입니다.


29장 분석 목적과 특징으로 구분하면#

KDD#

Knowledge Discovery

→ 데이터에서 지식 발견

CRISP-DM#

Business Problem

→ 비즈니스 문제 해결

SEMMA#

Data Exploration & Modeling

→ 데이터 탐색과 모델링

쉽게 줄이면:

KDD = 발견

CRISP-DM = 비즈니스

SEMMA = 모델링

입니다.


30장 KDD와 SEMMA 단계의 차이를 나란히 보면#

KDD SEMMA
Selection Sample
Preprocessing Explore
Transformation Modify
Data Mining Model
Interpretation / Evaluation Assess

두 방법론은 정확히 같은 단계가 1:1로 대응한다고 단순화해서 외우기보다 각 방법론의 고유한 순서를 따로 기억하는 것이 안전합니다.

KDD는:

Selection → Preprocessing → Transformation → Data Mining → Interpretation/Evaluation

SEMMA는:

Sample → Explore → Modify → Model → Assess

입니다.


31장 SEMMA에서 가장 헷갈리는 단계는 Explore와 Modify다#

Explore#

데이터를 살펴보는 단계입니다.

  • 분포
  • 패턴
  • 이상치
  • 기초 통계
  • 시각화

Modify#

데이터를 실제로 수정하는 단계입니다.

  • 변수 변환
  • 변수 생성
  • 변수 선택
  • 결측치 처리
  • 전처리

즉:

Explore = 본다

Modify = 바꾼다

라고 기억하면 매우 쉽습니다.


32장 Model과 Assess를 구분하는 방법#

Model#

모델을 만든다.

Assess#

모델을 평가한다.

따라서:

Model → 구축

Assess → 검증

이라고 연결합니다.

시험에서:

모델의 정확도와 ROI를 평가한다.

라고 나오면:

Assess

입니다.


33장 Sample과 Explore를 구분하는 방법#

Sample#

분석할 데이터를 뽑는다.

Explore#

뽑은 데이터를 살펴본다.

즉 전체 흐름의 첫 두 단계는:

뽑고 → 본다

입니다.

그다음:

바꾸고 → 모델 만들고 → 평가

합니다.

이를 한 문장으로 연결하면:

데이터를 뽑아서 살펴보고, 수정한 뒤 모델을 만들고 평가한다.

가 됩니다.


34장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. SEMMA는 Business Understanding으로 시작한다#

틀립니다.

SEMMA는:

Sample

부터 시작합니다.

Business Understanding은 CRISP-DM과 연결합니다.

함정 2. SEMMA는 6단계 방법론이다#

틀립니다.

SEMMA는 5단계입니다.

함정 3. SEMMA는 SAS Institute가 개발했다#

맞습니다.

SEMMA와 SAS를 반드시 연결합니다.

함정 4. Explore에서 모델을 구축한다#

틀립니다.

모델 구축은:

Model

단계입니다.

함정 5. Modify에서 모델 성능을 평가한다#

틀립니다.

모델 평가는:

Assess

입니다.

함정 6. 결측치 처리는 Explore에서 한다#

제공된 학습자료 기준에서는 결측치 처리를:

Modify

단계와 연결합니다.

함정 7. Assess에서는 표본을 추출한다#

틀립니다.

표본 추출은:

Sample

단계입니다.


35장 SEMMA 5단계 핵심 비교표#

단계 핵심 질문
Sample 어떤 데이터를 뽑을 것인가?
Explore 데이터에는 어떤 특징이 있는가?
Modify 데이터를 어떻게 바꿀 것인가?
Model 어떤 모델을 만들 것인가?
Assess 모델이 얼마나 좋은가?

질문 형태로 외우면 순서를 기억하기 쉽습니다.


36장 시험 직전 30초 암기#

SEMMA#

S = Sample

→ 표본 추출

→ 훈련·검증·테스트 분할

E = Explore

→ 분포·패턴·이상치

→ 통계·시각화

M = Modify

→ 변수 변환·생성·선택

→ 결측치·전처리

M = Model

→ 회귀·의사결정나무·신경망

→ 모델 구축

A = Assess

→ 성능 평가

→ 정확도·향상도·ROI

한 줄 암기#

샘플 → 탐색 → 수정 → 모델 → 평가


37장 3대 방법론 시험 직전 암기#

KDD#

Fayyad

5단계

학술적·데이터베이스 기반

CRISP-DM#

산업 컨소시엄

6단계

산업 표준

반복·순환 가능

SEMMA#

SAS Institute

5단계

SAS 도구 기반

모델링 중심

단계 수 암기:

5 → 6 → 5

입니다.


SEMMA FAQ#

SEMMA란 무엇인가#

SEMMA는 SAS Institute에서 개발한 데이터 마이닝 방법론으로 Sample, Explore, Modify, Model, Assess의 5단계로 구성됩니다.

SEMMA의 5단계는 무엇인가#

순서대로:

  1. Sample
  2. Explore
  3. Modify
  4. Model
  5. Assess

입니다.

SEMMA는 무엇의 약자인가#

각 단계의 첫 글자를 연결한 이름입니다.

Sample · Explore · Modify · Model · Assess

입니다.

Sample 단계에서는 무엇을 하는가#

분석 가능한 크기의 표본을 추출하고 제공된 학습자료에서는 훈련·검증·테스트 데이터 분할도 함께 연결합니다.

Explore 단계에서는 무엇을 하는가#

데이터 분포, 패턴, 이상치를 탐색하고 기초 통계와 시각화를 통해 데이터를 이해합니다.

Modify 단계에서는 무엇을 하는가#

변수 변환·생성·선택, 결측치 처리, 데이터 전처리 등을 수행합니다.

Model 단계에서는 무엇을 하는가#

회귀, 의사결정나무, 신경망 등의 기법을 이용해 분석 모델을 구축합니다.

Assess 단계에서는 무엇을 하는가#

모델의 성능을 평가합니다. 제공된 학습자료에서는 정확도, 향상도, ROI 등을 평가 요소로 제시합니다.

SEMMA는 Business Understanding으로 시작하는가#

아닙니다.

SEMMA는 Sample부터 시작합니다.

Business Understanding은 CRISP-DM의 시작 단계와 연결합니다.

SEMMA는 몇 단계인가#

5단계입니다.

SEMMA는 누가 개발했는가#

SAS Institute가 개발한 데이터 마이닝 방법론입니다.

KDD와 SEMMA의 단계 수는 같은가#

둘 다 5단계입니다.

다만 단계명과 강조점은 다릅니다.

CRISP-DM은 몇 단계인가#

제공된 학습자료 기준 6단계입니다.

KDD·CRISP-DM·SEMMA를 가장 쉽게 구분하는 방법은 무엇인가#

KDD → 학계·5단계

CRISP-DM → 산업 표준·6단계

SEMMA → SAS·5단계

로 기억하면 쉽습니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. SEMMA의 개발 주체를 말할 수 있는가?
  2. SEMMA의 5단계를 순서대로 말할 수 있는가?
  3. Sample 단계의 역할을 설명할 수 있는가?
  4. Explore에서 어떤 작업을 하는지 알고 있는가?
  5. Modify에서 결측치와 변수를 처리한다는 것을 알고 있는가?
  6. Model 단계에서 실제 분석 모델을 구축한다는 것을 알고 있는가?
  7. Assess가 모델 성능 평가 단계라는 것을 알고 있는가?
  8. Explore와 Modify를 구분할 수 있는가?
  9. Model과 Assess를 구분할 수 있는가?
  10. SEMMA가 Business Understanding으로 시작하지 않는다는 것을 알고 있는가?
  11. KDD와 SEMMA가 모두 5단계라는 것을 기억하고 있는가?
  12. CRISP-DM이 6단계라는 것을 알고 있는가?
  13. KDD·CRISP-DM·SEMMA의 개발 주체를 구분할 수 있는가?
  14. 세 방법론의 특징을 각각 한 문장으로 설명할 수 있는가?

이 글을 마치며#

SEMMA는 이름 자체에 전체 프로세스가 들어 있습니다.

Sample

→ 데이터를 뽑고

Explore

→ 데이터를 살펴보고

Modify

→ 데이터를 수정하고

Model

→ 모델을 만들고

Assess

→ 모델을 평가합니다.

따라서 가장 쉬운 암기 문장은 다음과 같습니다.

뽑고 → 보고 → 바꾸고 → 만들고 → 평가한다.

ADsP 시험에서는 특히 다음 세 가지를 확실하게 기억하면 됩니다.

첫째:

SEMMA = SAS Institute

둘째:

SEMMA = 5단계

셋째:

Business Understanding으로 시작하지 않고 Sample부터 시작

합니다.

마지막으로 3대 방법론은 다음처럼 정리할 수 있습니다.

KDD = 학계·5단계·지식 발견

CRISP-DM = 산업·6단계·비즈니스 문제 해결

SEMMA = SAS·5단계·탐색과 모델링

시험 직전에는 다음 두 줄만 기억해도 핵심을 빠르게 복원할 수 있습니다.

SEMMA = S-E-M-M-A

Sample → Explore → Modify → Model → Assess

이 페이지의 목차