KDD란? 데이터 마이닝 5단계와 Selection·Preprocessing·Transformation 차이 쉽게 이해하기

1장 KDD란 무엇인가#

KDD는 Knowledge Discovery in Databases의 약자입니다.

한국어로 풀면 데이터베이스에 저장된 데이터에서 유용한 지식과 패턴을 발견하는 과정이라고 이해할 수 있습니다.

데이터가 많이 있다고 해서 자동으로 의미 있는 정보가 만들어지는 것은 아닙니다.

예를 들어 쇼핑몰에 다음 데이터가 있다고 생각해봅시다.

  • 고객 정보
  • 구매 이력
  • 상품 정보
  • 접속 기록
  • 이벤트 참여 기록

이 데이터를 그대로 바라본다고 해서 바로:

어떤 고객이 다시 구매할 가능성이 높은가?

어떤 상품이 함께 팔리는가?

같은 지식을 얻을 수 있는 것은 아닙니다.

먼저 필요한 데이터를 선택하고, 데이터를 정리하고, 분석하기 좋은 형태로 바꾼 뒤, 데이터 마이닝 기법을 적용하고, 마지막으로 결과를 해석해야 합니다.

이 전체 과정을 단계적으로 정리한 것이 KDD 프로세스입니다.


2장 KDD 5단계 전체 흐름#

KDD는 다음 5단계로 구성됩니다.

  1. Selection
  2. Preprocessing
  3. Transformation
  4. Data Mining
  5. Interpretation / Evaluation

한글로 정리하면:

  1. 데이터 선택
  2. 전처리
  3. 변환
  4. 데이터 마이닝
  5. 해석·평가

입니다.

시험에서는 무엇보다 순서와 각 단계의 역할을 정확하게 구분하는 것이 중요합니다.


3장 KDD 5단계 한눈에 보기#

단계 한글 핵심 내용
Selection 데이터 선택 분석할 데이터셋 선택
Preprocessing 전처리 잡음·이상값·결측치 정제
Transformation 변환 변수 선택·차원 축소
Data Mining 데이터 마이닝 분석기법 적용·패턴 발견
Interpretation / Evaluation 해석·평가 결과 해석·평가

시험 직전에는 다음처럼 압축해서 기억하면 좋습니다.

선택 → 정제 → 변환 → 분석 → 평가


4장 Selection 데이터 선택이란 무엇인가#

Selection은 KDD의 첫 번째 단계입니다.

핵심은 분석에 사용할 데이터셋을 선택하는 것입니다.

예를 들어 회사에 다음과 같은 데이터가 있다고 하겠습니다.

  • 회원 데이터
  • 구매 데이터
  • 배송 데이터
  • 고객센터 데이터
  • 인사 데이터
  • 재무 데이터

그런데 분석 목적이:

고객 이탈 가능성을 분석한다.

라면 모든 데이터를 다 사용할 필요는 없습니다.

고객 이탈과 관련된 데이터를 중심으로 분석 대상 데이터셋을 구성할 수 있습니다.

예를 들어:

  • 회원 데이터
  • 구매 데이터
  • 접속 기록
  • 고객센터 문의 기록

등을 선택할 수 있습니다.

이것이 Selection입니다.

핵심#

Selection = 분석할 데이터셋 선택

입니다.


5장 Selection에서 가장 많이 틀리는 함정#

ADsP에서 매우 중요한 부분입니다.

다음 문장은 틀립니다.

KDD의 Selection 단계에서는 변수를 선택한다.

Selection의 핵심은 데이터셋 선택입니다.

변수 선택은 뒤에 나오는 Transformation 단계와 연결합니다.

따라서:

Selection → 데이터셋 선택

Transformation → 변수 선택

으로 반드시 구분해야 합니다.


6장 데이터셋 선택과 변수 선택은 무엇이 다른가#

둘을 같은 것으로 생각하기 쉽습니다.

하지만 범위가 다릅니다.

예를 들어 회사에 다음 세 개의 데이터셋이 있다고 하겠습니다.

고객 데이터#

  • 고객ID
  • 나이
  • 성별
  • 지역

구매 데이터#

  • 고객ID
  • 상품
  • 금액
  • 구매일자

배송 데이터#

  • 주문ID
  • 배송지역
  • 배송상태

여기서:

고객 데이터와 구매 데이터를 분석에 사용한다.

라고 결정하면 데이터셋 선택입니다.

반면 고객 데이터 안에서:

  • 고객ID
  • 나이
  • 지역

만 사용하고 성별은 제외한다고 결정하면 변수 선택입니다.

즉:

어떤 데이터 묶음을 사용할 것인가 → Selection

그 안에서 어떤 속성을 사용할 것인가 → Transformation

입니다.


7장 Preprocessing 전처리란 무엇인가#

Preprocessing은 선택된 데이터에서 분석에 방해가 되는 문제를 찾아 정리하는 단계입니다.

대표적으로 다음 문제를 처리합니다.

  • 잡음 Noise
  • 이상값 Outlier
  • 결측치 Missing Value
  • 잘못된 값

예를 들어 고객 나이에 다음 값이 있다고 하겠습니다.

고객 나이
A 25
B 31
C 999
D NULL

여기서:

  • 999 → 이상값 가능성
  • NULL → 결측치

입니다.

이 데이터를 그대로 분석하면 결과가 왜곡될 수 있습니다.

그래서 Preprocessing 단계에서 데이터를 확인하고 정제합니다.

핵심#

Preprocessing = 데이터 정리와 정제

입니다.


8장 잡음 Noise이란 무엇인가#

잡음은 분석에 필요하지 않거나 데이터의 실제 의미를 흐리는 불필요한 정보입니다.

예를 들어 Sensor가 순간적으로 오류를 일으켜 다음과 같은 값이 발생했다고 생각해봅시다.

정상 온도:

24℃
25℃
24℃
25℃

그런데 갑자기:

999℃

가 기록되었습니다.

실제 온도가 아니라 장비 오류라면 분석에서 정제해야 할 수 있습니다.

이런 데이터를 Noise와 연결해 이해할 수 있습니다.


9장 결측치란 무엇인가#

결측치는 값이 비어 있는 상태입니다.

예:

고객ID 나이 지역
101 25 서울
102 NULL 부산
103 35 NULL

나이나 지역 데이터가 존재하지 않는 경우입니다.

분석에 따라 결측치를:

  • 삭제하거나
  • 다른 값으로 대체하거나
  • 별도 범주로 처리

할 수 있습니다.

KDD에서는 이러한 데이터 정리가 Preprocessing 단계에 해당합니다.


10장 이상값 Outlier이란 무엇인가#

이상값은 다른 데이터와 비교했을 때 매우 크거나 작은 값입니다.

예를 들어 일반적인 고객 나이가:

20세 ~ 80세

범위인데:

350세

라는 값이 있다면 입력 오류 가능성이 높습니다.

다만 모든 이상값이 오류인 것은 아닙니다.

실제로 드물게 발생한 중요한 값일 수도 있기 때문에 분석 목적에 따라 판단해야 합니다.

KDD 학습에서는 우선:

이상값을 식별하고 정제하는 단계 = Preprocessing

으로 기억하면 됩니다.


11장 Transformation 변환이란 무엇인가#

Transformation은 전처리된 데이터를 분석에 적합한 형태로 변환하는 단계입니다.

제공된 ADsP 학습자료에서는 특히:

  • 변수 선택
  • 데이터 차원 축소

를 핵심으로 설명합니다.

즉 데이터는 정리됐지만 모든 변수를 그대로 분석에 사용할 필요는 없습니다.

필요한 변수만 선택하거나 데이터의 차원을 줄여 분석하기 좋은 형태로 변경합니다.

핵심#

Transformation = 변수 선택 + 차원 축소

입니다.


12장 변수 선택은 왜 Transformation인가#

예를 들어 고객 데이터에 100개의 변수가 있다고 하겠습니다.

하지만 고객 이탈 분석에 실제로 필요한 것은:

  • 최근 구매일
  • 구매 횟수
  • 접속 횟수
  • 고객센터 문의 횟수
  • 평균 구매금액

정도일 수 있습니다.

분석 목적과 관련 없는 변수까지 모두 사용하면:

  • 계산량 증가
  • 모델 복잡도 증가
  • 불필요한 정보 증가

문제가 생길 수 있습니다.

따라서 필요한 변수를 선택합니다.

이 작업이 Transformation 단계와 연결됩니다.


13장 차원 축소란 무엇인가#

데이터의 변수 수가 너무 많으면 분석이 복잡해질 수 있습니다.

예를 들어 변수 1,000개가 존재한다고 생각해봅시다.

이 가운데 핵심적인 정보만 남기거나 여러 변수를 더 적은 수의 새로운 변수로 표현할 수 있습니다.

이러한 과정을 차원 축소 Dimensionality Reduction와 연결해 이해할 수 있습니다.

ADsP에서는 세부 알고리즘보다:

Transformation → 변수 선택 또는 차원 축소

라는 연결을 기억하는 것이 중요합니다.


14장 Preprocessing과 Transformation 차이#

시험에서 두 단계가 자주 혼동됩니다.

Preprocessing#

문제가 있는 데이터를 정리합니다.

  • 잡음 제거
  • 이상값 처리
  • 결측치 처리

즉:

데이터를 깨끗하게 만드는 단계

입니다.

Transformation#

깨끗해진 데이터를 분석하기 적합하게 바꿉니다.

  • 변수 선택
  • 차원 축소

즉:

분석하기 좋은 형태로 바꾸는 단계

입니다.

한 줄로 기억하면:

Preprocessing = 정제

Transformation = 변환

입니다.


15장 Data Mining 데이터 마이닝 단계란 무엇인가#

네 번째 단계는 Data Mining입니다.

이 단계에서는 분석 목적에 맞는 기법을 선택하여 데이터에서 패턴이나 규칙을 발견합니다.

예를 들어:

  • 어떤 고객이 이탈할 가능성이 높은가?
  • 어떤 상품이 함께 구매되는가?
  • 고객은 어떤 유형으로 나눌 수 있는가?
  • 어떤 변수가 매출과 관련이 있는가?

같은 문제를 분석합니다.

이 단계에서 실제 데이터 분석이 본격적으로 수행됩니다.

핵심#

Data Mining = 분석기법 적용 + 패턴 발견

입니다.


16장 데이터 마이닝 단계에서는 무엇을 하는가#

문제에 따라 다양한 분석기법을 선택할 수 있습니다.

예를 들어:

분류#

고객을:

  • 이탈 가능
  • 이탈 가능성 낮음

으로 구분할 수 있습니다.

군집#

비슷한 고객들을 여러 그룹으로 나눌 수 있습니다.

연관규칙#

어떤 상품이 함께 구매되는지 찾을 수 있습니다.

예측#

미래 매출이나 고객 행동을 예측할 수 있습니다.

중요한 것은 특정 기법 자체보다:

분석 목적에 맞는 기법을 선택해 의미 있는 패턴을 찾는다

는 점입니다.


17장 Interpretation / Evaluation 해석·평가란 무엇인가#

마지막 단계는 Interpretation / Evaluation입니다.

데이터 마이닝 결과가 나왔다고 분석이 자동으로 끝나는 것은 아닙니다.

결과가 실제로 의미 있는지 확인해야 합니다.

다음 질문을 생각할 수 있습니다.

  • 분석 결과가 목적에 맞는가?
  • 발견한 패턴은 의미가 있는가?
  • 결과를 실제 업무에 사용할 수 있는가?
  • 분석 결과를 신뢰할 수 있는가?

즉 결과를 해석하고 평가하는 단계입니다.

핵심#

Interpretation / Evaluation = 결과 해석 + 평가 + 목적과의 일치성 확인

입니다.


18장 결과가 좋다고 무조건 사용할 수 있는 것은 아니다#

예를 들어 고객 이탈 예측 모델의 성능이 높게 나왔다고 생각해봅시다.

하지만 실제 비즈니스에서는:

  • 어떤 고객에게 대응해야 하는지
  • 결과를 실제 마케팅에 사용할 수 있는지
  • 분석 목적과 맞는지

확인해야 합니다.

따라서 KDD의 마지막 단계는 단순히:

정확도가 높다.

로 끝나는 것이 아니라:

이 결과가 실제 분석 목적에 부합하는가?

까지 확인합니다.


19장 KDD 전체 과정을 쇼핑몰 사례로 이해하기#

온라인 쇼핑몰에서 고객 이탈을 분석한다고 가정해봅시다.

1단계 Selection#

분석할 데이터셋을 선택합니다.

  • 고객 데이터
  • 구매 데이터
  • 접속 데이터

2단계 Preprocessing#

데이터를 정제합니다.

  • 결측치 처리
  • 잘못된 값 제거
  • 이상값 확인

3단계 Transformation#

분석에 필요한 변수만 선택합니다.

  • 최근 구매일
  • 방문 횟수
  • 평균 구매금액

4단계 Data Mining#

이탈 고객의 패턴을 분석합니다.

5단계 Interpretation / Evaluation#

결과가 실제 고객 이탈 문제를 설명하는지 평가합니다.

전체 흐름은:

선택 → 정제 → 변환 → 분석 → 평가

입니다.


20장 KDD 단계 순서를 왜 정확히 외워야 할까#

ADsP에서는 순서를 바꿔 출제할 수 있습니다.

정확한 순서는:

Selection

→ Preprocessing

→ Transformation

→ Data Mining

→ Interpretation / Evaluation

입니다.

예를 들어:

Transformation → Selection → Data Mining

처럼 나오면 틀립니다.

분석할 데이터를 먼저 선택한 뒤 정제하고 변환하는 것이 자연스러운 흐름입니다.


21장 KDD 순서를 쉽게 외우는 방법#

각 단계의 첫 의미를 연결합니다.

선택한다.

↓

정리한다.

↓

바꾼다.

↓

분석한다.

↓

해석한다.

즉:

선 → 전 → 변 → 마 → 해

처럼 줄여서 기억할 수 있습니다.

조금 더 자연스럽게:

데이터를 선택해서 깨끗하게 만들고, 분석하기 좋게 바꾼 다음, 패턴을 찾고 결과를 평가한다.

라고 문장으로 이해하면 순서를 잊기 어렵습니다.


22장 Selection과 Transformation을 반드시 구분해야 한다#

KDD에서 가장 많이 헷갈리는 부분입니다.

Selection#

데이터셋 선택

예:

고객 데이터와 주문 데이터를 사용할 것인지 결정

Transformation#

변수 선택

예:

고객 데이터의 나이·지역·구매금액 중 실제 분석에 사용할 변수를 결정

따라서:

Dataset → Selection

Variable → Transformation

이라고 기억하면 좋습니다.


23장 ADsP에서 자주 나오는 함정 1#

KDD의 Selection 단계에서는 분석에 사용할 변수를 선택한다.

틀립니다.

Selection은:

데이터셋 선택

입니다.

변수 선택은:

Transformation

입니다.


24장 ADsP에서 자주 나오는 함정 2#

결측치와 이상값을 처리하는 단계는 Transformation이다.

틀립니다.

결측치·이상값·잡음 처리와 가장 먼저 연결해야 하는 단계는:

Preprocessing

입니다.


25장 ADsP에서 자주 나오는 함정 3#

분석기법을 적용하여 패턴을 발견하는 단계는 Preprocessing이다.

틀립니다.

이는:

Data Mining

단계입니다.


26장 ADsP에서 자주 나오는 함정 4#

KDD에서 분석 결과를 평가하는 단계가 없다.

틀립니다.

마지막 단계가:

Interpretation / Evaluation

입니다.

결과를 해석하고 분석 목적과 일치하는지 평가합니다.


27장 KDD와 CRISP-DM의 차이#

제공된 ADsP 학습자료에서는 두 방법론을 다음과 같이 구분합니다.

KDD#

데이터 마이닝 프로세스 중심

학술적 접근

CRISP-DM#

비즈니스 문제 해결 중심

산업 표준

즉 KDD는 데이터를 통해 지식을 발견하는 과정 자체에 초점을 두고, CRISP-DM은 실제 비즈니스 문제를 해결하기 위한 분석 프로젝트 과정에 더 초점을 둔다고 이해하면 좋습니다.


28장 KDD와 SEMMA의 차이#

제공된 학습자료에서는 SEMMA를 다음과 같이 정리합니다.

SAS Institute 제안

데이터 탐색·모델링 중심

따라서 세 방법론을 매우 간단하게 구분하면 다음과 같습니다.

방법론 핵심 특징
KDD 데이터 마이닝 프로세스 중심
CRISP-DM 비즈니스 문제 해결 중심
SEMMA 데이터 탐색·모델링 중심

29장 KDD·CRISP-DM·SEMMA를 한 줄로 구분하기#

시험 직전에는 다음처럼 외우면 쉽습니다.

KDD → 지식 발견

CRISP-DM → 비즈니스 문제 해결

SEMMA → SAS·탐색·모델링

입니다.

각 방법론의 세부 단계는 따로 공부해야 하지만 먼저 이 성격을 구분해두면 문제 풀이가 쉬워집니다.


30장 KDD 5단계 핵심 비교표#

단계 핵심 질문
Selection 어떤 데이터셋을 사용할 것인가?
Preprocessing 데이터에 오류·결측·잡음이 있는가?
Transformation 어떤 변수와 형태로 분석할 것인가?
Data Mining 어떤 패턴을 찾을 것인가?
Interpretation / Evaluation 결과가 의미 있고 목적에 맞는가?

이 다섯 질문으로 각 단계를 구분할 수 있습니다.


31장 시험 문제를 푸는 방법#

문제에 특정 작업이 나오면 먼저 어떤 종류의 작업인지 판단합니다.

데이터셋을 고른다#

→ Selection

결측값을 정리한다#

→ Preprocessing

변수를 선택한다#

→ Transformation

분석 알고리즘을 적용한다#

→ Data Mining

결과가 목적과 일치하는지 확인한다#

→ Interpretation / Evaluation

이 다섯 가지 대응관계를 바로 떠올릴 수 있어야 합니다.


32장 시험 직전 30초 암기#

1. Selection

→ 데이터셋 선택

2. Preprocessing

→ 결측·잡음·이상값 정제

3. Transformation

→ 변수 선택·차원 축소

4. Data Mining

→ 분석기법 적용·패턴 발견

5. Interpretation / Evaluation

→ 결과 해석·평가

가장 중요한 함정:

Selection = 변수 선택 X

Transformation = 변수 선택 O

입니다.


KDD FAQ#

KDD란 무엇인가#

KDD는 Knowledge Discovery in Databases의 약자로 데이터에서 의미 있는 패턴과 지식을 발견하기 위한 일련의 프로세스입니다.

KDD는 몇 단계인가#

총 5단계입니다.

  1. Selection
  2. Preprocessing
  3. Transformation
  4. Data Mining
  5. Interpretation / Evaluation

Selection에서는 무엇을 하는가#

분석에 사용할 데이터셋을 선택하고 목표 데이터를 구성합니다.

변수 선택은 Selection에서 하는가#

아닙니다.

제공된 ADsP 학습자료에서는 변수 선택을 Transformation 단계와 연결합니다.

Preprocessing에서는 무엇을 하는가#

잡음, 이상값, 결측치 등을 식별하고 제거하거나 정제합니다.

Transformation에서는 무엇을 하는가#

변수 선택 또는 데이터 차원 축소를 수행하여 분석하기 좋은 형태로 데이터를 변환합니다.

Data Mining에서는 무엇을 하는가#

분석 목적에 맞는 기법을 선택해 데이터를 분석하고 패턴을 발견합니다.

Interpretation / Evaluation에서는 무엇을 하는가#

분석 결과를 해석하고 평가하며 분석 목적과 결과가 일치하는지 확인합니다.

KDD와 CRISP-DM의 차이는 무엇인가#

제공된 학습자료에서는 KDD를 데이터 마이닝 프로세스 중심의 학술적 접근으로, CRISP-DM을 비즈니스 문제 해결 중심의 산업 표준 방법론으로 구분합니다.

SEMMA는 무엇인가#

제공된 학습자료에서는 SAS Institute가 제안한 데이터 탐색·모델링 중심의 방법론으로 정리합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. KDD의 전체 영어 명칭을 말할 수 있는가?
  2. KDD의 5단계를 순서대로 말할 수 있는가?
  3. Selection이 데이터셋 선택이라는 것을 알고 있는가?
  4. 변수 선택이 Transformation이라는 것을 알고 있는가?
  5. 결측치·잡음·이상값 처리가 어느 단계인지 말할 수 있는가?
  6. 차원 축소가 어느 단계인지 말할 수 있는가?
  7. 분석기법을 적용하는 단계가 무엇인지 알고 있는가?
  8. 결과를 해석하고 평가하는 단계가 무엇인지 알고 있는가?
  9. Selection과 Transformation을 구분할 수 있는가?
  10. Preprocessing과 Transformation의 차이를 설명할 수 있는가?
  11. KDD와 CRISP-DM의 중심 차이를 설명할 수 있는가?
  12. SEMMA가 SAS Institute와 연결된다는 것을 기억하고 있는가?

이 글을 마치며#

KDD 5단계는 이름을 따로 외우기보다 데이터가 분석 가능한 지식으로 바뀌는 과정으로 이해하면 쉽습니다.

처음에는 분석할 데이터를 선택합니다.

Selection

그다음 데이터의 문제를 정리합니다.

Preprocessing

분석하기 좋은 형태로 바꿉니다.

Transformation

실제 분석기법을 적용하여 패턴을 찾습니다.

Data Mining

마지막으로 결과를 해석하고 평가합니다.

Interpretation / Evaluation

전체 흐름을 한 줄로 정리하면:

데이터셋 선택 → 데이터 정제 → 변수·형태 변환 → 패턴 발견 → 결과 평가

입니다.

ADsP 시험에서는 특히 다음 두 개를 반드시 구분해야 합니다.

Selection = 데이터셋 선택

Transformation = 변수 선택

마지막으로 순서는 다음처럼 기억하면 됩니다.

Selection → Preprocessing → Transformation → Data Mining → Interpretation/Evaluation

이 페이지의 목차