데이터 전처리란? 정규화·표준화·결측값 처리·이상치 탐지 쉽게 이해하기

1장 데이터 전처리란 무엇인가#

데이터 분석에서는 좋은 알고리즘만큼 데이터를 어떤 상태로 준비했는가가 중요합니다.

현실의 데이터에는 다음과 같은 문제가 자주 존재합니다.

  • 변수마다 숫자 범위가 크게 다름
  • 일부 값이 비어 있음
  • 지나치게 크거나 작은 이상값이 존재함
  • 변수의 단위가 서로 다름

예를 들어 고객 데이터에:

나이 → 20~70

연봉 → 3,000~100,000

만족도 → 1~5

처럼 서로 다른 범위의 값이 들어 있을 수 있습니다.

이 데이터를 그대로 분석하면 특정 변수의 숫자 크기가 지나치게 큰 영향을 줄 수 있습니다.

이러한 문제를 분석하기 좋은 형태로 정리하는 과정이 데이터 전처리 Data Preprocessing입니다.


2장 ADsP에서 알아야 할 전처리 핵심#

제공된 학습자료에서는 크게 다음 내용을 다룹니다.

  • 정규화 Normalization
  • 표준화 Standardization
  • 결측값 처리
  • 이상치 탐지

특히 정규화와 표준화는 이름이 비슷하기 때문에 공식과 결과를 정확하게 구분해야 합니다.

가장 먼저 기억하면:

정규화 = 0~1

표준화 = 평균 0, 표준편차 1

입니다.


3장 정규화 Normalization이란 무엇인가#

정규화는 데이터의 값을 일정한 범위로 바꾸는 방법입니다.

제공된 학습자료에서는 Min-Max Scaling을 정규화 방법으로 제시합니다.

데이터를:

0에서 1 사이

의 값으로 변환합니다.

공식은 다음과 같습니다.

X_norm = (X - X_min) / (X_max - X_min)

핵심#

Normalization = Min-Max = 0~1

입니다.


4장 정규화를 쉽게 이해하면#

시험점수가 다음처럼 있다고 하겠습니다.

최솟값:

50

최댓값:

100

어떤 학생의 점수가:

75

라면 Min-Max 정규화를 적용할 수 있습니다.

(75 - 50) / (100 - 50)

= 25 / 50

= 0.5

입니다.

원래 75점이었던 값이 0과 1 사이의 0.5로 변환됩니다.


5장 Min-Max 공식에서 각 값의 의미#

공식은:

(X - X_min) / (X_max - X_min)

입니다.

여기서:

X → 변환할 현재 값

X_min → 해당 변수의 최솟값

X_max → 해당 변수의 최댓값

입니다.

최솟값은 0에 가까워지고 최댓값은 1에 가까워집니다.

그래서 전체 데이터가 0~1 범위로 맞춰집니다.


6장 정규화는 왜 사용하는가#

변수마다 숫자의 크기가 다르면 분석 결과가 특정 변수의 범위에 지나치게 영향을 받을 수 있습니다.

예를 들어:

나이 → 20~70

이미지 픽셀값 → 0~255

소득 → 2,000~100,000

처럼 값의 범위가 다를 수 있습니다.

Min-Max 정규화를 사용하면 서로 다른 범위를 0~1로 맞출 수 있습니다.

제공된 학습자료에서는 정규화를 다음과 같은 활용과 연결합니다.

  • 신경망
  • 이미지

7장 정규화의 이상치 영향#

제공된 학습자료에서는 Min-Max 정규화가 이상치의 영향을 크게 받는다고 설명합니다.

왜 그럴까요?

Min-Max 공식에는:

최솟값

과:

최댓값

이 직접 들어갑니다.

따라서 극단적으로 큰 값 하나가 있으면 전체 범위가 크게 늘어날 수 있습니다.


8장 이상치가 Min-Max에 미치는 영향#

정상적인 데이터가:

10, 20, 30, 40, 50

이라고 하겠습니다.

그런데 이상치:

1000

이 하나 추가되면 최댓값이 50에서 1000으로 크게 바뀝니다.

Min-Max 정규화는 이 최댓값을 기준으로 계산하기 때문에 기존 데이터들이 0에 가까운 좁은 범위에 몰릴 수 있습니다.

따라서:

Min-Max = 이상치 영향 큼

이라고 기억합니다.


9장 표준화 Standardization이란 무엇인가#

표준화는 데이터를 평균 0, 표준편차 1을 기준으로 변환하는 방법입니다.

제공된 학습자료에서는 이를 Z-score 표준화로 설명합니다.

공식은:

X_std = (X - mean) / std

입니다.

즉 현재 값에서 평균을 빼고 표준편차로 나눕니다.

핵심#

Standardization = Z-score = 평균 0, 표준편차 1

입니다.


10장 표준화를 쉽게 이해하면#

어떤 시험의:

평균 = 70점

표준편차 = 10점

이라고 하겠습니다.

학생 A가:

80점

을 받았다면 표준화 값은:

(80 - 70) / 10

= 1

입니다.

즉 평균보다 표준편차 1개만큼 높은 위치라는 의미입니다.

앞서 학습한 Z-score와 같은 원리입니다.


11장 표준화 결과의 범위#

정규화는 결과가:

0~1

이라는 명확한 범위를 가집니다.

반면 표준화는 제공된 학습자료에서:

범위 제한 없음

으로 설명합니다.

표준화 후에는:

  • -2
  • -1
  • 0
  • 1
  • 2

등 다양한 값이 나올 수 있습니다.

따라서:

Normalization = 범위 있음

Standardization = 범위 제한 없음

으로 구분합니다.


12장 정규화와 표준화의 핵심 차이#

구분 정규화 Min-Max 표준화 Z-score
결과 0~1 평균 0, 표준편차 1
범위 0~1 제한 없음
이상치 영향 큼 상대적으로 작음
제공된 활용 예 신경망, 이미지 PCA, 회귀, SVM

시험에서 가장 중요한 것은 결과 형태입니다.

정규화 = 0~1

표준화 = μ 0, σ 1

입니다.


13장 정규화와 표준화를 혼동하지 않는 방법#

정규화 Normalization에서:

Min-Max

라는 표현이 보이면:

최솟값과 최댓값 사이로 맞춘다고 생각합니다.

따라서:

0~1

입니다.

표준화 Standardization에서:

Z-score

라는 표현이 보이면:

평균과 표준편차를 생각합니다.

따라서:

평균 0, 표준편차 1

입니다.

한 줄로:

Min-Max는 범위, Z-score는 평균과 표준편차

입니다.


14장 PCA는 정규화와 표준화 중 무엇과 연결되는가#

제공된 학습자료에서는 PCA의 사용 경우로 표준화를 제시합니다.

즉:

Standardization → PCA

로 연결합니다.

특히 여러 변수의 단위와 크기가 다를 경우 변수 스케일을 맞추는 것이 중요할 수 있습니다.

ADsP에서는 우선 학습자료 기준:

PCA = 표준화

연결을 기억하면 됩니다.


15장 SVM은 무엇과 연결되는가#

제공된 학습자료에서는 표준화 사용 사례에:

SVM

을 포함합니다.

SVM은 변수의 값 범위에 영향을 받을 수 있으므로 스케일을 조정하는 것이 중요합니다.

따라서:

Standardization → SVM

으로 연결합니다.


16장 회귀분석은 무엇과 연결되는가#

제공된 학습자료에서는 표준화 사용 사례에:

회귀

도 포함합니다.

즉 변수마다 단위나 숫자 범위가 크게 다른 경우 Z-score 형태로 표준화하여 분석할 수 있습니다.

시험에서는 우선:

표준화 = PCA·회귀·SVM

으로 묶어 기억할 수 있습니다.


17장 정규화는 어디에 사용하는가#

제공된 학습자료에서는 Min-Max 정규화를:

  • 신경망
  • 이미지

와 연결합니다.

따라서 시험 직전에는:

Min-Max → 신경망·이미지

Z-score → PCA·회귀·SVM

이라고 구분할 수 있습니다.


18장 결측값 Missing Value이란 무엇인가#

결측값은 원래 값이 있어야 하지만 데이터가 비어 있는 상태입니다.

R에서는 앞서 NA로 표현하는 방법을 살펴봤습니다.

예를 들어 고객 데이터에서:

고객 나이 소득
A 35 5000
B 42 결측
C 결측 4200

처럼 일부 값이 빠질 수 있습니다.

결측값을 그대로 두면 분석이나 모델 학습에 문제가 발생할 수 있으므로 적절한 처리 방법을 선택해야 합니다.


19장 결측값 처리 방법 1: 리스트 삭제#

제공된 학습자료에서는 첫 번째 방법으로 리스트 삭제를 제시합니다.

결측값이 있는 행 자체를 삭제하는 방식입니다.

예를 들어:

A → 정상

B → 소득 결측

C → 정상

이라면 B 행을 통째로 제거할 수 있습니다.

장점#

간단합니다.

주의점#

결측 데이터가 많다면 많은 정보를 잃을 수 있습니다.

핵심#

리스트 삭제 = 결측 행 전체 삭제

입니다.


20장 결측값 처리 방법 2: 평균 대체#

결측값을 해당 변수의 평균값으로 바꾸는 방법입니다.

예를 들어 시험점수가:

80, 70, 결측, 90

이라고 하겠습니다.

알려진 값들의 평균이 80이라면 결측값을 80으로 대체할 수 있습니다.

핵심#

평균 대체 = Missing → Mean

입니다.


21장 결측값 처리 방법 3: 중앙값 대체#

평균 대신 중앙값 Median을 이용할 수도 있습니다.

제공된 학습자료에서는:

평균/중앙값 대체

를 하나의 방법으로 제시합니다.

극단적으로 크거나 작은 값이 존재하는 데이터에서는 평균보다 중앙값을 고려할 수 있습니다.

시험에서는 우선:

결측값 → 평균 또는 중앙값 대체 가능

이라고 기억하면 됩니다.


22장 결측값 처리 방법 4: 보간법#

보간법 Interpolation은 주변 데이터를 이용하여 빠진 값을 추정하는 방법입니다.

특히 순서가 있는 데이터나 시계열에서 생각하기 쉽습니다.

예를 들어:

10

20

결측

40

50

이라는 데이터가 있다면 주변 값의 흐름을 보고 결측값을 추정할 수 있습니다.

핵심#

보간법 = 주변 값으로 추정

입니다.


23장 결측값 처리 방법 5: 예측 모델#

다른 변수들을 이용하여 결측값 자체를 예측하는 모델을 만들 수도 있습니다.

예를 들어 소득이 비어 있지만:

  • 나이
  • 직업
  • 경력
  • 학력

등 다른 데이터가 있다면 이를 이용해 결측된 소득값을 추정할 수 있습니다.

제공된 학습자료에서는 이를:

다른 변수로 결측값 예측

이라고 설명합니다.


24장 결측값 처리 방법 비교#

방법 설명
리스트 삭제 결측값이 있는 행 전체 삭제
평균 대체 평균으로 결측값 대체
중앙값 대체 중앙값으로 결측값 대체
보간법 주변 값을 이용해 추정
예측 모델 다른 변수를 사용하여 예측

어떤 방법이 무조건 가장 좋은 것은 아니며 데이터 특성에 따라 방법을 선택합니다.

ADsP에서는 각 방법의 개념을 구분하는 것이 중요합니다.


25장 이상치 Outlier란 무엇인가#

이상치는 전체 데이터의 일반적인 패턴과 비교해 지나치게 크거나 작은 값입니다.

예를 들어 사람들의 키가:

165

170

172

174

168

350

이라고 한다면 350은 일반적인 사람의 키 범위를 크게 벗어납니다.

이런 값은:

  • 입력 오류
  • 측정 오류
  • 실제로 매우 특이한 사례

등 다양한 이유로 발생할 수 있습니다.

따라서 이상치라고 해서 무조건 삭제하는 것이 아니라 먼저 탐지해야 합니다.


26장 이상치 탐지 방법 1: IQR#

IQR은 Interquartile Range, 사분위 범위입니다.

제공된 학습자료에서는 다음 범위를 벗어나는 값을 이상치로 판단합니다.

하한:

Q1 - 1.5 × IQR

상한:

Q3 + 1.5 × IQR

즉:

하한보다 작은 값

또는:

상한보다 큰 값

을 이상치 후보로 판단합니다.


27장 IQR이란 무엇인가#

IQR은 제1사분위수 Q1과 제3사분위수 Q3 사이의 범위입니다.

즉:

IQR = Q3 - Q1

입니다.

데이터의 가운데 50%가 포함되는 범위를 나타냅니다.

이 범위를 기반으로 지나치게 멀리 떨어진 값을 찾는 것이 IQR 이상치 탐지입니다.


28장 IQR 이상치 기준#

제공된 학습자료의 공식은 반드시 기억해야 합니다.

아래쪽 이상치 기준#

Q1 - 1.5×IQR 미만

위쪽 이상치 기준#

Q3 + 1.5×IQR 초과

입니다.

한 줄로:

Q1 아래 1.5 IQR / Q3 위 1.5 IQR

을 벗어나면 이상치 후보입니다.


29장 IQR 방법과 상자그림의 관계#

앞서 데이터 시각화에서 배운 Box Plot 상자그림과 IQR은 밀접한 관계가 있습니다.

상자의:

아래쪽 → Q1

위쪽 → Q3

이며 그 차이가 IQR입니다.

따라서 Box Plot에서 멀리 떨어진 점으로 표현되는 이상치 역시 이러한 IQR 기준과 연결해서 이해할 수 있습니다.


30장 이상치 탐지 방법 2: Z-score#

Z-score는 데이터가 평균에서 표준편차 몇 개만큼 떨어져 있는지 나타냅니다.

제공된 학습자료에서는 이상치 탐지 기준으로:

|Z| > 3

을 제시합니다.

즉 Z-score의 절댓값이 3보다 큰 값을 이상치로 판단하는 방식입니다.

핵심#

Z-score 이상치 = |Z| > 3

입니다.


31장 왜 절댓값을 사용하는가#

이상치는 평균보다 지나치게 큰 값뿐 아니라 지나치게 작은 값도 포함됩니다.

예를 들어:

Z = 4

도 평균에서 매우 멀고,

Z = -4

도 평균에서 매우 멉니다.

따라서 방향과 관계없이 떨어진 정도를 보기 위해 절댓값을 사용합니다.

|Z| > 3

이면 양쪽 방향 모두 탐지할 수 있습니다.


32장 Z-score 이상치 예제#

평균이:

100

표준편차가:

10

이라고 하겠습니다.

어떤 값이:

140

이라면:

Z = (140 - 100) / 10

= 4

입니다.

따라서:

|4| > 3

이므로 제공된 학습자료 기준 이상치로 판단할 수 있습니다.


33장 이상치 탐지 방법 3: ESD#

ESD는 Extreme Studentized Deviation입니다.

앞서 시계열 및 기타 개념에서도 등장했습니다.

제공된 학습자료에서는:

평균으로부터 k×표준편차 이상 떨어진 값

을 이상치로 판단하는 방법이라고 설명합니다.

핵심#

ESD = 평균에서 k×표준편차 이상 거리

입니다.


34장 IQR·Z-score·ESD 비교#

방법 이상치 판단 기준
IQR Q1−1.5×IQR 미만 또는 Q3+1.5×IQR 초과
Z-score |Z| > 3
ESD 평균에서 k×표준편차 이상 떨어짐

시험에서는 각 방법의 이름과 기준을 연결해야 합니다.


35장 전처리와 K-NN의 관계#

앞에서 K-NN을 공부하면서 특성 스케일링이 중요하다는 내용을 살펴봤습니다.

K-NN은 데이터 사이의 거리를 계산합니다.

따라서 변수 범위가 크게 다르면 값이 큰 변수가 거리 계산을 지배할 수 있습니다.

정규화나 표준화를 통해 변수들의 스케일을 맞추면 이런 문제를 줄일 수 있습니다.

즉:

거리 기반 알고리즘 → 스케일링 중요

라고 연결할 수 있습니다.


36장 전처리와 PCA의 관계#

PCA는 여러 변수의 분산과 관계를 이용해 새로운 주성분을 만듭니다.

제공된 학습자료에서는 표준화를 PCA 사용 사례와 연결합니다.

즉:

PCA → Z-score 표준화

를 시험 핵심 연결로 기억할 수 있습니다.


37장 정규화 시험 함정#

다음 문장을 주의합니다.

Min-Max 정규화는 평균을 0, 표준편차를 1로 만든다.

틀립니다.

그것은 표준화입니다.

Min-Max 정규화는:

0~1 범위

로 변환합니다.


38장 표준화 시험 함정#

Z-score 표준화는 모든 값을 반드시 0~1 사이로 만든다.

틀립니다.

표준화된 값에는 범위 제한이 없습니다.

핵심은:

평균 0

표준편차 1

입니다.


39장 이상치 영향 시험 함정#

Min-Max 정규화는 이상치의 영향을 거의 받지 않는다.

제공된 학습자료 기준 틀립니다.

최솟값과 최댓값을 직접 사용하기 때문에:

이상치 영향이 큼

으로 정리합니다.


40장 결측값 처리 시험 함정#

결측값은 항상 해당 행을 삭제하는 방법으로만 처리해야 한다.

틀립니다.

제공된 학습자료에서는:

  • 리스트 삭제
  • 평균·중앙값 대체
  • 보간
  • 예측 모델

등 여러 방법을 제시합니다.


41장 IQR 시험 함정#

IQR 방법에서는 Q1−3×IQR보다 작은 값을 이상치로 판단한다.

제공된 학습자료 기준 틀립니다.

기준은:

1.5×IQR

입니다.

즉:

Q1 - 1.5×IQR

Q3 + 1.5×IQR

입니다.


42장 Z-score 시험 함정#

Z-score를 이용한 이상치 판단 기준은 Z > 1이다.

제공된 학습자료 기준 틀립니다.

기준은:

|Z| > 3

입니다.

음수 방향도 포함하므로 절댓값을 사용합니다.


43장 ESD 시험 함정#

ESD는 사분위수 Q1과 Q3만을 이용하는 방법이다.

틀립니다.

그것은 IQR 방식과 관련됩니다.

제공된 학습자료에서는 ESD를:

평균으로부터 k×표준편차 이상 떨어진 값

과 연결합니다.


44장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 정규화는 평균 0, 표준편차 1로 만든다#

틀립니다.

표준화입니다.

함정 2. 표준화는 데이터를 반드시 0~1로 만든다#

틀립니다.

Min-Max 정규화입니다.

함정 3. Min-Max 정규화는 이상치에 강하다#

틀립니다.

제공된 학습자료에서는 이상치 영향이 크다고 설명합니다.

함정 4. 표준화된 데이터는 항상 0~1 범위다#

틀립니다.

범위 제한이 없습니다.

함정 5. 결측값은 삭제만 가능하다#

틀립니다.

대체·보간·예측 등의 방법도 있습니다.

함정 6. IQR 이상치의 기준은 Q1±1.5IQR이다#

표현을 주의해야 합니다.

정확한 기준은:

Q1 - 1.5×IQR 미만

또는:

Q3 + 1.5×IQR 초과

입니다.

함정 7. Z-score 이상치는 |Z| < 3이다#

틀립니다.

제공된 학습자료에서는:

|Z| > 3

입니다.


45장 정규화 시험 직전 암기#

Normalization

= Min-Max Scaling

공식:

(X - X_min) / (X_max - X_min)

결과:

0~1

특징:

이상치 영향 큼

제공된 활용:

신경망·이미지

입니다.


46장 표준화 시험 직전 암기#

Standardization

= Z-score

공식:

(X - mean) / std

결과:

평균 0

표준편차 1

범위:

제한 없음

제공된 활용:

PCA·회귀·SVM

입니다.


47장 결측값 시험 직전 암기#

결측값 처리 방법은:

삭제

→ 결측 행 제거

평균·중앙값

→ 대표값으로 대체

보간법

→ 주변값 이용

예측 모델

→ 다른 변수로 예측

입니다.


48장 이상치 시험 직전 암기#

IQR#

< Q1 - 1.5×IQR

또는:

> Q3 + 1.5×IQR

Z-score#

|Z| > 3

ESD#

평균에서 k×표준편차 이상

입니다.


49장 데이터 전처리 핵심 비교표#

구분 핵심
Min-Max 정규화 0~1
Min-Max 공식 (X−Min)/(Max−Min)
Min-Max 이상치 영향 큼
표준화 평균 0, 표준편차 1
표준화 공식 (X−Mean)/Std
표준화 범위 제한 없음
리스트 삭제 결측 행 삭제
평균·중앙값 대체 대표값으로 채움
보간법 주변 값으로 추정
예측 모델 다른 변수로 결측값 예측
IQR 이상치 Q1−1.5IQR, Q3+1.5IQR 밖
Z-score 이상치 |Z| > 3
ESD 평균에서 k×표준편차 이상

데이터 전처리 FAQ#

정규화란 무엇인가#

제공된 학습자료에서는 Min-Max Scaling을 사용해 데이터를 0~1 사이로 변환하는 방법으로 설명합니다.

Min-Max 정규화 공식은 무엇인가#

(X - X_min) / (X_max - X_min)

입니다.

표준화란 무엇인가#

데이터를 평균 0, 표준편차 1인 형태로 변환하는 방법입니다.

표준화 공식은 무엇인가#

(X - mean) / std

입니다.

정규화와 표준화의 가장 큰 차이는 무엇인가#

정규화는 0~1 범위로 변환하고 표준화는 평균 0과 표준편차 1을 기준으로 변환합니다.

표준화 결과도 0~1 범위인가#

아닙니다. 제공된 학습자료에서는 범위 제한이 없다고 설명합니다.

Min-Max 정규화는 이상치 영향을 많이 받는가#

네. 제공된 학습자료에서는 이상치 영향이 큰 방법으로 정리합니다.

PCA와 연결되는 방법은 무엇인가#

제공된 학습자료에서는 표준화를 PCA와 연결합니다.

SVM과 연결되는 방법은 무엇인가#

표준화입니다.

결측값을 처리하는 방법에는 무엇이 있는가#

리스트 삭제, 평균·중앙값 대체, 보간법, 예측 모델 등이 있습니다.

IQR 이상치 기준은 무엇인가#

Q1 - 1.5×IQR 미만

또는:

Q3 + 1.5×IQR 초과

입니다.

Z-score를 이용한 이상치 기준은 무엇인가#

제공된 학습자료 기준:

|Z| > 3

입니다.

ESD란 무엇인가#

평균에서 k×표준편차 이상 떨어진 값을 이상치로 판단하는 방법입니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 정규화와 표준화의 차이를 설명할 수 있는가?
  2. Min-Max 공식에 최솟값과 최댓값이 들어간다는 것을 알고 있는가?
  3. 정규화 결과가 0~1이라는 것을 알고 있는가?
  4. Z-score 표준화 공식을 기억하고 있는가?
  5. 표준화 후 평균이 0이라는 것을 알고 있는가?
  6. 표준화 후 표준편차가 1이라는 것을 알고 있는가?
  7. 표준화에는 값의 범위 제한이 없다는 것을 알고 있는가?
  8. Min-Max가 이상치 영향을 크게 받는다는 것을 알고 있는가?
  9. 정규화가 신경망·이미지와 연결된다는 것을 기억하고 있는가?
  10. 표준화가 PCA·회귀·SVM과 연결된다는 것을 기억하고 있는가?
  11. 결측값 처리 방법 네 가지를 설명할 수 있는가?
  12. 리스트 삭제의 의미를 알고 있는가?
  13. 보간법이 주변 값으로 추정한다는 것을 알고 있는가?
  14. IQR 이상치 기준을 기억하고 있는가?
  15. Z-score 이상치 기준이 |Z| > 3이라는 것을 알고 있는가?
  16. ESD의 기준을 설명할 수 있는가?

이 글을 마치며#

데이터 전처리에서 가장 먼저 구분해야 할 것은 정규화와 표준화입니다.

정규화 Min-Max Scaling은:

X_norm = (X - X_min) / (X_max - X_min)

을 사용하여 데이터를:

0~1

사이로 변환합니다.

제공된 학습자료에서는 이상치 영향을 크게 받으며 신경망·이미지와 연결합니다.

표준화 Z-score는:

X_std = (X - mean) / std

를 사용합니다.

결과는:

평균 0

표준편차 1

이며 값의 범위에는 제한이 없습니다.

제공된 학습자료에서는 PCA·회귀·SVM과 연결합니다.

결측값은:

행 삭제

평균·중앙값 대체

보간

예측 모델

등으로 처리할 수 있습니다.

이상치 탐지에서는:

IQR = Q1−1.5IQR 미만 또는 Q3+1.5IQR 초과

Z-score = |Z| > 3

ESD = 평균에서 k×표준편차 이상

을 기억합니다.

시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.

정규화 = Min-Max = 0~1

표준화 = Z-score = 평균 0·표준편차 1

Min-Max는 이상치 영향 큼

결측값 = 삭제·대체·보간·예측

이상치 = IQR / |Z|>3 / ESD

이 페이지의 목차