데이터 전처리란? 정규화·표준화·결측값 처리·이상치 탐지 쉽게 이해하기
1장 데이터 전처리란 무엇인가#
데이터 분석에서는 좋은 알고리즘만큼 데이터를 어떤 상태로 준비했는가가 중요합니다.
현실의 데이터에는 다음과 같은 문제가 자주 존재합니다.
- 변수마다 숫자 범위가 크게 다름
- 일부 값이 비어 있음
- 지나치게 크거나 작은 이상값이 존재함
- 변수의 단위가 서로 다름
예를 들어 고객 데이터에:
나이 → 20~70
연봉 → 3,000~100,000
만족도 → 1~5
처럼 서로 다른 범위의 값이 들어 있을 수 있습니다.
이 데이터를 그대로 분석하면 특정 변수의 숫자 크기가 지나치게 큰 영향을 줄 수 있습니다.
이러한 문제를 분석하기 좋은 형태로 정리하는 과정이 데이터 전처리 Data Preprocessing입니다.
2장 ADsP에서 알아야 할 전처리 핵심#
제공된 학습자료에서는 크게 다음 내용을 다룹니다.
- 정규화 Normalization
- 표준화 Standardization
- 결측값 처리
- 이상치 탐지
특히 정규화와 표준화는 이름이 비슷하기 때문에 공식과 결과를 정확하게 구분해야 합니다.
가장 먼저 기억하면:
정규화 = 0~1
표준화 = 평균 0, 표준편차 1
입니다.
3장 정규화 Normalization이란 무엇인가#
정규화는 데이터의 값을 일정한 범위로 바꾸는 방법입니다.
제공된 학습자료에서는 Min-Max Scaling을 정규화 방법으로 제시합니다.
데이터를:
0에서 1 사이
의 값으로 변환합니다.
공식은 다음과 같습니다.
X_norm = (X - X_min) / (X_max - X_min)
핵심#
Normalization = Min-Max = 0~1
입니다.
4장 정규화를 쉽게 이해하면#
시험점수가 다음처럼 있다고 하겠습니다.
최솟값:
50
최댓값:
100
어떤 학생의 점수가:
75
라면 Min-Max 정규화를 적용할 수 있습니다.
(75 - 50) / (100 - 50)
= 25 / 50
= 0.5
입니다.
원래 75점이었던 값이 0과 1 사이의 0.5로 변환됩니다.
5장 Min-Max 공식에서 각 값의 의미#
공식은:
(X - X_min) / (X_max - X_min)
입니다.
여기서:
X → 변환할 현재 값
X_min → 해당 변수의 최솟값
X_max → 해당 변수의 최댓값
입니다.
최솟값은 0에 가까워지고 최댓값은 1에 가까워집니다.
그래서 전체 데이터가 0~1 범위로 맞춰집니다.
6장 정규화는 왜 사용하는가#
변수마다 숫자의 크기가 다르면 분석 결과가 특정 변수의 범위에 지나치게 영향을 받을 수 있습니다.
예를 들어:
나이 → 20~70
이미지 픽셀값 → 0~255
소득 → 2,000~100,000
처럼 값의 범위가 다를 수 있습니다.
Min-Max 정규화를 사용하면 서로 다른 범위를 0~1로 맞출 수 있습니다.
제공된 학습자료에서는 정규화를 다음과 같은 활용과 연결합니다.
- 신경망
- 이미지
7장 정규화의 이상치 영향#
제공된 학습자료에서는 Min-Max 정규화가 이상치의 영향을 크게 받는다고 설명합니다.
왜 그럴까요?
Min-Max 공식에는:
최솟값
과:
최댓값
이 직접 들어갑니다.
따라서 극단적으로 큰 값 하나가 있으면 전체 범위가 크게 늘어날 수 있습니다.
8장 이상치가 Min-Max에 미치는 영향#
정상적인 데이터가:
10, 20, 30, 40, 50
이라고 하겠습니다.
그런데 이상치:
1000
이 하나 추가되면 최댓값이 50에서 1000으로 크게 바뀝니다.
Min-Max 정규화는 이 최댓값을 기준으로 계산하기 때문에 기존 데이터들이 0에 가까운 좁은 범위에 몰릴 수 있습니다.
따라서:
Min-Max = 이상치 영향 큼
이라고 기억합니다.
9장 표준화 Standardization이란 무엇인가#
표준화는 데이터를 평균 0, 표준편차 1을 기준으로 변환하는 방법입니다.
제공된 학습자료에서는 이를 Z-score 표준화로 설명합니다.
공식은:
X_std = (X - mean) / std
입니다.
즉 현재 값에서 평균을 빼고 표준편차로 나눕니다.
핵심#
Standardization = Z-score = 평균 0, 표준편차 1
입니다.
10장 표준화를 쉽게 이해하면#
어떤 시험의:
평균 = 70점
표준편차 = 10점
이라고 하겠습니다.
학생 A가:
80점
을 받았다면 표준화 값은:
(80 - 70) / 10
= 1
입니다.
즉 평균보다 표준편차 1개만큼 높은 위치라는 의미입니다.
앞서 학습한 Z-score와 같은 원리입니다.
11장 표준화 결과의 범위#
정규화는 결과가:
0~1
이라는 명확한 범위를 가집니다.
반면 표준화는 제공된 학습자료에서:
범위 제한 없음
으로 설명합니다.
표준화 후에는:
- -2
- -1
- 0
- 1
- 2
등 다양한 값이 나올 수 있습니다.
따라서:
Normalization = 범위 있음
Standardization = 범위 제한 없음
으로 구분합니다.
12장 정규화와 표준화의 핵심 차이#
| 구분 | 정규화 Min-Max | 표준화 Z-score |
|---|---|---|
| 결과 | 0~1 | 평균 0, 표준편차 1 |
| 범위 | 0~1 | 제한 없음 |
| 이상치 영향 | 큼 | 상대적으로 작음 |
| 제공된 활용 예 | 신경망, 이미지 | PCA, 회귀, SVM |
시험에서 가장 중요한 것은 결과 형태입니다.
정규화 = 0~1
표준화 = μ 0, σ 1
입니다.
13장 정규화와 표준화를 혼동하지 않는 방법#
정규화 Normalization에서:
Min-Max
라는 표현이 보이면:
최솟값과 최댓값 사이로 맞춘다고 생각합니다.
따라서:
0~1
입니다.
표준화 Standardization에서:
Z-score
라는 표현이 보이면:
평균과 표준편차를 생각합니다.
따라서:
평균 0, 표준편차 1
입니다.
한 줄로:
Min-Max는 범위, Z-score는 평균과 표준편차
입니다.
14장 PCA는 정규화와 표준화 중 무엇과 연결되는가#
제공된 학습자료에서는 PCA의 사용 경우로 표준화를 제시합니다.
즉:
Standardization → PCA
로 연결합니다.
특히 여러 변수의 단위와 크기가 다를 경우 변수 스케일을 맞추는 것이 중요할 수 있습니다.
ADsP에서는 우선 학습자료 기준:
PCA = 표준화
연결을 기억하면 됩니다.
15장 SVM은 무엇과 연결되는가#
제공된 학습자료에서는 표준화 사용 사례에:
SVM
을 포함합니다.
SVM은 변수의 값 범위에 영향을 받을 수 있으므로 스케일을 조정하는 것이 중요합니다.
따라서:
Standardization → SVM
으로 연결합니다.
16장 회귀분석은 무엇과 연결되는가#
제공된 학습자료에서는 표준화 사용 사례에:
회귀
도 포함합니다.
즉 변수마다 단위나 숫자 범위가 크게 다른 경우 Z-score 형태로 표준화하여 분석할 수 있습니다.
시험에서는 우선:
표준화 = PCA·회귀·SVM
으로 묶어 기억할 수 있습니다.
17장 정규화는 어디에 사용하는가#
제공된 학습자료에서는 Min-Max 정규화를:
- 신경망
- 이미지
와 연결합니다.
따라서 시험 직전에는:
Min-Max → 신경망·이미지
Z-score → PCA·회귀·SVM
이라고 구분할 수 있습니다.
18장 결측값 Missing Value이란 무엇인가#
결측값은 원래 값이 있어야 하지만 데이터가 비어 있는 상태입니다.
R에서는 앞서 NA로 표현하는 방법을 살펴봤습니다.
예를 들어 고객 데이터에서:
| 고객 | 나이 | 소득 |
|---|---|---|
| A | 35 | 5000 |
| B | 42 | 결측 |
| C | 결측 | 4200 |
처럼 일부 값이 빠질 수 있습니다.
결측값을 그대로 두면 분석이나 모델 학습에 문제가 발생할 수 있으므로 적절한 처리 방법을 선택해야 합니다.
19장 결측값 처리 방법 1: 리스트 삭제#
제공된 학습자료에서는 첫 번째 방법으로 리스트 삭제를 제시합니다.
결측값이 있는 행 자체를 삭제하는 방식입니다.
예를 들어:
A → 정상
B → 소득 결측
C → 정상
이라면 B 행을 통째로 제거할 수 있습니다.
장점#
간단합니다.
주의점#
결측 데이터가 많다면 많은 정보를 잃을 수 있습니다.
핵심#
리스트 삭제 = 결측 행 전체 삭제
입니다.
20장 결측값 처리 방법 2: 평균 대체#
결측값을 해당 변수의 평균값으로 바꾸는 방법입니다.
예를 들어 시험점수가:
80, 70, 결측, 90
이라고 하겠습니다.
알려진 값들의 평균이 80이라면 결측값을 80으로 대체할 수 있습니다.
핵심#
평균 대체 = Missing → Mean
입니다.
21장 결측값 처리 방법 3: 중앙값 대체#
평균 대신 중앙값 Median을 이용할 수도 있습니다.
제공된 학습자료에서는:
평균/중앙값 대체
를 하나의 방법으로 제시합니다.
극단적으로 크거나 작은 값이 존재하는 데이터에서는 평균보다 중앙값을 고려할 수 있습니다.
시험에서는 우선:
결측값 → 평균 또는 중앙값 대체 가능
이라고 기억하면 됩니다.
22장 결측값 처리 방법 4: 보간법#
보간법 Interpolation은 주변 데이터를 이용하여 빠진 값을 추정하는 방법입니다.
특히 순서가 있는 데이터나 시계열에서 생각하기 쉽습니다.
예를 들어:
10
20
결측
40
50
이라는 데이터가 있다면 주변 값의 흐름을 보고 결측값을 추정할 수 있습니다.
핵심#
보간법 = 주변 값으로 추정
입니다.
23장 결측값 처리 방법 5: 예측 모델#
다른 변수들을 이용하여 결측값 자체를 예측하는 모델을 만들 수도 있습니다.
예를 들어 소득이 비어 있지만:
- 나이
- 직업
- 경력
- 학력
등 다른 데이터가 있다면 이를 이용해 결측된 소득값을 추정할 수 있습니다.
제공된 학습자료에서는 이를:
다른 변수로 결측값 예측
이라고 설명합니다.
24장 결측값 처리 방법 비교#
| 방법 | 설명 |
|---|---|
| 리스트 삭제 | 결측값이 있는 행 전체 삭제 |
| 평균 대체 | 평균으로 결측값 대체 |
| 중앙값 대체 | 중앙값으로 결측값 대체 |
| 보간법 | 주변 값을 이용해 추정 |
| 예측 모델 | 다른 변수를 사용하여 예측 |
어떤 방법이 무조건 가장 좋은 것은 아니며 데이터 특성에 따라 방법을 선택합니다.
ADsP에서는 각 방법의 개념을 구분하는 것이 중요합니다.
25장 이상치 Outlier란 무엇인가#
이상치는 전체 데이터의 일반적인 패턴과 비교해 지나치게 크거나 작은 값입니다.
예를 들어 사람들의 키가:
165
170
172
174
168
350
이라고 한다면 350은 일반적인 사람의 키 범위를 크게 벗어납니다.
이런 값은:
- 입력 오류
- 측정 오류
- 실제로 매우 특이한 사례
등 다양한 이유로 발생할 수 있습니다.
따라서 이상치라고 해서 무조건 삭제하는 것이 아니라 먼저 탐지해야 합니다.
26장 이상치 탐지 방법 1: IQR#
IQR은 Interquartile Range, 사분위 범위입니다.
제공된 학습자료에서는 다음 범위를 벗어나는 값을 이상치로 판단합니다.
하한:
Q1 - 1.5 × IQR
상한:
Q3 + 1.5 × IQR
즉:
하한보다 작은 값
또는:
상한보다 큰 값
을 이상치 후보로 판단합니다.
27장 IQR이란 무엇인가#
IQR은 제1사분위수 Q1과 제3사분위수 Q3 사이의 범위입니다.
즉:
IQR = Q3 - Q1
입니다.
데이터의 가운데 50%가 포함되는 범위를 나타냅니다.
이 범위를 기반으로 지나치게 멀리 떨어진 값을 찾는 것이 IQR 이상치 탐지입니다.
28장 IQR 이상치 기준#
제공된 학습자료의 공식은 반드시 기억해야 합니다.
아래쪽 이상치 기준#
Q1 - 1.5×IQR 미만
위쪽 이상치 기준#
Q3 + 1.5×IQR 초과
입니다.
한 줄로:
Q1 아래 1.5 IQR / Q3 위 1.5 IQR
을 벗어나면 이상치 후보입니다.
29장 IQR 방법과 상자그림의 관계#
앞서 데이터 시각화에서 배운 Box Plot 상자그림과 IQR은 밀접한 관계가 있습니다.
상자의:
아래쪽 → Q1
위쪽 → Q3
이며 그 차이가 IQR입니다.
따라서 Box Plot에서 멀리 떨어진 점으로 표현되는 이상치 역시 이러한 IQR 기준과 연결해서 이해할 수 있습니다.
30장 이상치 탐지 방법 2: Z-score#
Z-score는 데이터가 평균에서 표준편차 몇 개만큼 떨어져 있는지 나타냅니다.
제공된 학습자료에서는 이상치 탐지 기준으로:
|Z| > 3
을 제시합니다.
즉 Z-score의 절댓값이 3보다 큰 값을 이상치로 판단하는 방식입니다.
핵심#
Z-score 이상치 = |Z| > 3
입니다.
31장 왜 절댓값을 사용하는가#
이상치는 평균보다 지나치게 큰 값뿐 아니라 지나치게 작은 값도 포함됩니다.
예를 들어:
Z = 4
도 평균에서 매우 멀고,
Z = -4
도 평균에서 매우 멉니다.
따라서 방향과 관계없이 떨어진 정도를 보기 위해 절댓값을 사용합니다.
|Z| > 3
이면 양쪽 방향 모두 탐지할 수 있습니다.
32장 Z-score 이상치 예제#
평균이:
100
표준편차가:
10
이라고 하겠습니다.
어떤 값이:
140
이라면:
Z = (140 - 100) / 10
= 4
입니다.
따라서:
|4| > 3
이므로 제공된 학습자료 기준 이상치로 판단할 수 있습니다.
33장 이상치 탐지 방법 3: ESD#
ESD는 Extreme Studentized Deviation입니다.
앞서 시계열 및 기타 개념에서도 등장했습니다.
제공된 학습자료에서는:
평균으로부터 k×표준편차 이상 떨어진 값
을 이상치로 판단하는 방법이라고 설명합니다.
핵심#
ESD = 평균에서 k×표준편차 이상 거리
입니다.
34장 IQR·Z-score·ESD 비교#
| 방법 | 이상치 판단 기준 |
|---|---|
| IQR | Q1−1.5×IQR 미만 또는 Q3+1.5×IQR 초과 |
| Z-score | |Z| > 3 |
| ESD | 평균에서 k×표준편차 이상 떨어짐 |
시험에서는 각 방법의 이름과 기준을 연결해야 합니다.
35장 전처리와 K-NN의 관계#
앞에서 K-NN을 공부하면서 특성 스케일링이 중요하다는 내용을 살펴봤습니다.
K-NN은 데이터 사이의 거리를 계산합니다.
따라서 변수 범위가 크게 다르면 값이 큰 변수가 거리 계산을 지배할 수 있습니다.
정규화나 표준화를 통해 변수들의 스케일을 맞추면 이런 문제를 줄일 수 있습니다.
즉:
거리 기반 알고리즘 → 스케일링 중요
라고 연결할 수 있습니다.
36장 전처리와 PCA의 관계#
PCA는 여러 변수의 분산과 관계를 이용해 새로운 주성분을 만듭니다.
제공된 학습자료에서는 표준화를 PCA 사용 사례와 연결합니다.
즉:
PCA → Z-score 표준화
를 시험 핵심 연결로 기억할 수 있습니다.
37장 정규화 시험 함정#
다음 문장을 주의합니다.
Min-Max 정규화는 평균을 0, 표준편차를 1로 만든다.
틀립니다.
그것은 표준화입니다.
Min-Max 정규화는:
0~1 범위
로 변환합니다.
38장 표준화 시험 함정#
Z-score 표준화는 모든 값을 반드시 0~1 사이로 만든다.
틀립니다.
표준화된 값에는 범위 제한이 없습니다.
핵심은:
평균 0
표준편차 1
입니다.
39장 이상치 영향 시험 함정#
Min-Max 정규화는 이상치의 영향을 거의 받지 않는다.
제공된 학습자료 기준 틀립니다.
최솟값과 최댓값을 직접 사용하기 때문에:
이상치 영향이 큼
으로 정리합니다.
40장 결측값 처리 시험 함정#
결측값은 항상 해당 행을 삭제하는 방법으로만 처리해야 한다.
틀립니다.
제공된 학습자료에서는:
- 리스트 삭제
- 평균·중앙값 대체
- 보간
- 예측 모델
등 여러 방법을 제시합니다.
41장 IQR 시험 함정#
IQR 방법에서는 Q1−3×IQR보다 작은 값을 이상치로 판단한다.
제공된 학습자료 기준 틀립니다.
기준은:
1.5×IQR
입니다.
즉:
Q1 - 1.5×IQR
Q3 + 1.5×IQR
입니다.
42장 Z-score 시험 함정#
Z-score를 이용한 이상치 판단 기준은 Z > 1이다.
제공된 학습자료 기준 틀립니다.
기준은:
|Z| > 3
입니다.
음수 방향도 포함하므로 절댓값을 사용합니다.
43장 ESD 시험 함정#
ESD는 사분위수 Q1과 Q3만을 이용하는 방법이다.
틀립니다.
그것은 IQR 방식과 관련됩니다.
제공된 학습자료에서는 ESD를:
평균으로부터 k×표준편차 이상 떨어진 값
과 연결합니다.
44장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 정규화는 평균 0, 표준편차 1로 만든다#
틀립니다.
표준화입니다.
함정 2. 표준화는 데이터를 반드시 0~1로 만든다#
틀립니다.
Min-Max 정규화입니다.
함정 3. Min-Max 정규화는 이상치에 강하다#
틀립니다.
제공된 학습자료에서는 이상치 영향이 크다고 설명합니다.
함정 4. 표준화된 데이터는 항상 0~1 범위다#
틀립니다.
범위 제한이 없습니다.
함정 5. 결측값은 삭제만 가능하다#
틀립니다.
대체·보간·예측 등의 방법도 있습니다.
함정 6. IQR 이상치의 기준은 Q1±1.5IQR이다#
표현을 주의해야 합니다.
정확한 기준은:
Q1 - 1.5×IQR 미만
또는:
Q3 + 1.5×IQR 초과
입니다.
함정 7. Z-score 이상치는 |Z| < 3이다#
틀립니다.
제공된 학습자료에서는:
|Z| > 3
입니다.
45장 정규화 시험 직전 암기#
Normalization
= Min-Max Scaling
공식:
(X - X_min) / (X_max - X_min)
결과:
0~1
특징:
이상치 영향 큼
제공된 활용:
신경망·이미지
입니다.
46장 표준화 시험 직전 암기#
Standardization
= Z-score
공식:
(X - mean) / std
결과:
평균 0
표준편차 1
범위:
제한 없음
제공된 활용:
PCA·회귀·SVM
입니다.
47장 결측값 시험 직전 암기#
결측값 처리 방법은:
삭제
→ 결측 행 제거
평균·중앙값
→ 대표값으로 대체
보간법
→ 주변값 이용
예측 모델
→ 다른 변수로 예측
입니다.
48장 이상치 시험 직전 암기#
IQR#
< Q1 - 1.5×IQR
또는:
> Q3 + 1.5×IQR
Z-score#
|Z| > 3
ESD#
평균에서 k×표준편차 이상
입니다.
49장 데이터 전처리 핵심 비교표#
| 구분 | 핵심 |
|---|---|
| Min-Max 정규화 | 0~1 |
| Min-Max 공식 | (X−Min)/(Max−Min) |
| Min-Max 이상치 영향 | 큼 |
| 표준화 | 평균 0, 표준편차 1 |
| 표준화 공식 | (X−Mean)/Std |
| 표준화 범위 | 제한 없음 |
| 리스트 삭제 | 결측 행 삭제 |
| 평균·중앙값 대체 | 대표값으로 채움 |
| 보간법 | 주변 값으로 추정 |
| 예측 모델 | 다른 변수로 결측값 예측 |
| IQR 이상치 | Q1−1.5IQR, Q3+1.5IQR 밖 |
| Z-score 이상치 | |Z| > 3 |
| ESD | 평균에서 k×표준편차 이상 |
데이터 전처리 FAQ#
정규화란 무엇인가#
제공된 학습자료에서는 Min-Max Scaling을 사용해 데이터를 0~1 사이로 변환하는 방법으로 설명합니다.
Min-Max 정규화 공식은 무엇인가#
(X - X_min) / (X_max - X_min)
입니다.
표준화란 무엇인가#
데이터를 평균 0, 표준편차 1인 형태로 변환하는 방법입니다.
표준화 공식은 무엇인가#
(X - mean) / std
입니다.
정규화와 표준화의 가장 큰 차이는 무엇인가#
정규화는 0~1 범위로 변환하고 표준화는 평균 0과 표준편차 1을 기준으로 변환합니다.
표준화 결과도 0~1 범위인가#
아닙니다. 제공된 학습자료에서는 범위 제한이 없다고 설명합니다.
Min-Max 정규화는 이상치 영향을 많이 받는가#
네. 제공된 학습자료에서는 이상치 영향이 큰 방법으로 정리합니다.
PCA와 연결되는 방법은 무엇인가#
제공된 학습자료에서는 표준화를 PCA와 연결합니다.
SVM과 연결되는 방법은 무엇인가#
표준화입니다.
결측값을 처리하는 방법에는 무엇이 있는가#
리스트 삭제, 평균·중앙값 대체, 보간법, 예측 모델 등이 있습니다.
IQR 이상치 기준은 무엇인가#
Q1 - 1.5×IQR 미만
또는:
Q3 + 1.5×IQR 초과
입니다.
Z-score를 이용한 이상치 기준은 무엇인가#
제공된 학습자료 기준:
|Z| > 3
입니다.
ESD란 무엇인가#
평균에서 k×표준편차 이상 떨어진 값을 이상치로 판단하는 방법입니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 정규화와 표준화의 차이를 설명할 수 있는가?
- Min-Max 공식에 최솟값과 최댓값이 들어간다는 것을 알고 있는가?
- 정규화 결과가 0~1이라는 것을 알고 있는가?
- Z-score 표준화 공식을 기억하고 있는가?
- 표준화 후 평균이 0이라는 것을 알고 있는가?
- 표준화 후 표준편차가 1이라는 것을 알고 있는가?
- 표준화에는 값의 범위 제한이 없다는 것을 알고 있는가?
- Min-Max가 이상치 영향을 크게 받는다는 것을 알고 있는가?
- 정규화가 신경망·이미지와 연결된다는 것을 기억하고 있는가?
- 표준화가 PCA·회귀·SVM과 연결된다는 것을 기억하고 있는가?
- 결측값 처리 방법 네 가지를 설명할 수 있는가?
- 리스트 삭제의 의미를 알고 있는가?
- 보간법이 주변 값으로 추정한다는 것을 알고 있는가?
- IQR 이상치 기준을 기억하고 있는가?
- Z-score 이상치 기준이 |Z| > 3이라는 것을 알고 있는가?
- ESD의 기준을 설명할 수 있는가?
이 글을 마치며#
데이터 전처리에서 가장 먼저 구분해야 할 것은 정규화와 표준화입니다.
정규화 Min-Max Scaling은:
X_norm = (X - X_min) / (X_max - X_min)
을 사용하여 데이터를:
0~1
사이로 변환합니다.
제공된 학습자료에서는 이상치 영향을 크게 받으며 신경망·이미지와 연결합니다.
표준화 Z-score는:
X_std = (X - mean) / std
를 사용합니다.
결과는:
평균 0
표준편차 1
이며 값의 범위에는 제한이 없습니다.
제공된 학습자료에서는 PCA·회귀·SVM과 연결합니다.
결측값은:
행 삭제
평균·중앙값 대체
보간
예측 모델
등으로 처리할 수 있습니다.
이상치 탐지에서는:
IQR = Q1−1.5IQR 미만 또는 Q3+1.5IQR 초과
Z-score = |Z| > 3
ESD = 평균에서 k×표준편차 이상
을 기억합니다.
시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.
정규화 = Min-Max = 0~1
표준화 = Z-score = 평균 0·표준편차 1
Min-Max는 이상치 영향 큼
결측값 = 삭제·대체·보간·예측
이상치 = IQR / |Z|>3 / ESD