ADsP 3과목 데이터 분석 핵심요약: 통계·회귀분석·머신러닝·AUROC·R·시계열 총정리

ADsP 3과목 데이터 분석은 통계 개념을 이해하는 것에서 출발해 실제 분석기법과 머신러닝 모델, 모델 평가, R 코드 해석까지 연결되는 과목입니다.

단순 용어 암기만으로는 부족합니다. 다음 세 가지를 함께 익히는 것이 중요합니다.

개념 이해
↓
공식 암기
↓
결과 해석

전체 흐름을 먼저 잡으면 다음과 같습니다.

통계 기초
↓
가설검정·확률분포
↓
상관·회귀분석
↓
분류·머신러닝
↓
군집·연관분석
↓
모델 평가
↓
R 프로그래밍
↓
시계열·전처리
↓
고급 분석기법

시험 직전에는 특히 다음 숫자와 관계를 먼저 기억합니다.

항목 핵심
상관계수 r -1 ~ +1
결정계수 R² 0 ~ 1
일반적 유의수준 0.05
VIF 기준 10 초과 시 다중공선성 의심
AUROC 0.5는 무작위, 1은 완벽
Silhouette -1 ~ 1
Lift 1이 독립 기준

1장 통계의 기본: 모집단·표본·모수·통계량#

통계는 데이터를 이용해 전체 집단의 특성을 이해하거나 미래를 추론하는 방법입니다.

가장 먼저 모집단과 표본, 그리고 모수와 통계량을 구분해야 합니다.

모수와 통계량의 차이#

모수 Parameter는 모집단의 특성을 나타냅니다.

대표적인 기호는:

모평균
μ

모분산
σ²

입니다.

반면 통계량 Statistic은 표본으로부터 계산한 값입니다.

표본평균
x̄

표본분산
s²

예를 들어 전국 성인의 평균 키를 알고 싶다고 가정합니다.

대한민국 전체 성인
→ 모집단

선택한 1,000명
→ 표본

대한민국 전체 평균 키
→ 모수

표본 1,000명의 평균 키
→ 통계량

전수조사와 표본조사#

전수조사 Census

모집단 전체를 조사합니다.

장점은 전체를 조사한다는 것이고, 많은 시간과 비용이 필요할 수 있습니다.

표본조사 Sampling

모집단 일부를 추출해 조사하고 전체 모집단을 추론합니다.

모집단
↓
표본 추출
↓
표본 분석
↓
모집단 추론

이산형과 연속형 확률변수#

이산형 확률변수

셀 수 있는 값을 가집니다.

예:

주사위 눈
사고 발생 건수
고객 수

연속형 확률변수

연속적으로 측정할 수 있습니다.

예:

키
몸무게
시간
온도

2장 상관관계와 스피어만 상관계수#

상관분석은 두 변수가 얼마나 함께 움직이는지를 살펴봅니다.

특히 상관계수는 인과관계를 의미하지 않는다는 점이 중요합니다.

상관관계
≠
인과관계

피어슨 상관계수#

상관계수 r은 -1에서 +1 사이입니다.

r = +1
완전한 양의 선형관계

r = 0
선형관계 없음

r = -1
완전한 음의 선형관계

공식은 다음 형태입니다.

r = Cov(X,Y) / (σx × σy)

스피어만 상관계수#

스피어만 상관계수는 값 자체보다 순위를 이용합니다.

따라서 순위형 데이터를 분석할 때 활용할 수 있습니다.

핵심:

Pearson
→ 실제 값 기반 선형관계

Spearman
→ 순위 기반 관계

3장 가설검정: 귀무가설·대립가설·P-value ★★★#

통계적 가설검정에서는 먼저 두 개의 가설을 세웁니다.

귀무가설 H₀#

일반적으로:

차이가 없다.
효과가 없다.
관계가 없다.

라는 형태로 설정합니다.

대립가설 H₁#

귀무가설과 반대되는 주장입니다.

차이가 있다.
효과가 있다.
관계가 있다.

예를 들어 새로운 교육방법이 기존 방법보다 효과가 있는지 확인한다고 가정합니다.

H₀
새 교육방법의 효과 차이가 없다.

H₁
새 교육방법의 효과 차이가 있다.

P-value란 무엇인가#

P-value는 귀무가설이 참이라는 전제 아래 현재와 같은 결과가 관측될 가능성을 평가하는 값으로 사용됩니다.

시험에서는 일반적으로 다음 기준을 이용합니다.

P-value < 0.05
→ 통계적으로 유의
→ 귀무가설 기각

반대로 기준보다 크거나 같으면 귀무가설을 기각하지 않는 방향으로 해석합니다.


4장 제1종 오류와 제2종 오류#

가설검정에서는 잘못된 판단이 발생할 수 있습니다.

제1종 오류#

귀무가설이 실제로 참인데 기각하는 오류입니다.

실제
정상

판단
환자

즉 False Positive와 연결합니다.

제2종 오류#

귀무가설이 실제로 거짓인데 기각하지 못하는 오류입니다.

실제
환자

판단
정상

즉 False Negative와 연결합니다.

시험용 비교#

구분 의미
제1종 오류 α 참인 H₀를 기각
제2종 오류 β 거짓인 H₀를 기각하지 못함
검정력 1 - β

빠르게 기억하면:

1종
없는 것을 있다고 판단

2종
있는 것을 없다고 판단

5장 정규분포와 Z-score ★★☆#

정규분포는 평균을 중심으로 좌우가 대칭인 종 모양의 확률분포입니다.

N(μ, σ²)

로 표현합니다.

68-95-99.7 법칙#

정규분포에서는 평균을 중심으로:

μ ± 1σ
약 68.27%

μ ± 2σ
약 95.45%

μ ± 3σ
약 99.73%

가 포함됩니다.

표준정규분포#

표준정규분포는:

평균 = 0
표준편차 = 1

인 정규분포입니다.

Z-score#

Z-score는 관측값이 평균에서 표준편차 몇 개만큼 떨어져 있는지를 나타냅니다.

Z = (X - μ) / σ

예:

Z = 0
→ 평균과 같음

Z = 1
→ 평균보다 1표준편차 높음

Z = -2
→ 평균보다 2표준편차 낮음

따라서 Z=2를 단순히 평균보다 값이 2배 크다고 해석해서는 안 됩니다.


6장 회귀분석과 결정계수 R² ★★★#

회귀분석은 하나 이상의 독립변수를 이용해 종속변수의 변화를 설명하거나 예측하는 분석방법입니다.

단순 선형회귀#

독립변수가 하나인 경우입니다.

Y = β₀ + β₁X + ε

각 항은:

β₀
절편

β₁
회귀계수

ε
오차항

을 의미합니다.

회귀계수 해석#

β₁이 2라고 가정하면 다른 조건에서:

X가 1 증가할 때 Y가 약 2 증가한다.

는 형태로 해석합니다.

결정계수 R²#

결정계수는 회귀모형이 종속변수의 변동을 얼마나 설명하는지를 나타냅니다.

0 ≤ R² ≤ 1

예:

R² = 0.8
→ 종속변수 변동의 약 80%를 모델이 설명

변동의 분해#

SST = SSR + SSE

그리고:

R² = SSR / SST

또는:

R² = 1 - SSE / SST

로 표현합니다.

단순회귀와 상관계수#

단순 선형회귀에서는:

R² = r²

관계가 있습니다.

예:

r = 0.8

R²
= 0.8²
= 0.64

7장 RMSE와 최소제곱법#

최소제곱법 OLS#

Ordinary Least Squares는 잔차제곱합을 최소화하는 회귀계수를 찾는 방법입니다.

핵심은 단순히 잔차의 합이 아니라:

잔차의 제곱합

을 최소화한다는 것입니다.

RMSE#

RMSE는 예측값과 실제값의 차이를 평가합니다.

RMSE = √[Σ(yi - ŷi)² / n]

RMSE는 일반적으로:

작을수록
→ 예측 오차가 작음

으로 해석합니다.


8장 다중회귀와 다중공선성 ★★★#

다중회귀는 여러 개의 독립변수를 사용합니다.

Y =
β₀
+ β₁X₁
+ β₂X₂
+ ...
+ βpXp
+ ε

각 회귀계수는 다른 독립변수를 고정했을 때 해당 변수가 한 단위 증가하면 Y가 얼마나 변하는지 나타냅니다.

다중공선성이란 무엇인가#

독립변수들 사이에 강한 상관관계가 존재하는 현상입니다.

X1
↔ 강한 상관
X2

다중공선성이 심하면 회귀계수 추정이 불안정해지고 해석하기 어려워질 수 있습니다.

VIF#

원고에서는:

VIF > 10
→ 다중공선성 의심

기준을 제시합니다.

PCA 등을 이용해 문제를 완화할 수도 있습니다.


9장 회귀 변수 선택과 AIC·BIC#

회귀모형에 어떤 독립변수를 넣을지도 중요합니다.

전진선택법#

변수 없음
↓
유용한 변수 추가
↓
추가
↓
추가

후진제거법#

전체 변수
↓
불필요한 변수 제거
↓
제거
↓
제거

단계적 선택법#

전진선택과 후진제거를 함께 이용합니다.

AIC와 BIC#

둘 다 모델 비교에 사용할 수 있으며 원고에서는 작을수록 좋은 모형으로 정리합니다.

AIC
↓ 작을수록

BIC
↓ 작을수록

BIC는 AIC보다 변수 수에 대한 패널티가 더 커 상대적으로 단순한 모형을 선호하는 특징이 있습니다.

R²가 무조건 가장 큰 모형만 선택하면 과적합 문제가 발생할 수 있으므로 다른 기준과 함께 판단합니다.


10장 로지스틱 회귀분석이란 무엇인가 ★★★#

일반적인 선형회귀가 연속형 값을 예측한다면 로지스틱 회귀는 범주형 결과를 예측하는 데 사용합니다.

대표적으로:

구매한다 / 구매하지 않는다

부도 / 정상

합격 / 불합격

1 / 0

같은 문제입니다.

Sigmoid 함수#

로지스틱 회귀에서는 Sigmoid 함수를 이용해 출력값을 0과 1 사이로 변환합니다.

0 < P < 1

따라서 결과를 확률 형태로 해석할 수 있습니다.

Odds#

사건이 발생할 확률 P가 있을 때:

Odds = P / (1-P)

입니다.

예:

P = 0.8

Odds
= 0.8 / 0.2
= 4

Odds Ratio#

두 그룹의 Odds를 비교합니다.

OR = 1
→ 동일

OR > 1
→ 첫 그룹 Odds가 큼

OR < 1
→ 두 번째 그룹 Odds가 큼

11장 의사결정나무: Gini·Entropy·Information Gain ★★★#

의사결정나무는 조건을 반복적으로 나누어 최종 결과를 예측합니다.

나이 > 50?
├─ Yes
│  └─ 소득 > 300?
└─ No
   └─ 소득 > 500?

스무고개처럼 조건을 하나씩 적용한다고 생각하면 이해하기 쉽습니다.

주요 Node#

Root Node
→ 시작점

Internal Node
→ 중간 분기

Leaf Node
→ 최종 결과

Gini Index#

Gini(D) = 1 - Σpj²

Gini가 0에 가까울수록 하나의 Class로 구성된 순수한 Node에 가깝습니다.

Entropy#

Entropy(D)
= -Σ pi log₂(pi)

Entropy 역시 낮을수록 불순도가 낮습니다.

Information Gain#

Information Gain
=
분할 전 Entropy
-
분할 후 Entropy

정보이득이 클수록 좋은 분할로 판단합니다.

알고리즘 구분#

알고리즘 주요 기준
CART Gini
ID3·C4.5 Entropy·Information Gain
CHAID Chi-square

정지규칙과 가지치기#

둘은 같은 개념이 아닙니다.

Stopping Rule
→ Tree를 더 이상 성장시키지 않음

Pruning
→ 이미 만들어진 가지를 제거

둘 다 과적합을 줄이는 데 활용됩니다.


12장 앙상블: Bagging·Boosting·Voting·Stacking ★★★#

앙상블은 여러 Model의 예측을 결합해 하나의 Model보다 안정적인 결과를 얻는 방법입니다.

Bagging#

여러 Model을 독립적으로 학습시키고 결과를 결합합니다.

Model A ─┐
Model B ─┼→ 투표·평균 → 결과
Model C ─┘

원고에서는:

병렬 학습
분산 감소
Random Forest

와 연결합니다.

Boosting#

앞선 Model의 오류를 다음 Model이 계속 보완합니다.

Model 1
↓ 오류 보완
Model 2
↓ 오류 보완
Model 3

대표적인 예:

AdaBoost
XGBoost
LightGBM

원고에서는 순차 학습과 편향 감소를 핵심으로 설명합니다.

Voting#

여러 Model의 결과를 투표합니다.

Hard Voting
→ Class 다수결

Soft Voting
→ 예측확률 평균

Stacking#

1단계 Model들의 예측값을 다시 다른 Meta Model의 입력으로 사용합니다.

Model A ─┐
Model B ─┼→ Meta Model → 최종 결과
Model C ─┘

빠른 비교#

방법 핵심
Bagging 병렬·분산 감소
Boosting 순차·오류 보완
Voting 여러 예측을 투표
Stacking Meta Model로 결합

13장 인공신경망과 활성화 함수 ★★☆#

인공신경망은 여러 Node와 가중치를 연결하여 입력에서 출력으로 정보를 전달합니다.

Sigmoid#

출력값을 0과 1 사이로 변환합니다.

0 < output < 1

원고에서는 이진 분류와 연결합니다.

Softmax#

여러 Class의 확률을 출력하는 데 사용합니다.

Class A
0.1

Class B
0.7

Class C
0.2

따라서 다범주 분류와 연결합니다.

ReLU#

x < 0
→ 0

x > 0
→ x

형태로 동작하며 은닉층 활성화 함수로 설명됩니다.

완전연결층의 가중치 수#

원고 예제:

Input 20
→ Hidden 50
→ Output 3

Bias를 제외한 연결 가중치만 계산하면:

20 × 50
+
50 × 3

=
1,150

입니다.

경사하강법#

Gradient Descent는 손실함수를 줄이는 방향으로 Parameter를 반복 갱신합니다.

Learning Rate가:

너무 큼
→ 발산 가능

너무 작음
→ 학습이 매우 느림

이라는 관계를 기억합니다.


14장 군집분석과 K-means ★★☆#

군집분석은 정답 Label이 없는 데이터를 서로 비슷한 집단으로 묶는 분석입니다.

K-means#

K-means는 데이터를 K개의 Cluster로 나눕니다.

중요한 점은:

K
→ 사용자가 미리 지정

한다는 것입니다.

알고리즘이 자동으로 적절한 K를 항상 결정한다고 생각하면 안 됩니다.

거리 측정#

Euclidean Distance#

두 점 사이의 직선거리를 계산합니다.

Manhattan Distance#

각 축에서 이동한 거리의 합으로 계산합니다.

Mahalanobis Distance#

변수 사이의 상관관계까지 고려하는 거리입니다.

Silhouette 계수#

군집 결과가 얼마나 잘 분리되어 있는지 평가합니다.

1에 가까움
→ 군집이 잘 분리됨

0 근처
→ 군집 경계

-1 근처
→ 잘못된 군집 가능

계층적 군집 연결법#

방법 기준
Single 가장 가까운 점
Complete 가장 먼 점
Average 평균 거리
Ward 군집 내 오차제곱합

15장 연관규칙분석과 Apriori ★★★#

연관규칙분석은 여러 항목이 함께 발생하는 패턴을 찾습니다.

대표적인 예가 장바구니 분석입니다.

우유를 구매한 고객이 빵도 함께 구매하는가?

Apriori 알고리즘#

원고에서는 다음 흐름으로 정리합니다.

최소 Support 결정
↓
Frequent Itemset 탐색
↓
Association Rule 생성
↓
Confidence 계산
↓
Lift로 평가

Support#

A와 B가 전체 거래에서 함께 등장하는 비율입니다.

Support(A→B)
=
A∩B 거래 수
/
전체 거래 수

Confidence#

A를 구매한 사람 가운데 B도 구매한 비율입니다.

Confidence(A→B)
=
A∩B
/
A

Lift#

A를 구매했을 때 B 구매가 일반적인 B 구매보다 얼마나 증가하는지 봅니다.

Lift(A→B)
=
Confidence(A→B)
/ Support(B)

해석:

Lift = 1
→ 독립

Lift > 1
→ 양의 연관

Lift < 1
→ 음의 연관

계산 예제#

전체 거래 1,000건에서:

우유
400건

빵
300건

우유 + 빵
200건

이라면:

Support
= 200 / 1000
= 0.2

Confidence
= 200 / 400
= 0.5

Lift
= 0.5 / 0.3
≈ 1.67

입니다.


16장 Confusion Matrix와 분류모델 평가 ★★★#

분류모델을 평가하려면 단순히 몇 개를 맞혔는지만 봐서는 부족합니다.

Confusion Matrix#

실제 / 예측 Positive Negative
Positive TP FN
Negative FP TN

의미는:

TP
실제 Positive를 Positive로 예측

TN
실제 Negative를 Negative로 예측

FP
실제 Negative를 Positive로 예측

FN
실제 Positive를 Negative로 예측

입니다.

Accuracy#

전체 예측 가운데 맞춘 비율입니다.

Accuracy
=
(TP + TN)
/ (TP + TN + FP + FN)

Precision#

Positive라고 예측한 것 가운데 실제 Positive인 비율입니다.

Precision
=
TP / (TP + FP)

기억법:

내가 양성이라고 한 것 중 진짜 양성은?

Recall#

실제 Positive 가운데 Positive라고 찾아낸 비율입니다.

Recall
=
TP / (TP + FN)

기억법:

실제 양성을 얼마나 놓치지 않고 찾아냈는가?

Specificity#

실제 Negative 가운데 Negative로 정확하게 예측한 비율입니다.

Specificity
=
TN / (TN + FP)

F1-Score#

Precision과 Recall의 조화평균입니다.

F1
=
2 × Precision × Recall
/
(Precision + Recall)

F1은 단순 산술평균이 아니라 조화평균이라는 점이 중요합니다.


17장 ROC Curve와 AUROC ★★★#

ROC Curve는 분류모델의 Threshold를 변화시키면서 성능을 살펴보는 그래프입니다.

축은:

X축
FPR
= 1 - Specificity

Y축
TPR
= Recall
= Sensitivity

입니다.

AUROC#

ROC Curve 아래의 면적입니다.

원고에서의 핵심 기준은:

AUROC = 0.5
→ 무작위 수준

AUROC = 1.0
→ 완벽한 분류

입니다.

따라서 일반적으로 AUROC가 클수록 분류능력이 높은 Model로 해석합니다.


18장 R 프로그래밍 기초 ★★☆#

ADsP에서는 복잡한 R 프로그램을 작성하는 것보다 기본 자료구조와 코드의 의미를 읽는 능력이 중요합니다.

Vector#

1차원 구조이며 같은 자료형의 원소를 저장합니다.

x <- c(1, 2, 3, 4, 5)

Matrix#

2차원이며 같은 자료형을 저장합니다.

m <- matrix(1:6, nrow=2, ncol=3)

Data Frame#

2차원 구조지만 Column마다 다른 자료형을 가질 수 있습니다.

df <- data.frame(
  id = 1:3,
  name = c("김철수", "이영희", "박민수"),
  score = c(85, 92, 78)
)

List#

서로 다른 자료형의 객체를 담을 수 있습니다.

x <- list(1, "A", TRUE)

자료구조 비교#

구조 차원 자료형
Vector 1차원 동일
Matrix 2차원 동일
Data Frame 2차원 Column별 다를 수 있음
List 1차원 형태 서로 다른 객체 가능

19장 R의 NA·NaN·NULL 차이#

NA#

Missing Value를 나타냅니다.

x <- c(10, 20, NA, 40)

확인:

is.na(x)

NaN#

Not a Number.

수학적으로 정의되지 않는 계산 결과를 의미합니다.

0 / 0

NULL#

값이 없는 객체를 의미합니다.

NA를 제외하고 평균 계산#

mean(x, na.rm=TRUE)

패키지 설치와 로드#

설치:

install.packages("패키지명")

로드:

library(패키지명)

즉:

install.packages()
→ 설치

library()
→ 로드

입니다.


20장 R의 lm과 summary 결과 읽는 법 ★★★#

R에서 선형회귀는 lm()을 사용할 수 있습니다.

model <- lm(y ~ x1 + x2, data=df)
summary(model)

시험에서는 직접 Model을 만드는 것보다 summary() 결과를 읽는 문제가 중요합니다.

Estimate#

회귀계수 추정값입니다.

예:

x1 Estimate = 2.3456

이라면 다른 변수가 고정되었을 때 x1이 한 단위 증가하면 y가 약 2.3456 증가하는 형태로 해석합니다.

Std. Error#

회귀계수 추정치의 표준오차입니다.

t value#

Estimate / Std. Error

관계로 이해합니다.

Pr(>|t|)#

해당 회귀계수의 P-value입니다.

원고에서는:

P < 0.05
→ 유의

로 해석합니다.

Multiple R-squared#

Model의 결정계수 R²입니다.

Adjusted R-squared#

독립변수 수를 고려해 조정한 결정계수입니다.

단순 R²는 변수를 추가하면 증가하는 특성이 있기 때문에 이를 보정해 해석합니다.

F-statistic#

개별 변수가 아니라 회귀 Model 전체의 유의성을 판단하는 데 사용합니다.


21장 시계열분석과 ARIMA ★★★#

시계열 데이터는 시간 순서에 따라 관측된 데이터입니다.

예:

일별 주가
월별 매출
시간별 전력 사용량
분기별 GDP

시계열의 4가지 구성요소#

추세
계절성
순환
불규칙

암기:

추 · 계 · 순 · 불

Trend#

장기간 지속되는 증가 또는 감소 경향입니다.

Seasonality#

일정한 주기로 반복되는 패턴입니다.

예:

여름마다 에어컨 판매 증가
주말마다 방문자 증가

Cycle#

경기순환처럼 일정하지 않은 장기적인 변동입니다.

Irregular#

예측하기 어려운 우연한 변동입니다.

Seasonality와 Cycle#

Seasonality
→ 일정한 주기

Cycle
→ 불규칙한 장기 변동

을 구분합니다.


22장 정상성과 AR·MA·ARIMA#

정상성 Stationarity#

시간이 변해도 평균과 분산 등 주요 통계적 특성이 일정한 상태로 설명됩니다.

비정상 시계열은 차분 Differencing을 이용해 정상화할 수 있습니다.

차분
=
현재 값 - 이전 값

AR Model#

AutoRegressive.

자신의 과거 값을 사용해 현재 값을 설명합니다.

MA Model#

Moving Average.

과거의 오차항을 사용해 현재 값을 설명합니다.

ARIMA#

ARIMA(p,d,q)

에서:

p
→ AR 차수

d
→ 차분 횟수

q
→ MA 차수

입니다.

ARIMA의 I는:

Integrated

를 의미합니다.

ACF와 PACF#

원고에서는:

AR(p)
→ PACF가 p에서 절단

MA(q)
→ ACF가 q에서 절단

으로 정리합니다.

암기하면:

AR
→ PACF

MA
→ ACF

입니다.


23장 K-NN은 어떻게 동작하는가 ★★☆#

K-NN은 새로운 데이터와 가까운 K개의 데이터를 찾아 결과를 결정합니다.

새 데이터
↓
가까운 K개 이웃 탐색
↓
분류: 다수결
회귀: 평균

Lazy Learning#

K-NN은 별도의 복잡한 사전 Model 학습 없이 예측 시점에 주변 데이터를 이용하기 때문에 게으른 학습 Lazy Learning으로 설명됩니다.

K 값#

K가 너무 작음
→ 과적합 가능

K가 너무 큼
→ 과소적합 가능

거리#

대표적으로:

Euclidean
Manhattan
Mahalanobis

거리를 사용할 수 있습니다.

K-NN에서는 거리 기반으로 이웃을 판단하므로 Feature의 Scale 차이에 주의합니다.


24장 SVM이란 무엇인가 ★★☆#

SVM, Support Vector Machine은 두 Class를 나누는 경계 가운데 Margin을 최대화하는 경계를 찾습니다.

Hyperplane#

Class를 나누는 결정경계입니다.

Margin#

결정경계와 가장 가까운 데이터까지의 여유 공간입니다.

Support Vector#

Margin 경계에 위치하여 Hyperplane 결정에 직접 영향을 주는 데이터입니다.

Class A
      ●
------ Margin
====== Hyperplane
------ Margin
      ▲
Class B

Kernel Trick#

선형으로 나누기 어려운 데이터를 더 높은 차원으로 표현해 분리할 수 있도록 합니다.

대표 Kernel:

Linear
RBF
Polynomial
Sigmoid

C Parameter#

원고에서는:

C 증가
→ 오류 허용을 줄이는 방향

C 감소
→ Soft Margin 성격 강화

로 정리합니다.

SVM은 분류뿐 아니라 SVR을 이용한 회귀에도 사용할 수 있습니다.


25장 PCA 주성분분석이란 무엇인가 ★★☆#

PCA는 고차원 데이터를 더 적은 수의 새로운 변수로 표현하는 차원축소 기법입니다.

주성분#

원래 변수들의 선형결합으로 만들어집니다.

첫 번째 주성분은 데이터의 분산을 가장 많이 설명하는 방향입니다.

PC1
→ 가장 큰 분산

PC2
→ 그다음 분산

PC3
→ 그다음

주성분들은 서로 직교하는 방향으로 생성됩니다.

PCA 활용#

차원 축소

Visualization

Noise 감소

다중공선성 완화

등에 사용할 수 있습니다.


26장 T-test·ANOVA·카이제곱 검정 ★★☆#

T-test#

두 평균의 차이를 검정합니다.

단일표본 T-test#

표본평균
vs
기준 평균

독립표본 T-test#

서로 독립된 두 집단의 평균을 비교합니다.

대응표본 T-test#

같은 대상의 전후 값을 비교합니다.

예:

다이어트 전 체중
vs
다이어트 후 체중

ANOVA#

세 집단 이상의 평균 차이를 검정합니다.

T-test
→ 두 집단

ANOVA
→ 세 집단 이상

ANOVA의 귀무가설은 모든 집단의 평균이 같다는 형태입니다.

Chi-square Test#

원고에서는 다음 세 가지를 구분합니다.

적합도 검정
→ 관측분포와 기대분포 비교

독립성 검정
→ 두 범주형 변수의 관계

동질성 검정
→ 여러 집단의 분포 비교

27장 정규화와 표준화 ★★☆#

Feature Scale이 크게 다르면 거리 기반 알고리즘이나 일부 분석에서 문제가 될 수 있습니다.

Normalization#

Min-Max Scaling.

값을 0~1 범위로 변환합니다.

Xnorm
=
(X - Xmin)
/
(Xmax - Xmin)

Standardization#

Z-score 방식입니다.

Xstd
=
(X - mean)
/ std

결과는 평균 0, 표준편차 1 형태로 변환됩니다.

차이#

구분 정규화 표준화
대표 방식 Min-Max Z-score
결과 주로 0~1 평균 0·표준편차 1
이상치 영향 상대적으로 큼 상대적으로 덜함

28장 결측값과 이상치 처리#

결측값 처리#

원고에서는 다음 방법을 제시합니다.

행 삭제

평균·중앙값 대체

보간

예측 Model로 대체

이상치 탐지#

대표적인 방법:

IQR

Z-score

ESD

입니다.

IQR에서는:

Q1 - 1.5 × IQR 미만

또는

Q3 + 1.5 × IQR 초과

값을 이상치 후보로 판단합니다.

Z-score 방식에서는 원고가:

|Z| > 3

을 대표적인 기준으로 제시합니다.


29장 Naive Bayes란 무엇인가 ★☆☆#

Naive Bayes는 Bayes 정리를 기반으로 한 확률적 분류방법입니다.

Bayes 정리:

P(A|B)
=
P(B|A) × P(A)
/ P(B)

핵심 가정#

Naive Bayes는 Feature들이 서로 독립이라고 가정합니다.

Feature A
Feature B
Feature C

→ 서로 독립이라고 가정

현실에서는 항상 독립인 것은 아니지만 이러한 단순한 가정 덕분에 계산이 빠릅니다.

대표적인 활용:

Spam 분류
문서 분류
감성 분석

30장 텍스트마이닝과 TF-IDF ★★☆#

텍스트마이닝은 비정형 Text 데이터에서 패턴과 정보를 추출하는 분석방법입니다.

대표적인 활용:

감성 분석
문서 분류
정보 추출
Chatbot
Topic Modeling

기본 전처리 흐름#

원고에서는 다음 순서를 제시합니다.

Tokenization
↓
Stopword 제거
↓
Stemming·Lemmatization
↓
Vectorization
↓
분석

Bag of Words#

문서를 단어의 집합으로 표현합니다.

핵심 특징:

단어 순서
→ 무시

단어 출현
→ 중요

단순하고 구현이 쉽지만 문맥과 단어 순서를 잃는다는 한계가 있습니다.

TF-IDF#

단어의 중요도를 평가합니다.

TF-IDF
=
TF × IDF

TF

해당 문서에서 단어가 얼마나 많이 등장하는지 나타냅니다.

IDF

많은 문서에 흔하게 등장하는 단어의 중요도를 낮춥니다.

따라서:

많은 문서에서 흔하게 등장
→ IDF 낮음

특정 문서에서 특징적으로 등장
→ TF-IDF 높아질 가능성

입니다.


31장 LDA 토픽모델링과 감성분석#

LDA#

Latent Dirichlet Allocation은 문서 집합에서 숨겨진 Topic을 찾아내는 Topic Modeling 방법입니다.

원고에서는 다음과 같이 정리합니다.

한 문서
→ 여러 Topic의 혼합

한 Topic
→ 여러 단어의 확률분포

LDA는 비지도 학습이며 Topic 수 K는 사용자가 정합니다.

감성분석#

Text를:

긍정
부정
중립

등으로 분류합니다.

상품 Review나 SNS 분석 등에 활용됩니다.


32장 사회연결망 분석 SNA ★★☆#

Social Network Analysis는 사람이나 조직 같은 대상 사이의 관계를 Network로 분석합니다.

기본 구성#

Node
→ 사람·조직·객체

Edge
→ 관계

Density#

실제 연결 수가 가능한 전체 연결에서 차지하는 정도입니다.

중심성#

Degree Centrality#

직접 연결된 Node가 얼마나 많은지를 봅니다.

Closeness Centrality#

다른 모든 Node까지 얼마나 가까운지를 봅니다.

거리가 짧을수록 중심성이 높습니다.

Betweenness Centrality#

다른 Node 사이의 최단경로에 얼마나 자주 위치하는지 나타냅니다.

정보 전달의 중개자 역할과 연결됩니다.

Eigenvector Centrality#

단순히 연결 수뿐 아니라 중요한 Node와 연결되어 있는가까지 고려합니다.

빠른 암기#

Degree
→ 직접 연결

Closeness
→ 거리

Betweenness
→ 중간 경로

Eigenvector
→ 중요한 이웃

33장 교차검증과 K-Fold ★★★#

머신러닝 Model이 Training Data에만 잘 맞는 것이 아니라 새로운 데이터에서도 잘 동작하는지 확인해야 합니다.

이를 위해 교차검증을 사용할 수 있습니다.

Hold-out#

전체 데이터를 한 번 나누어:

Training Set
+
Validation·Test Set

으로 사용합니다.

빠르고 단순하지만 데이터가 적으면 평가 결과가 불안정할 수 있습니다.

K-Fold#

전체 데이터를 K개의 Fold로 나눕니다.

K=5라면:

1회
Fold 1 검증
나머지 학습

2회
Fold 2 검증
나머지 학습

...

5회
Fold 5 검증
나머지 학습

최종적으로 여러 평가 결과를 평균합니다.

LOOCV#

Leave-One-Out Cross Validation.

데이터 하나만 검증용으로 사용하고 나머지를 Training에 사용합니다.

이를 전체 데이터에 반복합니다.

데이터 활용률은 높지만 계산량이 큽니다.


34장 과적합과 과소적합 ★★★#

Overfitting#

Training Data를 지나치게 세밀하게 학습해 새로운 데이터에서는 성능이 떨어지는 상태입니다.

Training Error
낮음

Test Error
높음

원고에서는:

Bias
낮음

Variance
높음

과 연결합니다.

Underfitting#

Model이 너무 단순해 Training Data의 기본 Pattern조차 충분히 학습하지 못한 상태입니다.

Training Error
높음

Test Error
높음

그리고:

Bias
높음

Variance
낮음

과 연결합니다.

Bias-Variance Trade-off#

너무 단순
→ Bias 증가
→ Underfitting

너무 복잡
→ Variance 증가
→ Overfitting

따라서 두 문제 사이의 적절한 균형이 필요합니다.


35장 과적합을 방지하는 방법#

원고에서는 여러 방법을 제시합니다.

Pruning#

Decision Tree의 불필요한 가지를 제거합니다.

Regularization#

Model이 너무 복잡해지지 않도록 Penalty를 부여합니다.

Dropout#

Neural Network 학습 과정에서 일부 Node를 임의로 비활성화합니다.

Cross-Validation#

다양한 데이터 구간에서 Model을 평가합니다.

Training Data 증가#

더 많은 학습 데이터를 확보합니다.

Ensemble#

여러 Model을 결합해 안정성을 높입니다.


36장 Ridge와 LASSO 차이 ★★★#

둘 다 회귀계수에 Penalty를 적용하는 Regularization 기법입니다.

Ridge#

L2 Regularization.

회귀계수의 제곱합에 Penalty를 줍니다.

계수를 작게 만듦
하지만 일반적으로 완전히 0으로 만들지는 않음

따라서 모든 변수를 유지하는 성격이 있습니다.

LASSO#

L1 Regularization.

회귀계수 절댓값의 합에 Penalty를 줍니다.

일부 회귀계수를 정확히 0으로 만들 수 있기 때문에 변수선택 효과를 가질 수 있습니다.

비교#

구분 Ridge LASSO
Penalty L2 L1
계수 0 근처로 축소 일부 0 가능
변수선택 일반적으로 유지 가능

37장 데이터 시각화와 R 함수 ★★★#

시험에서는 어떤 데이터에 어떤 Chart가 적합한지뿐 아니라 R 코드가 무엇을 그리는지도 확인해야 합니다.

R 함수 Chart 주요 목적
hist() Histogram 연속형 분포
boxplot() Box Plot 분포·이상치
plot(x,y) Scatter Plot 두 변수 관계
barplot() Bar Chart 범주 비교
pie() Pie Chart 구성비

Histogram#

hist(x)

연속형 데이터의 분포를 확인합니다.

Box Plot#

boxplot(x)

또는 그룹 비교:

boxplot(score ~ group, data=df)

Scatter Plot#

plot(x, y)

두 변수의 관계를 확인합니다.

Line Chart#

원고에서는:

plot(x, y, type="l")

처럼 type="l"을 이용한 선그래프도 구분합니다.

Box Plot에서 기억할 것#

Box
→ Q1 ~ Q3

Box 안 선
→ Median

점
→ Outlier

평균을 기본적으로 직접 표시하는 Chart라고 생각하면 안 됩니다.


38장 조건부확률과 계산문제 정리 ★★★#

조건부확률#

P(A|B)
=
P(A∩B)
/ P(B)

예를 들어 전체 사람 가운데 남성이 60명이고 안경을 쓴 남성이 24명이라면:

P(안경 | 남성)
=
24 / 60
=
0.4

입니다.

연관규칙#

Support
= A∩B / 전체

Confidence
= A∩B / A

Lift
= Confidence / Support(B)

Confusion Matrix#

Accuracy
= (TP + TN) / 전체

Precision
= TP / (TP + FP)

Recall
= TP / (TP + FN)

F1
= 2PR / (P + R)

이 네 공식은 직접 계산할 수 있도록 익혀두는 것이 좋습니다.


39장 기타 빈출 분석 개념#

3과목에는 큰 분석기법 외에도 독립적으로 출제될 수 있는 여러 개념이 포함됩니다.

MDS#

Multidimensional Scaling.

대상 사이의 거리정보를 이용해 저차원 공간에 배치합니다.

Cosine Similarity#

두 Vector의 방향이 얼마나 비슷한지를 비교하는 유사도입니다.

SOM#

Self-Organizing Map.

고차원 데이터를 저차원 지도 형태로 표현하는 비지도 신경망 기반 방법입니다.

ESD#

Extreme Studentized Deviation.

원고에서는 평균으로부터 일정 표준편차 이상 떨어진 값을 이용한 이상치 탐색방법으로 설명합니다.

Poisson Distribution#

일정 시간이나 영역에서 사건이 몇 번 발생하는지를 표현하는 이산형 확률분포입니다.

Lift Curve#

무작위 Model과 비교해 분류 Model이 어느 정도 성능 향상을 보이는지 평가합니다.

Content-based Filtering#

사용자가 과거에 좋아했던 Item의 특성과 비슷한 Item을 추천합니다.

사용자가 좋아한 Item 특징
↓
비슷한 Item 탐색
↓
추천

Genetic Algorithm#

생물학적 진화과정을 모방한 최적화 방식입니다.

선택
교차
변이

과정을 통해 해를 탐색합니다.


40장 ADsP 3과목 핵심 공식 한 번에 보기#

Z-score#

Z
=
(X - μ) / σ

Pearson 상관계수#

r
=
Cov(X,Y)
/ (σx × σy)

회귀 변동#

SST
=
SSR + SSE

결정계수#

R²
=
SSR / SST

또는

R²
=
1 - SSE/SST

RMSE#

RMSE
=
√[Σ(yi - ŷi)² / n]

Odds#

Odds
=
P / (1-P)

Gini#

Gini
=
1 - Σpj²

Entropy#

Entropy
=
-Σ pi log₂(pi)

Support#

Support(A→B)
=
P(A∩B)

Confidence#

Confidence(A→B)
=
P(A∩B) / P(A)

Lift#

Lift
=
Confidence(A→B)
/ P(B)

Accuracy#

(TP + TN)
/ 전체

Precision#

TP
/
(TP + FP)

Recall#

TP
/
(TP + FN)

Specificity#

TN
/
(TN + FP)

F1-Score#

2 × Precision × Recall
/
(Precision + Recall)

Min-Max Normalization#

(X - Xmin)
/ (Xmax - Xmin)

Standardization#

(X - mean)
/ std

41장 시험에서 자주 헷갈리는 개념 총정리#

r과 R²#

r
→ -1 ~ +1
→ 관계의 방향과 강도

R²
→ 0 ~ 1
→ 회귀모형 설명력

Precision과 Recall#

Precision
→ 예측 Positive 기준
→ FP와 관련

Recall
→ 실제 Positive 기준
→ FN과 관련

Bagging과 Boosting#

Bagging
→ 병렬
→ Random Forest
→ 분산 감소

Boosting
→ 순차
→ XGBoost·AdaBoost
→ 앞선 오류 보완

Gini와 Entropy#

낮을수록
→ Node가 더 순수

K-means#

K
→ 사용자가 지정

Lift#

1
→ 독립

1 초과
→ 양의 연관

1 미만
→ 음의 연관

ARIMA#

AR
→ PACF

MA
→ ACF

K-NN#

K 너무 작음
→ Overfitting

K 너무 큼
→ Underfitting

Ridge와 LASSO#

Ridge
→ L2
→ 변수 유지

LASSO
→ L1
→ 일부 계수 0
→ 변수선택 효과

정규화와 표준화#

Normalization
→ Min-Max
→ 0~1

Standardization
→ Z-score
→ 평균 0·표준편차 1

42장 ADsP 3과목 5분 최종 암기#

시험 직전에는 다음 내용부터 빠르게 확인합니다.

모수
→ 모집단

통계량
→ 표본
P < 0.05
→ 유의
→ H₀ 기각
1종 오류
→ False Positive

2종 오류
→ False Negative
정규분포

1σ
68%

2σ
95%

3σ
99.7%
r
-1 ~ +1

R²
0 ~ 1
VIF > 10
→ 다중공선성 의심
Logistic Regression
→ 범주형 종속변수
→ Sigmoid
CART
→ Gini

ID3·C4.5
→ Entropy

CHAID
→ Chi-square
Bagging
→ 병렬
→ Random Forest

Boosting
→ 순차
→ XGBoost·AdaBoost
K-means
→ K 직접 지정
Support
전체 중 A+B

Confidence
A 중 A+B

Lift
1이 독립 기준
Precision
TP / (TP+FP)

Recall
TP / (TP+FN)

F1
Precision과 Recall의 조화평균
ROC

X축
FPR

Y축
TPR
AUROC

0.5
무작위

1.0
완벽
시계열

추세
계절
순환
불규칙
AR
→ PACF

MA
→ ACF

ARIMA
→ p,d,q
K-NN

K 작음
→ 과적합

K 큼
→ 과소적합
SVM
→ Margin 최대화
→ Support Vector
→ Kernel Trick
PCA
→ 차원축소
→ 분산이 큰 방향
→ 다중공선성 완화
T-test
→ 두 집단 평균

ANOVA
→ 세 집단 이상 평균
Normalization
→ 0~1

Standardization
→ 평균 0
→ 표준편차 1
TF-IDF
→ 중요한 단어 가중

LDA
→ Topic Modeling
→ 비지도
Cross Validation
→ 일반화 성능 평가

Overfitting
→ Training에 지나치게 특화

Underfitting
→ Model이 너무 단순

ADsP 3과목 데이터 분석 FAQ#

ADsP 3과목에서는 무엇을 공부하는가#

통계 기초, 가설검정, 확률분포, 회귀분석, 의사결정나무, 앙상블, 인공신경망, 군집분석, 연관규칙분석, 분류모델 평가, ROC·AUROC, R 프로그래밍, 시계열분석, K-NN, SVM, PCA, 통계적 검정, 데이터 전처리, 텍스트마이닝, 사회연결망 분석, 교차검증과 과적합 등을 학습합니다.

P-value가 0.05보다 작으면 어떻게 해석하는가#

시험에서는 일반적으로 유의수준을 0.05로 두었을 때:

P-value < 0.05
→ 통계적으로 유의
→ 귀무가설 기각

으로 판단합니다.

상관계수 r과 결정계수 R²는 무엇이 다른가#

상관계수 r은 두 변수 사이의 선형관계 방향과 강도를 나타내며 -1에서 +1 사이입니다.

결정계수 R²는 회귀 Model이 종속변수의 변동을 얼마나 설명하는지 나타내며 0에서 1 사이입니다.

다중공선성이란 무엇인가#

다중회귀에서 독립변수끼리 강하게 상관되어 회귀계수 추정이 불안정해지는 문제입니다. 원고에서는 VIF가 10을 초과하면 다중공선성을 의심하는 기준을 제시합니다.

로지스틱 회귀와 선형회귀의 차이는 무엇인가#

선형회귀는 연속형 값을 설명하거나 예측하고, 로지스틱 회귀는 0/1과 같은 범주형 결과의 확률을 예측하는 데 사용합니다.

Random Forest는 Bagging인가 Boosting인가#

Random Forest는 원고에서 Bagging 계열의 대표 알고리즘으로 정리합니다.

반면 XGBoost·LightGBM·AdaBoost는 Boosting 계열입니다.

Precision과 Recall 차이는 무엇인가#

Precision은 Positive라고 예측한 것 중 실제 Positive의 비율입니다.

Recall은 실제 Positive 가운데 Model이 Positive라고 찾아낸 비율입니다.

Precision
→ 예측 기준

Recall
→ 실제 기준

으로 기억하면 쉽습니다.

AUROC가 0.5면 어떤 의미인가#

원고에서는 AUROC 0.5를 무작위 예측 수준으로 설명하고, 1.0을 완벽한 분류에 해당하는 값으로 정리합니다.

K-means에서 K는 자동으로 정해지는가#

아닙니다. 원고에서는 K를 사용자가 사전에 설정해야 하는 값으로 정리합니다.

K-NN의 K가 너무 크면 어떻게 되는가#

주변 데이터를 너무 넓게 사용하게 되면서 경계가 지나치게 단순해져 과소적합이 발생할 수 있습니다.

반대로 K가 지나치게 작으면 특정 데이터에 민감해져 과적합 위험이 커집니다.

SVM의 목표는 무엇인가#

두 Class 사이를 나누는 Hyperplane 가운데 Margin을 최대화하는 경계를 찾는 것입니다. Margin 경계에 있는 Support Vector가 결정경계 형성에 중요한 역할을 합니다.

PCA는 왜 사용하는가#

고차원 데이터의 정보를 가능한 한 유지하면서 더 적은 차원으로 표현하는 데 사용합니다. 시각화, 차원축소, Noise 감소, 다중공선성 완화 등에 활용할 수 있습니다.

T-test와 ANOVA의 차이는 무엇인가#

시험용 핵심 구분은:

T-test
→ 두 집단 평균 비교

ANOVA
→ 세 집단 이상 평균 비교

입니다.

TF-IDF란 무엇인가#

문서 안에서 자주 등장하면서 전체 문서에서는 상대적으로 드물게 등장하는 단어에 더 높은 중요도를 주는 방식입니다.

LDA란 무엇인가#

문서 집합에 숨어 있는 Topic을 찾아내는 Topic Modeling 기법입니다. 원고에서는 비지도 학습이며 Topic 수 K를 사용자가 지정하는 방식으로 설명합니다.

Overfitting과 Underfitting은 어떻게 다른가#

Overfitting은 Training Data에 지나치게 맞춰져 새로운 데이터에서 성능이 떨어지는 상태입니다.

Underfitting은 Model이 너무 단순하여 Training Data의 Pattern조차 충분히 학습하지 못하는 상태입니다.


자기 점검#

다음 질문에 바로 답할 수 있다면 ADsP 3과목의 핵심 구조가 상당 부분 정리된 것입니다.

  1. 모수와 통계량의 차이를 설명할 수 있는가?
  2. 귀무가설과 대립가설을 구분할 수 있는가?
  3. 제1종 오류와 제2종 오류를 설명할 수 있는가?
  4. 표준정규분포의 평균과 표준편차를 알고 있는가?
  5. Z-score의 의미를 설명할 수 있는가?
  6. r과 R²의 범위와 의미를 구분할 수 있는가?
  7. SST·SSR·SSE 관계를 기억하는가?
  8. VIF가 무엇을 평가하는지 알고 있는가?
  9. 선형회귀와 로지스틱 회귀를 구분할 수 있는가?
  10. Gini와 Entropy의 의미를 설명할 수 있는가?
  11. CART·C4.5·CHAID를 구분할 수 있는가?
  12. Bagging과 Boosting의 차이를 설명할 수 있는가?
  13. Sigmoid·Softmax·ReLU의 차이를 구분할 수 있는가?
  14. K-means에서 K를 누가 결정하는지 알고 있는가?
  15. Support·Confidence·Lift 공식을 사용할 수 있는가?
  16. TP·TN·FP·FN을 구분할 수 있는가?
  17. Precision과 Recall 공식을 혼동하지 않는가?
  18. F1-Score가 조화평균이라는 것을 알고 있는가?
  19. ROC Curve의 X축과 Y축을 알고 있는가?
  20. AUROC 0.5와 1.0의 의미를 설명할 수 있는가?
  21. R의 Vector·Matrix·Data Frame·List를 구분할 수 있는가?
  22. NA·NaN·NULL 차이를 구분할 수 있는가?
  23. install.packages()와 library()의 차이를 알고 있는가?
  24. summary(lm())에서 Estimate·P-value·R²·F-statistic을 읽을 수 있는가?
  25. 시계열의 추세·계절·순환·불규칙 요소를 구분할 수 있는가?
  26. AR과 MA를 ACF·PACF와 연결할 수 있는가?
  27. ARIMA의 p·d·q가 무엇인지 알고 있는가?
  28. K-NN에서 K가 너무 작거나 클 때 발생하는 문제를 알고 있는가?
  29. SVM의 Margin과 Support Vector를 설명할 수 있는가?
  30. PCA의 목적을 설명할 수 있는가?
  31. T-test와 ANOVA를 구분할 수 있는가?
  32. 정규화와 표준화를 구분할 수 있는가?
  33. Naive Bayes의 핵심 가정을 알고 있는가?
  34. TF-IDF와 LDA가 무엇인지 설명할 수 있는가?
  35. SNA의 네 가지 중심성을 구분할 수 있는가?
  36. Hold-out과 K-Fold 차이를 설명할 수 있는가?
  37. Overfitting과 Underfitting을 구분할 수 있는가?
  38. Ridge와 LASSO의 차이를 설명할 수 있는가?

이 글을 마치며#

ADsP 3과목 데이터 분석은 처음 보면 공식과 알고리즘 이름이 많아 가장 복잡하게 느껴질 수 있습니다.

하지만 실제로는 몇 개의 큰 질문으로 나누면 구조가 명확해집니다.

데이터에 차이가 있는가?
→ 가설검정

변수끼리 어떤 관계가 있는가?
→ 상관분석

숫자를 예측하고 싶은가?
→ 회귀분석

Class를 예측하고 싶은가?
→ 분류

정답 없이 비슷한 데이터를 묶고 싶은가?
→ 군집분석

함께 발생하는 Pattern을 찾고 싶은가?
→ 연관규칙

분류 Model이 얼마나 좋은가?
→ Confusion Matrix·ROC·AUROC

시간에 따른 변화를 예측하고 싶은가?
→ 시계열분석

머신러닝 알고리즘 역시 이름만 외우기보다 작동방식으로 연결하면 기억하기 쉽습니다.

Decision Tree
→ 질문을 반복하며 분기

Random Forest
→ 여러 Tree를 결합

Boosting
→ 이전 오류를 다음 Model이 보완

K-NN
→ 가까운 이웃으로 판단

SVM
→ Margin이 가장 큰 경계 탐색

PCA
→ 데이터의 주요 분산 방향으로 차원축소

그리고 평가단계에서는 다음 관계를 확실하게 구분해야 합니다.

Accuracy
→ 전체 중 얼마나 맞혔는가

Precision
→ Positive라고 한 것 중 얼마나 맞았는가

Recall
→ 실제 Positive를 얼마나 찾아냈는가

F1
→ Precision과 Recall의 균형

AUROC
→ Threshold 전반의 분류능력

ADsP 3과목은 개념과 공식, 해석을 따로 외우는 것보다 하나의 분석과정으로 연결해서 이해하는 것이 중요합니다.

데이터 준비
↓
통계적 특성 파악
↓
분석 방법 선택
↓
Model 학습
↓
성능 평가
↓
결과 해석

이 흐름을 잡고 회귀분석 → 의사결정나무·앙상블 → 연관분석 → Confusion Matrix·AUROC → R → 시계열 → K-NN·SVM·PCA → 교차검증·과적합 순으로 반복해서 확인하면 3과목 전체를 한 페이지에서 빠르게 복습할 수 있습니다.

이 페이지의 목차