ADsP 3과목 데이터 분석 핵심요약: 통계·회귀분석·머신러닝·AUROC·R·시계열 총정리
ADsP 3과목 데이터 분석은 통계 개념을 이해하는 것에서 출발해 실제 분석기법과 머신러닝 모델, 모델 평가, R 코드 해석까지 연결되는 과목입니다.
단순 용어 암기만으로는 부족합니다. 다음 세 가지를 함께 익히는 것이 중요합니다.
개념 이해
↓
공식 암기
↓
결과 해석전체 흐름을 먼저 잡으면 다음과 같습니다.
통계 기초
↓
가설검정·확률분포
↓
상관·회귀분석
↓
분류·머신러닝
↓
군집·연관분석
↓
모델 평가
↓
R 프로그래밍
↓
시계열·전처리
↓
고급 분석기법시험 직전에는 특히 다음 숫자와 관계를 먼저 기억합니다.
| 항목 | 핵심 |
|---|---|
| 상관계수 r | -1 ~ +1 |
| 결정계수 R² | 0 ~ 1 |
| 일반적 유의수준 | 0.05 |
| VIF 기준 | 10 초과 시 다중공선성 의심 |
| AUROC | 0.5는 무작위, 1은 완벽 |
| Silhouette | -1 ~ 1 |
| Lift | 1이 독립 기준 |
1장 통계의 기본: 모집단·표본·모수·통계량#
통계는 데이터를 이용해 전체 집단의 특성을 이해하거나 미래를 추론하는 방법입니다.
가장 먼저 모집단과 표본, 그리고 모수와 통계량을 구분해야 합니다.
모수와 통계량의 차이#
모수 Parameter는 모집단의 특성을 나타냅니다.
대표적인 기호는:
모평균
μ
모분산
σ²입니다.
반면 통계량 Statistic은 표본으로부터 계산한 값입니다.
표본평균
x̄
표본분산
s²예를 들어 전국 성인의 평균 키를 알고 싶다고 가정합니다.
대한민국 전체 성인
→ 모집단
선택한 1,000명
→ 표본
대한민국 전체 평균 키
→ 모수
표본 1,000명의 평균 키
→ 통계량전수조사와 표본조사#
전수조사 Census
모집단 전체를 조사합니다.
장점은 전체를 조사한다는 것이고, 많은 시간과 비용이 필요할 수 있습니다.
표본조사 Sampling
모집단 일부를 추출해 조사하고 전체 모집단을 추론합니다.
모집단
↓
표본 추출
↓
표본 분석
↓
모집단 추론이산형과 연속형 확률변수#
이산형 확률변수
셀 수 있는 값을 가집니다.
예:
주사위 눈
사고 발생 건수
고객 수연속형 확률변수
연속적으로 측정할 수 있습니다.
예:
키
몸무게
시간
온도2장 상관관계와 스피어만 상관계수#
상관분석은 두 변수가 얼마나 함께 움직이는지를 살펴봅니다.
특히 상관계수는 인과관계를 의미하지 않는다는 점이 중요합니다.
상관관계
≠
인과관계피어슨 상관계수#
상관계수 r은 -1에서 +1 사이입니다.
r = +1
완전한 양의 선형관계
r = 0
선형관계 없음
r = -1
완전한 음의 선형관계공식은 다음 형태입니다.
r = Cov(X,Y) / (σx × σy)스피어만 상관계수#
스피어만 상관계수는 값 자체보다 순위를 이용합니다.
따라서 순위형 데이터를 분석할 때 활용할 수 있습니다.
핵심:
Pearson
→ 실제 값 기반 선형관계
Spearman
→ 순위 기반 관계3장 가설검정: 귀무가설·대립가설·P-value ★★★#
통계적 가설검정에서는 먼저 두 개의 가설을 세웁니다.
귀무가설 H₀#
일반적으로:
차이가 없다.
효과가 없다.
관계가 없다.라는 형태로 설정합니다.
대립가설 H₁#
귀무가설과 반대되는 주장입니다.
차이가 있다.
효과가 있다.
관계가 있다.예를 들어 새로운 교육방법이 기존 방법보다 효과가 있는지 확인한다고 가정합니다.
H₀
새 교육방법의 효과 차이가 없다.
H₁
새 교육방법의 효과 차이가 있다.P-value란 무엇인가#
P-value는 귀무가설이 참이라는 전제 아래 현재와 같은 결과가 관측될 가능성을 평가하는 값으로 사용됩니다.
시험에서는 일반적으로 다음 기준을 이용합니다.
P-value < 0.05
→ 통계적으로 유의
→ 귀무가설 기각반대로 기준보다 크거나 같으면 귀무가설을 기각하지 않는 방향으로 해석합니다.
4장 제1종 오류와 제2종 오류#
가설검정에서는 잘못된 판단이 발생할 수 있습니다.
제1종 오류#
귀무가설이 실제로 참인데 기각하는 오류입니다.
실제
정상
판단
환자즉 False Positive와 연결합니다.
제2종 오류#
귀무가설이 실제로 거짓인데 기각하지 못하는 오류입니다.
실제
환자
판단
정상즉 False Negative와 연결합니다.
시험용 비교#
| 구분 | 의미 |
|---|---|
| 제1종 오류 α | 참인 H₀를 기각 |
| 제2종 오류 β | 거짓인 H₀를 기각하지 못함 |
| 검정력 | 1 - β |
빠르게 기억하면:
1종
없는 것을 있다고 판단
2종
있는 것을 없다고 판단5장 정규분포와 Z-score ★★☆#
정규분포는 평균을 중심으로 좌우가 대칭인 종 모양의 확률분포입니다.
N(μ, σ²)로 표현합니다.
68-95-99.7 법칙#
정규분포에서는 평균을 중심으로:
μ ± 1σ
약 68.27%
μ ± 2σ
약 95.45%
μ ± 3σ
약 99.73%가 포함됩니다.
표준정규분포#
표준정규분포는:
평균 = 0
표준편차 = 1인 정규분포입니다.
Z-score#
Z-score는 관측값이 평균에서 표준편차 몇 개만큼 떨어져 있는지를 나타냅니다.
Z = (X - μ) / σ예:
Z = 0
→ 평균과 같음
Z = 1
→ 평균보다 1표준편차 높음
Z = -2
→ 평균보다 2표준편차 낮음따라서 Z=2를 단순히 평균보다 값이 2배 크다고 해석해서는 안 됩니다.
6장 회귀분석과 결정계수 R² ★★★#
회귀분석은 하나 이상의 독립변수를 이용해 종속변수의 변화를 설명하거나 예측하는 분석방법입니다.
단순 선형회귀#
독립변수가 하나인 경우입니다.
Y = β₀ + β₁X + ε각 항은:
β₀
절편
β₁
회귀계수
ε
오차항을 의미합니다.
회귀계수 해석#
β₁이 2라고 가정하면 다른 조건에서:
X가 1 증가할 때 Y가 약 2 증가한다.
는 형태로 해석합니다.
결정계수 R²#
결정계수는 회귀모형이 종속변수의 변동을 얼마나 설명하는지를 나타냅니다.
0 ≤ R² ≤ 1예:
R² = 0.8
→ 종속변수 변동의 약 80%를 모델이 설명변동의 분해#
SST = SSR + SSE그리고:
R² = SSR / SST또는:
R² = 1 - SSE / SST로 표현합니다.
단순회귀와 상관계수#
단순 선형회귀에서는:
R² = r²관계가 있습니다.
예:
r = 0.8
R²
= 0.8²
= 0.647장 RMSE와 최소제곱법#
최소제곱법 OLS#
Ordinary Least Squares는 잔차제곱합을 최소화하는 회귀계수를 찾는 방법입니다.
핵심은 단순히 잔차의 합이 아니라:
잔차의 제곱합을 최소화한다는 것입니다.
RMSE#
RMSE는 예측값과 실제값의 차이를 평가합니다.
RMSE = √[Σ(yi - ŷi)² / n]RMSE는 일반적으로:
작을수록
→ 예측 오차가 작음으로 해석합니다.
8장 다중회귀와 다중공선성 ★★★#
다중회귀는 여러 개의 독립변수를 사용합니다.
Y =
β₀
+ β₁X₁
+ β₂X₂
+ ...
+ βpXp
+ ε각 회귀계수는 다른 독립변수를 고정했을 때 해당 변수가 한 단위 증가하면 Y가 얼마나 변하는지 나타냅니다.
다중공선성이란 무엇인가#
독립변수들 사이에 강한 상관관계가 존재하는 현상입니다.
X1
↔ 강한 상관
X2다중공선성이 심하면 회귀계수 추정이 불안정해지고 해석하기 어려워질 수 있습니다.
VIF#
원고에서는:
VIF > 10
→ 다중공선성 의심기준을 제시합니다.
PCA 등을 이용해 문제를 완화할 수도 있습니다.
9장 회귀 변수 선택과 AIC·BIC#
회귀모형에 어떤 독립변수를 넣을지도 중요합니다.
전진선택법#
변수 없음
↓
유용한 변수 추가
↓
추가
↓
추가후진제거법#
전체 변수
↓
불필요한 변수 제거
↓
제거
↓
제거단계적 선택법#
전진선택과 후진제거를 함께 이용합니다.
AIC와 BIC#
둘 다 모델 비교에 사용할 수 있으며 원고에서는 작을수록 좋은 모형으로 정리합니다.
AIC
↓ 작을수록
BIC
↓ 작을수록BIC는 AIC보다 변수 수에 대한 패널티가 더 커 상대적으로 단순한 모형을 선호하는 특징이 있습니다.
R²가 무조건 가장 큰 모형만 선택하면 과적합 문제가 발생할 수 있으므로 다른 기준과 함께 판단합니다.
10장 로지스틱 회귀분석이란 무엇인가 ★★★#
일반적인 선형회귀가 연속형 값을 예측한다면 로지스틱 회귀는 범주형 결과를 예측하는 데 사용합니다.
대표적으로:
구매한다 / 구매하지 않는다
부도 / 정상
합격 / 불합격
1 / 0같은 문제입니다.
Sigmoid 함수#
로지스틱 회귀에서는 Sigmoid 함수를 이용해 출력값을 0과 1 사이로 변환합니다.
0 < P < 1따라서 결과를 확률 형태로 해석할 수 있습니다.
Odds#
사건이 발생할 확률 P가 있을 때:
Odds = P / (1-P)입니다.
예:
P = 0.8
Odds
= 0.8 / 0.2
= 4Odds Ratio#
두 그룹의 Odds를 비교합니다.
OR = 1
→ 동일
OR > 1
→ 첫 그룹 Odds가 큼
OR < 1
→ 두 번째 그룹 Odds가 큼11장 의사결정나무: Gini·Entropy·Information Gain ★★★#
의사결정나무는 조건을 반복적으로 나누어 최종 결과를 예측합니다.
나이 > 50?
├─ Yes
│ └─ 소득 > 300?
└─ No
└─ 소득 > 500?스무고개처럼 조건을 하나씩 적용한다고 생각하면 이해하기 쉽습니다.
주요 Node#
Root Node
→ 시작점
Internal Node
→ 중간 분기
Leaf Node
→ 최종 결과Gini Index#
Gini(D) = 1 - Σpj²Gini가 0에 가까울수록 하나의 Class로 구성된 순수한 Node에 가깝습니다.
Entropy#
Entropy(D)
= -Σ pi log₂(pi)Entropy 역시 낮을수록 불순도가 낮습니다.
Information Gain#
Information Gain
=
분할 전 Entropy
-
분할 후 Entropy정보이득이 클수록 좋은 분할로 판단합니다.
알고리즘 구분#
| 알고리즘 | 주요 기준 |
|---|---|
| CART | Gini |
| ID3·C4.5 | Entropy·Information Gain |
| CHAID | Chi-square |
정지규칙과 가지치기#
둘은 같은 개념이 아닙니다.
Stopping Rule
→ Tree를 더 이상 성장시키지 않음
Pruning
→ 이미 만들어진 가지를 제거둘 다 과적합을 줄이는 데 활용됩니다.
12장 앙상블: Bagging·Boosting·Voting·Stacking ★★★#
앙상블은 여러 Model의 예측을 결합해 하나의 Model보다 안정적인 결과를 얻는 방법입니다.
Bagging#
여러 Model을 독립적으로 학습시키고 결과를 결합합니다.
Model A ─┐
Model B ─┼→ 투표·평균 → 결과
Model C ─┘원고에서는:
병렬 학습
분산 감소
Random Forest와 연결합니다.
Boosting#
앞선 Model의 오류를 다음 Model이 계속 보완합니다.
Model 1
↓ 오류 보완
Model 2
↓ 오류 보완
Model 3대표적인 예:
AdaBoost
XGBoost
LightGBM원고에서는 순차 학습과 편향 감소를 핵심으로 설명합니다.
Voting#
여러 Model의 결과를 투표합니다.
Hard Voting
→ Class 다수결
Soft Voting
→ 예측확률 평균Stacking#
1단계 Model들의 예측값을 다시 다른 Meta Model의 입력으로 사용합니다.
Model A ─┐
Model B ─┼→ Meta Model → 최종 결과
Model C ─┘빠른 비교#
| 방법 | 핵심 |
|---|---|
| Bagging | 병렬·분산 감소 |
| Boosting | 순차·오류 보완 |
| Voting | 여러 예측을 투표 |
| Stacking | Meta Model로 결합 |
13장 인공신경망과 활성화 함수 ★★☆#
인공신경망은 여러 Node와 가중치를 연결하여 입력에서 출력으로 정보를 전달합니다.
Sigmoid#
출력값을 0과 1 사이로 변환합니다.
0 < output < 1원고에서는 이진 분류와 연결합니다.
Softmax#
여러 Class의 확률을 출력하는 데 사용합니다.
Class A
0.1
Class B
0.7
Class C
0.2따라서 다범주 분류와 연결합니다.
ReLU#
x < 0
→ 0
x > 0
→ x형태로 동작하며 은닉층 활성화 함수로 설명됩니다.
완전연결층의 가중치 수#
원고 예제:
Input 20
→ Hidden 50
→ Output 3Bias를 제외한 연결 가중치만 계산하면:
20 × 50
+
50 × 3
=
1,150입니다.
경사하강법#
Gradient Descent는 손실함수를 줄이는 방향으로 Parameter를 반복 갱신합니다.
Learning Rate가:
너무 큼
→ 발산 가능
너무 작음
→ 학습이 매우 느림이라는 관계를 기억합니다.
14장 군집분석과 K-means ★★☆#
군집분석은 정답 Label이 없는 데이터를 서로 비슷한 집단으로 묶는 분석입니다.
K-means#
K-means는 데이터를 K개의 Cluster로 나눕니다.
중요한 점은:
K
→ 사용자가 미리 지정한다는 것입니다.
알고리즘이 자동으로 적절한 K를 항상 결정한다고 생각하면 안 됩니다.
거리 측정#
Euclidean Distance#
두 점 사이의 직선거리를 계산합니다.
Manhattan Distance#
각 축에서 이동한 거리의 합으로 계산합니다.
Mahalanobis Distance#
변수 사이의 상관관계까지 고려하는 거리입니다.
Silhouette 계수#
군집 결과가 얼마나 잘 분리되어 있는지 평가합니다.
1에 가까움
→ 군집이 잘 분리됨
0 근처
→ 군집 경계
-1 근처
→ 잘못된 군집 가능계층적 군집 연결법#
| 방법 | 기준 |
|---|---|
| Single | 가장 가까운 점 |
| Complete | 가장 먼 점 |
| Average | 평균 거리 |
| Ward | 군집 내 오차제곱합 |
15장 연관규칙분석과 Apriori ★★★#
연관규칙분석은 여러 항목이 함께 발생하는 패턴을 찾습니다.
대표적인 예가 장바구니 분석입니다.
우유를 구매한 고객이 빵도 함께 구매하는가?
Apriori 알고리즘#
원고에서는 다음 흐름으로 정리합니다.
최소 Support 결정
↓
Frequent Itemset 탐색
↓
Association Rule 생성
↓
Confidence 계산
↓
Lift로 평가Support#
A와 B가 전체 거래에서 함께 등장하는 비율입니다.
Support(A→B)
=
A∩B 거래 수
/
전체 거래 수Confidence#
A를 구매한 사람 가운데 B도 구매한 비율입니다.
Confidence(A→B)
=
A∩B
/
ALift#
A를 구매했을 때 B 구매가 일반적인 B 구매보다 얼마나 증가하는지 봅니다.
Lift(A→B)
=
Confidence(A→B)
/ Support(B)해석:
Lift = 1
→ 독립
Lift > 1
→ 양의 연관
Lift < 1
→ 음의 연관계산 예제#
전체 거래 1,000건에서:
우유
400건
빵
300건
우유 + 빵
200건이라면:
Support
= 200 / 1000
= 0.2
Confidence
= 200 / 400
= 0.5
Lift
= 0.5 / 0.3
≈ 1.67입니다.
16장 Confusion Matrix와 분류모델 평가 ★★★#
분류모델을 평가하려면 단순히 몇 개를 맞혔는지만 봐서는 부족합니다.
Confusion Matrix#
| 실제 / 예측 | Positive | Negative |
|---|---|---|
| Positive | TP | FN |
| Negative | FP | TN |
의미는:
TP
실제 Positive를 Positive로 예측
TN
실제 Negative를 Negative로 예측
FP
실제 Negative를 Positive로 예측
FN
실제 Positive를 Negative로 예측입니다.
Accuracy#
전체 예측 가운데 맞춘 비율입니다.
Accuracy
=
(TP + TN)
/ (TP + TN + FP + FN)Precision#
Positive라고 예측한 것 가운데 실제 Positive인 비율입니다.
Precision
=
TP / (TP + FP)기억법:
내가 양성이라고 한 것 중 진짜 양성은?
Recall#
실제 Positive 가운데 Positive라고 찾아낸 비율입니다.
Recall
=
TP / (TP + FN)기억법:
실제 양성을 얼마나 놓치지 않고 찾아냈는가?
Specificity#
실제 Negative 가운데 Negative로 정확하게 예측한 비율입니다.
Specificity
=
TN / (TN + FP)F1-Score#
Precision과 Recall의 조화평균입니다.
F1
=
2 × Precision × Recall
/
(Precision + Recall)F1은 단순 산술평균이 아니라 조화평균이라는 점이 중요합니다.
17장 ROC Curve와 AUROC ★★★#
ROC Curve는 분류모델의 Threshold를 변화시키면서 성능을 살펴보는 그래프입니다.
축은:
X축
FPR
= 1 - Specificity
Y축
TPR
= Recall
= Sensitivity입니다.
AUROC#
ROC Curve 아래의 면적입니다.
원고에서의 핵심 기준은:
AUROC = 0.5
→ 무작위 수준
AUROC = 1.0
→ 완벽한 분류입니다.
따라서 일반적으로 AUROC가 클수록 분류능력이 높은 Model로 해석합니다.
18장 R 프로그래밍 기초 ★★☆#
ADsP에서는 복잡한 R 프로그램을 작성하는 것보다 기본 자료구조와 코드의 의미를 읽는 능력이 중요합니다.
Vector#
1차원 구조이며 같은 자료형의 원소를 저장합니다.
x <- c(1, 2, 3, 4, 5)Matrix#
2차원이며 같은 자료형을 저장합니다.
m <- matrix(1:6, nrow=2, ncol=3)Data Frame#
2차원 구조지만 Column마다 다른 자료형을 가질 수 있습니다.
df <- data.frame(
id = 1:3,
name = c("김철수", "이영희", "박민수"),
score = c(85, 92, 78)
)List#
서로 다른 자료형의 객체를 담을 수 있습니다.
x <- list(1, "A", TRUE)자료구조 비교#
| 구조 | 차원 | 자료형 |
|---|---|---|
| Vector | 1차원 | 동일 |
| Matrix | 2차원 | 동일 |
| Data Frame | 2차원 | Column별 다를 수 있음 |
| List | 1차원 형태 | 서로 다른 객체 가능 |
19장 R의 NA·NaN·NULL 차이#
NA#
Missing Value를 나타냅니다.
x <- c(10, 20, NA, 40)확인:
is.na(x)NaN#
Not a Number.
수학적으로 정의되지 않는 계산 결과를 의미합니다.
0 / 0NULL#
값이 없는 객체를 의미합니다.
NA를 제외하고 평균 계산#
mean(x, na.rm=TRUE)패키지 설치와 로드#
설치:
install.packages("패키지명")로드:
library(패키지명)즉:
install.packages()
→ 설치
library()
→ 로드입니다.
20장 R의 lm과 summary 결과 읽는 법 ★★★#
R에서 선형회귀는 lm()을 사용할 수 있습니다.
model <- lm(y ~ x1 + x2, data=df)
summary(model)시험에서는 직접 Model을 만드는 것보다 summary() 결과를 읽는 문제가 중요합니다.
Estimate#
회귀계수 추정값입니다.
예:
x1 Estimate = 2.3456이라면 다른 변수가 고정되었을 때 x1이 한 단위 증가하면 y가 약 2.3456 증가하는 형태로 해석합니다.
Std. Error#
회귀계수 추정치의 표준오차입니다.
t value#
Estimate / Std. Error관계로 이해합니다.
Pr(>|t|)#
해당 회귀계수의 P-value입니다.
원고에서는:
P < 0.05
→ 유의로 해석합니다.
Multiple R-squared#
Model의 결정계수 R²입니다.
Adjusted R-squared#
독립변수 수를 고려해 조정한 결정계수입니다.
단순 R²는 변수를 추가하면 증가하는 특성이 있기 때문에 이를 보정해 해석합니다.
F-statistic#
개별 변수가 아니라 회귀 Model 전체의 유의성을 판단하는 데 사용합니다.
21장 시계열분석과 ARIMA ★★★#
시계열 데이터는 시간 순서에 따라 관측된 데이터입니다.
예:
일별 주가
월별 매출
시간별 전력 사용량
분기별 GDP시계열의 4가지 구성요소#
추세
계절성
순환
불규칙암기:
추 · 계 · 순 · 불Trend#
장기간 지속되는 증가 또는 감소 경향입니다.
Seasonality#
일정한 주기로 반복되는 패턴입니다.
예:
여름마다 에어컨 판매 증가
주말마다 방문자 증가Cycle#
경기순환처럼 일정하지 않은 장기적인 변동입니다.
Irregular#
예측하기 어려운 우연한 변동입니다.
Seasonality와 Cycle#
Seasonality
→ 일정한 주기
Cycle
→ 불규칙한 장기 변동을 구분합니다.
22장 정상성과 AR·MA·ARIMA#
정상성 Stationarity#
시간이 변해도 평균과 분산 등 주요 통계적 특성이 일정한 상태로 설명됩니다.
비정상 시계열은 차분 Differencing을 이용해 정상화할 수 있습니다.
차분
=
현재 값 - 이전 값AR Model#
AutoRegressive.
자신의 과거 값을 사용해 현재 값을 설명합니다.
MA Model#
Moving Average.
과거의 오차항을 사용해 현재 값을 설명합니다.
ARIMA#
ARIMA(p,d,q)에서:
p
→ AR 차수
d
→ 차분 횟수
q
→ MA 차수입니다.
ARIMA의 I는:
Integrated를 의미합니다.
ACF와 PACF#
원고에서는:
AR(p)
→ PACF가 p에서 절단
MA(q)
→ ACF가 q에서 절단으로 정리합니다.
암기하면:
AR
→ PACF
MA
→ ACF입니다.
23장 K-NN은 어떻게 동작하는가 ★★☆#
K-NN은 새로운 데이터와 가까운 K개의 데이터를 찾아 결과를 결정합니다.
새 데이터
↓
가까운 K개 이웃 탐색
↓
분류: 다수결
회귀: 평균Lazy Learning#
K-NN은 별도의 복잡한 사전 Model 학습 없이 예측 시점에 주변 데이터를 이용하기 때문에 게으른 학습 Lazy Learning으로 설명됩니다.
K 값#
K가 너무 작음
→ 과적합 가능
K가 너무 큼
→ 과소적합 가능거리#
대표적으로:
Euclidean
Manhattan
Mahalanobis거리를 사용할 수 있습니다.
K-NN에서는 거리 기반으로 이웃을 판단하므로 Feature의 Scale 차이에 주의합니다.
24장 SVM이란 무엇인가 ★★☆#
SVM, Support Vector Machine은 두 Class를 나누는 경계 가운데 Margin을 최대화하는 경계를 찾습니다.
Hyperplane#
Class를 나누는 결정경계입니다.
Margin#
결정경계와 가장 가까운 데이터까지의 여유 공간입니다.
Support Vector#
Margin 경계에 위치하여 Hyperplane 결정에 직접 영향을 주는 데이터입니다.
Class A
●
------ Margin
====== Hyperplane
------ Margin
▲
Class BKernel Trick#
선형으로 나누기 어려운 데이터를 더 높은 차원으로 표현해 분리할 수 있도록 합니다.
대표 Kernel:
Linear
RBF
Polynomial
SigmoidC Parameter#
원고에서는:
C 증가
→ 오류 허용을 줄이는 방향
C 감소
→ Soft Margin 성격 강화로 정리합니다.
SVM은 분류뿐 아니라 SVR을 이용한 회귀에도 사용할 수 있습니다.
25장 PCA 주성분분석이란 무엇인가 ★★☆#
PCA는 고차원 데이터를 더 적은 수의 새로운 변수로 표현하는 차원축소 기법입니다.
주성분#
원래 변수들의 선형결합으로 만들어집니다.
첫 번째 주성분은 데이터의 분산을 가장 많이 설명하는 방향입니다.
PC1
→ 가장 큰 분산
PC2
→ 그다음 분산
PC3
→ 그다음주성분들은 서로 직교하는 방향으로 생성됩니다.
PCA 활용#
차원 축소
Visualization
Noise 감소
다중공선성 완화등에 사용할 수 있습니다.
26장 T-test·ANOVA·카이제곱 검정 ★★☆#
T-test#
두 평균의 차이를 검정합니다.
단일표본 T-test#
표본평균
vs
기준 평균독립표본 T-test#
서로 독립된 두 집단의 평균을 비교합니다.
대응표본 T-test#
같은 대상의 전후 값을 비교합니다.
예:
다이어트 전 체중
vs
다이어트 후 체중ANOVA#
세 집단 이상의 평균 차이를 검정합니다.
T-test
→ 두 집단
ANOVA
→ 세 집단 이상ANOVA의 귀무가설은 모든 집단의 평균이 같다는 형태입니다.
Chi-square Test#
원고에서는 다음 세 가지를 구분합니다.
적합도 검정
→ 관측분포와 기대분포 비교
독립성 검정
→ 두 범주형 변수의 관계
동질성 검정
→ 여러 집단의 분포 비교27장 정규화와 표준화 ★★☆#
Feature Scale이 크게 다르면 거리 기반 알고리즘이나 일부 분석에서 문제가 될 수 있습니다.
Normalization#
Min-Max Scaling.
값을 0~1 범위로 변환합니다.
Xnorm
=
(X - Xmin)
/
(Xmax - Xmin)Standardization#
Z-score 방식입니다.
Xstd
=
(X - mean)
/ std결과는 평균 0, 표준편차 1 형태로 변환됩니다.
차이#
| 구분 | 정규화 | 표준화 |
|---|---|---|
| 대표 방식 | Min-Max | Z-score |
| 결과 | 주로 0~1 | 평균 0·표준편차 1 |
| 이상치 영향 | 상대적으로 큼 | 상대적으로 덜함 |
28장 결측값과 이상치 처리#
결측값 처리#
원고에서는 다음 방법을 제시합니다.
행 삭제
평균·중앙값 대체
보간
예측 Model로 대체이상치 탐지#
대표적인 방법:
IQR
Z-score
ESD입니다.
IQR에서는:
Q1 - 1.5 × IQR 미만
또는
Q3 + 1.5 × IQR 초과값을 이상치 후보로 판단합니다.
Z-score 방식에서는 원고가:
|Z| > 3을 대표적인 기준으로 제시합니다.
29장 Naive Bayes란 무엇인가 ★☆☆#
Naive Bayes는 Bayes 정리를 기반으로 한 확률적 분류방법입니다.
Bayes 정리:
P(A|B)
=
P(B|A) × P(A)
/ P(B)핵심 가정#
Naive Bayes는 Feature들이 서로 독립이라고 가정합니다.
Feature A
Feature B
Feature C
→ 서로 독립이라고 가정현실에서는 항상 독립인 것은 아니지만 이러한 단순한 가정 덕분에 계산이 빠릅니다.
대표적인 활용:
Spam 분류
문서 분류
감성 분석30장 텍스트마이닝과 TF-IDF ★★☆#
텍스트마이닝은 비정형 Text 데이터에서 패턴과 정보를 추출하는 분석방법입니다.
대표적인 활용:
감성 분석
문서 분류
정보 추출
Chatbot
Topic Modeling기본 전처리 흐름#
원고에서는 다음 순서를 제시합니다.
Tokenization
↓
Stopword 제거
↓
Stemming·Lemmatization
↓
Vectorization
↓
분석Bag of Words#
문서를 단어의 집합으로 표현합니다.
핵심 특징:
단어 순서
→ 무시
단어 출현
→ 중요단순하고 구현이 쉽지만 문맥과 단어 순서를 잃는다는 한계가 있습니다.
TF-IDF#
단어의 중요도를 평가합니다.
TF-IDF
=
TF × IDFTF
해당 문서에서 단어가 얼마나 많이 등장하는지 나타냅니다.
IDF
많은 문서에 흔하게 등장하는 단어의 중요도를 낮춥니다.
따라서:
많은 문서에서 흔하게 등장
→ IDF 낮음
특정 문서에서 특징적으로 등장
→ TF-IDF 높아질 가능성입니다.
31장 LDA 토픽모델링과 감성분석#
LDA#
Latent Dirichlet Allocation은 문서 집합에서 숨겨진 Topic을 찾아내는 Topic Modeling 방법입니다.
원고에서는 다음과 같이 정리합니다.
한 문서
→ 여러 Topic의 혼합
한 Topic
→ 여러 단어의 확률분포LDA는 비지도 학습이며 Topic 수 K는 사용자가 정합니다.
감성분석#
Text를:
긍정
부정
중립등으로 분류합니다.
상품 Review나 SNS 분석 등에 활용됩니다.
32장 사회연결망 분석 SNA ★★☆#
Social Network Analysis는 사람이나 조직 같은 대상 사이의 관계를 Network로 분석합니다.
기본 구성#
Node
→ 사람·조직·객체
Edge
→ 관계Density#
실제 연결 수가 가능한 전체 연결에서 차지하는 정도입니다.
중심성#
Degree Centrality#
직접 연결된 Node가 얼마나 많은지를 봅니다.
Closeness Centrality#
다른 모든 Node까지 얼마나 가까운지를 봅니다.
거리가 짧을수록 중심성이 높습니다.
Betweenness Centrality#
다른 Node 사이의 최단경로에 얼마나 자주 위치하는지 나타냅니다.
정보 전달의 중개자 역할과 연결됩니다.
Eigenvector Centrality#
단순히 연결 수뿐 아니라 중요한 Node와 연결되어 있는가까지 고려합니다.
빠른 암기#
Degree
→ 직접 연결
Closeness
→ 거리
Betweenness
→ 중간 경로
Eigenvector
→ 중요한 이웃33장 교차검증과 K-Fold ★★★#
머신러닝 Model이 Training Data에만 잘 맞는 것이 아니라 새로운 데이터에서도 잘 동작하는지 확인해야 합니다.
이를 위해 교차검증을 사용할 수 있습니다.
Hold-out#
전체 데이터를 한 번 나누어:
Training Set
+
Validation·Test Set으로 사용합니다.
빠르고 단순하지만 데이터가 적으면 평가 결과가 불안정할 수 있습니다.
K-Fold#
전체 데이터를 K개의 Fold로 나눕니다.
K=5라면:
1회
Fold 1 검증
나머지 학습
2회
Fold 2 검증
나머지 학습
...
5회
Fold 5 검증
나머지 학습최종적으로 여러 평가 결과를 평균합니다.
LOOCV#
Leave-One-Out Cross Validation.
데이터 하나만 검증용으로 사용하고 나머지를 Training에 사용합니다.
이를 전체 데이터에 반복합니다.
데이터 활용률은 높지만 계산량이 큽니다.
34장 과적합과 과소적합 ★★★#
Overfitting#
Training Data를 지나치게 세밀하게 학습해 새로운 데이터에서는 성능이 떨어지는 상태입니다.
Training Error
낮음
Test Error
높음원고에서는:
Bias
낮음
Variance
높음과 연결합니다.
Underfitting#
Model이 너무 단순해 Training Data의 기본 Pattern조차 충분히 학습하지 못한 상태입니다.
Training Error
높음
Test Error
높음그리고:
Bias
높음
Variance
낮음과 연결합니다.
Bias-Variance Trade-off#
너무 단순
→ Bias 증가
→ Underfitting
너무 복잡
→ Variance 증가
→ Overfitting따라서 두 문제 사이의 적절한 균형이 필요합니다.
35장 과적합을 방지하는 방법#
원고에서는 여러 방법을 제시합니다.
Pruning#
Decision Tree의 불필요한 가지를 제거합니다.
Regularization#
Model이 너무 복잡해지지 않도록 Penalty를 부여합니다.
Dropout#
Neural Network 학습 과정에서 일부 Node를 임의로 비활성화합니다.
Cross-Validation#
다양한 데이터 구간에서 Model을 평가합니다.
Training Data 증가#
더 많은 학습 데이터를 확보합니다.
Ensemble#
여러 Model을 결합해 안정성을 높입니다.
36장 Ridge와 LASSO 차이 ★★★#
둘 다 회귀계수에 Penalty를 적용하는 Regularization 기법입니다.
Ridge#
L2 Regularization.
회귀계수의 제곱합에 Penalty를 줍니다.
계수를 작게 만듦
하지만 일반적으로 완전히 0으로 만들지는 않음따라서 모든 변수를 유지하는 성격이 있습니다.
LASSO#
L1 Regularization.
회귀계수 절댓값의 합에 Penalty를 줍니다.
일부 회귀계수를 정확히 0으로 만들 수 있기 때문에 변수선택 효과를 가질 수 있습니다.
비교#
| 구분 | Ridge | LASSO |
|---|---|---|
| Penalty | L2 | L1 |
| 계수 | 0 근처로 축소 | 일부 0 가능 |
| 변수선택 | 일반적으로 유지 | 가능 |
37장 데이터 시각화와 R 함수 ★★★#
시험에서는 어떤 데이터에 어떤 Chart가 적합한지뿐 아니라 R 코드가 무엇을 그리는지도 확인해야 합니다.
| R 함수 | Chart | 주요 목적 |
|---|---|---|
hist() |
Histogram | 연속형 분포 |
boxplot() |
Box Plot | 분포·이상치 |
plot(x,y) |
Scatter Plot | 두 변수 관계 |
barplot() |
Bar Chart | 범주 비교 |
pie() |
Pie Chart | 구성비 |
Histogram#
hist(x)연속형 데이터의 분포를 확인합니다.
Box Plot#
boxplot(x)또는 그룹 비교:
boxplot(score ~ group, data=df)Scatter Plot#
plot(x, y)두 변수의 관계를 확인합니다.
Line Chart#
원고에서는:
plot(x, y, type="l")처럼 type="l"을 이용한 선그래프도 구분합니다.
Box Plot에서 기억할 것#
Box
→ Q1 ~ Q3
Box 안 선
→ Median
점
→ Outlier평균을 기본적으로 직접 표시하는 Chart라고 생각하면 안 됩니다.
38장 조건부확률과 계산문제 정리 ★★★#
조건부확률#
P(A|B)
=
P(A∩B)
/ P(B)예를 들어 전체 사람 가운데 남성이 60명이고 안경을 쓴 남성이 24명이라면:
P(안경 | 남성)
=
24 / 60
=
0.4입니다.
연관규칙#
Support
= A∩B / 전체
Confidence
= A∩B / A
Lift
= Confidence / Support(B)Confusion Matrix#
Accuracy
= (TP + TN) / 전체
Precision
= TP / (TP + FP)
Recall
= TP / (TP + FN)
F1
= 2PR / (P + R)이 네 공식은 직접 계산할 수 있도록 익혀두는 것이 좋습니다.
39장 기타 빈출 분석 개념#
3과목에는 큰 분석기법 외에도 독립적으로 출제될 수 있는 여러 개념이 포함됩니다.
MDS#
Multidimensional Scaling.
대상 사이의 거리정보를 이용해 저차원 공간에 배치합니다.
Cosine Similarity#
두 Vector의 방향이 얼마나 비슷한지를 비교하는 유사도입니다.
SOM#
Self-Organizing Map.
고차원 데이터를 저차원 지도 형태로 표현하는 비지도 신경망 기반 방법입니다.
ESD#
Extreme Studentized Deviation.
원고에서는 평균으로부터 일정 표준편차 이상 떨어진 값을 이용한 이상치 탐색방법으로 설명합니다.
Poisson Distribution#
일정 시간이나 영역에서 사건이 몇 번 발생하는지를 표현하는 이산형 확률분포입니다.
Lift Curve#
무작위 Model과 비교해 분류 Model이 어느 정도 성능 향상을 보이는지 평가합니다.
Content-based Filtering#
사용자가 과거에 좋아했던 Item의 특성과 비슷한 Item을 추천합니다.
사용자가 좋아한 Item 특징
↓
비슷한 Item 탐색
↓
추천Genetic Algorithm#
생물학적 진화과정을 모방한 최적화 방식입니다.
선택
교차
변이과정을 통해 해를 탐색합니다.
40장 ADsP 3과목 핵심 공식 한 번에 보기#
Z-score#
Z
=
(X - μ) / σPearson 상관계수#
r
=
Cov(X,Y)
/ (σx × σy)회귀 변동#
SST
=
SSR + SSE결정계수#
R²
=
SSR / SST
또는
R²
=
1 - SSE/SSTRMSE#
RMSE
=
√[Σ(yi - ŷi)² / n]Odds#
Odds
=
P / (1-P)Gini#
Gini
=
1 - Σpj²Entropy#
Entropy
=
-Σ pi log₂(pi)Support#
Support(A→B)
=
P(A∩B)Confidence#
Confidence(A→B)
=
P(A∩B) / P(A)Lift#
Lift
=
Confidence(A→B)
/ P(B)Accuracy#
(TP + TN)
/ 전체Precision#
TP
/
(TP + FP)Recall#
TP
/
(TP + FN)Specificity#
TN
/
(TN + FP)F1-Score#
2 × Precision × Recall
/
(Precision + Recall)Min-Max Normalization#
(X - Xmin)
/ (Xmax - Xmin)Standardization#
(X - mean)
/ std41장 시험에서 자주 헷갈리는 개념 총정리#
r과 R²#
r
→ -1 ~ +1
→ 관계의 방향과 강도
R²
→ 0 ~ 1
→ 회귀모형 설명력Precision과 Recall#
Precision
→ 예측 Positive 기준
→ FP와 관련
Recall
→ 실제 Positive 기준
→ FN과 관련Bagging과 Boosting#
Bagging
→ 병렬
→ Random Forest
→ 분산 감소
Boosting
→ 순차
→ XGBoost·AdaBoost
→ 앞선 오류 보완Gini와 Entropy#
낮을수록
→ Node가 더 순수K-means#
K
→ 사용자가 지정Lift#
1
→ 독립
1 초과
→ 양의 연관
1 미만
→ 음의 연관ARIMA#
AR
→ PACF
MA
→ ACFK-NN#
K 너무 작음
→ Overfitting
K 너무 큼
→ UnderfittingRidge와 LASSO#
Ridge
→ L2
→ 변수 유지
LASSO
→ L1
→ 일부 계수 0
→ 변수선택 효과정규화와 표준화#
Normalization
→ Min-Max
→ 0~1
Standardization
→ Z-score
→ 평균 0·표준편차 142장 ADsP 3과목 5분 최종 암기#
시험 직전에는 다음 내용부터 빠르게 확인합니다.
모수
→ 모집단
통계량
→ 표본P < 0.05
→ 유의
→ H₀ 기각1종 오류
→ False Positive
2종 오류
→ False Negative정규분포
1σ
68%
2σ
95%
3σ
99.7%r
-1 ~ +1
R²
0 ~ 1VIF > 10
→ 다중공선성 의심Logistic Regression
→ 범주형 종속변수
→ SigmoidCART
→ Gini
ID3·C4.5
→ Entropy
CHAID
→ Chi-squareBagging
→ 병렬
→ Random Forest
Boosting
→ 순차
→ XGBoost·AdaBoostK-means
→ K 직접 지정Support
전체 중 A+B
Confidence
A 중 A+B
Lift
1이 독립 기준Precision
TP / (TP+FP)
Recall
TP / (TP+FN)
F1
Precision과 Recall의 조화평균ROC
X축
FPR
Y축
TPRAUROC
0.5
무작위
1.0
완벽시계열
추세
계절
순환
불규칙AR
→ PACF
MA
→ ACF
ARIMA
→ p,d,qK-NN
K 작음
→ 과적합
K 큼
→ 과소적합SVM
→ Margin 최대화
→ Support Vector
→ Kernel TrickPCA
→ 차원축소
→ 분산이 큰 방향
→ 다중공선성 완화T-test
→ 두 집단 평균
ANOVA
→ 세 집단 이상 평균Normalization
→ 0~1
Standardization
→ 평균 0
→ 표준편차 1TF-IDF
→ 중요한 단어 가중
LDA
→ Topic Modeling
→ 비지도Cross Validation
→ 일반화 성능 평가
Overfitting
→ Training에 지나치게 특화
Underfitting
→ Model이 너무 단순ADsP 3과목 데이터 분석 FAQ#
ADsP 3과목에서는 무엇을 공부하는가#
통계 기초, 가설검정, 확률분포, 회귀분석, 의사결정나무, 앙상블, 인공신경망, 군집분석, 연관규칙분석, 분류모델 평가, ROC·AUROC, R 프로그래밍, 시계열분석, K-NN, SVM, PCA, 통계적 검정, 데이터 전처리, 텍스트마이닝, 사회연결망 분석, 교차검증과 과적합 등을 학습합니다.
P-value가 0.05보다 작으면 어떻게 해석하는가#
시험에서는 일반적으로 유의수준을 0.05로 두었을 때:
P-value < 0.05
→ 통계적으로 유의
→ 귀무가설 기각으로 판단합니다.
상관계수 r과 결정계수 R²는 무엇이 다른가#
상관계수 r은 두 변수 사이의 선형관계 방향과 강도를 나타내며 -1에서 +1 사이입니다.
결정계수 R²는 회귀 Model이 종속변수의 변동을 얼마나 설명하는지 나타내며 0에서 1 사이입니다.
다중공선성이란 무엇인가#
다중회귀에서 독립변수끼리 강하게 상관되어 회귀계수 추정이 불안정해지는 문제입니다. 원고에서는 VIF가 10을 초과하면 다중공선성을 의심하는 기준을 제시합니다.
로지스틱 회귀와 선형회귀의 차이는 무엇인가#
선형회귀는 연속형 값을 설명하거나 예측하고, 로지스틱 회귀는 0/1과 같은 범주형 결과의 확률을 예측하는 데 사용합니다.
Random Forest는 Bagging인가 Boosting인가#
Random Forest는 원고에서 Bagging 계열의 대표 알고리즘으로 정리합니다.
반면 XGBoost·LightGBM·AdaBoost는 Boosting 계열입니다.
Precision과 Recall 차이는 무엇인가#
Precision은 Positive라고 예측한 것 중 실제 Positive의 비율입니다.
Recall은 실제 Positive 가운데 Model이 Positive라고 찾아낸 비율입니다.
Precision
→ 예측 기준
Recall
→ 실제 기준으로 기억하면 쉽습니다.
AUROC가 0.5면 어떤 의미인가#
원고에서는 AUROC 0.5를 무작위 예측 수준으로 설명하고, 1.0을 완벽한 분류에 해당하는 값으로 정리합니다.
K-means에서 K는 자동으로 정해지는가#
아닙니다. 원고에서는 K를 사용자가 사전에 설정해야 하는 값으로 정리합니다.
K-NN의 K가 너무 크면 어떻게 되는가#
주변 데이터를 너무 넓게 사용하게 되면서 경계가 지나치게 단순해져 과소적합이 발생할 수 있습니다.
반대로 K가 지나치게 작으면 특정 데이터에 민감해져 과적합 위험이 커집니다.
SVM의 목표는 무엇인가#
두 Class 사이를 나누는 Hyperplane 가운데 Margin을 최대화하는 경계를 찾는 것입니다. Margin 경계에 있는 Support Vector가 결정경계 형성에 중요한 역할을 합니다.
PCA는 왜 사용하는가#
고차원 데이터의 정보를 가능한 한 유지하면서 더 적은 차원으로 표현하는 데 사용합니다. 시각화, 차원축소, Noise 감소, 다중공선성 완화 등에 활용할 수 있습니다.
T-test와 ANOVA의 차이는 무엇인가#
시험용 핵심 구분은:
T-test
→ 두 집단 평균 비교
ANOVA
→ 세 집단 이상 평균 비교입니다.
TF-IDF란 무엇인가#
문서 안에서 자주 등장하면서 전체 문서에서는 상대적으로 드물게 등장하는 단어에 더 높은 중요도를 주는 방식입니다.
LDA란 무엇인가#
문서 집합에 숨어 있는 Topic을 찾아내는 Topic Modeling 기법입니다. 원고에서는 비지도 학습이며 Topic 수 K를 사용자가 지정하는 방식으로 설명합니다.
Overfitting과 Underfitting은 어떻게 다른가#
Overfitting은 Training Data에 지나치게 맞춰져 새로운 데이터에서 성능이 떨어지는 상태입니다.
Underfitting은 Model이 너무 단순하여 Training Data의 Pattern조차 충분히 학습하지 못하는 상태입니다.
자기 점검#
다음 질문에 바로 답할 수 있다면 ADsP 3과목의 핵심 구조가 상당 부분 정리된 것입니다.
- 모수와 통계량의 차이를 설명할 수 있는가?
- 귀무가설과 대립가설을 구분할 수 있는가?
- 제1종 오류와 제2종 오류를 설명할 수 있는가?
- 표준정규분포의 평균과 표준편차를 알고 있는가?
- Z-score의 의미를 설명할 수 있는가?
- r과 R²의 범위와 의미를 구분할 수 있는가?
- SST·SSR·SSE 관계를 기억하는가?
- VIF가 무엇을 평가하는지 알고 있는가?
- 선형회귀와 로지스틱 회귀를 구분할 수 있는가?
- Gini와 Entropy의 의미를 설명할 수 있는가?
- CART·C4.5·CHAID를 구분할 수 있는가?
- Bagging과 Boosting의 차이를 설명할 수 있는가?
- Sigmoid·Softmax·ReLU의 차이를 구분할 수 있는가?
- K-means에서 K를 누가 결정하는지 알고 있는가?
- Support·Confidence·Lift 공식을 사용할 수 있는가?
- TP·TN·FP·FN을 구분할 수 있는가?
- Precision과 Recall 공식을 혼동하지 않는가?
- F1-Score가 조화평균이라는 것을 알고 있는가?
- ROC Curve의 X축과 Y축을 알고 있는가?
- AUROC 0.5와 1.0의 의미를 설명할 수 있는가?
- R의 Vector·Matrix·Data Frame·List를 구분할 수 있는가?
- NA·NaN·NULL 차이를 구분할 수 있는가?
install.packages()와library()의 차이를 알고 있는가?summary(lm())에서 Estimate·P-value·R²·F-statistic을 읽을 수 있는가?- 시계열의 추세·계절·순환·불규칙 요소를 구분할 수 있는가?
- AR과 MA를 ACF·PACF와 연결할 수 있는가?
- ARIMA의 p·d·q가 무엇인지 알고 있는가?
- K-NN에서 K가 너무 작거나 클 때 발생하는 문제를 알고 있는가?
- SVM의 Margin과 Support Vector를 설명할 수 있는가?
- PCA의 목적을 설명할 수 있는가?
- T-test와 ANOVA를 구분할 수 있는가?
- 정규화와 표준화를 구분할 수 있는가?
- Naive Bayes의 핵심 가정을 알고 있는가?
- TF-IDF와 LDA가 무엇인지 설명할 수 있는가?
- SNA의 네 가지 중심성을 구분할 수 있는가?
- Hold-out과 K-Fold 차이를 설명할 수 있는가?
- Overfitting과 Underfitting을 구분할 수 있는가?
- Ridge와 LASSO의 차이를 설명할 수 있는가?
이 글을 마치며#
ADsP 3과목 데이터 분석은 처음 보면 공식과 알고리즘 이름이 많아 가장 복잡하게 느껴질 수 있습니다.
하지만 실제로는 몇 개의 큰 질문으로 나누면 구조가 명확해집니다.
데이터에 차이가 있는가?
→ 가설검정
변수끼리 어떤 관계가 있는가?
→ 상관분석
숫자를 예측하고 싶은가?
→ 회귀분석
Class를 예측하고 싶은가?
→ 분류
정답 없이 비슷한 데이터를 묶고 싶은가?
→ 군집분석
함께 발생하는 Pattern을 찾고 싶은가?
→ 연관규칙
분류 Model이 얼마나 좋은가?
→ Confusion Matrix·ROC·AUROC
시간에 따른 변화를 예측하고 싶은가?
→ 시계열분석머신러닝 알고리즘 역시 이름만 외우기보다 작동방식으로 연결하면 기억하기 쉽습니다.
Decision Tree
→ 질문을 반복하며 분기
Random Forest
→ 여러 Tree를 결합
Boosting
→ 이전 오류를 다음 Model이 보완
K-NN
→ 가까운 이웃으로 판단
SVM
→ Margin이 가장 큰 경계 탐색
PCA
→ 데이터의 주요 분산 방향으로 차원축소그리고 평가단계에서는 다음 관계를 확실하게 구분해야 합니다.
Accuracy
→ 전체 중 얼마나 맞혔는가
Precision
→ Positive라고 한 것 중 얼마나 맞았는가
Recall
→ 실제 Positive를 얼마나 찾아냈는가
F1
→ Precision과 Recall의 균형
AUROC
→ Threshold 전반의 분류능력ADsP 3과목은 개념과 공식, 해석을 따로 외우는 것보다 하나의 분석과정으로 연결해서 이해하는 것이 중요합니다.
데이터 준비
↓
통계적 특성 파악
↓
분석 방법 선택
↓
Model 학습
↓
성능 평가
↓
결과 해석이 흐름을 잡고 회귀분석 → 의사결정나무·앙상블 → 연관분석 → Confusion Matrix·AUROC → R → 시계열 → K-NN·SVM·PCA → 교차검증·과적합 순으로 반복해서 확인하면 3과목 전체를 한 페이지에서 빠르게 복습할 수 있습니다.