회귀분석 기초란? 상관계수 r·결정계수 R²·SST·SSR·SSE·RMSE·VIF 쉽게 이해하기
1장 회귀분석에서 가장 먼저 기억해야 할 숫자#
회귀분석 문제를 풀다 보면 비슷해 보이는 여러 숫자가 한꺼번에 등장합니다.
대표적으로:
- 상관계수 r
- 결정계수 R²
- p-value
- VIF
- AUROC
가 있습니다.
하지만 각각 의미와 범위가 다릅니다.
먼저 시험에서 자주 사용하는 기준부터 정리하면 다음과 같습니다.
| 지표 | 범위·기준 | 핵심 의미 |
|---|---|---|
| 상관계수 r | -1 ~ +1 | 두 변수의 선형 관계 방향과 강도 |
| 결정계수 R² | 0 ~ 1 | 회귀모형의 설명력 |
| p-value | 0.05 기준 | 0.05 미만이면 통계적으로 유의 |
| VIF | 10 기준 | 10 초과 시 다중공선성 의심 |
| AUROC | 0.5 ~ 1.0 | 0.5 무작위, 1.0 완벽한 분류 |
이 가운데 이번 글에서는 회귀분석과 직접 연결되는 r, R², p-value, VIF, SST·SSR·SSE, RMSE를 중심으로 살펴봅니다.
2장 회귀분석이란 무엇인가#
회귀분석은 변수 사이의 관계를 이용하여 한 변수의 값을 설명하거나 예측하는 분석방법입니다.
예를 들어 다음과 같은 질문을 생각할 수 있습니다.
광고비가 증가하면 매출은 얼마나 증가할까?
공부시간이 늘어나면 시험점수는 어떻게 변할까?
집의 면적이 커질수록 가격은 얼마나 높아질까?
이런 문제에서는 한 변수의 변화가 다른 변수와 어떤 관계를 가지는지 분석합니다.
일반적으로 설명이나 원인 쪽에 놓는 변수를 독립변수, 설명하거나 예측하려는 대상을 종속변수라고 합니다.
예를 들어:
광고비 → 독립변수
매출 → 종속변수
로 생각할 수 있습니다.
3장 상관계수 r이란 무엇인가#
상관계수 r은 두 변수 사이의 선형 관계가 어느 방향으로 얼마나 강하게 나타나는지 보여주는 값입니다.
범위는:
-1 ≤ r ≤ +1
입니다.
따라서 상관계수에서는 두 가지를 봅니다.
첫째:
부호
→ 관계의 방향
둘째:
절댓값의 크기
→ 관계의 강도
입니다.
4장 상관계수의 부호는 무엇을 의미하는가#
r > 0#
양의 상관관계입니다.
한 변수가 증가할 때 다른 변수도 증가하는 경향을 보입니다.
예:
공부시간 증가
→ 시험점수 증가
r < 0#
음의 상관관계입니다.
한 변수가 증가할 때 다른 변수는 감소하는 경향을 보입니다.
예:
상품 가격 증가
→ 수요 감소
r = 0#
선형 관계가 없음을 의미합니다.
핵심#
양수 = 같이 움직임
음수 = 반대로 움직임
0 = 선형 관계 없음
입니다.
5장 r = 1은 무엇을 의미하는가#
r = 1이면 완전한 양의 선형 관계입니다.
한 변수가 증가할 때 다른 변수도 완벽하게 일정한 선형 관계를 가지고 증가합니다.
예를 들어 X가 일정하게 증가할 때 Y도 정확하게 일정 비율로 증가한다면 r은 1에 가까워질 수 있습니다.
핵심#
r = +1 → 완전한 양의 선형 관계
입니다.
6장 r = -1은 무엇을 의미하는가#
r = -1이면 완전한 음의 선형 관계입니다.
한 변수가 증가할수록 다른 변수는 완벽하게 일정한 선형 관계를 가지고 감소합니다.
핵심#
r = -1 → 완전한 음의 선형 관계
입니다.
7장 r = 0은 정말 아무 관계도 없다는 뜻인가#
제공된 학습자료에서는 r = 0을 선형 관계 없음으로 설명합니다.
이 표현이 중요합니다.
상관계수 r은 두 변수 사이의 선형적인 관계를 측정합니다.
따라서 r = 0이라고 해서 모든 종류의 관계가 반드시 존재하지 않는다고 단정하기보다 시험에서는:
선형 관계가 없다
라고 기억하는 것이 안전합니다.
8장 상관계수는 인과관계를 의미하지 않는다#
ADsP에서 반드시 기억해야 하는 핵심입니다.
두 변수 사이의 상관관계가 강하다고 해서:
X가 Y의 원인이다.
라고 바로 결론 내릴 수 없습니다.
즉:
상관관계 ≠ 인과관계
입니다.
예를 들어 아이스크림 판매량과 물놀이 사고가 동시에 증가할 수 있습니다.
하지만 아이스크림을 많이 팔아서 사고가 증가했다고 볼 수는 없습니다.
여름철 기온이라는 다른 요인이 두 변수를 함께 증가시킬 수 있기 때문입니다.
시험 핵심#
상관계수는 관계를 나타낼 뿐 인과관계를 증명하지 않는다
입니다.
9장 피어슨 상관계수란 무엇인가#
제공된 학습자료에서는 피어슨 상관계수를 다음과 같이 표현합니다.
r = Cov(X,Y) / (σₓ × σᵧ)
즉:
공분산 ÷ 두 변수의 표준편차의 곱
입니다.
표본 형태의 계산식은 다음과 같이 제시할 수 있습니다.
r = Σ(xᵢ-x̄)(yᵢ-ȳ) / √[Σ(xᵢ-x̄)² × Σ(yᵢ-ȳ)²]
시험에서는 복잡한 계산 자체보다 r이 -1에서 +1 사이이고 선형 관계의 방향과 강도를 나타낸다는 의미를 먼저 이해하는 것이 중요합니다.
10장 공분산과 상관계수의 관계#
피어슨 상관계수 공식에는 공분산 Covariance가 등장합니다.
공분산은 두 변수가 함께 움직이는 방향을 나타낼 수 있습니다.
하지만 공분산은 변수의 단위와 크기에 영향을 받을 수 있습니다.
이를 두 변수의 표준편차로 나누어 일정한 범위로 만든 것이 상관계수라고 이해하면 쉽습니다.
그래서 상관계수 r은:
-1 ~ +1
이라는 일정한 범위에서 관계를 비교할 수 있습니다.
11장 결정계수 R²란 무엇인가#
결정계수 R²는 회귀모형이 종속변수의 변동을 얼마나 설명하는지 나타내는 값입니다.
범위는:
0 ≤ R² ≤ 1
입니다.
값이 1에 가까울수록 회귀모형의 설명력이 높습니다.
예#
R² = 0.8
이라면 제공된 학습자료에서는:
종속변수 전체 변동의 약 80%를 회귀모형이 설명
한다고 해석합니다.
12장 R² = 1은 무엇을 의미하는가#
R² = 1이면:
100% 설명력
입니다.
즉 회귀모형이 관측된 종속변수의 변동을 완벽하게 설명하는 상태입니다.
핵심#
R² = 1 → 완벽한 설명
입니다.
13장 R² = 0은 무엇을 의미하는가#
R² = 0이면 제공된 학습자료에서는:
설명력 없음
으로 정리합니다.
즉 해당 회귀모형의 독립변수들이 종속변수의 변동을 설명하지 못하는 상태로 이해합니다.
핵심#
R² = 0 → 설명력 없음
입니다.
14장 R² = 0.8을 어떻게 해석할까#
R² = 0.8이라면:
회귀모형이 종속변수 변동의 80%를 설명한다.
고 해석할 수 있습니다.
여기서 주의할 점은:
예측값의 80%가 맞았다.
라는 의미와 동일한 것은 아니라는 점입니다.
결정계수는 종속변수의 변동에 대한 설명 비율을 나타냅니다.
시험에서는:
R² = 설명력
이라고 기억하는 것이 가장 중요합니다.
15장 r과 R²는 같은 값인가#
아닙니다.
상관계수 r과 결정계수 R²는 서로 다른 개념입니다.
r#
범위:
-1 ~ +1
의미:
두 변수 사이 선형 관계의 방향과 강도
R²#
범위:
0 ~ 1
의미:
회귀모형의 설명력
따라서:
r은 음수가 될 수 있지만 R²는 기본적으로 0 이상
입니다.
16장 단순회귀에서는 r² = R²#
제공된 학습자료에서 중요한 공식입니다.
단순 회귀분석에서는 상관계수의 제곱 r²이 결정계수 R²와 같습니다.
즉:
R² = r²
입니다.
예를 들어:
r = 0.8
이라면:
R² = 0.8²
= 0.64
입니다.
따라서:
64% 설명력
으로 해석합니다.
17장 r이 -0.8이면 R²는 얼마인가#
단순회귀라고 가정하면:
r = -0.8
입니다.
제곱하면:
R² = (-0.8)² = 0.64
입니다.
즉 상관관계 방향은 음수지만 결정계수는 0.64가 됩니다.
이 사례를 통해:
r은 방향까지 표현
하지만:
R²는 설명력의 크기
를 나타낸다는 차이를 이해할 수 있습니다.
18장 회귀분석에서 변동을 세 가지로 나눈다#
회귀분석에서는 종속변수의 전체 변동을 크게 두 부분으로 나누어 생각합니다.
SST = SSR + SSE
입니다.
각각:
SST
→ 총제곱합 Total Sum of Squares
SSR
→ 회귀제곱합 Regression Sum of Squares
SSE
→ 오차제곱합 Error Sum of Squares
입니다.
시험에서는 이름보다 관계식을 정확하게 기억하는 것이 중요합니다.
19장 SST 총제곱합이란 무엇인가#
SST는 종속변수의 전체 변동입니다.
공식은 제공된 학습자료에서 다음처럼 제시합니다.
SST = Σ(yᵢ - ȳ)²
즉 각각의 실제값 yᵢ가 전체 평균 ȳ에서 얼마나 떨어져 있는지를 제곱하여 더합니다.
쉽게 말하면:
실제 데이터가 평균을 기준으로 얼마나 퍼져 있는가?
를 나타냅니다.
핵심#
SST = 전체 변동
입니다.
20장 SSR 회귀제곱합이란 무엇인가#
SSR은 회귀모형이 설명한 변동입니다.
공식은:
SSR = Σ(ŷᵢ - ȳ)²
입니다.
ŷᵢ는 회귀모형이 예측한 값입니다.
즉:
전체 변동 가운데 회귀모형이 얼마나 설명했는가?
를 나타냅니다.
핵심#
SSR = 모델이 설명한 변동
입니다.
21장 SSE 오차제곱합이란 무엇인가#
SSE는 회귀모형이 설명하지 못한 오차 변동입니다.
공식은:
SSE = Σ(yᵢ - ŷᵢ)²
입니다.
실제값과 예측값의 차이를 제곱하여 합한 값입니다.
즉:
예측에서 얼마나 틀렸는가?
를 나타내는 오차와 연결됩니다.
핵심#
SSE = 설명하지 못한 오차
입니다.
22장 SST·SSR·SSE 관계를 쉽게 이해하면#
전체 변동 SST는 두 부분으로 나뉩니다.
모델이 설명한 부분
→ SSR
모델이 설명하지 못한 부분
→ SSE
따라서:
SST = SSR + SSE
입니다.
쉽게 표현하면:
전체 = 설명 + 오차
입니다.
이 한 문장을 기억하면 세 가지 제곱합의 관계를 쉽게 복원할 수 있습니다.
23장 결정계수 R² 계산 공식#
제공된 학습자료에서는 결정계수를 다음 두 가지 형태로 제시합니다.
R² = SSR / SST
또는:
R² = 1 − SSE / SST
입니다.
두 공식은 같은 의미를 나타냅니다.
왜냐하면:
SST = SSR + SSE
이기 때문입니다.
24장 결정계수 계산 예제#
다음 값이 주어졌다고 하겠습니다.
SSR = 300
SSE = 200
먼저 SST를 계산합니다.
SST = SSR + SSE
SST = 300 + 200
SST = 500
그다음 결정계수를 계산합니다.
R² = SSR / SST
R² = 300 / 500
R² = 0.60
따라서 회귀모형의 설명력은:
60%
입니다.
25장 같은 문제를 SSE로 계산하면#
앞의 사례에서:
SSE = 200
SST = 500
입니다.
다른 공식을 사용하면:
R² = 1 − SSE / SST
= 1 − 200/500
= 1 − 0.4
= 0.6
입니다.
같은 결과:
R² = 0.60
을 얻습니다.
26장 SSE가 작으면 왜 좋은가#
SSE는 실제값과 예측값 사이의 오차를 나타냅니다.
따라서 SSE가 작다는 것은:
실제값과 예측값의 차이가 작다
는 의미입니다.
제공된 학습자료에서는:
SSE가 작을수록 좋은 모델
이라고 정리합니다.
핵심#
SSE ↓ → 오차 ↓
입니다.
27장 SST는 모델에 따라 달라질까#
제공된 학습자료의 중요한 함정입니다.
SST는 회귀모형에 따라 달라진다.
틀립니다.
SST는 실제 종속변수 데이터가 평균에서 얼마나 변동하는지를 나타내기 때문에 동일한 데이터라면 고정된 전체 변동입니다.
반면 모델에 따라:
- SSR
- SSE
는 달라질 수 있습니다.
시험 핵심#
SST = 고정
입니다.
28장 좋은 모델에서는 SSR과 SSE가 어떻게 될까#
전체 변동 SST가 고정되어 있다고 생각해봅시다.
좋은 회귀모형이라면 가능한 한 많은 변동을 모델이 설명해야 합니다.
따라서:
SSR은 커지고
SSE는 작아지는
방향이 좋습니다.
그러면:
R² = SSR / SST
값이 커지게 됩니다.
즉:
SSR ↑
SSE ↓
R² ↑
로 연결할 수 있습니다.
29장 RMSE란 무엇인가#
RMSE는 Root Mean Squared Error, 평균제곱근오차입니다.
제공된 학습자료의 공식은:
RMSE = √(SSE / n)
또는:
RMSE = √[Σ(yᵢ − ŷᵢ)² / n]
입니다.
여기서:
yᵢ
→ 실제값
ŷᵢ
→ 예측값
n
→ 데이터 수
입니다.
30장 RMSE를 쉽게 이해하면#
RMSE는 실제값과 예측값의 차이를 이용하여 모델의 예측 오차 수준을 나타냅니다.
따라서:
RMSE가 작을수록
실제값과 예측값 사이의 차이가 상대적으로 작습니다.
제공된 학습자료에서는:
RMSE 작을수록 좋은 모델
로 정리합니다.
핵심#
R²는 클수록 좋고
RMSE는 작을수록 좋다
고 기억하면 쉽습니다.
31장 R²와 RMSE 방향을 혼동하지 말자#
시험에서는 두 지표의 방향을 바꿔 출제할 수 있습니다.
R²#
클수록 설명력 높음
RMSE#
작을수록 오차 적음
즉:
R² ↑ 좋은 방향
RMSE ↓ 좋은 방향
입니다.
32장 p-value는 회귀분석에서 무엇을 의미할까#
회귀분석 결과에서는 독립변수가 통계적으로 유의한지 판단하기 위해 p-value를 확인할 수 있습니다.
제공된 학습자료에서는 기준을:
0.05
로 제시합니다.
p-value < 0.05#
→ 통계적으로 유의
→ 귀무가설 기각
p-value ≥ 0.05#
→ 통계적으로 유의하지 않음
으로 해석합니다.
시험에서는:
0.05 미만 = 유의
를 기억하면 됩니다.
33장 회귀계수의 p-value 사례#
회귀분석 결과에서 독립변수 x의 p-value가:
2.65e-05
라고 하겠습니다.
이는 0.05보다 매우 작은 값입니다.
따라서 제공된 학습자료의 기준에서는:
x는 통계적으로 유의한 독립변수
라고 판단할 수 있습니다.
34장 다중공선성이란 무엇인가#
다중공선성 Multicollinearity은 회귀분석에서 독립변수들 사이에 강한 상관관계가 존재하는 문제입니다.
예를 들어 집값을 예측하는데 독립변수로:
- 전용면적
- 전체면적
- 방 개수
를 사용했다고 생각해봅시다.
이 변수들이 서로 매우 강하게 연결되어 있다면 개별 독립변수의 영향력을 분리해 해석하기 어려울 수 있습니다.
핵심#
다중공선성 = 독립변수들끼리 너무 강하게 연관
입니다.
35장 다중공선성이 왜 문제가 되는가#
제공된 학습자료에서는 다중공선성이 회귀계수의 분산을 증가시켜 결과를 불안정하고 해석하기 어렵게 만든다고 설명합니다.
즉 독립변수들이 서로 비슷한 정보를 많이 가지고 있으면:
실제로 어떤 변수가 종속변수에 얼마나 영향을 주는가?
를 명확하게 구분하기 어려워질 수 있습니다.
회귀계수 역시 데이터 변화에 민감하게 달라질 수 있습니다.
36장 VIF란 무엇인가#
다중공선성을 확인하는 대표적인 지표로 제공된 학습자료에서는 VIF를 제시합니다.
VIF는 Variance Inflation Factor입니다.
학습자료 기준:
VIF > 10
이면 다중공선성을 의심합니다.
따라서 시험에서는:
10
이라는 기준값을 기억해야 합니다.
핵심#
VIF 10 초과 → 다중공선성 의심
입니다.
37장 다중공선성 해결 방법#
제공된 학습자료에서는 해결방법으로 PCA 주성분분석을 제시합니다.
PCA는 서로 상관된 여러 변수를 새로운 주성분으로 변환하여 차원을 축소하는 방법입니다.
시험에서는 다음 연결을 기억하면 좋습니다.
독립변수끼리 높은 상관
→ 다중공선성
→ VIF 확인
→ VIF > 10 의심
→ 해결방법 예: PCA
입니다.
38장 단순회귀와 다중회귀 차이#
단순회귀#
독립변수가 하나입니다.
예:
공부시간 → 시험점수
다중회귀#
독립변수가 여러 개입니다.
예:
- 공부시간
- 출석률
- 과제점수
를 이용해 시험점수를 설명합니다.
다중공선성은 이름 그대로 여러 독립변수를 사용하는 회귀분석에서 특히 중요한 문제입니다.
39장 R에서 상관계수 계산하기#
제공된 학습자료의 예제에서는 다음 데이터를 사용합니다.
x <- c(1, 2, 3, 4, 5, 6, 7, 8, 9, 10)
y <- c(2, 4, 5, 4, 5, 8, 7, 9, 10, 12)상관계수는 cor() 함수를 이용합니다.
cor(x, y)제공된 예제 결과는 약:
0.9545
입니다.
이는 강한 양의 상관관계를 나타냅니다.
40장 R에서 단순회귀모형 만들기#
R에서는 lm() 함수를 이용해 선형회귀모형을 만들 수 있습니다.
model <- lm(y ~ x)
summary(model)y ~ x는:
x를 이용하여 y를 설명한다.
는 의미로 이해하면 쉽습니다.
제공된 학습자료 예제의 회귀식은:
y = 0.964 + 1.036x
정도로 제시되어 있습니다.
41장 회귀식의 절편과 기울기#
회귀식:
y = 0.964 + 1.036x
를 보면 두 숫자가 있습니다.
0.964#
절편 Intercept입니다.
x = 0일 때 예측되는 y값과 연결됩니다.
1.036#
x의 회귀계수, 즉 기울기입니다.
x가 1 증가할 때 y가 약 1.036만큼 증가하는 관계를 나타냅니다.
즉 회귀계수의 부호와 크기를 이용하여 변수 사이 관계를 해석할 수 있습니다.
42장 R에서 결정계수 확인하기#
제공된 학습자료에서는 다음 코드로 결정계수를 확인합니다.
summary(model)$r.squared결과:
0.9111
즉 약:
91.11%의 설명력
입니다.
상관계수가 약 0.9545였으므로 단순회귀에서는:
0.9545² ≈ 0.911
이 되어:
r² ≈ R²
관계도 확인할 수 있습니다.
43장 R summary 결과 읽기#
제공된 학습자료의 결과 일부는 다음과 같습니다.
Coefficients:
Estimate Std. Error t value Pr(>|t|)
(Intercept) 0.9636 2.024 0.4762 0.1201
x 1.0364 0.1201 8.627 2.65e-05
Multiple R-squared: 0.9111
Adjusted R-squared: 0.9여기서 시험에서 중요하게 볼 수 있는 값은:
- Estimate
- p-value
- R-squared
입니다.
특히 x의 p-value가 매우 작기 때문에 x가 통계적으로 유의한 변수인지 판단할 수 있습니다.
44장 산점도와 회귀선#
R에서는 다음과 같이 산점도를 그릴 수 있습니다.
plot(x, y, main="산점도", xlab="X변수", ylab="Y변수")회귀선을 추가하려면:
abline(model)을 사용할 수 있습니다.
산점도를 보면 두 변수 사이 관계를 시각적으로 확인할 수 있고, 회귀선을 추가하면 데이터의 선형 추세를 더 쉽게 파악할 수 있습니다.
45장 상관분석과 회귀분석은 무엇이 다른가#
둘은 관련 있지만 목적이 다릅니다.
상관분석#
두 변수가 얼마나 함께 움직이는가를 봅니다.
대표 지표:
r
회귀분석#
독립변수를 이용해 종속변수를 설명하거나 예측합니다.
대표 지표:
- 회귀계수
- R²
- p-value
- RMSE
따라서:
상관 = 관계의 강도와 방향
회귀 = 설명과 예측
으로 구분하면 쉽습니다.
46장 상관계수가 높으면 회귀모형도 무조건 좋은가#
상관계수가 높다는 것은 두 변수 사이에 강한 선형 관계가 있다는 의미입니다.
단순회귀에서는 r²과 R²가 연결되므로 높은 상관관계가 높은 설명력으로 이어질 수 있습니다.
하지만 회귀모형을 평가할 때는 단순히 r 하나만 보는 것이 아니라:
- R²
- p-value
- RMSE
- 잔차
- 다중공선성
등 다양한 요소를 함께 확인할 필요가 있습니다.
ADsP에서는 각 지표의 역할과 방향을 구분하는 것이 중요합니다.
47장 AUROC는 회귀분석 지표인가#
제공된 학습자료의 첫 요약표에는 AUROC 기준도 함께 제시되어 있습니다.
AUROC는:
0.5 ~ 1.0
범위로 정리하며:
0.5
→ 무작위 수준
1.0
→ 완벽한 분류
입니다.
다만 AUROC는 여기서 다루는 선형회귀의 설명력 지표인 R²와 같은 개념이 아닙니다.
시험에서 숫자 범위를 혼동하지 않도록 다음과 같이 구분합니다.
r → -1 ~ +1
R² → 0 ~ 1
AUROC → 0.5 ~ 1.0
입니다.
48장 회귀분석 핵심 숫자 비교#
| 지표 | 기준 | 해석 |
|---|---|---|
| r | -1 ~ +1 | 선형 관계 방향·강도 |
| R² | 0 ~ 1 | 회귀 설명력 |
| p-value | < 0.05 | 통계적으로 유의 |
| VIF | > 10 | 다중공선성 의심 |
| RMSE | 작을수록 좋음 | 예측오차 |
| AUROC | 0.5 ~ 1.0 | 분류 성능 |
시험에서는 각 숫자가 무엇을 의미하는지 바꿔서 출제할 수 있으므로 세트로 기억하는 것이 좋습니다.
49장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 상관계수 r의 범위는 0에서 1이다#
틀립니다.
r은:
-1 ~ +1
입니다.
함정 2. 결정계수 R²는 -1에서 +1이다#
틀립니다.
제공된 학습자료에서는:
0 ~ 1
로 정리합니다.
함정 3. r = 0이면 완전한 음의 상관이다#
틀립니다.
r = 0은 선형 관계가 없음을 의미합니다.
완전한 음의 선형 관계는 r = -1입니다.
함정 4. 상관관계가 강하면 인과관계도 증명된다#
틀립니다.
상관관계는 인과관계를 의미하지 않습니다.
함정 5. R²가 0.8이면 모델이 모든 예측을 80% 정확하게 맞혔다#
결정계수의 정확한 해석이 아닙니다.
R² = 0.8은 제공된 학습자료 기준 종속변수 변동의 80%를 모형이 설명한다는 뜻입니다.
함정 6. 단순회귀에서 r²와 R²는 관계없다#
틀립니다.
단순회귀에서는:
r² = R²
입니다.
함정 7. SST = SSR − SSE다#
틀립니다.
정확한 관계는:
SST = SSR + SSE
입니다.
함정 8. SSE가 클수록 좋은 모델이다#
틀립니다.
오차이므로 작을수록 좋습니다.
함정 9. SST는 모델에 따라 계속 달라진다#
틀립니다.
같은 종속변수 데이터에서 SST는 고정입니다.
함정 10. RMSE는 클수록 좋은 모델이다#
틀립니다.
RMSE는 오차이므로 작을수록 좋습니다.
함정 11. VIF가 10보다 크면 다중공선성을 의심할 수 있다#
제공된 학습자료 기준 맞습니다.
함정 12. 다중공선성은 종속변수끼리 높은 상관을 가지는 문제다#
틀립니다.
독립변수들 사이의 강한 상관관계 문제입니다.
50장 상관계수 시험 직전 암기#
r#
범위:
-1 ~ +1
r = +1#
완전한 양의 선형 관계
r = -1#
완전한 음의 선형 관계
r = 0#
선형 관계 없음
그리고 반드시 기억합니다.
상관관계 ≠ 인과관계
입니다.
51장 결정계수 시험 직전 암기#
R²
→ 0 ~ 1
→ 회귀모형의 설명력
공식:
R² = SSR / SST
또는:
R² = 1 − SSE / SST
단순회귀에서는:
R² = r²
입니다.
52장 SS 분해 시험 직전 암기#
SST
→ Total
→ 전체 변동
SSR
→ Regression
→ 모델이 설명한 변동
SSE
→ Error
→ 설명하지 못한 오차
관계:
SST = SSR + SSE
쉽게:
전체 = 설명 + 오차
입니다.
53장 RMSE 시험 직전 암기#
공식:
RMSE = √(SSE / n)
또는:
RMSE = √[Σ(yᵢ − ŷᵢ)² / n]
해석:
실제값과 예측값의 오차
판단:
작을수록 좋음
입니다.
54장 다중공선성 시험 직전 암기#
다중공선성
→ 독립변수들 사이 강한 상관
→ 회귀계수 불안정
→ 해석 어려움
확인:
VIF
기준:
VIF > 10 → 의심
제공된 학습자료의 해결방법 예:
PCA
입니다.
55장 회귀분석 전체를 한 번에 암기하면#
다음 숫자만 먼저 기억해도 많은 문제를 정리할 수 있습니다.
r = -1 ~ +1
R² = 0 ~ 1
p-value < 0.05
VIF > 10
AUROC = 0.5 ~ 1.0
그리고 방향은:
R²는 클수록 좋음
SSE는 작을수록 좋음
RMSE는 작을수록 좋음
입니다.
회귀분석 FAQ#
상관계수 r이란 무엇인가#
두 변수 사이 선형 관계의 방향과 강도를 나타내는 값으로 -1에서 +1 사이입니다.
r이 양수이면 무엇을 의미하는가#
한 변수가 증가할 때 다른 변수도 증가하는 경향이 있는 양의 상관관계를 의미합니다.
r이 음수이면 무엇을 의미하는가#
한 변수가 증가할 때 다른 변수가 감소하는 경향을 가지는 음의 상관관계를 의미합니다.
r = 0이면 무엇인가#
두 변수 사이에 선형 관계가 없음을 의미합니다.
상관관계는 인과관계를 의미하는가#
아닙니다. 강한 상관관계만으로 인과관계를 증명할 수 없습니다.
결정계수 R²란 무엇인가#
회귀모형이 종속변수의 변동을 얼마나 설명하는지 나타내는 값입니다.
R²의 범위는 무엇인가#
제공된 학습자료 기준 0에서 1 사이입니다.
R² = 0.8은 무엇을 의미하는가#
회귀모형이 종속변수 변동의 약 80%를 설명한다고 해석합니다.
단순회귀에서 r과 R²의 관계는 무엇인가#
R² = r²입니다.
SST란 무엇인가#
종속변수의 전체 변동을 나타내는 총제곱합입니다.
SSR이란 무엇인가#
회귀모형이 설명한 변동입니다.
SSE란 무엇인가#
회귀모형이 설명하지 못한 오차 변동입니다.
SST·SSR·SSE 관계는 무엇인가#
SST = SSR + SSE입니다.
R² 계산식은 무엇인가#
R² = SSR / SST
또는:
R² = 1 − SSE / SST
입니다.
RMSE란 무엇인가#
실제값과 예측값 사이의 오차를 나타내는 지표이며 제공된 학습자료에서는 작을수록 좋은 모델로 설명합니다.
다중공선성이란 무엇인가#
독립변수들 사이에 강한 상관관계가 존재하여 회귀계수가 불안정해지고 해석이 어려워지는 문제입니다.
VIF 기준은 무엇인가#
제공된 학습자료에서는 VIF > 10이면 다중공선성을 의심합니다.
다중공선성 해결방법으로 무엇이 제시되어 있는가#
제공된 학습자료에서는 PCA 주성분분석을 제시합니다.
회귀분석에서 p-value가 0.05보다 작으면 어떻게 해석하는가#
제공된 학습자료 기준 통계적으로 유의하다고 보고 귀무가설을 기각합니다.
R²와 RMSE는 어느 방향이 좋은가#
R²는 클수록 좋고, RMSE는 작을수록 좋습니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 상관계수 r의 범위를 말할 수 있는가?
- r의 부호가 무엇을 의미하는지 설명할 수 있는가?
- r = 1, -1, 0을 각각 해석할 수 있는가?
- 상관관계와 인과관계가 다르다는 것을 알고 있는가?
- R²의 범위를 알고 있는가?
- R²가 무엇을 설명하는 지표인지 알고 있는가?
- 단순회귀에서 r² = R²라는 것을 기억하고 있는가?
- r = 0.8일 때 R² = 0.64를 계산할 수 있는가?
- SST·SSR·SSE가 무엇을 의미하는지 설명할 수 있는가?
- SST = SSR + SSE를 기억하고 있는가?
- R² = SSR/SST를 계산할 수 있는가?
- R² = 1−SSE/SST 관계를 이해하고 있는가?
- SSE는 작을수록 좋다는 것을 알고 있는가?
- SST는 동일한 데이터에서 고정된다는 것을 기억하고 있는가?
- RMSE가 작을수록 좋다는 것을 알고 있는가?
- 다중공선성이 독립변수 사이의 문제라는 것을 알고 있는가?
- VIF > 10 기준을 기억하고 있는가?
- PCA가 다중공선성 해결방법의 하나로 제시된다는 것을 알고 있는가?
- p-value 0.05 기준을 알고 있는가?
- R에서
cor()와lm()의 역할을 구분할 수 있는가?
이 글을 마치며#
회귀분석의 기본은 여러 공식을 따로 외우는 것보다 각 숫자가 무엇을 의미하는지 연결해서 이해하는 것입니다.
먼저 상관계수 r은:
두 변수가 얼마나 같은 방향 또는 반대 방향으로 선형적으로 움직이는가
를 봅니다.
범위는:
-1 ~ +1
입니다.
결정계수 R²는:
회귀모형이 종속변수의 변동을 얼마나 설명하는가
를 나타냅니다.
범위는:
0 ~ 1
입니다.
단순회귀에서는:
R² = r²
관계가 성립합니다.
회귀분석의 변동은:
SST = SSR + SSE
즉:
전체 변동 = 모델이 설명한 변동 + 오차 변동
으로 나뉩니다.
그리고:
R² = SSR / SST = 1 − SSE / SST
입니다.
모델의 오차를 평가하는 RMSE는:
작을수록 좋습니다.
다중회귀에서는 독립변수 사이의 강한 상관관계인 다중공선성을 주의해야 합니다.
제공된 학습자료 기준으로:
VIF > 10
이면 다중공선성을 의심합니다.
시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.
r = -1 ~ +1, 관계의 방향과 강도
R² = 0 ~ 1, 모델 설명력
SST = SSR + SSE
R²는 클수록 좋고 RMSE·SSE는 작을수록 좋음
VIF > 10 → 다중공선성 의심