회귀분석 기초란? 상관계수 r·결정계수 R²·SST·SSR·SSE·RMSE·VIF 쉽게 이해하기

1장 회귀분석에서 가장 먼저 기억해야 할 숫자#

회귀분석 문제를 풀다 보면 비슷해 보이는 여러 숫자가 한꺼번에 등장합니다.

대표적으로:

  • 상관계수 r
  • 결정계수 R²
  • p-value
  • VIF
  • AUROC

가 있습니다.

하지만 각각 의미와 범위가 다릅니다.

먼저 시험에서 자주 사용하는 기준부터 정리하면 다음과 같습니다.

지표 범위·기준 핵심 의미
상관계수 r -1 ~ +1 두 변수의 선형 관계 방향과 강도
결정계수 R² 0 ~ 1 회귀모형의 설명력
p-value 0.05 기준 0.05 미만이면 통계적으로 유의
VIF 10 기준 10 초과 시 다중공선성 의심
AUROC 0.5 ~ 1.0 0.5 무작위, 1.0 완벽한 분류

이 가운데 이번 글에서는 회귀분석과 직접 연결되는 r, R², p-value, VIF, SST·SSR·SSE, RMSE를 중심으로 살펴봅니다.


2장 회귀분석이란 무엇인가#

회귀분석은 변수 사이의 관계를 이용하여 한 변수의 값을 설명하거나 예측하는 분석방법입니다.

예를 들어 다음과 같은 질문을 생각할 수 있습니다.

광고비가 증가하면 매출은 얼마나 증가할까?

공부시간이 늘어나면 시험점수는 어떻게 변할까?

집의 면적이 커질수록 가격은 얼마나 높아질까?

이런 문제에서는 한 변수의 변화가 다른 변수와 어떤 관계를 가지는지 분석합니다.

일반적으로 설명이나 원인 쪽에 놓는 변수를 독립변수, 설명하거나 예측하려는 대상을 종속변수라고 합니다.

예를 들어:

광고비 → 독립변수

매출 → 종속변수

로 생각할 수 있습니다.


3장 상관계수 r이란 무엇인가#

상관계수 r은 두 변수 사이의 선형 관계가 어느 방향으로 얼마나 강하게 나타나는지 보여주는 값입니다.

범위는:

-1 ≤ r ≤ +1

입니다.

따라서 상관계수에서는 두 가지를 봅니다.

첫째:

부호

→ 관계의 방향

둘째:

절댓값의 크기

→ 관계의 강도

입니다.


4장 상관계수의 부호는 무엇을 의미하는가#

r > 0#

양의 상관관계입니다.

한 변수가 증가할 때 다른 변수도 증가하는 경향을 보입니다.

예:

공부시간 증가
→ 시험점수 증가

r < 0#

음의 상관관계입니다.

한 변수가 증가할 때 다른 변수는 감소하는 경향을 보입니다.

예:

상품 가격 증가
→ 수요 감소

r = 0#

선형 관계가 없음을 의미합니다.

핵심#

양수 = 같이 움직임

음수 = 반대로 움직임

0 = 선형 관계 없음

입니다.


5장 r = 1은 무엇을 의미하는가#

r = 1이면 완전한 양의 선형 관계입니다.

한 변수가 증가할 때 다른 변수도 완벽하게 일정한 선형 관계를 가지고 증가합니다.

예를 들어 X가 일정하게 증가할 때 Y도 정확하게 일정 비율로 증가한다면 r은 1에 가까워질 수 있습니다.

핵심#

r = +1 → 완전한 양의 선형 관계

입니다.


6장 r = -1은 무엇을 의미하는가#

r = -1이면 완전한 음의 선형 관계입니다.

한 변수가 증가할수록 다른 변수는 완벽하게 일정한 선형 관계를 가지고 감소합니다.

핵심#

r = -1 → 완전한 음의 선형 관계

입니다.


7장 r = 0은 정말 아무 관계도 없다는 뜻인가#

제공된 학습자료에서는 r = 0을 선형 관계 없음으로 설명합니다.

이 표현이 중요합니다.

상관계수 r은 두 변수 사이의 선형적인 관계를 측정합니다.

따라서 r = 0이라고 해서 모든 종류의 관계가 반드시 존재하지 않는다고 단정하기보다 시험에서는:

선형 관계가 없다

라고 기억하는 것이 안전합니다.


8장 상관계수는 인과관계를 의미하지 않는다#

ADsP에서 반드시 기억해야 하는 핵심입니다.

두 변수 사이의 상관관계가 강하다고 해서:

X가 Y의 원인이다.

라고 바로 결론 내릴 수 없습니다.

즉:

상관관계 ≠ 인과관계

입니다.

예를 들어 아이스크림 판매량과 물놀이 사고가 동시에 증가할 수 있습니다.

하지만 아이스크림을 많이 팔아서 사고가 증가했다고 볼 수는 없습니다.

여름철 기온이라는 다른 요인이 두 변수를 함께 증가시킬 수 있기 때문입니다.

시험 핵심#

상관계수는 관계를 나타낼 뿐 인과관계를 증명하지 않는다

입니다.


9장 피어슨 상관계수란 무엇인가#

제공된 학습자료에서는 피어슨 상관계수를 다음과 같이 표현합니다.

r = Cov(X,Y) / (σₓ × σᵧ)

즉:

공분산 ÷ 두 변수의 표준편차의 곱

입니다.

표본 형태의 계산식은 다음과 같이 제시할 수 있습니다.

r = Σ(xᵢ-x̄)(yᵢ-ȳ) / √[Σ(xᵢ-x̄)² × Σ(yᵢ-ȳ)²]

시험에서는 복잡한 계산 자체보다 r이 -1에서 +1 사이이고 선형 관계의 방향과 강도를 나타낸다는 의미를 먼저 이해하는 것이 중요합니다.


10장 공분산과 상관계수의 관계#

피어슨 상관계수 공식에는 공분산 Covariance가 등장합니다.

공분산은 두 변수가 함께 움직이는 방향을 나타낼 수 있습니다.

하지만 공분산은 변수의 단위와 크기에 영향을 받을 수 있습니다.

이를 두 변수의 표준편차로 나누어 일정한 범위로 만든 것이 상관계수라고 이해하면 쉽습니다.

그래서 상관계수 r은:

-1 ~ +1

이라는 일정한 범위에서 관계를 비교할 수 있습니다.


11장 결정계수 R²란 무엇인가#

결정계수 R²는 회귀모형이 종속변수의 변동을 얼마나 설명하는지 나타내는 값입니다.

범위는:

0 ≤ R² ≤ 1

입니다.

값이 1에 가까울수록 회귀모형의 설명력이 높습니다.

예#

R² = 0.8

이라면 제공된 학습자료에서는:

종속변수 전체 변동의 약 80%를 회귀모형이 설명

한다고 해석합니다.


12장 R² = 1은 무엇을 의미하는가#

R² = 1이면:

100% 설명력

입니다.

즉 회귀모형이 관측된 종속변수의 변동을 완벽하게 설명하는 상태입니다.

핵심#

R² = 1 → 완벽한 설명

입니다.


13장 R² = 0은 무엇을 의미하는가#

R² = 0이면 제공된 학습자료에서는:

설명력 없음

으로 정리합니다.

즉 해당 회귀모형의 독립변수들이 종속변수의 변동을 설명하지 못하는 상태로 이해합니다.

핵심#

R² = 0 → 설명력 없음

입니다.


14장 R² = 0.8을 어떻게 해석할까#

R² = 0.8이라면:

회귀모형이 종속변수 변동의 80%를 설명한다.

고 해석할 수 있습니다.

여기서 주의할 점은:

예측값의 80%가 맞았다.

라는 의미와 동일한 것은 아니라는 점입니다.

결정계수는 종속변수의 변동에 대한 설명 비율을 나타냅니다.

시험에서는:

R² = 설명력

이라고 기억하는 것이 가장 중요합니다.


15장 r과 R²는 같은 값인가#

아닙니다.

상관계수 r과 결정계수 R²는 서로 다른 개념입니다.

r#

범위:

-1 ~ +1

의미:

두 변수 사이 선형 관계의 방향과 강도

R²#

범위:

0 ~ 1

의미:

회귀모형의 설명력

따라서:

r은 음수가 될 수 있지만 R²는 기본적으로 0 이상

입니다.


16장 단순회귀에서는 r² = R²#

제공된 학습자료에서 중요한 공식입니다.

단순 회귀분석에서는 상관계수의 제곱 r²이 결정계수 R²와 같습니다.

즉:

R² = r²

입니다.

예를 들어:

r = 0.8

이라면:

R² = 0.8²

= 0.64

입니다.

따라서:

64% 설명력

으로 해석합니다.


17장 r이 -0.8이면 R²는 얼마인가#

단순회귀라고 가정하면:

r = -0.8

입니다.

제곱하면:

R² = (-0.8)² = 0.64

입니다.

즉 상관관계 방향은 음수지만 결정계수는 0.64가 됩니다.

이 사례를 통해:

r은 방향까지 표현

하지만:

R²는 설명력의 크기

를 나타낸다는 차이를 이해할 수 있습니다.


18장 회귀분석에서 변동을 세 가지로 나눈다#

회귀분석에서는 종속변수의 전체 변동을 크게 두 부분으로 나누어 생각합니다.

SST = SSR + SSE

입니다.

각각:

SST

→ 총제곱합 Total Sum of Squares

SSR

→ 회귀제곱합 Regression Sum of Squares

SSE

→ 오차제곱합 Error Sum of Squares

입니다.

시험에서는 이름보다 관계식을 정확하게 기억하는 것이 중요합니다.


19장 SST 총제곱합이란 무엇인가#

SST는 종속변수의 전체 변동입니다.

공식은 제공된 학습자료에서 다음처럼 제시합니다.

SST = Σ(yᵢ - ȳ)²

즉 각각의 실제값 yᵢ가 전체 평균 ȳ에서 얼마나 떨어져 있는지를 제곱하여 더합니다.

쉽게 말하면:

실제 데이터가 평균을 기준으로 얼마나 퍼져 있는가?

를 나타냅니다.

핵심#

SST = 전체 변동

입니다.


20장 SSR 회귀제곱합이란 무엇인가#

SSR은 회귀모형이 설명한 변동입니다.

공식은:

SSR = Σ(ŷᵢ - ȳ)²

입니다.

ŷᵢ는 회귀모형이 예측한 값입니다.

즉:

전체 변동 가운데 회귀모형이 얼마나 설명했는가?

를 나타냅니다.

핵심#

SSR = 모델이 설명한 변동

입니다.


21장 SSE 오차제곱합이란 무엇인가#

SSE는 회귀모형이 설명하지 못한 오차 변동입니다.

공식은:

SSE = Σ(yᵢ - ŷᵢ)²

입니다.

실제값과 예측값의 차이를 제곱하여 합한 값입니다.

즉:

예측에서 얼마나 틀렸는가?

를 나타내는 오차와 연결됩니다.

핵심#

SSE = 설명하지 못한 오차

입니다.


22장 SST·SSR·SSE 관계를 쉽게 이해하면#

전체 변동 SST는 두 부분으로 나뉩니다.

모델이 설명한 부분

→ SSR

모델이 설명하지 못한 부분

→ SSE

따라서:

SST = SSR + SSE

입니다.

쉽게 표현하면:

전체 = 설명 + 오차

입니다.

이 한 문장을 기억하면 세 가지 제곱합의 관계를 쉽게 복원할 수 있습니다.


23장 결정계수 R² 계산 공식#

제공된 학습자료에서는 결정계수를 다음 두 가지 형태로 제시합니다.

R² = SSR / SST

또는:

R² = 1 − SSE / SST

입니다.

두 공식은 같은 의미를 나타냅니다.

왜냐하면:

SST = SSR + SSE

이기 때문입니다.


24장 결정계수 계산 예제#

다음 값이 주어졌다고 하겠습니다.

SSR = 300

SSE = 200

먼저 SST를 계산합니다.

SST = SSR + SSE

SST = 300 + 200

SST = 500

그다음 결정계수를 계산합니다.

R² = SSR / SST

R² = 300 / 500

R² = 0.60

따라서 회귀모형의 설명력은:

60%

입니다.


25장 같은 문제를 SSE로 계산하면#

앞의 사례에서:

SSE = 200

SST = 500

입니다.

다른 공식을 사용하면:

R² = 1 − SSE / SST

= 1 − 200/500

= 1 − 0.4

= 0.6

입니다.

같은 결과:

R² = 0.60

을 얻습니다.


26장 SSE가 작으면 왜 좋은가#

SSE는 실제값과 예측값 사이의 오차를 나타냅니다.

따라서 SSE가 작다는 것은:

실제값과 예측값의 차이가 작다

는 의미입니다.

제공된 학습자료에서는:

SSE가 작을수록 좋은 모델

이라고 정리합니다.

핵심#

SSE ↓ → 오차 ↓

입니다.


27장 SST는 모델에 따라 달라질까#

제공된 학습자료의 중요한 함정입니다.

SST는 회귀모형에 따라 달라진다.

틀립니다.

SST는 실제 종속변수 데이터가 평균에서 얼마나 변동하는지를 나타내기 때문에 동일한 데이터라면 고정된 전체 변동입니다.

반면 모델에 따라:

  • SSR
  • SSE

는 달라질 수 있습니다.

시험 핵심#

SST = 고정

입니다.


28장 좋은 모델에서는 SSR과 SSE가 어떻게 될까#

전체 변동 SST가 고정되어 있다고 생각해봅시다.

좋은 회귀모형이라면 가능한 한 많은 변동을 모델이 설명해야 합니다.

따라서:

SSR은 커지고

SSE는 작아지는

방향이 좋습니다.

그러면:

R² = SSR / SST

값이 커지게 됩니다.

즉:

SSR ↑

SSE ↓

R² ↑

로 연결할 수 있습니다.


29장 RMSE란 무엇인가#

RMSE는 Root Mean Squared Error, 평균제곱근오차입니다.

제공된 학습자료의 공식은:

RMSE = √(SSE / n)

또는:

RMSE = √[Σ(yᵢ − ŷᵢ)² / n]

입니다.

여기서:

yᵢ

→ 실제값

ŷᵢ

→ 예측값

n

→ 데이터 수

입니다.


30장 RMSE를 쉽게 이해하면#

RMSE는 실제값과 예측값의 차이를 이용하여 모델의 예측 오차 수준을 나타냅니다.

따라서:

RMSE가 작을수록

실제값과 예측값 사이의 차이가 상대적으로 작습니다.

제공된 학습자료에서는:

RMSE 작을수록 좋은 모델

로 정리합니다.

핵심#

R²는 클수록 좋고

RMSE는 작을수록 좋다

고 기억하면 쉽습니다.


31장 R²와 RMSE 방향을 혼동하지 말자#

시험에서는 두 지표의 방향을 바꿔 출제할 수 있습니다.

R²#

클수록 설명력 높음

RMSE#

작을수록 오차 적음

즉:

R² ↑ 좋은 방향

RMSE ↓ 좋은 방향

입니다.


32장 p-value는 회귀분석에서 무엇을 의미할까#

회귀분석 결과에서는 독립변수가 통계적으로 유의한지 판단하기 위해 p-value를 확인할 수 있습니다.

제공된 학습자료에서는 기준을:

0.05

로 제시합니다.

p-value < 0.05#

→ 통계적으로 유의

→ 귀무가설 기각

p-value ≥ 0.05#

→ 통계적으로 유의하지 않음

으로 해석합니다.

시험에서는:

0.05 미만 = 유의

를 기억하면 됩니다.


33장 회귀계수의 p-value 사례#

회귀분석 결과에서 독립변수 x의 p-value가:

2.65e-05

라고 하겠습니다.

이는 0.05보다 매우 작은 값입니다.

따라서 제공된 학습자료의 기준에서는:

x는 통계적으로 유의한 독립변수

라고 판단할 수 있습니다.


34장 다중공선성이란 무엇인가#

다중공선성 Multicollinearity은 회귀분석에서 독립변수들 사이에 강한 상관관계가 존재하는 문제입니다.

예를 들어 집값을 예측하는데 독립변수로:

  • 전용면적
  • 전체면적
  • 방 개수

를 사용했다고 생각해봅시다.

이 변수들이 서로 매우 강하게 연결되어 있다면 개별 독립변수의 영향력을 분리해 해석하기 어려울 수 있습니다.

핵심#

다중공선성 = 독립변수들끼리 너무 강하게 연관

입니다.


35장 다중공선성이 왜 문제가 되는가#

제공된 학습자료에서는 다중공선성이 회귀계수의 분산을 증가시켜 결과를 불안정하고 해석하기 어렵게 만든다고 설명합니다.

즉 독립변수들이 서로 비슷한 정보를 많이 가지고 있으면:

실제로 어떤 변수가 종속변수에 얼마나 영향을 주는가?

를 명확하게 구분하기 어려워질 수 있습니다.

회귀계수 역시 데이터 변화에 민감하게 달라질 수 있습니다.


36장 VIF란 무엇인가#

다중공선성을 확인하는 대표적인 지표로 제공된 학습자료에서는 VIF를 제시합니다.

VIF는 Variance Inflation Factor입니다.

학습자료 기준:

VIF > 10

이면 다중공선성을 의심합니다.

따라서 시험에서는:

10

이라는 기준값을 기억해야 합니다.

핵심#

VIF 10 초과 → 다중공선성 의심

입니다.


37장 다중공선성 해결 방법#

제공된 학습자료에서는 해결방법으로 PCA 주성분분석을 제시합니다.

PCA는 서로 상관된 여러 변수를 새로운 주성분으로 변환하여 차원을 축소하는 방법입니다.

시험에서는 다음 연결을 기억하면 좋습니다.

독립변수끼리 높은 상관

→ 다중공선성

→ VIF 확인

→ VIF > 10 의심

→ 해결방법 예: PCA

입니다.


38장 단순회귀와 다중회귀 차이#

단순회귀#

독립변수가 하나입니다.

예:

공부시간 → 시험점수

다중회귀#

독립변수가 여러 개입니다.

예:

  • 공부시간
  • 출석률
  • 과제점수

를 이용해 시험점수를 설명합니다.

다중공선성은 이름 그대로 여러 독립변수를 사용하는 회귀분석에서 특히 중요한 문제입니다.


39장 R에서 상관계수 계산하기#

제공된 학습자료의 예제에서는 다음 데이터를 사용합니다.

x <- c(1, 2, 3, 4, 5, 6, 7, 8, 9, 10)
y <- c(2, 4, 5, 4, 5, 8, 7, 9, 10, 12)

상관계수는 cor() 함수를 이용합니다.

cor(x, y)

제공된 예제 결과는 약:

0.9545

입니다.

이는 강한 양의 상관관계를 나타냅니다.


40장 R에서 단순회귀모형 만들기#

R에서는 lm() 함수를 이용해 선형회귀모형을 만들 수 있습니다.

model <- lm(y ~ x)
summary(model)

y ~ x는:

x를 이용하여 y를 설명한다.

는 의미로 이해하면 쉽습니다.

제공된 학습자료 예제의 회귀식은:

y = 0.964 + 1.036x

정도로 제시되어 있습니다.


41장 회귀식의 절편과 기울기#

회귀식:

y = 0.964 + 1.036x

를 보면 두 숫자가 있습니다.

0.964#

절편 Intercept입니다.

x = 0일 때 예측되는 y값과 연결됩니다.

1.036#

x의 회귀계수, 즉 기울기입니다.

x가 1 증가할 때 y가 약 1.036만큼 증가하는 관계를 나타냅니다.

즉 회귀계수의 부호와 크기를 이용하여 변수 사이 관계를 해석할 수 있습니다.


42장 R에서 결정계수 확인하기#

제공된 학습자료에서는 다음 코드로 결정계수를 확인합니다.

summary(model)$r.squared

결과:

0.9111

즉 약:

91.11%의 설명력

입니다.

상관계수가 약 0.9545였으므로 단순회귀에서는:

0.9545² ≈ 0.911

이 되어:

r² ≈ R²

관계도 확인할 수 있습니다.


43장 R summary 결과 읽기#

제공된 학습자료의 결과 일부는 다음과 같습니다.

Coefficients:
            Estimate Std. Error t value Pr(>|t|)
(Intercept) 0.9636   2.024     0.4762  0.1201
x           1.0364   0.1201    8.627   2.65e-05

Multiple R-squared: 0.9111
Adjusted R-squared: 0.9

여기서 시험에서 중요하게 볼 수 있는 값은:

  • Estimate
  • p-value
  • R-squared

입니다.

특히 x의 p-value가 매우 작기 때문에 x가 통계적으로 유의한 변수인지 판단할 수 있습니다.


44장 산점도와 회귀선#

R에서는 다음과 같이 산점도를 그릴 수 있습니다.

plot(x, y, main="산점도", xlab="X변수", ylab="Y변수")

회귀선을 추가하려면:

abline(model)

을 사용할 수 있습니다.

산점도를 보면 두 변수 사이 관계를 시각적으로 확인할 수 있고, 회귀선을 추가하면 데이터의 선형 추세를 더 쉽게 파악할 수 있습니다.


45장 상관분석과 회귀분석은 무엇이 다른가#

둘은 관련 있지만 목적이 다릅니다.

상관분석#

두 변수가 얼마나 함께 움직이는가를 봅니다.

대표 지표:

r

회귀분석#

독립변수를 이용해 종속변수를 설명하거나 예측합니다.

대표 지표:

  • 회귀계수
  • R²
  • p-value
  • RMSE

따라서:

상관 = 관계의 강도와 방향

회귀 = 설명과 예측

으로 구분하면 쉽습니다.


46장 상관계수가 높으면 회귀모형도 무조건 좋은가#

상관계수가 높다는 것은 두 변수 사이에 강한 선형 관계가 있다는 의미입니다.

단순회귀에서는 r²과 R²가 연결되므로 높은 상관관계가 높은 설명력으로 이어질 수 있습니다.

하지만 회귀모형을 평가할 때는 단순히 r 하나만 보는 것이 아니라:

  • R²
  • p-value
  • RMSE
  • 잔차
  • 다중공선성

등 다양한 요소를 함께 확인할 필요가 있습니다.

ADsP에서는 각 지표의 역할과 방향을 구분하는 것이 중요합니다.


47장 AUROC는 회귀분석 지표인가#

제공된 학습자료의 첫 요약표에는 AUROC 기준도 함께 제시되어 있습니다.

AUROC는:

0.5 ~ 1.0

범위로 정리하며:

0.5

→ 무작위 수준

1.0

→ 완벽한 분류

입니다.

다만 AUROC는 여기서 다루는 선형회귀의 설명력 지표인 R²와 같은 개념이 아닙니다.

시험에서 숫자 범위를 혼동하지 않도록 다음과 같이 구분합니다.

r → -1 ~ +1

R² → 0 ~ 1

AUROC → 0.5 ~ 1.0

입니다.


48장 회귀분석 핵심 숫자 비교#

지표 기준 해석
r -1 ~ +1 선형 관계 방향·강도
R² 0 ~ 1 회귀 설명력
p-value < 0.05 통계적으로 유의
VIF > 10 다중공선성 의심
RMSE 작을수록 좋음 예측오차
AUROC 0.5 ~ 1.0 분류 성능

시험에서는 각 숫자가 무엇을 의미하는지 바꿔서 출제할 수 있으므로 세트로 기억하는 것이 좋습니다.


49장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 상관계수 r의 범위는 0에서 1이다#

틀립니다.

r은:

-1 ~ +1

입니다.

함정 2. 결정계수 R²는 -1에서 +1이다#

틀립니다.

제공된 학습자료에서는:

0 ~ 1

로 정리합니다.

함정 3. r = 0이면 완전한 음의 상관이다#

틀립니다.

r = 0은 선형 관계가 없음을 의미합니다.

완전한 음의 선형 관계는 r = -1입니다.

함정 4. 상관관계가 강하면 인과관계도 증명된다#

틀립니다.

상관관계는 인과관계를 의미하지 않습니다.

함정 5. R²가 0.8이면 모델이 모든 예측을 80% 정확하게 맞혔다#

결정계수의 정확한 해석이 아닙니다.

R² = 0.8은 제공된 학습자료 기준 종속변수 변동의 80%를 모형이 설명한다는 뜻입니다.

함정 6. 단순회귀에서 r²와 R²는 관계없다#

틀립니다.

단순회귀에서는:

r² = R²

입니다.

함정 7. SST = SSR − SSE다#

틀립니다.

정확한 관계는:

SST = SSR + SSE

입니다.

함정 8. SSE가 클수록 좋은 모델이다#

틀립니다.

오차이므로 작을수록 좋습니다.

함정 9. SST는 모델에 따라 계속 달라진다#

틀립니다.

같은 종속변수 데이터에서 SST는 고정입니다.

함정 10. RMSE는 클수록 좋은 모델이다#

틀립니다.

RMSE는 오차이므로 작을수록 좋습니다.

함정 11. VIF가 10보다 크면 다중공선성을 의심할 수 있다#

제공된 학습자료 기준 맞습니다.

함정 12. 다중공선성은 종속변수끼리 높은 상관을 가지는 문제다#

틀립니다.

독립변수들 사이의 강한 상관관계 문제입니다.


50장 상관계수 시험 직전 암기#

r#

범위:

-1 ~ +1

r = +1#

완전한 양의 선형 관계

r = -1#

완전한 음의 선형 관계

r = 0#

선형 관계 없음

그리고 반드시 기억합니다.

상관관계 ≠ 인과관계

입니다.


51장 결정계수 시험 직전 암기#

R²

→ 0 ~ 1

→ 회귀모형의 설명력

공식:

R² = SSR / SST

또는:

R² = 1 − SSE / SST

단순회귀에서는:

R² = r²

입니다.


52장 SS 분해 시험 직전 암기#

SST

→ Total

→ 전체 변동

SSR

→ Regression

→ 모델이 설명한 변동

SSE

→ Error

→ 설명하지 못한 오차

관계:

SST = SSR + SSE

쉽게:

전체 = 설명 + 오차

입니다.


53장 RMSE 시험 직전 암기#

공식:

RMSE = √(SSE / n)

또는:

RMSE = √[Σ(yᵢ − ŷᵢ)² / n]

해석:

실제값과 예측값의 오차

판단:

작을수록 좋음

입니다.


54장 다중공선성 시험 직전 암기#

다중공선성

→ 독립변수들 사이 강한 상관

→ 회귀계수 불안정

→ 해석 어려움

확인:

VIF

기준:

VIF > 10 → 의심

제공된 학습자료의 해결방법 예:

PCA

입니다.


55장 회귀분석 전체를 한 번에 암기하면#

다음 숫자만 먼저 기억해도 많은 문제를 정리할 수 있습니다.

r = -1 ~ +1

R² = 0 ~ 1

p-value < 0.05

VIF > 10

AUROC = 0.5 ~ 1.0

그리고 방향은:

R²는 클수록 좋음

SSE는 작을수록 좋음

RMSE는 작을수록 좋음

입니다.


회귀분석 FAQ#

상관계수 r이란 무엇인가#

두 변수 사이 선형 관계의 방향과 강도를 나타내는 값으로 -1에서 +1 사이입니다.

r이 양수이면 무엇을 의미하는가#

한 변수가 증가할 때 다른 변수도 증가하는 경향이 있는 양의 상관관계를 의미합니다.

r이 음수이면 무엇을 의미하는가#

한 변수가 증가할 때 다른 변수가 감소하는 경향을 가지는 음의 상관관계를 의미합니다.

r = 0이면 무엇인가#

두 변수 사이에 선형 관계가 없음을 의미합니다.

상관관계는 인과관계를 의미하는가#

아닙니다. 강한 상관관계만으로 인과관계를 증명할 수 없습니다.

결정계수 R²란 무엇인가#

회귀모형이 종속변수의 변동을 얼마나 설명하는지 나타내는 값입니다.

R²의 범위는 무엇인가#

제공된 학습자료 기준 0에서 1 사이입니다.

R² = 0.8은 무엇을 의미하는가#

회귀모형이 종속변수 변동의 약 80%를 설명한다고 해석합니다.

단순회귀에서 r과 R²의 관계는 무엇인가#

R² = r²입니다.

SST란 무엇인가#

종속변수의 전체 변동을 나타내는 총제곱합입니다.

SSR이란 무엇인가#

회귀모형이 설명한 변동입니다.

SSE란 무엇인가#

회귀모형이 설명하지 못한 오차 변동입니다.

SST·SSR·SSE 관계는 무엇인가#

SST = SSR + SSE입니다.

R² 계산식은 무엇인가#

R² = SSR / SST

또는:

R² = 1 − SSE / SST

입니다.

RMSE란 무엇인가#

실제값과 예측값 사이의 오차를 나타내는 지표이며 제공된 학습자료에서는 작을수록 좋은 모델로 설명합니다.

다중공선성이란 무엇인가#

독립변수들 사이에 강한 상관관계가 존재하여 회귀계수가 불안정해지고 해석이 어려워지는 문제입니다.

VIF 기준은 무엇인가#

제공된 학습자료에서는 VIF > 10이면 다중공선성을 의심합니다.

다중공선성 해결방법으로 무엇이 제시되어 있는가#

제공된 학습자료에서는 PCA 주성분분석을 제시합니다.

회귀분석에서 p-value가 0.05보다 작으면 어떻게 해석하는가#

제공된 학습자료 기준 통계적으로 유의하다고 보고 귀무가설을 기각합니다.

R²와 RMSE는 어느 방향이 좋은가#

R²는 클수록 좋고, RMSE는 작을수록 좋습니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 상관계수 r의 범위를 말할 수 있는가?
  2. r의 부호가 무엇을 의미하는지 설명할 수 있는가?
  3. r = 1, -1, 0을 각각 해석할 수 있는가?
  4. 상관관계와 인과관계가 다르다는 것을 알고 있는가?
  5. R²의 범위를 알고 있는가?
  6. R²가 무엇을 설명하는 지표인지 알고 있는가?
  7. 단순회귀에서 r² = R²라는 것을 기억하고 있는가?
  8. r = 0.8일 때 R² = 0.64를 계산할 수 있는가?
  9. SST·SSR·SSE가 무엇을 의미하는지 설명할 수 있는가?
  10. SST = SSR + SSE를 기억하고 있는가?
  11. R² = SSR/SST를 계산할 수 있는가?
  12. R² = 1−SSE/SST 관계를 이해하고 있는가?
  13. SSE는 작을수록 좋다는 것을 알고 있는가?
  14. SST는 동일한 데이터에서 고정된다는 것을 기억하고 있는가?
  15. RMSE가 작을수록 좋다는 것을 알고 있는가?
  16. 다중공선성이 독립변수 사이의 문제라는 것을 알고 있는가?
  17. VIF > 10 기준을 기억하고 있는가?
  18. PCA가 다중공선성 해결방법의 하나로 제시된다는 것을 알고 있는가?
  19. p-value 0.05 기준을 알고 있는가?
  20. R에서 cor()와 lm()의 역할을 구분할 수 있는가?

이 글을 마치며#

회귀분석의 기본은 여러 공식을 따로 외우는 것보다 각 숫자가 무엇을 의미하는지 연결해서 이해하는 것입니다.

먼저 상관계수 r은:

두 변수가 얼마나 같은 방향 또는 반대 방향으로 선형적으로 움직이는가

를 봅니다.

범위는:

-1 ~ +1

입니다.

결정계수 R²는:

회귀모형이 종속변수의 변동을 얼마나 설명하는가

를 나타냅니다.

범위는:

0 ~ 1

입니다.

단순회귀에서는:

R² = r²

관계가 성립합니다.

회귀분석의 변동은:

SST = SSR + SSE

즉:

전체 변동 = 모델이 설명한 변동 + 오차 변동

으로 나뉩니다.

그리고:

R² = SSR / SST = 1 − SSE / SST

입니다.

모델의 오차를 평가하는 RMSE는:

작을수록 좋습니다.

다중회귀에서는 독립변수 사이의 강한 상관관계인 다중공선성을 주의해야 합니다.

제공된 학습자료 기준으로:

VIF > 10

이면 다중공선성을 의심합니다.

시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.

r = -1 ~ +1, 관계의 방향과 강도

R² = 0 ~ 1, 모델 설명력

SST = SSR + SSE

R²는 클수록 좋고 RMSE·SSE는 작을수록 좋음

VIF > 10 → 다중공선성 의심

이 페이지의 목차