단순회귀와 다중회귀란? OLS·회귀계수·다중공선성·VIF·변수선택·AIC·BIC 쉽게 이해하기

1장 단순회귀와 다중회귀는 무엇이 다른가#

회귀분석은 하나 이상의 독립변수를 이용해 종속변수의 변화를 설명하거나 예측하는 분석방법입니다.

예를 들어 다음과 같은 문제를 생각해볼 수 있습니다.

공부시간이 늘어나면 시험점수는 어떻게 변하는가?

이 문제에서는 시험점수에 영향을 주는 변수로 공부시간 하나만 사용합니다.

이런 형태가 단순회귀분석입니다.

반면 현실에서는 시험점수에 공부시간만 영향을 주는 것이 아닐 수 있습니다.

  • 공부시간
  • 출석률
  • 수면시간
  • 과제점수

같은 여러 변수를 동시에 사용할 수 있습니다.

이처럼 독립변수를 여러 개 사용하는 것이 다중회귀분석입니다.

핵심 차이는 간단합니다.

독립변수 1개 → 단순회귀

독립변수 여러 개 → 다중회귀

입니다.


2장 단순 선형 회귀식#

제공된 ADsP 학습자료에서는 단순 선형 회귀식을 다음과 같이 제시합니다.

Y = β₀ + β₁X + ε

각 요소의 의미는 다음과 같습니다.

기호 의미
Y 종속변수
X 독립변수
β₀ 절편 Intercept
β₁ 회귀계수·기울기
ε 오차항

이 식을 이해하면 단순회귀의 기본 구조를 이해한 것입니다.


3장 β₀ 절편이란 무엇인가#

β₀는 절편 Intercept입니다.

단순회귀식:

Y = β₀ + β₁X + ε

에서 X가 0일 때 Y가 가지는 기본적인 값을 나타냅니다.

예를 들어 다음과 같은 회귀식이 있다고 하겠습니다.

시험점수 = 40 + 5 × 공부시간

여기서 절편은 40입니다.

수학적으로 공부시간이 0일 때 예측되는 시험점수가 40이라는 의미입니다.

핵심#

β₀ = X가 0일 때의 Y 기준값

입니다.


4장 β₁ 회귀계수란 무엇인가#

β₁은 독립변수 X의 회귀계수 Regression Coefficient이며 직선의 기울기와 연결됩니다.

단순회귀에서는:

X가 1단위 증가할 때 Y가 얼마나 변하는가?

를 나타냅니다.

앞의 회귀식:

시험점수 = 40 + 5 × 공부시간

에서 β₁은 5입니다.

따라서 공부시간이 1시간 증가하면 시험점수가 평균적으로 5점 증가하는 관계로 해석할 수 있습니다.

핵심#

단순회귀 β₁ = X 1단위 증가에 따른 Y 변화량

입니다.


5장 회귀계수가 음수일 수도 있는가#

가능합니다.

예를 들어 다음과 같은 회귀식이 있다고 하겠습니다.

제품수요 = 1000 − 20 × 가격

여기서 가격의 회귀계수는 -20입니다.

즉 가격이 1단위 증가할 때 제품수요가 평균적으로 20만큼 감소하는 방향의 관계를 나타냅니다.

따라서:

β > 0 → X 증가 시 Y 증가 방향

β < 0 → X 증가 시 Y 감소 방향

으로 이해할 수 있습니다.


6장 ε 오차항이란 무엇인가#

회귀식 마지막에는 ε 오차항이 있습니다.

현실의 데이터는 회귀식 하나로 완벽하게 설명되지 않는 경우가 많습니다.

예를 들어 시험점수는 공부시간뿐 아니라:

  • 집중력
  • 수면
  • 기존 학습수준
  • 시험 난이도

등 다양한 요소의 영향을 받을 수 있습니다.

모형에 포함되지 않은 영향이나 우연한 변동 등이 존재하기 때문에 실제 Y와 회귀식으로 설명되는 값 사이에는 차이가 발생할 수 있습니다.

이를 오차항과 연결해 이해할 수 있습니다.


7장 잔차 Residual는 무엇인가#

회귀분석에서는 실제 관측값과 모형이 예측한 값 사이의 차이가 생깁니다.

쉽게 표현하면:

잔차 = 실제값 − 예측값

입니다.

회귀모형이 데이터를 잘 설명한다면 실제값과 예측값 사이의 차이, 즉 잔차가 작아야 합니다.

최소제곱법 OLS는 바로 이 잔차를 이용해 적절한 회귀선을 찾습니다.


8장 최소제곱법 OLS란 무엇인가#

OLS는 Ordinary Least Squares, 최소제곱법입니다.

제공된 학습자료에서는 다음과 같이 정의합니다.

잔차제곱합 SSE를 최소화하는 회귀계수를 추정하는 방법

입니다.

회귀분석에서는 수많은 직선을 그릴 수 있습니다.

그중에서 실제 데이터와 예측값 사이의 차이가 가장 작아지도록 하는 회귀계수를 찾습니다.

이때 단순히 잔차를 더하지 않고 잔차를 제곱하여 합한 값을 최소화합니다.


9장 왜 잔차를 그냥 더하지 않고 제곱할까#

잔차에는 양수와 음수가 모두 존재할 수 있습니다.

예를 들어 실제값과 예측값 차이가:

+5

-5

라고 하겠습니다.

그대로 더하면:

0

이 됩니다.

하지만 실제로 오차가 없는 것은 아닙니다.

그래서 차이를 제곱합니다.

5² = 25

(-5)² = 25

이렇게 하면 양수와 음수가 서로 상쇄되지 않습니다.

이를 모두 더한 값이 잔차제곱합 SSE입니다.


10장 OLS의 대표 시험 함정#

다음 문장을 주의합니다.

최소제곱법은 잔차의 합을 최소화한다.

틀립니다.

제공된 학습자료에서 정확한 설명은:

잔차제곱합 SSE를 최소화한다

입니다.

따라서 시험 직전에는 다음처럼 기억하면 됩니다.

OLS → Least Squares → 제곱합 최소

입니다.


11장 다중 선형 회귀식#

다중회귀에서는 독립변수를 여러 개 사용합니다.

제공된 학습자료의 식은 다음과 같습니다.

Y = β₀ + β₁X₁ + β₂X₂ + ... + βₚXₚ + ε

여기서:

  • X₁
  • X₂
  • ...
  • Xₚ

가 각각 독립변수입니다.

즉 총 p개의 독립변수를 이용해 Y를 설명합니다.


12장 다중회귀 사례#

주택가격을 예측한다고 생각해봅시다.

종속변수:

Y = 주택가격

독립변수:

X₁ = 면적

X₂ = 역과의 거리

X₃ = 건축연수

라고 할 수 있습니다.

회귀식은 예를 들어 다음처럼 구성할 수 있습니다.

주택가격 = β₀ + β₁면적 + β₂거리 + β₃건축연수 + ε

이처럼 여러 요인의 영향을 동시에 분석하는 것이 다중회귀입니다.


13장 다중회귀의 회귀계수는 어떻게 해석할까#

다중회귀의 회귀계수 해석에서는 매우 중요한 조건이 하나 추가됩니다.

다른 독립변수를 고정한다

는 것입니다.

제공된 학습자료에서는:

각 βᵢ는 다른 변수를 고정했을 때 Xᵢ가 1단위 증가함에 따른 Y의 변화량

으로 설명합니다.

이 문장은 시험에서 매우 중요합니다.


14장 다른 변수를 고정한다는 것은 무슨 뜻인가#

다음 회귀식을 생각해봅시다.

집값 = 1억 + 500만원 × 면적 − 300만원 × 역까지 거리

면적의 회귀계수를 해석할 때는 역까지 거리가 동일하다고 가정합니다.

그 상태에서 면적이 1단위 증가할 때 집값이 얼마나 변하는지 보는 것입니다.

즉 다중회귀에서는:

다른 조건이 동일하다면

이라는 조건을 붙여 회귀계수를 해석합니다.

핵심#

다중회귀 βᵢ = 다른 변수 고정 시 Xᵢ 1단위 증가에 따른 Y 변화

입니다.


15장 단순회귀와 다중회귀의 회귀계수 해석 차이#

단순회귀#

X가 1 증가할 때 Y가 얼마나 변하는가

다중회귀#

다른 독립변수를 고정한 상태에서 X가 1 증가할 때 Y가 얼마나 변하는가

시험에서는 특히 다른 변수를 고정한다는 조건을 기억해야 합니다.


16장 다중회귀에서는 왜 다중공선성을 확인해야 할까#

다중회귀에서는 독립변수가 여러 개 존재합니다.

이때 독립변수들끼리 지나치게 비슷한 정보를 가지고 있을 수 있습니다.

예를 들어 주택가격 예측에 다음 변수를 동시에 사용한다고 하겠습니다.

  • 전체면적
  • 전용면적
  • 방 개수

이 변수들은 서로 강한 관계를 가질 가능성이 있습니다.

이렇게 독립변수들 사이에 강한 상관관계가 존재하는 현상을 다중공선성이라고 합니다.


17장 다중공선성이 생기면 무엇이 문제인가#

제공된 학습자료에서는 다중공선성이 존재하면 회귀계수 추정이 불안정해진다고 설명합니다.

독립변수들이 서로 비슷한 정보를 설명하기 때문에:

실제로 어느 변수가 Y에 영향을 준 것인가?

를 명확하게 구분하기 어려워집니다.

그 결과 회귀계수가 불안정해지고 해석 역시 어려워질 수 있습니다.


18장 다중공선성에 대한 시험 함정#

다음 문장은 틀립니다.

다중공선성이 존재하면 회귀계수 추정이 더 안정적이다.

정반대입니다.

다중공선성 → 회귀계수 추정 불안정

입니다.

따라서:

독립변수끼리 너무 비슷하면 문제가 된다

라고 기억하면 쉽습니다.


19장 VIF란 무엇인가#

VIF는 Variance Inflation Factor입니다.

다중공선성을 확인하는 데 사용하는 대표적인 지표입니다.

제공된 학습자료에서는 다음 기준을 제시합니다.

VIF > 10

→ 다중공선성이 있다고 판단하거나 의심

합니다.

시험에서는 숫자 10을 자주 물을 수 있습니다.

핵심#

VIF 10 초과 → 다중공선성

입니다.


20장 다중공선성 핵심 흐름#

시험에서는 다음 흐름으로 연결하면 됩니다.

독립변수 여러 개

↓

독립변수 간 강한 상관

↓

다중공선성

↓

회귀계수 불안정

↓

VIF 확인

↓

VIF > 10이면 의심

입니다.


21장 회귀분석에서 변수가 너무 많으면 좋은가#

반드시 그렇지는 않습니다.

독립변수를 계속 추가하면 학습 데이터에 대한 설명력은 높아질 수 있습니다.

하지만 필요하지 않은 변수까지 많이 포함하면:

  • 모델이 복잡해지고
  • 해석이 어려워지고
  • 새로운 데이터에 대한 성능이 나빠질 가능성

이 생길 수 있습니다.

따라서 회귀분석에서는 어떤 독립변수를 모델에 포함할 것인지 선택하는 과정이 중요합니다.

이를 변수 선택이라고 합니다.


22장 변수 선택법 3가지#

제공된 ADsP 학습자료에서는 다음 세 가지를 중요하게 다룹니다.

  1. 전진선택법
  2. 후진제거법
  3. 단계적 선택법

시험에서 자주 출제되는 부분입니다.

전체적인 차이는 다음과 같습니다.

방법 시작 진행
전진선택법 변수 없음 하나씩 추가
후진제거법 모든 변수 하나씩 제거
단계적 선택법 추가·제거 두 방법 반복

가장 쉽게:

전진 = 넣는다

후진 = 뺀다

단계적 = 넣었다 뺐다

라고 기억하면 됩니다.


23장 전진선택법 Forward Selection이란 무엇인가#

전진선택법은 처음에는 독립변수를 하나도 사용하지 않는 모형에서 시작합니다.

그리고 도움이 되는 변수를 하나씩 추가합니다.

제공된 학습자료에서는:

F통계량이 가장 큰 변수부터 순차적으로 추가

한다고 설명합니다.

전체 흐름은:

변수 없음

↓

가장 유용한 변수 추가

↓

다음 변수 추가

↓

반복

입니다.

핵심#

전진선택 = 없음 → 추가

입니다.


24장 전진선택법을 쉽게 이해하면#

회사 매출을 설명하기 위해 다음 후보변수가 있다고 하겠습니다.

  • 광고비
  • 방문자 수
  • 할인율
  • 날씨
  • 직원 수

전진선택법에서는 처음에 아무 변수도 없는 상태에서 시작합니다.

그다음 가장 설명력이 높은 변수를 먼저 추가하고, 그 이후 도움이 되는 변수를 계속 추가합니다.

즉 빈 모델에서 점점 변수가 늘어나는 방식입니다.


25장 후진제거법 Backward Elimination이란 무엇인가#

후진제거법은 전진선택법과 반대입니다.

처음부터 모든 후보 독립변수를 포함한 상태로 시작합니다.

그다음 중요도가 낮은 변수를 하나씩 제거합니다.

제공된 학습자료에서는:

F통계량이 가장 작은 변수부터 순차 제거

한다고 설명합니다.

핵심#

후진제거 = 전체 → 제거

입니다.


26장 후진제거법을 쉽게 이해하면#

앞의 후보변수 다섯 개를 모두 모델에 포함합니다.

  • 광고비
  • 방문자 수
  • 할인율
  • 날씨
  • 직원 수

그다음 가장 도움이 적은 변수를 제거합니다.

그리고 다시 모델을 검토한 뒤 다음 변수를 제거합니다.

즉:

다 넣고 → 필요 없는 것을 뺀다

는 방식입니다.


27장 단계적 선택법 Stepwise Selection이란 무엇인가#

단계적 선택법은 전진선택과 후진제거를 결합한 방식입니다.

변수를 추가하기만 하는 것도 아니고 제거하기만 하는 것도 아닙니다.

새로운 변수를 추가한 뒤 기존에 들어 있던 변수가 더 이상 필요하지 않다고 판단되면 다시 제거할 수 있습니다.

그래서 제공된 학습자료에서는 세 방법 가운데 가장 유연한 방식으로 설명합니다.

핵심#

Stepwise = 추가 + 제거 반복

입니다.


28장 변수 선택법 3가지를 방향으로 기억하기#

전진선택법#

없음 → 추가

후진제거법#

전체 → 제거

단계적 선택법#

추가 ↔ 제거

이 세 방향만 기억하면 이름이 헷갈리는 것을 줄일 수 있습니다.


29장 전진선택과 후진제거의 대표 함정#

다음 설명을 주의합니다.

전진선택법은 모든 변수를 넣은 뒤 하나씩 제거한다.

틀립니다.

이것은 후진제거법입니다.

반대로:

후진제거법은 아무 변수도 없는 상태에서 하나씩 추가한다.

역시 틀립니다.

이것은 전진선택법입니다.

따라서:

Forward → 앞으로 추가

Backward → 뒤로 빼기

라고 기억해도 좋습니다.


30장 좋은 회귀모형은 어떻게 고를까#

회귀모형을 여러 개 만들었다면 그중 어떤 모델을 선택할지 결정해야 합니다.

단순히 변수를 많이 넣는다고 좋은 것은 아닙니다.

제공된 학습자료에서는 대표적인 모형 선택 기준으로:

  • AIC
  • BIC
  • Cp 통계량

을 제시합니다.

특히 AIC와 BIC는 ADsP에서 자주 출제됩니다.


31장 AIC란 무엇인가#

AIC는 Akaike Information Criterion입니다.

회귀모형의 적합도와 복잡성을 함께 고려하여 모델을 비교하는 기준입니다.

제공된 학습자료의 핵심은 매우 간단합니다.

AIC는 작을수록 좋은 모형

입니다.

또한 모델에 변수가 지나치게 많아지는 것을 막기 위해 변수 수에 대한 패널티를 고려합니다.

핵심#

AIC ↓ → 좋은 모형

입니다.


32장 왜 변수 수에 패널티를 줄까#

변수를 계속 추가하면 학습 데이터에 대한 설명력은 높아질 수 있습니다.

하지만 무조건 변수 수를 늘리면 복잡한 모델이 항상 선택될 수 있습니다.

이를 막기 위해 AIC는:

  • 모형 적합도
  • 모형 복잡도

를 함께 고려합니다.

즉:

데이터를 잘 설명하면서 지나치게 복잡하지 않은 모델

을 찾는 데 사용합니다.


33장 BIC란 무엇인가#

BIC는 Bayesian Information Criterion입니다.

BIC 역시 모형 선택에 사용하며:

작을수록 좋은 모형

입니다.

제공된 학습자료에서 특히 중요한 차이는:

BIC는 AIC보다 변수 수에 대한 패널티가 더 크다

는 것입니다.

따라서 BIC는 상대적으로 더 단순한 모형을 선호합니다.


34장 AIC와 BIC 차이#

둘의 공통점부터 보면:

AIC → 작을수록 좋음

BIC → 작을수록 좋음

입니다.

차이는 패널티입니다.

AIC#

변수 수에 패널티 부여

BIC#

AIC보다 변수 수 패널티가 더 큼

→ 더 단순한 모형을 선호

시험에서는 다음 문장을 기억하면 됩니다.

BIC가 AIC보다 복잡한 모델에 더 엄격하다

입니다.


35장 AIC와 BIC 비교표#

기준 AIC BIC
전체 이름 Akaike Information Criterion Bayesian Information Criterion
좋은 방향 작을수록 좋음 작을수록 좋음
복잡도 패널티 있음 AIC보다 큼
성향 적합도와 복잡성 고려 상대적으로 단순한 모형 선호

시험에서 가장 중요한 것은:

둘 다 작을수록 좋다

는 점입니다.


36장 Cp 통계량이란 무엇인가#

제공된 학습자료에서는 변수 선택과 모형 평가에 사용할 수 있는 지표로 Cp 통계량도 제시합니다.

시험에서 기억해야 할 핵심은:

Cp도 작을수록 좋다

는 것입니다.

따라서 이번 범위에서는:

AIC ↓

BIC ↓

Cp ↓

를 하나로 묶어 기억할 수 있습니다.


37장 AIC가 크면 좋은 모델인가#

아닙니다.

제공된 학습자료의 대표적인 함정입니다.

AIC가 클수록 좋은 모형이다.

틀립니다.

정확한 방향은:

AIC가 작을수록 좋은 모형

입니다.

BIC와 Cp도 학습자료 기준으로 작을수록 좋은 방향입니다.


38장 R²가 가장 높은 모델이 무조건 최선인가#

아닙니다.

제공된 학습자료에서는 다음 문장을 대표적인 함정으로 제시합니다.

R²가 가장 높은 모형이 최선이다.

틀립니다.

독립변수를 추가하면 R²가 높아질 수 있기 때문에 단순히 R²만 보고 모델을 선택하면 과적합 위험이 있을 수 있습니다.

따라서:

  • 설명력
  • 모델 복잡도
  • 변수 수
  • AIC
  • BIC

등을 함께 고려해야 합니다.


39장 변수를 추가하면 왜 R²가 문제가 될 수 있을까#

회귀모형에 변수를 추가하면 기존 모델보다 설명할 수 있는 정보가 늘어날 가능성이 있습니다.

따라서 단순 R²만 보면 많은 변수를 가진 복잡한 모델이 유리해질 수 있습니다.

하지만 새로운 변수가 실제로 의미 있는 정보가 아니라 우연한 패턴까지 설명한다면 새로운 데이터에서는 성능이 떨어질 수 있습니다.

이런 문제를 피하기 위해 모델의 설명력과 복잡성을 함께 고려하는 기준이 필요합니다.

AIC와 BIC가 등장하는 이유를 이런 관점으로 이해하면 쉽습니다.


40장 OLS부터 모형 선택까지 전체 흐름#

회귀분석 전체 흐름을 연결해보겠습니다.

1단계#

독립변수와 종속변수를 설정합니다.

2단계#

OLS를 이용해 회귀계수를 추정합니다.

3단계#

각 회귀계수와 모델을 해석합니다.

4단계#

다중회귀라면 다중공선성을 확인합니다.

5단계#

필요하면 변수를 선택합니다.

6단계#

여러 모형 가운데 AIC·BIC 등을 이용해 적절한 모형을 선택합니다.

즉 회귀분석은 단순히 회귀식을 한 번 계산하고 끝나는 과정이 아닙니다.


41장 사례로 단순회귀 이해하기#

온라인 광고비와 매출의 관계를 분석한다고 하겠습니다.

회귀식이 다음처럼 나왔다고 가정합니다.

매출 = 1000 + 5 × 광고비

여기서:

β₀ = 1000

β₁ = 5

입니다.

따라서 광고비가 1단위 증가할 때 매출이 평균적으로 5단위 증가한다고 해석할 수 있습니다.

독립변수는 광고비 하나뿐이므로 단순회귀입니다.


42장 사례로 다중회귀 이해하기#

이번에는 매출에 영향을 주는 변수를 여러 개 사용합니다.

매출 = β₀ + β₁광고비 + β₂방문자수 + β₃할인율 + ε

광고비의 β₁을 해석할 때는:

방문자 수와 할인율을 고정한 상태에서

광고비가 1단위 증가할 때 매출이 얼마나 변하는지를 봅니다.

이것이 단순회귀와 다중회귀의 회귀계수 해석에서 가장 중요한 차이입니다.


43장 사례로 다중공선성 이해하기#

주택가격을 분석하면서 다음 독립변수를 사용한다고 하겠습니다.

  • 전용면적
  • 방 개수
  • 거실 크기

대체로 면적이 큰 집은 방과 거실도 큰 경우가 많습니다.

세 변수가 지나치게 강하게 연결되어 있으면 모델 입장에서는:

집값 상승에 영향을 준 것이 전용면적인가?

방 개수인가?

거실 크기인가?

를 구분하기 어려워질 수 있습니다.

이것이 다중공선성 문제입니다.

이 경우 VIF 등을 통해 확인합니다.


44장 사례로 변수 선택법 이해하기#

후보변수가 다음과 같다고 하겠습니다.

  • 광고비
  • 가격
  • 할인율
  • 방문자 수
  • 날씨

전진선택#

아무 변수 없이 시작

→ 광고비 추가

→ 방문자 수 추가

→ 할인율 추가

후진제거#

5개 모두 포함

→ 날씨 제거

→ 가격 제거

단계적 선택#

광고비 추가

→ 방문자 수 추가

→ 기존 광고비 영향 재검토

→ 필요하면 제거

처럼 추가와 제거를 반복할 수 있습니다.


45장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 최소제곱법은 잔차의 합을 최소화한다#

틀립니다.

잔차제곱합 SSE를 최소화합니다.

함정 2. 단순회귀는 독립변수를 여러 개 사용한다#

틀립니다.

독립변수 하나를 사용합니다.

함정 3. 다중회귀의 회귀계수는 다른 변수의 영향을 고려하지 않고 해석한다#

틀립니다.

다른 변수를 고정한 상태에서 해석합니다.

함정 4. 다중공선성은 종속변수와 독립변수 사이의 강한 상관이다#

틀립니다.

독립변수들 사이의 강한 상관관계입니다.

함정 5. 다중공선성이 발생하면 회귀계수가 더 안정적이다#

틀립니다.

불안정해집니다.

함정 6. VIF가 10을 초과하면 다중공선성을 의심한다#

제공된 학습자료 기준 맞습니다.

함정 7. 전진선택법은 모든 변수에서 시작한다#

틀립니다.

변수가 없는 상태에서 시작합니다.

함정 8. 후진제거법은 변수가 없는 상태에서 시작한다#

틀립니다.

모든 변수를 포함한 상태에서 시작합니다.

함정 9. 단계적 선택법은 변수 추가만 수행한다#

틀립니다.

추가와 제거를 함께 반복합니다.

함정 10. AIC는 클수록 좋다#

틀립니다.

작을수록 좋습니다.

함정 11. BIC는 AIC보다 변수 수에 대한 패널티가 작다#

틀립니다.

제공된 학습자료에서는 BIC의 패널티가 더 크다고 설명합니다.

함정 12. R²가 가장 큰 모델을 무조건 선택하면 된다#

틀립니다.

과적합 위험 때문에 AIC·BIC 등 여러 기준을 함께 고려해야 합니다.


46장 단순·다중회귀 시험 직전 암기#

단순회귀#

Y = β₀ + β₁X + ε

→ 독립변수 1개

→ β₁ = X 1단위 증가에 따른 Y 변화량

다중회귀#

Y = β₀ + β₁X₁ + β₂X₂ + ... + βₚXₚ + ε

→ 독립변수 여러 개

→ βᵢ = 다른 변수 고정 시 Xᵢ 1단위 증가에 따른 Y 변화량


47장 OLS 시험 직전 암기#

OLS

→ Ordinary Least Squares

→ 최소제곱법

→ 회귀계수 추정

→ 잔차제곱합 SSE 최소화

가장 중요한 함정:

잔차 합 최소화 X

잔차제곱합 최소화 O

입니다.


48장 다중공선성 시험 직전 암기#

다중공선성

→ 독립변수끼리 강한 상관

→ 회귀계수 불안정

→ 해석 어려움

확인:

VIF

기준:

VIF > 10

입니다.

한 줄로:

독립변수끼리 너무 친하면 회귀계수가 흔들린다

라고 기억할 수 있습니다.


49장 변수 선택법 시험 직전 암기#

전진선택법#

없음 → 추가

→ F통계량 큰 변수부터

후진제거법#

전체 → 제거

→ F통계량 작은 변수부터

단계적 선택법#

추가 + 제거

→ 가장 유연

가장 쉽게:

전진 = 넣기

후진 = 빼기

단계 = 넣고 빼기

입니다.


50장 모형 선택 기준 시험 직전 암기#

AIC#

→ 작을수록 좋음

→ 적합도와 변수 수 패널티 고려

BIC#

→ 작을수록 좋음

→ AIC보다 변수 수 패널티 큼

→ 상대적으로 단순한 모형 선호

Cp#

→ 작을수록 좋음

따라서 시험에서는:

AIC ↓

BIC ↓

Cp ↓

로 기억하면 됩니다.


51장 단순·다중 회귀분석 핵심 비교표#

개념 핵심
단순회귀 독립변수 1개
다중회귀 독립변수 여러 개
OLS SSE를 최소화
β₀ 절편
β₁ 회귀계수
ε 오차항
다중공선성 독립변수 간 강한 상관
VIF 10 초과 시 다중공선성 의심
전진선택 변수 추가
후진제거 변수 제거
단계적 선택 추가·제거 반복
AIC 작을수록 좋음
BIC 작을수록 좋고 변수 패널티 큼
Cp 작을수록 좋음

단순·다중 회귀분석 FAQ#

단순회귀분석이란 무엇인가#

하나의 독립변수를 이용해 종속변수를 설명하거나 예측하는 회귀분석입니다.

단순 선형 회귀식은 무엇인가#

Y = β₀ + β₁X + ε

입니다.

β₀는 무엇인가#

절편 Intercept입니다.

β₁은 무엇인가#

단순회귀에서는 X가 1단위 증가할 때 Y가 얼마나 변하는지를 나타내는 회귀계수입니다.

ε는 무엇인가#

오차항입니다.

다중회귀분석이란 무엇인가#

여러 개의 독립변수를 이용해 하나의 종속변수를 설명하거나 예측하는 회귀분석입니다.

다중회귀의 회귀계수는 어떻게 해석하는가#

다른 독립변수를 고정한 상태에서 해당 독립변수가 1단위 증가할 때 종속변수가 얼마나 변하는지로 해석합니다.

OLS란 무엇인가#

Ordinary Least Squares의 약자로 잔차제곱합 SSE를 최소화하는 회귀계수를 추정하는 방법입니다.

최소제곱법은 잔차의 합을 최소화하는가#

아닙니다.

잔차제곱합을 최소화합니다.

다중공선성이란 무엇인가#

다중회귀에서 독립변수들 사이에 강한 상관관계가 존재하는 현상입니다.

다중공선성이 발생하면 어떤 문제가 있는가#

회귀계수 추정이 불안정해지고 개별 변수의 영향력을 해석하기 어려워질 수 있습니다.

VIF 기준은 무엇인가#

제공된 학습자료에서는 VIF > 10이면 다중공선성이 있다고 판단하거나 의심합니다.

전진선택법은 어떻게 진행하는가#

변수가 없는 모형에서 시작하여 F통계량이 큰 변수를 순차적으로 추가합니다.

후진제거법은 어떻게 진행하는가#

모든 후보변수를 포함하고 시작하여 F통계량이 작은 변수부터 순차적으로 제거합니다.

단계적 선택법은 무엇인가#

전진선택과 후진제거를 결합해 변수의 추가와 제거를 반복하는 방식입니다.

AIC는 큰 것이 좋은가#

아닙니다.

작을수록 좋은 모형으로 판단합니다.

BIC는 무엇이 다른가#

제공된 학습자료에서는 BIC가 AIC보다 변수 수에 대한 패널티가 커서 더 단순한 모형을 선호한다고 설명합니다.

Cp 통계량은 어느 방향이 좋은가#

제공된 학습자료에서는 작을수록 좋음으로 정리합니다.

R²가 가장 높은 모형이 항상 좋은가#

아닙니다.

변수가 많아지면서 과적합이 발생할 수 있으므로 AIC·BIC 등의 다른 기준도 함께 고려해야 합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 단순회귀와 다중회귀의 차이를 설명할 수 있는가?
  2. 단순 선형 회귀식을 쓸 수 있는가?
  3. β₀와 β₁의 의미를 설명할 수 있는가?
  4. 다중회귀의 회귀계수를 해석할 때 다른 변수를 고정한다는 것을 알고 있는가?
  5. OLS의 전체 이름을 알고 있는가?
  6. OLS가 무엇을 최소화하는지 알고 있는가?
  7. 잔차의 합과 잔차제곱합을 혼동하지 않을 수 있는가?
  8. 다중공선성이 독립변수 사이의 문제라는 것을 알고 있는가?
  9. 다중공선성이 회귀계수를 불안정하게 만든다는 것을 알고 있는가?
  10. VIF > 10 기준을 기억하고 있는가?
  11. 전진선택법이 어떤 상태에서 시작하는지 알고 있는가?
  12. 후진제거법이 어떤 상태에서 시작하는지 알고 있는가?
  13. 단계적 선택법이 추가와 제거를 모두 수행한다는 것을 알고 있는가?
  14. AIC는 작을수록 좋다는 것을 알고 있는가?
  15. BIC도 작을수록 좋다는 것을 알고 있는가?
  16. BIC가 AIC보다 변수 수에 더 큰 패널티를 준다는 것을 기억하고 있는가?
  17. Cp 통계량의 방향을 알고 있는가?
  18. R²만으로 최종 모형을 고르는 것이 위험할 수 있다는 것을 이해하고 있는가?

이 글을 마치며#

단순회귀와 다중회귀의 가장 기본적인 차이는 독립변수의 개수입니다.

단순회귀는:

Y = β₀ + β₁X + ε

처럼 하나의 독립변수를 사용합니다.

다중회귀는:

Y = β₀ + β₁X₁ + β₂X₂ + ... + βₚXₚ + ε

처럼 여러 독립변수를 사용합니다.

회귀계수는 단순회귀에서는:

X가 1단위 증가할 때 Y의 변화량

으로 해석하고,

다중회귀에서는:

다른 변수를 고정한 상태에서 X가 1단위 증가할 때 Y의 변화량

으로 해석합니다.

회귀계수를 추정하는 대표적인 방법은 OLS입니다.

핵심은:

잔차의 합이 아니라 잔차제곱합 SSE를 최소화한다

는 것입니다.

다중회귀에서는 독립변수 사이의 강한 상관관계인 다중공선성을 주의합니다.

제공된 학습자료 기준:

VIF > 10

이면 다중공선성을 의심합니다.

변수 선택법은:

전진 = 추가

후진 = 제거

단계적 = 추가 + 제거

로 기억합니다.

마지막으로 모형 선택 기준은:

AIC 작을수록 좋음

BIC 작을수록 좋음

Cp 작을수록 좋음

입니다.

시험 직전에는 다음 다섯 줄만 기억해도 핵심을 복원할 수 있습니다.

단순 = X 하나 / 다중 = X 여러 개

OLS = SSE 최소화

다중공선성 = 독립변수끼리 강한 상관 / VIF > 10

전진은 넣고, 후진은 빼고, 단계적은 넣고 뺀다

AIC·BIC·Cp는 작을수록 좋다

이 페이지의 목차