PCA 주성분분석이란? 차원 축소·분산·주성분·다중공선성 쉽게 이해하기

1장 PCA란 무엇인가#

PCA는 Principal Component Analysis, 우리말로 주성분분석이라고 합니다.

PCA의 가장 중요한 목적은:

고차원 데이터를 저차원으로 축소하면서 정보 손실을 최소화하는 것

입니다.

예를 들어 고객 한 명을 설명하는 변수가 다음과 같이 20개 있다고 하겠습니다.

  • 나이
  • 소득
  • 구매횟수
  • 구매금액
  • 방문횟수
  • 체류시간
  • 최근 구매일
  • 상품별 구매량
  • 기타 여러 행동지표

변수가 많아질수록 분석은 복잡해집니다.

PCA는 이 많은 변수에서 중요한 정보를 추출해:

20개 변수

↓

5개 주성분

처럼 더 적은 수의 변수로 데이터를 표현할 수 있게 합니다.

핵심#

PCA = 차원 축소

입니다.


2장 차원 Dimension이란 무엇인가#

PCA에서 말하는 차원은 쉽게 생각하면 변수의 개수입니다.

예를 들어 데이터가:

키

몸무게

라는 두 변수로 이루어져 있다면 2차원 데이터로 생각할 수 있습니다.

여기에:

나이

가 추가되면 3차원이 됩니다.

변수가 100개라면 100차원 데이터가 됩니다.

따라서 차원 축소는:

변수의 수를 줄여 데이터를 더 간단하게 표현하는 것

이라고 이해할 수 있습니다.


3장 왜 차원을 줄여야 할까#

변수가 많다고 해서 항상 좋은 것은 아닙니다.

변수가 지나치게 많으면:

  • 분석이 복잡해지고
  • 계산량이 증가하고
  • 변수 사이에 중복정보가 존재할 수 있으며
  • 시각화가 어려워질 수 있습니다.

PCA는 여러 변수에 흩어져 있는 정보를 새로운 축으로 압축하여 더 적은 수의 변수로 표현합니다.

중요한 것은 무작정 변수를 삭제하는 것이 아니라 가능한 한 많은 정보를 유지하면서 줄이는 것입니다.


4장 PCA를 쉽게 이해하면#

학생들의 능력을 다음 5개 점수로 측정한다고 하겠습니다.

  • 국어
  • 영어
  • 수학
  • 과학
  • 사회

학생마다 5개의 숫자가 존재합니다.

그런데 실제 데이터를 살펴보니 국어·영어·사회 점수가 서로 비슷한 방향으로 움직이고, 수학·과학도 비슷한 경향을 보일 수 있습니다.

이 경우 5개 점수를 각각 모두 사용하는 대신 여러 과목의 정보를 조합한 새로운 변수들을 만들 수 있습니다.

예를 들어:

주성분 1 = 전반적인 학업성취도

주성분 2 = 언어계열과 수리계열의 차이

처럼 기존 변수들을 조합해 새로운 축으로 데이터를 표현하는 방식으로 이해할 수 있습니다.


5장 주성분 Principal Component이란 무엇인가#

주성분은 기존 변수들의 선형 결합으로 만들어진 새로운 변수입니다.

즉 기존 변수 중 하나를 그대로 선택하는 것이 아닙니다.

예를 들어 원래 변수가:

X₁

X₂

X₃

이라고 하면 하나의 주성분은 개념적으로:

PC₁ = aX₁ + bX₂ + cX₃

처럼 기존 변수들의 조합으로 만들어질 수 있습니다.

여기서 중요한 것은 PCA가 기존 변수를 단순 삭제하는 것이 아니라 기존 변수들을 조합하여 새로운 변수축을 만든다는 점입니다.

핵심#

주성분 = 원래 변수들의 선형 결합

입니다.


6장 PCA는 변수 선택과 같은가#

완전히 같은 개념으로 보면 안 됩니다.

변수 선택은 기존 변수 가운데 필요한 것을 골라 사용하는 방식입니다.

예를 들어:

10개 변수

↓

중요한 기존 변수 3개 선택

처럼 사용할 수 있습니다.

반면 PCA는:

10개 기존 변수

↓

기존 변수들의 조합으로 새로운 주성분 생성

이라는 방식입니다.

즉:

변수 선택 = 원래 변수 중 선택

PCA = 원래 변수를 조합한 새로운 변수 생성

으로 구분할 수 있습니다.


7장 제1주성분이란 무엇인가#

PCA에서 가장 중요한 것이 제1주성분 First Principal Component입니다.

제공된 학습자료에서는 제1주성분을:

분산이 가장 큰 방향

이라고 설명합니다.

쉽게 말하면 데이터가 가장 넓게 퍼져 있는 방향을 새로운 첫 번째 축으로 선택합니다.

핵심#

제1주성분 = 가장 많은 분산을 설명하는 방향

입니다.


8장 왜 분산이 큰 방향을 찾을까#

분산은 데이터가 얼마나 넓게 퍼져 있는지를 나타냅니다.

데이터가 거의 변하지 않는 방향보다는 데이터가 많이 달라지는 방향에 더 많은 구분 정보가 담겨 있을 가능성이 있습니다.

예를 들어 데이터가 길쭉한 타원 형태로 퍼져 있다고 생각해봅시다.

가장 길게 퍼진 방향을 축으로 잡으면 데이터의 차이를 많이 보존할 수 있습니다.

반대로 거의 변화가 없는 짧은 방향만 선택하면 많은 정보를 잃게 됩니다.

따라서 PCA는 분산이 큰 방향부터 주성분으로 선택합니다.


9장 제2주성분은 어떻게 만들어지는가#

제1주성분을 찾은 뒤에는 제1주성분과 겹치지 않는 새로운 방향에서 다음으로 많은 분산을 설명하는 축을 찾습니다.

이것이 제2주성분입니다.

그다음:

제3주성분

제4주성분

순으로 만들 수 있습니다.

중요한 특징은 각 주성분이 서로 같은 정보를 반복해서 설명하지 않도록 서로 직교하는 방향으로 만들어진다는 것입니다.


10장 주성분은 서로 직교한다#

제공된 학습자료의 핵심 내용입니다.

주성분들은 서로 직교 Orthogonal합니다.

직교한다는 것은 기하학적으로 서로 수직인 방향이라는 뜻입니다.

통계적인 관점에서는 제공된 학습자료에서:

상관관계 = 0

으로 설명합니다.

즉 한 주성분이 가지고 있는 정보와 다른 주성분이 가지고 있는 정보가 서로 겹치지 않도록 새로운 축을 구성합니다.

핵심#

주성분끼리 직교 → 상관관계 없음

입니다.


11장 직교를 쉽게 이해하면#

2차원 좌표에서:

x축

과

y축

을 생각하면 쉽습니다.

두 축은 90도로 만나 서로 다른 방향을 나타냅니다.

PCA에서도 새로운 주성분 축들이 서로 겹치지 않는 방향으로 만들어집니다.

따라서 제공된 학습자료에서는 주성분을 서로 독립적이며 상관관계가 없는 변수로 정리합니다.

시험에서는 특히:

주성분끼리 상관관계가 있다

라는 문장을 주의해야 합니다.


12장 첫 번째 주성분이 가장 중요하다#

PCA에서는 제1주성분이 가장 많은 분산을 설명합니다.

그다음 제2주성분이 다음으로 많은 분산을 설명합니다.

따라서 일반적인 순서는:

PC1 설명력 > PC2 설명력 > PC3 설명력 ...

으로 이해할 수 있습니다.

즉 주성분은 중요한 정보를 많이 포함하는 순서대로 정렬됩니다.


13장 주성분 개수는 몇 개인가#

ADsP에서 자주 출제되는 부분입니다.

제공된 학습자료에서는:

주성분 개수의 최대값은 변수 개수

라고 설명합니다.

예를 들어 기존 변수가 5개라면 만들 수 있는 주성분도 최대 5개입니다.

예#

기존 변수:

X₁, X₂, X₃, X₄

→ 최대 주성분:

PC1, PC2, PC3, PC4

입니다.


14장 주성분 개수와 관측치 수를 혼동하지 말자#

제공된 학습자료의 대표적인 함정입니다.

주성분의 개수는 관측치 개수와 같다.

틀립니다.

제공된 학습자료에서는:

주성분 개수는 변수 개수와 연결

합니다.

즉 학생 1,000명을 조사했다고 해서 주성분이 1,000개가 되는 것이 아닙니다.

변수가 10개라면 최대 주성분 수도 10개입니다.

핵심#

주성분 수 → 변수 수

관측치 수 X

입니다.


15장 PCA에서 차원 축소는 어떻게 이루어질까#

기존 변수가 10개라면 PCA를 통해 최대 10개의 주성분을 만들 수 있습니다.

하지만 차원 축소가 목적이라면 모든 주성분을 다시 사용할 필요가 없습니다.

예를 들어:

PC1 → 많은 정보

PC2 → 다음으로 많은 정보

PC3 → 어느 정도 정보

PC4~PC10 → 상대적으로 적은 정보

라고 한다면:

PC1 + PC2 + PC3

만 사용해서 원래 10차원 데이터를 3차원으로 축소할 수 있습니다.

이것이 PCA를 이용한 차원 축소의 핵심입니다.


16장 정보 손실 최소화란 무엇인가#

차원을 줄이면 어느 정도 정보가 줄어들 수 있습니다.

하지만 PCA는 아무 방향이나 버리지 않습니다.

분산을 많이 설명하는 주성분부터 남기고 분산이 작은 주성분을 제거합니다.

즉 가능한 한 중요한 데이터 변화를 유지하면서 덜 중요한 정보를 제거하려고 합니다.

그래서 PCA의 목적을:

정보 손실을 최소화하면서 차원 축소

라고 설명합니다.


17장 PCA와 분산의 관계#

PCA를 이해할 때 가장 중요한 단어 중 하나가 분산 Variance입니다.

PCA는:

데이터를 어떤 방향으로 바라보면 가장 많이 퍼져 있는가?

를 찾습니다.

가장 많이 퍼진 방향:

→ PC1

그다음 많이 퍼진 방향:

→ PC2

그다음:

→ PC3

순으로 주성분을 만듭니다.

따라서 PCA 문제에서는:

분산이 큰 방향

이라는 표현이 나오면 주성분과 연결해야 합니다.


18장 PCA 활용 1: 차원 축소#

PCA의 대표적인 활용은 변수 개수를 줄이는 것입니다.

예를 들어 원래 데이터가 변수 100개를 가지고 있다고 하겠습니다.

분석 결과 앞쪽 몇 개 주성분만으로 원래 데이터의 주요 정보를 충분히 표현할 수 있다면:

100차원

↓

10차원

처럼 데이터를 줄일 수 있습니다.

이렇게 하면 분석과 계산이 단순해질 수 있습니다.


19장 PCA 활용 2: 다중공선성 해결#

ADsP에서 매우 중요한 연결입니다.

제공된 학습자료에서는 PCA를 다중공선성 문제 해결에 활용할 수 있다고 설명합니다.

다중공선성은 회귀분석에서 독립변수끼리 강한 상관관계를 가지고 있는 상태입니다.

예를 들어:

X₁과 X₂가 거의 같은 방향으로 움직이면 두 변수가 서로 중복된 정보를 가지고 있을 수 있습니다.

PCA를 적용하면 서로 직교하는 주성분으로 변환할 수 있습니다.


20장 PCA가 다중공선성을 줄이는 이유#

원래 변수들은 서로 상관관계를 가지고 있을 수 있습니다.

예를 들어:

X₁ ↔ X₂

상관관계 높음

X₂ ↔ X₃

상관관계 높음

과 같은 상황입니다.

PCA를 적용하면:

PC1

PC2

PC3

처럼 서로 직교하는 새로운 변수를 만듭니다.

제공된 학습자료에서는 주성분 사이의 상관관계가 0이라고 설명하므로 기존 변수 사이의 강한 상관관계 문제를 줄일 수 있습니다.

핵심#

PCA → 직교 주성분 → 다중공선성 해결

입니다.


21장 다중공선성과 VIF를 함께 기억하기#

앞에서 회귀분석을 공부했다면 다중공선성 문제와 VIF를 연결할 수 있습니다.

다중공선성이 심하면 회귀계수가 불안정해질 수 있습니다.

제공된 학습자료에서는 해결 방법 가운데 하나로 PCA를 제시했습니다.

따라서 시험에서는:

다중공선성 문제를 해결하기 위해 사용할 수 있는 차원 축소 방법은?

이라는 문제가 나오면:

PCA

를 떠올릴 수 있습니다.


22장 PCA 활용 3: 데이터 시각화#

고차원 데이터는 사람이 직접 볼 수 없습니다.

예를 들어 변수가 20개라면 20차원 공간을 그림으로 표현하기 어렵습니다.

PCA를 이용해:

20차원

↓

2차원

또는:

20차원

↓

3차원

으로 축소하면 데이터를 그래프로 표현하기 쉬워집니다.

제공된 학습자료에서는 PCA 활용으로:

고차원 데이터를 2~3차원으로 투영하여 시각화

하는 방법을 제시합니다.


23장 PCA 활용 4: 노이즈 제거#

제공된 학습자료에서는 PCA를 노이즈 제거에도 활용할 수 있다고 설명합니다.

핵심 아이디어는:

분산이 작은 성분을 제거

하는 것입니다.

주요 패턴은 상대적으로 분산이 큰 주성분에 담기고 작은 분산의 성분에는 덜 중요한 정보나 노이즈가 포함될 수 있다고 보고 이를 제거하는 방식입니다.

핵심#

작은 분산 성분 제거 → 노이즈 감소

입니다.


24장 PCA 활용 한눈에 보기#

활용 의미
차원 축소 변수 개수 줄이기
다중공선성 해결 서로 직교하는 주성분 생성
시각화 고차원 데이터를 2~3차원으로 표현
노이즈 제거 분산이 작은 성분 제거

시험에서는 특히:

PCA = 차원 축소 + 다중공선성 해결

연결이 중요합니다.


25장 PCA에서 원래 변수는 사라지는가#

PCA를 적용하면 분석에서는 기존 변수 대신 새로운 주성분 변수를 사용할 수 있습니다.

예를 들어:

키

몸무게

허리둘레

체지방률

이라는 변수들을 조합해:

PC1

PC2

PC3

PC4

라는 새로운 축을 만들 수 있습니다.

따라서 PCA 결과의 주성분은 원래 변수 하나와 동일한 의미가 아니라 여러 변수의 정보를 조합한 결과입니다.


26장 PCA 결과는 해석하기 쉬운가#

원래 변수는:

나이

소득

키

몸무게

처럼 명확한 의미를 가지고 있습니다.

하지만 주성분은 여러 변수를 선형 결합하여 만들기 때문에:

PC1

PC2

처럼 새로운 축 자체의 의미를 직관적으로 설명하기 어려울 수 있습니다.

따라서 PCA는 차원을 줄이는 데 매우 유용하지만 원래 변수 그대로 사용하는 것보다 해석이 직관적이지 않을 수 있습니다.

ADsP에서는 우선 주성분은 기존 변수의 선형 결합이라는 점을 기억하는 것이 중요합니다.


27장 PCA 전체 과정을 쉽게 정리하면#

PCA의 흐름을 개념적으로 정리하면 다음과 같습니다.

여러 개의 원래 변수

↓

데이터가 많이 퍼진 방향 탐색

↓

제1주성분 생성

↓

제1주성분과 직교하면서 다음으로 분산이 큰 방향 탐색

↓

제2주성분 생성

↓

필요한 수의 주성분 선택

↓

저차원 데이터로 변환

입니다.

핵심은 항상 분산이 큰 방향부터 선택한다는 것입니다.


28장 PCA와 군집분석은 같은 것인가#

아닙니다.

PCA#

차원 축소

→ 새로운 주성분 생성

군집분석#

비슷한 데이터끼리 그룹 생성

입니다.

PCA를 먼저 적용해서 변수 수를 줄인 후 군집분석에 사용할 수도 있지만 두 분석방법의 목적은 서로 다릅니다.

핵심#

PCA = 변수 축소

Clustering = 데이터 그룹화

입니다.


29장 PCA와 변수선택의 차이#

다시 한번 시험 관점에서 구분하면 다음과 같습니다.

변수선택#

기존 변수 중 일부 선택

예:

X1, X2, X3, X4, X5

↓

X1, X3

PCA#

기존 변수들을 조합해 새로운 주성분 생성

예:

X1, X2, X3, X4, X5

↓

PC1, PC2

따라서 PCA의 결과는 원래 변수 이름을 그대로 사용하는 것이 아니라 새로운 변수축입니다.


30장 제1주성분 시험 함정#

다음 문장을 주의합니다.

제1주성분은 데이터의 분산이 가장 작은 방향이다.

틀립니다.

제공된 학습자료에서는:

분산이 가장 큰 방향

이라고 설명합니다.

핵심#

PC1 = 최대 분산

입니다.


31장 주성분 상관관계 시험 함정#

PCA로 만들어진 주성분들은 서로 강한 상관관계를 갖는다.

틀립니다.

제공된 학습자료에서는:

주성분들은 서로 직교

하고:

상관관계가 없다

고 설명합니다.


32장 주성분 개수 시험 함정#

주성분 개수는 관측치 개수와 같다.

틀립니다.

제공된 학습자료 기준:

주성분 개수는 최대 변수 개수

입니다.

시험에서:

관측치 수

변수 수

를 바꾸어 제시할 수 있으므로 주의해야 합니다.


33장 차원 축소 시험 함정#

PCA는 차원을 늘려 데이터 정보를 확장하는 것이 주요 목적이다.

틀립니다.

PCA의 핵심 목적은:

고차원 → 저차원

입니다.

그리고 가능한 한 정보 손실을 최소화하려고 합니다.


34장 다중공선성 시험 함정#

PCA는 변수 사이의 상관관계를 더 크게 만들어 다중공선성을 증가시킨다.

틀립니다.

제공된 학습자료에서는 PCA로 서로 직교하는 주성분을 생성하여 다중공선성 문제를 해결하는 방법으로 활용할 수 있다고 설명합니다.


35장 노이즈 제거 시험 함정#

PCA에서는 분산이 큰 주성분부터 제거하여 노이즈를 줄인다.

틀립니다.

제공된 학습자료에서는:

분산이 작은 성분 제거

를 노이즈 제거와 연결합니다.

분산이 큰 앞쪽 주성분은 더 많은 정보를 설명하므로 일반적으로 우선 유지합니다.


36장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. PCA의 목적은 군집 수를 결정하는 것이다#

틀립니다.

차원 축소가 핵심 목적입니다.

함정 2. 주성분은 기존 변수 하나를 그대로 선택한 것이다#

틀립니다.

원래 변수들의 선형 결합입니다.

함정 3. 제1주성분은 가장 작은 분산을 설명한다#

틀립니다.

가장 큰 분산을 설명합니다.

함정 4. 주성분들은 서로 높은 상관관계를 가진다#

틀립니다.

서로 직교하며 제공된 학습자료에서는 상관관계가 없다고 설명합니다.

함정 5. 주성분 수는 관측치 수로 결정된다#

틀립니다.

제공된 학습자료에서는 최대 변수 개수와 연결합니다.

함정 6. PCA는 다중공선성 문제 해결에 사용할 수 없다#

틀립니다.

대표적인 활용 중 하나입니다.

함정 7. PCA는 고차원 데이터를 더 높은 차원으로 확대한다#

틀립니다.

저차원으로 축소합니다.

함정 8. PCA에서는 분산이 작은 성분을 우선 보존한다#

틀립니다.

분산이 큰 주성분부터 중요한 정보를 설명합니다.


37장 PCA 시험 직전 암기#

PCA

→ Principal Component Analysis

→ 주성분분석

→ 차원 축소

→ 정보 손실 최소화

입니다.

가장 중요한 연결은:

고차원 → 저차원

입니다.


38장 주성분 시험 직전 암기#

주성분

→ 원래 변수의 선형 결합

PC1#

→ 분산 최대

→ 가장 많은 정보 설명

PC2 이후#

→ 이전 주성분과 직교

→ 남은 분산을 순서대로 설명

입니다.


39장 직교 시험 직전 암기#

PCA 주성분은:

서로 직교

합니다.

제공된 학습자료 기준:

상관관계 = 0

입니다.

따라서:

PCA → 상관없는 새로운 축

이라고 기억하면 다중공선성과도 연결하기 쉽습니다.


40장 주성분 개수 시험 직전 암기#

기존 변수 개수가:

5개라면

주성분 최대 개수:

5개

입니다.

기존 변수가:

20개라면

주성분 최대 개수:

20개

입니다.

한 줄로:

PC 최대 개수 = 변수 개수

입니다.


41장 PCA 활용 시험 직전 암기#

차원 축소#

변수 줄이기

다중공선성#

직교 주성분으로 해결

시각화#

고차원 → 2~3차원

노이즈 제거#

분산 작은 성분 제거

암기하면:

축·공·시·노

정도로 묶어볼 수 있습니다.


42장 PCA 핵심 비교표#

개념 핵심
PCA 목적 차원 축소
정보 손실 최소화
주성분 원래 변수의 선형 결합
제1주성분 분산이 가장 큰 방향
주성분 관계 서로 직교
주성분 상관 0
주성분 최대 개수 변수 개수
다중공선성 PCA로 해결 가능
시각화 2~3차원 축소
노이즈 제거 분산 작은 성분 제거

PCA 주성분분석 FAQ#

PCA란 무엇인가#

고차원 데이터를 더 적은 수의 새로운 변수로 변환하면서 정보 손실을 최소화하려는 차원 축소 기법입니다.

PCA의 가장 중요한 목적은 무엇인가#

차원 축소입니다.

주성분이란 무엇인가#

기존 변수들을 선형 결합하여 만든 새로운 변수입니다.

제1주성분은 무엇인가#

데이터의 분산을 가장 많이 설명하는 방향입니다.

제1주성분은 분산이 가장 작은 방향인가#

아닙니다. 제공된 학습자료에서는 가장 큰 방향이라고 설명합니다.

주성분들은 서로 어떤 관계인가#

서로 직교합니다.

주성분 사이에 상관관계가 있는가#

제공된 학습자료에서는 상관관계가 없다고 설명합니다.

주성분의 최대 개수는 무엇으로 결정되는가#

제공된 학습자료 기준 변수 개수입니다.

관측치가 1,000개이고 변수가 5개라면 주성분 수는 최대 몇 개인가#

제공된 학습자료의 기준을 적용하면 최대 5개입니다.

PCA는 다중공선성 해결에 사용할 수 있는가#

네. 서로 직교하는 주성분으로 변환하여 다중공선성 문제를 줄이는 데 활용할 수 있습니다.

PCA로 데이터를 시각화할 수 있는가#

고차원 데이터를 2~3개의 주성분으로 축소하여 시각화하는 데 활용할 수 있습니다.

PCA는 노이즈 제거에도 사용하는가#

제공된 학습자료에서는 분산이 작은 성분을 제거하여 노이즈 제거에 활용할 수 있다고 설명합니다.

PCA와 변수 선택은 같은가#

아닙니다. 변수 선택은 기존 변수를 고르는 것이고 PCA는 기존 변수들을 조합하여 새로운 주성분을 만듭니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. PCA의 전체 이름을 말할 수 있는가?
  2. PCA의 핵심 목적이 차원 축소라는 것을 알고 있는가?
  3. 정보 손실 최소화가 무엇을 의미하는지 설명할 수 있는가?
  4. 주성분이 기존 변수들의 선형 결합이라는 것을 알고 있는가?
  5. 제1주성분이 어떤 방향인지 설명할 수 있는가?
  6. PC1이 가장 많은 분산을 설명한다는 것을 알고 있는가?
  7. 주성분들이 서로 직교한다는 것을 알고 있는가?
  8. 주성분 사이의 상관관계가 0이라는 것을 알고 있는가?
  9. 주성분 최대 개수가 변수 개수와 연결된다는 것을 알고 있는가?
  10. 관측치 개수와 주성분 개수를 혼동하지 않는가?
  11. PCA를 다중공선성 해결에 사용할 수 있다는 것을 알고 있는가?
  12. 고차원 데이터를 2~3차원으로 축소해 시각화할 수 있다는 것을 알고 있는가?
  13. 분산이 작은 성분을 제거해 노이즈를 줄일 수 있다는 것을 알고 있는가?
  14. PCA와 군집분석의 목적을 구분할 수 있는가?
  15. PCA와 변수 선택의 차이를 설명할 수 있는가?

이 글을 마치며#

PCA는 고차원 데이터를 저차원으로 축소하면서 중요한 정보를 가능한 한 많이 보존하는 방법입니다.

핵심은 새로운 주성분 Principal Component을 만드는 것입니다.

주성분은:

원래 변수들의 선형 결합

으로 만들어집니다.

그리고:

제1주성분은 데이터의 분산이 가장 큰 방향

을 선택하여 가장 많은 정보를 설명합니다.

이후 주성분들은 서로:

직교

하며 제공된 학습자료에서는:

상관관계가 없다

고 설명합니다.

주성분의 최대 개수는:

관측치 개수가 아니라 변수 개수

와 연결합니다.

PCA의 대표적인 활용은 다음과 같습니다.

차원 축소

다중공선성 해결

고차원 데이터 시각화

분산이 작은 성분 제거를 통한 노이즈 제거

시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.

PCA = 고차원 → 저차원

주성분 = 원래 변수의 선형 결합

PC1 = 분산이 가장 큰 방향

주성분끼리 직교 = 상관관계 0

주성분 최대 개수 = 변수 개수 / 다중공선성 해결 가능

이 페이지의 목차