PCA 주성분분석이란? 차원 축소·분산·주성분·다중공선성 쉽게 이해하기
1장 PCA란 무엇인가#
PCA는 Principal Component Analysis, 우리말로 주성분분석이라고 합니다.
PCA의 가장 중요한 목적은:
고차원 데이터를 저차원으로 축소하면서 정보 손실을 최소화하는 것
입니다.
예를 들어 고객 한 명을 설명하는 변수가 다음과 같이 20개 있다고 하겠습니다.
- 나이
- 소득
- 구매횟수
- 구매금액
- 방문횟수
- 체류시간
- 최근 구매일
- 상품별 구매량
- 기타 여러 행동지표
변수가 많아질수록 분석은 복잡해집니다.
PCA는 이 많은 변수에서 중요한 정보를 추출해:
20개 변수
↓
5개 주성분
처럼 더 적은 수의 변수로 데이터를 표현할 수 있게 합니다.
핵심#
PCA = 차원 축소
입니다.
2장 차원 Dimension이란 무엇인가#
PCA에서 말하는 차원은 쉽게 생각하면 변수의 개수입니다.
예를 들어 데이터가:
키
몸무게
라는 두 변수로 이루어져 있다면 2차원 데이터로 생각할 수 있습니다.
여기에:
나이
가 추가되면 3차원이 됩니다.
변수가 100개라면 100차원 데이터가 됩니다.
따라서 차원 축소는:
변수의 수를 줄여 데이터를 더 간단하게 표현하는 것
이라고 이해할 수 있습니다.
3장 왜 차원을 줄여야 할까#
변수가 많다고 해서 항상 좋은 것은 아닙니다.
변수가 지나치게 많으면:
- 분석이 복잡해지고
- 계산량이 증가하고
- 변수 사이에 중복정보가 존재할 수 있으며
- 시각화가 어려워질 수 있습니다.
PCA는 여러 변수에 흩어져 있는 정보를 새로운 축으로 압축하여 더 적은 수의 변수로 표현합니다.
중요한 것은 무작정 변수를 삭제하는 것이 아니라 가능한 한 많은 정보를 유지하면서 줄이는 것입니다.
4장 PCA를 쉽게 이해하면#
학생들의 능력을 다음 5개 점수로 측정한다고 하겠습니다.
- 국어
- 영어
- 수학
- 과학
- 사회
학생마다 5개의 숫자가 존재합니다.
그런데 실제 데이터를 살펴보니 국어·영어·사회 점수가 서로 비슷한 방향으로 움직이고, 수학·과학도 비슷한 경향을 보일 수 있습니다.
이 경우 5개 점수를 각각 모두 사용하는 대신 여러 과목의 정보를 조합한 새로운 변수들을 만들 수 있습니다.
예를 들어:
주성분 1 = 전반적인 학업성취도
주성분 2 = 언어계열과 수리계열의 차이
처럼 기존 변수들을 조합해 새로운 축으로 데이터를 표현하는 방식으로 이해할 수 있습니다.
5장 주성분 Principal Component이란 무엇인가#
주성분은 기존 변수들의 선형 결합으로 만들어진 새로운 변수입니다.
즉 기존 변수 중 하나를 그대로 선택하는 것이 아닙니다.
예를 들어 원래 변수가:
X₁
X₂
X₃
이라고 하면 하나의 주성분은 개념적으로:
PC₁ = aX₁ + bX₂ + cX₃
처럼 기존 변수들의 조합으로 만들어질 수 있습니다.
여기서 중요한 것은 PCA가 기존 변수를 단순 삭제하는 것이 아니라 기존 변수들을 조합하여 새로운 변수축을 만든다는 점입니다.
핵심#
주성분 = 원래 변수들의 선형 결합
입니다.
6장 PCA는 변수 선택과 같은가#
완전히 같은 개념으로 보면 안 됩니다.
변수 선택은 기존 변수 가운데 필요한 것을 골라 사용하는 방식입니다.
예를 들어:
10개 변수
↓
중요한 기존 변수 3개 선택
처럼 사용할 수 있습니다.
반면 PCA는:
10개 기존 변수
↓
기존 변수들의 조합으로 새로운 주성분 생성
이라는 방식입니다.
즉:
변수 선택 = 원래 변수 중 선택
PCA = 원래 변수를 조합한 새로운 변수 생성
으로 구분할 수 있습니다.
7장 제1주성분이란 무엇인가#
PCA에서 가장 중요한 것이 제1주성분 First Principal Component입니다.
제공된 학습자료에서는 제1주성분을:
분산이 가장 큰 방향
이라고 설명합니다.
쉽게 말하면 데이터가 가장 넓게 퍼져 있는 방향을 새로운 첫 번째 축으로 선택합니다.
핵심#
제1주성분 = 가장 많은 분산을 설명하는 방향
입니다.
8장 왜 분산이 큰 방향을 찾을까#
분산은 데이터가 얼마나 넓게 퍼져 있는지를 나타냅니다.
데이터가 거의 변하지 않는 방향보다는 데이터가 많이 달라지는 방향에 더 많은 구분 정보가 담겨 있을 가능성이 있습니다.
예를 들어 데이터가 길쭉한 타원 형태로 퍼져 있다고 생각해봅시다.
가장 길게 퍼진 방향을 축으로 잡으면 데이터의 차이를 많이 보존할 수 있습니다.
반대로 거의 변화가 없는 짧은 방향만 선택하면 많은 정보를 잃게 됩니다.
따라서 PCA는 분산이 큰 방향부터 주성분으로 선택합니다.
9장 제2주성분은 어떻게 만들어지는가#
제1주성분을 찾은 뒤에는 제1주성분과 겹치지 않는 새로운 방향에서 다음으로 많은 분산을 설명하는 축을 찾습니다.
이것이 제2주성분입니다.
그다음:
제3주성분
제4주성분
순으로 만들 수 있습니다.
중요한 특징은 각 주성분이 서로 같은 정보를 반복해서 설명하지 않도록 서로 직교하는 방향으로 만들어진다는 것입니다.
10장 주성분은 서로 직교한다#
제공된 학습자료의 핵심 내용입니다.
주성분들은 서로 직교 Orthogonal합니다.
직교한다는 것은 기하학적으로 서로 수직인 방향이라는 뜻입니다.
통계적인 관점에서는 제공된 학습자료에서:
상관관계 = 0
으로 설명합니다.
즉 한 주성분이 가지고 있는 정보와 다른 주성분이 가지고 있는 정보가 서로 겹치지 않도록 새로운 축을 구성합니다.
핵심#
주성분끼리 직교 → 상관관계 없음
입니다.
11장 직교를 쉽게 이해하면#
2차원 좌표에서:
x축
과
y축
을 생각하면 쉽습니다.
두 축은 90도로 만나 서로 다른 방향을 나타냅니다.
PCA에서도 새로운 주성분 축들이 서로 겹치지 않는 방향으로 만들어집니다.
따라서 제공된 학습자료에서는 주성분을 서로 독립적이며 상관관계가 없는 변수로 정리합니다.
시험에서는 특히:
주성분끼리 상관관계가 있다
라는 문장을 주의해야 합니다.
12장 첫 번째 주성분이 가장 중요하다#
PCA에서는 제1주성분이 가장 많은 분산을 설명합니다.
그다음 제2주성분이 다음으로 많은 분산을 설명합니다.
따라서 일반적인 순서는:
PC1 설명력 > PC2 설명력 > PC3 설명력 ...
으로 이해할 수 있습니다.
즉 주성분은 중요한 정보를 많이 포함하는 순서대로 정렬됩니다.
13장 주성분 개수는 몇 개인가#
ADsP에서 자주 출제되는 부분입니다.
제공된 학습자료에서는:
주성분 개수의 최대값은 변수 개수
라고 설명합니다.
예를 들어 기존 변수가 5개라면 만들 수 있는 주성분도 최대 5개입니다.
예#
기존 변수:
X₁, X₂, X₃, X₄
→ 최대 주성분:
PC1, PC2, PC3, PC4
입니다.
14장 주성분 개수와 관측치 수를 혼동하지 말자#
제공된 학습자료의 대표적인 함정입니다.
주성분의 개수는 관측치 개수와 같다.
틀립니다.
제공된 학습자료에서는:
주성분 개수는 변수 개수와 연결
합니다.
즉 학생 1,000명을 조사했다고 해서 주성분이 1,000개가 되는 것이 아닙니다.
변수가 10개라면 최대 주성분 수도 10개입니다.
핵심#
주성분 수 → 변수 수
관측치 수 X
입니다.
15장 PCA에서 차원 축소는 어떻게 이루어질까#
기존 변수가 10개라면 PCA를 통해 최대 10개의 주성분을 만들 수 있습니다.
하지만 차원 축소가 목적이라면 모든 주성분을 다시 사용할 필요가 없습니다.
예를 들어:
PC1 → 많은 정보
PC2 → 다음으로 많은 정보
PC3 → 어느 정도 정보
PC4~PC10 → 상대적으로 적은 정보
라고 한다면:
PC1 + PC2 + PC3
만 사용해서 원래 10차원 데이터를 3차원으로 축소할 수 있습니다.
이것이 PCA를 이용한 차원 축소의 핵심입니다.
16장 정보 손실 최소화란 무엇인가#
차원을 줄이면 어느 정도 정보가 줄어들 수 있습니다.
하지만 PCA는 아무 방향이나 버리지 않습니다.
분산을 많이 설명하는 주성분부터 남기고 분산이 작은 주성분을 제거합니다.
즉 가능한 한 중요한 데이터 변화를 유지하면서 덜 중요한 정보를 제거하려고 합니다.
그래서 PCA의 목적을:
정보 손실을 최소화하면서 차원 축소
라고 설명합니다.
17장 PCA와 분산의 관계#
PCA를 이해할 때 가장 중요한 단어 중 하나가 분산 Variance입니다.
PCA는:
데이터를 어떤 방향으로 바라보면 가장 많이 퍼져 있는가?
를 찾습니다.
가장 많이 퍼진 방향:
→ PC1
그다음 많이 퍼진 방향:
→ PC2
그다음:
→ PC3
순으로 주성분을 만듭니다.
따라서 PCA 문제에서는:
분산이 큰 방향
이라는 표현이 나오면 주성분과 연결해야 합니다.
18장 PCA 활용 1: 차원 축소#
PCA의 대표적인 활용은 변수 개수를 줄이는 것입니다.
예를 들어 원래 데이터가 변수 100개를 가지고 있다고 하겠습니다.
분석 결과 앞쪽 몇 개 주성분만으로 원래 데이터의 주요 정보를 충분히 표현할 수 있다면:
100차원
↓
10차원
처럼 데이터를 줄일 수 있습니다.
이렇게 하면 분석과 계산이 단순해질 수 있습니다.
19장 PCA 활용 2: 다중공선성 해결#
ADsP에서 매우 중요한 연결입니다.
제공된 학습자료에서는 PCA를 다중공선성 문제 해결에 활용할 수 있다고 설명합니다.
다중공선성은 회귀분석에서 독립변수끼리 강한 상관관계를 가지고 있는 상태입니다.
예를 들어:
X₁과 X₂가 거의 같은 방향으로 움직이면 두 변수가 서로 중복된 정보를 가지고 있을 수 있습니다.
PCA를 적용하면 서로 직교하는 주성분으로 변환할 수 있습니다.
20장 PCA가 다중공선성을 줄이는 이유#
원래 변수들은 서로 상관관계를 가지고 있을 수 있습니다.
예를 들어:
X₁ ↔ X₂
상관관계 높음
X₂ ↔ X₃
상관관계 높음
과 같은 상황입니다.
PCA를 적용하면:
PC1
PC2
PC3
처럼 서로 직교하는 새로운 변수를 만듭니다.
제공된 학습자료에서는 주성분 사이의 상관관계가 0이라고 설명하므로 기존 변수 사이의 강한 상관관계 문제를 줄일 수 있습니다.
핵심#
PCA → 직교 주성분 → 다중공선성 해결
입니다.
21장 다중공선성과 VIF를 함께 기억하기#
앞에서 회귀분석을 공부했다면 다중공선성 문제와 VIF를 연결할 수 있습니다.
다중공선성이 심하면 회귀계수가 불안정해질 수 있습니다.
제공된 학습자료에서는 해결 방법 가운데 하나로 PCA를 제시했습니다.
따라서 시험에서는:
다중공선성 문제를 해결하기 위해 사용할 수 있는 차원 축소 방법은?
이라는 문제가 나오면:
PCA
를 떠올릴 수 있습니다.
22장 PCA 활용 3: 데이터 시각화#
고차원 데이터는 사람이 직접 볼 수 없습니다.
예를 들어 변수가 20개라면 20차원 공간을 그림으로 표현하기 어렵습니다.
PCA를 이용해:
20차원
↓
2차원
또는:
20차원
↓
3차원
으로 축소하면 데이터를 그래프로 표현하기 쉬워집니다.
제공된 학습자료에서는 PCA 활용으로:
고차원 데이터를 2~3차원으로 투영하여 시각화
하는 방법을 제시합니다.
23장 PCA 활용 4: 노이즈 제거#
제공된 학습자료에서는 PCA를 노이즈 제거에도 활용할 수 있다고 설명합니다.
핵심 아이디어는:
분산이 작은 성분을 제거
하는 것입니다.
주요 패턴은 상대적으로 분산이 큰 주성분에 담기고 작은 분산의 성분에는 덜 중요한 정보나 노이즈가 포함될 수 있다고 보고 이를 제거하는 방식입니다.
핵심#
작은 분산 성분 제거 → 노이즈 감소
입니다.
24장 PCA 활용 한눈에 보기#
| 활용 | 의미 |
|---|---|
| 차원 축소 | 변수 개수 줄이기 |
| 다중공선성 해결 | 서로 직교하는 주성분 생성 |
| 시각화 | 고차원 데이터를 2~3차원으로 표현 |
| 노이즈 제거 | 분산이 작은 성분 제거 |
시험에서는 특히:
PCA = 차원 축소 + 다중공선성 해결
연결이 중요합니다.
25장 PCA에서 원래 변수는 사라지는가#
PCA를 적용하면 분석에서는 기존 변수 대신 새로운 주성분 변수를 사용할 수 있습니다.
예를 들어:
키
몸무게
허리둘레
체지방률
이라는 변수들을 조합해:
PC1
PC2
PC3
PC4
라는 새로운 축을 만들 수 있습니다.
따라서 PCA 결과의 주성분은 원래 변수 하나와 동일한 의미가 아니라 여러 변수의 정보를 조합한 결과입니다.
26장 PCA 결과는 해석하기 쉬운가#
원래 변수는:
나이
소득
키
몸무게
처럼 명확한 의미를 가지고 있습니다.
하지만 주성분은 여러 변수를 선형 결합하여 만들기 때문에:
PC1
PC2
처럼 새로운 축 자체의 의미를 직관적으로 설명하기 어려울 수 있습니다.
따라서 PCA는 차원을 줄이는 데 매우 유용하지만 원래 변수 그대로 사용하는 것보다 해석이 직관적이지 않을 수 있습니다.
ADsP에서는 우선 주성분은 기존 변수의 선형 결합이라는 점을 기억하는 것이 중요합니다.
27장 PCA 전체 과정을 쉽게 정리하면#
PCA의 흐름을 개념적으로 정리하면 다음과 같습니다.
여러 개의 원래 변수
↓
데이터가 많이 퍼진 방향 탐색
↓
제1주성분 생성
↓
제1주성분과 직교하면서 다음으로 분산이 큰 방향 탐색
↓
제2주성분 생성
↓
필요한 수의 주성분 선택
↓
저차원 데이터로 변환
입니다.
핵심은 항상 분산이 큰 방향부터 선택한다는 것입니다.
28장 PCA와 군집분석은 같은 것인가#
아닙니다.
PCA#
차원 축소
→ 새로운 주성분 생성
군집분석#
비슷한 데이터끼리 그룹 생성
입니다.
PCA를 먼저 적용해서 변수 수를 줄인 후 군집분석에 사용할 수도 있지만 두 분석방법의 목적은 서로 다릅니다.
핵심#
PCA = 변수 축소
Clustering = 데이터 그룹화
입니다.
29장 PCA와 변수선택의 차이#
다시 한번 시험 관점에서 구분하면 다음과 같습니다.
변수선택#
기존 변수 중 일부 선택
예:
X1, X2, X3, X4, X5
↓
X1, X3
PCA#
기존 변수들을 조합해 새로운 주성분 생성
예:
X1, X2, X3, X4, X5
↓
PC1, PC2
따라서 PCA의 결과는 원래 변수 이름을 그대로 사용하는 것이 아니라 새로운 변수축입니다.
30장 제1주성분 시험 함정#
다음 문장을 주의합니다.
제1주성분은 데이터의 분산이 가장 작은 방향이다.
틀립니다.
제공된 학습자료에서는:
분산이 가장 큰 방향
이라고 설명합니다.
핵심#
PC1 = 최대 분산
입니다.
31장 주성분 상관관계 시험 함정#
PCA로 만들어진 주성분들은 서로 강한 상관관계를 갖는다.
틀립니다.
제공된 학습자료에서는:
주성분들은 서로 직교
하고:
상관관계가 없다
고 설명합니다.
32장 주성분 개수 시험 함정#
주성분 개수는 관측치 개수와 같다.
틀립니다.
제공된 학습자료 기준:
주성분 개수는 최대 변수 개수
입니다.
시험에서:
관측치 수
변수 수
를 바꾸어 제시할 수 있으므로 주의해야 합니다.
33장 차원 축소 시험 함정#
PCA는 차원을 늘려 데이터 정보를 확장하는 것이 주요 목적이다.
틀립니다.
PCA의 핵심 목적은:
고차원 → 저차원
입니다.
그리고 가능한 한 정보 손실을 최소화하려고 합니다.
34장 다중공선성 시험 함정#
PCA는 변수 사이의 상관관계를 더 크게 만들어 다중공선성을 증가시킨다.
틀립니다.
제공된 학습자료에서는 PCA로 서로 직교하는 주성분을 생성하여 다중공선성 문제를 해결하는 방법으로 활용할 수 있다고 설명합니다.
35장 노이즈 제거 시험 함정#
PCA에서는 분산이 큰 주성분부터 제거하여 노이즈를 줄인다.
틀립니다.
제공된 학습자료에서는:
분산이 작은 성분 제거
를 노이즈 제거와 연결합니다.
분산이 큰 앞쪽 주성분은 더 많은 정보를 설명하므로 일반적으로 우선 유지합니다.
36장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. PCA의 목적은 군집 수를 결정하는 것이다#
틀립니다.
차원 축소가 핵심 목적입니다.
함정 2. 주성분은 기존 변수 하나를 그대로 선택한 것이다#
틀립니다.
원래 변수들의 선형 결합입니다.
함정 3. 제1주성분은 가장 작은 분산을 설명한다#
틀립니다.
가장 큰 분산을 설명합니다.
함정 4. 주성분들은 서로 높은 상관관계를 가진다#
틀립니다.
서로 직교하며 제공된 학습자료에서는 상관관계가 없다고 설명합니다.
함정 5. 주성분 수는 관측치 수로 결정된다#
틀립니다.
제공된 학습자료에서는 최대 변수 개수와 연결합니다.
함정 6. PCA는 다중공선성 문제 해결에 사용할 수 없다#
틀립니다.
대표적인 활용 중 하나입니다.
함정 7. PCA는 고차원 데이터를 더 높은 차원으로 확대한다#
틀립니다.
저차원으로 축소합니다.
함정 8. PCA에서는 분산이 작은 성분을 우선 보존한다#
틀립니다.
분산이 큰 주성분부터 중요한 정보를 설명합니다.
37장 PCA 시험 직전 암기#
PCA
→ Principal Component Analysis
→ 주성분분석
→ 차원 축소
→ 정보 손실 최소화
입니다.
가장 중요한 연결은:
고차원 → 저차원
입니다.
38장 주성분 시험 직전 암기#
주성분
→ 원래 변수의 선형 결합
PC1#
→ 분산 최대
→ 가장 많은 정보 설명
PC2 이후#
→ 이전 주성분과 직교
→ 남은 분산을 순서대로 설명
입니다.
39장 직교 시험 직전 암기#
PCA 주성분은:
서로 직교
합니다.
제공된 학습자료 기준:
상관관계 = 0
입니다.
따라서:
PCA → 상관없는 새로운 축
이라고 기억하면 다중공선성과도 연결하기 쉽습니다.
40장 주성분 개수 시험 직전 암기#
기존 변수 개수가:
5개라면
주성분 최대 개수:
5개
입니다.
기존 변수가:
20개라면
주성분 최대 개수:
20개
입니다.
한 줄로:
PC 최대 개수 = 변수 개수
입니다.
41장 PCA 활용 시험 직전 암기#
차원 축소#
변수 줄이기
다중공선성#
직교 주성분으로 해결
시각화#
고차원 → 2~3차원
노이즈 제거#
분산 작은 성분 제거
암기하면:
축·공·시·노
정도로 묶어볼 수 있습니다.
42장 PCA 핵심 비교표#
| 개념 | 핵심 |
|---|---|
| PCA 목적 | 차원 축소 |
| 정보 | 손실 최소화 |
| 주성분 | 원래 변수의 선형 결합 |
| 제1주성분 | 분산이 가장 큰 방향 |
| 주성분 관계 | 서로 직교 |
| 주성분 상관 | 0 |
| 주성분 최대 개수 | 변수 개수 |
| 다중공선성 | PCA로 해결 가능 |
| 시각화 | 2~3차원 축소 |
| 노이즈 제거 | 분산 작은 성분 제거 |
PCA 주성분분석 FAQ#
PCA란 무엇인가#
고차원 데이터를 더 적은 수의 새로운 변수로 변환하면서 정보 손실을 최소화하려는 차원 축소 기법입니다.
PCA의 가장 중요한 목적은 무엇인가#
차원 축소입니다.
주성분이란 무엇인가#
기존 변수들을 선형 결합하여 만든 새로운 변수입니다.
제1주성분은 무엇인가#
데이터의 분산을 가장 많이 설명하는 방향입니다.
제1주성분은 분산이 가장 작은 방향인가#
아닙니다. 제공된 학습자료에서는 가장 큰 방향이라고 설명합니다.
주성분들은 서로 어떤 관계인가#
서로 직교합니다.
주성분 사이에 상관관계가 있는가#
제공된 학습자료에서는 상관관계가 없다고 설명합니다.
주성분의 최대 개수는 무엇으로 결정되는가#
제공된 학습자료 기준 변수 개수입니다.
관측치가 1,000개이고 변수가 5개라면 주성분 수는 최대 몇 개인가#
제공된 학습자료의 기준을 적용하면 최대 5개입니다.
PCA는 다중공선성 해결에 사용할 수 있는가#
네. 서로 직교하는 주성분으로 변환하여 다중공선성 문제를 줄이는 데 활용할 수 있습니다.
PCA로 데이터를 시각화할 수 있는가#
고차원 데이터를 2~3개의 주성분으로 축소하여 시각화하는 데 활용할 수 있습니다.
PCA는 노이즈 제거에도 사용하는가#
제공된 학습자료에서는 분산이 작은 성분을 제거하여 노이즈 제거에 활용할 수 있다고 설명합니다.
PCA와 변수 선택은 같은가#
아닙니다. 변수 선택은 기존 변수를 고르는 것이고 PCA는 기존 변수들을 조합하여 새로운 주성분을 만듭니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- PCA의 전체 이름을 말할 수 있는가?
- PCA의 핵심 목적이 차원 축소라는 것을 알고 있는가?
- 정보 손실 최소화가 무엇을 의미하는지 설명할 수 있는가?
- 주성분이 기존 변수들의 선형 결합이라는 것을 알고 있는가?
- 제1주성분이 어떤 방향인지 설명할 수 있는가?
- PC1이 가장 많은 분산을 설명한다는 것을 알고 있는가?
- 주성분들이 서로 직교한다는 것을 알고 있는가?
- 주성분 사이의 상관관계가 0이라는 것을 알고 있는가?
- 주성분 최대 개수가 변수 개수와 연결된다는 것을 알고 있는가?
- 관측치 개수와 주성분 개수를 혼동하지 않는가?
- PCA를 다중공선성 해결에 사용할 수 있다는 것을 알고 있는가?
- 고차원 데이터를 2~3차원으로 축소해 시각화할 수 있다는 것을 알고 있는가?
- 분산이 작은 성분을 제거해 노이즈를 줄일 수 있다는 것을 알고 있는가?
- PCA와 군집분석의 목적을 구분할 수 있는가?
- PCA와 변수 선택의 차이를 설명할 수 있는가?
이 글을 마치며#
PCA는 고차원 데이터를 저차원으로 축소하면서 중요한 정보를 가능한 한 많이 보존하는 방법입니다.
핵심은 새로운 주성분 Principal Component을 만드는 것입니다.
주성분은:
원래 변수들의 선형 결합
으로 만들어집니다.
그리고:
제1주성분은 데이터의 분산이 가장 큰 방향
을 선택하여 가장 많은 정보를 설명합니다.
이후 주성분들은 서로:
직교
하며 제공된 학습자료에서는:
상관관계가 없다
고 설명합니다.
주성분의 최대 개수는:
관측치 개수가 아니라 변수 개수
와 연결합니다.
PCA의 대표적인 활용은 다음과 같습니다.
차원 축소
다중공선성 해결
고차원 데이터 시각화
분산이 작은 성분 제거를 통한 노이즈 제거
시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.
PCA = 고차원 → 저차원
주성분 = 원래 변수의 선형 결합
PC1 = 분산이 가장 큰 방향
주성분끼리 직교 = 상관관계 0
주성분 최대 개수 = 변수 개수 / 다중공선성 해결 가능