군집분석이란? K-means·실루엣 계수·마할라노비스 거리·계층적 군집 연결법 쉽게 이해하기
1장 군집분석이란 무엇인가#
군집분석 Clustering은 데이터들을 서로 비슷한 특성을 가진 그룹으로 묶는 분석방법입니다.
예를 들어 쇼핑몰 고객 데이터가 있다고 하겠습니다.
고객마다 다음과 같은 특성이 있습니다.
- 구매금액
- 구매횟수
- 방문횟수
- 최근 구매일
이 데이터를 분석해보니 비슷한 행동을 보이는 고객들이 자연스럽게 몇 개의 그룹으로 나뉠 수 있습니다.
예를 들어:
- 자주 방문하고 많이 구매하는 고객
- 가끔 방문하지만 구매금액이 큰 고객
- 가입만 하고 거의 이용하지 않는 고객
처럼 분류할 수 있습니다.
이처럼 미리 정답이 주어지지 않은 상태에서 데이터 자체의 유사성을 이용해 그룹을 찾는 것이 군집분석입니다.
2장 군집분석을 쉽게 이해하면#
군집분석을 가장 쉽게 생각하면:
서로 비슷한 것끼리 모으기
입니다.
반 학생들을 예로 들어보겠습니다.
학생들을:
- 키
- 몸무게
- 운동시간
같은 특성을 기준으로 비슷한 학생끼리 묶을 수 있습니다.
어떤 학생이 어느 그룹에 속해야 한다는 정답을 미리 알려주는 것이 아니라 데이터 사이의 유사성을 보고 그룹을 만드는 것입니다.
즉 군집분석에서는 거리 Distance와 유사성 Similarity이 매우 중요합니다.
3장 K-평균 K-means란 무엇인가#
제공된 ADsP 학습자료에서 가장 중요한 군집 알고리즘 중 하나가 K-평균 K-means입니다.
K-means는 데이터를 K개의 군집으로 분할하는 알고리즘입니다.
여기서 K는 만들고 싶은 군집의 개수를 의미합니다.
예를 들어:
K = 3
이라면 데이터를 세 개의 군집으로 나눕니다.
K = 5
라면 다섯 개의 군집으로 나눕니다.
핵심#
K-means = 데이터를 K개 그룹으로 분할
입니다.
4장 K는 누가 정하는가#
ADsP에서 매우 중요한 시험 포인트입니다.
K-means의 K는 사용자가 사전에 설정해야 합니다.
알고리즘이 아무 설정 없이 자동으로 최적의 K를 결정하는 것이 아닙니다.
따라서 다음 문장은 틀립니다.
K-means의 K는 알고리즘이 자동으로 결정한다.
정확한 설명은:
K는 사용자가 사전에 지정
입니다.
5장 K-means를 학교 반 편성으로 이해하기#
학생 100명을 비슷한 특성에 따라 세 그룹으로 나누고 싶다고 하겠습니다.
먼저 사용자가:
K = 3
이라고 정합니다.
그러면 알고리즘은 학생들을 세 그룹으로 나누려고 합니다.
각 그룹에는 중심을 나타내는 값이 존재하고 데이터들은 자신과 가까운 중심의 군집에 배정됩니다.
이 과정을 반복하며 비슷한 데이터가 같은 그룹에 모이도록 조정합니다.
ADsP에서는 세부 계산보다 우선:
K를 미리 정한다
는 특징을 확실하게 기억하는 것이 중요합니다.
6장 군집분석에서는 왜 거리가 중요한가#
군집분석에서는:
두 데이터가 얼마나 비슷한가?
를 판단해야 합니다.
대표적인 방법이 데이터 사이의 거리를 계산하는 것입니다.
거리가 가까우면 비슷한 데이터라고 판단할 수 있고, 거리가 멀면 서로 다른 특성을 가진 데이터라고 판단할 수 있습니다.
제공된 학습자료에서는 특히 다음 거리 개념을 구분합니다.
- 유클리드 거리
- 맨해튼 거리
- 마할라노비스 거리
이 가운데 시험에서 자주 묻는 것은 마할라노비스 거리의 특징입니다.
7장 마할라노비스 거리란 무엇인가#
마할라노비스 거리 Mahalanobis Distance는 변수 사이의 상관관계를 고려하여 거리를 계산하는 방법입니다.
제공된 학습자료에서는 특히:
두 변수가 강한 상관관계를 가질 때 이를 고려하여 거리를 계산한다.
고 설명합니다.
즉 단순히 좌표 사이의 물리적인 거리만 보는 것이 아니라 데이터가 어떤 방향으로 함께 움직이는지도 반영합니다.
핵심#
마할라노비스 거리 = 변수 간 상관성 반영
입니다.
8장 유클리드 거리와 마할라노비스 거리의 차이#
유클리드 거리는 우리가 일반적으로 생각하는 직선거리와 비슷합니다.
반면 마할라노비스 거리는 변수 간 상관관계를 고려합니다.
제공된 학습자료의 핵심 구분은 다음과 같습니다.
유클리드 거리#
변수 간 상관성을 별도로 반영하지 않음
맨해튼 거리#
변수 간 상관성을 별도로 반영하지 않음
마할라노비스 거리#
변수 간 상관관계를 반영
합니다.
시험에서:
변수들 사이의 상관관계를 고려하는 거리
라는 표현이 나오면 마할라노비스 거리를 떠올리면 됩니다.
9장 왜 상관관계를 고려해야 할까#
두 변수가 서로 강하게 연관되어 있다고 생각해봅시다.
예를 들어:
- 키
- 몸무게
는 일정 부분 함께 증가하는 경향을 가질 수 있습니다.
단순한 거리 계산은 각 변수의 차이를 독립적으로 바라볼 수 있지만 마할라노비스 거리는 이러한 변수 간 관계를 고려합니다.
즉:
이 정도 차이가 이 데이터의 전체적인 분포에서 정말 큰 차이인가?
를 보다 구조적으로 바라보는 거리라고 이해할 수 있습니다.
10장 계층적 군집분석이란 무엇인가#
군집을 만드는 또 다른 방법으로 계층적 군집분석 Hierarchical Clustering이 있습니다.
이 방식에서는 가까운 데이터나 군집들을 단계적으로 결합하면서 계층적인 구조를 만들 수 있습니다.
여기서 중요한 문제가 하나 생깁니다.
두 군집 사이의 거리를 어떻게 계산할 것인가?
군집에는 여러 개의 데이터가 있으므로 어떤 점과 어떤 점을 비교할지 기준이 필요합니다.
제공된 학습자료에서는 다음 네 가지 연결법을 다룹니다.
- 최단연결법 Single
- 완전연결법 Complete
- 평균연결법 Average
- 와드연결법 Ward
11장 최단연결법 Single Linkage란 무엇인가#
최단연결법은 두 군집 사이에서 가장 가까운 두 점의 거리를 군집 간 거리로 사용합니다.
즉:
두 그룹에서 가장 가까이 붙어 있는 데이터가 얼마나 가까운가?
를 봅니다.
핵심#
Single = 최소 거리
입니다.
12장 최단연결법의 특징#
최단연결법에서는 군집 사이에 가까운 점 하나만 있어도 두 군집의 거리가 가깝다고 판단할 수 있습니다.
제공된 학습자료에서는 이 때문에:
사슬 구조가 형성될 수 있다
는 특징을 제시합니다.
즉 데이터가 길게 이어지듯 연결되는 형태가 나타날 수 있습니다.
시험 핵심#
Single → 가장 가까운 점 → 사슬 구조
입니다.
13장 완전연결법 Complete Linkage란 무엇인가#
완전연결법은 두 군집 사이에서 가장 멀리 떨어진 두 점의 거리를 군집 간 거리로 사용합니다.
즉:
두 그룹의 가장 먼 구성원까지 고려했을 때 거리가 얼마나 되는가?
를 보는 것입니다.
핵심#
Complete = 최대 거리
입니다.
14장 완전연결법은 최장연결법이라고도 이해할 수 있다#
제공된 학습자료에서는 완전연결법을 최장연결법이라고 표현하며 다음처럼 설명합니다.
두 군집 사이의 거리를 최댓값으로 측정
합니다.
따라서 시험에서는:
완전연결 = 최장연결 = 최대값
으로 묶어서 기억하면 됩니다.
15장 완전연결법의 특징#
제공된 학습자료에서는 완전연결법이 고립된 군집을 잘 탐지하는 특징을 제시합니다.
최단연결법이 가까운 점 하나를 기준으로 연결한다면 완전연결법은 가장 먼 점까지 고려하기 때문에 군집 전체의 범위를 더 엄격하게 바라봅니다.
시험 핵심#
Complete → 가장 먼 점 → 고립 군집 탐지
입니다.
16장 평균연결법 Average Linkage란 무엇인가#
평균연결법은 두 군집에 속한 데이터들 사이의 평균 거리를 이용합니다.
즉 가장 가까운 점 하나만 보는 것도 아니고 가장 먼 점 하나만 보는 것도 아닙니다.
전체적인 거리를 평균적으로 고려합니다.
제공된 학습자료에서는:
가장 균형 잡힌 방법
으로 설명합니다.
핵심#
Average = 평균 거리
입니다.
17장 최단·완전·평균연결법 비교#
세 가지를 거리 계산 기준으로 비교하면 매우 쉽습니다.
최단연결법#
가장 가까운 거리
→ 최솟값
완전연결법#
가장 먼 거리
→ 최댓값
평균연결법#
모든 거리의 평균
→ 평균값
즉:
Single = Min
Complete = Max
Average = Mean
으로 기억할 수 있습니다.
18장 와드연결법 Ward Linkage란 무엇인가#
와드연결법은 앞의 세 방법과 조금 다릅니다.
단순히 가장 가까운 점이나 가장 먼 점을 기준으로 하지 않고 군집 내 오차제곱합을 기준으로 군집을 결합합니다.
제공된 학습자료에서는:
군집 내 오차제곱합 최소화
라고 정리합니다.
핵심#
Ward = 오차제곱합
입니다.
19장 와드연결법을 쉽게 이해하면#
좋은 군집이라면 같은 군집에 속한 데이터들이 가능한 한 서로 비슷하게 모여 있어야 합니다.
와드연결법은 군집을 합쳤을 때 내부의 퍼짐이 얼마나 증가하는지를 고려합니다.
즉 군집 내부의 분산이 지나치게 커지지 않도록 결합하는 방식으로 이해할 수 있습니다.
제공된 학습자료에서는:
분산 기반
그리고:
가장 많이 사용
되는 방식으로 정리합니다.
20장 계층적 군집 연결법 4가지 비교#
| 연결법 | 거리 기준 | 주요 특징 |
|---|---|---|
| 최단연결 Single | 가장 가까운 점 | 사슬 구조 가능 |
| 완전연결 Complete | 가장 먼 점 | 고립된 군집 탐지 |
| 평균연결 Average | 평균 거리 | 균형 잡힌 방식 |
| 와드연결 Ward | 오차제곱합 | 분산 기반 |
시험에서는 특히:
최단 = 최소
완전 = 최대
Ward = SSE
를 많이 혼동합니다.
21장 실루엣 계수란 무엇인가#
실루엣 계수 Silhouette Coefficient는 군집 품질을 평가하는 지표입니다.
즉 군집분석을 수행한 뒤:
데이터들이 적절한 그룹에 잘 들어갔는가?
를 판단하는 데 사용할 수 있습니다.
제공된 학습자료에서는 세 개의 대표 값을 중요하게 제시합니다.
- 1
- 0
- -1
22장 실루엣 계수 1의 의미#
실루엣 계수가 1에 가까우면 군집이 매우 잘 분리된 상태입니다.
제공된 학습자료에서는:
1 = 완벽한 분리
라고 정리합니다.
즉 자신이 속한 군집 안에서는 잘 어울리고 다른 군집과는 명확히 구분되는 상태입니다.
핵심#
Silhouette = 1 → 매우 좋은 군집
입니다.
23장 실루엣 계수 0의 의미#
실루엣 계수가 0이면 데이터가 군집의 경계에 위치한 경우입니다.
즉:
이 군집에 넣어도 될 것 같고 다른 군집에 넣어도 될 것 같은데?
라는 애매한 상태로 이해할 수 있습니다.
핵심#
Silhouette = 0 → 경계
입니다.
24장 실루엣 계수 -1의 의미#
실루엣 계수가 -1에 가까우면 해당 데이터가 잘못된 군집에 배정되었을 가능성이 높은 상태입니다.
제공된 학습자료에서는:
-1 = 잘못 분류된 경우
라고 정리합니다.
핵심#
Silhouette = -1 → 잘못된 군집
입니다.
25장 실루엣 계수는 어느 방향이 좋은가#
실루엣 계수는 값이 1에 가까울수록 좋은 군집 결과로 해석할 수 있습니다.
시험에서는 다음 세 가지를 세트로 기억하면 됩니다.
1 → 완벽한 분리
0 → 경계
-1 → 잘못 분류
입니다.
26장 K-means와 실루엣 계수를 연결해서 이해하기#
K-means에서는 사용자가 K를 지정해야 합니다.
예를 들어:
K = 2
K = 3
K = 4
중 어떤 값이 적절한지 고민할 수 있습니다.
제공된 학습자료에서는 K 자체를 사용자가 사전 설정해야 한다는 점과 실루엣 계수를 군집 품질 평가 지표로 제시합니다.
따라서 기본 흐름은:
K 지정
↓
군집 생성
↓
군집 품질 평가
로 이해할 수 있습니다.
27장 K-means와 계층적 군집은 같은 방법인가#
둘 다 데이터를 군집으로 나누지만 접근 방식은 다릅니다.
K-means#
사용자가 K를 미리 정하고 데이터를 K개 그룹으로 분할합니다.
계층적 군집#
데이터 또는 군집 사이 거리를 이용해 단계적인 군집 구조를 만듭니다.
그리고 계층적 군집에서는 군집 사이 거리 계산법으로:
- Single
- Complete
- Average
- Ward
등을 사용할 수 있습니다.
28장 K-means에서 가장 중요한 시험 함정#
다음 문장을 주의합니다.
K-means는 최적의 K값을 자동으로 찾아 군집 수를 결정한다.
틀립니다.
제공된 학습자료에서는:
사용자가 K를 사전 설정
한다고 명확하게 설명합니다.
따라서:
K-means → K는 미리
라고 기억하면 됩니다.
29장 마할라노비스 거리 시험 함정#
다음 문장을 생각해봅시다.
변수들 사이에 강한 상관관계가 존재할 때 이를 반영해 거리를 계산한다.
정답은:
마할라노비스 거리
입니다.
반대로:
유클리드 거리가 변수 간 상관성을 직접 반영한다.
라고 나오면 제공된 학습자료의 설명과 다릅니다.
핵심#
상관관계 반영 → Mahalanobis
입니다.
30장 연결법 시험 함정 1#
최단연결법은 두 군집 사이에서 가장 먼 두 점을 이용한다.
틀립니다.
최단연결법은:
가장 가까운 점
입니다.
가장 먼 점을 사용하는 것은 완전연결법입니다.
31장 연결법 시험 함정 2#
완전연결법은 두 군집의 최소 거리를 사용한다.
틀립니다.
완전연결법은:
최대 거리
를 사용합니다.
시험에서는:
Single ↔ Complete
를 반대로 제시하는 문제가 특히 주의할 부분입니다.
32장 연결법 시험 함정 3#
와드연결법은 두 군집의 가장 먼 점 사이 거리를 사용한다.
틀립니다.
그것은 완전연결법입니다.
와드연결법은:
군집 내 오차제곱합
과 연결됩니다.
33장 연결법을 사람 모임으로 이해하기#
두 모임 A와 B가 있다고 생각해봅시다.
각 모임에 여러 사람이 있습니다.
Single#
두 모임 사람 중 가장 가까운 두 사람만 봅니다.
Complete#
두 모임 사람 중 가장 먼 두 사람을 봅니다.
Average#
모든 사람 사이 거리의 평균을 봅니다.
Ward#
모임을 합쳤을 때 내부적으로 얼마나 퍼지는지를 봅니다.
이렇게 생각하면 네 방법을 쉽게 구분할 수 있습니다.
34장 K-means 시험 직전 암기#
K-means
→ 데이터를 K개 군집으로 분할
→ K는 사용자가 사전 지정
가장 중요한 함정:
K 자동 결정 X
입니다.
한 줄로:
K-means의 K는 내가 정한다
라고 기억하면 됩니다.
35장 거리 시험 직전 암기#
Mahalanobis#
→ 변수 간 상관관계 반영
시험에서:
상관관계
라는 단어가 거리와 함께 나오면 마할라노비스를 떠올립니다.
핵심:
Mahalanobis = 상관성 고려
입니다.
36장 연결법 시험 직전 암기#
Single#
→ 최소 거리
→ 사슬 구조
Complete#
→ 최대 거리
→ 고립 군집 탐지
Average#
→ 평균 거리
→ 균형적
Ward#
→ 오차제곱합
→ 분산 기반
가장 간단하게:
Single = Min
Complete = Max
Average = Mean
Ward = SSE
입니다.
37장 실루엣 계수 시험 직전 암기#
1#
→ 완벽한 분리
0#
→ 경계
-1#
→ 잘못된 군집
따라서:
1에 가까울수록 좋은 군집
이라고 기억하면 됩니다.
38장 군집분석 핵심 비교표#
| 개념 | 핵심 |
|---|---|
| K-means | K개 군집으로 분할 |
| K | 사용자가 사전 설정 |
| Mahalanobis | 변수 간 상관성 반영 |
| Silhouette 1 | 완벽한 분리 |
| Silhouette 0 | 군집 경계 |
| Silhouette -1 | 잘못된 군집 |
| Single | 최솟값 |
| Complete | 최댓값 |
| Average | 평균거리 |
| Ward | 군집 내 오차제곱합 |
군집분석 FAQ#
군집분석이란 무엇인가#
정답이 주어지지 않은 데이터에서 서로 비슷한 특성을 가진 데이터를 그룹으로 묶는 분석방법입니다.
K-means란 무엇인가#
데이터를 사용자가 지정한 K개의 군집으로 분할하는 알고리즘입니다.
K-means의 K는 누가 정하는가#
제공된 학습자료에서는 사용자가 사전에 설정한다고 설명합니다.
K-means가 K를 자동으로 결정하는가#
아닙니다.
마할라노비스 거리의 핵심 특징은 무엇인가#
변수 사이의 상관관계를 반영하여 거리를 계산합니다.
유클리드 거리와 마할라노비스 거리의 중요한 차이는 무엇인가#
제공된 학습자료에서는 마할라노비스 거리가 변수 간 상관성을 반영한다는 점을 강조합니다.
실루엣 계수는 무엇에 사용하는가#
군집 품질을 평가하는 데 사용합니다.
실루엣 계수가 1이면 무엇을 의미하는가#
완벽하게 잘 분리된 군집을 의미합니다.
실루엣 계수가 0이면 무엇을 의미하는가#
군집 경계에 있는 경우입니다.
실루엣 계수가 -1이면 무엇을 의미하는가#
잘못된 군집에 속한 경우로 해석합니다.
최단연결법은 어떤 거리를 사용하는가#
두 군집 사이에서 가장 가까운 두 점의 거리를 사용합니다.
완전연결법은 어떤 거리를 사용하는가#
두 군집 사이에서 가장 먼 두 점의 거리를 사용합니다.
최장연결법과 완전연결법은 어떻게 연결되는가#
제공된 학습자료에서는 완전연결법을 두 군집 사이의 최댓값을 사용하는 방식으로 설명합니다.
평균연결법은 무엇인가#
두 군집 사이의 평균 거리를 이용하는 방법입니다.
와드연결법은 무엇을 기준으로 하는가#
군집 내 오차제곱합을 최소화하는 기준을 사용합니다.
사슬 구조가 나타날 수 있는 방법은 무엇인가#
제공된 학습자료에서는 최단연결법의 특징으로 제시합니다.
고립된 군집을 잘 탐지하는 방법은 무엇인가#
제공된 학습자료에서는 완전연결법의 특징으로 제시합니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 군집분석이 무엇인지 설명할 수 있는가?
- K-means의 K가 무엇을 의미하는지 알고 있는가?
- K를 사용자가 사전에 설정한다는 것을 기억하고 있는가?
- 마할라노비스 거리의 특징을 설명할 수 있는가?
- 변수 간 상관관계를 반영하는 거리가 무엇인지 알고 있는가?
- 실루엣 계수가 무엇을 평가하는지 알고 있는가?
- 실루엣 1·0·-1을 각각 해석할 수 있는가?
- 최단연결법의 거리 기준을 알고 있는가?
- 완전연결법의 거리 기준을 알고 있는가?
- 평균연결법의 거리 기준을 알고 있는가?
- 와드연결법이 오차제곱합과 연결된다는 것을 알고 있는가?
- 최단연결법에서 사슬 구조가 발생할 수 있다는 것을 알고 있는가?
- 완전연결법이 고립된 군집 탐지와 연결된다는 것을 알고 있는가?
- Single·Complete·Average·Ward를 서로 구분할 수 있는가?
이 글을 마치며#
군집분석은 비슷한 데이터끼리 그룹으로 묶는 분석방법입니다.
ADsP에서 먼저 기억해야 할 것은 K-means입니다.
K-means = 데이터를 K개 군집으로 분할
하며:
K는 사용자가 사전에 설정
합니다.
거리와 관련해서는:
마할라노비스 거리 = 변수 간 상관관계를 반영
이라는 특징이 중요합니다.
군집 결과를 평가하는 실루엣 계수는:
1 = 완벽한 분리
0 = 경계
-1 = 잘못된 군집
으로 기억합니다.
계층적 군집의 연결방법은:
Single = 가장 가까운 점
Complete = 가장 먼 점
Average = 평균 거리
Ward = 오차제곱합
입니다.
시험 직전에는 다음 네 줄로 압축하면 됩니다.
K-means의 K는 사용자가 정한다
Mahalanobis = 변수 간 상관관계 반영
Silhouette = 1 좋음 / 0 경계 / -1 잘못됨
Single=Min / Complete=Max / Average=Mean / Ward=SSE