군집분석이란? K-means·실루엣 계수·마할라노비스 거리·계층적 군집 연결법 쉽게 이해하기

1장 군집분석이란 무엇인가#

군집분석 Clustering은 데이터들을 서로 비슷한 특성을 가진 그룹으로 묶는 분석방법입니다.

예를 들어 쇼핑몰 고객 데이터가 있다고 하겠습니다.

고객마다 다음과 같은 특성이 있습니다.

  • 구매금액
  • 구매횟수
  • 방문횟수
  • 최근 구매일

이 데이터를 분석해보니 비슷한 행동을 보이는 고객들이 자연스럽게 몇 개의 그룹으로 나뉠 수 있습니다.

예를 들어:

  • 자주 방문하고 많이 구매하는 고객
  • 가끔 방문하지만 구매금액이 큰 고객
  • 가입만 하고 거의 이용하지 않는 고객

처럼 분류할 수 있습니다.

이처럼 미리 정답이 주어지지 않은 상태에서 데이터 자체의 유사성을 이용해 그룹을 찾는 것이 군집분석입니다.


2장 군집분석을 쉽게 이해하면#

군집분석을 가장 쉽게 생각하면:

서로 비슷한 것끼리 모으기

입니다.

반 학생들을 예로 들어보겠습니다.

학생들을:

  • 키
  • 몸무게
  • 운동시간

같은 특성을 기준으로 비슷한 학생끼리 묶을 수 있습니다.

어떤 학생이 어느 그룹에 속해야 한다는 정답을 미리 알려주는 것이 아니라 데이터 사이의 유사성을 보고 그룹을 만드는 것입니다.

즉 군집분석에서는 거리 Distance와 유사성 Similarity이 매우 중요합니다.


3장 K-평균 K-means란 무엇인가#

제공된 ADsP 학습자료에서 가장 중요한 군집 알고리즘 중 하나가 K-평균 K-means입니다.

K-means는 데이터를 K개의 군집으로 분할하는 알고리즘입니다.

여기서 K는 만들고 싶은 군집의 개수를 의미합니다.

예를 들어:

K = 3

이라면 데이터를 세 개의 군집으로 나눕니다.

K = 5

라면 다섯 개의 군집으로 나눕니다.

핵심#

K-means = 데이터를 K개 그룹으로 분할

입니다.


4장 K는 누가 정하는가#

ADsP에서 매우 중요한 시험 포인트입니다.

K-means의 K는 사용자가 사전에 설정해야 합니다.

알고리즘이 아무 설정 없이 자동으로 최적의 K를 결정하는 것이 아닙니다.

따라서 다음 문장은 틀립니다.

K-means의 K는 알고리즘이 자동으로 결정한다.

정확한 설명은:

K는 사용자가 사전에 지정

입니다.


5장 K-means를 학교 반 편성으로 이해하기#

학생 100명을 비슷한 특성에 따라 세 그룹으로 나누고 싶다고 하겠습니다.

먼저 사용자가:

K = 3

이라고 정합니다.

그러면 알고리즘은 학생들을 세 그룹으로 나누려고 합니다.

각 그룹에는 중심을 나타내는 값이 존재하고 데이터들은 자신과 가까운 중심의 군집에 배정됩니다.

이 과정을 반복하며 비슷한 데이터가 같은 그룹에 모이도록 조정합니다.

ADsP에서는 세부 계산보다 우선:

K를 미리 정한다

는 특징을 확실하게 기억하는 것이 중요합니다.


6장 군집분석에서는 왜 거리가 중요한가#

군집분석에서는:

두 데이터가 얼마나 비슷한가?

를 판단해야 합니다.

대표적인 방법이 데이터 사이의 거리를 계산하는 것입니다.

거리가 가까우면 비슷한 데이터라고 판단할 수 있고, 거리가 멀면 서로 다른 특성을 가진 데이터라고 판단할 수 있습니다.

제공된 학습자료에서는 특히 다음 거리 개념을 구분합니다.

  • 유클리드 거리
  • 맨해튼 거리
  • 마할라노비스 거리

이 가운데 시험에서 자주 묻는 것은 마할라노비스 거리의 특징입니다.


7장 마할라노비스 거리란 무엇인가#

마할라노비스 거리 Mahalanobis Distance는 변수 사이의 상관관계를 고려하여 거리를 계산하는 방법입니다.

제공된 학습자료에서는 특히:

두 변수가 강한 상관관계를 가질 때 이를 고려하여 거리를 계산한다.

고 설명합니다.

즉 단순히 좌표 사이의 물리적인 거리만 보는 것이 아니라 데이터가 어떤 방향으로 함께 움직이는지도 반영합니다.

핵심#

마할라노비스 거리 = 변수 간 상관성 반영

입니다.


8장 유클리드 거리와 마할라노비스 거리의 차이#

유클리드 거리는 우리가 일반적으로 생각하는 직선거리와 비슷합니다.

반면 마할라노비스 거리는 변수 간 상관관계를 고려합니다.

제공된 학습자료의 핵심 구분은 다음과 같습니다.

유클리드 거리#

변수 간 상관성을 별도로 반영하지 않음

맨해튼 거리#

변수 간 상관성을 별도로 반영하지 않음

마할라노비스 거리#

변수 간 상관관계를 반영

합니다.

시험에서:

변수들 사이의 상관관계를 고려하는 거리

라는 표현이 나오면 마할라노비스 거리를 떠올리면 됩니다.


9장 왜 상관관계를 고려해야 할까#

두 변수가 서로 강하게 연관되어 있다고 생각해봅시다.

예를 들어:

  • 키
  • 몸무게

는 일정 부분 함께 증가하는 경향을 가질 수 있습니다.

단순한 거리 계산은 각 변수의 차이를 독립적으로 바라볼 수 있지만 마할라노비스 거리는 이러한 변수 간 관계를 고려합니다.

즉:

이 정도 차이가 이 데이터의 전체적인 분포에서 정말 큰 차이인가?

를 보다 구조적으로 바라보는 거리라고 이해할 수 있습니다.


10장 계층적 군집분석이란 무엇인가#

군집을 만드는 또 다른 방법으로 계층적 군집분석 Hierarchical Clustering이 있습니다.

이 방식에서는 가까운 데이터나 군집들을 단계적으로 결합하면서 계층적인 구조를 만들 수 있습니다.

여기서 중요한 문제가 하나 생깁니다.

두 군집 사이의 거리를 어떻게 계산할 것인가?

군집에는 여러 개의 데이터가 있으므로 어떤 점과 어떤 점을 비교할지 기준이 필요합니다.

제공된 학습자료에서는 다음 네 가지 연결법을 다룹니다.

  • 최단연결법 Single
  • 완전연결법 Complete
  • 평균연결법 Average
  • 와드연결법 Ward

11장 최단연결법 Single Linkage란 무엇인가#

최단연결법은 두 군집 사이에서 가장 가까운 두 점의 거리를 군집 간 거리로 사용합니다.

즉:

두 그룹에서 가장 가까이 붙어 있는 데이터가 얼마나 가까운가?

를 봅니다.

핵심#

Single = 최소 거리

입니다.


12장 최단연결법의 특징#

최단연결법에서는 군집 사이에 가까운 점 하나만 있어도 두 군집의 거리가 가깝다고 판단할 수 있습니다.

제공된 학습자료에서는 이 때문에:

사슬 구조가 형성될 수 있다

는 특징을 제시합니다.

즉 데이터가 길게 이어지듯 연결되는 형태가 나타날 수 있습니다.

시험 핵심#

Single → 가장 가까운 점 → 사슬 구조

입니다.


13장 완전연결법 Complete Linkage란 무엇인가#

완전연결법은 두 군집 사이에서 가장 멀리 떨어진 두 점의 거리를 군집 간 거리로 사용합니다.

즉:

두 그룹의 가장 먼 구성원까지 고려했을 때 거리가 얼마나 되는가?

를 보는 것입니다.

핵심#

Complete = 최대 거리

입니다.


14장 완전연결법은 최장연결법이라고도 이해할 수 있다#

제공된 학습자료에서는 완전연결법을 최장연결법이라고 표현하며 다음처럼 설명합니다.

두 군집 사이의 거리를 최댓값으로 측정

합니다.

따라서 시험에서는:

완전연결 = 최장연결 = 최대값

으로 묶어서 기억하면 됩니다.


15장 완전연결법의 특징#

제공된 학습자료에서는 완전연결법이 고립된 군집을 잘 탐지하는 특징을 제시합니다.

최단연결법이 가까운 점 하나를 기준으로 연결한다면 완전연결법은 가장 먼 점까지 고려하기 때문에 군집 전체의 범위를 더 엄격하게 바라봅니다.

시험 핵심#

Complete → 가장 먼 점 → 고립 군집 탐지

입니다.


16장 평균연결법 Average Linkage란 무엇인가#

평균연결법은 두 군집에 속한 데이터들 사이의 평균 거리를 이용합니다.

즉 가장 가까운 점 하나만 보는 것도 아니고 가장 먼 점 하나만 보는 것도 아닙니다.

전체적인 거리를 평균적으로 고려합니다.

제공된 학습자료에서는:

가장 균형 잡힌 방법

으로 설명합니다.

핵심#

Average = 평균 거리

입니다.


17장 최단·완전·평균연결법 비교#

세 가지를 거리 계산 기준으로 비교하면 매우 쉽습니다.

최단연결법#

가장 가까운 거리

→ 최솟값

완전연결법#

가장 먼 거리

→ 최댓값

평균연결법#

모든 거리의 평균

→ 평균값

즉:

Single = Min

Complete = Max

Average = Mean

으로 기억할 수 있습니다.


18장 와드연결법 Ward Linkage란 무엇인가#

와드연결법은 앞의 세 방법과 조금 다릅니다.

단순히 가장 가까운 점이나 가장 먼 점을 기준으로 하지 않고 군집 내 오차제곱합을 기준으로 군집을 결합합니다.

제공된 학습자료에서는:

군집 내 오차제곱합 최소화

라고 정리합니다.

핵심#

Ward = 오차제곱합

입니다.


19장 와드연결법을 쉽게 이해하면#

좋은 군집이라면 같은 군집에 속한 데이터들이 가능한 한 서로 비슷하게 모여 있어야 합니다.

와드연결법은 군집을 합쳤을 때 내부의 퍼짐이 얼마나 증가하는지를 고려합니다.

즉 군집 내부의 분산이 지나치게 커지지 않도록 결합하는 방식으로 이해할 수 있습니다.

제공된 학습자료에서는:

분산 기반

그리고:

가장 많이 사용

되는 방식으로 정리합니다.


20장 계층적 군집 연결법 4가지 비교#

연결법 거리 기준 주요 특징
최단연결 Single 가장 가까운 점 사슬 구조 가능
완전연결 Complete 가장 먼 점 고립된 군집 탐지
평균연결 Average 평균 거리 균형 잡힌 방식
와드연결 Ward 오차제곱합 분산 기반

시험에서는 특히:

최단 = 최소

완전 = 최대

Ward = SSE

를 많이 혼동합니다.


21장 실루엣 계수란 무엇인가#

실루엣 계수 Silhouette Coefficient는 군집 품질을 평가하는 지표입니다.

즉 군집분석을 수행한 뒤:

데이터들이 적절한 그룹에 잘 들어갔는가?

를 판단하는 데 사용할 수 있습니다.

제공된 학습자료에서는 세 개의 대표 값을 중요하게 제시합니다.

  • 1
  • 0
  • -1

22장 실루엣 계수 1의 의미#

실루엣 계수가 1에 가까우면 군집이 매우 잘 분리된 상태입니다.

제공된 학습자료에서는:

1 = 완벽한 분리

라고 정리합니다.

즉 자신이 속한 군집 안에서는 잘 어울리고 다른 군집과는 명확히 구분되는 상태입니다.

핵심#

Silhouette = 1 → 매우 좋은 군집

입니다.


23장 실루엣 계수 0의 의미#

실루엣 계수가 0이면 데이터가 군집의 경계에 위치한 경우입니다.

즉:

이 군집에 넣어도 될 것 같고 다른 군집에 넣어도 될 것 같은데?

라는 애매한 상태로 이해할 수 있습니다.

핵심#

Silhouette = 0 → 경계

입니다.


24장 실루엣 계수 -1의 의미#

실루엣 계수가 -1에 가까우면 해당 데이터가 잘못된 군집에 배정되었을 가능성이 높은 상태입니다.

제공된 학습자료에서는:

-1 = 잘못 분류된 경우

라고 정리합니다.

핵심#

Silhouette = -1 → 잘못된 군집

입니다.


25장 실루엣 계수는 어느 방향이 좋은가#

실루엣 계수는 값이 1에 가까울수록 좋은 군집 결과로 해석할 수 있습니다.

시험에서는 다음 세 가지를 세트로 기억하면 됩니다.

1 → 완벽한 분리

0 → 경계

-1 → 잘못 분류

입니다.


26장 K-means와 실루엣 계수를 연결해서 이해하기#

K-means에서는 사용자가 K를 지정해야 합니다.

예를 들어:

K = 2

K = 3

K = 4

중 어떤 값이 적절한지 고민할 수 있습니다.

제공된 학습자료에서는 K 자체를 사용자가 사전 설정해야 한다는 점과 실루엣 계수를 군집 품질 평가 지표로 제시합니다.

따라서 기본 흐름은:

K 지정

↓

군집 생성

↓

군집 품질 평가

로 이해할 수 있습니다.


27장 K-means와 계층적 군집은 같은 방법인가#

둘 다 데이터를 군집으로 나누지만 접근 방식은 다릅니다.

K-means#

사용자가 K를 미리 정하고 데이터를 K개 그룹으로 분할합니다.

계층적 군집#

데이터 또는 군집 사이 거리를 이용해 단계적인 군집 구조를 만듭니다.

그리고 계층적 군집에서는 군집 사이 거리 계산법으로:

  • Single
  • Complete
  • Average
  • Ward

등을 사용할 수 있습니다.


28장 K-means에서 가장 중요한 시험 함정#

다음 문장을 주의합니다.

K-means는 최적의 K값을 자동으로 찾아 군집 수를 결정한다.

틀립니다.

제공된 학습자료에서는:

사용자가 K를 사전 설정

한다고 명확하게 설명합니다.

따라서:

K-means → K는 미리

라고 기억하면 됩니다.


29장 마할라노비스 거리 시험 함정#

다음 문장을 생각해봅시다.

변수들 사이에 강한 상관관계가 존재할 때 이를 반영해 거리를 계산한다.

정답은:

마할라노비스 거리

입니다.

반대로:

유클리드 거리가 변수 간 상관성을 직접 반영한다.

라고 나오면 제공된 학습자료의 설명과 다릅니다.

핵심#

상관관계 반영 → Mahalanobis

입니다.


30장 연결법 시험 함정 1#

최단연결법은 두 군집 사이에서 가장 먼 두 점을 이용한다.

틀립니다.

최단연결법은:

가장 가까운 점

입니다.

가장 먼 점을 사용하는 것은 완전연결법입니다.


31장 연결법 시험 함정 2#

완전연결법은 두 군집의 최소 거리를 사용한다.

틀립니다.

완전연결법은:

최대 거리

를 사용합니다.

시험에서는:

Single ↔ Complete

를 반대로 제시하는 문제가 특히 주의할 부분입니다.


32장 연결법 시험 함정 3#

와드연결법은 두 군집의 가장 먼 점 사이 거리를 사용한다.

틀립니다.

그것은 완전연결법입니다.

와드연결법은:

군집 내 오차제곱합

과 연결됩니다.


33장 연결법을 사람 모임으로 이해하기#

두 모임 A와 B가 있다고 생각해봅시다.

각 모임에 여러 사람이 있습니다.

Single#

두 모임 사람 중 가장 가까운 두 사람만 봅니다.

Complete#

두 모임 사람 중 가장 먼 두 사람을 봅니다.

Average#

모든 사람 사이 거리의 평균을 봅니다.

Ward#

모임을 합쳤을 때 내부적으로 얼마나 퍼지는지를 봅니다.

이렇게 생각하면 네 방법을 쉽게 구분할 수 있습니다.


34장 K-means 시험 직전 암기#

K-means

→ 데이터를 K개 군집으로 분할

→ K는 사용자가 사전 지정

가장 중요한 함정:

K 자동 결정 X

입니다.

한 줄로:

K-means의 K는 내가 정한다

라고 기억하면 됩니다.


35장 거리 시험 직전 암기#

Mahalanobis#

→ 변수 간 상관관계 반영

시험에서:

상관관계

라는 단어가 거리와 함께 나오면 마할라노비스를 떠올립니다.

핵심:

Mahalanobis = 상관성 고려

입니다.


36장 연결법 시험 직전 암기#

Single#

→ 최소 거리

→ 사슬 구조

Complete#

→ 최대 거리

→ 고립 군집 탐지

Average#

→ 평균 거리

→ 균형적

Ward#

→ 오차제곱합

→ 분산 기반

가장 간단하게:

Single = Min

Complete = Max

Average = Mean

Ward = SSE

입니다.


37장 실루엣 계수 시험 직전 암기#

1#

→ 완벽한 분리

0#

→ 경계

-1#

→ 잘못된 군집

따라서:

1에 가까울수록 좋은 군집

이라고 기억하면 됩니다.


38장 군집분석 핵심 비교표#

개념 핵심
K-means K개 군집으로 분할
K 사용자가 사전 설정
Mahalanobis 변수 간 상관성 반영
Silhouette 1 완벽한 분리
Silhouette 0 군집 경계
Silhouette -1 잘못된 군집
Single 최솟값
Complete 최댓값
Average 평균거리
Ward 군집 내 오차제곱합

군집분석 FAQ#

군집분석이란 무엇인가#

정답이 주어지지 않은 데이터에서 서로 비슷한 특성을 가진 데이터를 그룹으로 묶는 분석방법입니다.

K-means란 무엇인가#

데이터를 사용자가 지정한 K개의 군집으로 분할하는 알고리즘입니다.

K-means의 K는 누가 정하는가#

제공된 학습자료에서는 사용자가 사전에 설정한다고 설명합니다.

K-means가 K를 자동으로 결정하는가#

아닙니다.

마할라노비스 거리의 핵심 특징은 무엇인가#

변수 사이의 상관관계를 반영하여 거리를 계산합니다.

유클리드 거리와 마할라노비스 거리의 중요한 차이는 무엇인가#

제공된 학습자료에서는 마할라노비스 거리가 변수 간 상관성을 반영한다는 점을 강조합니다.

실루엣 계수는 무엇에 사용하는가#

군집 품질을 평가하는 데 사용합니다.

실루엣 계수가 1이면 무엇을 의미하는가#

완벽하게 잘 분리된 군집을 의미합니다.

실루엣 계수가 0이면 무엇을 의미하는가#

군집 경계에 있는 경우입니다.

실루엣 계수가 -1이면 무엇을 의미하는가#

잘못된 군집에 속한 경우로 해석합니다.

최단연결법은 어떤 거리를 사용하는가#

두 군집 사이에서 가장 가까운 두 점의 거리를 사용합니다.

완전연결법은 어떤 거리를 사용하는가#

두 군집 사이에서 가장 먼 두 점의 거리를 사용합니다.

최장연결법과 완전연결법은 어떻게 연결되는가#

제공된 학습자료에서는 완전연결법을 두 군집 사이의 최댓값을 사용하는 방식으로 설명합니다.

평균연결법은 무엇인가#

두 군집 사이의 평균 거리를 이용하는 방법입니다.

와드연결법은 무엇을 기준으로 하는가#

군집 내 오차제곱합을 최소화하는 기준을 사용합니다.

사슬 구조가 나타날 수 있는 방법은 무엇인가#

제공된 학습자료에서는 최단연결법의 특징으로 제시합니다.

고립된 군집을 잘 탐지하는 방법은 무엇인가#

제공된 학습자료에서는 완전연결법의 특징으로 제시합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 군집분석이 무엇인지 설명할 수 있는가?
  2. K-means의 K가 무엇을 의미하는지 알고 있는가?
  3. K를 사용자가 사전에 설정한다는 것을 기억하고 있는가?
  4. 마할라노비스 거리의 특징을 설명할 수 있는가?
  5. 변수 간 상관관계를 반영하는 거리가 무엇인지 알고 있는가?
  6. 실루엣 계수가 무엇을 평가하는지 알고 있는가?
  7. 실루엣 1·0·-1을 각각 해석할 수 있는가?
  8. 최단연결법의 거리 기준을 알고 있는가?
  9. 완전연결법의 거리 기준을 알고 있는가?
  10. 평균연결법의 거리 기준을 알고 있는가?
  11. 와드연결법이 오차제곱합과 연결된다는 것을 알고 있는가?
  12. 최단연결법에서 사슬 구조가 발생할 수 있다는 것을 알고 있는가?
  13. 완전연결법이 고립된 군집 탐지와 연결된다는 것을 알고 있는가?
  14. Single·Complete·Average·Ward를 서로 구분할 수 있는가?

이 글을 마치며#

군집분석은 비슷한 데이터끼리 그룹으로 묶는 분석방법입니다.

ADsP에서 먼저 기억해야 할 것은 K-means입니다.

K-means = 데이터를 K개 군집으로 분할

하며:

K는 사용자가 사전에 설정

합니다.

거리와 관련해서는:

마할라노비스 거리 = 변수 간 상관관계를 반영

이라는 특징이 중요합니다.

군집 결과를 평가하는 실루엣 계수는:

1 = 완벽한 분리

0 = 경계

-1 = 잘못된 군집

으로 기억합니다.

계층적 군집의 연결방법은:

Single = 가장 가까운 점

Complete = 가장 먼 점

Average = 평균 거리

Ward = 오차제곱합

입니다.

시험 직전에는 다음 네 줄로 압축하면 됩니다.

K-means의 K는 사용자가 정한다

Mahalanobis = 변수 간 상관관계 반영

Silhouette = 1 좋음 / 0 경계 / -1 잘못됨

Single=Min / Complete=Max / Average=Mean / Ward=SSE

이 페이지의 목차