데이터 시각화 유형 총정리: 히스토그램·막대 차트·상자그림·산점도·선 그래프·히트맵 차이
1장 데이터 시각화는 왜 필요한가#
데이터를 숫자로만 보면 전체적인 특징을 빠르게 파악하기 어렵습니다.
예를 들어 학생 100명의 시험점수가 있다고 생각해봅시다.
85, 72, 68, 91, 55, 77, 83, 64, 95, 71 ...
숫자가 몇 개라면 직접 읽을 수 있지만 수백 개, 수천 개가 되면 다음 질문에 바로 답하기 어렵습니다.
- 점수가 어느 구간에 가장 많이 몰려 있는가?
- 매우 낮거나 높은 점수가 있는가?
- 두 학급의 점수 분포가 다른가?
- 공부시간과 시험점수는 관계가 있는가?
- 점수가 시간에 따라 상승하고 있는가?
이럴 때 데이터를 그림으로 표현하면 숫자만 볼 때보다 패턴을 빠르게 발견할 수 있습니다.
이것이 데이터 시각화 Data Visualization입니다.
데이터 시각화에서 중요한 것은 단순히 보기 좋은 그래프를 만드는 것이 아닙니다.
데이터의 성격과 분석 목적에 맞는 차트를 선택하는 것이 핵심입니다.
2장 어떤 데이터에 어떤 차트를 사용해야 할까#
ADsP에서는 다음 대응관계를 먼저 기억하면 좋습니다.
| 분석 목적 | 대표 시각화 |
|---|---|
| 연속형 데이터의 분포 | 히스토그램 |
| 범주별 값 비교 | 막대 차트 |
| 분포와 이상치 확인 | 상자그림 |
| 전체에서 차지하는 비율 | 파이 차트 |
| 두 연속형 변수의 관계 | 산점도 |
| 시간에 따른 변화 | 선 그래프 |
| 행렬·상관관계의 크기 | 히트맵 |
아주 간단하게 줄이면 다음과 같습니다.
분포 → 히스토그램·상자그림
비교 → 막대 차트
비율 → 파이 차트
관계 → 산점도
시간 → 선 그래프
행렬 → 히트맵
이 기준을 잡아두면 새로운 문제가 나와도 어떤 차트를 선택해야 하는지 판단하기 쉬워집니다.
3장 히스토그램 Histogram이란 무엇인가#
히스토그램은 연속형 수치 데이터의 분포를 확인하는 그래프입니다.
예를 들어 학생 1,000명의 시험점수가 있다고 생각해봅시다.
점수를 다음과 같이 일정한 구간으로 나눌 수 있습니다.
- 0~10점
- 10~20점
- 20~30점
- 30~40점
- ...
- 90~100점
각 구간에 몇 명이 들어가는지를 세어서 막대로 표시합니다.
즉 히스토그램은 다음 질문에 답하는 데 유용합니다.
- 데이터가 어디에 많이 몰려 있는가?
- 좌우가 대칭적인가?
- 특정 구간에 값이 집중되어 있는가?
- 극단적으로 크거나 작은 값이 있는가?
히스토그램의 축#
일반적으로:
X축 → 값의 구간
Y축 → 빈도
를 나타냅니다.
예를 들어 나이를 시각화한다면 X축에는 20대, 30대처럼 연속된 나이 구간이 들어가고 Y축에는 해당 구간에 속하는 사람 수가 나타날 수 있습니다.
4장 히스토그램의 막대 사이에는 왜 간격이 없을까#
히스토그램에서 매우 중요한 특징입니다.
막대 사이에 일반적으로 간격이 없습니다.
이유는 각각의 막대가 서로 독립적인 범주가 아니라 연속된 수치 구간을 나타내기 때문입니다.
예를 들어:
20~30
30~40
40~50
은 서로 이어지는 구간입니다.
따라서 그래프에서도 막대가 이어져 있는 형태로 표현합니다.
시험에서는 이 특징을 이용하여 막대 차트와 구분하는 문제가 자주 출제됩니다.
5장 막대 차트 Bar Chart란 무엇인가#
막대 차트는 범주형 데이터의 값을 서로 비교하기 위한 그래프입니다.
예를 들어 지역별 매출을 비교한다고 하겠습니다.
| 지역 | 매출 |
|---|---|
| 서울 | 10억 |
| 부산 | 6억 |
| 대구 | 4억 |
이 데이터를 막대로 나타내면 서울·부산·대구 가운데 어느 지역의 매출이 높은지 쉽게 비교할 수 있습니다.
대표적인 활용은 다음과 같습니다.
- 지역별 매출
- 상품별 판매량
- 부서별 인원
- 브랜드별 판매량
- 직업별 응답자 수
핵심은 서로 다른 범주를 비교한다는 것입니다.
6장 막대 차트는 왜 막대 사이에 간격이 있을까#
막대 차트의 각 막대는 서로 다른 독립적인 범주를 의미합니다.
예를 들어:
서울 | 부산 | 대구
는 연속된 숫자구간이 아닙니다.
서울과 부산 사이에 반드시 어떤 중간 범주가 존재하는 것도 아닙니다.
따라서 보통 막대를 떨어뜨려 표현합니다.
히스토그램
연속된 구간 → 막대가 붙음
막대 차트
독립된 범주 → 막대 사이에 간격
이 차이가 시험에서 매우 중요합니다.
7장 히스토그램과 막대 차트 차이#
두 그래프는 겉으로 보기에는 비슷합니다.
둘 다 막대를 사용하기 때문입니다.
하지만 데이터 자체가 다릅니다.
| 구분 | 히스토그램 | 막대 차트 |
|---|---|---|
| 영어 | Histogram | Bar Chart |
| 데이터 | 연속형 수치 | 범주형 |
| 목적 | 분포 확인 | 범주 비교 |
| X축 | 값의 구간 | 범주 |
| 막대 간격 | 없음 | 있음 |
| 순서 | 수치 순서 중요 | 필요에 따라 변경 가능 |
| 예 | 나이 분포 | 지역별 매출 |
시험 핵심#
히스토그램 = 연속형 + 분포 + 막대 붙음
막대 차트 = 범주형 + 비교 + 막대 떨어짐
입니다.
대표 함정#
히스토그램과 막대 차트는 동일한 그래프이다.
틀린 설명입니다.
8장 상자그림 Box Plot이란 무엇인가#
상자그림은 연속형 데이터의 분포와 중앙값, 사분위수, 이상치를 한눈에 확인하기 위한 그래프입니다.
영어로는 Box Plot 또는 Box-and-Whisker Plot이라고 합니다.
상자그림을 이해하려면 먼저 다음 다섯 값을 알아야 합니다.
- 최솟값
- Q1 제1사분위수
- 중앙값 Median
- Q3 제3사분위수
- 최댓값
이를 흔히 5-숫자 요약 Five-number Summary이라고 합니다.
ADsP에서는 상자그림의 구조와 IQR을 이용한 이상치 판별이 특히 중요합니다.
9장 중앙값 Median이란 무엇인가#
데이터를 작은 값부터 큰 값까지 정렬했을 때 가운데 위치하는 값을 중앙값이라고 합니다.
예를 들어:
10, 20, 30, 40, 50
이라면 중앙값은:
30
입니다.
전체 데이터 가운데 약 절반은 중앙값보다 작고 나머지 절반은 중앙값보다 큽니다.
중앙값은 평균 Mean과 다른 개념입니다.
시험 함정#
상자그림을 보면 평균을 직접 확인할 수 있다.
일반적인 기본 Box Plot 설명에서는 틀린 문장으로 봅니다.
상자 안에 표시되는 대표적인 중심값은 중앙값 Median입니다.
10장 Q1과 Q3란 무엇인가#
사분위수 Quartile는 정렬된 데이터를 네 부분으로 나누는 기준입니다.
Q1 제1사분위수#
전체 데이터의 하위 25% 지점입니다.
Q2#
하위 50% 지점으로 바로 중앙값 Median입니다.
Q3 제3사분위수#
전체 데이터의 하위 75% 지점입니다.
따라서 위치를 단순하게 나타내면:
최솟값 → Q1 → 중앙값 → Q3 → 최댓값
순서입니다.
11장 IQR이란 무엇인가#
IQR은 Interquartile Range, 즉 사분위 범위를 의미합니다.
계산식은 다음과 같습니다.
IQR = Q3 - Q1
즉 데이터의 가운데 50%가 어느 정도 범위에 퍼져 있는지 보여줍니다.
예를 들어:
Q1 = 40
Q3 = 80
이라면:
IQR = 80 - 40 = 40
입니다.
IQR은 상자그림에서 이상치를 판단하는 데 매우 중요합니다.
12장 상자그림에서 이상치는 어떻게 찾을까#
ADsP에서는 다음 기준을 기억해야 합니다.
하한 경계 = Q1 - 1.5 × IQR
상한 경계 = Q3 + 1.5 × IQR
이 범위를 벗어나는 데이터는 이상치 후보로 봅니다.
즉:
Q1 - 1.5 × IQR 미만
또는
Q3 + 1.5 × IQR 초과
이면 이상치로 표시할 수 있습니다.
13장 상자그림 이상치 계산을 실제로 해보자#
다음 값이 있다고 하겠습니다.
Q1 = 20
Q3 = 40
먼저 IQR을 구합니다.
IQR = 40 - 20 = 20
하한 경계는:
20 - 1.5 × 20
= 20 - 30
= -10
입니다.
상한 경계는:
40 + 1.5 × 20
= 40 + 30
= 70
입니다.
따라서:
- -10 미만
- 70 초과
인 값은 이상치 후보가 됩니다.
예를 들어 데이터에 90이 존재한다면 상한 70을 넘어가므로 이상치로 표시될 수 있습니다.
14장 Box Plot의 최솟값과 최댓값은 단순한 실제 최소·최대가 아니다#
시험에서 주의해야 할 부분입니다.
상자그림에 수염 Whisker로 표시되는 값은 이상치를 제외한 범위에서 결정됩니다.
학습자료 기준으로 정리하면:
최솟값
Q1 - 1.5 × IQR 이상인 데이터 중 가장 작은 값
최댓값
Q3 + 1.5 × IQR 이하인 데이터 중 가장 큰 값
입니다.
경계 밖에 있는 데이터는 별도의 점 등으로 표시해 이상치 Outlier로 표현합니다.
따라서:
Box Plot의 최댓값은 무조건 전체 데이터의 가장 큰 값이다.
라고 생각하면 틀릴 수 있습니다.
15장 상자그림을 보면 무엇을 알 수 있는가#
상자그림 하나만으로도 여러 특징을 빠르게 확인할 수 있습니다.
데이터의 중심#
중앙값으로 데이터의 중심 위치를 확인할 수 있습니다.
데이터의 퍼짐#
Q1과 Q3의 차이인 IQR로 가운데 50% 데이터가 얼마나 퍼져 있는지 확인할 수 있습니다.
치우침#
중앙값의 위치나 수염의 길이를 비교하면서 분포의 비대칭성을 살펴볼 수 있습니다.
이상치#
IQR 기준을 벗어난 값을 쉽게 발견할 수 있습니다.
그룹 비교#
여러 Box Plot을 나란히 놓으면 서로 다른 집단의 분포를 비교하기 좋습니다.
16장 두 학급의 성적을 Box Plot으로 비교한다면#
A반과 B반의 평균만 비교했다고 생각해봅시다.
A반 평균 = 75점
B반 평균 = 75점
평균만 보면 두 학급이 똑같아 보입니다.
하지만 실제 분포는 다를 수 있습니다.
A반:
70~80점에 대부분 집중
B반:
30점부터 100점까지 넓게 분포
이럴 때 상자그림을 사용하면:
- 중앙값
- 데이터 분포 범위
- IQR
- 이상치
를 함께 비교할 수 있습니다.
따라서 여러 그룹의 분포를 비교할 때 Box Plot이 매우 유용합니다.
17장 파이 차트 Pie Chart란 무엇인가#
파이 차트는 전체를 100%로 보고 각 범주가 차지하는 구성비와 비율을 보여주는 그래프입니다.
예를 들어 스마트폰 시장 점유율이:
| 브랜드 | 점유율 |
|---|---|
| A | 40% |
| B | 30% |
| C | 20% |
| 기타 | 10% |
라면 전체 원을 각 비율에 따라 나눌 수 있습니다.
파이 차트는 다음과 같은 질문에 적합합니다.
전체 가운데 각 항목이 얼마나 차지하는가?
대표적인 예:
- 시장 점유율
- 예산 구성
- 고객 유형 구성비
- 응답 비율
입니다.
18장 파이 차트를 사용하면 안 좋은 경우#
파이 차트는 범주가 너무 많으면 읽기 어려워집니다.
예를 들어 범주가 20개라면 아주 작은 조각이 많이 만들어져 차이를 구분하기 어려울 수 있습니다.
또 31%와 33%처럼 차이가 작은 항목은 원의 각도만 보고 정확하게 비교하기 어렵습니다.
따라서 파이 차트는 범주 수가 적고 전체 구성비를 보여주는 것이 중요할 때 사용하는 것이 적합합니다.
시험 핵심#
Pie Chart = 전체 100%의 구성비
입니다.
19장 산점도 Scatter Plot이란 무엇인가#
산점도는 두 연속형 변수 사이의 관계를 확인하는 그래프입니다.
X축과 Y축에 각각 하나의 연속형 변수를 배치하고 각 관측값을 점으로 표현합니다.
예를 들어:
X축 = 키
Y축 = 몸무게
라고 하면 사람 한 명이 점 하나가 됩니다.
점들이 어떤 방향으로 분포하는지를 보면 두 변수 사이의 관계를 파악할 수 있습니다.
20장 산점도에서 양의 상관관계란 무엇인가#
X가 증가하면서 Y도 증가하는 경향이 나타나면 양의 상관관계를 생각할 수 있습니다.
예:
공부시간 증가 → 시험점수도 증가하는 경향
광고비 증가 → 매출도 증가하는 경향
그래프에서는 점들이 대체로 왼쪽 아래에서 오른쪽 위 방향으로 나타납니다.
즉:
X ↑ → Y ↑
형태입니다.
21장 산점도에서 음의 상관관계란 무엇인가#
X가 증가할수록 Y가 감소하는 경향이 있다면 음의 상관관계입니다.
예:
상품 가격이 증가할수록 판매량이 감소하는 경향
처럼 생각할 수 있습니다.
그래프에서는 대체로:
왼쪽 위 → 오른쪽 아래
방향의 패턴을 보일 수 있습니다.
즉:
X ↑ → Y ↓
입니다.
22장 산점도에서 상관관계가 없다는 것은 무엇인가#
점들이 특정한 증가 또는 감소 방향 없이 흩어져 있다면 뚜렷한 상관관계가 없다고 볼 수 있습니다.
산점도에서는 따라서 다음 세 가지를 기본적으로 확인할 수 있습니다.
- 양의 관계
- 음의 관계
- 뚜렷한 관계 없음
다만 중요한 점이 있습니다.
산점도에서 상관관계가 보인다고 해서 인과관계가 자동으로 성립하는 것은 아닙니다.
두 변수가 함께 움직인다는 것과 한 변수가 다른 변수의 원인이라는 것은 다른 문제입니다.
23장 선 그래프 Line Chart란 무엇인가#
선 그래프는 시간의 흐름에 따른 변화와 추세 Trend를 보여주는 데 적합한 그래프입니다.
일반적으로:
X축 → 시간
Y축 → 측정값
을 사용합니다.
예를 들어:
- 월별 매출
- 연도별 인구
- 일별 방문자 수
- 시간별 온도
- 주가 변화
등을 표현할 수 있습니다.
각 시점의 값을 선으로 연결하기 때문에 값이 증가하는지 감소하는지 쉽게 확인할 수 있습니다.
24장 선 그래프와 막대 차트는 언제 다르게 사용할까#
월별 매출은 막대 차트와 선 그래프 모두 사용할 수 있습니다.
하지만 강조하는 목적이 조금 다릅니다.
막대 차트#
각 월의 매출 크기를 비교하는 데 유용합니다.
선 그래프#
1월부터 12월까지 매출이 어떤 추세로 변화했는지 보는 데 유용합니다.
따라서 같은 데이터라도 무엇을 보여주고 싶은지에 따라 시각화가 달라질 수 있습니다.
비교가 중요 → 막대
시간적 흐름이 중요 → 선
으로 생각하면 쉽습니다.
25장 히트맵 Heatmap이란 무엇인가#
히트맵은 값을 숫자만으로 표시하는 대신 색상의 강도나 차이를 이용해 데이터의 크기를 표현하는 시각화입니다.
특히 행과 열로 이루어진 행렬 형태의 데이터를 표현할 때 유용합니다.
ADsP에서 대표적으로 연결되는 것이 상관관계 행렬 Correlation Matrix입니다.
예를 들어:
| 변수 | 나이 | 소득 | 구매액 |
|---|---|---|---|
| 나이 | 1.00 | 0.30 | 0.20 |
| 소득 | 0.30 | 1.00 | 0.75 |
| 구매액 | 0.20 | 0.75 | 1.00 |
처럼 변수끼리의 상관계수가 있을 때 숫자만 보는 것보다 색상 강도로 표현하면 강한 관계가 어디에 있는지 빠르게 파악할 수 있습니다.
26장 히트맵은 어디에 활용할 수 있을까#
대표적인 활용은 다음과 같습니다.
- 변수 간 상관관계
- 상관관계 행렬
- Cluster 결과
- 시간대별 활동량
- 요일·시간별 방문자
- 행렬 데이터의 패턴
예를 들어 Website 방문량을:
세로축 → 요일
가로축 → 시간
색상 → 방문자 수
로 표현하면 어떤 요일과 시간에 방문자가 집중되는지 쉽게 볼 수 있습니다.
시험 핵심#
Heatmap = 행렬 + 색상 강도
라고 기억하면 됩니다.
27장 데이터 유형별 시각화를 다시 정리해보자#
연속형 데이터의 분포를 보고 싶다#
Histogram
또는
Box Plot
범주형 데이터를 비교하고 싶다#
Bar Chart
전체의 구성비를 보고 싶다#
Pie Chart
두 연속형 변수의 관계를 보고 싶다#
Scatter Plot
시간에 따른 변화를 보고 싶다#
Line Chart
행렬의 값이나 상관관계를 색으로 보고 싶다#
Heatmap
이 연결이 데이터 시각화 문제의 핵심입니다.
28장 같은 데이터를 다른 그래프로 표현할 수도 있다#
중요한 점은 데이터와 차트가 항상 1:1로 정해지는 것은 아니라는 것입니다.
예를 들어 월별 매출은:
막대 차트
로 월별 규모를 비교할 수도 있고,
선 그래프
로 시간에 따른 추세를 강조할 수도 있습니다.
따라서 그래프 선택에서는:
이 데이터가 무엇인가?
와 함께:
이 데이터에서 무엇을 보여주고 싶은가?
를 생각해야 합니다.
이것이 단순 암기를 넘어 데이터 시각화를 실제로 이해하는 방법입니다.
29장 상자그림과 히스토그램은 무엇이 다른가#
둘 다 연속형 데이터의 분포를 확인할 수 있습니다.
하지만 보여주는 정보가 다릅니다.
히스토그램#
데이터가 구간별로 얼마나 많이 존재하는지 보여줍니다.
따라서 실제 분포의 모양을 파악하기 좋습니다.
상자그림#
Q1·중앙값·Q3·IQR·이상치를 압축하여 보여줍니다.
따라서 여러 집단의 분포를 빠르게 비교하기 좋습니다.
| 구분 | 히스토그램 | 상자그림 |
|---|---|---|
| 데이터 | 연속형 | 연속형 |
| 주요 목적 | 분포 모양 | 분포 요약·이상치 |
| 중앙값 | 직접 중심요소 아님 | 표시 |
| 이상치 | 모양으로 추정 | IQR 기준으로 표현 |
| 그룹 비교 | 가능 | 특히 편리 |
30장 막대 차트와 파이 차트는 무엇이 다른가#
두 그래프 모두 범주형 데이터를 표현할 수 있습니다.
그러나 목적이 다릅니다.
막대 차트#
범주끼리 크기를 비교
예:
서울 매출 100
부산 매출 70
대구 매출 40
파이 차트#
전체에서 각 범주가 차지하는 비율
예:
서울 50%
부산 30%
대구 20%
즉:
비교 → 막대
구성비 → 파이
라고 기억하면 쉽습니다.
31장 산점도와 선 그래프는 무엇이 다른가#
둘 모두 X축과 Y축을 사용하지만 목적이 다릅니다.
산점도#
두 연속형 변수의 관계를 봅니다.
예:
키 ↔ 몸무게
광고비 ↔ 매출
선 그래프#
시간에 따른 값의 변화를 봅니다.
예:
시간 → 주가
월 → 매출
날짜 → 기온
따라서:
관계 → 산점도
시간 → 선 그래프
입니다.
32장 어떤 차트를 선택할지 질문으로 판단하기#
시험에서 사례가 나오면 다음 질문을 순서대로 해보면 좋습니다.
데이터의 분포를 알고 싶은가#
그렇다면:
히스토그램
을 생각합니다.
이상치까지 함께 보고 싶은가#
그렇다면:
상자그림
을 생각합니다.
서로 다른 항목의 크기를 비교하는가#
그렇다면:
막대 차트
입니다.
전체에서 각 항목의 비율을 보는가#
그렇다면:
파이 차트
입니다.
두 연속형 변수의 관계를 보는가#
그렇다면:
산점도
입니다.
시간에 따른 변화인가#
그렇다면:
선 그래프
입니다.
행렬 값을 색상으로 표현하는가#
그렇다면:
히트맵
입니다.
33장 실제 쇼핑몰 데이터로 시각화 선택하기#
쇼핑몰의 여러 분석 문제를 예로 들어보겠습니다.
고객 나이는 어떻게 분포되어 있는가#
연속형 데이터의 분포입니다.
→ 히스토그램
지역별 매출을 비교하고 싶다#
범주별 값 비교입니다.
→ 막대 차트
고객 구매금액의 이상치를 찾고 싶다#
분포와 이상치를 확인합니다.
→ 상자그림
결제수단별 이용 비율을 보고 싶다#
전체 구성비입니다.
→ 파이 차트
광고비와 매출의 관계를 보고 싶다#
두 연속형 변수입니다.
→ 산점도
최근 12개월 매출 추세를 보고 싶다#
시간에 따른 변화입니다.
→ 선 그래프
여러 변수의 상관관계를 한꺼번에 보고 싶다#
행렬 형태의 관계를 표현합니다.
→ 히트맵
이렇게 실제 문제와 연결하면 단순 암기보다 기억하기 쉽습니다.
34장 상자그림 5-숫자 요약 핵심 정리#
시험에서 반드시 기억할 부분입니다.
Q1#
하위 25% 지점
중앙값 Median#
하위 50% 지점
평균 Mean과 다른 개념입니다.
Q3#
하위 75% 지점
IQR#
Q3 - Q1
하한#
Q1 - 1.5 × IQR
상한#
Q3 + 1.5 × IQR
이상치#
Q1 - 1.5 × IQR 미만
또는
Q3 + 1.5 × IQR 초과
입니다.
35장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 히스토그램과 막대 차트는 동일하다#
틀립니다.
히스토그램은 연속형 데이터의 분포를 나타냅니다.
막대 차트는 범주형 데이터의 값을 비교합니다.
함정 2. 히스토그램 막대 사이에는 간격이 있다#
기본적인 히스토그램은 연속된 구간이므로 막대 사이에 간격이 없습니다.
함정 3. Box Plot에서 평균을 확인한다#
틀립니다.
기본적인 상자그림에서는 중앙값 Median을 확인합니다.
함정 4. IQR은 Q1 + Q3이다#
틀립니다.
정답은:
IQR = Q3 - Q1
입니다.
함정 5. 산점도는 시간에 따른 추세를 확인한다#
시간에 따른 추세는 선 그래프와 가장 먼저 연결합니다.
산점도는 두 연속형 변수 사이의 관계를 확인하는 데 사용합니다.
함정 6. 파이 차트는 범주가 많을수록 좋다#
아닙니다.
범주가 지나치게 많으면 각 조각을 비교하기 어려워집니다.
함정 7. 히트맵은 두 변수의 점을 찍어 관계를 보여준다#
이는 산점도의 설명입니다.
히트맵은 행렬 형태 데이터를 색상의 강도로 표현합니다.
36장 시각화 유형 핵심 비교표#
| 시각화 | 적합한 데이터·목적 | 핵심 특징 | 대표 사례 |
|---|---|---|---|
| 히스토그램 | 연속형 분포 | 구간·빈도, 막대 간격 없음 | 나이·성적 분포 |
| 막대 차트 | 범주 비교 | 범주별 막대, 간격 있음 | 지역별 매출 |
| 상자그림 | 연속형 분포·이상치 | Q1·Median·Q3·IQR | 그룹별 점수 |
| 파이 차트 | 구성비 | 전체 100% | 시장 점유율 |
| 산점도 | 두 연속형 변수 관계 | X·Y 관계 | 키와 몸무게 |
| 선 그래프 | 시간에 따른 추세 | X축 시간 | 월별 매출 |
| 히트맵 | 행렬 데이터 | 색상 강도 | 상관관계 행렬 |
37장 시험 직전 30초 암기#
히스토그램
→ 연속형
→ 분포
→ 막대 붙음
막대 차트
→ 범주형
→ 비교
→ 막대 떨어짐
상자그림
→ 분포 + 이상치
→ Q1·중앙값·Q3
→ IQR = Q3 - Q1
파이 차트
→ 비율
→ 전체 100%
산점도
→ 두 연속형 변수
→ 상관관계
선 그래프
→ 시간
→ 추세
히트맵
→ 행렬
→ 색상 강도
38장 Box Plot 시험 직전 공식#
상자그림은 다음 네 줄을 반드시 기억합니다.
IQR = Q3 - Q1
하한 = Q1 - 1.5 × IQR
상한 = Q3 + 1.5 × IQR
범위를 벗어나면 이상치
그리고:
중앙값 ≠ 평균
이라는 점도 함께 기억합니다.
데이터 시각화 FAQ#
히스토그램이란 무엇인가#
연속형 수치 데이터를 일정한 구간으로 나누어 각 구간에 데이터가 얼마나 존재하는지 나타내는 그래프입니다.
히스토그램과 막대 차트의 차이는 무엇인가#
히스토그램은 연속형 데이터의 분포를 표현하고 막대 차트는 범주별 값을 비교합니다.
또 히스토그램은 일반적으로 막대 사이가 붙어 있고 막대 차트는 떨어져 있습니다.
막대 차트는 어떤 데이터에 적합한가#
지역, 상품, 부서처럼 서로 구분되는 범주별 값을 비교할 때 적합합니다.
상자그림은 무엇을 보여주는가#
Q1, 중앙값, Q3를 중심으로 데이터의 분포를 요약하고 IQR을 이용해 이상치를 확인할 수 있습니다.
상자그림에서 평균을 볼 수 있는가#
ADsP 기본 개념에서는 상자그림의 중심값으로 중앙값 Median을 확인합니다. 평균과 혼동하지 않아야 합니다.
IQR은 어떻게 계산하는가#
IQR = Q3 - Q1
입니다.
Box Plot의 이상치 기준은 무엇인가#
다음 범위를 벗어나는 값입니다.
Q1 - 1.5 × IQR 미만
또는
Q3 + 1.5 × IQR 초과
입니다.
파이 차트는 언제 사용하는가#
전체를 100%로 보았을 때 각 범주가 차지하는 구성비를 표현할 때 사용합니다.
산점도는 언제 사용하는가#
두 연속형 변수 사이의 관계와 상관관계 패턴을 확인할 때 사용합니다.
산점도에서 상관관계가 발견되면 인과관계도 있는가#
아닙니다.
산점도를 통해 두 변수가 함께 움직이는 패턴을 확인할 수 있지만 그것만으로 한 변수가 다른 변수의 원인이라고 판단할 수는 없습니다.
선 그래프는 언제 사용하는가#
시간에 따른 값의 변화와 추세를 표현할 때 적합합니다.
히트맵은 무엇인가#
행렬 형태의 데이터 값을 색상이나 색상의 강도로 표현하는 시각화입니다. 변수 간 상관관계 행렬을 시각화할 때 대표적으로 사용됩니다.
연속형 데이터에는 어떤 그래프가 적합한가#
목적에 따라 다릅니다.
분포를 보고 싶으면 히스토그램, 분포와 이상치를 함께 보고 싶으면 상자그림, 두 연속형 변수 사이의 관계를 보고 싶으면 산점도를 사용할 수 있습니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 히스토그램이 어떤 데이터에 적합한지 설명할 수 있는가?
- 히스토그램과 막대 차트의 차이를 두 가지 이상 말할 수 있는가?
- 막대 차트가 범주형 데이터 비교에 적합한 이유를 알고 있는가?
- Box Plot의 5-숫자 요약을 말할 수 있는가?
- 중앙값과 평균이 다른 개념이라는 것을 알고 있는가?
- Q1과 Q3가 각각 몇 % 지점인지 알고 있는가?
- IQR 공식을 바로 말할 수 있는가?
- IQR을 이용한 이상치 판별 기준을 계산할 수 있는가?
- 파이 차트가 어떤 목적에 적합한지 설명할 수 있는가?
- 산점도가 두 연속형 변수의 관계를 표현한다는 것을 알고 있는가?
- 산점도에서 양의 상관과 음의 상관을 구분할 수 있는가?
- 선 그래프가 시간에 따른 추세와 연결된다는 것을 알고 있는가?
- 히트맵이 행렬과 색상 강도를 이용한다는 것을 알고 있는가?
- 분석 목적을 보고 적절한 차트를 선택할 수 있는가?
이 글을 마치며#
데이터 시각화 문제의 핵심은 차트 이름을 외우는 것이 아닙니다.
먼저:
무엇을 보고 싶은가?
를 생각해야 합니다.
데이터가 어느 구간에 몰려 있는지 보고 싶다면:
히스토그램
을 선택합니다.
집단별 크기를 비교한다면:
막대 차트
입니다.
분포와 이상치를 한 번에 보고 싶다면:
상자그림
입니다.
전체에서 차지하는 비율이 궁금하다면:
파이 차트
를 사용할 수 있습니다.
두 숫자형 변수의 관계가 궁금하다면:
산점도
시간이 지나면서 어떻게 변화했는지 보고 싶다면:
선 그래프
여러 변수 사이의 관계를 행렬과 색상으로 보고 싶다면:
히트맵
을 생각합니다.
시험 직전에는 다음 한 줄로 압축해서 기억하면 됩니다.
분포는 히스토그램, 비교는 막대, 이상치는 상자그림, 비율은 파이, 관계는 산점도, 시간은 선, 행렬은 히트맵.
그리고 상자그림에서는 다음 공식이 가장 중요합니다.
IQR = Q3 - Q1
하한 = Q1 - 1.5 × IQR
상한 = Q3 + 1.5 × IQR
마지막으로 가장 자주 나오는 두 가지 함정만 확실히 기억합니다.
히스토그램과 막대 차트는 같은 그래프가 아니다.
상자그림의 중심값은 평균이 아니라 중앙값이다.