정규분포란? 68-95-99.7 법칙·표준정규분포·Z-score 계산과 해석 쉽게 이해하기
1장 확률분포란 무엇인가#
확률분포를 처음 배우면 수식부터 떠올라 어렵게 느껴질 수 있습니다.
하지만 핵심은 간단합니다.
어떤 값들이 어느 정도의 가능성으로 나타나는지를 보여주는 것이 확률분포입니다.
예를 들어 사람의 키를 조사했다고 생각해봅시다.
모든 사람이 똑같은 키를 가지지는 않습니다.
어떤 사람은 평균보다 작고, 어떤 사람은 평균과 비슷하며, 어떤 사람은 평균보다 큽니다.
이때 사람들이 어떤 범위에 얼마나 많이 분포하는지를 표현하면 데이터의 전체적인 모습을 이해할 수 있습니다.
ADsP에서 대표적으로 알아야 하는 확률분포가 정규분포 Normal Distribution입니다.
2장 정규분포란 무엇인가#
정규분포는 평균을 중심으로 좌우가 대칭인 종 모양의 확률분포입니다.
수학적으로는 다음처럼 표현합니다.
N(μ, σ²)
여기서:
μ
→ 평균 Mean
σ²
→ 분산 Variance
입니다.
즉 정규분포의 모양과 위치는 평균과 분산에 의해 결정됩니다.
제공된 학습자료에서는 정규분포를 쉽게:
대부분의 데이터는 평균 근처에 모여 있고 평균에서 멀어질수록 데이터가 적어진다.
라고 설명합니다.
3장 정규분포는 왜 종 모양일까#
정규분포에서는 평균에 가까운 값이 가장 많이 나타납니다.
평균에서 멀어질수록 나타나는 빈도가 감소합니다.
그래서 그래프로 그리면 가운데가 가장 높고 양쪽으로 갈수록 낮아지는 형태가 됩니다.
모양을 단순화하면 다음과 같습니다.
평균에서 멀리 떨어진 값
→ 적음
평균 근처의 값
→ 많음
평균에서 반대편으로 멀리 떨어진 값
→ 다시 적음
이런 형태 때문에 Bell-shaped Curve, 즉 종 모양 곡선이라고 부릅니다.
4장 정규분포의 중심은 평균 μ다#
정규분포의 가운데에는 평균 μ가 위치합니다.
정규분포는 평균을 중심으로 좌우가 대칭입니다.
즉 평균에서:
- 왼쪽으로 같은 거리
- 오른쪽으로 같은 거리
만큼 떨어진 위치는 서로 대칭 관계를 가집니다.
예를 들어 평균이 100이라면 90과 110은 평균으로부터 각각 10만큼 떨어져 있습니다.
정규분포의 기본적인 형태에서는 이런 좌우 대칭성이 중요한 특징입니다.
핵심#
정규분포 = 평균 μ를 중심으로 좌우 대칭
입니다.
5장 σ는 무엇인가#
σ는 표준편차 Standard Deviation를 의미합니다.
표준편차는 데이터가 평균에서 얼마나 퍼져 있는지를 나타냅니다.
표준편차가 작다#
데이터가 평균 주변에 비교적 모여 있습니다.
표준편차가 크다#
데이터가 평균을 중심으로 넓게 퍼져 있습니다.
즉 같은 평균을 가지는 두 정규분포라도 표준편차가 다르면 분포의 퍼진 정도가 달라집니다.
6장 σ²는 무엇인가#
정규분포를:
N(μ, σ²)
라고 표현할 때 두 번째 값은 표준편차 σ가 아니라 분산 σ²입니다.
따라서:
μ = 평균
σ² = 분산
σ = 표준편차
로 구분해야 합니다.
시험에서는 σ와 σ²를 바꾸어 제시할 수 있으므로 주의해야 합니다.
7장 평균과 표준편차로 정규분포 이해하기#
예를 들어 시험점수가 다음과 같은 정규분포를 따른다고 생각해봅시다.
평균:
μ = 70
표준편차:
σ = 10
이면:
평균 위치는 70점입니다.
평균보다 1표준편차 높은 값은:
80점
평균보다 1표준편차 낮은 값은:
60점
입니다.
따라서:
μ − 1σ = 60
μ = 70
μ + 1σ = 80
입니다.
이 개념이 68-95-99.7 법칙을 이해하는 기초입니다.
8장 68-95-99.7 법칙이란 무엇인가#
정규분포에서는 평균을 중심으로 몇 개의 표준편차 범위 안에 데이터가 얼마나 포함되는지 대략적인 비율을 알 수 있습니다.
제공된 학습자료에서는 이를 68-95-99.7 법칙으로 정리합니다.
μ ± 1σ#
약 68.27%
μ ± 2σ#
약 95.45%
μ ± 3σ#
약 99.73%
입니다.
시험에서 매우 중요한 수치입니다.
9장 1σ 범위에는 약 68%가 있다#
평균을 중심으로 표준편차 1개 범위를 생각합니다.
구간은:
μ − 1σ ~ μ + 1σ
입니다.
이 범위 안에는 정규분포 전체 데이터의 약:
68.27%
가 포함됩니다.
제공된 학습자료에서는 쉽게:
한 칸 안에 68% = 대부분
이라고 설명합니다.
10장 2σ 범위에는 약 95%가 있다#
평균에서 양쪽으로 표준편차 두 개만큼 넓히면:
μ − 2σ ~ μ + 2σ
가 됩니다.
이 범위에는 약:
95.45%
의 데이터가 포함됩니다.
즉 정규분포를 따르는 데이터 대부분이 평균에서 두 표준편차 범위 안에 들어갑니다.
쉽게 기억하면:
2σ → 95% → 거의 다
입니다.
11장 3σ 범위에는 약 99.7%가 있다#
범위를 다시 넓혀:
μ − 3σ ~ μ + 3σ
를 보면 약:
99.73%
가 포함됩니다.
거의 전체 데이터에 가까운 수준입니다.
제공된 학습자료에서는 이를:
세 칸 안에 99.7% = 사실상 전부
라고 설명합니다.
12장 68-95-99.7 법칙 한눈에 보기#
| 평균 기준 범위 | 포함 비율 |
|---|---|
| μ ± 1σ | 약 68.27% |
| μ ± 2σ | 약 95.45% |
| μ ± 3σ | 약 99.73% |
시험에서는 간단하게:
1 → 68
2 → 95
3 → 99.7
로 기억하면 됩니다.
13장 68-95-99.7 법칙을 시험점수로 이해하기#
시험점수가 정규분포를 따르고:
평균 = 70점
표준편차 = 10점
이라고 하겠습니다.
평균 ± 1σ#
70 ± 10
→ 60점 ~ 80점
약 68.27%
평균 ± 2σ#
70 ± 20
→ 50점 ~ 90점
약 95.45%
평균 ± 3σ#
70 ± 30
→ 40점 ~ 100점
약 99.73%
입니다.
이렇게 숫자로 대입하면 의미를 쉽게 이해할 수 있습니다.
14장 왜 평균에서 멀어질수록 사람이 적어질까#
정규분포에서는 평균 주변에 값이 가장 많이 모입니다.
따라서 평균에서:
1σ
2σ
3σ
처럼 멀어질수록 해당 범위 밖에 존재하는 데이터는 점점 줄어듭니다.
μ ± 3σ 안에 이미 약 99.73%가 포함되기 때문에 그보다 바깥쪽에 존재하는 값은 매우 적습니다.
이러한 특징 때문에 평균에서 표준편차 여러 배만큼 떨어진 값을 특이한 값으로 바라볼 때도 활용할 수 있습니다.
15장 표준정규분포란 무엇인가#
정규분포마다 평균과 표준편차가 다르면 서로 비교하기 불편할 수 있습니다.
그래서 정규분포를 일정한 기준으로 변환하여 사용합니다.
이것이 표준정규분포 Standard Normal Distribution입니다.
표준정규분포는:
N(0, 1)
로 표현합니다.
제공된 학습자료에서는:
평균 μ = 0
표준편차 σ = 1
인 정규분포라고 설명합니다.
16장 표준정규분포의 핵심#
표준정규분포에서는 가운데 평균이 0입니다.
그리고 표준편차가 1입니다.
따라서:
평균
→ 0
평균보다 1표준편차 위
→ 1
평균보다 2표준편차 위
→ 2
평균보다 1표준편차 아래
→ -1
평균보다 2표준편차 아래
→ -2
와 같이 표현할 수 있습니다.
이때 사용하는 값이 Z-score입니다.
17장 표준정규분포 시험 함정#
다음 문장을 주의합니다.
표준정규분포는 평균 1, 표준편차 0이다.
틀립니다.
정확한 값은:
평균 = 0
표준편차 = 1
입니다.
시험 직전에는:
표준정규 = 0, 1
이라고 기억하면 됩니다.
18장 Z-score란 무엇인가#
Z-score는 어떤 값이 평균으로부터 표준편차 몇 배만큼 떨어져 있는지 나타내는 값입니다.
제공된 학습자료에서는 다음 공식으로 정리합니다.
Z = (X − μ) / σ
여기서:
X
→ 관측값
μ
→ 모평균
σ
→ 모표준편차
입니다.
결과인 Z값을 보면 특정 관측값이 평균에서 어느 정도 떨어져 있는지 알 수 있습니다.
19장 Z-score 공식을 쉽게 이해하기#
공식:
Z = (X − μ) / σ
를 두 단계로 나누면 이해하기 쉽습니다.
첫 번째#
X − μ
→ 내 값이 평균에서 얼마나 떨어져 있는가?
두 번째#
이를 σ로 나눕니다.
→ 그 차이가 표준편차 몇 개에 해당하는가?
따라서 Z-score는:
평균에서 얼마나 떨어졌는지를 표준편차 단위로 표현한 값
입니다.
20장 Z = 0은 무엇을 의미하는가#
Z-score가 0이라면:
X − μ = 0
이라는 뜻입니다.
즉:
X = μ
입니다.
따라서 해당 값은 평균과 같습니다.
핵심#
Z = 0 → 평균과 같음
입니다.
21장 Z = 1은 무엇을 의미하는가#
Z = 1이라면 해당 관측값은 평균보다 1표준편차만큼 높은 위치에 있습니다.
예를 들어:
평균 = 70
표준편차 = 10
일 때:
80점의 Z-score는:
(80 − 70) / 10
= 1
입니다.
따라서:
80점은 평균보다 1표준편차 높은 점수
입니다.
22장 Z = -2는 무엇을 의미하는가#
Z-score가 음수이면 해당 값이 평균보다 낮다는 의미입니다.
예를 들어:
평균 = 70
표준편차 = 10
관측값 = 50
이라고 하겠습니다.
Z-score는:
(50 − 70) / 10
= -2
입니다.
즉:
평균보다 2표준편차 낮은 위치
입니다.
핵심#
Z가 음수 → 평균보다 낮음
입니다.
23장 Z-score의 부호를 해석하는 방법#
Z-score에서 부호는 위치를 나타냅니다.
Z > 0#
평균보다 높음
Z = 0#
평균과 같음
Z < 0#
평균보다 낮음
그리고 절댓값은 평균에서 얼마나 멀리 떨어졌는지를 나타냅니다.
예를 들어:
Z = 0.5
→ 평균보다 0.5표준편차 높음
Z = -1.5
→ 평균보다 1.5표준편차 낮음
입니다.
24장 Z-score가 2이면 평균보다 2배 높은 것인가#
아닙니다.
ADsP에서 매우 중요한 함정입니다.
Z-score가 2이면 평균보다 값이 두 배 높다.
틀립니다.
Z = 2의 정확한 의미는:
평균보다 2표준편차만큼 높은 위치
입니다.
예를 들어:
평균 = 100
표준편차 = 10
이면 Z = 2인 값은:
120
입니다.
120은 평균 100의 두 배인 200이 아닙니다.
따라서:
Z = 2 → 평균의 2배 X
Z = 2 → 평균 + 2σ O
입니다.
25장 Z-score 계산 사례 1#
평균이 100이고 표준편차가 15인 시험에서 어떤 학생의 점수가 115점이라고 하겠습니다.
Z-score는:
Z = (115 − 100) / 15
Z = 1
입니다.
따라서 이 학생은 평균보다 1표준편차 높은 점수를 받았습니다.
26장 Z-score 계산 사례 2#
같은 시험에서 학생의 점수가 70점이라고 하겠습니다.
평균:
100
표준편차:
15
이므로:
Z = (70 − 100) / 15
Z = -2
입니다.
따라서:
평균보다 2표준편차 낮은 위치
입니다.
27장 서로 다른 시험점수도 Z-score로 비교할 수 있다#
Z-score의 중요한 장점은 평균과 표준편차가 다른 데이터에서도 상대적인 위치를 비교하기 쉽다는 점입니다.
예를 들어:
시험 A#
평균 70점
표준편차 10점
학생 점수 80점
Z = 1
시험 B#
평균 500점
표준편차 50점
학생 점수 550점
Z = 1
점수 자체는 80점과 550점으로 완전히 다릅니다.
하지만 두 학생 모두 각각 자신의 시험에서 평균보다 1표준편차 높은 위치에 있습니다.
즉 Z-score를 이용하면 데이터의 단위가 달라도 상대적인 위치를 비교할 수 있습니다.
28장 정규분포와 Z-score의 관계#
Z-score는 원래 정규분포의 값을 표준화하여 표준정규분포의 위치로 표현하는 데 사용됩니다.
일반 정규분포에서:
X
라는 값을 가지고 있다면:
Z = (X − μ) / σ
로 변환합니다.
그러면 평균은 0을 중심으로 하고 표준편차는 1인 기준에서 해당 값의 상대적 위치를 볼 수 있습니다.
즉:
원래 값 X
↓
표준화
↓
Z-score
↓
표준정규분포에서 위치 확인
의 흐름입니다.
29장 표준화 Standardization란 무엇인가#
표준화는 서로 다른 평균과 표준편차를 가진 데이터를 일정한 기준으로 바꾸는 과정으로 이해할 수 있습니다.
Z-score를 이용하면:
- 평균을 기준점 0으로 만들고
- 표준편차를 기준 단위 1로
해석할 수 있습니다.
예를 들어:
Z = 1.5
라는 값은 원래 데이터 단위가:
- 점수
- 키
- 몸무게
중 무엇이든 상관없이 평균보다 1.5표준편차 높은 위치라는 공통 기준으로 해석할 수 있습니다.
30장 68-95-99.7 법칙과 Z-score 연결하기#
표준정규분포에서는 평균이 0이므로 68-95-99.7 법칙을 Z값으로 표현하기 쉽습니다.
Z = -1 ~ +1#
약 68.27%
Z = -2 ~ +2#
약 95.45%
Z = -3 ~ +3#
약 99.73%
즉:
|Z| ≤ 1
→ 평균 주변 약 68%
|Z| ≤ 2
→ 약 95%
|Z| ≤ 3
→ 약 99.7%
라고 이해할 수 있습니다.
31장 Z = 3이라는 값은 어느 정도인가#
Z = 3이라는 것은 평균보다 3표준편차 높은 위치입니다.
정규분포에서는 μ ± 3σ 범위 안에 약 99.73%가 들어갑니다.
따라서 평균으로부터 3표준편차 이상 떨어진 값은 상대적으로 매우 드문 영역에 위치합니다.
반대로:
Z = -3
은 평균보다 3표준편차 낮은 위치입니다.
두 경우 모두 평균에서 상당히 멀리 떨어진 값입니다.
32장 정규분포를 시험점수 사례로 완전히 이해하기#
학생 시험점수가 정규분포를 따른다고 가정하겠습니다.
평균:
μ = 70
표준편차:
σ = 10
이라면:
Z = -3#
40점
Z = -2#
50점
Z = -1#
60점
Z = 0#
70점
Z = 1#
80점
Z = 2#
90점
Z = 3#
100점
입니다.
그리고 정규분포의 특성상:
60~80점
→ 약 68%
50~90점
→ 약 95%
40~100점
→ 약 99.7%
가 포함된다고 이해할 수 있습니다.
33장 정규분포에서 평균과 분산의 역할#
정규분포는 평균 μ와 분산 σ²에 의해 결정됩니다.
평균 μ#
분포가 어디를 중심으로 위치하는지 결정합니다.
분산 σ²#
데이터가 얼마나 넓게 퍼져 있는지와 연결됩니다.
따라서 평균이 달라지면 그래프의 중심 위치가 달라지고, 분산 또는 표준편차가 달라지면 분포의 퍼진 정도가 달라집니다.
34장 표준편차가 작으면 어떤 모양일까#
표준편차가 작다는 것은 데이터가 평균 가까이에 많이 모여 있다는 뜻입니다.
따라서 분포는 상대적으로:
- 가운데가 높고
- 폭이 좁은
형태가 됩니다.
반대로 표준편차가 커지면 데이터가 더 넓게 퍼집니다.
35장 표준편차가 크면 어떤 모양일까#
표준편차가 크다는 것은 데이터가 평균에서 넓게 퍼져 있다는 뜻입니다.
따라서 분포는 상대적으로:
- 폭이 넓고
- 가운데가 낮은
형태가 됩니다.
즉 표준편차는 정규분포의 퍼짐 정도를 이해하는 핵심 요소입니다.
36장 ADsP에서 자주 헷갈리는 함정#
함정 1. 정규분포는 좌우가 비대칭이다#
틀립니다.
정규분포는 평균을 중심으로 좌우가 대칭입니다.
함정 2. N(μ, σ²)에서 σ²는 표준편차다#
틀립니다.
σ²는 분산입니다.
표준편차는 σ입니다.
함정 3. μ ± 1σ에 약 95%가 들어간다#
틀립니다.
약 68.27%입니다.
함정 4. μ ± 2σ에 약 68%가 들어간다#
틀립니다.
약 95.45%입니다.
함정 5. μ ± 3σ에는 약 99.73%가 들어간다#
맞습니다.
함정 6. 표준정규분포의 평균은 1이다#
틀립니다.
평균은 0입니다.
함정 7. 표준정규분포의 표준편차는 0이다#
틀립니다.
표준편차는 1입니다.
함정 8. Z-score가 2이면 평균값의 두 배이다#
틀립니다.
평균보다 2표준편차 높은 위치입니다.
함정 9. Z-score가 음수이면 잘못 계산된 값이다#
틀립니다.
음수는 평균보다 낮은 위치라는 뜻입니다.
37장 정규분포 시험 직전 30초 암기#
정규분포#
N(μ, σ²)
→ μ = 평균
→ σ² = 분산
→ σ = 표준편차
→ 종 모양
→ 평균 중심 좌우 대칭
68-95-99.7#
μ ± 1σ
→ 68.27%
μ ± 2σ
→ 95.45%
μ ± 3σ
→ 99.73%
암기:
1-68 / 2-95 / 3-99.7
입니다.
38장 표준정규분포 시험 직전 암기#
표준정규분포
→ N(0,1)
→ 평균 0
→ 표준편차 1
따라서:
표준정규 = 0, 1
입니다.
시험에서:
평균 1, 표준편차 0
이라고 나오면 틀린 설명입니다.
39장 Z-score 시험 직전 암기#
공식은:
Z = (X − μ) / σ
입니다.
해석은:
평균으로부터 표준편차 몇 개만큼 떨어져 있는가
입니다.
Z = 0#
평균
Z = 1#
평균보다 1σ 높음
Z = -1#
평균보다 1σ 낮음
Z = 2#
평균보다 2σ 높음
Z = -2#
평균보다 2σ 낮음
가장 중요한 함정:
Z = 2는 평균의 2배가 아니다.
입니다.
40장 정규분포 핵심 비교표#
| 개념 | 핵심 |
|---|---|
| 정규분포 | 평균 중심의 좌우 대칭 종 모양 분포 |
| N(μ, σ²) | 평균 μ, 분산 σ² |
| σ | 표준편차 |
| μ ± 1σ | 약 68.27% |
| μ ± 2σ | 약 95.45% |
| μ ± 3σ | 약 99.73% |
| 표준정규분포 | N(0,1) |
| Z-score | 평균에서 표준편차 몇 배 떨어졌는지 표현 |
확률분포 FAQ#
정규분포란 무엇인가#
평균을 중심으로 좌우 대칭이며 가운데가 높고 양쪽으로 갈수록 낮아지는 종 모양의 확률분포입니다.
정규분포 N(μ, σ²)에서 μ는 무엇인가#
평균입니다.
σ²는 무엇인가#
분산입니다.
σ는 무엇인가#
표준편차입니다.
정규분포에서 μ ± 1σ 안에는 데이터가 얼마나 있는가#
약 68.27%가 포함됩니다.
μ ± 2σ에는 얼마나 포함되는가#
약 95.45%입니다.
μ ± 3σ에는 얼마나 포함되는가#
약 99.73%입니다.
68-95-99.7 법칙은 무엇인가#
정규분포에서 평균을 중심으로 1표준편차 범위에 약 68%, 2표준편차 범위에 약 95%, 3표준편차 범위에 약 99.7%의 데이터가 존재한다는 규칙입니다.
표준정규분포란 무엇인가#
평균 0, 표준편차 1인 정규분포입니다.
표준정규분포는 어떻게 표현하는가#
**N(0,1)**로 표현합니다.
Z-score란 무엇인가#
관측값이 평균에서 표준편차 몇 배만큼 떨어져 있는지를 나타내는 값입니다.
Z-score 공식은 무엇인가#
Z = (X − μ) / σ
입니다.
Z-score가 0이면 어떤 의미인가#
관측값이 평균과 같습니다.
Z-score가 1이면 어떤 의미인가#
평균보다 1표준편차 높은 위치입니다.
Z-score가 -2이면 어떤 의미인가#
평균보다 2표준편차 낮은 위치입니다.
Z-score가 2이면 평균의 두 배인가#
아닙니다.
평균보다 2표준편차만큼 높은 위치라는 의미입니다.
Z-score가 음수일 수도 있는가#
네. 평균보다 낮은 값이면 Z-score가 음수가 될 수 있습니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 정규분포가 어떤 모양인지 설명할 수 있는가?
- 정규분포가 평균을 중심으로 좌우 대칭이라는 것을 알고 있는가?
- N(μ, σ²)의 μ와 σ²가 각각 무엇인지 알고 있는가?
- σ와 σ²의 차이를 구분할 수 있는가?
- μ ± 1σ의 포함 비율을 알고 있는가?
- μ ± 2σ의 포함 비율을 알고 있는가?
- μ ± 3σ의 포함 비율을 알고 있는가?
- 68-95-99.7 법칙을 순서대로 말할 수 있는가?
- 표준정규분포의 평균을 알고 있는가?
- 표준정규분포의 표준편차를 알고 있는가?
- N(0,1)이 무엇을 의미하는지 설명할 수 있는가?
- Z-score 공식을 기억하고 있는가?
- Z-score가 무엇을 의미하는지 설명할 수 있는가?
- Z = 0, 1, -2를 각각 해석할 수 있는가?
- Z = 2가 평균의 두 배라는 의미가 아니라는 것을 알고 있는가?
이 글을 마치며#
정규분포를 이해할 때 가장 중요한 것은 복잡한 확률 계산보다 평균과 표준편차를 기준으로 데이터가 어떻게 퍼져 있는지를 이해하는 것입니다.
정규분포는:
N(μ, σ²)
로 나타냅니다.
여기서:
μ = 평균
σ² = 분산
σ = 표준편차
입니다.
정규분포의 데이터는 평균 주변에 가장 많이 모이며 평균에서 멀어질수록 줄어듭니다.
이를 수치로 나타낸 것이:
68-95-99.7 법칙
입니다.
1σ → 68.27%
2σ → 95.45%
3σ → 99.73%
입니다.
표준정규분포는:
N(0,1)
즉:
평균 0
표준편차 1
입니다.
그리고 Z-score는:
Z = (X − μ) / σ
로 계산하며:
관측값이 평균에서 표준편차 몇 개만큼 떨어져 있는가?
를 나타냅니다.
시험 직전에는 다음 네 줄만 확실하게 기억하면 됩니다.
정규분포 = 평균 중심 좌우 대칭 종 모양
68-95-99.7 = 1σ·2σ·3σ
표준정규분포 = 평균 0·표준편차 1
Z-score = 평균에서 표준편차 몇 칸 떨어졌는가