조건부 확률과 연관성 계산이란? Support·Confidence·Lift·Accuracy·Precision·Recall·F1 쉽게 이해하기
1장 조건부 확률과 연관성 계산은 왜 중요한가#
ADsP에서는 복잡한 수학 문제보다는 공식을 알고 숫자를 정확하게 대입할 수 있는지를 묻는 계산 문제가 자주 등장합니다.
제공된 학습자료에서 특히 빈출이라고 제시한 것은 다음 세 가지입니다.
- 조건부 확률
- 연관규칙의 지지도·신뢰도·향상도
- 혼동행렬의 정확도·정밀도·재현율·F1-Score
이 문제들은 공식을 정확히 구분하면 비교적 쉽게 풀 수 있습니다.
가장 중요한 것은 분모를 무엇으로 잡는지입니다.
예를 들어:
지지도 → 전체 거래
신뢰도 → 선행항목 A
정밀도 → 예측 Positive
재현율 → 실제 Positive
처럼 분모를 구분해야 합니다.
2장 조건부 확률 Conditional Probability이란 무엇인가#
조건부 확률은 어떤 사건이 이미 발생했다는 조건에서 다른 사건이 발생할 확률입니다.
공식은 다음과 같습니다.
P(A|B) = P(A ∩ B) / P(B)
P(A|B)는:
B가 발생했다는 조건에서 A가 발생할 확률
을 의미합니다.
핵심#
조건부 확률 = 동시에 발생 / 조건이 되는 사건
입니다.
3장 P(A|B)의 기호를 읽는 방법#
P(A|B)에서 세로줄 |는:
B가 주어졌을 때
라고 읽습니다.
따라서:
P(A|B)
는:
B가 주어졌을 때 A의 확률
입니다.
순서를 바꾸면 의미도 달라집니다.
P(A|B)와 P(B|A)는 일반적으로 같은 값이 아닙니다.
4장 조건부 확률 예제#
제공된 학습자료의 예제를 보겠습니다.
전체 사람:
100명
남자:
60명
안경을 쓴 남자:
24명
질문은:
남자라는 조건에서 안경을 쓴 사람의 비율은?
입니다.
즉:
P(안경 | 남자)
를 구합니다.
공식에 대입하면:
24 / 60 = 0.4
입니다.
따라서 확률은:
0.4 = 40%
입니다.
5장 왜 24/100이 아닌가#
조건부 확률 문제에서 가장 중요한 부분입니다.
질문이:
전체 사람 중 안경 쓴 남자는 몇 %인가?
라면:
24 / 100
을 생각할 수 있습니다.
하지만 질문은:
남자 중에서 안경 쓴 사람은 몇 %인가?
입니다.
이미 남자 60명으로 범위가 제한되었습니다.
따라서 분모는 전체 100명이 아니라:
남자 60명
입니다.
핵심#
조건이 붙으면 분모가 바뀐다
고 기억하면 됩니다.
6장 조건부 확률과 베이즈 정리의 관계#
앞에서 나이브 베이즈를 공부하면서 다음 공식을 살펴봤습니다.
P(A|B)
조건부 확률은 베이즈 정리에서도 핵심적으로 사용됩니다.
조건부 확률 자체의 기본 공식은:
P(A|B) = P(A ∩ B) / P(B)
이고,
베이즈 정리는 조건부 확률들의 관계를 이용해 사후확률을 계산합니다.
시험에서는 두 공식을 서로 혼동하지 않는 것이 중요합니다.
7장 연관규칙분석에서 무엇을 계산하는가#
연관규칙분석 Association Rule Analysis은 어떤 항목들이 함께 등장하는 패턴을 찾는 방법입니다.
대표적인 예가 장바구니 분석입니다.
예:
우유 → 빵
이라는 규칙이 있다고 하겠습니다.
이 규칙을 평가하는 대표적인 지표는:
- 지지도 Support
- 신뢰도 Confidence
- 향상도 Lift
입니다.
이 세 지표의 공식을 반드시 구분해야 합니다.
8장 연관규칙 계산 예제#
제공된 학습자료의 데이터를 그대로 사용해보겠습니다.
전체 거래:
1,000건
우유 포함 거래:
400건
빵 포함 거래:
300건
우유와 빵을 모두 포함:
200건
규칙:
우유 → 빵
입니다.
이제 Support, Confidence, Lift를 하나씩 계산합니다.
9장 지지도 Support란 무엇인가#
지지도는 전체 거래 중에서 A와 B가 함께 등장한 거래의 비율입니다.
공식은:
Support(A→B) = A∩B / 전체 거래
입니다.
제공된 예제에서는:
우유∩빵 = 200
전체 거래 = 1000
이므로:
Support = 200 / 1000
= 0.2
= 20%
입니다.
핵심#
Support = 같이 / 전체
입니다.
10장 지지도는 무엇을 의미하는가#
지지도 20%라는 것은 전체 거래 1,000건 가운데 **우유와 빵이 함께 등장한 거래가 20%**라는 의미입니다.
즉 해당 조합이 전체 데이터에서 얼마나 자주 등장하는지를 보여줍니다.
시험에서는 분모가:
전체 거래
라는 점이 가장 중요합니다.
11장 신뢰도 Confidence란 무엇인가#
신뢰도는 A를 구매한 거래 중 B도 구매한 비율입니다.
규칙이:
우유 → 빵
이라면 질문은:
우유를 산 사람 중 빵도 산 사람은 얼마나 되는가?
입니다.
공식은:
Confidence(A→B) = A∩B / A
입니다.
12장 신뢰도 계산#
제공된 예제에서:
우유∩빵 = 200
우유 포함 거래 = 400
입니다.
따라서:
Confidence = 200 / 400
= 0.5
= 50%
입니다.
즉 우유를 구매한 거래 중 절반에서 빵도 구매했습니다.
핵심#
Confidence = 같이 / A
입니다.
13장 지지도와 신뢰도의 분모를 구분하자#
이 부분이 시험에서 매우 중요합니다.
Support#
같이 / 전체
Confidence#
같이 / A
입니다.
우유 → 빵이라면:
Support:
우유와 빵 / 전체 거래
Confidence:
우유와 빵 / 우유 거래
입니다.
한 줄로:
지지도는 전체, 신뢰도는 앞쪽
이라고 기억하면 쉽습니다.
14장 향상도 Lift란 무엇인가#
향상도는 A를 고려했을 때 B가 나타날 가능성이 기본적인 B 발생률에 비해 얼마나 높아지는지를 나타냅니다.
제공된 학습자료의 공식은:
Lift(A→B) = Confidence(A→B) / Support(B)
입니다.
즉:
A를 알고 있을 때의 B 확률
을:
전체에서 B가 발생하는 기본 확률
과 비교합니다.
15장 향상도 계산#
제공된 예제에서:
Confidence = 0.5
빵의 Support:
300 / 1000
= 0.3
입니다.
따라서:
Lift = 0.5 / 0.3
≈ 1.67
입니다.
해석#
Lift > 1
이므로 제공된 학습자료에서는:
양의 연관성
이라고 설명합니다.
16장 Lift 값 해석#
향상도는 1을 기준으로 해석합니다.
Lift = 1#
독립
연관성 없음
Lift > 1#
양의 연관성
함께 발생할 가능성이 높음
Lift < 1#
음의 연관성
함께 발생할 가능성이 상대적으로 낮음
입니다.
핵심#
Lift 기준값 = 1
입니다.
17장 Lift=1의 대표적인 시험 함정#
다음 문장은 틀립니다.
Lift가 1이면 두 항목 사이에 강한 양의 연관성이 존재한다.
제공된 학습자료 기준:
Lift = 1 → 독립 → 연관성 없음
입니다.
이 부분은 반드시 기억해야 합니다.
18장 연관규칙 세 지표 한 번에 비교#
| 지표 | 공식 | 핵심 의미 |
|---|---|---|
| Support | A∩B / 전체 | 전체 거래 중 함께 등장 |
| Confidence | A∩B / A | A 중 B도 발생 |
| Lift | Confidence / Support(B) | B 기본확률 대비 향상 |
암기:
Support = 같이 / 전체
Confidence = 같이 / 앞
Lift = Confidence / 뒤 항목 비율
입니다.
19장 우유 → 빵 문제 전체 풀이#
주어진 값:
전체 = 1000
우유 = 400
빵 = 300
우유∩빵 = 200
Support#
200 / 1000
= 0.20
Confidence#
200 / 400
= 0.50
Lift#
0.50 / 0.30
= 1.67
최종 해석#
지지도 = 20%
신뢰도 = 50%
향상도 = 1.67
향상도가 1보다 크므로 양의 연관성
입니다.
20장 혼동행렬 Confusion Matrix 다시 보기#
분류모델의 성능을 계산하려면 먼저 다음 네 값을 구분해야 합니다.
- TP
- FP
- FN
- TN
제공된 학습자료의 예제는 다음과 같습니다.
TP = 80
FP = 20
FN = 10
TN = 90
전체:
200개
입니다.
21장 TP란 무엇인가#
TP는 True Positive입니다.
실제 Positive인데 모델도 Positive라고 예측한 경우입니다.
예를 들어 질병 진단이라면:
실제 환자
환자로 예측
입니다.
핵심#
TP = 맞게 Positive
입니다.
22장 FP란 무엇인가#
FP는 False Positive입니다.
실제 Negative인데 모델이 Positive라고 잘못 예측한 경우입니다.
질병 사례에서는:
실제 건강함
환자로 잘못 판단
입니다.
핵심#
FP = 잘못 Positive
입니다.
23장 FN이란 무엇인가#
FN은 False Negative입니다.
실제 Positive인데 모델이 Negative라고 잘못 예측한 경우입니다.
질병 사례에서는:
실제 환자
정상이라고 판단
입니다.
핵심#
FN = 놓친 Positive
입니다.
24장 TN이란 무엇인가#
TN은 True Negative입니다.
실제 Negative이고 모델도 Negative라고 올바르게 판단한 경우입니다.
질병 사례에서는:
건강한 사람
정상으로 판단
입니다.
핵심#
TN = 맞게 Negative
입니다.
25장 혼동행렬 한눈에 보기#
| 실제 / 예측 | Positive | Negative |
|---|---|---|
| 실제 Positive | TP | FN |
| 실제 Negative | FP | TN |
이 구조를 먼저 그린 뒤 공식에 대입하면 실수를 줄일 수 있습니다.
26장 정확도 Accuracy란 무엇인가#
정확도는 전체 예측 중 올바르게 맞힌 비율입니다.
맞힌 것은:
TP
TN
입니다.
공식:
Accuracy = (TP + TN) / (TP + FP + FN + TN)
입니다.
27장 정확도 계산#
제공된 예제:
TP = 80
TN = 90
전체 = 200
따라서:
Accuracy = (80 + 90) / 200
= 170 / 200
= 0.85
즉:
85%
입니다.
핵심#
Accuracy = 전체 중 맞힌 것
입니다.
28장 정밀도 Precision이란 무엇인가#
정밀도는 모델이 Positive라고 예측한 것 중 실제로 Positive였던 비율입니다.
공식은:
Precision = TP / (TP + FP)
입니다.
분모가:
예측 Positive 전체
라는 점이 중요합니다.
질문으로 기억#
내가 Positive라고 한 것 중 진짜 Positive는?
입니다.
29장 정밀도 계산#
예제:
TP = 80
FP = 20
이므로:
Precision = 80 / (80 + 20)
= 80 / 100
= 0.80
즉:
80%
입니다.
30장 재현율 Recall이란 무엇인가#
재현율은 실제 Positive 데이터 중 모델이 얼마나 찾아냈는지 나타냅니다.
공식:
Recall = TP / (TP + FN)
입니다.
분모가:
실제 Positive 전체
라는 점이 핵심입니다.
질문으로 기억#
진짜 Positive 중 내가 얼마나 찾아냈는가?
입니다.
31장 재현율 계산#
예제:
TP = 80
FN = 10
이므로:
Recall = 80 / (80 + 10)
= 80 / 90
≈ 0.889
즉 약:
88.9%
입니다.
32장 Precision과 Recall을 혼동하지 않는 방법#
두 공식은 매우 비슷하게 보입니다.
Precision#
TP / TP+FP
FP를 봅니다.
→ 예측 Positive 기준
Recall#
TP / TP+FN
FN을 봅니다.
→ 실제 Positive 기준
암기:
Precision은 FP
Recall은 FN
이라고 기억할 수 있습니다.
33장 정밀도를 쉽게 이해하면#
모델이 100명을 환자라고 진단했습니다.
그중 실제 환자가 80명이었다면:
정밀도 = 80%
입니다.
즉:
내가 환자라고 주장한 결과가 얼마나 정확했는가?
를 보는 지표입니다.
따라서 FP가 많아질수록 Precision은 낮아집니다.
34장 재현율을 쉽게 이해하면#
실제 환자가 90명 있습니다.
모델이 그중 80명을 찾아냈다면:
Recall = 80/90
≈ 88.9%
입니다.
즉:
실제 환자를 얼마나 놓치지 않고 찾아냈는가?
를 봅니다.
따라서 FN이 많아지면 Recall이 낮아집니다.
35장 F1-Score란 무엇인가#
F1-Score는 Precision과 Recall을 함께 고려하는 지표입니다.
제공된 학습자료의 공식은:
F1 = 2 × (Precision × Recall) / (Precision + Recall)
입니다.
단순한 산술평균이 아니라 Precision과 Recall의 균형을 평가합니다.
36장 F1-Score 계산#
예제에서:
Precision = 0.80
Recall = 0.889
입니다.
공식:
F1 = 2 × (0.80 × 0.889) / (0.80 + 0.889)
계산 결과:
≈ 0.842
입니다.
즉 약:
84.2%
입니다.
37장 혼동행렬 예제 전체 풀이#
주어진 값:
TP = 80
FP = 20
FN = 10
TN = 90
전체 = 200
Accuracy#
(80 + 90) / 200
= 0.85
Precision#
80 / (80 + 20)
= 0.80
Recall#
80 / (80 + 10)
= 0.889
F1#
2 × (0.80 × 0.889) / (0.80 + 0.889)
≈ 0.842
입니다.
38장 Accuracy·Precision·Recall·F1 비교#
| 지표 | 공식 | 핵심 질문 |
|---|---|---|
| Accuracy | (TP+TN)/전체 | 전체에서 얼마나 맞혔나 |
| Precision | TP/(TP+FP) | Positive 예측 중 진짜는? |
| Recall | TP/(TP+FN) | 실제 Positive 중 찾은 것은? |
| F1 | 2PR/(P+R) | Precision·Recall 균형 |
이 표를 정확하게 기억하면 계산 문제 대부분을 해결할 수 있습니다.
39장 정밀도와 재현율은 항상 같이 올라가는가#
아닙니다.
제공된 학습자료에서는 정밀도와 재현율 사이에 Trade-off 관계가 있을 수 있다고 설명합니다.
분류 기준을 바꾸어 더 많은 데이터를 Positive로 판단하면 실제 Positive를 더 많이 찾아 Recall이 높아질 수 있습니다.
하지만 동시에 FP도 증가하면서 Precision이 낮아질 수 있습니다.
반대로 Positive 판정을 엄격하게 하면 Precision은 높아지지만 일부 Positive를 놓쳐 Recall이 낮아질 수 있습니다.
핵심#
Precision ↑ ↔ Recall ↓ 가능
입니다.
40장 Precision·Recall Trade-off를 쉽게 이해하면#
스팸 필터가 매우 엄격하다고 생각해봅시다.
조금이라도 의심되면 모두 스팸으로 처리합니다.
그러면 실제 스팸을 많이 잡을 수 있습니다.
→ Recall ↑
하지만 정상 메일까지 스팸으로 잘못 분류할 수 있습니다.
→ FP ↑
→ Precision ↓
반대로 확실한 스팸만 차단하면:
FP는 줄지만
실제 스팸을 놓치는 FN이 늘어날 수 있습니다.
이런 관계가 Precision-Recall Trade-off입니다.
41장 조건부 확률 시험 함정#
P(A|B)의 분모는 항상 전체 데이터다.
틀립니다.
조건부 확률의 분모는:
P(B)
즉 조건으로 주어진 사건 B입니다.
42장 Support 시험 함정#
Support(A→B)는 A 거래 중 A와 B가 함께 발생한 비율이다.
틀립니다.
그것은 Confidence와 연결됩니다.
Support의 분모는:
전체 거래
입니다.
43장 Confidence 시험 함정#
Confidence(A→B)는 전체 거래 중 A와 B가 함께 등장한 비율이다.
틀립니다.
그것은 Support입니다.
Confidence는:
A가 발생한 거래 중 B도 발생한 비율
입니다.
44장 Lift 시험 함정#
Lift=1이면 두 항목 사이에 강한 연관성이 있다.
틀립니다.
제공된 학습자료 기준:
Lift = 1 → 독립
입니다.
45장 Precision 시험 함정#
Precision = TP / (TP + FN)
틀립니다.
그것은 Recall입니다.
Precision은:
TP / (TP + FP)
입니다.
46장 Recall 시험 함정#
Recall = TP / (TP + FP)
틀립니다.
그것은 Precision입니다.
Recall은:
TP / (TP + FN)
입니다.
47장 F1 시험 함정#
F1은 Precision과 Recall의 단순 산술평균이다.
틀립니다.
제공된 학습자료의 공식은:
2PR / (P+R)
입니다.
시험에서는 공식을 그대로 기억하는 것이 안전합니다.
48장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 조건부 확률은 항상 전체를 분모로 사용한다#
틀립니다.
조건 사건을 분모로 사용합니다.
함정 2. Support와 Confidence의 분모는 같다#
틀립니다.
Support는 전체, Confidence는 A입니다.
함정 3. Lift=1이면 양의 연관성이다#
틀립니다.
독립입니다.
함정 4. Lift>1이면 양의 연관성이다#
맞습니다.
함정 5. Accuracy는 TP만 사용한다#
틀립니다.
TP와 TN을 함께 사용합니다.
함정 6. Precision의 분모에는 FN이 들어간다#
틀립니다.
FP가 들어갑니다.
함정 7. Recall의 분모에는 FP가 들어간다#
틀립니다.
FN이 들어갑니다.
함정 8. Precision과 Recall은 항상 함께 증가한다#
틀립니다.
Trade-off가 나타날 수 있습니다.
49장 계산 문제를 빠르게 푸는 순서#
계산 문제에서는 먼저 공식을 쓰고 숫자를 넣는 것이 좋습니다.
조건부 확률#
교집합 / 조건
연관규칙#
Support:
같이 / 전체
Confidence:
같이 / A
Lift:
Confidence / B의 Support
혼동행렬#
Accuracy:
맞은 것 / 전체
Precision:
TP / 예측 Positive
Recall:
TP / 실제 Positive
F1:
Precision과 Recall 결합
입니다.
50장 조건부 확률 시험 직전 암기#
공식:
P(A|B) = P(A∩B) / P(B)
암기:
B라는 조건 안에서 A를 찾는다
입니다.
예제:
남자 60명 중 안경 쓴 남자 24명
→ 24/60
→ 0.4
입니다.
51장 연관규칙 시험 직전 암기#
Support#
A∩B / 전체
Confidence#
A∩B / A
Lift#
Confidence / Support(B)
Lift 해석:
>1 양의 연관
=1 독립
<1 음의 연관
입니다.
52장 혼동행렬 시험 직전 암기#
Accuracy#
TP+TN / 전체
Precision#
TP / TP+FP
Recall#
TP / TP+FN
F1#
2PR / P+R
암기:
Precision = FP
Recall = FN
을 분모에 넣는다고 기억하면 쉽습니다.
53장 조건부 확률·연관성·혼동행렬 핵심 비교표#
| 영역 | 지표 | 공식 |
|---|---|---|
| 조건부 확률 | P(A|B) | P(A∩B)/P(B) |
| 연관규칙 | Support | A∩B/전체 |
| 연관규칙 | Confidence | A∩B/A |
| 연관규칙 | Lift | Confidence/Support(B) |
| 혼동행렬 | Accuracy | (TP+TN)/전체 |
| 혼동행렬 | Precision | TP/(TP+FP) |
| 혼동행렬 | Recall | TP/(TP+FN) |
| 혼동행렬 | F1 | 2PR/(P+R) |
조건부 확률과 연관성 계산 FAQ#
조건부 확률 공식은 무엇인가#
P(A|B) = P(A∩B) / P(B)
입니다.
P(A|B)는 무엇을 의미하는가#
B가 주어졌을 때 A가 발생할 확률입니다.
Support란 무엇인가#
전체 거래 중 A와 B가 함께 발생한 비율입니다.
Confidence란 무엇인가#
A가 발생한 거래 중 B도 발생한 비율입니다.
Lift란 무엇인가#
A를 조건으로 했을 때 B의 발생 가능성이 B의 기본 발생률보다 얼마나 달라지는지 나타내는 지표입니다.
Lift가 1이면 무엇을 의미하는가#
제공된 학습자료에서는 두 항목이 독립이라고 설명합니다.
Lift가 1보다 크면 무엇을 의미하는가#
양의 연관성입니다.
정확도 Accuracy 공식은 무엇인가#
(TP+TN)/(TP+FP+FN+TN)
입니다.
Precision 공식은 무엇인가#
TP/(TP+FP)
입니다.
Recall 공식은 무엇인가#
TP/(TP+FN)
입니다.
Precision과 Recall의 차이는 무엇인가#
Precision은 예측 Positive를 기준으로 하고 Recall은 실제 Positive를 기준으로 합니다.
F1-Score 공식은 무엇인가#
2 × Precision × Recall / (Precision + Recall)
입니다.
Precision과 Recall은 항상 같이 증가하는가#
아닙니다. 제공된 학습자료에서는 Trade-off 관계가 있을 수 있다고 설명합니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 조건부 확률 공식을 기억하고 있는가?
- P(A|B)에서 분모가 B라는 것을 알고 있는가?
- Support 공식을 말할 수 있는가?
- Confidence 공식을 말할 수 있는가?
- Support와 Confidence의 분모를 구분할 수 있는가?
- Lift 공식을 기억하고 있는가?
- Lift=1의 의미를 알고 있는가?
- Lift>1의 의미를 알고 있는가?
- TP·FP·FN·TN을 구분할 수 있는가?
- Accuracy 공식을 기억하고 있는가?
- Precision의 분모에 FP가 들어간다는 것을 알고 있는가?
- Recall의 분모에 FN이 들어간다는 것을 알고 있는가?
- Precision과 Recall의 차이를 설명할 수 있는가?
- F1 공식을 기억하고 있는가?
- Precision과 Recall 사이에 Trade-off가 있을 수 있다는 것을 알고 있는가?
- 숫자가 주어졌을 때 각 지표를 직접 계산할 수 있는가?
이 글을 마치며#
조건부 확률과 연관성 계산 문제는 공식을 정확히 기억하면 비교적 쉽게 해결할 수 있습니다.
조건부 확률은:
P(A|B) = P(A∩B) / P(B)
입니다.
연관규칙에서는:
Support = 같이 / 전체
Confidence = 같이 / A
Lift = Confidence / Support(B)
를 기억합니다.
Lift는:
1보다 크면 양의 연관성
1이면 독립
입니다.
혼동행렬에서는:
Accuracy = (TP+TN)/전체
Precision = TP/(TP+FP)
Recall = TP/(TP+FN)
F1 = 2PR/(P+R)
입니다.
제공된 예제에서는:
Support = 0.20
Confidence = 0.50
Lift = 1.67
이며,
TP=80, FP=20, FN=10, TN=90일 때:
Accuracy = 0.85
Precision = 0.80
Recall = 0.889
F1 = 0.842
입니다.
시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.
조건부 확률 = 교집합 / 조건
Support = 같이/전체
Confidence = 같이/A
Lift = 1이 독립, 1보다 크면 양의 연관
Precision은 FP / Recall은 FN을 분모에서 구분