조건부 확률과 연관성 계산이란? Support·Confidence·Lift·Accuracy·Precision·Recall·F1 쉽게 이해하기

1장 조건부 확률과 연관성 계산은 왜 중요한가#

ADsP에서는 복잡한 수학 문제보다는 공식을 알고 숫자를 정확하게 대입할 수 있는지를 묻는 계산 문제가 자주 등장합니다.

제공된 학습자료에서 특히 빈출이라고 제시한 것은 다음 세 가지입니다.

  • 조건부 확률
  • 연관규칙의 지지도·신뢰도·향상도
  • 혼동행렬의 정확도·정밀도·재현율·F1-Score

이 문제들은 공식을 정확히 구분하면 비교적 쉽게 풀 수 있습니다.

가장 중요한 것은 분모를 무엇으로 잡는지입니다.

예를 들어:

지지도 → 전체 거래

신뢰도 → 선행항목 A

정밀도 → 예측 Positive

재현율 → 실제 Positive

처럼 분모를 구분해야 합니다.


2장 조건부 확률 Conditional Probability이란 무엇인가#

조건부 확률은 어떤 사건이 이미 발생했다는 조건에서 다른 사건이 발생할 확률입니다.

공식은 다음과 같습니다.

P(A|B) = P(A ∩ B) / P(B)

P(A|B)는:

B가 발생했다는 조건에서 A가 발생할 확률

을 의미합니다.

핵심#

조건부 확률 = 동시에 발생 / 조건이 되는 사건

입니다.


3장 P(A|B)의 기호를 읽는 방법#

P(A|B)에서 세로줄 |는:

B가 주어졌을 때

라고 읽습니다.

따라서:

P(A|B)

는:

B가 주어졌을 때 A의 확률

입니다.

순서를 바꾸면 의미도 달라집니다.

P(A|B)와 P(B|A)는 일반적으로 같은 값이 아닙니다.


4장 조건부 확률 예제#

제공된 학습자료의 예제를 보겠습니다.

전체 사람:

100명

남자:

60명

안경을 쓴 남자:

24명

질문은:

남자라는 조건에서 안경을 쓴 사람의 비율은?

입니다.

즉:

P(안경 | 남자)

를 구합니다.

공식에 대입하면:

24 / 60 = 0.4

입니다.

따라서 확률은:

0.4 = 40%

입니다.


5장 왜 24/100이 아닌가#

조건부 확률 문제에서 가장 중요한 부분입니다.

질문이:

전체 사람 중 안경 쓴 남자는 몇 %인가?

라면:

24 / 100

을 생각할 수 있습니다.

하지만 질문은:

남자 중에서 안경 쓴 사람은 몇 %인가?

입니다.

이미 남자 60명으로 범위가 제한되었습니다.

따라서 분모는 전체 100명이 아니라:

남자 60명

입니다.

핵심#

조건이 붙으면 분모가 바뀐다

고 기억하면 됩니다.


6장 조건부 확률과 베이즈 정리의 관계#

앞에서 나이브 베이즈를 공부하면서 다음 공식을 살펴봤습니다.

P(A|B)

조건부 확률은 베이즈 정리에서도 핵심적으로 사용됩니다.

조건부 확률 자체의 기본 공식은:

P(A|B) = P(A ∩ B) / P(B)

이고,

베이즈 정리는 조건부 확률들의 관계를 이용해 사후확률을 계산합니다.

시험에서는 두 공식을 서로 혼동하지 않는 것이 중요합니다.


7장 연관규칙분석에서 무엇을 계산하는가#

연관규칙분석 Association Rule Analysis은 어떤 항목들이 함께 등장하는 패턴을 찾는 방법입니다.

대표적인 예가 장바구니 분석입니다.

예:

우유 → 빵

이라는 규칙이 있다고 하겠습니다.

이 규칙을 평가하는 대표적인 지표는:

  • 지지도 Support
  • 신뢰도 Confidence
  • 향상도 Lift

입니다.

이 세 지표의 공식을 반드시 구분해야 합니다.


8장 연관규칙 계산 예제#

제공된 학습자료의 데이터를 그대로 사용해보겠습니다.

전체 거래:

1,000건

우유 포함 거래:

400건

빵 포함 거래:

300건

우유와 빵을 모두 포함:

200건

규칙:

우유 → 빵

입니다.

이제 Support, Confidence, Lift를 하나씩 계산합니다.


9장 지지도 Support란 무엇인가#

지지도는 전체 거래 중에서 A와 B가 함께 등장한 거래의 비율입니다.

공식은:

Support(A→B) = A∩B / 전체 거래

입니다.

제공된 예제에서는:

우유∩빵 = 200

전체 거래 = 1000

이므로:

Support = 200 / 1000

= 0.2

= 20%

입니다.

핵심#

Support = 같이 / 전체

입니다.


10장 지지도는 무엇을 의미하는가#

지지도 20%라는 것은 전체 거래 1,000건 가운데 **우유와 빵이 함께 등장한 거래가 20%**라는 의미입니다.

즉 해당 조합이 전체 데이터에서 얼마나 자주 등장하는지를 보여줍니다.

시험에서는 분모가:

전체 거래

라는 점이 가장 중요합니다.


11장 신뢰도 Confidence란 무엇인가#

신뢰도는 A를 구매한 거래 중 B도 구매한 비율입니다.

규칙이:

우유 → 빵

이라면 질문은:

우유를 산 사람 중 빵도 산 사람은 얼마나 되는가?

입니다.

공식은:

Confidence(A→B) = A∩B / A

입니다.


12장 신뢰도 계산#

제공된 예제에서:

우유∩빵 = 200

우유 포함 거래 = 400

입니다.

따라서:

Confidence = 200 / 400

= 0.5

= 50%

입니다.

즉 우유를 구매한 거래 중 절반에서 빵도 구매했습니다.

핵심#

Confidence = 같이 / A

입니다.


13장 지지도와 신뢰도의 분모를 구분하자#

이 부분이 시험에서 매우 중요합니다.

Support#

같이 / 전체

Confidence#

같이 / A

입니다.

우유 → 빵이라면:

Support:

우유와 빵 / 전체 거래

Confidence:

우유와 빵 / 우유 거래

입니다.

한 줄로:

지지도는 전체, 신뢰도는 앞쪽

이라고 기억하면 쉽습니다.


14장 향상도 Lift란 무엇인가#

향상도는 A를 고려했을 때 B가 나타날 가능성이 기본적인 B 발생률에 비해 얼마나 높아지는지를 나타냅니다.

제공된 학습자료의 공식은:

Lift(A→B) = Confidence(A→B) / Support(B)

입니다.

즉:

A를 알고 있을 때의 B 확률

을:

전체에서 B가 발생하는 기본 확률

과 비교합니다.


15장 향상도 계산#

제공된 예제에서:

Confidence = 0.5

빵의 Support:

300 / 1000

= 0.3

입니다.

따라서:

Lift = 0.5 / 0.3

≈ 1.67

입니다.

해석#

Lift > 1

이므로 제공된 학습자료에서는:

양의 연관성

이라고 설명합니다.


16장 Lift 값 해석#

향상도는 1을 기준으로 해석합니다.

Lift = 1#

독립

연관성 없음

Lift > 1#

양의 연관성

함께 발생할 가능성이 높음

Lift < 1#

음의 연관성

함께 발생할 가능성이 상대적으로 낮음

입니다.

핵심#

Lift 기준값 = 1

입니다.


17장 Lift=1의 대표적인 시험 함정#

다음 문장은 틀립니다.

Lift가 1이면 두 항목 사이에 강한 양의 연관성이 존재한다.

제공된 학습자료 기준:

Lift = 1 → 독립 → 연관성 없음

입니다.

이 부분은 반드시 기억해야 합니다.


18장 연관규칙 세 지표 한 번에 비교#

지표 공식 핵심 의미
Support A∩B / 전체 전체 거래 중 함께 등장
Confidence A∩B / A A 중 B도 발생
Lift Confidence / Support(B) B 기본확률 대비 향상

암기:

Support = 같이 / 전체

Confidence = 같이 / 앞

Lift = Confidence / 뒤 항목 비율

입니다.


19장 우유 → 빵 문제 전체 풀이#

주어진 값:

전체 = 1000

우유 = 400

빵 = 300

우유∩빵 = 200

Support#

200 / 1000

= 0.20

Confidence#

200 / 400

= 0.50

Lift#

0.50 / 0.30

= 1.67

최종 해석#

지지도 = 20%

신뢰도 = 50%

향상도 = 1.67

향상도가 1보다 크므로 양의 연관성

입니다.


20장 혼동행렬 Confusion Matrix 다시 보기#

분류모델의 성능을 계산하려면 먼저 다음 네 값을 구분해야 합니다.

  • TP
  • FP
  • FN
  • TN

제공된 학습자료의 예제는 다음과 같습니다.

TP = 80

FP = 20

FN = 10

TN = 90

전체:

200개

입니다.


21장 TP란 무엇인가#

TP는 True Positive입니다.

실제 Positive인데 모델도 Positive라고 예측한 경우입니다.

예를 들어 질병 진단이라면:

실제 환자

환자로 예측

입니다.

핵심#

TP = 맞게 Positive

입니다.


22장 FP란 무엇인가#

FP는 False Positive입니다.

실제 Negative인데 모델이 Positive라고 잘못 예측한 경우입니다.

질병 사례에서는:

실제 건강함

환자로 잘못 판단

입니다.

핵심#

FP = 잘못 Positive

입니다.


23장 FN이란 무엇인가#

FN은 False Negative입니다.

실제 Positive인데 모델이 Negative라고 잘못 예측한 경우입니다.

질병 사례에서는:

실제 환자

정상이라고 판단

입니다.

핵심#

FN = 놓친 Positive

입니다.


24장 TN이란 무엇인가#

TN은 True Negative입니다.

실제 Negative이고 모델도 Negative라고 올바르게 판단한 경우입니다.

질병 사례에서는:

건강한 사람

정상으로 판단

입니다.

핵심#

TN = 맞게 Negative

입니다.


25장 혼동행렬 한눈에 보기#

실제 / 예측 Positive Negative
실제 Positive TP FN
실제 Negative FP TN

이 구조를 먼저 그린 뒤 공식에 대입하면 실수를 줄일 수 있습니다.


26장 정확도 Accuracy란 무엇인가#

정확도는 전체 예측 중 올바르게 맞힌 비율입니다.

맞힌 것은:

TP

TN

입니다.

공식:

Accuracy = (TP + TN) / (TP + FP + FN + TN)

입니다.


27장 정확도 계산#

제공된 예제:

TP = 80

TN = 90

전체 = 200

따라서:

Accuracy = (80 + 90) / 200

= 170 / 200

= 0.85

즉:

85%

입니다.

핵심#

Accuracy = 전체 중 맞힌 것

입니다.


28장 정밀도 Precision이란 무엇인가#

정밀도는 모델이 Positive라고 예측한 것 중 실제로 Positive였던 비율입니다.

공식은:

Precision = TP / (TP + FP)

입니다.

분모가:

예측 Positive 전체

라는 점이 중요합니다.

질문으로 기억#

내가 Positive라고 한 것 중 진짜 Positive는?

입니다.


29장 정밀도 계산#

예제:

TP = 80

FP = 20

이므로:

Precision = 80 / (80 + 20)

= 80 / 100

= 0.80

즉:

80%

입니다.


30장 재현율 Recall이란 무엇인가#

재현율은 실제 Positive 데이터 중 모델이 얼마나 찾아냈는지 나타냅니다.

공식:

Recall = TP / (TP + FN)

입니다.

분모가:

실제 Positive 전체

라는 점이 핵심입니다.

질문으로 기억#

진짜 Positive 중 내가 얼마나 찾아냈는가?

입니다.


31장 재현율 계산#

예제:

TP = 80

FN = 10

이므로:

Recall = 80 / (80 + 10)

= 80 / 90

≈ 0.889

즉 약:

88.9%

입니다.


32장 Precision과 Recall을 혼동하지 않는 방법#

두 공식은 매우 비슷하게 보입니다.

Precision#

TP / TP+FP

FP를 봅니다.

→ 예측 Positive 기준

Recall#

TP / TP+FN

FN을 봅니다.

→ 실제 Positive 기준

암기:

Precision은 FP

Recall은 FN

이라고 기억할 수 있습니다.


33장 정밀도를 쉽게 이해하면#

모델이 100명을 환자라고 진단했습니다.

그중 실제 환자가 80명이었다면:

정밀도 = 80%

입니다.

즉:

내가 환자라고 주장한 결과가 얼마나 정확했는가?

를 보는 지표입니다.

따라서 FP가 많아질수록 Precision은 낮아집니다.


34장 재현율을 쉽게 이해하면#

실제 환자가 90명 있습니다.

모델이 그중 80명을 찾아냈다면:

Recall = 80/90

≈ 88.9%

입니다.

즉:

실제 환자를 얼마나 놓치지 않고 찾아냈는가?

를 봅니다.

따라서 FN이 많아지면 Recall이 낮아집니다.


35장 F1-Score란 무엇인가#

F1-Score는 Precision과 Recall을 함께 고려하는 지표입니다.

제공된 학습자료의 공식은:

F1 = 2 × (Precision × Recall) / (Precision + Recall)

입니다.

단순한 산술평균이 아니라 Precision과 Recall의 균형을 평가합니다.


36장 F1-Score 계산#

예제에서:

Precision = 0.80

Recall = 0.889

입니다.

공식:

F1 = 2 × (0.80 × 0.889) / (0.80 + 0.889)

계산 결과:

≈ 0.842

입니다.

즉 약:

84.2%

입니다.


37장 혼동행렬 예제 전체 풀이#

주어진 값:

TP = 80

FP = 20

FN = 10

TN = 90

전체 = 200

Accuracy#

(80 + 90) / 200

= 0.85

Precision#

80 / (80 + 20)

= 0.80

Recall#

80 / (80 + 10)

= 0.889

F1#

2 × (0.80 × 0.889) / (0.80 + 0.889)

≈ 0.842

입니다.


38장 Accuracy·Precision·Recall·F1 비교#

지표 공식 핵심 질문
Accuracy (TP+TN)/전체 전체에서 얼마나 맞혔나
Precision TP/(TP+FP) Positive 예측 중 진짜는?
Recall TP/(TP+FN) 실제 Positive 중 찾은 것은?
F1 2PR/(P+R) Precision·Recall 균형

이 표를 정확하게 기억하면 계산 문제 대부분을 해결할 수 있습니다.


39장 정밀도와 재현율은 항상 같이 올라가는가#

아닙니다.

제공된 학습자료에서는 정밀도와 재현율 사이에 Trade-off 관계가 있을 수 있다고 설명합니다.

분류 기준을 바꾸어 더 많은 데이터를 Positive로 판단하면 실제 Positive를 더 많이 찾아 Recall이 높아질 수 있습니다.

하지만 동시에 FP도 증가하면서 Precision이 낮아질 수 있습니다.

반대로 Positive 판정을 엄격하게 하면 Precision은 높아지지만 일부 Positive를 놓쳐 Recall이 낮아질 수 있습니다.

핵심#

Precision ↑ ↔ Recall ↓ 가능

입니다.


40장 Precision·Recall Trade-off를 쉽게 이해하면#

스팸 필터가 매우 엄격하다고 생각해봅시다.

조금이라도 의심되면 모두 스팸으로 처리합니다.

그러면 실제 스팸을 많이 잡을 수 있습니다.

→ Recall ↑

하지만 정상 메일까지 스팸으로 잘못 분류할 수 있습니다.

→ FP ↑

→ Precision ↓

반대로 확실한 스팸만 차단하면:

FP는 줄지만

실제 스팸을 놓치는 FN이 늘어날 수 있습니다.

이런 관계가 Precision-Recall Trade-off입니다.


41장 조건부 확률 시험 함정#

P(A|B)의 분모는 항상 전체 데이터다.

틀립니다.

조건부 확률의 분모는:

P(B)

즉 조건으로 주어진 사건 B입니다.


42장 Support 시험 함정#

Support(A→B)는 A 거래 중 A와 B가 함께 발생한 비율이다.

틀립니다.

그것은 Confidence와 연결됩니다.

Support의 분모는:

전체 거래

입니다.


43장 Confidence 시험 함정#

Confidence(A→B)는 전체 거래 중 A와 B가 함께 등장한 비율이다.

틀립니다.

그것은 Support입니다.

Confidence는:

A가 발생한 거래 중 B도 발생한 비율

입니다.


44장 Lift 시험 함정#

Lift=1이면 두 항목 사이에 강한 연관성이 있다.

틀립니다.

제공된 학습자료 기준:

Lift = 1 → 독립

입니다.


45장 Precision 시험 함정#

Precision = TP / (TP + FN)

틀립니다.

그것은 Recall입니다.

Precision은:

TP / (TP + FP)

입니다.


46장 Recall 시험 함정#

Recall = TP / (TP + FP)

틀립니다.

그것은 Precision입니다.

Recall은:

TP / (TP + FN)

입니다.


47장 F1 시험 함정#

F1은 Precision과 Recall의 단순 산술평균이다.

틀립니다.

제공된 학습자료의 공식은:

2PR / (P+R)

입니다.

시험에서는 공식을 그대로 기억하는 것이 안전합니다.


48장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 조건부 확률은 항상 전체를 분모로 사용한다#

틀립니다.

조건 사건을 분모로 사용합니다.

함정 2. Support와 Confidence의 분모는 같다#

틀립니다.

Support는 전체, Confidence는 A입니다.

함정 3. Lift=1이면 양의 연관성이다#

틀립니다.

독립입니다.

함정 4. Lift>1이면 양의 연관성이다#

맞습니다.

함정 5. Accuracy는 TP만 사용한다#

틀립니다.

TP와 TN을 함께 사용합니다.

함정 6. Precision의 분모에는 FN이 들어간다#

틀립니다.

FP가 들어갑니다.

함정 7. Recall의 분모에는 FP가 들어간다#

틀립니다.

FN이 들어갑니다.

함정 8. Precision과 Recall은 항상 함께 증가한다#

틀립니다.

Trade-off가 나타날 수 있습니다.


49장 계산 문제를 빠르게 푸는 순서#

계산 문제에서는 먼저 공식을 쓰고 숫자를 넣는 것이 좋습니다.

조건부 확률#

교집합 / 조건

연관규칙#

Support:

같이 / 전체

Confidence:

같이 / A

Lift:

Confidence / B의 Support

혼동행렬#

Accuracy:

맞은 것 / 전체

Precision:

TP / 예측 Positive

Recall:

TP / 실제 Positive

F1:

Precision과 Recall 결합

입니다.


50장 조건부 확률 시험 직전 암기#

공식:

P(A|B) = P(A∩B) / P(B)

암기:

B라는 조건 안에서 A를 찾는다

입니다.

예제:

남자 60명 중 안경 쓴 남자 24명

→ 24/60

→ 0.4

입니다.


51장 연관규칙 시험 직전 암기#

Support#

A∩B / 전체

Confidence#

A∩B / A

Lift#

Confidence / Support(B)

Lift 해석:

>1 양의 연관

=1 독립

<1 음의 연관

입니다.


52장 혼동행렬 시험 직전 암기#

Accuracy#

TP+TN / 전체

Precision#

TP / TP+FP

Recall#

TP / TP+FN

F1#

2PR / P+R

암기:

Precision = FP

Recall = FN

을 분모에 넣는다고 기억하면 쉽습니다.


53장 조건부 확률·연관성·혼동행렬 핵심 비교표#

영역 지표 공식
조건부 확률 P(A|B) P(A∩B)/P(B)
연관규칙 Support A∩B/전체
연관규칙 Confidence A∩B/A
연관규칙 Lift Confidence/Support(B)
혼동행렬 Accuracy (TP+TN)/전체
혼동행렬 Precision TP/(TP+FP)
혼동행렬 Recall TP/(TP+FN)
혼동행렬 F1 2PR/(P+R)

조건부 확률과 연관성 계산 FAQ#

조건부 확률 공식은 무엇인가#

P(A|B) = P(A∩B) / P(B)

입니다.

P(A|B)는 무엇을 의미하는가#

B가 주어졌을 때 A가 발생할 확률입니다.

Support란 무엇인가#

전체 거래 중 A와 B가 함께 발생한 비율입니다.

Confidence란 무엇인가#

A가 발생한 거래 중 B도 발생한 비율입니다.

Lift란 무엇인가#

A를 조건으로 했을 때 B의 발생 가능성이 B의 기본 발생률보다 얼마나 달라지는지 나타내는 지표입니다.

Lift가 1이면 무엇을 의미하는가#

제공된 학습자료에서는 두 항목이 독립이라고 설명합니다.

Lift가 1보다 크면 무엇을 의미하는가#

양의 연관성입니다.

정확도 Accuracy 공식은 무엇인가#

(TP+TN)/(TP+FP+FN+TN)

입니다.

Precision 공식은 무엇인가#

TP/(TP+FP)

입니다.

Recall 공식은 무엇인가#

TP/(TP+FN)

입니다.

Precision과 Recall의 차이는 무엇인가#

Precision은 예측 Positive를 기준으로 하고 Recall은 실제 Positive를 기준으로 합니다.

F1-Score 공식은 무엇인가#

2 × Precision × Recall / (Precision + Recall)

입니다.

Precision과 Recall은 항상 같이 증가하는가#

아닙니다. 제공된 학습자료에서는 Trade-off 관계가 있을 수 있다고 설명합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 조건부 확률 공식을 기억하고 있는가?
  2. P(A|B)에서 분모가 B라는 것을 알고 있는가?
  3. Support 공식을 말할 수 있는가?
  4. Confidence 공식을 말할 수 있는가?
  5. Support와 Confidence의 분모를 구분할 수 있는가?
  6. Lift 공식을 기억하고 있는가?
  7. Lift=1의 의미를 알고 있는가?
  8. Lift>1의 의미를 알고 있는가?
  9. TP·FP·FN·TN을 구분할 수 있는가?
  10. Accuracy 공식을 기억하고 있는가?
  11. Precision의 분모에 FP가 들어간다는 것을 알고 있는가?
  12. Recall의 분모에 FN이 들어간다는 것을 알고 있는가?
  13. Precision과 Recall의 차이를 설명할 수 있는가?
  14. F1 공식을 기억하고 있는가?
  15. Precision과 Recall 사이에 Trade-off가 있을 수 있다는 것을 알고 있는가?
  16. 숫자가 주어졌을 때 각 지표를 직접 계산할 수 있는가?

이 글을 마치며#

조건부 확률과 연관성 계산 문제는 공식을 정확히 기억하면 비교적 쉽게 해결할 수 있습니다.

조건부 확률은:

P(A|B) = P(A∩B) / P(B)

입니다.

연관규칙에서는:

Support = 같이 / 전체

Confidence = 같이 / A

Lift = Confidence / Support(B)

를 기억합니다.

Lift는:

1보다 크면 양의 연관성

1이면 독립

입니다.

혼동행렬에서는:

Accuracy = (TP+TN)/전체

Precision = TP/(TP+FP)

Recall = TP/(TP+FN)

F1 = 2PR/(P+R)

입니다.

제공된 예제에서는:

Support = 0.20

Confidence = 0.50

Lift = 1.67

이며,

TP=80, FP=20, FN=10, TN=90일 때:

Accuracy = 0.85

Precision = 0.80

Recall = 0.889

F1 = 0.842

입니다.

시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.

조건부 확률 = 교집합 / 조건

Support = 같이/전체

Confidence = 같이/A

Lift = 1이 독립, 1보다 크면 양의 연관

Precision은 FP / Recall은 FN을 분모에서 구분

이 페이지의 목차