연관규칙분석이란? Apriori·지지도·신뢰도·향상도 계산과 해석 쉽게 이해하기

1장 연관규칙분석이란 무엇인가#

연관규칙분석 Association Rule Analysis은 여러 항목 가운데 어떤 항목들이 함께 나타나는 경향이 있는지 찾는 분석방법입니다.

가장 대표적인 예가 장바구니 분석입니다.

마트 고객의 구매 데이터를 보고 다음과 같은 질문을 할 수 있습니다.

맥주를 산 사람은 땅콩도 자주 사는가?

빵을 산 고객은 우유도 함께 사는가?

초콜릿을 구매한 고객은 일반 고객보다 우유를 더 많이 구매하는가?

이처럼 항목 사이의 동시 발생 패턴을 찾는 것이 연관규칙분석입니다.


2장 연관규칙을 쉽게 이해하면#

연관규칙은 보통 다음과 같은 형태로 표현합니다.

A → B

이는:

A가 발생한 경우 B도 함께 발생하는 경향이 있는가?

를 의미합니다.

예를 들어:

빵 → 버터

라는 규칙이 있다고 하겠습니다.

이는:

빵을 구매한 고객이 버터도 함께 구매하는 경향이 있는가?

를 분석하는 것입니다.

다만 단순히 같이 구매한 횟수만 봐서는 좋은 규칙인지 판단하기 어렵습니다.

그래서 연관규칙분석에서는 대표적으로 세 가지 지표를 사용합니다.

  • 지지도 Support
  • 신뢰도 Confidence
  • 향상도 Lift

3장 장바구니 분석이 대표 사례인 이유#

온라인 쇼핑몰이나 마트에는 고객별 구매내역이 있습니다.

예를 들어 다음과 같습니다.

고객 구매상품
A 빵, 우유
B 빵, 버터
C 빵, 우유, 버터
D 우유
E 빵, 버터

이런 데이터를 분석하면:

  • 어떤 상품이 자주 팔리는가
  • 어떤 상품들이 함께 구매되는가
  • 특정 상품 구매가 다른 상품 구매와 관련되어 있는가

를 확인할 수 있습니다.

연관규칙분석은 바로 이런 동시 구매 패턴을 찾는 데 활용됩니다.


4장 Apriori 알고리즘이란 무엇인가#

Apriori 알고리즘은 연관규칙을 탐색하기 위한 대표적인 알고리즘입니다.

제공된 ADsP 학습자료에서는 Apriori의 핵심을:

최소 지지도를 기준으로 빈발항목집합을 찾는다

라고 설명합니다.

즉 모든 상품 조합을 끝까지 조사하는 것이 아니라 일정 수준 이상 자주 나타나는 항목 조합을 중심으로 탐색합니다.


5장 빈발항목집합이란 무엇인가#

빈발항목집합 Frequent Itemset은 거래 데이터에서 일정 횟수 이상 자주 함께 나타나는 항목들의 집합입니다.

예를 들어 100건의 거래 중:

빵 + 우유

조합이 40번 나타났다면 비교적 자주 나타나는 조합일 수 있습니다.

반면:

빵 + 세제 + 칫솔 + 수박

조합이 단 한 번밖에 나오지 않았다면 분석 가치가 낮을 수 있습니다.

Apriori는 이런 항목 조합을 최소 지지도를 이용해 걸러냅니다.


6장 최소 지지도란 무엇인가#

최소 지지도 Minimum Support는:

어느 정도 이상 자주 발생해야 의미 있는 항목집합으로 볼 것인가?

를 정하는 기준입니다.

제공된 학습자료에서 중요한 점은:

최소 지지도는 분석자가 설정

한다는 것입니다.

예를 들어 최소 지지도를 20%로 설정했다면 전체 거래의 20% 미만에서 나타나는 항목집합은 후보에서 제외할 수 있습니다.


7장 Apriori 알고리즘의 전체 과정#

제공된 학습자료에서는 Apriori를 다음 네 단계로 정리합니다.

1단계 최소 지지도 설정#

분석자가 기준값을 정합니다.

2단계 빈발항목집합 탐색#

최소 지지도 이상인 항목집합을 추출합니다.

3단계 연관규칙 생성#

빈발항목집합을 이용해 규칙을 만들고 신뢰도를 계산합니다.

4단계 규칙 평가#

향상도를 이용해 규칙이 실제로 유용한 관계인지 확인합니다.

즉:

지지도 기준 설정 → 자주 나오는 조합 찾기 → 규칙 만들기 → Lift로 관계 평가

의 흐름입니다.


8장 Apriori가 효율적인 이유#

상품이 많아지면 가능한 상품 조합 수가 매우 빠르게 증가합니다.

모든 조합을 끝까지 계산하면 불필요한 계산이 많아집니다.

제공된 학습자료에서는 Apriori가:

최소 지지도를 이용해 후보 항목집합을 줄여 탐색 효율을 높인다

는 점을 강조합니다.

즉 너무 드물게 등장하는 조합을 조기에 제외해 탐색해야 할 후보 수를 줄입니다.


9장 지지도 Support란 무엇인가#

지지도는 특정 항목들이 전체 거래에서 얼마나 자주 함께 나타나는지를 나타냅니다.

A → B 규칙의 지지도는:

Support(A→B) = (A∩B) / 전체 거래

입니다.

여기서 A∩B는 A와 B가 동시에 발생한 거래를 의미합니다.


10장 지지도를 쉽게 이해하면#

빵과 버터의 구매 패턴을 분석한다고 하겠습니다.

전체 고객:

100명

빵과 버터를 모두 산 고객:

20명

이라면:

Support = 20 / 100

= 0.20

= 20%

입니다.

즉:

전체 거래 중 20%에서 빵과 버터가 함께 나타났다.

는 뜻입니다.

핵심#

Support = 전체 중 같이 나온 비율

입니다.


11장 지지도의 분모는 무엇인가#

시험에서 중요한 부분입니다.

지지도는:

A와 B를 모두 산 사람 / 전체 거래

입니다.

분모가 A를 산 사람 수가 아닙니다.

즉:

Support 분모 = 전체

입니다.


12장 신뢰도 Confidence란 무엇인가#

신뢰도는 A가 발생했을 때 B도 함께 발생한 비율입니다.

공식은:

Confidence(A→B) = (A∩B) / A

입니다.

즉 A를 기준으로 봅니다.

쉽게 말하면:

A를 한 사람 가운데 B도 한 사람이 몇 %인가?

입니다.


13장 신뢰도를 쉽게 이해하면#

빵을 산 고객:

50명

빵과 버터를 함께 산 고객:

20명

이라고 하겠습니다.

신뢰도는:

20 / 50

= 0.4

= 40%

입니다.

따라서:

빵을 산 사람 중 40%가 버터도 구매했다.

라고 해석합니다.

핵심#

Confidence = A를 한 사람 중 B도 한 비율

입니다.


14장 Support와 Confidence의 차이#

두 지표를 혼동하기 쉽습니다.

Support#

분모:

전체 거래

질문:

전체에서 A와 B가 얼마나 자주 같이 나타났나?

Confidence#

분모:

A가 발생한 거래

질문:

A가 발생했을 때 B도 얼마나 자주 발생했나?

한 줄로:

Support = 전체 기준

Confidence = A 기준

입니다.


15장 같은 데이터로 두 지표 계산하기#

전체 거래가 100건이라고 하겠습니다.

A 구매:

50건

A와 B 동시 구매:

20건

이라면:

Support#

20 / 100

= 0.20

Confidence#

20 / 50

= 0.40

입니다.

같은 20건을 사용하지만 분모가 다르기 때문에 결과가 다릅니다.


16장 향상도 Lift란 무엇인가#

향상도 Lift는 A가 발생했을 때 B가 나타나는 비율이 B의 일반적인 발생 비율보다 얼마나 높은지 비교하는 지표입니다.

제공된 학습자료의 공식은:

Lift(A→B) = Confidence(A→B) / Support(B)

입니다.

즉:

A를 조건으로 했을 때 B의 발생률

을:

전체에서 B가 나타나는 비율

과 비교합니다.


17장 향상도를 쉽게 이해하면#

제공된 학습자료에서는 Lift를 쉽게:

우연보다 얼마나 더 같이 나타나는가?

라고 설명합니다.

예를 들어 전체 고객 중 우유를 사는 사람이 20%인데 초콜릿을 산 사람 중에서는 우유를 사는 사람이 60%라고 하겠습니다.

그러면:

Lift = 0.60 / 0.20

= 3

입니다.

즉 초콜릿 구매 고객은 일반적인 고객에 비해 우유를 구매하는 오즈가 아니라 구매 비율이 기준보다 3배 수준으로 나타난 규칙으로 해석할 수 있습니다.


18장 향상도의 기준은 1이다#

ADsP에서 가장 중요한 향상도 기준입니다.

Lift = 1#

독립

즉 특별한 관계가 없습니다.

Lift > 1#

양의 관계

함께 발생하는 경향이 있습니다.

Lift < 1#

음의 관계

함께 발생하기보다 반대되는 경향 또는 대체 관계로 볼 수 있습니다.

핵심#

Lift의 기준선은 1

입니다.


19장 Lift = 1은 무엇을 의미하는가#

향상도가 정확히 1이라면:

A가 발생했을 때 B가 발생하는 비율이 전체 B 발생률과 동일하다.

는 의미입니다.

즉 A가 B 발생에 특별한 연관성을 보여주지 않습니다.

제공된 학습자료에서는 이를:

독립

이라고 정리합니다.

시험 핵심#

Lift = 1 → 관계 없음

입니다.


20장 Lift > 1의 의미#

향상도가 1보다 크면 A와 B가 함께 나타나는 경향이 상대적으로 강합니다.

예:

Lift = 3

이라면 제공된 학습자료 사례에서는:

A 조건에서 B가 일반적인 경우보다 3배 높은 수준으로 나타난다.

는 의미로 해석합니다.

핵심#

Lift > 1 → 양의 상관관계

입니다.


21장 Lift < 1의 의미#

향상도가 1보다 작으면 A가 발생했을 때 B가 일반적인 경우보다 덜 나타납니다.

제공된 학습자료에서는 이를:

음의 상관관계 또는 대체 관계

라고 설명합니다.

예를 들어 고객이 상품 A를 구매하면 상품 B를 잘 구매하지 않는 패턴이 있을 수 있습니다.

핵심#

Lift < 1 → 음의 관계

입니다.


22장 향상도의 또 다른 공식#

제공된 학습자료에서는 Lift를 다음과 같이도 표현합니다.

Lift = P(A∩B) / [P(A) × P(B)]

이는 A와 B가 실제로 함께 발생하는 확률을 두 사건이 독립이라고 가정했을 때의 확률과 비교하는 형태입니다.

따라서 향상도가 1이라는 것은:

P(A∩B) = P(A) × P(B)

와 연결되어 A와 B가 독립적인 상태라고 이해할 수 있습니다.


23장 초콜릿과 우유 예제로 전체 계산하기#

제공된 학습자료의 예를 살펴보겠습니다.

전체 고객:

100명

초콜릿 구매:

50명

초콜릿 + 우유 구매:

30명

전체 우유 구매율:

20%

입니다.

지지도#

초콜릿과 우유를 모두 산 사람:

30명

전체:

100명

따라서:

Support = 30 / 100 = 0.30

즉 30%입니다.


24장 초콜릿과 우유의 신뢰도 계산#

초콜릿 구매자:

50명

초콜릿과 우유 동시 구매자:

30명

이므로:

Confidence = 30 / 50

= 0.60

= 60%

입니다.

즉:

초콜릿을 산 사람의 60%가 우유도 구매했다.

는 의미입니다.


25장 초콜릿과 우유의 향상도 계산#

초콜릿 구매 고객의 우유 구매율:

60%

전체 고객의 우유 구매율:

20%

이므로:

Lift = 0.60 / 0.20

= 3.0

입니다.

제공된 학습자료에서는 이를:

초콜릿을 산 사람이 우유를 구매할 비율이 일반적인 경우보다 3배 높다.

는 의미로 설명합니다.


26장 Support·Confidence·Lift를 하나의 예제로 정리하면#

전체 거래:

100

A 구매:

50

B 구매:

20

A와 B 동시 구매:

10

이라고 하겠습니다.

Support#

10 / 100

= 0.10

Confidence#

10 / 50

= 0.20

Lift#

0.20 / 0.20

= 1

입니다.

따라서 이 사례에서는 A와 B가 독립적인 관계라고 해석합니다.


27장 신뢰도가 높으면 무조건 좋은 규칙인가#

신뢰도만 높다고 해서 항상 강한 연관성이 있다고 판단하기는 어렵습니다.

예를 들어 B라는 상품이 모든 고객의 95%가 구매하는 인기상품이라고 하겠습니다.

A를 구매한 사람 중 B 구매율이 96%라고 해도 특별히 A 때문에 B를 많이 산 것인지 판단하기 어렵습니다.

이때 Lift를 보면:

0.96 / 0.95

처럼 1에 가까운 값이 나올 수 있습니다.

즉 B 자체가 원래 매우 많이 팔리는 상품일 수 있습니다.

그래서 제공된 학습자료에서는 향상도를 이용해 실질적인 유용성을 확인합니다.


28장 지지도는 왜 필요한가#

신뢰도가 높더라도 실제로 해당 조합이 거의 등장하지 않는다면 실용적인 가치가 낮을 수 있습니다.

예를 들어:

A를 구매한 고객이 단 2명뿐인데 그 2명이 모두 B를 구매했다면 Confidence는 100%입니다.

하지만 전체 거래에서 이 조합이 거의 나타나지 않는다면 일반적인 패턴으로 보기 어려울 수 있습니다.

그래서 Apriori에서는 먼저 최소 지지도를 통해 자주 나타나는 항목집합을 찾습니다.


29장 세 지표가 각각 답하는 질문#

Support#

이 조합이 전체에서 얼마나 자주 등장하는가?

Confidence#

A가 발생했을 때 B도 얼마나 자주 발생하는가?

Lift#

B가 원래 발생하는 수준보다 A와 함께 있을 때 얼마나 더 많이 나타나는가?

이 세 질문을 기억하면 공식을 외우지 않아도 의미를 복원하기 쉽습니다.


30장 지지도와 신뢰도 공식 암기법#

지지도#

같이 / 전체

즉:

(A∩B) / 전체

신뢰도#

같이 / A

즉:

(A∩B) / A

입니다.

둘의 분자는 동일합니다.

차이는 분모입니다.

암기#

Support는 전체

Confidence는 앞쪽 A

입니다.


31장 향상도 공식 암기법#

향상도는:

Confidence(A→B) / Support(B)

입니다.

즉:

A가 있을 때 B가 나오는 비율

을:

원래 B가 나오는 비율

로 나눕니다.

따라서:

조건부 B / 평소 B

라고 이해할 수 있습니다.


32장 Apriori와 세 지표의 관계#

Apriori 전체 흐름을 세 지표와 연결하면 더욱 이해하기 쉽습니다.

Support#

빈발항목집합을 찾는 기준

↓

Confidence#

만들어진 연관규칙의 조건부 발생 정도 확인

↓

Lift#

그 관계가 단순히 B가 자주 등장해서 생긴 것인지, 실제 연관성이 있는지 평가

즉:

Support → 후보 찾기

Confidence → 규칙 강도 보기

Lift → 실제 연관성 보기

로 기억할 수 있습니다.


33장 향상도와 상관관계 해석#

제공된 학습자료에서는 다음과 같이 정리합니다.

Lift 해석
= 1 독립
> 1 양의 상관관계
< 1 음의 상관관계

시험에서 가장 자주 바꿔 출제하는 부분은 Lift = 1입니다.

1이면 양의 관계가 아니라 독립입니다.


34장 연관규칙에서 A→B와 B→A는 같은가#

지지도는 A와 B가 함께 발생하는 정도를 보기 때문에 A∩B 자체는 동일합니다.

하지만 신뢰도는 분모가 달라집니다.

Confidence(A→B)#

(A∩B) / A

Confidence(B→A)#

(A∩B) / B

따라서 두 값은 일반적으로 서로 다를 수 있습니다.

즉 연관규칙에서는 방향이 중요합니다.


35장 A→B 방향을 쉽게 이해하기#

A→B에서:

A는 조건이 되는 항목입니다.

B는 결과로 확인하려는 항목입니다.

예:

맥주 → 땅콩

은:

맥주를 산 고객 가운데 땅콩도 산 고객이 얼마나 되는가?

를 보는 것입니다.

따라서 Confidence의 분모는 맥주 구매자 A입니다.


36장 Apriori의 최소 지지도 시험 함정#

다음 문장을 주의합니다.

Apriori는 모든 가능한 항목 조합을 끝까지 탐색한 뒤 최소 지지도를 확인한다.

제공된 학습자료의 핵심과 맞지 않습니다.

Apriori에서는 최소 지지도를 이용해 후보 항목집합을 줄여 탐색 효율을 높입니다.

시험에서는:

Apriori → 최소 지지도 → 후보 축소

로 기억하면 됩니다.


37장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. Apriori의 최소 지지도는 알고리즘이 자동으로 설정한다#

제공된 학습자료에서는 분석자가 기준값을 결정합니다.

함정 2. 지지도는 A 구매자 가운데 B도 구매한 비율이다#

틀립니다.

이는 신뢰도입니다.

지지도는 전체 거래를 기준으로 합니다.

함정 3. 신뢰도는 전체 거래 중 A와 B가 동시에 나타난 비율이다#

틀립니다.

이는 지지도입니다.

함정 4. Lift = 1이면 양의 상관관계다#

틀립니다.

독립입니다.

함정 5. Lift > 1이면 음의 관계다#

틀립니다.

양의 관계입니다.

함정 6. Lift < 1이면 두 항목이 독립이다#

틀립니다.

제공된 학습자료에서는 음의 상관 또는 대체 관계로 설명합니다.

함정 7. 향상도는 Support(A→B) / Confidence(A→B)다#

틀립니다.

제공된 학습자료 공식은:

Confidence(A→B) / Support(B)

입니다.

함정 8. Apriori는 최소 지지도를 이용해 후보를 줄이지 않는다#

틀립니다.

최소 지지도를 이용해 후보를 축소하여 효율을 높입니다.


38장 Apriori 시험 직전 암기#

Apriori

→ 연관규칙 탐색

→ 최소 지지도 설정

→ 빈발항목집합 탐색

→ 연관규칙 생성

→ 향상도로 평가

가장 중요한 연결은:

Apriori = 최소 지지도 기반 빈발항목집합

입니다.


39장 지지도 시험 직전 암기#

공식:

Support(A→B) = (A∩B) / 전체 거래

질문:

전체에서 A와 B가 같이 얼마나 나왔나?

암기:

Support = 같이 / 전체

입니다.


40장 신뢰도 시험 직전 암기#

공식:

Confidence(A→B) = (A∩B) / A

질문:

A를 한 사람 중 B도 한 사람이 얼마나 되는가?

암기:

Confidence = 같이 / A

입니다.


41장 향상도 시험 직전 암기#

공식:

Lift(A→B) = Confidence(A→B) / Support(B)

또는:

P(A∩B) / [P(A) × P(B)]

해석:

Lift = 1 → 독립

Lift > 1 → 양의 관계

Lift < 1 → 음의 관계

가장 중요한 암기:

Lift는 1이 기준

입니다.


42장 연관규칙분석 핵심 비교표#

지표 공식 핵심 질문
Support (A∩B) / 전체 전체에서 같이 얼마나 발생?
Confidence (A∩B) / A A일 때 B가 얼마나 발생?
Lift Confidence / Support(B) 평소보다 얼마나 더 함께 발생?

그리고 Lift 해석은:

Lift 의미
1 독립
> 1 양의 관계
< 1 음의 관계

입니다.


연관규칙분석 FAQ#

연관규칙분석이란 무엇인가#

여러 항목이 함께 나타나는 패턴을 찾아 항목 사이의 연관성을 분석하는 방법입니다.

대표적인 활용 사례는 무엇인가#

마트나 쇼핑몰의 장바구니 분석입니다.

Apriori란 무엇인가#

최소 지지도를 기준으로 빈발항목집합을 찾고 연관규칙을 생성하는 대표적인 알고리즘입니다.

최소 지지도는 누가 정하는가#

제공된 학습자료에서는 분석자가 기준값을 결정합니다.

빈발항목집합이란 무엇인가#

최소 지지도 이상의 빈도로 함께 나타나는 항목들의 집합입니다.

Apriori가 최소 지지도를 사용하는 이유는 무엇인가#

지지도가 낮은 후보를 제거하여 탐색해야 하는 항목집합을 줄이고 효율을 높이기 위해 사용합니다.

지지도 Support란 무엇인가#

전체 거래 중 A와 B가 함께 발생한 거래의 비율입니다.

지지도 공식은 무엇인가#

(A∩B) / 전체 거래

입니다.

신뢰도 Confidence란 무엇인가#

A가 발생한 거래 중 B도 함께 발생한 거래의 비율입니다.

신뢰도 공식은 무엇인가#

(A∩B) / A

입니다.

향상도 Lift란 무엇인가#

A가 발생했을 때 B의 발생률을 전체 B 발생률과 비교하여 두 항목의 실질적 관계를 평가하는 지표입니다.

향상도 공식은 무엇인가#

Confidence(A→B) / Support(B)

입니다.

Lift가 1이면 무엇인가#

두 항목이 독립적인 관계입니다.

Lift가 1보다 크면 무엇인가#

제공된 학습자료에서는 양의 상관관계로 설명합니다.

Lift가 1보다 작으면 무엇인가#

제공된 학습자료에서는 음의 상관관계 또는 대체 관계로 설명합니다.

A→B와 B→A의 Confidence는 같은가#

일반적으로 같지 않을 수 있습니다. 분모가 각각 A와 B로 다르기 때문입니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 연관규칙분석이 무엇인지 설명할 수 있는가?
  2. Apriori가 어떤 목적으로 사용되는지 알고 있는가?
  3. 최소 지지도를 누가 설정하는지 알고 있는가?
  4. 빈발항목집합의 의미를 설명할 수 있는가?
  5. Apriori의 네 단계를 순서대로 말할 수 있는가?
  6. Support의 공식을 기억하고 있는가?
  7. Confidence의 공식을 기억하고 있는가?
  8. Support와 Confidence의 분모를 구분할 수 있는가?
  9. Lift 공식을 기억하고 있는가?
  10. Lift = 1을 독립으로 해석할 수 있는가?
  11. Lift > 1과 Lift < 1을 구분할 수 있는가?
  12. 초콜릿·우유 예제에서 Support·Confidence·Lift를 계산할 수 있는가?
  13. Confidence가 높다고 반드시 강한 관계인 것은 아니라는 이유를 설명할 수 있는가?
  14. A→B와 B→A의 신뢰도가 달라질 수 있다는 것을 알고 있는가?

이 글을 마치며#

연관규칙분석은 어떤 항목들이 함께 나타나는지 찾는 분석방법입니다.

대표적인 알고리즘은 Apriori입니다.

Apriori는:

최소 지지도를 설정하고

↓

빈발항목집합을 찾고

↓

연관규칙을 생성하고

↓

향상도로 규칙의 유용성을 평가

합니다.

연관규칙의 핵심 지표는 세 가지입니다.

Support

→ 전체에서 A와 B가 같이 나온 비율

Confidence

→ A가 나온 경우 중 B도 나온 비율

Lift

→ B의 일반적인 발생률보다 A와 함께 있을 때 얼마나 더 나타나는지 비교

공식은 다음 세 줄로 정리됩니다.

Support = (A∩B) / 전체

Confidence = (A∩B) / A

Lift = Confidence(A→B) / Support(B)

시험에서 가장 중요한 기준은 향상도 1입니다.

Lift = 1 → 독립

Lift > 1 → 양의 관계

Lift < 1 → 음의 관계

시험 직전에는 다음 네 줄로 압축해서 기억하면 됩니다.

Apriori = 최소 지지도로 빈발항목집합 탐색

Support = 같이 / 전체

Confidence = 같이 / A

Lift는 1이 기준: 1 독립 / >1 양 / <1 음

이 페이지의 목차