의사결정나무란? 지니계수·엔트로피·정보이득·CART·C4.5·CHAID·가지치기 쉽게 이해하기
1장 의사결정나무란 무엇인가#
의사결정나무 Decision Tree는 데이터를 여러 조건에 따라 반복적으로 나누면서 최종 결과를 예측하는 방법입니다.
제공된 학습자료에서는 의사결정나무를 쉽게 스무고개 놀이에 비유합니다.
예를 들어 고객이 상품을 구매할지 예측한다고 하겠습니다.
첫 번째 질문:
나이가 50세보다 많은가?
Yes와 No로 나눕니다.
다음 질문:
소득이 300만 원보다 많은가?
다시 Yes와 No로 나눕니다.
이 과정을 반복하다 보면 최종적으로:
- 구매 O
- 구매 X
와 같은 결과에 도달합니다.
즉 의사결정나무는 질문을 반복하면서 데이터를 점점 더 잘 구분하는 모델입니다.
2장 의사결정나무의 기본 구조#
의사결정나무는 크게 세 종류의 노드로 구성됩니다.
- 루트노드 Root Node
- 내부노드 Internal Node
- 단말노드 Terminal Node 또는 Leaf Node
각 노드는 서로 다른 역할을 합니다.
3장 루트노드 Root Node란 무엇인가#
루트노드는 의사결정나무의 시작점입니다.
가장 처음 전체 데이터가 들어오는 위치입니다.
예를 들어:
나이가 50세보다 많은가?
라는 첫 번째 질문이 루트노드가 될 수 있습니다.
핵심#
Root Node = 시작점
입니다.
4장 내부노드 Internal Node란 무엇인가#
내부노드는 트리 중간에서 추가로 데이터를 나누는 분기점입니다.
예를 들어 첫 번째 질문에서 Yes 그룹으로 들어온 고객에게:
소득이 300만 원보다 많은가?
라는 두 번째 질문을 할 수 있습니다.
이 두 번째 질문이 내부노드입니다.
핵심#
Internal Node = 중간 분기점
입니다.
5장 단말노드 Terminal Node란 무엇인가#
단말노드는 더 이상 분기하지 않고 최종 결과를 결정하는 노드입니다.
예를 들어:
- 구매 O
- 구매 X
같은 결과가 들어갈 수 있습니다.
다른 이름으로:
Leaf Node
라고도 부릅니다.
핵심#
Terminal 또는 Leaf Node = 최종 결과
입니다.
6장 의사결정나무 구조를 한 번에 기억하기#
| 노드 | 역할 |
|---|---|
| Root Node | 시작점 |
| Internal Node | 중간 분기 |
| Terminal / Leaf Node | 최종 결과 |
쉽게:
루트 = 시작
내부 = 질문
단말 = 답
이라고 기억할 수 있습니다.
7장 의사결정나무는 지도학습인가#
네.
제공된 학습자료에서는 의사결정나무를 지도학습 Supervised Learning으로 분류합니다.
즉 정답이 있는 데이터를 이용해 규칙을 학습합니다.
예를 들어 고객 데이터에:
- 나이
- 소득
- 구매 여부
가 있다면 나이와 소득을 이용해 구매 여부를 예측하는 규칙을 학습할 수 있습니다.
8장 의사결정나무는 분류만 가능한가#
아닙니다.
제공된 학습자료에서는 의사결정나무가:
분류 + 회귀 모두 가능
하다고 설명합니다.
분류#
결과가 범주형
예:
- 구매 O/X
- 정상/이상
- 합격/불합격
회귀#
결과가 연속형
예:
- 가격
- 매출
- 수요량
입니다.
9장 좋은 질문은 어떻게 고를까#
의사결정나무에서는 아무 질문이나 선택하는 것이 아닙니다.
데이터를 가능한 한 잘 구분하는 질문을 선택해야 합니다.
예를 들어 구매 고객과 미구매 고객이 섞여 있는 노드가 있다고 하겠습니다.
좋은 분할은 이 고객들을:
- 구매 고객이 많이 모인 그룹
- 미구매 고객이 많이 모인 그룹
으로 잘 나누어야 합니다.
이때 사용하는 대표적인 기준이:
- 지니계수
- 엔트로피
- 카이제곱
입니다.
10장 불순도 Impurity란 무엇인가#
불순도는 하나의 노드 안에 서로 다른 클래스가 얼마나 섞여 있는지를 나타냅니다.
예를 들어 한 노드에 고객 10명이 있다고 하겠습니다.
사례 A#
구매 10명
미구매 0명
→ 한 클래스만 존재
→ 매우 순수
사례 B#
구매 5명
미구매 5명
→ 두 클래스가 절반씩 섞임
→ 불순도가 높음
입니다.
핵심#
불순도 = 얼마나 섞여 있는가
입니다.
11장 의사결정나무의 목표는 불순도를 낮추는 것#
제공된 학습자료에서는:
지니계수와 엔트로피는 낮을수록 좋다
고 정리합니다.
즉 분할 후 각 노드에 가능한 한 비슷한 클래스끼리 모이도록 만드는 것이 목표입니다.
핵심#
불순도 ↓ → 순도 ↑
입니다.
12장 지니계수 Gini Index란 무엇인가#
지니계수는 의사결정나무에서 노드의 불순도를 측정하는 대표적인 기준입니다.
제공된 학습자료의 공식은 다음과 같습니다.
Gini(D) = 1 - Σ(pⱼ)²
여기서 pⱼ는 클래스 j에 속하는 데이터의 비율입니다.
핵심#
Gini 작음 → 불순도 낮음 → 좋은 분할
입니다.
13장 지니계수 0은 무엇을 의미하는가#
지니계수가 0이라면 완전히 순수한 노드입니다.
즉 하나의 클래스만 존재합니다.
예를 들어:
구매 O = 100%
구매 X = 0%
이라면 지니계수는 0이 됩니다.
핵심#
Gini = 0 → 완전 순수
입니다.
14장 지니계수가 높으면 무엇을 의미하는가#
지니계수가 높을수록 여러 클래스가 섞여 있는 상태입니다.
즉:
불순도가 높다
는 의미입니다.
제공된 학습자료에서는 다음 함정을 강조합니다.
지니계수가 높을수록 불순도가 낮다.
틀립니다.
정반대입니다.
핵심#
Gini ↑ → 불순도 ↑
입니다.
15장 지니계수 계산 예제 1#
두 클래스가 다음 비율이라고 하겠습니다.
A = 1개
B = 4개
전체 = 5개
각 비율은:
1/5
4/5
입니다.
지니계수는:
1 - (1/5)² - (4/5)²
= 1 - 1/25 - 16/25
= 8/25
= 0.32
입니다.
16장 지니계수 계산 예제 2#
이진 분류에서:
A = 6
B = 4
라고 하겠습니다.
비율은:
0.6
0.4
입니다.
지니계수는:
1 - (0.6² + 0.4²)
= 1 - (0.36 + 0.16)
= 0.48
입니다.
따라서:
Gini = 0.48
입니다.
17장 지니계수의 최대 불순도#
제공된 학습자료에서는 클래스가 c개이고 균등하게 분포할 때 최대 불순도를 다음과 같이 정리합니다.
Gini = 1 - (1/c)
이진 분류에서 c = 2라면 최대값은:
1 - 1/2
= 0.5
입니다.
즉 이진 분류에서 50:50으로 섞여 있을 때 불순도가 가장 큽니다.
18장 엔트로피 Entropy란 무엇인가#
엔트로피 역시 노드의 불순도를 측정하는 기준입니다.
제공된 학습자료의 공식은 다음과 같습니다.
Entropy(D) = -Σ(pᵢ × log₂(pᵢ))
엔트로피도 마찬가지로:
낮을수록 순수
합니다.
핵심#
Entropy ↓ → 불순도 ↓
입니다.
19장 엔트로피 0은 무엇을 의미하는가#
엔트로피가 0이면 노드가 완전히 순수합니다.
즉 하나의 클래스만 존재합니다.
예#
A = 100%
B = 0%
→ Entropy = 0
입니다.
핵심#
Entropy = 0 → 완전 순수
입니다.
20장 이진 분류에서 엔트로피가 가장 큰 경우#
제공된 학습자료에서는 이진 분류에서:
50 : 50
으로 두 클래스가 동일하게 섞여 있을 때 엔트로피가 최대라고 설명합니다.
이 경우:
Entropy = 1
입니다.
즉 어느 클래스로 갈지 가장 불확실한 상태입니다.
21장 엔트로피 계산 예제#
A = 5
B = 5
라고 하겠습니다.
각 비율은:
0.5
0.5
입니다.
공식에 대입하면:
Entropy = -(0.5×log₂0.5 + 0.5×log₂0.5)
log₂0.5 = -1이므로:
= -(0.5×-1 + 0.5×-1)
= 1
입니다.
따라서:
Entropy = 1
이고 최대 불확실 상태입니다.
22장 지니계수와 엔트로피의 공통점#
두 지표 모두 노드가 얼마나 섞여 있는지를 측정합니다.
| 구분 | 지니계수 | 엔트로피 |
|---|---|---|
| 목적 | 불순도 측정 | 불순도 측정 |
| 좋은 방향 | 낮을수록 좋음 | 낮을수록 좋음 |
| 0 | 완전 순수 | 완전 순수 |
| 주요 알고리즘 | CART | ID3, C4.5 |
시험에서는:
둘 다 낮을수록 좋다
는 점을 확실히 기억해야 합니다.
23장 정보이득 Information Gain이란 무엇인가#
정보이득은 분할 전과 분할 후의 엔트로피 차이를 이용합니다.
제공된 학습자료의 공식은:
IG = Entropy(부모) - Σ(|Dᵥ|/|D| × Entropy(Dᵥ))
입니다.
쉽게 말하면:
분할 전 불순도 − 분할 후 불순도
입니다.
즉 질문 하나를 했을 때 얼마나 불확실성이 줄었는지 측정합니다.
24장 정보이득은 클수록 좋다#
지니계수와 엔트로피는 낮을수록 좋지만, 정보이득은 반대입니다.
정보이득은 클수록 좋은 분할입니다.
왜냐하면 분할을 통해 불순도를 많이 줄였다는 뜻이기 때문입니다.
핵심#
Gini·Entropy → 낮을수록 좋음
Information Gain → 클수록 좋음
입니다.
25장 정보이득 대표 함정#
다음 문장을 주의합니다.
정보이득이 작은 변수를 먼저 분할한다.
틀립니다.
정확한 설명은:
정보이득이 큰 변수를 우선 선택
입니다.
시험 직전에는:
Gain은 얻는 것이므로 클수록 좋다
고 기억하면 쉽습니다.
26장 CART란 무엇인가#
CART는 Classification And Regression Tree의 약자입니다.
제공된 학습자료에서는 다음 특징을 강조합니다.
- 지니계수 기반
- 이진 분할 Binary Split
- 분류와 회귀 모두 가능
- 계산이 빠름
- 범주형·연속형 처리 가능
핵심#
CART = Gini + Binary
입니다.
27장 CART는 왜 이름에 Classification과 Regression이 모두 있을까#
CART의 전체 이름은:
Classification And Regression Tree
입니다.
즉 이름 자체에서 알 수 있듯이:
- 분류
- 회귀
모두 수행할 수 있습니다.
시험에서는 이 특징을 직접 묻기도 합니다.
28장 CART의 분할 방식#
CART는 이진 분할을 사용합니다.
즉 하나의 노드를 두 개의 자식 노드로 나눕니다.
예:
나이 > 50?
→ Yes
→ No
처럼 항상 두 방향으로 분할됩니다.
핵심#
CART = Binary Split
입니다.
29장 ID3란 무엇인가#
ID3는 의사결정나무 알고리즘 가운데 하나로 제공된 학습자료에서는:
- 엔트로피
- 정보이득
을 기반으로 하는 방식으로 정리합니다.
즉 어떤 변수를 사용했을 때 엔트로피가 많이 감소하는지, 정보이득이 얼마나 큰지를 보고 분할변수를 선택합니다.
30장 C4.5란 무엇인가#
C4.5는 제공된 학습자료에서 ID3의 개선판으로 설명합니다.
주요 특징은:
- 엔트로피 기반
- 정보이득 계열 사용
- 다진 분할 가능
- 연속형 변수 처리 가능
입니다.
특히 시험에서는:
C4.5는 연속형 변수도 처리 가능
이라는 점을 기억할 필요가 있습니다.
31장 ID3와 C4.5를 함께 기억하는 방법#
둘 다:
엔트로피
와 연결합니다.
하지만 C4.5는 ID3보다 개선된 형태이고 연속형 변수 처리가 가능하다는 점을 기억합니다.
핵심#
ID3/C4.5 = Entropy
C4.5 = 연속형 처리 가능
입니다.
32장 CHAID란 무엇인가#
CHAID는 제공된 학습자료에서 카이제곱 χ² 검정 기반의 의사결정나무 알고리즘으로 설명합니다.
주요 특징은:
- 카이제곱 검정
- 다진 분할 Multi-way
- 범주형 종속변수에 강함
- 통계적 검정 활용
입니다.
핵심#
CHAID = χ² + Multi-way
입니다.
33장 CART·C4.5·CHAID 비교#
| 알고리즘 | 분리기준 | 분할 | 특징 |
|---|---|---|---|
| CART | 지니계수 | 이진 | 분류+회귀, 계산 빠름 |
| ID3/C4.5 | 엔트로피·정보이득 | 다진 가능 | C4.5는 연속형 처리 |
| CHAID | 카이제곱 χ² | 다진 | 범주형 종속변수에 강함 |
시험에서는 이 세 가지 연결을 자주 묻습니다.
34장 알고리즘 암기법#
제공된 학습자료의 핵심 암기법은 다음과 같습니다.
CART#
Classification And Regression Tree
→ 지니계수
→ 이진 분할
C4.5#
ID3 개선판
→ 엔트로피
→ 연속형 처리 가능
CHAID#
→ 카이제곱 검정
→ 범주형에 강함
→ 다진 분할
입니다.
35장 의사결정나무가 너무 깊어지면 어떤 문제가 생길까#
의사결정나무가 계속 분할되면 학습 데이터에 매우 세밀하게 맞춰질 수 있습니다.
이 경우 학습 데이터에서는 높은 성능을 보이지만 새로운 데이터에서는 성능이 떨어질 수 있습니다.
즉 과적합 Overfitting이 발생할 수 있습니다.
이를 방지하기 위한 대표적인 방법이:
- 가지치기 Pruning
- 정지규칙 Stopping Rule
입니다.
36장 가지치기 Pruning이란 무엇인가#
가지치기는 이미 만들어진 트리에서 불필요한 가지를 제거하는 과정입니다.
제공된 학습자료에서는:
과적합을 방지하기 위해 불필요한 가지를 제거
한다고 설명합니다.
나무를 너무 복잡하게 만들지 않고 단순화하는 과정이라고 이해하면 쉽습니다.
핵심#
Pruning = 만든 뒤 잘라냄
입니다.
37장 정지규칙 Stopping Rule이란 무엇인가#
정지규칙은 트리를 만드는 과정에서:
여기서 더 이상 분할하지 말자.
라고 결정하는 조건입니다.
즉 현재 노드를 끝마디 Leaf Node로 만드는 규칙입니다.
제공된 학습자료에서는 대표적으로 다음 기준을 제시합니다.
- 끝마디 최소 레코드 수
- 나무 최대 깊이
- 불순도 향상 최소값
입니다.
38장 끝마디 최소 레코드 수#
노드에 들어 있는 관측치가 너무 적어지면 더 이상 분할하지 않을 수 있습니다.
예를 들어:
노드에 데이터가 5개 이하이면 분할 중지
와 같은 규칙을 설정할 수 있습니다.
이렇게 하면 지나치게 세밀한 분기를 방지할 수 있습니다.
39장 나무의 최대 깊이 Depth#
트리가 지나치게 깊어지는 것을 방지하기 위해 최대 깊이를 지정할 수 있습니다.
예를 들어:
max depth = 5
라고 설정하면 5단계까지 분할한 이후에는 더 이상 트리를 확장하지 않습니다.
이 역시 과적합을 줄이는 방법입니다.
40장 불순도 향상 최소값#
새롭게 분할했는데 불순도가 거의 줄어들지 않는다면 분할을 계속할 필요가 적을 수 있습니다.
따라서:
불순도 감소가 특정 기준보다 작으면 분할하지 않는다.
와 같은 정지규칙을 사용할 수 있습니다.
즉 의미 없는 추가 분기를 막는 것입니다.
41장 정지규칙과 가지치기의 차이#
시험에서 중요한 함정입니다.
둘은 모두 과도한 트리 생성을 막지만 시점이 다릅니다.
정지규칙#
분기하는 과정에서:
더 이상 나누지 않음
가지치기#
이미 만들어진 트리에서:
불필요한 가지 제거
입니다.
핵심#
Stopping = 분기 전에 멈춤
Pruning = 분기 후 제거
입니다.
42장 정지규칙과 가지치기 대표 함정#
다음 문장을 주의합니다.
정지규칙은 트리를 모두 만든 뒤 필요 없는 가지를 제거하는 것이다.
틀립니다.
이것은 가지치기입니다.
반대로:
가지치기는 더 이상 분기하지 않도록 사전에 조건을 설정하는 것이다.
역시 틀립니다.
이것은 정지규칙입니다.
43장 의사결정나무의 장점#
제공된 학습자료의 핵심 구조에서 알 수 있듯이 의사결정나무는 질문과 분기 형태로 결과를 표현합니다.
따라서 결과를 다음처럼 읽을 수 있습니다.
나이 > 50이고 소득 > 500이면 구매 O
처럼 규칙을 따라갈 수 있습니다.
즉 트리의 구조 자체가 의사결정 과정을 단계적으로 보여줍니다.
시험에서는 무엇보다 구조와 분할 기준을 정확히 이해하는 것이 중요합니다.
44장 R에서 의사결정나무 만들기#
제공된 학습자료에서는 rpart 패키지를 사용합니다.
먼저 설치하고 불러옵니다.
install.packages("rpart")
library(rpart)그다음 iris 데이터를 이용해 의사결정나무를 생성합니다.
tree_model <- rpart(Species ~ ., data=iris, method="class")여기서:
Species ~ .
는 Species를 나머지 모든 변수를 이용해 예측한다는 의미입니다.
45장 R에서 모델 결과 확인하기#
만들어진 모델을 확인하려면:
print(tree_model)을 사용할 수 있습니다.
변수 중요도는 다음과 같이 확인합니다.
tree_model$variable.importance이를 통해 어떤 변수가 트리 분할에 상대적으로 중요한 역할을 했는지 확인할 수 있습니다.
46장 R에서 의사결정나무 예측하기#
제공된 학습자료에서는 다음과 같이 예측합니다.
pred <- predict(tree_model, iris, type="class")type="class"는 클래스 결과를 반환하도록 지정합니다.
즉 iris 데이터의 Species를 범주 형태로 예측합니다.
47장 R에서 정확도 계산하기#
예측 결과와 실제값을 비교해 정확도를 계산할 수 있습니다.
mean(pred == iris$Species)제공된 학습자료 예시는:
0.9
입니다.
즉 예제 기준 약 90% 정확도로 분류했다는 의미입니다.
48장 의사결정나무 전체 흐름#
의사결정나무 학습 흐름을 한 번에 정리하면 다음과 같습니다.
전체 데이터
↓
좋은 분할 기준 찾기
↓
노드 분리
↓
다시 좋은 분할 찾기
↓
반복
↓
Leaf Node에서 결과 결정
입니다.
분할을 선택할 때는:
- Gini
- Entropy
- χ²
등을 사용할 수 있습니다.
49장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 지니계수가 높을수록 순도가 높다#
틀립니다.
지니계수는 낮을수록 불순도가 낮고 순도가 높습니다.
함정 2. 엔트로피는 높을수록 좋은 분할이다#
틀립니다.
엔트로피 역시 낮을수록 불순도가 낮습니다.
함정 3. 정보이득은 작을수록 좋다#
틀립니다.
정보이득은 클수록 좋은 분할입니다.
함정 4. CART는 엔트로피만 사용한다#
틀립니다.
제공된 학습자료에서는 지니계수와 연결합니다.
함정 5. CART는 다진 분할만 수행한다#
틀립니다.
이진 분할입니다.
함정 6. CART는 분류만 가능하다#
틀립니다.
Classification And Regression Tree이므로 분류와 회귀 모두 가능합니다.
함정 7. C4.5는 연속형 변수를 처리할 수 없다#
틀립니다.
제공된 학습자료에서는 C4.5가 연속형 변수를 처리할 수 있다고 설명합니다.
함정 8. CHAID는 지니계수 기반이다#
틀립니다.
카이제곱 χ² 검정 기반입니다.
함정 9. CHAID는 이진 분할만 가능하다#
틀립니다.
다진 분할이 가능합니다.
함정 10. 가지치기는 분기 전에 멈추는 규칙이다#
틀립니다.
분기 후 불필요한 가지를 제거합니다.
함정 11. 정지규칙은 트리를 만든 뒤 가지를 제거한다#
틀립니다.
트리 생성 과정에서 분기를 멈추는 조건입니다.
50장 지니계수 시험 직전 암기#
공식:
Gini(D) = 1 - Σ(pⱼ)²
Gini = 0#
→ 완전 순수
Gini 증가#
→ 불순도 증가
목표#
→ 낮은 Gini
한 줄로:
지니는 낮을수록 좋다
입니다.
51장 엔트로피 시험 직전 암기#
공식:
Entropy(D) = -Σ(pᵢ × log₂pᵢ)
Entropy = 0#
→ 완전 순수
이진 50:50#
→ Entropy = 1
목표#
→ 낮은 Entropy
따라서:
엔트로피도 낮을수록 좋다
입니다.
52장 정보이득 시험 직전 암기#
공식의 핵심은:
분할 전 엔트로피 − 분할 후 엔트로피
입니다.
좋은 분할#
→ 불순도를 크게 감소
→ Information Gain 큼
따라서:
IG는 클수록 좋다
입니다.
53장 의사결정나무 알고리즘 시험 직전 암기#
CART#
Gini
Binary
분류 + 회귀
ID3 / C4.5#
Entropy
Information Gain
다진 가능
C4.5 연속형 가능
CHAID#
χ²
Multi-way
범주형에 강함
가장 쉽게:
CART = 지니
C4.5 = 엔트로피
CHAID = 카이제곱
입니다.
54장 과적합 방지 시험 직전 암기#
Stopping Rule#
→ 분기 중단
→ 최소 레코드 수
→ 최대 깊이
→ 불순도 향상 최소값
Pruning#
→ 이미 만들어진 가지 제거
→ 과적합 방지
한 줄로:
Stopping은 멈추고, Pruning은 자른다
입니다.
55장 의사결정나무 핵심 비교표#
| 개념 | 핵심 |
|---|---|
| 지도학습 | O |
| 분류 | 가능 |
| 회귀 | 가능 |
| Root Node | 시작점 |
| Internal Node | 분기점 |
| Leaf Node | 최종 결과 |
| Gini | 낮을수록 좋음 |
| Entropy | 낮을수록 좋음 |
| Information Gain | 클수록 좋음 |
| CART | Gini, 이진 |
| C4.5 | Entropy, 연속형 가능 |
| CHAID | χ², 다진 |
| Pruning | 분기 후 제거 |
| Stopping Rule | 분기 중단 |
의사결정나무 FAQ#
의사결정나무란 무엇인가#
조건을 이용해 데이터를 반복적으로 분할하여 최종 분류나 회귀 결과를 결정하는 지도학습 알고리즘입니다.
의사결정나무의 시작점은 무엇인가#
Root Node입니다.
중간 분기점은 무엇인가#
Internal Node입니다.
최종 결과가 있는 노드는 무엇인가#
Terminal Node 또는 Leaf Node입니다.
의사결정나무는 분류만 가능한가#
아닙니다. 제공된 학습자료에서는 분류와 회귀 모두 가능하다고 설명합니다.
불순도란 무엇인가#
한 노드에 서로 다른 클래스가 얼마나 섞여 있는지를 나타냅니다.
지니계수는 어느 방향이 좋은가#
낮을수록 불순도가 낮고 순도가 높습니다.
지니계수 공식은 무엇인가#
1 - Σ(pⱼ)²
입니다.
지니계수가 0이면 무엇을 의미하는가#
한 클래스만 존재하는 완전히 순수한 노드입니다.
엔트로피는 어느 방향이 좋은가#
낮을수록 좋습니다.
이진 분류에서 50:50이면 엔트로피는 얼마인가#
제공된 학습자료 기준 1입니다.
정보이득은 어느 방향이 좋은가#
클수록 좋은 분할입니다.
CART는 무엇을 사용하는가#
지니계수를 사용하며 이진 분할을 수행합니다.
CART는 회귀도 가능한가#
네. Classification And Regression Tree이므로 분류와 회귀 모두 가능합니다.
C4.5는 무엇을 사용하는가#
제공된 학습자료에서는 엔트로피와 정보이득 기반으로 설명합니다.
C4.5는 연속형 변수도 처리 가능한가#
네.
CHAID는 무엇을 사용하는가#
카이제곱 χ² 검정을 사용합니다.
CHAID는 어떤 분할을 하는가#
다진 분할 Multi-way이 가능합니다.
가지치기는 무엇인가#
과적합을 방지하기 위해 이미 만들어진 트리의 불필요한 가지를 제거하는 과정입니다.
정지규칙은 무엇인가#
트리를 생성하는 과정에서 더 이상 분기하지 않고 현재 노드를 Leaf Node로 만드는 규칙입니다.
정지규칙과 가지치기의 차이는 무엇인가#
정지규칙은 분기 중에 멈추는 것, 가지치기는 분기 후 제거하는 것입니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- Root·Internal·Leaf Node를 구분할 수 있는가?
- 의사결정나무가 지도학습이라는 것을 알고 있는가?
- 분류와 회귀 모두 가능하다는 것을 알고 있는가?
- 불순도가 무엇인지 설명할 수 있는가?
- 지니계수 공식을 기억하고 있는가?
- Gini = 0의 의미를 알고 있는가?
- 지니계수는 낮을수록 좋다는 것을 알고 있는가?
- 엔트로피 공식의 의미를 알고 있는가?
- 이진 50:50에서 엔트로피가 최대라는 것을 알고 있는가?
- 정보이득은 클수록 좋다는 것을 알고 있는가?
- CART와 지니계수를 연결할 수 있는가?
- CART가 이진 분할이라는 것을 알고 있는가?
- C4.5와 엔트로피를 연결할 수 있는가?
- C4.5가 연속형 변수를 처리할 수 있다는 것을 알고 있는가?
- CHAID와 카이제곱을 연결할 수 있는가?
- CHAID가 다진 분할이라는 것을 알고 있는가?
- 가지치기의 목적을 설명할 수 있는가?
- 정지규칙과 가지치기의 순서 차이를 구분할 수 있는가?
이 글을 마치며#
의사결정나무는 질문을 반복하면서 데이터를 더 순수한 그룹으로 나누는 지도학습 모델입니다.
구조는:
Root → Internal → Leaf
로 이어집니다.
분할의 핵심은 불순도를 낮추는 것입니다.
따라서:
Gini는 낮을수록 좋고
Entropy도 낮을수록 좋습니다.
반대로:
Information Gain은 클수록 좋습니다.
알고리즘은 다음 세 가지 연결을 기억하면 됩니다.
CART = Gini + Binary
C4.5 = Entropy + 연속형 가능
CHAID = χ² + Multi-way
과적합 방지는:
Stopping Rule = 더 이상 분기하지 않기
Pruning = 만든 뒤 가지 제거
로 구분합니다.
시험 직전에는 다음 다섯 줄만 확실히 기억하면 됩니다.
의사결정나무 = 스무고개식 지도학습
Gini·Entropy는 낮을수록 좋음
Information Gain은 클수록 좋음
CART=지니 / C4.5=엔트로피 / CHAID=카이제곱
Stopping은 멈춤 / Pruning은 자름