의사결정나무란? 지니계수·엔트로피·정보이득·CART·C4.5·CHAID·가지치기 쉽게 이해하기

1장 의사결정나무란 무엇인가#

의사결정나무 Decision Tree는 데이터를 여러 조건에 따라 반복적으로 나누면서 최종 결과를 예측하는 방법입니다.

제공된 학습자료에서는 의사결정나무를 쉽게 스무고개 놀이에 비유합니다.

예를 들어 고객이 상품을 구매할지 예측한다고 하겠습니다.

첫 번째 질문:

나이가 50세보다 많은가?

Yes와 No로 나눕니다.

다음 질문:

소득이 300만 원보다 많은가?

다시 Yes와 No로 나눕니다.

이 과정을 반복하다 보면 최종적으로:

  • 구매 O
  • 구매 X

와 같은 결과에 도달합니다.

즉 의사결정나무는 질문을 반복하면서 데이터를 점점 더 잘 구분하는 모델입니다.


2장 의사결정나무의 기본 구조#

의사결정나무는 크게 세 종류의 노드로 구성됩니다.

  • 루트노드 Root Node
  • 내부노드 Internal Node
  • 단말노드 Terminal Node 또는 Leaf Node

각 노드는 서로 다른 역할을 합니다.


3장 루트노드 Root Node란 무엇인가#

루트노드는 의사결정나무의 시작점입니다.

가장 처음 전체 데이터가 들어오는 위치입니다.

예를 들어:

나이가 50세보다 많은가?

라는 첫 번째 질문이 루트노드가 될 수 있습니다.

핵심#

Root Node = 시작점

입니다.


4장 내부노드 Internal Node란 무엇인가#

내부노드는 트리 중간에서 추가로 데이터를 나누는 분기점입니다.

예를 들어 첫 번째 질문에서 Yes 그룹으로 들어온 고객에게:

소득이 300만 원보다 많은가?

라는 두 번째 질문을 할 수 있습니다.

이 두 번째 질문이 내부노드입니다.

핵심#

Internal Node = 중간 분기점

입니다.


5장 단말노드 Terminal Node란 무엇인가#

단말노드는 더 이상 분기하지 않고 최종 결과를 결정하는 노드입니다.

예를 들어:

  • 구매 O
  • 구매 X

같은 결과가 들어갈 수 있습니다.

다른 이름으로:

Leaf Node

라고도 부릅니다.

핵심#

Terminal 또는 Leaf Node = 최종 결과

입니다.


6장 의사결정나무 구조를 한 번에 기억하기#

노드 역할
Root Node 시작점
Internal Node 중간 분기
Terminal / Leaf Node 최종 결과

쉽게:

루트 = 시작

내부 = 질문

단말 = 답

이라고 기억할 수 있습니다.


7장 의사결정나무는 지도학습인가#

네.

제공된 학습자료에서는 의사결정나무를 지도학습 Supervised Learning으로 분류합니다.

즉 정답이 있는 데이터를 이용해 규칙을 학습합니다.

예를 들어 고객 데이터에:

  • 나이
  • 소득
  • 구매 여부

가 있다면 나이와 소득을 이용해 구매 여부를 예측하는 규칙을 학습할 수 있습니다.


8장 의사결정나무는 분류만 가능한가#

아닙니다.

제공된 학습자료에서는 의사결정나무가:

분류 + 회귀 모두 가능

하다고 설명합니다.

분류#

결과가 범주형

예:

  • 구매 O/X
  • 정상/이상
  • 합격/불합격

회귀#

결과가 연속형

예:

  • 가격
  • 매출
  • 수요량

입니다.


9장 좋은 질문은 어떻게 고를까#

의사결정나무에서는 아무 질문이나 선택하는 것이 아닙니다.

데이터를 가능한 한 잘 구분하는 질문을 선택해야 합니다.

예를 들어 구매 고객과 미구매 고객이 섞여 있는 노드가 있다고 하겠습니다.

좋은 분할은 이 고객들을:

  • 구매 고객이 많이 모인 그룹
  • 미구매 고객이 많이 모인 그룹

으로 잘 나누어야 합니다.

이때 사용하는 대표적인 기준이:

  • 지니계수
  • 엔트로피
  • 카이제곱

입니다.


10장 불순도 Impurity란 무엇인가#

불순도는 하나의 노드 안에 서로 다른 클래스가 얼마나 섞여 있는지를 나타냅니다.

예를 들어 한 노드에 고객 10명이 있다고 하겠습니다.

사례 A#

구매 10명

미구매 0명

→ 한 클래스만 존재

→ 매우 순수

사례 B#

구매 5명

미구매 5명

→ 두 클래스가 절반씩 섞임

→ 불순도가 높음

입니다.

핵심#

불순도 = 얼마나 섞여 있는가

입니다.


11장 의사결정나무의 목표는 불순도를 낮추는 것#

제공된 학습자료에서는:

지니계수와 엔트로피는 낮을수록 좋다

고 정리합니다.

즉 분할 후 각 노드에 가능한 한 비슷한 클래스끼리 모이도록 만드는 것이 목표입니다.

핵심#

불순도 ↓ → 순도 ↑

입니다.


12장 지니계수 Gini Index란 무엇인가#

지니계수는 의사결정나무에서 노드의 불순도를 측정하는 대표적인 기준입니다.

제공된 학습자료의 공식은 다음과 같습니다.

Gini(D) = 1 - Σ(pⱼ)²

여기서 pⱼ는 클래스 j에 속하는 데이터의 비율입니다.

핵심#

Gini 작음 → 불순도 낮음 → 좋은 분할

입니다.


13장 지니계수 0은 무엇을 의미하는가#

지니계수가 0이라면 완전히 순수한 노드입니다.

즉 하나의 클래스만 존재합니다.

예를 들어:

구매 O = 100%

구매 X = 0%

이라면 지니계수는 0이 됩니다.

핵심#

Gini = 0 → 완전 순수

입니다.


14장 지니계수가 높으면 무엇을 의미하는가#

지니계수가 높을수록 여러 클래스가 섞여 있는 상태입니다.

즉:

불순도가 높다

는 의미입니다.

제공된 학습자료에서는 다음 함정을 강조합니다.

지니계수가 높을수록 불순도가 낮다.

틀립니다.

정반대입니다.

핵심#

Gini ↑ → 불순도 ↑

입니다.


15장 지니계수 계산 예제 1#

두 클래스가 다음 비율이라고 하겠습니다.

A = 1개

B = 4개

전체 = 5개

각 비율은:

1/5

4/5

입니다.

지니계수는:

1 - (1/5)² - (4/5)²

= 1 - 1/25 - 16/25

= 8/25

= 0.32

입니다.


16장 지니계수 계산 예제 2#

이진 분류에서:

A = 6

B = 4

라고 하겠습니다.

비율은:

0.6

0.4

입니다.

지니계수는:

1 - (0.6² + 0.4²)

= 1 - (0.36 + 0.16)

= 0.48

입니다.

따라서:

Gini = 0.48

입니다.


17장 지니계수의 최대 불순도#

제공된 학습자료에서는 클래스가 c개이고 균등하게 분포할 때 최대 불순도를 다음과 같이 정리합니다.

Gini = 1 - (1/c)

이진 분류에서 c = 2라면 최대값은:

1 - 1/2

= 0.5

입니다.

즉 이진 분류에서 50:50으로 섞여 있을 때 불순도가 가장 큽니다.


18장 엔트로피 Entropy란 무엇인가#

엔트로피 역시 노드의 불순도를 측정하는 기준입니다.

제공된 학습자료의 공식은 다음과 같습니다.

Entropy(D) = -Σ(pᵢ × log₂(pᵢ))

엔트로피도 마찬가지로:

낮을수록 순수

합니다.

핵심#

Entropy ↓ → 불순도 ↓

입니다.


19장 엔트로피 0은 무엇을 의미하는가#

엔트로피가 0이면 노드가 완전히 순수합니다.

즉 하나의 클래스만 존재합니다.

예#

A = 100%

B = 0%

→ Entropy = 0

입니다.

핵심#

Entropy = 0 → 완전 순수

입니다.


20장 이진 분류에서 엔트로피가 가장 큰 경우#

제공된 학습자료에서는 이진 분류에서:

50 : 50

으로 두 클래스가 동일하게 섞여 있을 때 엔트로피가 최대라고 설명합니다.

이 경우:

Entropy = 1

입니다.

즉 어느 클래스로 갈지 가장 불확실한 상태입니다.


21장 엔트로피 계산 예제#

A = 5

B = 5

라고 하겠습니다.

각 비율은:

0.5

0.5

입니다.

공식에 대입하면:

Entropy = -(0.5×log₂0.5 + 0.5×log₂0.5)

log₂0.5 = -1이므로:

= -(0.5×-1 + 0.5×-1)

= 1

입니다.

따라서:

Entropy = 1

이고 최대 불확실 상태입니다.


22장 지니계수와 엔트로피의 공통점#

두 지표 모두 노드가 얼마나 섞여 있는지를 측정합니다.

구분 지니계수 엔트로피
목적 불순도 측정 불순도 측정
좋은 방향 낮을수록 좋음 낮을수록 좋음
0 완전 순수 완전 순수
주요 알고리즘 CART ID3, C4.5

시험에서는:

둘 다 낮을수록 좋다

는 점을 확실히 기억해야 합니다.


23장 정보이득 Information Gain이란 무엇인가#

정보이득은 분할 전과 분할 후의 엔트로피 차이를 이용합니다.

제공된 학습자료의 공식은:

IG = Entropy(부모) - Σ(|Dᵥ|/|D| × Entropy(Dᵥ))

입니다.

쉽게 말하면:

분할 전 불순도 − 분할 후 불순도

입니다.

즉 질문 하나를 했을 때 얼마나 불확실성이 줄었는지 측정합니다.


24장 정보이득은 클수록 좋다#

지니계수와 엔트로피는 낮을수록 좋지만, 정보이득은 반대입니다.

정보이득은 클수록 좋은 분할입니다.

왜냐하면 분할을 통해 불순도를 많이 줄였다는 뜻이기 때문입니다.

핵심#

Gini·Entropy → 낮을수록 좋음

Information Gain → 클수록 좋음

입니다.


25장 정보이득 대표 함정#

다음 문장을 주의합니다.

정보이득이 작은 변수를 먼저 분할한다.

틀립니다.

정확한 설명은:

정보이득이 큰 변수를 우선 선택

입니다.

시험 직전에는:

Gain은 얻는 것이므로 클수록 좋다

고 기억하면 쉽습니다.


26장 CART란 무엇인가#

CART는 Classification And Regression Tree의 약자입니다.

제공된 학습자료에서는 다음 특징을 강조합니다.

  • 지니계수 기반
  • 이진 분할 Binary Split
  • 분류와 회귀 모두 가능
  • 계산이 빠름
  • 범주형·연속형 처리 가능

핵심#

CART = Gini + Binary

입니다.


27장 CART는 왜 이름에 Classification과 Regression이 모두 있을까#

CART의 전체 이름은:

Classification And Regression Tree

입니다.

즉 이름 자체에서 알 수 있듯이:

  • 분류
  • 회귀

모두 수행할 수 있습니다.

시험에서는 이 특징을 직접 묻기도 합니다.


28장 CART의 분할 방식#

CART는 이진 분할을 사용합니다.

즉 하나의 노드를 두 개의 자식 노드로 나눕니다.

예:

나이 > 50?

→ Yes

→ No

처럼 항상 두 방향으로 분할됩니다.

핵심#

CART = Binary Split

입니다.


29장 ID3란 무엇인가#

ID3는 의사결정나무 알고리즘 가운데 하나로 제공된 학습자료에서는:

  • 엔트로피
  • 정보이득

을 기반으로 하는 방식으로 정리합니다.

즉 어떤 변수를 사용했을 때 엔트로피가 많이 감소하는지, 정보이득이 얼마나 큰지를 보고 분할변수를 선택합니다.


30장 C4.5란 무엇인가#

C4.5는 제공된 학습자료에서 ID3의 개선판으로 설명합니다.

주요 특징은:

  • 엔트로피 기반
  • 정보이득 계열 사용
  • 다진 분할 가능
  • 연속형 변수 처리 가능

입니다.

특히 시험에서는:

C4.5는 연속형 변수도 처리 가능

이라는 점을 기억할 필요가 있습니다.


31장 ID3와 C4.5를 함께 기억하는 방법#

둘 다:

엔트로피

와 연결합니다.

하지만 C4.5는 ID3보다 개선된 형태이고 연속형 변수 처리가 가능하다는 점을 기억합니다.

핵심#

ID3/C4.5 = Entropy

C4.5 = 연속형 처리 가능

입니다.


32장 CHAID란 무엇인가#

CHAID는 제공된 학습자료에서 카이제곱 χ² 검정 기반의 의사결정나무 알고리즘으로 설명합니다.

주요 특징은:

  • 카이제곱 검정
  • 다진 분할 Multi-way
  • 범주형 종속변수에 강함
  • 통계적 검정 활용

입니다.

핵심#

CHAID = χ² + Multi-way

입니다.


33장 CART·C4.5·CHAID 비교#

알고리즘 분리기준 분할 특징
CART 지니계수 이진 분류+회귀, 계산 빠름
ID3/C4.5 엔트로피·정보이득 다진 가능 C4.5는 연속형 처리
CHAID 카이제곱 χ² 다진 범주형 종속변수에 강함

시험에서는 이 세 가지 연결을 자주 묻습니다.


34장 알고리즘 암기법#

제공된 학습자료의 핵심 암기법은 다음과 같습니다.

CART#

Classification And Regression Tree

→ 지니계수

→ 이진 분할

C4.5#

ID3 개선판

→ 엔트로피

→ 연속형 처리 가능

CHAID#

→ 카이제곱 검정

→ 범주형에 강함

→ 다진 분할

입니다.


35장 의사결정나무가 너무 깊어지면 어떤 문제가 생길까#

의사결정나무가 계속 분할되면 학습 데이터에 매우 세밀하게 맞춰질 수 있습니다.

이 경우 학습 데이터에서는 높은 성능을 보이지만 새로운 데이터에서는 성능이 떨어질 수 있습니다.

즉 과적합 Overfitting이 발생할 수 있습니다.

이를 방지하기 위한 대표적인 방법이:

  • 가지치기 Pruning
  • 정지규칙 Stopping Rule

입니다.


36장 가지치기 Pruning이란 무엇인가#

가지치기는 이미 만들어진 트리에서 불필요한 가지를 제거하는 과정입니다.

제공된 학습자료에서는:

과적합을 방지하기 위해 불필요한 가지를 제거

한다고 설명합니다.

나무를 너무 복잡하게 만들지 않고 단순화하는 과정이라고 이해하면 쉽습니다.

핵심#

Pruning = 만든 뒤 잘라냄

입니다.


37장 정지규칙 Stopping Rule이란 무엇인가#

정지규칙은 트리를 만드는 과정에서:

여기서 더 이상 분할하지 말자.

라고 결정하는 조건입니다.

즉 현재 노드를 끝마디 Leaf Node로 만드는 규칙입니다.

제공된 학습자료에서는 대표적으로 다음 기준을 제시합니다.

  • 끝마디 최소 레코드 수
  • 나무 최대 깊이
  • 불순도 향상 최소값

입니다.


38장 끝마디 최소 레코드 수#

노드에 들어 있는 관측치가 너무 적어지면 더 이상 분할하지 않을 수 있습니다.

예를 들어:

노드에 데이터가 5개 이하이면 분할 중지

와 같은 규칙을 설정할 수 있습니다.

이렇게 하면 지나치게 세밀한 분기를 방지할 수 있습니다.


39장 나무의 최대 깊이 Depth#

트리가 지나치게 깊어지는 것을 방지하기 위해 최대 깊이를 지정할 수 있습니다.

예를 들어:

max depth = 5

라고 설정하면 5단계까지 분할한 이후에는 더 이상 트리를 확장하지 않습니다.

이 역시 과적합을 줄이는 방법입니다.


40장 불순도 향상 최소값#

새롭게 분할했는데 불순도가 거의 줄어들지 않는다면 분할을 계속할 필요가 적을 수 있습니다.

따라서:

불순도 감소가 특정 기준보다 작으면 분할하지 않는다.

와 같은 정지규칙을 사용할 수 있습니다.

즉 의미 없는 추가 분기를 막는 것입니다.


41장 정지규칙과 가지치기의 차이#

시험에서 중요한 함정입니다.

둘은 모두 과도한 트리 생성을 막지만 시점이 다릅니다.

정지규칙#

분기하는 과정에서:

더 이상 나누지 않음

가지치기#

이미 만들어진 트리에서:

불필요한 가지 제거

입니다.

핵심#

Stopping = 분기 전에 멈춤

Pruning = 분기 후 제거

입니다.


42장 정지규칙과 가지치기 대표 함정#

다음 문장을 주의합니다.

정지규칙은 트리를 모두 만든 뒤 필요 없는 가지를 제거하는 것이다.

틀립니다.

이것은 가지치기입니다.

반대로:

가지치기는 더 이상 분기하지 않도록 사전에 조건을 설정하는 것이다.

역시 틀립니다.

이것은 정지규칙입니다.


43장 의사결정나무의 장점#

제공된 학습자료의 핵심 구조에서 알 수 있듯이 의사결정나무는 질문과 분기 형태로 결과를 표현합니다.

따라서 결과를 다음처럼 읽을 수 있습니다.

나이 > 50이고 소득 > 500이면 구매 O

처럼 규칙을 따라갈 수 있습니다.

즉 트리의 구조 자체가 의사결정 과정을 단계적으로 보여줍니다.

시험에서는 무엇보다 구조와 분할 기준을 정확히 이해하는 것이 중요합니다.


44장 R에서 의사결정나무 만들기#

제공된 학습자료에서는 rpart 패키지를 사용합니다.

먼저 설치하고 불러옵니다.

install.packages("rpart")
library(rpart)

그다음 iris 데이터를 이용해 의사결정나무를 생성합니다.

tree_model <- rpart(Species ~ ., data=iris, method="class")

여기서:

Species ~ .

는 Species를 나머지 모든 변수를 이용해 예측한다는 의미입니다.


45장 R에서 모델 결과 확인하기#

만들어진 모델을 확인하려면:

print(tree_model)

을 사용할 수 있습니다.

변수 중요도는 다음과 같이 확인합니다.

tree_model$variable.importance

이를 통해 어떤 변수가 트리 분할에 상대적으로 중요한 역할을 했는지 확인할 수 있습니다.


46장 R에서 의사결정나무 예측하기#

제공된 학습자료에서는 다음과 같이 예측합니다.

pred <- predict(tree_model, iris, type="class")

type="class"는 클래스 결과를 반환하도록 지정합니다.

즉 iris 데이터의 Species를 범주 형태로 예측합니다.


47장 R에서 정확도 계산하기#

예측 결과와 실제값을 비교해 정확도를 계산할 수 있습니다.

mean(pred == iris$Species)

제공된 학습자료 예시는:

0.9

입니다.

즉 예제 기준 약 90% 정확도로 분류했다는 의미입니다.


48장 의사결정나무 전체 흐름#

의사결정나무 학습 흐름을 한 번에 정리하면 다음과 같습니다.

전체 데이터

↓

좋은 분할 기준 찾기

↓

노드 분리

↓

다시 좋은 분할 찾기

↓

반복

↓

Leaf Node에서 결과 결정

입니다.

분할을 선택할 때는:

  • Gini
  • Entropy
  • χ²

등을 사용할 수 있습니다.


49장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 지니계수가 높을수록 순도가 높다#

틀립니다.

지니계수는 낮을수록 불순도가 낮고 순도가 높습니다.

함정 2. 엔트로피는 높을수록 좋은 분할이다#

틀립니다.

엔트로피 역시 낮을수록 불순도가 낮습니다.

함정 3. 정보이득은 작을수록 좋다#

틀립니다.

정보이득은 클수록 좋은 분할입니다.

함정 4. CART는 엔트로피만 사용한다#

틀립니다.

제공된 학습자료에서는 지니계수와 연결합니다.

함정 5. CART는 다진 분할만 수행한다#

틀립니다.

이진 분할입니다.

함정 6. CART는 분류만 가능하다#

틀립니다.

Classification And Regression Tree이므로 분류와 회귀 모두 가능합니다.

함정 7. C4.5는 연속형 변수를 처리할 수 없다#

틀립니다.

제공된 학습자료에서는 C4.5가 연속형 변수를 처리할 수 있다고 설명합니다.

함정 8. CHAID는 지니계수 기반이다#

틀립니다.

카이제곱 χ² 검정 기반입니다.

함정 9. CHAID는 이진 분할만 가능하다#

틀립니다.

다진 분할이 가능합니다.

함정 10. 가지치기는 분기 전에 멈추는 규칙이다#

틀립니다.

분기 후 불필요한 가지를 제거합니다.

함정 11. 정지규칙은 트리를 만든 뒤 가지를 제거한다#

틀립니다.

트리 생성 과정에서 분기를 멈추는 조건입니다.


50장 지니계수 시험 직전 암기#

공식:

Gini(D) = 1 - Σ(pⱼ)²

Gini = 0#

→ 완전 순수

Gini 증가#

→ 불순도 증가

목표#

→ 낮은 Gini

한 줄로:

지니는 낮을수록 좋다

입니다.


51장 엔트로피 시험 직전 암기#

공식:

Entropy(D) = -Σ(pᵢ × log₂pᵢ)

Entropy = 0#

→ 완전 순수

이진 50:50#

→ Entropy = 1

목표#

→ 낮은 Entropy

따라서:

엔트로피도 낮을수록 좋다

입니다.


52장 정보이득 시험 직전 암기#

공식의 핵심은:

분할 전 엔트로피 − 분할 후 엔트로피

입니다.

좋은 분할#

→ 불순도를 크게 감소

→ Information Gain 큼

따라서:

IG는 클수록 좋다

입니다.


53장 의사결정나무 알고리즘 시험 직전 암기#

CART#

Gini

Binary

분류 + 회귀

ID3 / C4.5#

Entropy

Information Gain

다진 가능

C4.5 연속형 가능

CHAID#

χ²

Multi-way

범주형에 강함

가장 쉽게:

CART = 지니

C4.5 = 엔트로피

CHAID = 카이제곱

입니다.


54장 과적합 방지 시험 직전 암기#

Stopping Rule#

→ 분기 중단

→ 최소 레코드 수

→ 최대 깊이

→ 불순도 향상 최소값

Pruning#

→ 이미 만들어진 가지 제거

→ 과적합 방지

한 줄로:

Stopping은 멈추고, Pruning은 자른다

입니다.


55장 의사결정나무 핵심 비교표#

개념 핵심
지도학습 O
분류 가능
회귀 가능
Root Node 시작점
Internal Node 분기점
Leaf Node 최종 결과
Gini 낮을수록 좋음
Entropy 낮을수록 좋음
Information Gain 클수록 좋음
CART Gini, 이진
C4.5 Entropy, 연속형 가능
CHAID χ², 다진
Pruning 분기 후 제거
Stopping Rule 분기 중단

의사결정나무 FAQ#

의사결정나무란 무엇인가#

조건을 이용해 데이터를 반복적으로 분할하여 최종 분류나 회귀 결과를 결정하는 지도학습 알고리즘입니다.

의사결정나무의 시작점은 무엇인가#

Root Node입니다.

중간 분기점은 무엇인가#

Internal Node입니다.

최종 결과가 있는 노드는 무엇인가#

Terminal Node 또는 Leaf Node입니다.

의사결정나무는 분류만 가능한가#

아닙니다. 제공된 학습자료에서는 분류와 회귀 모두 가능하다고 설명합니다.

불순도란 무엇인가#

한 노드에 서로 다른 클래스가 얼마나 섞여 있는지를 나타냅니다.

지니계수는 어느 방향이 좋은가#

낮을수록 불순도가 낮고 순도가 높습니다.

지니계수 공식은 무엇인가#

1 - Σ(pⱼ)²

입니다.

지니계수가 0이면 무엇을 의미하는가#

한 클래스만 존재하는 완전히 순수한 노드입니다.

엔트로피는 어느 방향이 좋은가#

낮을수록 좋습니다.

이진 분류에서 50:50이면 엔트로피는 얼마인가#

제공된 학습자료 기준 1입니다.

정보이득은 어느 방향이 좋은가#

클수록 좋은 분할입니다.

CART는 무엇을 사용하는가#

지니계수를 사용하며 이진 분할을 수행합니다.

CART는 회귀도 가능한가#

네. Classification And Regression Tree이므로 분류와 회귀 모두 가능합니다.

C4.5는 무엇을 사용하는가#

제공된 학습자료에서는 엔트로피와 정보이득 기반으로 설명합니다.

C4.5는 연속형 변수도 처리 가능한가#

네.

CHAID는 무엇을 사용하는가#

카이제곱 χ² 검정을 사용합니다.

CHAID는 어떤 분할을 하는가#

다진 분할 Multi-way이 가능합니다.

가지치기는 무엇인가#

과적합을 방지하기 위해 이미 만들어진 트리의 불필요한 가지를 제거하는 과정입니다.

정지규칙은 무엇인가#

트리를 생성하는 과정에서 더 이상 분기하지 않고 현재 노드를 Leaf Node로 만드는 규칙입니다.

정지규칙과 가지치기의 차이는 무엇인가#

정지규칙은 분기 중에 멈추는 것, 가지치기는 분기 후 제거하는 것입니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. Root·Internal·Leaf Node를 구분할 수 있는가?
  2. 의사결정나무가 지도학습이라는 것을 알고 있는가?
  3. 분류와 회귀 모두 가능하다는 것을 알고 있는가?
  4. 불순도가 무엇인지 설명할 수 있는가?
  5. 지니계수 공식을 기억하고 있는가?
  6. Gini = 0의 의미를 알고 있는가?
  7. 지니계수는 낮을수록 좋다는 것을 알고 있는가?
  8. 엔트로피 공식의 의미를 알고 있는가?
  9. 이진 50:50에서 엔트로피가 최대라는 것을 알고 있는가?
  10. 정보이득은 클수록 좋다는 것을 알고 있는가?
  11. CART와 지니계수를 연결할 수 있는가?
  12. CART가 이진 분할이라는 것을 알고 있는가?
  13. C4.5와 엔트로피를 연결할 수 있는가?
  14. C4.5가 연속형 변수를 처리할 수 있다는 것을 알고 있는가?
  15. CHAID와 카이제곱을 연결할 수 있는가?
  16. CHAID가 다진 분할이라는 것을 알고 있는가?
  17. 가지치기의 목적을 설명할 수 있는가?
  18. 정지규칙과 가지치기의 순서 차이를 구분할 수 있는가?

이 글을 마치며#

의사결정나무는 질문을 반복하면서 데이터를 더 순수한 그룹으로 나누는 지도학습 모델입니다.

구조는:

Root → Internal → Leaf

로 이어집니다.

분할의 핵심은 불순도를 낮추는 것입니다.

따라서:

Gini는 낮을수록 좋고

Entropy도 낮을수록 좋습니다.

반대로:

Information Gain은 클수록 좋습니다.

알고리즘은 다음 세 가지 연결을 기억하면 됩니다.

CART = Gini + Binary

C4.5 = Entropy + 연속형 가능

CHAID = χ² + Multi-way

과적합 방지는:

Stopping Rule = 더 이상 분기하지 않기

Pruning = 만든 뒤 가지 제거

로 구분합니다.

시험 직전에는 다음 다섯 줄만 확실히 기억하면 됩니다.

의사결정나무 = 스무고개식 지도학습

Gini·Entropy는 낮을수록 좋음

Information Gain은 클수록 좋음

CART=지니 / C4.5=엔트로피 / CHAID=카이제곱

Stopping은 멈춤 / Pruning은 자름

이 페이지의 목차