앙상블 기법이란? 배깅·부스팅·랜덤포레스트·XGBoost·LightGBM·보팅·스태킹 쉽게 이해하기

1장 앙상블이란 무엇인가#

앙상블 Ensemble은 여러 개의 모델을 결합하여 더 좋은 예측 결과를 만드는 방법입니다.

한 명의 판단보다 여러 사람의 판단을 모으면 더 안정적인 결론을 얻을 수 있는 것과 비슷합니다.

제공된 학습자료에서는 앙상블을 쉽게:

여러 모델을 합쳐서 더 좋은 결과 만들기

라고 설명합니다.

예를 들어 의사결정나무 하나만 사용하는 대신 나무를 100개 만들고 각 나무의 예측 결과를 모아 최종 결정을 내릴 수 있습니다.

이처럼 여러 모델의 장점을 결합하는 것이 앙상블의 기본 아이디어입니다.


2장 왜 여러 모델을 함께 사용할까#

하나의 모델은 데이터에 따라 결과가 크게 흔들리거나 특정 패턴을 충분히 학습하지 못할 수 있습니다.

여러 모델을 결합하면:

  • 결과의 변동을 줄이고
  • 특정 모델의 약점을 다른 모델이 보완하고
  • 더 안정적인 예측을 만들 수 있습니다.

제공된 ADsP 학습자료에서는 대표적인 앙상블 방식으로 다음을 다룹니다.

  • 배깅 Bagging
  • 부스팅 Boosting
  • 보팅 Voting
  • 스태킹 Stacking

시험에서는 이 네 기법의 학습 방식과 결합 방식을 구분하는 것이 중요합니다.


3장 배깅과 부스팅이 가장 중요하다#

앙상블에서 가장 먼저 비교해야 하는 것은 배깅과 부스팅입니다.

두 방식의 가장 중요한 차이는 학습 순서입니다.

배깅 Bagging#

병렬 학습

부스팅 Boosting#

순차 학습

이 한 줄을 먼저 기억하면 나머지 특징도 쉽게 연결할 수 있습니다.


4장 배깅 Bagging이란 무엇인가#

배깅은 여러 모델을 서로 독립적으로 병렬 학습시킨 후 예측 결과를 합치는 방식입니다.

제공된 학습자료의 비유를 이용하면 학생 10명이 각자 독립적으로 문제를 풀고 마지막에 다수결로 정답을 결정하는 것과 비슷합니다.

즉 모델 A가 학습한 결과를 모델 B가 이어받는 구조가 아닙니다.

각 모델이 따로 학습한 뒤 결과만 결합합니다.

핵심#

Bagging = 병렬

입니다.


5장 배깅에서 병렬이라는 것은 무엇인가#

예를 들어 의사결정나무 100개를 만든다고 하겠습니다.

각 나무는 서로 독립적으로 학습할 수 있습니다.

Tree 1

Tree 2

Tree 3

...

Tree 100

이 각각 예측한 뒤 마지막에 결과를 결합합니다.

즉:

모델 1 → 모델 2 → 모델 3

처럼 순서대로 이어지는 것이 아니라 여러 모델이 동시에 독립적인 방향으로 학습합니다.


6장 배깅의 핵심 효과는 분산 감소#

제공된 학습자료에서는 배깅의 핵심 효과를:

분산 감소

로 정리합니다.

모델 하나의 결과가 데이터 변화에 크게 흔들리더라도 여러 모델의 결과를 평균하거나 투표하면 전체 결과가 더 안정적일 수 있습니다.

쉽게 말하면:

한 명의 판단보다 여러 명의 평균적인 판단이 덜 흔들린다.

는 아이디어입니다.

시험 핵심#

배깅 = 병렬 = 분산 감소

입니다.


7장 배깅을 학생 비유로 이해하기#

학생 10명이 각자 독립적으로 시험문제를 푼다고 하겠습니다.

한 학생은 실수할 수 있습니다.

하지만 10명이 각각 문제를 풀고 가장 많은 학생이 선택한 답을 최종 정답으로 선택한다면 한 사람의 실수가 전체 결과에 미치는 영향을 줄일 수 있습니다.

이것이 제공된 학습자료에서 설명하는 배깅의 직관적인 모습입니다.


8장 배깅의 대표 알고리즘은 Random Forest#

제공된 학습자료에서 배깅의 대표적인 알고리즘은:

Random Forest

입니다.

Random Forest는 이름 그대로 여러 개의 의사결정나무를 이용합니다.

즉:

Forest = 여러 Tree의 집합

이라고 생각할 수 있습니다.

핵심#

Bagging → Random Forest

입니다.


9장 Random Forest는 어떻게 동작하는가#

제공된 학습자료에서는 Random Forest의 특징을 다음과 같이 정리합니다.

  • 배깅
  • 병렬 학습
  • 의사결정나무 다수 생성
  • 무작위 변수 선택
  • 분산 감소 효과

즉 하나의 거대한 나무에 모든 판단을 맡기기보다 여러 개의 서로 다른 나무를 만들고 결과를 결합합니다.


10장 Random Forest에서 무작위성이 중요한 이유#

Random Forest에서는 여러 나무가 모두 똑같은 구조가 되지 않도록 학습 과정에 무작위성을 사용합니다.

제공된 학습자료에서는 특히 무작위 변수 선택을 특징으로 제시합니다.

각 나무가 조금씩 다른 관점에서 데이터를 바라보게 만들고 그 결과를 모으는 것입니다.

시험에서는 상세 구현보다:

Random Forest = 여러 Decision Tree + Bagging

이라고 기억하는 것이 핵심입니다.


11장 Random Forest의 최종 예측#

분류 문제에서는 여러 나무가 각각 예측한 결과를 모아 다수결로 최종 결정을 내릴 수 있습니다.

예를 들어 다섯 나무의 예측이:

1

1

0

1

0

이라면 최종 결과는:

1

입니다.

제공된 학습자료에서는 배깅의 특징으로 이러한 다수결 투표를 강조합니다.


12장 부스팅 Boosting이란 무엇인가#

부스팅은 여러 모델을 순차적으로 학습하는 앙상블 방식입니다.

앞선 모델이 제대로 맞히지 못한 부분을 다음 모델이 집중적으로 보완합니다.

즉:

첫 번째 모델 학습

↓

오류 확인

↓

두 번째 모델이 오류 보완

↓

다시 오류 확인

↓

세 번째 모델이 추가 보완

과 같은 구조입니다.

핵심#

Boosting = 순차

입니다.


13장 부스팅을 학생 비유로 이해하기#

제공된 학습자료에서는 부스팅을 다음과 같이 설명합니다.

첫 번째 학생이 문제를 풀었습니다.

틀린 문제가 있었습니다.

두 번째 학생은 첫 번째 학생이 틀린 문제를 집중적으로 공부합니다.

그런데 여전히 틀린 문제가 있다면 세 번째 학생이 다시 보완합니다.

이 과정을 반복하면서 모델이 약한 부분을 계속 개선합니다.


14장 부스팅의 핵심 효과는 편향 감소#

제공된 학습자료에서는 부스팅의 대표적인 효과를:

편향 감소

로 정리합니다.

초기 모델의 부족한 부분을 다음 모델들이 지속적으로 보완하면서 모델의 예측능력을 높여가는 방식입니다.

시험 핵심#

부스팅 = 순차 = 편향 감소

입니다.


15장 배깅과 부스팅 비교#

구분 배깅 Bagging 부스팅 Boosting
학습 방식 병렬 순차
모델 관계 독립적 학습 이전 오류를 다음 모델이 보완
주요 효과 분산 감소 편향 감소
대표 알고리즘 Random Forest AdaBoost·XGBoost·LightGBM
결합 사고 여러 결과를 모음 약점을 단계적으로 개선

시험에서는 이 표의 연결관계를 정확하게 기억해야 합니다.


16장 배깅과 부스팅 암기법#

제공된 학습자료의 핵심 암기법입니다.

배깅 = 병렬 = 분산 감소

부스팅 = 순차 = 편향 감소

여기에 알고리즘까지 연결하면:

배깅 → Random Forest

부스팅 → AdaBoost·XGBoost·LightGBM

입니다.


17장 부스팅은 병렬로 학습하는가#

아닙니다.

제공된 학습자료의 대표적인 함정입니다.

부스팅은 여러 모델을 병렬로 학습한다.

틀립니다.

부스팅은 앞선 모델의 결과를 다음 모델이 보완해야 하므로 기본적인 학습 구조는 순차적입니다.

시험 핵심#

Boosting ≠ 병렬

Boosting = 순차

입니다.


18장 AdaBoost란 무엇인가#

AdaBoost는 제공된 학습자료에서 대표적인 부스팅 알고리즘으로 제시됩니다.

주요 특징은:

  • 부스팅
  • 순차 학습
  • 오분류 샘플의 가중치 증가
  • 최초 부스팅 알고리즘
  • 편향 감소 효과

입니다.

특히 틀린 데이터에 더 많은 관심을 준다는 점이 핵심입니다.


19장 AdaBoost의 가중치 증가를 쉽게 이해하면#

첫 번째 모델이 데이터 100개 가운데 20개를 틀렸다고 하겠습니다.

다음 모델에서는 모든 데이터에 똑같이 집중하는 것이 아니라 앞서 틀렸던 데이터의 중요도를 높여 학습합니다.

즉:

이전 모델이 어려워했던 문제를 더 집중적으로 공부한다.

는 방식입니다.

핵심#

AdaBoost = 오분류 샘플 가중치 증가

입니다.


20장 XGBoost란 무엇인가#

XGBoost는 대표적인 부스팅 알고리즘입니다.

제공된 학습자료에서는 다음 특징을 제시합니다.

  • 부스팅
  • 순차 학습
  • 잔차 학습
  • 정규화
  • 병렬 처리 지원
  • 높은 정확도

시험에서는 특히 XGBoost가 Boosting 계열이라는 점을 명확하게 기억해야 합니다.


21장 XGBoost가 병렬 처리를 지원하면 배깅인가#

아닙니다.

이 부분은 이름만 보고 혼동하기 쉽습니다.

제공된 학습자료에서는 XGBoost 자체를:

부스팅·순차 학습

으로 분류하면서 동시에 병렬 처리 지원이라는 구현상의 특징을 제시합니다.

따라서:

병렬 처리 지원 = Bagging이라는 뜻은 아님

입니다.

시험에서 알고리즘 계열을 묻는다면:

XGBoost = Boosting

입니다.


22장 XGBoost의 잔차 학습#

제공된 학습자료에서는 XGBoost를 잔차 학습과 연결합니다.

쉽게 생각하면 이전 모델이 충분히 설명하지 못한 부분을 다음 모델이 계속 학습하여 보완하는 구조입니다.

즉 부스팅의 기본 철학인:

이전 오류를 다음 모델이 보완

한다는 흐름과 연결됩니다.


23장 XGBoost의 정규화#

제공된 학습자료에서는 XGBoost 특징 가운데 정규화도 제시합니다.

정규화는 모델이 지나치게 복잡해지는 것을 억제하는 방향과 연결하여 이해할 수 있습니다.

ADsP에서는 세부 수식보다는 다음 연결을 기억하는 것이 좋습니다.

XGBoost → Boosting → 잔차 학습 + 정규화

입니다.


24장 LightGBM이란 무엇인가#

LightGBM 역시 대표적인 부스팅 알고리즘입니다.

제공된 학습자료에서는 다음 특징을 제시합니다.

  • 부스팅
  • 순차 학습
  • Leaf-wise 분할 전략
  • 대용량 데이터 고속 처리
  • 메모리 효율적

핵심#

LightGBM = Boosting + Leaf-wise + 빠른 대용량 처리

입니다.


25장 Leaf-wise란 무엇인가#

제공된 학습자료에서는 LightGBM의 핵심 특징으로 Leaf-wise 분할 전략을 제시합니다.

시험에서는 상세한 트리 생성 알고리즘보다:

LightGBM → Leaf-wise

를 직접 연결해서 기억하는 것이 중요합니다.

특히 XGBoost와 LightGBM을 보기에 함께 제시하고 특징을 바꾸는 문제가 나올 수 있습니다.


26장 Random Forest·AdaBoost·XGBoost·LightGBM 비교#

알고리즘 계열 핵심 특징
Random Forest Bagging 여러 의사결정나무, 무작위 변수 선택
AdaBoost Boosting 오분류 샘플 가중치 증가
XGBoost Boosting 잔차 학습·정규화·병렬 처리 지원
LightGBM Boosting Leaf-wise·대용량 고속 처리·메모리 효율

알고리즘 이름과 특징을 서로 바꾸어 출제하는 문제에 주의해야 합니다.


27장 Random Forest와 XGBoost의 가장 큰 차이#

둘 다 여러 의사결정나무를 활용할 수 있지만 학습 방식이 다릅니다.

Random Forest#

여러 나무를 독립적으로 만듭니다.

→ Bagging

→ 병렬적 사고

XGBoost#

앞 모델의 오류를 다음 모델이 보완합니다.

→ Boosting

→ 순차적 사고

따라서:

Random Forest = 함께

XGBoost = 이어서

라고 생각하면 쉽게 구분할 수 있습니다.


28장 보팅 Voting이란 무엇인가#

보팅은 여러 모델이 만든 예측 결과를 투표하거나 평균하여 최종 결과를 결정하는 방법입니다.

제공된 학습자료에서는 보팅을:

다른 알고리즘의 결과를 병렬적으로 결합

하는 방식으로 정리합니다.

예를 들어:

  • 로지스틱 회귀
  • 의사결정나무
  • K-NN

이 각각 결과를 예측하고 이를 투표해 최종 결과를 만들 수 있습니다.


29장 하드 보팅 Hard Voting이란 무엇인가#

하드 보팅은 각 모델의 최종 분류 결과를 직접 투표합니다.

예를 들어 세 모델의 예측이:

1

1

0

이라면 다수결로:

1

을 최종 결과로 선택합니다.

핵심#

Hard Voting = 다수결

입니다.


30장 소프트 보팅 Soft Voting이란 무엇인가#

소프트 보팅은 모델이 출력한 확률을 평균하여 최종 결과를 결정합니다.

예를 들어 세 모델의 1 클래스 확률이:

0.8

0.7

0.3

이라고 하겠습니다.

이 확률들의 평균을 이용해 최종 결과를 결정할 수 있습니다.

핵심#

Soft Voting = 확률 평균

입니다.


31장 하드 보팅과 소프트 보팅 비교#

방식 사용하는 값 핵심
Hard Voting 최종 클래스 다수결
Soft Voting 예측 확률 확률 평균

시험에서는:

Hard = 결과

Soft = 확률

이라고 기억하면 쉽습니다.


32장 스태킹 Stacking이란 무엇인가#

스태킹은 여러 모델의 예측 결과를 단순히 투표하는 것이 아니라 다른 모델의 입력값으로 다시 사용하는 방식입니다.

제공된 학습자료에서는:

1단계 모델의 예측값을 입력으로 2단계 메타 모델이 최종 예측

한다고 설명합니다.

즉 두 단계 구조를 가집니다.


33장 스태킹의 1단계와 2단계#

1단계#

여러 기본 모델이 각각 예측합니다.

예:

  • Random Forest
  • Logistic Regression
  • K-NN

2단계#

1단계 모델이 만든 예측값들을 새로운 입력 데이터로 사용합니다.

이를 메타 모델 Meta Model이 다시 학습하여 최종 결과를 결정합니다.

핵심#

Stacking = 예측 결과를 다시 학습

입니다.


34장 스태킹을 쉽게 이해하면#

세 명의 전문가가 각각 의견을 냈다고 생각해봅시다.

보팅은:

세 명 중 가장 많은 의견을 채택하자.

입니다.

스태킹은:

세 명의 의견을 다시 전문 판정관에게 주고, 누가 어떤 상황에서 잘 맞는지까지 학습해서 최종 결정을 내리자.

에 가깝습니다.

따라서 단순 투표보다 구조가 한 단계 더 복잡합니다.


35장 스태킹의 장점과 주의점#

제공된 학습자료에서는 스태킹의 특징으로:

  • 이질적인 모델 조합
  • 성능 극대화
  • 과적합 위험

을 제시합니다.

서로 다른 모델의 강점을 메타 모델이 조합할 수 있지만 구조가 복잡해지는 만큼 과적합 가능성에도 주의해야 합니다.


36장 보팅과 스태킹 차이#

Voting#

여러 모델의 결과를:

투표 또는 평균

Stacking#

여러 모델의 결과를:

메타 모델의 입력으로 사용

입니다.

따라서:

Voting = 직접 결합

Stacking = 한 번 더 학습

으로 기억하면 쉽습니다.


37장 배깅과 보팅은 어떻게 다른가#

둘 다 여러 모델의 결과를 모을 수 있어서 헷갈릴 수 있습니다.

제공된 학습자료의 정리에서는 다음처럼 구분합니다.

Bagging#

같은 알고리즘

을 여러 번 병렬적으로 학습

대표:

Random Forest의 여러 Decision Tree

Voting#

다른 알고리즘

들의 예측을 결합

예:

Logistic Regression + K-NN + Decision Tree

핵심#

Bagging = 같은 모델 여러 개

Voting = 다른 모델 여러 개

입니다.


38장 부스팅과 스태킹은 어떻게 다른가#

Boosting#

같은 계열의 모델을 순차적으로 학습하면서 이전 오류를 보완합니다.

Stacking#

여러 이질적인 모델의 예측 결과를 메타 모델이 다시 학습합니다.

따라서:

Boosting = 이전 모델의 오류를 다음 모델이 보완

Stacking = 여러 모델 결과를 새로운 모델이 통합

입니다.


39장 앙상블 전체 비교#

기법 모델 구성 학습·결합 방식 핵심
Bagging 같은 알고리즘 중심 병렬 분산 감소
Boosting 같은 알고리즘 중심 순차 편향 감소
Voting 다른 알고리즘 병렬 결과 결합 다수결·확률 평균
Stacking 다른 알고리즘 2단계 메타 모델

이 표를 이해하면 앙상블 관련 문제 대부분을 구분하기 쉽습니다.


40장 앙상블 기법 암기법#

제공된 학습자료의 전체 정리를 그대로 연결하면 다음과 같습니다.

배깅#

같은 알고리즘 병렬

→ 분산 감소

→ Random Forest

부스팅#

같은 알고리즘 순차

→ 편향 감소

→ XGBoost·AdaBoost·LightGBM

보팅#

다른 알고리즘 병렬

→ 다수결 또는 평균

스태킹#

다른 알고리즘 2단계

→ 메타 모델

입니다.


41장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 배깅은 순차 학습이다#

틀립니다.

병렬 학습입니다.

함정 2. 부스팅은 병렬 학습이다#

틀립니다.

제공된 학습자료에서는 순차 학습으로 정리합니다.

함정 3. 배깅의 대표 알고리즘은 XGBoost다#

틀립니다.

Random Forest입니다.

함정 4. Random Forest는 부스팅 기법이다#

틀립니다.

배깅입니다.

함정 5. AdaBoost는 오분류 샘플의 가중치를 낮춘다#

틀립니다.

제공된 학습자료에서는 오분류 샘플의 가중치를 증가시킵니다.

함정 6. XGBoost는 배깅 알고리즘이다#

틀립니다.

부스팅입니다.

함정 7. LightGBM은 Leaf-wise 전략과 관련이 없다#

틀립니다.

제공된 학습자료의 핵심 특징입니다.

함정 8. 하드 보팅은 예측 확률을 평균한다#

틀립니다.

다수결입니다.

함정 9. 소프트 보팅은 클래스 결과만 투표한다#

틀립니다.

확률 평균을 사용합니다.

함정 10. 스태킹은 단순히 다수결로 결과를 결정한다#

틀립니다.

메타 모델이 최종 예측합니다.


42장 배깅 시험 직전 암기#

Bagging

→ 병렬

→ 여러 모델 독립 학습

→ 결과 결합

→ 분산 감소

대표:

Random Forest

한 줄로:

배깅 = 각자 풀고 마지막에 투표

입니다.


43장 부스팅 시험 직전 암기#

Boosting

→ 순차

→ 이전 오류에 집중

→ 편향 감소

대표:

  • AdaBoost
  • XGBoost
  • LightGBM

한 줄로:

부스팅 = 앞사람이 틀린 것을 뒷사람이 고친다

입니다.


44장 Random Forest 시험 직전 암기#

Random Forest

→ Bagging

→ 여러 Decision Tree

→ 무작위 변수 선택

→ 병렬 학습

→ 분산 감소

→ 다수결

입니다.

가장 중요한 연결은:

Random Forest = Bagging

입니다.


45장 AdaBoost 시험 직전 암기#

AdaBoost

→ Boosting

→ 순차

→ 오분류 샘플 가중치 증가

→ 이전 오류 보완

→ 편향 감소

입니다.


46장 XGBoost 시험 직전 암기#

XGBoost

→ Boosting

→ 순차 학습

→ 잔차 학습

→ 정규화

→ 병렬 처리 지원

→ 높은 정확도

중요한 함정:

병렬 처리 지원이 있어도 계열은 Boosting

입니다.


47장 LightGBM 시험 직전 암기#

LightGBM

→ Boosting

→ 순차

→ Leaf-wise

→ 대용량 데이터 고속 처리

→ 메모리 효율적

입니다.

시험에서는:

LightGBM = Leaf-wise

를 강하게 연결해두는 것이 좋습니다.


48장 Voting 시험 직전 암기#

Hard Voting#

→ 클래스 투표

→ 다수결

예:

1, 1, 0 → 1

Soft Voting#

→ 예측 확률 평균

따라서:

Hard = 결과

Soft = 확률

입니다.


49장 Stacking 시험 직전 암기#

Stacking

→ 이질적 모델

→ 1단계에서 예측

→ 예측값을 새 입력으로 사용

→ 2단계 Meta Model

→ 최종 예측

→ 성능 향상 가능

→ 과적합 위험

한 줄로:

스태킹 = 모델 위에 모델

입니다.


50장 앙상블 알고리즘 핵심 비교표#

알고리즘·기법 분류 가장 중요한 특징
Bagging 병렬 분산 감소
Random Forest Bagging 여러 나무·무작위 변수
Boosting 순차 편향 감소
AdaBoost Boosting 오분류 가중치 증가
XGBoost Boosting 잔차·정규화
LightGBM Boosting Leaf-wise·고속 처리
Hard Voting Voting 다수결
Soft Voting Voting 확률 평균
Stacking 2단계 앙상블 메타 모델

앙상블 기법 FAQ#

앙상블이란 무엇인가#

여러 모델의 예측 결과를 결합해 하나의 모델보다 더 안정적이거나 좋은 예측결과를 만드는 방법입니다.

배깅과 부스팅의 가장 큰 차이는 무엇인가#

배깅은 병렬적으로 학습하고 부스팅은 순차적으로 학습합니다.

배깅의 주요 효과는 무엇인가#

제공된 학습자료에서는 분산 감소로 설명합니다.

부스팅의 주요 효과는 무엇인가#

제공된 학습자료에서는 편향 감소로 설명합니다.

배깅의 대표 알고리즘은 무엇인가#

Random Forest입니다.

Random Forest는 무엇을 여러 개 사용하는가#

여러 개의 의사결정나무를 사용합니다.

부스팅의 대표 알고리즘은 무엇인가#

AdaBoost, XGBoost, LightGBM이 있습니다.

AdaBoost의 핵심 특징은 무엇인가#

이전 모델이 오분류한 샘플의 가중치를 높여 다음 모델이 더 집중하도록 합니다.

XGBoost의 특징은 무엇인가#

제공된 학습자료에서는 잔차 학습, 정규화, 병렬 처리 지원, 높은 정확도를 특징으로 제시합니다.

XGBoost는 병렬 처리를 지원하므로 배깅인가#

아닙니다. 제공된 학습자료 기준 XGBoost는 부스팅 알고리즘입니다.

LightGBM의 대표적인 특징은 무엇인가#

Leaf-wise 분할 전략과 대용량 데이터의 고속 처리, 메모리 효율성입니다.

Hard Voting이란 무엇인가#

여러 모델이 예측한 클래스 결과를 다수결로 결정하는 방법입니다.

Soft Voting이란 무엇인가#

여러 모델이 예측한 확률을 평균하여 최종 결과를 결정하는 방법입니다.

Stacking이란 무엇인가#

여러 1단계 모델의 예측 결과를 새로운 입력값으로 사용하고 2단계 메타 모델이 최종 예측하는 방식입니다.

Stacking의 주의점은 무엇인가#

제공된 학습자료에서는 과적합 위험을 주의점으로 제시합니다.

Bagging과 Voting의 차이는 무엇인가#

제공된 학습자료의 정리에서는 Bagging을 같은 알고리즘의 병렬 학습, Voting을 다른 알고리즘의 예측 결과 결합으로 구분합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 앙상블이 무엇인지 설명할 수 있는가?
  2. 배깅과 부스팅의 학습방식을 구분할 수 있는가?
  3. 배깅이 병렬이라는 것을 알고 있는가?
  4. 부스팅이 순차라는 것을 알고 있는가?
  5. 배깅을 분산 감소와 연결할 수 있는가?
  6. 부스팅을 편향 감소와 연결할 수 있는가?
  7. Random Forest가 Bagging이라는 것을 알고 있는가?
  8. Random Forest가 여러 의사결정나무를 이용한다는 것을 알고 있는가?
  9. AdaBoost의 오분류 가중치 증가를 기억하고 있는가?
  10. XGBoost가 Boosting이라는 것을 알고 있는가?
  11. XGBoost의 병렬 처리 지원과 Bagging을 혼동하지 않을 수 있는가?
  12. LightGBM과 Leaf-wise를 연결할 수 있는가?
  13. Hard Voting과 Soft Voting의 차이를 설명할 수 있는가?
  14. Stacking에서 메타 모델의 역할을 알고 있는가?
  15. Bagging·Boosting·Voting·Stacking을 서로 구분할 수 있는가?

이 글을 마치며#

앙상블의 핵심은 모델 하나에 모든 판단을 맡기지 않고 여러 모델의 결과를 결합하는 것입니다.

가장 먼저 배깅과 부스팅을 구분해야 합니다.

Bagging

→ 병렬

→ 분산 감소

→ Random Forest

Boosting

→ 순차

→ 이전 오류 보완

→ 편향 감소

→ AdaBoost·XGBoost·LightGBM

입니다.

각 알고리즘의 핵심은:

Random Forest = 여러 의사결정나무 + 무작위 변수

AdaBoost = 오분류 샘플 가중치 증가

XGBoost = 잔차 학습 + 정규화

LightGBM = Leaf-wise + 대용량 고속 처리

로 기억합니다.

보팅은:

Hard = 다수결

Soft = 확률 평균

입니다.

스태킹은:

여러 모델의 예측값 → 메타 모델 → 최종 결과

의 2단계 구조입니다.

시험 직전에는 다음 네 줄로 압축하면 됩니다.

배깅 = 병렬 = 분산 감소 = Random Forest

부스팅 = 순차 = 편향 감소 = AdaBoost·XGBoost·LightGBM

보팅 = 다른 모델들의 다수결·확률 평균

스태킹 = 다른 모델들의 예측을 메타 모델이 다시 학습

이 페이지의 목차