앙상블 기법이란? 배깅·부스팅·랜덤포레스트·XGBoost·LightGBM·보팅·스태킹 쉽게 이해하기
1장 앙상블이란 무엇인가#
앙상블 Ensemble은 여러 개의 모델을 결합하여 더 좋은 예측 결과를 만드는 방법입니다.
한 명의 판단보다 여러 사람의 판단을 모으면 더 안정적인 결론을 얻을 수 있는 것과 비슷합니다.
제공된 학습자료에서는 앙상블을 쉽게:
여러 모델을 합쳐서 더 좋은 결과 만들기
라고 설명합니다.
예를 들어 의사결정나무 하나만 사용하는 대신 나무를 100개 만들고 각 나무의 예측 결과를 모아 최종 결정을 내릴 수 있습니다.
이처럼 여러 모델의 장점을 결합하는 것이 앙상블의 기본 아이디어입니다.
2장 왜 여러 모델을 함께 사용할까#
하나의 모델은 데이터에 따라 결과가 크게 흔들리거나 특정 패턴을 충분히 학습하지 못할 수 있습니다.
여러 모델을 결합하면:
- 결과의 변동을 줄이고
- 특정 모델의 약점을 다른 모델이 보완하고
- 더 안정적인 예측을 만들 수 있습니다.
제공된 ADsP 학습자료에서는 대표적인 앙상블 방식으로 다음을 다룹니다.
- 배깅 Bagging
- 부스팅 Boosting
- 보팅 Voting
- 스태킹 Stacking
시험에서는 이 네 기법의 학습 방식과 결합 방식을 구분하는 것이 중요합니다.
3장 배깅과 부스팅이 가장 중요하다#
앙상블에서 가장 먼저 비교해야 하는 것은 배깅과 부스팅입니다.
두 방식의 가장 중요한 차이는 학습 순서입니다.
배깅 Bagging#
병렬 학습
부스팅 Boosting#
순차 학습
이 한 줄을 먼저 기억하면 나머지 특징도 쉽게 연결할 수 있습니다.
4장 배깅 Bagging이란 무엇인가#
배깅은 여러 모델을 서로 독립적으로 병렬 학습시킨 후 예측 결과를 합치는 방식입니다.
제공된 학습자료의 비유를 이용하면 학생 10명이 각자 독립적으로 문제를 풀고 마지막에 다수결로 정답을 결정하는 것과 비슷합니다.
즉 모델 A가 학습한 결과를 모델 B가 이어받는 구조가 아닙니다.
각 모델이 따로 학습한 뒤 결과만 결합합니다.
핵심#
Bagging = 병렬
입니다.
5장 배깅에서 병렬이라는 것은 무엇인가#
예를 들어 의사결정나무 100개를 만든다고 하겠습니다.
각 나무는 서로 독립적으로 학습할 수 있습니다.
Tree 1
Tree 2
Tree 3
...
Tree 100
이 각각 예측한 뒤 마지막에 결과를 결합합니다.
즉:
모델 1 → 모델 2 → 모델 3
처럼 순서대로 이어지는 것이 아니라 여러 모델이 동시에 독립적인 방향으로 학습합니다.
6장 배깅의 핵심 효과는 분산 감소#
제공된 학습자료에서는 배깅의 핵심 효과를:
분산 감소
로 정리합니다.
모델 하나의 결과가 데이터 변화에 크게 흔들리더라도 여러 모델의 결과를 평균하거나 투표하면 전체 결과가 더 안정적일 수 있습니다.
쉽게 말하면:
한 명의 판단보다 여러 명의 평균적인 판단이 덜 흔들린다.
는 아이디어입니다.
시험 핵심#
배깅 = 병렬 = 분산 감소
입니다.
7장 배깅을 학생 비유로 이해하기#
학생 10명이 각자 독립적으로 시험문제를 푼다고 하겠습니다.
한 학생은 실수할 수 있습니다.
하지만 10명이 각각 문제를 풀고 가장 많은 학생이 선택한 답을 최종 정답으로 선택한다면 한 사람의 실수가 전체 결과에 미치는 영향을 줄일 수 있습니다.
이것이 제공된 학습자료에서 설명하는 배깅의 직관적인 모습입니다.
8장 배깅의 대표 알고리즘은 Random Forest#
제공된 학습자료에서 배깅의 대표적인 알고리즘은:
Random Forest
입니다.
Random Forest는 이름 그대로 여러 개의 의사결정나무를 이용합니다.
즉:
Forest = 여러 Tree의 집합
이라고 생각할 수 있습니다.
핵심#
Bagging → Random Forest
입니다.
9장 Random Forest는 어떻게 동작하는가#
제공된 학습자료에서는 Random Forest의 특징을 다음과 같이 정리합니다.
- 배깅
- 병렬 학습
- 의사결정나무 다수 생성
- 무작위 변수 선택
- 분산 감소 효과
즉 하나의 거대한 나무에 모든 판단을 맡기기보다 여러 개의 서로 다른 나무를 만들고 결과를 결합합니다.
10장 Random Forest에서 무작위성이 중요한 이유#
Random Forest에서는 여러 나무가 모두 똑같은 구조가 되지 않도록 학습 과정에 무작위성을 사용합니다.
제공된 학습자료에서는 특히 무작위 변수 선택을 특징으로 제시합니다.
각 나무가 조금씩 다른 관점에서 데이터를 바라보게 만들고 그 결과를 모으는 것입니다.
시험에서는 상세 구현보다:
Random Forest = 여러 Decision Tree + Bagging
이라고 기억하는 것이 핵심입니다.
11장 Random Forest의 최종 예측#
분류 문제에서는 여러 나무가 각각 예측한 결과를 모아 다수결로 최종 결정을 내릴 수 있습니다.
예를 들어 다섯 나무의 예측이:
1
1
0
1
0
이라면 최종 결과는:
1
입니다.
제공된 학습자료에서는 배깅의 특징으로 이러한 다수결 투표를 강조합니다.
12장 부스팅 Boosting이란 무엇인가#
부스팅은 여러 모델을 순차적으로 학습하는 앙상블 방식입니다.
앞선 모델이 제대로 맞히지 못한 부분을 다음 모델이 집중적으로 보완합니다.
즉:
첫 번째 모델 학습
↓
오류 확인
↓
두 번째 모델이 오류 보완
↓
다시 오류 확인
↓
세 번째 모델이 추가 보완
과 같은 구조입니다.
핵심#
Boosting = 순차
입니다.
13장 부스팅을 학생 비유로 이해하기#
제공된 학습자료에서는 부스팅을 다음과 같이 설명합니다.
첫 번째 학생이 문제를 풀었습니다.
틀린 문제가 있었습니다.
두 번째 학생은 첫 번째 학생이 틀린 문제를 집중적으로 공부합니다.
그런데 여전히 틀린 문제가 있다면 세 번째 학생이 다시 보완합니다.
이 과정을 반복하면서 모델이 약한 부분을 계속 개선합니다.
14장 부스팅의 핵심 효과는 편향 감소#
제공된 학습자료에서는 부스팅의 대표적인 효과를:
편향 감소
로 정리합니다.
초기 모델의 부족한 부분을 다음 모델들이 지속적으로 보완하면서 모델의 예측능력을 높여가는 방식입니다.
시험 핵심#
부스팅 = 순차 = 편향 감소
입니다.
15장 배깅과 부스팅 비교#
| 구분 | 배깅 Bagging | 부스팅 Boosting |
|---|---|---|
| 학습 방식 | 병렬 | 순차 |
| 모델 관계 | 독립적 학습 | 이전 오류를 다음 모델이 보완 |
| 주요 효과 | 분산 감소 | 편향 감소 |
| 대표 알고리즘 | Random Forest | AdaBoost·XGBoost·LightGBM |
| 결합 사고 | 여러 결과를 모음 | 약점을 단계적으로 개선 |
시험에서는 이 표의 연결관계를 정확하게 기억해야 합니다.
16장 배깅과 부스팅 암기법#
제공된 학습자료의 핵심 암기법입니다.
배깅 = 병렬 = 분산 감소
부스팅 = 순차 = 편향 감소
여기에 알고리즘까지 연결하면:
배깅 → Random Forest
부스팅 → AdaBoost·XGBoost·LightGBM
입니다.
17장 부스팅은 병렬로 학습하는가#
아닙니다.
제공된 학습자료의 대표적인 함정입니다.
부스팅은 여러 모델을 병렬로 학습한다.
틀립니다.
부스팅은 앞선 모델의 결과를 다음 모델이 보완해야 하므로 기본적인 학습 구조는 순차적입니다.
시험 핵심#
Boosting ≠ 병렬
Boosting = 순차
입니다.
18장 AdaBoost란 무엇인가#
AdaBoost는 제공된 학습자료에서 대표적인 부스팅 알고리즘으로 제시됩니다.
주요 특징은:
- 부스팅
- 순차 학습
- 오분류 샘플의 가중치 증가
- 최초 부스팅 알고리즘
- 편향 감소 효과
입니다.
특히 틀린 데이터에 더 많은 관심을 준다는 점이 핵심입니다.
19장 AdaBoost의 가중치 증가를 쉽게 이해하면#
첫 번째 모델이 데이터 100개 가운데 20개를 틀렸다고 하겠습니다.
다음 모델에서는 모든 데이터에 똑같이 집중하는 것이 아니라 앞서 틀렸던 데이터의 중요도를 높여 학습합니다.
즉:
이전 모델이 어려워했던 문제를 더 집중적으로 공부한다.
는 방식입니다.
핵심#
AdaBoost = 오분류 샘플 가중치 증가
입니다.
20장 XGBoost란 무엇인가#
XGBoost는 대표적인 부스팅 알고리즘입니다.
제공된 학습자료에서는 다음 특징을 제시합니다.
- 부스팅
- 순차 학습
- 잔차 학습
- 정규화
- 병렬 처리 지원
- 높은 정확도
시험에서는 특히 XGBoost가 Boosting 계열이라는 점을 명확하게 기억해야 합니다.
21장 XGBoost가 병렬 처리를 지원하면 배깅인가#
아닙니다.
이 부분은 이름만 보고 혼동하기 쉽습니다.
제공된 학습자료에서는 XGBoost 자체를:
부스팅·순차 학습
으로 분류하면서 동시에 병렬 처리 지원이라는 구현상의 특징을 제시합니다.
따라서:
병렬 처리 지원 = Bagging이라는 뜻은 아님
입니다.
시험에서 알고리즘 계열을 묻는다면:
XGBoost = Boosting
입니다.
22장 XGBoost의 잔차 학습#
제공된 학습자료에서는 XGBoost를 잔차 학습과 연결합니다.
쉽게 생각하면 이전 모델이 충분히 설명하지 못한 부분을 다음 모델이 계속 학습하여 보완하는 구조입니다.
즉 부스팅의 기본 철학인:
이전 오류를 다음 모델이 보완
한다는 흐름과 연결됩니다.
23장 XGBoost의 정규화#
제공된 학습자료에서는 XGBoost 특징 가운데 정규화도 제시합니다.
정규화는 모델이 지나치게 복잡해지는 것을 억제하는 방향과 연결하여 이해할 수 있습니다.
ADsP에서는 세부 수식보다는 다음 연결을 기억하는 것이 좋습니다.
XGBoost → Boosting → 잔차 학습 + 정규화
입니다.
24장 LightGBM이란 무엇인가#
LightGBM 역시 대표적인 부스팅 알고리즘입니다.
제공된 학습자료에서는 다음 특징을 제시합니다.
- 부스팅
- 순차 학습
- Leaf-wise 분할 전략
- 대용량 데이터 고속 처리
- 메모리 효율적
핵심#
LightGBM = Boosting + Leaf-wise + 빠른 대용량 처리
입니다.
25장 Leaf-wise란 무엇인가#
제공된 학습자료에서는 LightGBM의 핵심 특징으로 Leaf-wise 분할 전략을 제시합니다.
시험에서는 상세한 트리 생성 알고리즘보다:
LightGBM → Leaf-wise
를 직접 연결해서 기억하는 것이 중요합니다.
특히 XGBoost와 LightGBM을 보기에 함께 제시하고 특징을 바꾸는 문제가 나올 수 있습니다.
26장 Random Forest·AdaBoost·XGBoost·LightGBM 비교#
| 알고리즘 | 계열 | 핵심 특징 |
|---|---|---|
| Random Forest | Bagging | 여러 의사결정나무, 무작위 변수 선택 |
| AdaBoost | Boosting | 오분류 샘플 가중치 증가 |
| XGBoost | Boosting | 잔차 학습·정규화·병렬 처리 지원 |
| LightGBM | Boosting | Leaf-wise·대용량 고속 처리·메모리 효율 |
알고리즘 이름과 특징을 서로 바꾸어 출제하는 문제에 주의해야 합니다.
27장 Random Forest와 XGBoost의 가장 큰 차이#
둘 다 여러 의사결정나무를 활용할 수 있지만 학습 방식이 다릅니다.
Random Forest#
여러 나무를 독립적으로 만듭니다.
→ Bagging
→ 병렬적 사고
XGBoost#
앞 모델의 오류를 다음 모델이 보완합니다.
→ Boosting
→ 순차적 사고
따라서:
Random Forest = 함께
XGBoost = 이어서
라고 생각하면 쉽게 구분할 수 있습니다.
28장 보팅 Voting이란 무엇인가#
보팅은 여러 모델이 만든 예측 결과를 투표하거나 평균하여 최종 결과를 결정하는 방법입니다.
제공된 학습자료에서는 보팅을:
다른 알고리즘의 결과를 병렬적으로 결합
하는 방식으로 정리합니다.
예를 들어:
- 로지스틱 회귀
- 의사결정나무
- K-NN
이 각각 결과를 예측하고 이를 투표해 최종 결과를 만들 수 있습니다.
29장 하드 보팅 Hard Voting이란 무엇인가#
하드 보팅은 각 모델의 최종 분류 결과를 직접 투표합니다.
예를 들어 세 모델의 예측이:
1
1
0
이라면 다수결로:
1
을 최종 결과로 선택합니다.
핵심#
Hard Voting = 다수결
입니다.
30장 소프트 보팅 Soft Voting이란 무엇인가#
소프트 보팅은 모델이 출력한 확률을 평균하여 최종 결과를 결정합니다.
예를 들어 세 모델의 1 클래스 확률이:
0.8
0.7
0.3
이라고 하겠습니다.
이 확률들의 평균을 이용해 최종 결과를 결정할 수 있습니다.
핵심#
Soft Voting = 확률 평균
입니다.
31장 하드 보팅과 소프트 보팅 비교#
| 방식 | 사용하는 값 | 핵심 |
|---|---|---|
| Hard Voting | 최종 클래스 | 다수결 |
| Soft Voting | 예측 확률 | 확률 평균 |
시험에서는:
Hard = 결과
Soft = 확률
이라고 기억하면 쉽습니다.
32장 스태킹 Stacking이란 무엇인가#
스태킹은 여러 모델의 예측 결과를 단순히 투표하는 것이 아니라 다른 모델의 입력값으로 다시 사용하는 방식입니다.
제공된 학습자료에서는:
1단계 모델의 예측값을 입력으로 2단계 메타 모델이 최종 예측
한다고 설명합니다.
즉 두 단계 구조를 가집니다.
33장 스태킹의 1단계와 2단계#
1단계#
여러 기본 모델이 각각 예측합니다.
예:
- Random Forest
- Logistic Regression
- K-NN
2단계#
1단계 모델이 만든 예측값들을 새로운 입력 데이터로 사용합니다.
이를 메타 모델 Meta Model이 다시 학습하여 최종 결과를 결정합니다.
핵심#
Stacking = 예측 결과를 다시 학습
입니다.
34장 스태킹을 쉽게 이해하면#
세 명의 전문가가 각각 의견을 냈다고 생각해봅시다.
보팅은:
세 명 중 가장 많은 의견을 채택하자.
입니다.
스태킹은:
세 명의 의견을 다시 전문 판정관에게 주고, 누가 어떤 상황에서 잘 맞는지까지 학습해서 최종 결정을 내리자.
에 가깝습니다.
따라서 단순 투표보다 구조가 한 단계 더 복잡합니다.
35장 스태킹의 장점과 주의점#
제공된 학습자료에서는 스태킹의 특징으로:
- 이질적인 모델 조합
- 성능 극대화
- 과적합 위험
을 제시합니다.
서로 다른 모델의 강점을 메타 모델이 조합할 수 있지만 구조가 복잡해지는 만큼 과적합 가능성에도 주의해야 합니다.
36장 보팅과 스태킹 차이#
Voting#
여러 모델의 결과를:
투표 또는 평균
Stacking#
여러 모델의 결과를:
메타 모델의 입력으로 사용
입니다.
따라서:
Voting = 직접 결합
Stacking = 한 번 더 학습
으로 기억하면 쉽습니다.
37장 배깅과 보팅은 어떻게 다른가#
둘 다 여러 모델의 결과를 모을 수 있어서 헷갈릴 수 있습니다.
제공된 학습자료의 정리에서는 다음처럼 구분합니다.
Bagging#
같은 알고리즘
을 여러 번 병렬적으로 학습
대표:
Random Forest의 여러 Decision Tree
Voting#
다른 알고리즘
들의 예측을 결합
예:
Logistic Regression + K-NN + Decision Tree
핵심#
Bagging = 같은 모델 여러 개
Voting = 다른 모델 여러 개
입니다.
38장 부스팅과 스태킹은 어떻게 다른가#
Boosting#
같은 계열의 모델을 순차적으로 학습하면서 이전 오류를 보완합니다.
Stacking#
여러 이질적인 모델의 예측 결과를 메타 모델이 다시 학습합니다.
따라서:
Boosting = 이전 모델의 오류를 다음 모델이 보완
Stacking = 여러 모델 결과를 새로운 모델이 통합
입니다.
39장 앙상블 전체 비교#
| 기법 | 모델 구성 | 학습·결합 방식 | 핵심 |
|---|---|---|---|
| Bagging | 같은 알고리즘 중심 | 병렬 | 분산 감소 |
| Boosting | 같은 알고리즘 중심 | 순차 | 편향 감소 |
| Voting | 다른 알고리즘 | 병렬 결과 결합 | 다수결·확률 평균 |
| Stacking | 다른 알고리즘 | 2단계 | 메타 모델 |
이 표를 이해하면 앙상블 관련 문제 대부분을 구분하기 쉽습니다.
40장 앙상블 기법 암기법#
제공된 학습자료의 전체 정리를 그대로 연결하면 다음과 같습니다.
배깅#
같은 알고리즘 병렬
→ 분산 감소
→ Random Forest
부스팅#
같은 알고리즘 순차
→ 편향 감소
→ XGBoost·AdaBoost·LightGBM
보팅#
다른 알고리즘 병렬
→ 다수결 또는 평균
스태킹#
다른 알고리즘 2단계
→ 메타 모델
입니다.
41장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 배깅은 순차 학습이다#
틀립니다.
병렬 학습입니다.
함정 2. 부스팅은 병렬 학습이다#
틀립니다.
제공된 학습자료에서는 순차 학습으로 정리합니다.
함정 3. 배깅의 대표 알고리즘은 XGBoost다#
틀립니다.
Random Forest입니다.
함정 4. Random Forest는 부스팅 기법이다#
틀립니다.
배깅입니다.
함정 5. AdaBoost는 오분류 샘플의 가중치를 낮춘다#
틀립니다.
제공된 학습자료에서는 오분류 샘플의 가중치를 증가시킵니다.
함정 6. XGBoost는 배깅 알고리즘이다#
틀립니다.
부스팅입니다.
함정 7. LightGBM은 Leaf-wise 전략과 관련이 없다#
틀립니다.
제공된 학습자료의 핵심 특징입니다.
함정 8. 하드 보팅은 예측 확률을 평균한다#
틀립니다.
다수결입니다.
함정 9. 소프트 보팅은 클래스 결과만 투표한다#
틀립니다.
확률 평균을 사용합니다.
함정 10. 스태킹은 단순히 다수결로 결과를 결정한다#
틀립니다.
메타 모델이 최종 예측합니다.
42장 배깅 시험 직전 암기#
Bagging
→ 병렬
→ 여러 모델 독립 학습
→ 결과 결합
→ 분산 감소
대표:
Random Forest
한 줄로:
배깅 = 각자 풀고 마지막에 투표
입니다.
43장 부스팅 시험 직전 암기#
Boosting
→ 순차
→ 이전 오류에 집중
→ 편향 감소
대표:
- AdaBoost
- XGBoost
- LightGBM
한 줄로:
부스팅 = 앞사람이 틀린 것을 뒷사람이 고친다
입니다.
44장 Random Forest 시험 직전 암기#
Random Forest
→ Bagging
→ 여러 Decision Tree
→ 무작위 변수 선택
→ 병렬 학습
→ 분산 감소
→ 다수결
입니다.
가장 중요한 연결은:
Random Forest = Bagging
입니다.
45장 AdaBoost 시험 직전 암기#
AdaBoost
→ Boosting
→ 순차
→ 오분류 샘플 가중치 증가
→ 이전 오류 보완
→ 편향 감소
입니다.
46장 XGBoost 시험 직전 암기#
XGBoost
→ Boosting
→ 순차 학습
→ 잔차 학습
→ 정규화
→ 병렬 처리 지원
→ 높은 정확도
중요한 함정:
병렬 처리 지원이 있어도 계열은 Boosting
입니다.
47장 LightGBM 시험 직전 암기#
LightGBM
→ Boosting
→ 순차
→ Leaf-wise
→ 대용량 데이터 고속 처리
→ 메모리 효율적
입니다.
시험에서는:
LightGBM = Leaf-wise
를 강하게 연결해두는 것이 좋습니다.
48장 Voting 시험 직전 암기#
Hard Voting#
→ 클래스 투표
→ 다수결
예:
1, 1, 0 → 1
Soft Voting#
→ 예측 확률 평균
따라서:
Hard = 결과
Soft = 확률
입니다.
49장 Stacking 시험 직전 암기#
Stacking
→ 이질적 모델
→ 1단계에서 예측
→ 예측값을 새 입력으로 사용
→ 2단계 Meta Model
→ 최종 예측
→ 성능 향상 가능
→ 과적합 위험
한 줄로:
스태킹 = 모델 위에 모델
입니다.
50장 앙상블 알고리즘 핵심 비교표#
| 알고리즘·기법 | 분류 | 가장 중요한 특징 |
|---|---|---|
| Bagging | 병렬 | 분산 감소 |
| Random Forest | Bagging | 여러 나무·무작위 변수 |
| Boosting | 순차 | 편향 감소 |
| AdaBoost | Boosting | 오분류 가중치 증가 |
| XGBoost | Boosting | 잔차·정규화 |
| LightGBM | Boosting | Leaf-wise·고속 처리 |
| Hard Voting | Voting | 다수결 |
| Soft Voting | Voting | 확률 평균 |
| Stacking | 2단계 앙상블 | 메타 모델 |
앙상블 기법 FAQ#
앙상블이란 무엇인가#
여러 모델의 예측 결과를 결합해 하나의 모델보다 더 안정적이거나 좋은 예측결과를 만드는 방법입니다.
배깅과 부스팅의 가장 큰 차이는 무엇인가#
배깅은 병렬적으로 학습하고 부스팅은 순차적으로 학습합니다.
배깅의 주요 효과는 무엇인가#
제공된 학습자료에서는 분산 감소로 설명합니다.
부스팅의 주요 효과는 무엇인가#
제공된 학습자료에서는 편향 감소로 설명합니다.
배깅의 대표 알고리즘은 무엇인가#
Random Forest입니다.
Random Forest는 무엇을 여러 개 사용하는가#
여러 개의 의사결정나무를 사용합니다.
부스팅의 대표 알고리즘은 무엇인가#
AdaBoost, XGBoost, LightGBM이 있습니다.
AdaBoost의 핵심 특징은 무엇인가#
이전 모델이 오분류한 샘플의 가중치를 높여 다음 모델이 더 집중하도록 합니다.
XGBoost의 특징은 무엇인가#
제공된 학습자료에서는 잔차 학습, 정규화, 병렬 처리 지원, 높은 정확도를 특징으로 제시합니다.
XGBoost는 병렬 처리를 지원하므로 배깅인가#
아닙니다. 제공된 학습자료 기준 XGBoost는 부스팅 알고리즘입니다.
LightGBM의 대표적인 특징은 무엇인가#
Leaf-wise 분할 전략과 대용량 데이터의 고속 처리, 메모리 효율성입니다.
Hard Voting이란 무엇인가#
여러 모델이 예측한 클래스 결과를 다수결로 결정하는 방법입니다.
Soft Voting이란 무엇인가#
여러 모델이 예측한 확률을 평균하여 최종 결과를 결정하는 방법입니다.
Stacking이란 무엇인가#
여러 1단계 모델의 예측 결과를 새로운 입력값으로 사용하고 2단계 메타 모델이 최종 예측하는 방식입니다.
Stacking의 주의점은 무엇인가#
제공된 학습자료에서는 과적합 위험을 주의점으로 제시합니다.
Bagging과 Voting의 차이는 무엇인가#
제공된 학습자료의 정리에서는 Bagging을 같은 알고리즘의 병렬 학습, Voting을 다른 알고리즘의 예측 결과 결합으로 구분합니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 앙상블이 무엇인지 설명할 수 있는가?
- 배깅과 부스팅의 학습방식을 구분할 수 있는가?
- 배깅이 병렬이라는 것을 알고 있는가?
- 부스팅이 순차라는 것을 알고 있는가?
- 배깅을 분산 감소와 연결할 수 있는가?
- 부스팅을 편향 감소와 연결할 수 있는가?
- Random Forest가 Bagging이라는 것을 알고 있는가?
- Random Forest가 여러 의사결정나무를 이용한다는 것을 알고 있는가?
- AdaBoost의 오분류 가중치 증가를 기억하고 있는가?
- XGBoost가 Boosting이라는 것을 알고 있는가?
- XGBoost의 병렬 처리 지원과 Bagging을 혼동하지 않을 수 있는가?
- LightGBM과 Leaf-wise를 연결할 수 있는가?
- Hard Voting과 Soft Voting의 차이를 설명할 수 있는가?
- Stacking에서 메타 모델의 역할을 알고 있는가?
- Bagging·Boosting·Voting·Stacking을 서로 구분할 수 있는가?
이 글을 마치며#
앙상블의 핵심은 모델 하나에 모든 판단을 맡기지 않고 여러 모델의 결과를 결합하는 것입니다.
가장 먼저 배깅과 부스팅을 구분해야 합니다.
Bagging
→ 병렬
→ 분산 감소
→ Random Forest
Boosting
→ 순차
→ 이전 오류 보완
→ 편향 감소
→ AdaBoost·XGBoost·LightGBM
입니다.
각 알고리즘의 핵심은:
Random Forest = 여러 의사결정나무 + 무작위 변수
AdaBoost = 오분류 샘플 가중치 증가
XGBoost = 잔차 학습 + 정규화
LightGBM = Leaf-wise + 대용량 고속 처리
로 기억합니다.
보팅은:
Hard = 다수결
Soft = 확률 평균
입니다.
스태킹은:
여러 모델의 예측값 → 메타 모델 → 최종 결과
의 2단계 구조입니다.
시험 직전에는 다음 네 줄로 압축하면 됩니다.
배깅 = 병렬 = 분산 감소 = Random Forest
부스팅 = 순차 = 편향 감소 = AdaBoost·XGBoost·LightGBM
보팅 = 다른 모델들의 다수결·확률 평균
스태킹 = 다른 모델들의 예측을 메타 모델이 다시 학습