통계 기초란? 모수·통계량·전수조사·표본조사·확률변수·스피어만 상관계수·K-NN 쉽게 이해하기
1장 ADsP 3과목에서 통계가 중요한 이유#
ADsP 3과목 데이터 분석은 전체 시험에서 가장 많은 비중을 차지합니다.
제공된 학습자료 기준으로 3과목은 다음과 같이 구성됩니다.
- 출제 문항: 객관식 30문제
- 배점: 60점
- 난이도: ★★★★
- 권장 학습 시간: 8~10시간
단순한 용어 암기만으로 풀기 어려운 문제가 많습니다.
특히:
- 통계 개념
- 수식
- 분석 결과 해석
을 함께 이해해야 합니다.
따라서 학습 순서도 중요합니다.
개념 이해 → 공식 암기 → 결과 해석
순으로 접근하는 것이 좋습니다.
제공된 학습자료에서는 특히 다음 항목을 최빈출 영역으로 제시합니다.
- 회귀분석
- AUROC
- 혼동행렬
- 앙상블
- 연관분석
- R 기초
하지만 이러한 내용을 이해하려면 먼저 모집단·표본·모수·통계량 같은 통계의 기본 언어를 익혀야 합니다.
2장 통계란 무엇인가#
통계를 어렵게 생각할 필요는 없습니다.
제공된 학습자료에서는 통계를 쉽게:
데이터로부터 정보를 끌어내는 방법
이라고 설명합니다.
우리는 일상에서도 이미 통계적인 사고를 사용하고 있습니다.
예를 들어 한 학급의 시험 점수가 다음과 같다고 하겠습니다.
75점, 83점, 91점, 65점, 86점
이때:
우리 반 학생들의 시험 성적은 대략 어느 정도인가?
를 알고 싶다면 평균을 계산할 수 있습니다.
또 두 학급을 비교하면서:
어느 반의 성적이 더 높은가?
를 판단할 수도 있습니다.
즉 평균을 구하고, 데이터를 비교하고, 일정한 패턴을 찾는 행동 역시 통계적인 사고의 일부입니다.
3장 모집단과 표본부터 이해하자#
모수와 통계량을 이해하려면 먼저 모집단 Population과 표본 Sample을 구분해야 합니다.
모집단 Population#
우리가 알고 싶은 대상의 전체 집합입니다.
예를 들어:
대한민국 성인의 평균 키를 알고 싶다.
고 한다면 대한민국의 모든 성인이 모집단이 됩니다.
표본 Sample#
모집단 전체를 조사하기 어려울 때 모집단에서 일부를 선택한 것입니다.
예를 들어 대한민국 성인 중 5,000명을 선정해 키를 조사했다면 이 5,000명이 표본입니다.
즉:
모집단 = 전체
표본 = 전체에서 뽑은 일부
입니다.
4장 왜 표본을 사용하는가#
이론적으로는 모집단 전체를 조사하면 가장 많은 정보를 얻을 수 있습니다.
하지만 현실에서는 모집단 전체를 조사하기 어려운 경우가 많습니다.
예를 들어 대한민국 국민 전체의:
- 평균 키
- 평균 소득
- 하루 평균 인터넷 이용시간
을 조사한다고 생각해봅시다.
모든 사람을 직접 조사하면 엄청난:
- 시간
- 비용
- 인력
이 필요합니다.
그래서 전체 가운데 일부를 뽑아 조사하고, 그 결과를 이용해 전체의 특성을 추정합니다.
이것이 표본을 사용하는 기본적인 이유입니다.
5장 모수 Parameter란 무엇인가#
모수 Parameter는 모집단 전체의 특성을 나타내는 값입니다.
대표적인 예는:
- 모평균 μ
- 모분산 σ²
입니다.
예를 들어 대한민국 성인 전체의 실제 평균 키가 존재한다고 하겠습니다.
이 값은 모집단 전체의 특성이므로 모평균입니다.
핵심#
모수 = 모집단의 특성을 나타내는 값
입니다.
6장 통계량 Statistic이란 무엇인가#
통계량 Statistic은 표본에서 계산한 값을 의미합니다.
대표적인 예는:
- 표본평균 x̄
- 표본분산 s²
입니다.
예를 들어 대한민국 성인 가운데 1,000명을 조사한 결과 평균 키가 171.3cm였다고 하겠습니다.
171.3cm는 전체 국민의 평균이 아니라 표본 1,000명에서 계산한 평균입니다.
따라서 표본평균, 즉 통계량입니다.
핵심#
통계량 = 표본에서 계산한 값
입니다.
7장 모수와 통계량을 비교하면#
| 구분 | 모수 Parameter | 통계량 Statistic |
|---|---|---|
| 대상 | 모집단 | 표본 |
| 평균 | μ 모평균 | x̄ 표본평균 |
| 분산 | σ² 모분산 | s² 표본분산 |
| 특징 | 일반적으로 직접 알기 어려움 | 표본을 이용해 계산 가능 |
시험에서는 무엇보다:
모수 → 모집단
통계량 → 표본
을 확실하게 구분해야 합니다.
8장 모수와 통계량을 일상생활로 이해하기#
학교 전체 학생이 1,000명이라고 생각해봅시다.
모수#
학생 1,000명 전체의 실제 평균 키
→ 모집단 전체의 평균
→ 모평균 μ
통계량#
1,000명 중 30명을 뽑아 계산한 평균 키
→ 표본의 평균
→ 표본평균 x̄
입니다.
제공된 학습자료의 비유를 이용하면:
모수
→ 전국 국민의 평균 키
통계량
→ 우리 반 30명의 평균 키
라고 이해할 수 있습니다.
9장 왜 모수는 알기 어렵고 통계량은 계산할 수 있는가#
모수를 정확히 알려면 원칙적으로 모집단 전체에 대한 정보가 필요합니다.
하지만 모집단이 매우 크면 모든 대상을 조사하기 어렵습니다.
그래서 실제 통계에서는 표본을 조사합니다.
표본에서는 데이터를 가지고 있기 때문에:
- 표본평균
- 표본분산
같은 통계량을 직접 계산할 수 있습니다.
그리고 이 통계량을 이용하여 알 수 없는 모집단의 모수를 추정합니다.
즉 흐름은 다음과 같습니다.
모집단
↓
일부 표본 추출
↓
표본에서 통계량 계산
↓
모집단의 모수 추정
입니다.
10장 모수와 통계량 기호도 구분하자#
제공된 학습자료에서는 다음과 같이 정리합니다.
모수#
모평균:
μ
모분산:
σ²
통계량#
표본평균:
x̄
표본분산:
s²
시험에서는 기호만 보고도 모집단인지 표본인지 판단할 수 있어야 합니다.
간단하게:
μ·σ² → 모수
x̄·s² → 통계량
으로 기억합니다.
11장 모집단과 표본의 관계#
통계의 중요한 목적 가운데 하나는 일부 표본을 통해 전체 모집단을 이해하는 것입니다.
예를 들어 1,000만 명의 고객이 있는 서비스에서 고객 만족도를 조사한다고 하겠습니다.
1,000만 명 전부를 조사하기 어려우므로 일정한 기준으로 5,000명을 선정합니다.
그리고 이들의 만족도를 분석합니다.
여기서:
1,000만 명 전체 고객
→ 모집단
조사한 5,000명
→ 표본
전체 고객의 실제 평균 만족도
→ 모수
5,000명의 평균 만족도
→ 통계량
입니다.
이 네 가지 관계를 함께 이해하면 통계의 기본 구조가 보이기 시작합니다.
12장 전수조사 Census란 무엇인가#
전수조사는 모집단 전체를 조사하는 방식입니다.
영어로는 Census라고 합니다.
예를 들어 어떤 학교에 학생이 300명이고 300명 모두의 키를 조사했다면 전수조사입니다.
제공된 학습자료에서는 전수조사의 특징을 다음과 같이 정리합니다.
- 모집단 전체 조사
- 정확도가 높음
- 비용과 시간이 많이 필요
- 소규모 집단에 적합
핵심#
Census = 모두 조사
입니다.
13장 전수조사의 장점#
전수조사의 가장 큰 특징은 모집단 전체를 대상으로 한다는 것입니다.
표본을 일부만 선택하는 과정에서 발생할 수 있는 표본 관련 오차를 줄일 수 있습니다.
예를 들어 회사 직원이 30명뿐이라면 굳이 일부 직원만 조사할 필요가 없을 수 있습니다.
30명 모두를 조사하는 것이 가능하기 때문입니다.
따라서 소규모 모집단에서는 전수조사가 현실적인 방법이 될 수 있습니다.
14장 전수조사의 단점#
모집단이 커지면 문제가 달라집니다.
예를 들어 수천만 명을 조사해야 한다면:
- 조사 인력
- 시간
- 비용
- 데이터 수집 과정
이 크게 증가합니다.
그래서 대규모 모집단에서는 전수조사가 쉽지 않을 수 있습니다.
핵심#
전수조사 = 정확한 전체 조사이지만 비용·시간 부담이 큼
입니다.
15장 표본조사 Sampling이란 무엇인가#
표본조사는 모집단 전체가 아니라 일부 표본만 추출하여 조사하는 방법입니다.
예를 들어 국민 5,000만 명 가운데 2,000명을 조사하여 전체 국민의 의견을 추정하는 방식입니다.
제공된 학습자료에서는 다음 특징을 제시합니다.
- 모집단에서 일부 추출
- 추론통계 활용
- 비용·시간 절약
- 대규모 집단에 적합
핵심#
Sampling = 일부를 조사하여 전체를 추정
입니다.
16장 전수조사와 표본조사를 비교하면#
| 구분 | 전수조사 Census | 표본조사 Sampling |
|---|---|---|
| 조사 대상 | 모집단 전체 | 모집단 일부 |
| 비용 | 큼 | 상대적으로 작음 |
| 시간 | 많이 필요 | 상대적으로 적음 |
| 활용 | 소규모 집단에 유리 | 대규모 집단에 유리 |
| 통계적 역할 | 전체 특성 확인 | 표본으로 모집단 추론 |
쉽게 기억하면:
전수 = 전부
표본 = 일부
입니다.
17장 표본조사와 추론통계의 관계#
표본조사는 단순히 일부 데이터만 보고 끝나는 것이 아닙니다.
표본에서 얻은 결과를 바탕으로 모집단 전체의 특성을 추론합니다.
예를 들어 2,000명을 조사해 특정 제품에 대한 선호도가 65%라고 나왔다고 하겠습니다.
우리가 궁금한 것은 단순히 조사한 2,000명의 선호도만이 아니라 전체 소비자의 선호도일 수 있습니다.
이처럼:
표본 → 전체 모집단을 추론
하는 것이 추론통계의 중요한 역할입니다.
18장 빅데이터 시대와 전수조사#
제공된 학습자료에서는 빅데이터 시대의 변화 가운데 하나로:
표본조사 → 전수조사
를 제시합니다.
과거에는 데이터 수집과 저장에 비용이 많이 들어 일부 표본을 이용하는 경우가 많았습니다.
하지만 디지털 서비스에서는 사용자의 행동 데이터가 자동으로 수집되는 경우가 많습니다.
예를 들어 온라인 쇼핑몰에서는 전체 사용자의:
- 클릭
- 검색
- 주문
- 접속
기록을 대규모로 저장할 수 있습니다.
따라서 과거보다 전체 데이터를 대상으로 분석할 가능성이 커졌다는 의미로 이해하면 됩니다.
19장 전수조사가 가능해졌다고 표본조사가 사라지는 것은 아니다#
학습자료에서는 빅데이터 시대의 변화를 표본조사에서 전수조사로의 확대라는 흐름으로 제시합니다.
핵심은 데이터 저장·처리 기술의 발전으로 과거보다 훨씬 많은 데이터를 직접 분석할 수 있게 되었다는 것입니다.
ADsP 시험에서는 이 흐름을:
빅데이터 시대 → 전수조사 가능성 확대
로 기억하면 됩니다.
20장 확률변수란 무엇인가#
통계에서는 확률변수 Random Variable라는 개념을 자주 사용합니다.
확률변수는 확률적인 결과를 수치로 표현하는 변수라고 이해할 수 있습니다.
예를 들어 주사위를 던지면 나올 수 있는 결과는:
1, 2, 3, 4, 5, 6
입니다.
이처럼 확률적으로 결정되는 값을 하나의 변수로 다룰 수 있습니다.
제공된 학습자료에서는 확률변수를 크게:
- 이산형 확률변수
- 연속형 확률변수
로 구분합니다.
21장 이산형 확률변수란 무엇인가#
이산형 확률변수는 셀 수 있는 값을 가지는 확률변수입니다.
대표적인 예는:
- 주사위 눈
- 동전 앞뒤
입니다.
주사위를 던졌을 때 결과는:
1, 2, 3, 4, 5, 6
중 하나입니다.
가능한 값을 하나씩 셀 수 있습니다.
핵심#
이산형 = 셀 수 있음
입니다.
22장 이산형 데이터의 다른 사례#
이산형 개념을 조금 더 쉽게 이해하면 다음과 같은 값을 생각할 수 있습니다.
- 하루 주문 건수
- 고객 수
- 불량 제품 개수
예를 들어 주문 건수는:
0건, 1건, 2건, 3건...
처럼 개수 단위로 셀 수 있습니다.
이런 성격이 이산적인 값의 특징입니다.
23장 연속형 확률변수란 무엇인가#
연속형 확률변수는 제공된 학습자료에서 셀 수 없는 값으로 설명합니다.
대표적인 예는:
- 키
- 무게
- 시간
입니다.
예를 들어 사람의 키는 단순히:
170cm
171cm
처럼 정수만 존재하는 것이 아닙니다.
170.1cm
170.12cm
170.123cm
처럼 연속적인 값으로 나타날 수 있습니다.
핵심#
연속형 = 연속적으로 측정되는 값
입니다.
24장 이산형과 연속형을 비교하면#
| 구분 | 이산형 확률변수 | 연속형 확률변수 |
|---|---|---|
| 특징 | 셀 수 있는 값 | 연속적으로 측정되는 값 |
| 대표 예 | 주사위 눈 | 키 |
| 대표 예 | 동전 앞뒤 | 무게 |
| 대표 예 | 개수 | 시간 |
가장 쉬운 구분은:
개수 → 이산형
측정값 → 연속형
이라고 생각하는 것입니다.
25장 주문 건수와 배송시간으로 구분해보기#
온라인 쇼핑몰을 예로 들어보겠습니다.
오늘 주문 건수#
253건
→ 몇 건인지 셀 수 있습니다.
→ 이산형
주문 후 배송까지 걸린 시간#
27.53시간
→ 연속적인 값으로 측정됩니다.
→ 연속형
시험에서 사례가 나오면 이처럼 셀 수 있는 개수인지 연속적으로 측정하는 값인지를 확인하면 됩니다.
26장 스피어만 상관계수란 무엇인가#
제공된 학습자료에서는 통계 기초에서 자주 출제되는 문제로 스피어만 상관계수 Spearman Correlation를 제시합니다.
스피어만 상관계수의 핵심은 순위 Rank입니다.
원래 측정값 자체보다 각 관측값의 순위를 이용하여 관계를 분석합니다.
제공된 학습자료에서는 다음 특징을 강조합니다.
- 서열척도에서 사용 가능
- 명목척도에는 적용 불가
- 원시 데이터가 아니라 순위를 매긴 값을 기반으로 계산
- 비선형 관계도 나타낼 수 있음
시험에서는 무엇보다:
Spearman = 순위
를 먼저 기억해야 합니다.
27장 스피어만 상관계수를 순위로 이해하기#
예를 들어 학생 5명의:
- 수학 성적 순위
- 과학 성적 순위
가 있다고 하겠습니다.
| 학생 | 수학 순위 | 과학 순위 |
|---|---|---|
| A | 1 | 2 |
| B | 2 | 1 |
| C | 3 | 3 |
| D | 4 | 5 |
| E | 5 | 4 |
스피어만 상관계수에서는 점수 자체보다는 이러한 순위 사이의 관계에 주목합니다.
즉:
수학 순위가 높은 학생이 과학에서도 대체로 높은 순위를 보이는가?
를 살펴볼 수 있습니다.
핵심#
Spearman = Rank 기반 상관관계
입니다.
28장 서열척도에서 스피어만을 사용할 수 있는 이유#
서열척도는 값 사이의 순서가 의미 있는 데이터입니다.
예를 들어:
- 1등
- 2등
- 3등
또는:
- 매우 만족
- 만족
- 보통
- 불만족
- 매우 불만족
처럼 순서가 존재합니다.
스피어만 상관계수는 순위를 기반으로 하기 때문에 이러한 서열형 데이터의 관계를 살펴보는 데 활용할 수 있습니다.
29장 명목척도에는 왜 적용하지 않는가#
명목척도는 단순히 범주를 구분하는 데이터입니다.
예를 들어:
- 혈액형
- 지역
- 색상
과 같은 데이터에서는 일반적으로 범주 자체에 순서가 존재하지 않습니다.
A형이 B형보다 크다거나, 서울이 부산보다 높은 순위라고 할 수 없습니다.
따라서 순위를 기반으로 하는 스피어만 상관계수를 명목척도에 그대로 적용할 수 없습니다.
시험 핵심#
Spearman → 서열척도 O
명목척도 X
입니다.
30장 스피어만에서 원시 데이터보다 순위가 중요하다#
제공된 학습자료에서 중요한 문장입니다.
스피어만 상관계수는 원시 데이터 자체가 아니라 순위를 매긴 값을 기반으로 계산합니다.
예를 들어 두 데이터가 다음과 같다고 하겠습니다.
A:
10, 20, 30, 40
B:
100, 400, 900, 1600
수치 증가 폭은 서로 다르지만 순서는 동일합니다.
두 변수 모두:
1위 → 2위 → 3위 → 4위
라는 동일한 순서 관계를 가질 수 있습니다.
스피어만에서는 이러한 순위 관계를 중요하게 봅니다.
31장 스피어만에서 시험이 노리는 포인트#
문제에 다음 단어가 보이면 스피어만을 떠올릴 수 있습니다.
- 순위
- Rank
- 서열척도
반대로:
명목척도
가 나오면 그대로 적용할 수 없다는 점을 주의합니다.
시험 직전에는:
Spearman = 순위 = 서열
로 묶어 기억하면 좋습니다.
32장 K-NN이란 무엇인가#
제공된 학습자료에서는 통계 기초와 함께 K-NN K-최근접이웃의 주의점도 자주 출제되는 내용으로 제시합니다.
K-NN은 새로운 데이터가 들어왔을 때 주변에서 가장 가까운 데이터들을 살펴보고 결과를 결정하는 방식입니다.
이름 자체가 의미를 설명합니다.
K
→ 몇 개의 이웃을 볼 것인가
NN
→ Nearest Neighbors
→ 가장 가까운 이웃
입니다.
33장 K-NN을 일상적인 사례로 이해하기#
새로운 고객 A가 있다고 생각해봅시다.
고객 A와 행동 패턴이 가장 비슷한 기존 고객들을 찾아봅니다.
가까운 5명의 고객 가운데:
- 4명 → 상품 구매
- 1명 → 구매하지 않음
이라면 새로운 고객 역시 구매할 가능성이 높은 쪽으로 분류할 수 있습니다.
이처럼 가까운 데이터의 특징을 이용해 새로운 데이터를 판단하는 것이 K-NN의 기본 아이디어입니다.
34장 K-NN은 왜 게으른 학습인가#
제공된 학습자료에서는 K-NN의 특징으로:
사전 학습 없이 새 데이터를 분류할 수 있다
는 점을 강조합니다.
이를 게으른 학습 Lazy Learning이라고 부릅니다.
일반적인 모델은 먼저 학습 데이터를 이용하여 모델을 만든 뒤 새로운 데이터를 예측합니다.
K-NN은 별도의 복잡한 모델을 미리 만들어놓기보다 새로운 데이터가 들어오면 기존 데이터와 거리를 비교하여 결과를 결정합니다.
핵심#
K-NN = 사전 학습 모델 구축 없이 예측 시점에 이웃 탐색
입니다.
35장 K는 무엇을 의미하는가#
K는 판단에 사용할 가까운 이웃의 개수를 의미합니다.
예를 들어:
K = 3
이면 가장 가까운 3개 데이터를 봅니다.
K = 5
이면 가장 가까운 5개 데이터를 봅니다.
따라서 K값에 따라 분류 결과와 모델의 특성이 달라질 수 있습니다.
36장 K가 너무 크면 어떻게 되는가#
제공된 학습자료에서 매우 중요한 함정입니다.
K가 너무 크면 과소적합 Underfitting이 발생할 수 있습니다.
시험에서 이를 과적합이라고 바꾸어 출제할 수 있으므로 주의해야 합니다.
K를 지나치게 크게 잡으면 가까운 주변의 특징뿐 아니라 멀리 떨어진 데이터까지 많이 포함하게 됩니다.
그 결과 지역적인 특징을 충분히 반영하지 못하고 지나치게 일반화될 수 있습니다.
핵심#
K 너무 큼 → Underfitting
입니다.
37장 왜 K가 커지면 과소적합으로 이어질 수 있는가#
동네 맛집을 추천한다고 생각해봅시다.
현재 위치 주변 5개의 음식점만 보면 내가 있는 지역의 특성을 잘 반영할 수 있습니다.
그런데 전국 음식점 10만 개를 모두 고려한다면 현재 동네의 특성이 희석될 수 있습니다.
K-NN도 비슷합니다.
K가 지나치게 커지면 매우 가까운 이웃의 특성보다 전체 데이터의 일반적인 특성이 강하게 반영됩니다.
그래서 모델이 데이터의 세부 패턴을 충분히 표현하지 못하는 과소적합이 발생할 수 있습니다.
38장 과소적합 Underfitting을 쉽게 이해하면#
과소적합은 모델이 데이터의 특징을 충분히 학습하거나 표현하지 못한 상태입니다.
쉽게 말하면:
모델이 너무 단순해서 중요한 패턴까지 놓치는 상태
입니다.
K-NN에서는 K를 너무 크게 설정하면 주변의 작은 패턴이 평균화되어 중요한 경계를 놓칠 수 있습니다.
따라서 시험에서는 다음 연결을 기억합니다.
K가 너무 크다
→ 지나치게 일반화
→ Underfitting
입니다.
39장 K-NN 시험에서 주의할 함정#
다음 문장을 보겠습니다.
K-NN에서 k가 너무 크면 과적합이 발생한다.
제공된 학습자료 기준으로 틀린 설명입니다.
정답은:
과소적합 Underfitting
입니다.
또한:
K-NN은 반드시 복잡한 사전 학습 과정을 거쳐야 새로운 데이터를 분류할 수 있다.
역시 제공된 학습자료의 설명과 맞지 않습니다.
K-NN은 게으른 학습 방식과 연결합니다.
40장 통계 기초 개념을 하나의 흐름으로 연결하면#
지금까지 배운 개념은 서로 따로 떨어져 있는 것이 아닙니다.
우리가 어떤 사람들의 평균 키를 알고 싶다고 하겠습니다.
1. 모집단 결정#
대한민국 성인 전체
2. 조사방법 결정#
전체를 조사하면:
→ 전수조사
일부를 조사하면:
→ 표본조사
3. 모집단의 실제 평균#
→ 모수 μ
4. 표본에서 계산한 평균#
→ 통계량 x̄
5. 측정한 키#
→ 연속형 값
이렇게 연결하면 통계 기초 개념이 하나의 구조로 이해됩니다.
41장 ADsP 시험에서 자주 헷갈리는 함정#
함정 1. 모수는 표본의 특성을 나타낸다#
틀립니다.
모수는 모집단의 특성입니다.
함정 2. 통계량은 모집단에서 계산한다#
틀립니다.
통계량은 표본에서 계산합니다.
함정 3. μ는 표본평균이다#
틀립니다.
μ는 모평균입니다.
표본평균은 x̄입니다.
함정 4. σ²는 표본분산이다#
틀립니다.
σ²는 모분산입니다.
표본분산은 s²입니다.
함정 5. 전수조사는 모집단 일부를 조사한다#
틀립니다.
모집단 전체를 조사합니다.
함정 6. 표본조사는 대규모 집단에 사용할 수 없다#
틀립니다.
오히려 비용과 시간을 절약할 수 있어 대규모 모집단 조사에서 활용할 수 있습니다.
함정 7. 주사위 눈은 연속형 확률변수다#
틀립니다.
셀 수 있는 값이므로 이산형입니다.
함정 8. 키와 시간은 이산형이다#
틀립니다.
제공된 학습자료에서는 연속형 확률변수의 예로 제시합니다.
함정 9. 스피어만 상관계수는 명목척도에 사용한다#
틀립니다.
서열척도에서 사용할 수 있으며 명목척도에는 적용하지 않습니다.
함정 10. 스피어만은 순위가 아니라 원시 데이터 값만 사용한다#
틀립니다.
순위를 매긴 값을 기반으로 계산합니다.
함정 11. K-NN은 사전 학습이 반드시 필요하다#
틀립니다.
제공된 학습자료에서는 게으른 학습 방식으로 설명합니다.
함정 12. K가 너무 크면 과적합이 발생한다#
틀립니다.
제공된 학습자료 기준으로 과소적합 Underfitting이 발생할 수 있습니다.
42장 모수와 통계량 시험 직전 암기#
모수 Parameter#
→ 모집단
→ μ
→ σ²
→ 일반적으로 직접 알기 어려움
통계량 Statistic#
→ 표본
→ x̄
→ s²
→ 표본에서 계산 가능
한 줄로:
모수는 모집단, 통계량은 표본
입니다.
43장 전수조사와 표본조사 시험 직전 암기#
Census#
→ 모집단 전체
→ 정확도 높음
→ 비용·시간 큼
→ 소규모에 적합
Sampling#
→ 모집단 일부
→ 추론통계
→ 비용·시간 절약
→ 대규모에 적합
쉽게:
Census = 모두
Sampling = 일부
입니다.
44장 이산형과 연속형 시험 직전 암기#
이산형#
→ 셀 수 있다
→ 주사위 눈
→ 동전 결과
→ 개수
연속형#
→ 연속적으로 측정
→ 키
→ 무게
→ 시간
한 줄로:
세면 이산, 재면 연속
이라고 기억할 수 있습니다.
45장 스피어만 시험 직전 암기#
Spearman
→ Rank
→ 순위 데이터
→ 서열척도 O
→ 명목척도 X
→ 원시값보다 순위를 기반으로 계산
시험에서:
순위
라는 말이 보이면 스피어만을 떠올리는 것이 핵심입니다.
46장 K-NN 시험 직전 암기#
K-NN
→ K-최근접이웃
→ 가까운 이웃으로 분류
→ Lazy Learning
→ 사전 학습 모델 구축 없이 새로운 데이터 분류 가능
그리고 가장 중요한 함정:
K 너무 큼 → Underfitting
입니다.
47장 ADsP 3과목 학습전략#
제공된 학습자료에서는 3과목의 핵심 전략을 다음 순서로 제시합니다.
개념 이해
↓
공식 암기
↓
결과 해석
입니다.
이 순서가 중요한 이유는 통계 공식을 무조건 외워도 문제에서 무엇을 계산하는지 이해하지 못하면 활용하기 어렵기 때문입니다.
예를 들어 표본평균 공식을 알고 있더라도:
- 모집단인지
- 표본인지
- 무엇을 추정하려는지
를 구분하지 못하면 문제 풀이가 어려워질 수 있습니다.
따라서 통계에서는 개념을 먼저 이해하고 공식을 연결한 뒤 결과의 의미까지 해석하는 방식이 중요합니다.
통계 기초 FAQ#
모수 Parameter란 무엇인가#
모집단 전체의 특성을 나타내는 값입니다. 대표적으로 모평균 μ와 모분산 σ²가 있습니다.
통계량 Statistic이란 무엇인가#
표본에서 계산한 값입니다. 대표적으로 표본평균 x̄와 표본분산 s²가 있습니다.
모수와 통계량의 가장 큰 차이는 무엇인가#
모수는 모집단의 특성을 나타내고 통계량은 표본의 특성을 나타냅니다.
μ는 무엇인가#
모집단의 평균을 나타내는 모평균입니다.
x̄는 무엇인가#
표본에서 계산한 표본평균입니다.
σ²와 s²의 차이는 무엇인가#
σ²는 모분산이고 s²는 표본분산입니다.
전수조사란 무엇인가#
모집단 전체를 조사하는 방식입니다.
표본조사란 무엇인가#
모집단 일부를 추출하여 조사하고 그 결과를 통해 모집단을 추론하는 방식입니다.
빅데이터 시대에는 조사 방식이 어떻게 변했는가#
제공된 학습자료에서는 많은 데이터를 직접 수집·처리할 수 있게 되면서 표본조사에서 전수조사로 확대되는 변화를 핵심으로 제시합니다.
이산형 확률변수란 무엇인가#
셀 수 있는 값을 가지는 확률변수입니다. 주사위 눈 등이 대표적인 예입니다.
연속형 확률변수란 무엇인가#
키·무게·시간처럼 연속적으로 측정할 수 있는 값을 가지는 확률변수입니다.
스피어만 상관계수는 어떤 데이터에 사용하는가#
제공된 학습자료에서는 순위 데이터와 서열척도에서 사용할 수 있다고 설명합니다.
스피어만 상관계수를 명목척도에 사용할 수 있는가#
제공된 학습자료 기준으로는 적용할 수 없습니다.
스피어만 상관계수에서 중요한 것은 무엇인가#
원시 데이터 값 자체보다 순위를 매긴 값을 기반으로 계산한다는 점입니다.
K-NN이란 무엇인가#
새로운 데이터와 가까운 기존 데이터들을 확인하여 결과를 분류하는 K-최근접이웃 방식입니다.
K-NN이 게으른 학습이라고 불리는 이유는 무엇인가#
제공된 학습자료에서는 별도의 사전 학습 없이 새로운 데이터가 들어왔을 때 기존 데이터를 이용해 분류한다는 특징과 연결합니다.
K가 너무 커지면 어떻게 되는가#
제공된 학습자료에서는 과소적합 Underfitting이 발생할 수 있다고 설명합니다.
자기 점검#
다음 질문에 바로 답할 수 있는지 확인해봅니다.
- 모집단과 표본의 차이를 설명할 수 있는가?
- 모수와 통계량의 차이를 설명할 수 있는가?
- μ가 무엇을 의미하는지 알고 있는가?
- x̄가 무엇을 의미하는지 알고 있는가?
- σ²와 s²를 구분할 수 있는가?
- 전수조사와 표본조사의 차이를 설명할 수 있는가?
- 전수조사가 비용과 시간이 많이 필요하다는 것을 알고 있는가?
- 표본조사가 추론통계와 연결된다는 것을 알고 있는가?
- 이산형과 연속형 확률변수를 구분할 수 있는가?
- 주사위 눈이 이산형이라는 것을 알고 있는가?
- 키·무게·시간이 연속형이라는 것을 알고 있는가?
- 스피어만 상관계수가 순위를 이용한다는 것을 알고 있는가?
- 스피어만을 서열척도와 연결할 수 있는가?
- 명목척도에는 스피어만을 적용하지 않는다는 것을 기억하고 있는가?
- K-NN의 K가 무엇을 의미하는지 설명할 수 있는가?
- K-NN이 게으른 학습이라는 것을 알고 있는가?
- K가 너무 크면 과소적합이 발생할 수 있다는 것을 기억하고 있는가?
이 글을 마치며#
통계 기초를 공부할 때 가장 먼저 머릿속에 만들어야 하는 구조는 다음과 같습니다.
우리가 알고 싶은 전체가 있습니다.
→ 모집단
모집단의 실제 특성은:
→ 모수
입니다.
하지만 전체를 조사하기 어렵기 때문에 일부를 뽑습니다.
→ 표본
표본에서 계산한 값은:
→ 통계량
입니다.
따라서 가장 중요한 첫 번째 문장은:
모수는 모집단, 통계량은 표본
입니다.
조사방법은:
전부 조사하면 Census
일부 조사하면 Sampling
입니다.
확률변수는:
셀 수 있으면 이산형
연속적으로 측정하면 연속형
으로 구분합니다.
그리고 시험에서 자주 등장하는 두 가지 함정도 함께 기억합니다.
Spearman = 순위·서열척도
K-NN에서 K가 너무 크면 Underfitting
입니다.
ADsP 3과목은 암기만으로 해결하기보다 다음 순서를 유지하는 것이 중요합니다.
개념을 이해하고 → 공식을 익히고 → 결과의 의미를 해석한다.
시험 직전에는 다음 다섯 줄로 압축하면 됩니다.
모수 = 모집단 / 통계량 = 표본
Census = 전체 / Sampling = 일부
세면 이산 / 재면 연속
Spearman = 순위
K-NN의 K가 너무 크면 과소적합