통계 기초란? 모수·통계량·전수조사·표본조사·확률변수·스피어만 상관계수·K-NN 쉽게 이해하기

1장 ADsP 3과목에서 통계가 중요한 이유#

ADsP 3과목 데이터 분석은 전체 시험에서 가장 많은 비중을 차지합니다.

제공된 학습자료 기준으로 3과목은 다음과 같이 구성됩니다.

  • 출제 문항: 객관식 30문제
  • 배점: 60점
  • 난이도: ★★★★
  • 권장 학습 시간: 8~10시간

단순한 용어 암기만으로 풀기 어려운 문제가 많습니다.

특히:

  • 통계 개념
  • 수식
  • 분석 결과 해석

을 함께 이해해야 합니다.

따라서 학습 순서도 중요합니다.

개념 이해 → 공식 암기 → 결과 해석

순으로 접근하는 것이 좋습니다.

제공된 학습자료에서는 특히 다음 항목을 최빈출 영역으로 제시합니다.

  • 회귀분석
  • AUROC
  • 혼동행렬
  • 앙상블
  • 연관분석
  • R 기초

하지만 이러한 내용을 이해하려면 먼저 모집단·표본·모수·통계량 같은 통계의 기본 언어를 익혀야 합니다.


2장 통계란 무엇인가#

통계를 어렵게 생각할 필요는 없습니다.

제공된 학습자료에서는 통계를 쉽게:

데이터로부터 정보를 끌어내는 방법

이라고 설명합니다.

우리는 일상에서도 이미 통계적인 사고를 사용하고 있습니다.

예를 들어 한 학급의 시험 점수가 다음과 같다고 하겠습니다.

75점, 83점, 91점, 65점, 86점

이때:

우리 반 학생들의 시험 성적은 대략 어느 정도인가?

를 알고 싶다면 평균을 계산할 수 있습니다.

또 두 학급을 비교하면서:

어느 반의 성적이 더 높은가?

를 판단할 수도 있습니다.

즉 평균을 구하고, 데이터를 비교하고, 일정한 패턴을 찾는 행동 역시 통계적인 사고의 일부입니다.


3장 모집단과 표본부터 이해하자#

모수와 통계량을 이해하려면 먼저 모집단 Population과 표본 Sample을 구분해야 합니다.

모집단 Population#

우리가 알고 싶은 대상의 전체 집합입니다.

예를 들어:

대한민국 성인의 평균 키를 알고 싶다.

고 한다면 대한민국의 모든 성인이 모집단이 됩니다.

표본 Sample#

모집단 전체를 조사하기 어려울 때 모집단에서 일부를 선택한 것입니다.

예를 들어 대한민국 성인 중 5,000명을 선정해 키를 조사했다면 이 5,000명이 표본입니다.

즉:

모집단 = 전체

표본 = 전체에서 뽑은 일부

입니다.


4장 왜 표본을 사용하는가#

이론적으로는 모집단 전체를 조사하면 가장 많은 정보를 얻을 수 있습니다.

하지만 현실에서는 모집단 전체를 조사하기 어려운 경우가 많습니다.

예를 들어 대한민국 국민 전체의:

  • 평균 키
  • 평균 소득
  • 하루 평균 인터넷 이용시간

을 조사한다고 생각해봅시다.

모든 사람을 직접 조사하면 엄청난:

  • 시간
  • 비용
  • 인력

이 필요합니다.

그래서 전체 가운데 일부를 뽑아 조사하고, 그 결과를 이용해 전체의 특성을 추정합니다.

이것이 표본을 사용하는 기본적인 이유입니다.


5장 모수 Parameter란 무엇인가#

모수 Parameter는 모집단 전체의 특성을 나타내는 값입니다.

대표적인 예는:

  • 모평균 μ
  • 모분산 σ²

입니다.

예를 들어 대한민국 성인 전체의 실제 평균 키가 존재한다고 하겠습니다.

이 값은 모집단 전체의 특성이므로 모평균입니다.

핵심#

모수 = 모집단의 특성을 나타내는 값

입니다.


6장 통계량 Statistic이란 무엇인가#

통계량 Statistic은 표본에서 계산한 값을 의미합니다.

대표적인 예는:

  • 표본평균 x̄
  • 표본분산 s²

입니다.

예를 들어 대한민국 성인 가운데 1,000명을 조사한 결과 평균 키가 171.3cm였다고 하겠습니다.

171.3cm는 전체 국민의 평균이 아니라 표본 1,000명에서 계산한 평균입니다.

따라서 표본평균, 즉 통계량입니다.

핵심#

통계량 = 표본에서 계산한 값

입니다.


7장 모수와 통계량을 비교하면#

구분 모수 Parameter 통계량 Statistic
대상 모집단 표본
평균 μ 모평균 x̄ 표본평균
분산 σ² 모분산 s² 표본분산
특징 일반적으로 직접 알기 어려움 표본을 이용해 계산 가능

시험에서는 무엇보다:

모수 → 모집단

통계량 → 표본

을 확실하게 구분해야 합니다.


8장 모수와 통계량을 일상생활로 이해하기#

학교 전체 학생이 1,000명이라고 생각해봅시다.

모수#

학생 1,000명 전체의 실제 평균 키

→ 모집단 전체의 평균

→ 모평균 μ

통계량#

1,000명 중 30명을 뽑아 계산한 평균 키

→ 표본의 평균

→ 표본평균 x̄

입니다.

제공된 학습자료의 비유를 이용하면:

모수

→ 전국 국민의 평균 키

통계량

→ 우리 반 30명의 평균 키

라고 이해할 수 있습니다.


9장 왜 모수는 알기 어렵고 통계량은 계산할 수 있는가#

모수를 정확히 알려면 원칙적으로 모집단 전체에 대한 정보가 필요합니다.

하지만 모집단이 매우 크면 모든 대상을 조사하기 어렵습니다.

그래서 실제 통계에서는 표본을 조사합니다.

표본에서는 데이터를 가지고 있기 때문에:

  • 표본평균
  • 표본분산

같은 통계량을 직접 계산할 수 있습니다.

그리고 이 통계량을 이용하여 알 수 없는 모집단의 모수를 추정합니다.

즉 흐름은 다음과 같습니다.

모집단

↓

일부 표본 추출

↓

표본에서 통계량 계산

↓

모집단의 모수 추정

입니다.


10장 모수와 통계량 기호도 구분하자#

제공된 학습자료에서는 다음과 같이 정리합니다.

모수#

모평균:

μ

모분산:

σ²

통계량#

표본평균:

x̄

표본분산:

s²

시험에서는 기호만 보고도 모집단인지 표본인지 판단할 수 있어야 합니다.

간단하게:

μ·σ² → 모수

x̄·s² → 통계량

으로 기억합니다.


11장 모집단과 표본의 관계#

통계의 중요한 목적 가운데 하나는 일부 표본을 통해 전체 모집단을 이해하는 것입니다.

예를 들어 1,000만 명의 고객이 있는 서비스에서 고객 만족도를 조사한다고 하겠습니다.

1,000만 명 전부를 조사하기 어려우므로 일정한 기준으로 5,000명을 선정합니다.

그리고 이들의 만족도를 분석합니다.

여기서:

1,000만 명 전체 고객

→ 모집단

조사한 5,000명

→ 표본

전체 고객의 실제 평균 만족도

→ 모수

5,000명의 평균 만족도

→ 통계량

입니다.

이 네 가지 관계를 함께 이해하면 통계의 기본 구조가 보이기 시작합니다.


12장 전수조사 Census란 무엇인가#

전수조사는 모집단 전체를 조사하는 방식입니다.

영어로는 Census라고 합니다.

예를 들어 어떤 학교에 학생이 300명이고 300명 모두의 키를 조사했다면 전수조사입니다.

제공된 학습자료에서는 전수조사의 특징을 다음과 같이 정리합니다.

  • 모집단 전체 조사
  • 정확도가 높음
  • 비용과 시간이 많이 필요
  • 소규모 집단에 적합

핵심#

Census = 모두 조사

입니다.


13장 전수조사의 장점#

전수조사의 가장 큰 특징은 모집단 전체를 대상으로 한다는 것입니다.

표본을 일부만 선택하는 과정에서 발생할 수 있는 표본 관련 오차를 줄일 수 있습니다.

예를 들어 회사 직원이 30명뿐이라면 굳이 일부 직원만 조사할 필요가 없을 수 있습니다.

30명 모두를 조사하는 것이 가능하기 때문입니다.

따라서 소규모 모집단에서는 전수조사가 현실적인 방법이 될 수 있습니다.


14장 전수조사의 단점#

모집단이 커지면 문제가 달라집니다.

예를 들어 수천만 명을 조사해야 한다면:

  • 조사 인력
  • 시간
  • 비용
  • 데이터 수집 과정

이 크게 증가합니다.

그래서 대규모 모집단에서는 전수조사가 쉽지 않을 수 있습니다.

핵심#

전수조사 = 정확한 전체 조사이지만 비용·시간 부담이 큼

입니다.


15장 표본조사 Sampling이란 무엇인가#

표본조사는 모집단 전체가 아니라 일부 표본만 추출하여 조사하는 방법입니다.

예를 들어 국민 5,000만 명 가운데 2,000명을 조사하여 전체 국민의 의견을 추정하는 방식입니다.

제공된 학습자료에서는 다음 특징을 제시합니다.

  • 모집단에서 일부 추출
  • 추론통계 활용
  • 비용·시간 절약
  • 대규모 집단에 적합

핵심#

Sampling = 일부를 조사하여 전체를 추정

입니다.


16장 전수조사와 표본조사를 비교하면#

구분 전수조사 Census 표본조사 Sampling
조사 대상 모집단 전체 모집단 일부
비용 큼 상대적으로 작음
시간 많이 필요 상대적으로 적음
활용 소규모 집단에 유리 대규모 집단에 유리
통계적 역할 전체 특성 확인 표본으로 모집단 추론

쉽게 기억하면:

전수 = 전부

표본 = 일부

입니다.


17장 표본조사와 추론통계의 관계#

표본조사는 단순히 일부 데이터만 보고 끝나는 것이 아닙니다.

표본에서 얻은 결과를 바탕으로 모집단 전체의 특성을 추론합니다.

예를 들어 2,000명을 조사해 특정 제품에 대한 선호도가 65%라고 나왔다고 하겠습니다.

우리가 궁금한 것은 단순히 조사한 2,000명의 선호도만이 아니라 전체 소비자의 선호도일 수 있습니다.

이처럼:

표본 → 전체 모집단을 추론

하는 것이 추론통계의 중요한 역할입니다.


18장 빅데이터 시대와 전수조사#

제공된 학습자료에서는 빅데이터 시대의 변화 가운데 하나로:

표본조사 → 전수조사

를 제시합니다.

과거에는 데이터 수집과 저장에 비용이 많이 들어 일부 표본을 이용하는 경우가 많았습니다.

하지만 디지털 서비스에서는 사용자의 행동 데이터가 자동으로 수집되는 경우가 많습니다.

예를 들어 온라인 쇼핑몰에서는 전체 사용자의:

  • 클릭
  • 검색
  • 주문
  • 접속

기록을 대규모로 저장할 수 있습니다.

따라서 과거보다 전체 데이터를 대상으로 분석할 가능성이 커졌다는 의미로 이해하면 됩니다.


19장 전수조사가 가능해졌다고 표본조사가 사라지는 것은 아니다#

학습자료에서는 빅데이터 시대의 변화를 표본조사에서 전수조사로의 확대라는 흐름으로 제시합니다.

핵심은 데이터 저장·처리 기술의 발전으로 과거보다 훨씬 많은 데이터를 직접 분석할 수 있게 되었다는 것입니다.

ADsP 시험에서는 이 흐름을:

빅데이터 시대 → 전수조사 가능성 확대

로 기억하면 됩니다.


20장 확률변수란 무엇인가#

통계에서는 확률변수 Random Variable라는 개념을 자주 사용합니다.

확률변수는 확률적인 결과를 수치로 표현하는 변수라고 이해할 수 있습니다.

예를 들어 주사위를 던지면 나올 수 있는 결과는:

1, 2, 3, 4, 5, 6

입니다.

이처럼 확률적으로 결정되는 값을 하나의 변수로 다룰 수 있습니다.

제공된 학습자료에서는 확률변수를 크게:

  • 이산형 확률변수
  • 연속형 확률변수

로 구분합니다.


21장 이산형 확률변수란 무엇인가#

이산형 확률변수는 셀 수 있는 값을 가지는 확률변수입니다.

대표적인 예는:

  • 주사위 눈
  • 동전 앞뒤

입니다.

주사위를 던졌을 때 결과는:

1, 2, 3, 4, 5, 6

중 하나입니다.

가능한 값을 하나씩 셀 수 있습니다.

핵심#

이산형 = 셀 수 있음

입니다.


22장 이산형 데이터의 다른 사례#

이산형 개념을 조금 더 쉽게 이해하면 다음과 같은 값을 생각할 수 있습니다.

  • 하루 주문 건수
  • 고객 수
  • 불량 제품 개수

예를 들어 주문 건수는:

0건, 1건, 2건, 3건...

처럼 개수 단위로 셀 수 있습니다.

이런 성격이 이산적인 값의 특징입니다.


23장 연속형 확률변수란 무엇인가#

연속형 확률변수는 제공된 학습자료에서 셀 수 없는 값으로 설명합니다.

대표적인 예는:

  • 키
  • 무게
  • 시간

입니다.

예를 들어 사람의 키는 단순히:

170cm

171cm

처럼 정수만 존재하는 것이 아닙니다.

170.1cm

170.12cm

170.123cm

처럼 연속적인 값으로 나타날 수 있습니다.

핵심#

연속형 = 연속적으로 측정되는 값

입니다.


24장 이산형과 연속형을 비교하면#

구분 이산형 확률변수 연속형 확률변수
특징 셀 수 있는 값 연속적으로 측정되는 값
대표 예 주사위 눈 키
대표 예 동전 앞뒤 무게
대표 예 개수 시간

가장 쉬운 구분은:

개수 → 이산형

측정값 → 연속형

이라고 생각하는 것입니다.


25장 주문 건수와 배송시간으로 구분해보기#

온라인 쇼핑몰을 예로 들어보겠습니다.

오늘 주문 건수#

253건

→ 몇 건인지 셀 수 있습니다.

→ 이산형

주문 후 배송까지 걸린 시간#

27.53시간

→ 연속적인 값으로 측정됩니다.

→ 연속형

시험에서 사례가 나오면 이처럼 셀 수 있는 개수인지 연속적으로 측정하는 값인지를 확인하면 됩니다.


26장 스피어만 상관계수란 무엇인가#

제공된 학습자료에서는 통계 기초에서 자주 출제되는 문제로 스피어만 상관계수 Spearman Correlation를 제시합니다.

스피어만 상관계수의 핵심은 순위 Rank입니다.

원래 측정값 자체보다 각 관측값의 순위를 이용하여 관계를 분석합니다.

제공된 학습자료에서는 다음 특징을 강조합니다.

  • 서열척도에서 사용 가능
  • 명목척도에는 적용 불가
  • 원시 데이터가 아니라 순위를 매긴 값을 기반으로 계산
  • 비선형 관계도 나타낼 수 있음

시험에서는 무엇보다:

Spearman = 순위

를 먼저 기억해야 합니다.


27장 스피어만 상관계수를 순위로 이해하기#

예를 들어 학생 5명의:

  • 수학 성적 순위
  • 과학 성적 순위

가 있다고 하겠습니다.

학생 수학 순위 과학 순위
A 1 2
B 2 1
C 3 3
D 4 5
E 5 4

스피어만 상관계수에서는 점수 자체보다는 이러한 순위 사이의 관계에 주목합니다.

즉:

수학 순위가 높은 학생이 과학에서도 대체로 높은 순위를 보이는가?

를 살펴볼 수 있습니다.

핵심#

Spearman = Rank 기반 상관관계

입니다.


28장 서열척도에서 스피어만을 사용할 수 있는 이유#

서열척도는 값 사이의 순서가 의미 있는 데이터입니다.

예를 들어:

  • 1등
  • 2등
  • 3등

또는:

  • 매우 만족
  • 만족
  • 보통
  • 불만족
  • 매우 불만족

처럼 순서가 존재합니다.

스피어만 상관계수는 순위를 기반으로 하기 때문에 이러한 서열형 데이터의 관계를 살펴보는 데 활용할 수 있습니다.


29장 명목척도에는 왜 적용하지 않는가#

명목척도는 단순히 범주를 구분하는 데이터입니다.

예를 들어:

  • 혈액형
  • 지역
  • 색상

과 같은 데이터에서는 일반적으로 범주 자체에 순서가 존재하지 않습니다.

A형이 B형보다 크다거나, 서울이 부산보다 높은 순위라고 할 수 없습니다.

따라서 순위를 기반으로 하는 스피어만 상관계수를 명목척도에 그대로 적용할 수 없습니다.

시험 핵심#

Spearman → 서열척도 O

명목척도 X

입니다.


30장 스피어만에서 원시 데이터보다 순위가 중요하다#

제공된 학습자료에서 중요한 문장입니다.

스피어만 상관계수는 원시 데이터 자체가 아니라 순위를 매긴 값을 기반으로 계산합니다.

예를 들어 두 데이터가 다음과 같다고 하겠습니다.

A:

10, 20, 30, 40

B:

100, 400, 900, 1600

수치 증가 폭은 서로 다르지만 순서는 동일합니다.

두 변수 모두:

1위 → 2위 → 3위 → 4위

라는 동일한 순서 관계를 가질 수 있습니다.

스피어만에서는 이러한 순위 관계를 중요하게 봅니다.


31장 스피어만에서 시험이 노리는 포인트#

문제에 다음 단어가 보이면 스피어만을 떠올릴 수 있습니다.

  • 순위
  • Rank
  • 서열척도

반대로:

명목척도

가 나오면 그대로 적용할 수 없다는 점을 주의합니다.

시험 직전에는:

Spearman = 순위 = 서열

로 묶어 기억하면 좋습니다.


32장 K-NN이란 무엇인가#

제공된 학습자료에서는 통계 기초와 함께 K-NN K-최근접이웃의 주의점도 자주 출제되는 내용으로 제시합니다.

K-NN은 새로운 데이터가 들어왔을 때 주변에서 가장 가까운 데이터들을 살펴보고 결과를 결정하는 방식입니다.

이름 자체가 의미를 설명합니다.

K

→ 몇 개의 이웃을 볼 것인가

NN

→ Nearest Neighbors

→ 가장 가까운 이웃

입니다.


33장 K-NN을 일상적인 사례로 이해하기#

새로운 고객 A가 있다고 생각해봅시다.

고객 A와 행동 패턴이 가장 비슷한 기존 고객들을 찾아봅니다.

가까운 5명의 고객 가운데:

  • 4명 → 상품 구매
  • 1명 → 구매하지 않음

이라면 새로운 고객 역시 구매할 가능성이 높은 쪽으로 분류할 수 있습니다.

이처럼 가까운 데이터의 특징을 이용해 새로운 데이터를 판단하는 것이 K-NN의 기본 아이디어입니다.


34장 K-NN은 왜 게으른 학습인가#

제공된 학습자료에서는 K-NN의 특징으로:

사전 학습 없이 새 데이터를 분류할 수 있다

는 점을 강조합니다.

이를 게으른 학습 Lazy Learning이라고 부릅니다.

일반적인 모델은 먼저 학습 데이터를 이용하여 모델을 만든 뒤 새로운 데이터를 예측합니다.

K-NN은 별도의 복잡한 모델을 미리 만들어놓기보다 새로운 데이터가 들어오면 기존 데이터와 거리를 비교하여 결과를 결정합니다.

핵심#

K-NN = 사전 학습 모델 구축 없이 예측 시점에 이웃 탐색

입니다.


35장 K는 무엇을 의미하는가#

K는 판단에 사용할 가까운 이웃의 개수를 의미합니다.

예를 들어:

K = 3

이면 가장 가까운 3개 데이터를 봅니다.

K = 5

이면 가장 가까운 5개 데이터를 봅니다.

따라서 K값에 따라 분류 결과와 모델의 특성이 달라질 수 있습니다.


36장 K가 너무 크면 어떻게 되는가#

제공된 학습자료에서 매우 중요한 함정입니다.

K가 너무 크면 과소적합 Underfitting이 발생할 수 있습니다.

시험에서 이를 과적합이라고 바꾸어 출제할 수 있으므로 주의해야 합니다.

K를 지나치게 크게 잡으면 가까운 주변의 특징뿐 아니라 멀리 떨어진 데이터까지 많이 포함하게 됩니다.

그 결과 지역적인 특징을 충분히 반영하지 못하고 지나치게 일반화될 수 있습니다.

핵심#

K 너무 큼 → Underfitting

입니다.


37장 왜 K가 커지면 과소적합으로 이어질 수 있는가#

동네 맛집을 추천한다고 생각해봅시다.

현재 위치 주변 5개의 음식점만 보면 내가 있는 지역의 특성을 잘 반영할 수 있습니다.

그런데 전국 음식점 10만 개를 모두 고려한다면 현재 동네의 특성이 희석될 수 있습니다.

K-NN도 비슷합니다.

K가 지나치게 커지면 매우 가까운 이웃의 특성보다 전체 데이터의 일반적인 특성이 강하게 반영됩니다.

그래서 모델이 데이터의 세부 패턴을 충분히 표현하지 못하는 과소적합이 발생할 수 있습니다.


38장 과소적합 Underfitting을 쉽게 이해하면#

과소적합은 모델이 데이터의 특징을 충분히 학습하거나 표현하지 못한 상태입니다.

쉽게 말하면:

모델이 너무 단순해서 중요한 패턴까지 놓치는 상태

입니다.

K-NN에서는 K를 너무 크게 설정하면 주변의 작은 패턴이 평균화되어 중요한 경계를 놓칠 수 있습니다.

따라서 시험에서는 다음 연결을 기억합니다.

K가 너무 크다

→ 지나치게 일반화

→ Underfitting

입니다.


39장 K-NN 시험에서 주의할 함정#

다음 문장을 보겠습니다.

K-NN에서 k가 너무 크면 과적합이 발생한다.

제공된 학습자료 기준으로 틀린 설명입니다.

정답은:

과소적합 Underfitting

입니다.

또한:

K-NN은 반드시 복잡한 사전 학습 과정을 거쳐야 새로운 데이터를 분류할 수 있다.

역시 제공된 학습자료의 설명과 맞지 않습니다.

K-NN은 게으른 학습 방식과 연결합니다.


40장 통계 기초 개념을 하나의 흐름으로 연결하면#

지금까지 배운 개념은 서로 따로 떨어져 있는 것이 아닙니다.

우리가 어떤 사람들의 평균 키를 알고 싶다고 하겠습니다.

1. 모집단 결정#

대한민국 성인 전체

2. 조사방법 결정#

전체를 조사하면:

→ 전수조사

일부를 조사하면:

→ 표본조사

3. 모집단의 실제 평균#

→ 모수 μ

4. 표본에서 계산한 평균#

→ 통계량 x̄

5. 측정한 키#

→ 연속형 값

이렇게 연결하면 통계 기초 개념이 하나의 구조로 이해됩니다.


41장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. 모수는 표본의 특성을 나타낸다#

틀립니다.

모수는 모집단의 특성입니다.

함정 2. 통계량은 모집단에서 계산한다#

틀립니다.

통계량은 표본에서 계산합니다.

함정 3. μ는 표본평균이다#

틀립니다.

μ는 모평균입니다.

표본평균은 x̄입니다.

함정 4. σ²는 표본분산이다#

틀립니다.

σ²는 모분산입니다.

표본분산은 s²입니다.

함정 5. 전수조사는 모집단 일부를 조사한다#

틀립니다.

모집단 전체를 조사합니다.

함정 6. 표본조사는 대규모 집단에 사용할 수 없다#

틀립니다.

오히려 비용과 시간을 절약할 수 있어 대규모 모집단 조사에서 활용할 수 있습니다.

함정 7. 주사위 눈은 연속형 확률변수다#

틀립니다.

셀 수 있는 값이므로 이산형입니다.

함정 8. 키와 시간은 이산형이다#

틀립니다.

제공된 학습자료에서는 연속형 확률변수의 예로 제시합니다.

함정 9. 스피어만 상관계수는 명목척도에 사용한다#

틀립니다.

서열척도에서 사용할 수 있으며 명목척도에는 적용하지 않습니다.

함정 10. 스피어만은 순위가 아니라 원시 데이터 값만 사용한다#

틀립니다.

순위를 매긴 값을 기반으로 계산합니다.

함정 11. K-NN은 사전 학습이 반드시 필요하다#

틀립니다.

제공된 학습자료에서는 게으른 학습 방식으로 설명합니다.

함정 12. K가 너무 크면 과적합이 발생한다#

틀립니다.

제공된 학습자료 기준으로 과소적합 Underfitting이 발생할 수 있습니다.


42장 모수와 통계량 시험 직전 암기#

모수 Parameter#

→ 모집단

→ μ

→ σ²

→ 일반적으로 직접 알기 어려움

통계량 Statistic#

→ 표본

→ x̄

→ s²

→ 표본에서 계산 가능

한 줄로:

모수는 모집단, 통계량은 표본

입니다.


43장 전수조사와 표본조사 시험 직전 암기#

Census#

→ 모집단 전체

→ 정확도 높음

→ 비용·시간 큼

→ 소규모에 적합

Sampling#

→ 모집단 일부

→ 추론통계

→ 비용·시간 절약

→ 대규모에 적합

쉽게:

Census = 모두

Sampling = 일부

입니다.


44장 이산형과 연속형 시험 직전 암기#

이산형#

→ 셀 수 있다

→ 주사위 눈

→ 동전 결과

→ 개수

연속형#

→ 연속적으로 측정

→ 키

→ 무게

→ 시간

한 줄로:

세면 이산, 재면 연속

이라고 기억할 수 있습니다.


45장 스피어만 시험 직전 암기#

Spearman

→ Rank

→ 순위 데이터

→ 서열척도 O

→ 명목척도 X

→ 원시값보다 순위를 기반으로 계산

시험에서:

순위

라는 말이 보이면 스피어만을 떠올리는 것이 핵심입니다.


46장 K-NN 시험 직전 암기#

K-NN

→ K-최근접이웃

→ 가까운 이웃으로 분류

→ Lazy Learning

→ 사전 학습 모델 구축 없이 새로운 데이터 분류 가능

그리고 가장 중요한 함정:

K 너무 큼 → Underfitting

입니다.


47장 ADsP 3과목 학습전략#

제공된 학습자료에서는 3과목의 핵심 전략을 다음 순서로 제시합니다.

개념 이해

↓

공식 암기

↓

결과 해석

입니다.

이 순서가 중요한 이유는 통계 공식을 무조건 외워도 문제에서 무엇을 계산하는지 이해하지 못하면 활용하기 어렵기 때문입니다.

예를 들어 표본평균 공식을 알고 있더라도:

  • 모집단인지
  • 표본인지
  • 무엇을 추정하려는지

를 구분하지 못하면 문제 풀이가 어려워질 수 있습니다.

따라서 통계에서는 개념을 먼저 이해하고 공식을 연결한 뒤 결과의 의미까지 해석하는 방식이 중요합니다.


통계 기초 FAQ#

모수 Parameter란 무엇인가#

모집단 전체의 특성을 나타내는 값입니다. 대표적으로 모평균 μ와 모분산 σ²가 있습니다.

통계량 Statistic이란 무엇인가#

표본에서 계산한 값입니다. 대표적으로 표본평균 x̄와 표본분산 s²가 있습니다.

모수와 통계량의 가장 큰 차이는 무엇인가#

모수는 모집단의 특성을 나타내고 통계량은 표본의 특성을 나타냅니다.

μ는 무엇인가#

모집단의 평균을 나타내는 모평균입니다.

x̄는 무엇인가#

표본에서 계산한 표본평균입니다.

σ²와 s²의 차이는 무엇인가#

σ²는 모분산이고 s²는 표본분산입니다.

전수조사란 무엇인가#

모집단 전체를 조사하는 방식입니다.

표본조사란 무엇인가#

모집단 일부를 추출하여 조사하고 그 결과를 통해 모집단을 추론하는 방식입니다.

빅데이터 시대에는 조사 방식이 어떻게 변했는가#

제공된 학습자료에서는 많은 데이터를 직접 수집·처리할 수 있게 되면서 표본조사에서 전수조사로 확대되는 변화를 핵심으로 제시합니다.

이산형 확률변수란 무엇인가#

셀 수 있는 값을 가지는 확률변수입니다. 주사위 눈 등이 대표적인 예입니다.

연속형 확률변수란 무엇인가#

키·무게·시간처럼 연속적으로 측정할 수 있는 값을 가지는 확률변수입니다.

스피어만 상관계수는 어떤 데이터에 사용하는가#

제공된 학습자료에서는 순위 데이터와 서열척도에서 사용할 수 있다고 설명합니다.

스피어만 상관계수를 명목척도에 사용할 수 있는가#

제공된 학습자료 기준으로는 적용할 수 없습니다.

스피어만 상관계수에서 중요한 것은 무엇인가#

원시 데이터 값 자체보다 순위를 매긴 값을 기반으로 계산한다는 점입니다.

K-NN이란 무엇인가#

새로운 데이터와 가까운 기존 데이터들을 확인하여 결과를 분류하는 K-최근접이웃 방식입니다.

K-NN이 게으른 학습이라고 불리는 이유는 무엇인가#

제공된 학습자료에서는 별도의 사전 학습 없이 새로운 데이터가 들어왔을 때 기존 데이터를 이용해 분류한다는 특징과 연결합니다.

K가 너무 커지면 어떻게 되는가#

제공된 학습자료에서는 과소적합 Underfitting이 발생할 수 있다고 설명합니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 모집단과 표본의 차이를 설명할 수 있는가?
  2. 모수와 통계량의 차이를 설명할 수 있는가?
  3. μ가 무엇을 의미하는지 알고 있는가?
  4. x̄가 무엇을 의미하는지 알고 있는가?
  5. σ²와 s²를 구분할 수 있는가?
  6. 전수조사와 표본조사의 차이를 설명할 수 있는가?
  7. 전수조사가 비용과 시간이 많이 필요하다는 것을 알고 있는가?
  8. 표본조사가 추론통계와 연결된다는 것을 알고 있는가?
  9. 이산형과 연속형 확률변수를 구분할 수 있는가?
  10. 주사위 눈이 이산형이라는 것을 알고 있는가?
  11. 키·무게·시간이 연속형이라는 것을 알고 있는가?
  12. 스피어만 상관계수가 순위를 이용한다는 것을 알고 있는가?
  13. 스피어만을 서열척도와 연결할 수 있는가?
  14. 명목척도에는 스피어만을 적용하지 않는다는 것을 기억하고 있는가?
  15. K-NN의 K가 무엇을 의미하는지 설명할 수 있는가?
  16. K-NN이 게으른 학습이라는 것을 알고 있는가?
  17. K가 너무 크면 과소적합이 발생할 수 있다는 것을 기억하고 있는가?

이 글을 마치며#

통계 기초를 공부할 때 가장 먼저 머릿속에 만들어야 하는 구조는 다음과 같습니다.

우리가 알고 싶은 전체가 있습니다.

→ 모집단

모집단의 실제 특성은:

→ 모수

입니다.

하지만 전체를 조사하기 어렵기 때문에 일부를 뽑습니다.

→ 표본

표본에서 계산한 값은:

→ 통계량

입니다.

따라서 가장 중요한 첫 번째 문장은:

모수는 모집단, 통계량은 표본

입니다.

조사방법은:

전부 조사하면 Census

일부 조사하면 Sampling

입니다.

확률변수는:

셀 수 있으면 이산형

연속적으로 측정하면 연속형

으로 구분합니다.

그리고 시험에서 자주 등장하는 두 가지 함정도 함께 기억합니다.

Spearman = 순위·서열척도

K-NN에서 K가 너무 크면 Underfitting

입니다.

ADsP 3과목은 암기만으로 해결하기보다 다음 순서를 유지하는 것이 중요합니다.

개념을 이해하고 → 공식을 익히고 → 결과의 의미를 해석한다.

시험 직전에는 다음 다섯 줄로 압축하면 됩니다.

모수 = 모집단 / 통계량 = 표본

Census = 전체 / Sampling = 일부

세면 이산 / 재면 연속

Spearman = 순위

K-NN의 K가 너무 크면 과소적합

이 페이지의 목차