시계열분석이란? 추세·계절성·순환·불규칙·ARIMA·ACF·PACF·차분 쉽게 이해하기

1장 시계열분석이란 무엇인가#

시계열분석 Time Series Analysis은 시간의 흐름에 따라 관측된 데이터를 분석하는 방법입니다.

일반적인 데이터 분석에서는 데이터의 순서가 중요하지 않은 경우도 많습니다. 하지만 시계열 데이터에서는 순서가 매우 중요합니다.

예를 들어 다음과 같은 데이터가 있습니다.

  • 월별 매출
  • 일별 방문자 수
  • 시간별 전력사용량
  • 연도별 인구
  • 분기별 경제성장률
  • 주가

이런 데이터에서는 단순히 값의 크기만 보는 것이 아니라:

시간이 지나면서 어떤 방향으로 변하고 있는가?

일정한 주기로 반복되는 패턴이 있는가?

과거 값이 현재 값과 관계가 있는가?

를 분석해야 합니다.


2장 시계열 구성요소 4가지#

ADsP에서 매우 자주 출제되는 부분입니다.

시계열은 크게 다음 네 가지 요소로 나누어 생각합니다.

  • 추세 Trend
  • 계절성 Seasonality
  • 순환 Cycle
  • 불규칙 Irregular 또는 Residual

암기법은 제공된 학습자료 기준:

추·계·순·불

입니다.


3장 추세 Trend란 무엇인가#

추세는 시계열 데이터가 장기간에 걸쳐 전체적으로 증가하거나 감소하는 방향을 의미합니다.

예를 들어 한 국가의 소비가 수십 년 동안 지속적으로 증가하고 있다면 장기적인 상승 추세가 있다고 볼 수 있습니다.

또는 어떤 제품의 판매량이 몇 년에 걸쳐 지속적으로 감소한다면 하락 추세가 존재하는 것입니다.

핵심#

Trend = 장기적인 증가 또는 감소

입니다.


4장 추세를 쉽게 이해하면#

온라인 쇼핑몰의 연간 매출이 다음처럼 증가한다고 하겠습니다.

2022년 → 10억

2023년 → 12억

2024년 → 15억

2025년 → 18억

세부적인 월별 변동은 있더라도 전체적으로 올라가는 방향이 나타납니다.

이것이 상승 추세입니다.

반대로 시간이 지날수록 지속적으로 감소한다면 하락 추세라고 할 수 있습니다.


5장 계절성 Seasonality란 무엇인가#

계절성은 일정한 주기로 반복되는 패턴입니다.

제공된 학습자료에서는 다음과 같은 주기를 예로 듭니다.

  • 계절
  • 연간
  • 월간
  • 요일

예를 들어 여름마다 에어컨 판매량이 증가하고 겨울마다 감소한다면 일정한 계절적 패턴이 반복되는 것입니다.

핵심#

Seasonality = 일정한 주기로 반복

입니다.


6장 계절성은 꼭 사계절만 의미하는가#

아닙니다.

Seasonality라는 이름 때문에 봄·여름·가을·겨울만 생각하기 쉽지만 제공된 학습자료에서는:

  • 연간
  • 월간
  • 요일

처럼 고정된 주기로 반복되는 현상을 계절성으로 설명합니다.

예를 들어:

주말마다 방문객 증가

매달 월급날 이후 소비 증가

매년 여름 전력사용량 증가

와 같은 패턴도 계절성으로 볼 수 있습니다.


7장 순환 Cycle이란 무엇인가#

순환은 경기 변동처럼 장기간에 걸쳐 반복되지만 주기가 일정하지 않은 변동입니다.

대표적인 사례는:

  • 경기 호황
  • 경기 침체
  • 다시 회복

과 같은 경제 사이클입니다.

계절성과 가장 큰 차이는 주기가 고정되어 있지 않다는 점입니다.

핵심#

Cycle = 불규칙한 장기 주기 변동

입니다.


8장 계절성과 순환의 차이#

시험에서 매우 자주 혼동하는 부분입니다.

계절성#

고정된 주기

예:

매년 여름 에어컨 판매 증가

매주 금요일 외식 주문 증가

순환#

불규칙한 장기 변동

예:

경기 호황과 불황

즉:

Seasonality = 규칙적인 반복

Cycle = 주기가 일정하지 않은 장기 흐름

입니다.


9장 불규칙 Irregular이란 무엇인가#

불규칙 요소는 예측하기 어려운 우연한 변동을 의미합니다.

다른 말로 Residual이라고도 표현할 수 있습니다.

예를 들어:

  • 갑작스러운 사고
  • 예상하지 못한 사건
  • 일시적인 충격

등으로 데이터가 크게 변할 수 있습니다.

핵심#

Irregular = 예측하기 어려운 우연 변동

입니다.


10장 시계열 4요소 한눈에 보기#

구성요소 의미 예
Trend 장기 증가·감소 경제성장에 따른 소비 증가
Seasonality 일정 주기 반복 여름 에어컨 판매 증가
Cycle 불규칙한 장기 변동 경기 호황·불황
Irregular 우연한 변동 갑작스러운 사건

시험 직전에는:

추세는 방향

계절은 반복

순환은 경기

불규칙은 예외

로 기억하면 쉽습니다.


11장 정상성 Stationarity이란 무엇인가#

시계열분석에서 매우 중요한 개념이 정상성 Stationarity입니다.

제공된 학습자료에서는 정상성을:

시계열의 수준과 분산에 체계적인 변화가 없고 주기적 변동이 없는 상태

로 설명합니다.

또한 정상 시계열의 중요한 조건으로:

시점과 관계없이 평균과 분산이 일정

하다는 점을 강조합니다.


12장 정상 시계열의 핵심 조건#

시험에서는 다음 두 가지를 가장 먼저 기억하면 됩니다.

평균#

시간이 지나도 일정

분산#

시간이 지나도 일정

즉 특정 시점에서는 평균이 10이고 다른 시점에서는 평균이 100으로 계속 변한다면 정상적인 시계열이라고 보기 어렵습니다.

핵심#

정상성 = 평균과 분산이 시간에 따라 안정적

입니다.


13장 비정상 시계열이란 무엇인가#

시간이 지나면서 평균이나 분산이 계속 변하는 시계열은 비정상 시계열일 수 있습니다.

예를 들어 매출이 장기적으로 계속 증가한다면 평균 수준 자체가 시간에 따라 변할 수 있습니다.

이런 시계열을 ARIMA와 같은 방법으로 분석하려면 먼저 정상화하는 과정이 필요할 수 있습니다.

제공된 학습자료에서 대표적으로 제시하는 방법이 차분 Differencing입니다.


14장 차분 Differencing이란 무엇인가#

차분은 현재 시점의 값에서 이전 시점의 값을 빼는 방법입니다.

즉:

현재값 − 이전값

을 계산합니다.

예를 들어 매출이:

100

120

150

이라면 1차 차분은:

120 − 100 = 20

150 − 120 = 30

이 됩니다.

핵심#

Differencing = 현재 − 이전

입니다.


15장 차분은 왜 사용하는가#

제공된 학습자료에서는 차분을:

비정상 시계열을 정상 시계열로 변환하는 방법

으로 설명합니다.

장기적인 증가·감소 추세가 있는 데이터를 그대로 분석하기보다 값 자체가 아니라 변화량을 보면 보다 안정적인 형태가 될 수 있습니다.

시험 핵심#

비정상 → 차분 → 정상화

입니다.


16장 AR 모델이란 무엇인가#

AR은 AutoRegressive, 자기회귀 모델입니다.

제공된 학습자료에서는:

자기 자신의 과거 값을 사용하여 현재 값을 설명하는 모델

이라고 정의합니다.

즉:

어제 값, 그제 값이 오늘 값에 영향을 준다.

는 방식입니다.

핵심#

AR = 과거의 자기 값

입니다.


17장 AR을 쉽게 이해하면#

오늘의 매출이:

  • 어제 매출
  • 이틀 전 매출

과 강한 관계가 있다고 하겠습니다.

이런 경우 과거의 자기 값을 이용해 현재 값을 설명할 수 있습니다.

예를 들어 AR(2)라면 제공된 학습자료 기준:

과거 2개의 값

을 이용하는 구조로 이해할 수 있습니다.


18장 MA 모델이란 무엇인가#

MA는 Moving Average, 이동평균 모델입니다.

하지만 여기서 단순한 이동평균 계산과 혼동하면 안 됩니다.

제공된 학습자료에서는 MA 모델을:

과거의 오차항, 즉 백색잡음을 사용하여 현재 값을 설명하는 모델

이라고 설명합니다.

핵심#

MA = 과거의 오차

입니다.


19장 AR과 MA 차이#

AR#

과거의 자기 값

사용

MA#

과거의 오차항

사용

따라서 시험에서는:

AR = 값

MA = 오차

라고 기억하면 매우 쉽습니다.


20장 ARIMA란 무엇인가#

ARIMA는 AutoRegressive Integrated Moving Average의 약자입니다.

제공된 학습자료에서는:

AR + I + MA의 통합 모델

이라고 설명합니다.

표기 방식은:

ARIMA(p, d, q)

입니다.

각 값은 서로 다른 의미를 가집니다.


21장 ARIMA의 p는 무엇인가#

p는 AR 차수입니다.

즉 과거 몇 개의 자기 값을 사용할 것인지 나타냅니다.

제공된 학습자료에서는:

과거 p개 값의 선형 조합

이라고 설명합니다.

핵심#

p = AR 차수

입니다.


22장 ARIMA의 d는 무엇인가#

d는 차분 횟수입니다.

즉 비정상 시계열을 정상화하기 위해 몇 번 차분했는지를 나타냅니다.

예:

d = 1

→ 1차 차분

d = 2

→ 두 번 차분

입니다.

핵심#

d = Differencing 횟수

입니다.


23장 ARIMA의 q는 무엇인가#

q는 MA 차수입니다.

즉 과거 몇 개의 오차항을 사용하는지 나타냅니다.

제공된 학습자료에서는:

과거 q개 오차항의 선형 조합

으로 설명합니다.

핵심#

q = MA 차수

입니다.


24장 ARIMA의 I는 Independent인가#

아닙니다.

제공된 학습자료의 대표적인 함정입니다.

ARIMA의 I는 Independent를 의미한다.

틀립니다.

정확한 의미는:

Integrated

입니다.

학습자료에서는 이를 누적/차분과 연결합니다.

핵심#

ARIMA의 I = Integrated

입니다.


25장 ARIMA(p,d,q) 한 번에 기억하기#

p

→ AR

→ 과거 값

d

→ Integrated

→ 차분 횟수

q

→ MA

→ 과거 오차

한 줄로:

p는 과거 값, d는 차분, q는 과거 오차

입니다.


26장 ACF란 무엇인가#

ACF는 Autocorrelation Function, 자기상관함수입니다.

제공된 학습자료에서는:

시계열 데이터와 시차 Lag를 둔 자기 자신의 상관계수

라고 설명합니다.

즉 현재 값과:

  • 1시점 전
  • 2시점 전
  • 3시점 전

값 사이의 상관관계를 확인합니다.


27장 PACF란 무엇인가#

PACF는 Partial Autocorrelation Function, 부분자기상관함수입니다.

제공된 학습자료에서는:

중간 시차의 영향을 제거한 자기상관계수

라고 설명합니다.

예를 들어 현재값과 3시점 전 값의 관계를 볼 때 중간에 있는 1시점·2시점의 영향을 제거하고 직접적인 관계를 보는 개념으로 이해할 수 있습니다.


28장 AR(p)는 무엇으로 p를 결정하는가#

ADsP에서 매우 중요한 시험 포인트입니다.

제공된 학습자료에서는:

AR(p) → PACF가 p 시차에서 절단

된다고 설명합니다.

따라서:

PACF로 p 결정

입니다.

핵심#

AR → PACF → p

입니다.


29장 MA(q)는 무엇으로 q를 결정하는가#

MA(q)는 반대로:

ACF가 q 시차에서 절단

됩니다.

따라서:

ACF로 q 결정

입니다.

핵심#

MA → ACF → q

입니다.


30장 AR과 MA의 ACF·PACF 패턴#

제공된 학습자료에서는 다음과 같이 정리합니다.

모형 ACF 패턴 PACF 패턴 차수 결정
AR(p) 서서히 감소 p 시차에서 절단 PACF로 p
MA(q) q 시차에서 절단 서서히 감소 ACF로 q

이 표는 ADsP에서 매우 자주 출제됩니다.


31장 절단 Cut-off이란 무엇인가#

ACF나 PACF 그래프에서 특정 시차까지 값이 의미 있게 나타나다가 이후에는 갑자기 거의 사라지는 패턴을 절단이라고 이해할 수 있습니다.

예를 들어 PACF가:

Lag 1 → 큼

Lag 2 → 큼

Lag 3 이후 → 거의 없음

이라면:

p = 2

인 AR(2)을 고려할 수 있습니다.

제공된 학습자료에서는 이런 방식으로 AR 차수를 식별합니다.


32장 ARIMA 차수 암기법#

시험에서 가장 많이 혼동하는 부분입니다.

AR은 PACF

MA는 ACF

입니다.

즉:

AR → P

MA → A

처럼 반대쪽 알파벳을 연결한다고 기억할 수도 있습니다.

제공된 학습자료 역시:

AR(p)는 PACF로 p를 결정, MA(q)는 ACF로 q를 결정

을 핵심 함정으로 강조합니다.


33장 시계열 시험 함정 1#

계절성은 경기 호황과 불황처럼 일정하지 않은 장기 변동이다.

틀립니다.

그것은 순환 Cycle입니다.

계절성은 고정된 주기로 반복되는 패턴입니다.


34장 시계열 시험 함정 2#

순환은 매년 여름마다 반복되는 패턴이다.

틀립니다.

이는 계절성에 해당합니다.

순환은 주기가 고정되어 있지 않은 장기적 변동입니다.


35장 시계열 시험 함정 3#

AR 모델은 과거 오차항을 이용한다.

틀립니다.

AR은 과거의 자기 값을 사용합니다.

과거 오차항을 사용하는 것은 MA입니다.


36장 시계열 시험 함정 4#

MA(q)는 PACF로 q를 결정한다.

틀립니다.

제공된 학습자료에서는:

MA(q) → ACF

입니다.


37장 시계열 시험 함정 5#

AR(p)는 ACF가 p에서 절단된다.

틀립니다.

제공된 학습자료에서는:

PACF가 p 시차에서 절단

됩니다.


38장 시계열 시험 함정 6#

ARIMA의 d는 MA 차수를 의미한다.

틀립니다.

d는 차분 횟수입니다.


39장 유전 알고리즘이란 무엇인가#

유전 알고리즘 Genetic Algorithm은 생물학적 진화 과정을 모방한 최적화 알고리즘입니다.

제공된 학습자료에서는 다음 세 가지 연산을 중요하게 제시합니다.

  • 선택 Selection
  • 교차 Crossover
  • 변이 Mutation

이 과정을 반복하면서 더 좋은 해를 탐색합니다.

핵심#

유전 알고리즘 = 선택 + 교차 + 변이

입니다.


40장 유전 알고리즘을 쉽게 이해하면#

여러 후보 해가 있다고 생각해봅시다.

성능이 좋은 후보는 선택될 가능성을 높이고, 두 후보의 특징을 섞어 새로운 후보를 만들고, 일부는 무작위로 변형합니다.

이 과정을 여러 세대 반복하면서 점점 더 좋은 해를 찾습니다.

생물의 진화 과정과 비슷한 구조이기 때문에 유전 알고리즘이라는 이름을 사용합니다.


41장 부트스트랩 Bootstrap이란 무엇인가#

제공된 학습자료에서는 부트스트랩 관련 문제로 미추출 확률 계산을 제시합니다.

크기 N인 데이터에서 복원추출 방식으로 n번 추출할 때 어떤 특정 데이터가 한 번도 선택되지 않을 확률은:

(1 - 1/N)^n

입니다.


42장 부트스트랩 미추출 확률 예제#

N = 100

n = 100

이라고 하겠습니다.

특정 데이터 하나가 한 번의 추출에서 선택되지 않을 확률은:

1 - 1/100

입니다.

이를 100번 연속 선택하지 않을 확률은:

(1 - 1/100)^100

입니다.

제공된 학습자료에서는 결과를 약:

0.366

으로 제시합니다.

즉 약 36.6% 확률로 특정 데이터가 한 번도 선택되지 않을 수 있습니다.


43장 MDS 다차원 척도법이란 무엇인가#

MDS는 Multi-Dimensional Scaling, 다차원 척도법입니다.

제공된 학습자료에서는:

여러 대상 사이의 거리가 주어졌을 때 그 상대적인 거리를 유지하도록 실수 공간의 점으로 배치하는 방법

이라고 설명합니다.

쉽게 말하면 복잡한 대상들 사이의 거리 관계를 2차원이나 3차원 공간에 배치해 시각적으로 이해할 수 있게 만드는 방법입니다.

핵심#

MDS = 거리 관계를 공간에 배치

입니다.


44장 코사인 유사도란 무엇인가#

코사인 유사도 Cosine Similarity는 두 벡터의 방향이 얼마나 비슷한지 측정하는 유사성 지표입니다.

제공된 학습자료에서는:

두 개체의 벡터 내적에 기반하여 계산

한다고 설명합니다.

즉 벡터의 크기 자체보다 두 벡터가 비슷한 방향을 향하는지에 초점을 둡니다.

핵심#

Cosine Similarity = 벡터 방향 유사성

입니다.


45장 SOM이란 무엇인가#

SOM은 Self-Organizing Map, 자기조직화지도입니다.

제공된 학습자료에서는 코호넨 Kohonen에 의해 제시된 비지도 신경망으로 설명합니다.

고차원 데이터를 이해하기 쉬운 저차원 뉴런 공간에 정렬하여 지도 형태로 표현하는 클러스터링 방법입니다.

핵심#

SOM = 비지도 신경망 + 고차원 → 저차원 지도

입니다.


46장 SOM은 지도학습인가#

아닙니다.

제공된 학습자료에서 SOM은 비지도 신경망입니다.

즉 정답 레이블 없이 데이터의 구조를 학습하고 유사한 데이터들을 가까운 위치에 배치합니다.

시험에서는:

SOM = Unsupervised

를 기억하면 됩니다.


47장 ESD란 무엇인가#

ESD는 Extreme Studentized Deviation입니다.

제공된 학습자료에서는 이상값 탐색기법 중 하나로:

평균으로부터 k×표준편차만큼 떨어진 값을 이상값으로 판단

하는 방법이라고 설명합니다.

즉 평균에서 지나치게 멀리 떨어진 데이터를 이상치로 판단합니다.

핵심#

ESD = 평균에서 k×표준편차 이상 떨어진 값 탐지

입니다.


48장 포아송 분포란 무엇인가#

포아송 분포 Poisson Distribution는 이산형 확률분포입니다.

제공된 학습자료에서는:

주어진 시간 또는 영역에서 어떤 사건이 발생하는 횟수를 나타내는 확률분포

라고 설명합니다.

예를 들어:

  • 1시간 동안 발생하는 전화 수
  • 하루 동안 들어오는 주문 수
  • 특정 구간에서 발생하는 사고 수

처럼 사건 발생 횟수와 연결됩니다.

핵심#

Poisson = 일정 시간·영역의 사건 횟수

입니다.


49장 향상도 곡선 Lift Curve란 무엇인가#

향상도 곡선 Lift Curve는 분류모델을 평가하는 방법입니다.

제공된 학습자료에서는:

랜덤 모델과 비교하여 해당 모델의 성과가 얼마나 향상되었는지를 등급별로 파악하는 그래프

라고 설명합니다.

즉:

아무렇게나 고객을 선택하는 것보다 이 모델을 사용하면 얼마나 더 좋은 결과를 얻는가?

를 평가할 수 있습니다.

핵심#

Lift Curve = Random 대비 모델 향상 정도

입니다.


50장 연관규칙의 Lift와 Lift Curve는 같은 것인가#

이름은 같지만 문맥을 구분해야 합니다.

연관규칙분석에서 Lift는:

A와 B가 독립일 때보다 얼마나 더 함께 발생하는지

를 평가합니다.

분류모델 평가에서 Lift Curve는:

랜덤 모델과 비교했을 때 예측모델의 성과가 얼마나 개선되는지

를 나타냅니다.

시험에서는 어떤 분석 문맥에서 사용되는지 확인해야 합니다.


51장 홀드아웃 Hold-out이란 무엇인가#

홀드아웃 Hold-out은 모형을 평가하기 위한 방법입니다.

제공된 학습자료에서는 원천 데이터를 랜덤하게 두 집합으로 분리하여 사용하는 방식으로 설명합니다.

하나는:

훈련용 데이터

다른 하나는:

검증용 데이터

로 사용합니다.

핵심#

Hold-out = Train / Validation 분리

입니다.


52장 홀드아웃을 쉽게 이해하면#

전체 데이터가 1,000건 있다고 하겠습니다.

예를 들어 일부는 모델 학습에 사용하고 나머지는 모델의 성능을 평가하는 데 사용할 수 있습니다.

중요한 것은 모델이 이미 학습한 데이터만 잘 맞히는지를 보는 것이 아니라 보지 않은 데이터에서도 잘 작동하는지 확인하는 것입니다.


53장 내용 기반 필터링이란 무엇인가#

내용 기반 필터링 Content-Based Filtering은 추천시스템의 한 방법입니다.

제공된 학습자료에서는:

아이템에 대한 설명과 사용자의 선호를 기반으로 과거에 사용자가 좋아했던 것과 비슷한 아이템을 추천

하는 알고리즘이라고 설명합니다.

예를 들어 사용자가 액션 영화를 자주 봤다면 액션 요소가 비슷한 다른 영화를 추천할 수 있습니다.

핵심#

Content-Based = 내가 좋아한 것과 비슷한 아이템 추천

입니다.


54장 내용 기반 필터링을 쉽게 이해하면#

사용자가 과거에 다음 책들을 좋아했다고 하겠습니다.

  • 파이썬 입문
  • 데이터 분석
  • 머신러닝

그러면 시스템은 다른 사용자보다 이 사용자가 좋아했던 아이템의 특징을 중심으로 비슷한 책을 추천할 수 있습니다.

즉:

다른 사람이 무엇을 좋아했는가?

보다:

내가 예전에 좋아했던 아이템과 무엇이 비슷한가?

에 초점을 둡니다.


55장 ADsP 기타 개념 한눈에 비교#

개념 핵심
Genetic Algorithm 선택·교차·변이
Bootstrap 복원추출
MDS 거리 정보를 저차원 공간에 배치
Cosine Similarity 벡터 방향 유사성
SOM 비지도 신경망·저차원 지도
ESD 평균에서 k×표준편차 이상 거리
Poisson 일정 시간·영역의 사건 횟수
Lift Curve Random 대비 모델 성능 향상
Hold-out 훈련·검증 데이터 분리
Content-Based Filtering 과거 선호와 비슷한 아이템 추천

56장 시계열분석 시험 직전 암기#

시계열 4요소는:

추·계·순·불

입니다.

추세#

장기 증가·감소

계절성#

고정된 주기 반복

순환#

불규칙한 장기 주기

불규칙#

예측하기 어려운 우연 변동


57장 정상성 시험 직전 암기#

정상 시계열:

평균 일정

분산 일정

비정상 시계열을 정상화하는 대표 방법:

차분

차분:

현재값 − 이전값

입니다.


58장 ARIMA 시험 직전 암기#

ARIMA(p,d,q)

p#

AR 차수

과거 p개 값

d#

차분 횟수

q#

MA 차수

과거 q개 오차

그리고:

I = Integrated

입니다.


59장 ACF·PACF 시험 직전 암기#

AR(p)#

PACF가 p에서 절단

ACF는 서서히 감소

PACF로 p 결정

MA(q)#

ACF가 q에서 절단

PACF는 서서히 감소

ACF로 q 결정

한 줄로:

AR은 PACF, MA는 ACF

입니다.


60장 기타 개념 시험 직전 암기#

유전 알고리즘

→ 선택·교차·변이

Bootstrap 미추출

→ (1−1/N)^n

MDS

→ 거리 → 공간 배치

Cosine

→ 벡터 방향

SOM

→ 비지도 신경망

ESD

→ 평균 ± k×표준편차

Poisson

→ 사건 횟수

Lift Curve

→ 랜덤 대비 향상

Hold-out

→ Train / Validation

Content-Based

→ 내가 좋아한 것과 비슷한 아이템


61장 ADsP 시험에서 자주 헷갈리는 함정#

함정 1. Seasonality는 주기가 일정하지 않은 장기 변동이다#

틀립니다.

그것은 Cycle입니다.

함정 2. Cycle은 매주 반복되는 패턴이다#

틀립니다.

고정된 반복 주기는 Seasonality입니다.

함정 3. AR은 과거 오차를 사용한다#

틀립니다.

과거 자기 값을 사용합니다.

함정 4. MA는 과거 자기 값을 사용한다#

틀립니다.

과거 오차항을 사용합니다.

함정 5. AR의 차수 p는 ACF로 결정한다#

틀립니다.

제공된 학습자료 기준 PACF로 결정합니다.

함정 6. MA의 차수 q는 PACF로 결정한다#

틀립니다.

ACF로 결정합니다.

함정 7. ARIMA의 I는 Independent이다#

틀립니다.

Integrated입니다.

함정 8. 비정상 시계열은 차분으로 정상화할 수 없다#

틀립니다.

제공된 학습자료에서는 차분을 대표적인 정상화 방법으로 설명합니다.

함정 9. SOM은 지도학습 신경망이다#

틀립니다.

비지도 신경망입니다.

함정 10. 포아송 분포는 연속형 확률분포다#

틀립니다.

제공된 학습자료에서는 이산형 확률분포로 설명합니다.

함정 11. Hold-out은 데이터를 하나의 집합으로만 사용한다#

틀립니다.

훈련용과 검증용으로 나누어 사용합니다.


시계열분석 및 기타 FAQ#

시계열의 4가지 구성요소는 무엇인가#

추세 Trend, 계절성 Seasonality, 순환 Cycle, 불규칙 Irregular입니다.

계절성과 순환의 차이는 무엇인가#

계절성은 일정한 주기로 반복되고 순환은 주기가 일정하지 않은 장기 변동입니다.

정상성이란 무엇인가#

제공된 학습자료에서는 시점에 관계없이 평균과 분산이 일정하고 체계적인 수준 변화가 없는 상태로 설명합니다.

비정상 시계열을 정상화하는 대표 방법은 무엇인가#

차분 Differencing입니다.

AR 모델은 무엇을 사용하는가#

자기 자신의 과거 값을 사용합니다.

MA 모델은 무엇을 사용하는가#

과거의 오차항을 사용합니다.

ARIMA의 p는 무엇인가#

AR 차수입니다.

ARIMA의 d는 무엇인가#

차분 횟수입니다.

ARIMA의 q는 무엇인가#

MA 차수입니다.

ARIMA의 I는 무엇을 의미하는가#

Integrated입니다.

AR(p)의 p는 무엇으로 결정하는가#

PACF가 p 시차에서 절단되는 패턴을 이용합니다.

MA(q)의 q는 무엇으로 결정하는가#

ACF가 q 시차에서 절단되는 패턴을 이용합니다.

ACF란 무엇인가#

시계열과 시차를 둔 자기 자신의 상관관계를 나타내는 함수입니다.

PACF란 무엇인가#

중간 시차의 영향을 제거한 부분자기상관을 나타냅니다.

유전 알고리즘의 핵심 연산은 무엇인가#

선택, 교차, 변이입니다.

부트스트랩에서 특정 데이터가 한 번도 뽑히지 않을 확률은 어떻게 계산하는가#

제공된 학습자료 기준:

(1−1/N)^n

입니다.

MDS란 무엇인가#

대상 사이의 거리 관계를 유지하면서 저차원의 실수 공간에 배치하는 방법입니다.

코사인 유사도란 무엇인가#

벡터 내적을 기반으로 두 벡터의 방향 유사성을 측정하는 방법입니다.

SOM이란 무엇인가#

고차원 데이터를 저차원의 지도 형태로 표현하는 비지도 신경망입니다.

ESD란 무엇인가#

평균에서 k×표준편차 이상 떨어진 값을 이상치로 판단하는 방법입니다.

포아송 분포란 무엇인가#

주어진 시간이나 영역에서 사건의 발생 횟수를 나타내는 이산형 확률분포입니다.

Lift Curve란 무엇인가#

랜덤 모델과 비교하여 분류모델의 성과 향상 정도를 확인하는 그래프입니다.

Hold-out이란 무엇인가#

데이터를 훈련용과 검증용으로 나누어 모델을 평가하는 방법입니다.

내용 기반 필터링이란 무엇인가#

사용자가 과거에 좋아했던 아이템의 특징을 기반으로 비슷한 아이템을 추천하는 방법입니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 시계열의 4가지 구성요소를 말할 수 있는가?
  2. Seasonality와 Cycle을 구분할 수 있는가?
  3. 정상성에서 평균과 분산의 조건을 알고 있는가?
  4. 차분이 무엇인지 설명할 수 있는가?
  5. AR과 MA의 차이를 설명할 수 있는가?
  6. ARIMA의 p·d·q를 각각 설명할 수 있는가?
  7. ARIMA의 I가 Integrated라는 것을 알고 있는가?
  8. AR은 PACF로 p를 결정한다는 것을 기억하고 있는가?
  9. MA는 ACF로 q를 결정한다는 것을 기억하고 있는가?
  10. ACF와 PACF의 차이를 설명할 수 있는가?
  11. 유전 알고리즘의 선택·교차·변이를 기억하고 있는가?
  12. Bootstrap 미추출 확률 공식을 알고 있는가?
  13. MDS의 목적을 설명할 수 있는가?
  14. 코사인 유사도가 벡터 방향을 비교한다는 것을 알고 있는가?
  15. SOM이 비지도 신경망이라는 것을 알고 있는가?
  16. ESD가 이상값 탐색과 관련된다는 것을 알고 있는가?
  17. 포아송 분포가 사건 횟수를 다룬다는 것을 알고 있는가?
  18. Lift Curve가 랜덤 모델과 비교한다는 것을 알고 있는가?
  19. Hold-out의 훈련·검증 분리를 설명할 수 있는가?
  20. 내용 기반 필터링이 무엇을 기준으로 추천하는지 알고 있는가?

이 글을 마치며#

시계열분석에서 가장 먼저 기억해야 하는 것은 추·계·순·불입니다.

추세 Trend

→ 장기적인 증가·감소

계절성 Seasonality

→ 일정한 주기의 반복

순환 Cycle

→ 주기가 일정하지 않은 장기 변동

불규칙 Irregular

→ 예측하기 어려운 우연 변동

정상 시계열에서는 평균과 분산이 시간에 따라 안정적이며 비정상 시계열을 정상화하는 대표적인 방법으로 차분을 사용합니다.

ARIMA는:

ARIMA(p,d,q)

형태이며:

p = AR 차수

d = 차분 횟수

q = MA 차수

입니다.

모형 식별에서는:

AR(p) → PACF에서 p 결정

MA(q) → ACF에서 q 결정

이라는 관계가 매우 중요합니다.

그 밖의 기타 개념은 다음처럼 압축할 수 있습니다.

유전 알고리즘 = 선택·교차·변이

MDS = 거리 관계를 공간에 배치

SOM = 비지도 신경망

Poisson = 일정 시간·영역의 사건 횟수

Hold-out = 훈련·검증 분리

내용 기반 필터링 = 내가 좋아한 것과 비슷한 아이템 추천

시험 직전에는 다음 다섯 줄을 우선 기억하면 됩니다.

시계열 = 추·계·순·불

정상성 = 평균·분산 일정 / 비정상은 차분

AR = 과거 값 / MA = 과거 오차

AR은 PACF / MA는 ACF

ARIMA(p,d,q) = AR 차수 / 차분 횟수 / MA 차수

이 페이지의 목차