빅데이터란? 3V·5V와 Volume·Variety·Velocity·Veracity·Value 쉽게 이해하기

빅데이터란? 3V·5V와 Volume·Variety·Velocity·Veracity·Value 쉽게 이해하기#

우리가 스마트폰으로 사진을 찍고, 동영상을 보고, 검색하고, 결제하고, SNS에 글을 올리는 순간에도 데이터는 계속 만들어집니다.

기업에서도 마찬가지입니다.

온라인 주문

결제 기록

웹사이트 접속 Log

고객 Review

CCTV Video

IoT Sensor

GPS 위치정보

SNS 게시글

이런 데이터는 하루에도 엄청난 양으로 쌓입니다.

그런데 데이터가 많아지는 것만이 문제는 아닙니다.

데이터 형태도 다양하고, 생성되는 속도도 매우 빠릅니다.

예를 들어 과거에는 Database Table에 저장된 숫자와 문자 데이터가 분석의 중심이었다면 오늘날에는:

JSON

Image

Audio

Video

자연어 Text

Sensor Stream

까지 함께 다뤄야 합니다.

이처럼 기존 방식만으로 처리하기 어려울 정도로 규모가 크고, 형태가 다양하며, 빠르게 생성되는 데이터를 저장·처리·분석하고 여기에서 가치를 만들어내는 개념을 빅데이터라고 이해할 수 있습니다.


1장 빅데이터란 무엇인가#

빅데이터 Big Data를 가장 단순하게 설명하면:

기존의 일반적인 데이터 처리 방식만으로는
효율적으로 저장·처리·분석하기 어려운
대규모·다양한 데이터

라고 할 수 있습니다.

초보자는 흔히:

Big Data
=
용량이 큰 Data

라고 생각하기 쉽습니다.

하지만 빅데이터에서 중요한 것은 단순한 용량만이 아닙니다.

다음 세 가지가 함께 중요합니다.

Volume
→ 얼마나 많은가

Variety
→ 얼마나 다양한가

Velocity
→ 얼마나 빠른가

이를 빅데이터 3V라고 합니다.


2장 빅데이터를 왜 3V로 설명하는가#

전통적인 데이터는 상대적으로 구조가 명확하고 처리량도 제한적이었습니다.

예를 들어 회사의 매출 Database라면:

날짜

상품ID

판매수량

가격

같은 일정한 구조를 가질 수 있습니다.

하지만 오늘날에는 한 서비스에서 동시에 다음 데이터가 발생할 수 있습니다.

Database Transaction

웹사이트 Click Log

모바일 App Event

Image

Video

고객 Review

위치정보

Sensor Data

이 데이터는:

양도 많고

형태도 다르고

생성속도도 빠릅니다.

그래서 빅데이터의 특징을 설명할 때 Volume·Variety·Velocity 세 단어를 사용합니다.


3장 Volume이란 무엇인가#

Volume은 데이터의 규모와 양을 의미합니다.

쉽게 말하면:

데이터가 얼마나 많이 쌓이는가?

를 나타냅니다.

예를 들어 전자상거래 서비스에서는:

회원 10명

주문 100건

정도라면 일반적인 환경에서도 쉽게 관리할 수 있습니다.

하지만 서비스가 커지면:

회원 수천만 명

주문 수십억 건

접속 Log 수백억 건

상품 Image 수억 장

처럼 데이터가 폭발적으로 증가할 수 있습니다.

이때 데이터의 크기는:

TB
PB
EB
ZB

단위까지 확장될 수 있습니다.

Volume 핵심#

Volume
=
데이터의 양과 규모

입니다.

초보자 암기법#

Volume
→ 볼륨
→ 데이터가 얼마나 많은가

로 연결하면 쉽습니다.


4장 Variety란 무엇인가#

Variety는 데이터의 형태와 종류의 다양성을 의미합니다.

빅데이터는 Database Table 하나만 다루지 않습니다.

대표적으로:

정형 데이터

반정형 데이터

비정형 데이터

가 모두 포함될 수 있습니다.

정형 데이터#

Database Table

CSV

반정형 데이터#

JSON

XML

HTML

비정형 데이터#

Image

Audio

Video

자연어 Text

예를 들어 쇼핑몰 하나만 운영해도:

주문 DB
→ 정형

API JSON
→ 반정형

상품 Image
→ 비정형

고객 Review
→ 비정형

처럼 여러 형태의 데이터를 동시에 처리할 수 있습니다.

Variety 핵심#

Variety
=
데이터 유형의 다양성

입니다.

시험에서 자주 나오는 함정#

Variety
=
다양한 시각으로 데이터를 분석한다.

는 설명이 아닙니다.

Variety는 분석 관점의 다양성이 아니라:

데이터 형태의 다양성

을 의미합니다.


5장 Velocity란 무엇인가#

Velocity는 데이터가 생성되고 전달되고 처리되는 속도를 의미합니다.

예를 들어 주식거래 시스템이나 Sensor 시스템에서는 데이터가 계속 발생합니다.

09:00:00.001
거래 발생

09:00:00.002
거래 발생

09:00:00.003
거래 발생

수많은 데이터가 매우 짧은 시간 안에 생성될 수 있습니다.

또 실시간 서비스에서는 데이터를 저장한 뒤 며칠 후 분석하는 것만으로는 충분하지 않을 수 있습니다.

예:

신용카드 이상거래 탐지

실시간 추천

공장 Sensor 이상 감지

실시간 Traffic 분석

이런 시스템은 데이터를 빠르게 처리해야 합니다.

Velocity 핵심#

Velocity
=
데이터 생성·처리 속도

입니다.

시험 함정#

Velocity
=
데이터의 정확도

가 아닙니다.

속도를 의미합니다.


6장 빅데이터 3V 한눈에 보기#

특징 의미 대표 사례
Volume 데이터 양 TB·PB·EB·ZB
Variety 데이터 유형의 다양성 DB·JSON·Image·Video
Velocity 생성·처리 속도 Streaming·실시간 Sensor

가장 간단하게 외우면:

Volume
→ 양

Variety
→ 다양성

Velocity
→ 속도

입니다.

시험에서는 다음 세 단어를 정확하게 연결하는 것이 중요합니다.

Volume
Variety
Velocity

7장 Volume·Variety·Velocity를 하나의 사례로 이해하기#

스마트시티의 교통 시스템을 예로 들어보겠습니다.

도시에는 수많은 교통 Sensor와 Camera가 설치되어 있습니다.

Volume#

수천 개 Camera

수백만 대 차량

매일 생성되는 대규모 기록

데이터의 양이 매우 많습니다.

Variety#

차량번호
→ Text

속도
→ Numeric Data

CCTV
→ Video

GPS
→ 위치 Data

Sensor
→ 측정 Data

형태가 다양합니다.

Velocity#

차량 이동

신호 변화

교통량

사고 Event

가 실시간에 가깝게 계속 발생합니다.

즉:

많다
+
다양하다
+
빠르다

가 동시에 나타나는 대표적인 빅데이터 환경입니다.


8장 빅데이터 5V란 무엇인가#

빅데이터 3V에서 두 가지 요소를 추가해 5V로 설명하기도 합니다.

추가되는 요소는:

Veracity
→ 진실성

Value
→ 가치

입니다.

따라서 빅데이터 5V는:

Volume

Variety

Velocity

Veracity

Value

입니다.

암기하면:

기존 3V
+
Veracity
+
Value
=
5V

입니다.


9장 Veracity란 무엇인가#

Veracity는 데이터의 진실성·정확성·신뢰성과 관련된 개념입니다.

데이터가 아무리 많아도 잘못된 데이터라면 좋은 분석결과를 얻을 수 없습니다.

예를 들어 Sensor가 고장 나서 실제 온도가 25℃인데:

Sensor A
25℃

Sensor B
25℃

고장 난 Sensor
250℃

라고 기록했다고 생각해봅시다.

이 값을 그대로 분석하면 평균이나 이상징후 분석이 왜곡될 수 있습니다.

따라서:

Noise 제거

오류 Data 정리

출처 확인

품질 검증

과정이 중요합니다.

Veracity 핵심#

Veracity
=
이 데이터를 믿을 수 있는가?

입니다.


10장 Value란 무엇인가#

Value는 데이터를 통해 의미 있는 가치와 결과를 만들어내는 것을 의미합니다.

데이터가 아무리 많아도 실제로 활용되지 않는다면 저장비용만 증가할 수 있습니다.

예를 들어 쇼핑몰에서 수십억 건의 고객 행동 데이터를 가지고 있다고 하겠습니다.

이를 분석해서:

고객이 원하는 상품 추천

재구매 고객 예측

이탈 가능 고객 탐지

재고 최적화

매출 개선

에 활용한다면 데이터가 실제 Value를 만들어낸 것입니다.

Value 핵심#

Value
=
데이터를 이용해
실제 의미와 가치를 만들어내는 것

입니다.

왜 Value가 중요한가#

빅데이터의 목적은 데이터를 무한정 모으는 것이 아닙니다.

궁극적으로는:

Data
↓
Analysis
↓
Insight
↓
Decision
↓
Value

로 연결되어야 합니다.

따라서 ADsP 학습에서는 Value를 빅데이터 활용의 궁극적인 목적으로 기억하는 것이 좋습니다.


11장 빅데이터 5V 한눈에 보기#

V 의미 핵심 질문
Volume 규모 얼마나 많은가
Variety 다양성 어떤 형태가 있는가
Velocity 속도 얼마나 빠르게 생성·처리되는가
Veracity 진실성 믿을 수 있는가
Value 가치 어떤 가치를 만들 수 있는가

쉽게 연결하면:

많고

다양하고

빠른 데이터를

믿을 수 있게 관리해서

가치를 만든다.

입니다.


12장 빅데이터 3V와 5V 차이#

시험에서는 다음 관계를 정확하게 알아야 합니다.

3V#

Volume

Variety

Velocity

5V#

Volume

Variety

Velocity

Veracity

Value

즉:

3V + Veracity + Value = 5V

입니다.

시험 함정#

다음 문장을 주의합니다.

빅데이터 5V에서 추가되는 것은
Velocity와 Value이다.

틀린 설명입니다.

Velocity는 이미 3V에 포함되어 있습니다.

추가되는 것은:

Veracity
+
Value

입니다.


13장 데이터 크기 단위는 어떻게 증가하는가#

빅데이터를 이해할 때 데이터 크기 단위도 자주 등장합니다.

순서는 다음과 같습니다.

KB
<
MB
<
GB
<
TB
<
PB
<
EB
<
ZB
<
YB

각 단위의 영어 이름은 다음과 같습니다.

단위 영어
KB Kilobyte
MB Megabyte
GB Gigabyte
TB Terabyte
PB Petabyte
EB Exabyte
ZB Zettabyte
YB Yottabyte

ADsP 학습자료에서는 각 단계가 1024배씩 증가하는 관계로 정리되어 있습니다.


14장 KB·MB·GB·TB는 얼마나 차이가 나는가#

시험용으로 다음 관계를 기억합니다.

1 KB
=
1024 Byte

1 MB
=
1024 KB

1 GB
=
1024 MB

1 TB
=
1024 GB

1 PB
=
1024 TB

1 EB
=
1024 PB

1 ZB
=
1024 EB

1 YB
=
1024 ZB

가장 중요한 것은 모든 숫자를 따로 외우기보다 순서를 기억하는 것입니다.

K
→ M
→ G
→ T
→ P
→ E
→ Z
→ Y

암기:

킬로
메가
기가
테라
페타
엑사
제타
요타

입니다.


15장 ZB와 EB를 자주 헷갈리는 이유#

시험에서는 단위를 한 단계 건너뛰어 제시해 혼동을 유도할 수 있습니다.

예를 들어:

1 ZB = 1024 PB

라고 하면 틀립니다.

순서를 다시 보면:

PB
↓
EB
↓
ZB

이므로:

1 ZB
=
1024 EB

입니다.

마찬가지로:

1 YB
=
1024 ZB

입니다.

시험 직전 암기#

PB → EB → ZB → YB

순서를 확실하게 기억합니다.


16장 데이터 크기 단위를 실제로 이해하면#

단순히 단위를 외우는 것보다 규모를 상상해보면 이해하기 쉽습니다.

일상에서는 보통:

문서
→ KB·MB

사진
→ MB

Video
→ MB·GB

Computer Storage
→ GB·TB

단위를 자주 접합니다.

기업이나 대규모 서비스에서는:

대규모 Log

수년간의 거래정보

Video 저장

IoT Data

가 쌓이면서:

TB
PB

이상의 규모가 될 수 있습니다.

인터넷 전체 수준의 데이터 규모를 설명할 때는 EB·ZB 같은 훨씬 큰 단위도 등장합니다.


17장 빅데이터 시대에는 무엇이 달라졌는가#

제공된 ADsP 학습자료에서는 전통적인 데이터 분석 환경과 빅데이터 시대의 차이를 네 가지 방향으로 정리합니다.

사전처리
→ 사후처리

표본조사
→ 전수조사

질
→ 양

인과관계
→ 상관관계

이 표현은 시험에서 방향을 바꾸어 출제될 수 있으므로 순서를 기억하는 것이 중요합니다.


18장 사전처리에서 사후처리로의 변화#

기존에는 데이터를 저장하기 전에:

필요한 데이터인가?

어떤 구조로 저장할 것인가?

어떤 용도로 사용할 것인가?

를 먼저 정리하는 접근이 중요했습니다.

빅데이터 환경에서는 저장 기술과 데이터 처리능력이 발전하면서 데이터를 폭넓게 수집한 뒤 나중에 필요한 목적에 따라 분석하는 방식도 가능해졌습니다.

이를 학습자료에서는:

사전처리
→ 사후처리

라는 변화로 설명합니다.


19장 표본조사에서 전수조사로의 변화#

과거에는 전체 데이터를 처리하기 어렵기 때문에 모집단 일부를 뽑아 분석하는 표본조사가 많이 사용되었습니다.

전체 100만 명
↓
1,000명 표본 추출
↓
전체 추정

하지만 대규모 데이터 처리기술이 발전하면서 가능한 경우 훨씬 많은 데이터를 직접 분석할 수 있게 되었습니다.

이를:

표본조사
→ 전수조사

방향으로 설명합니다.

다만 실제 데이터 분석에서 언제나 모든 데이터를 전수조사할 수 있다는 뜻으로 단순화하기보다는 빅데이터 환경에서 훨씬 큰 범위의 데이터를 활용할 수 있게 되었다는 변화로 이해하면 좋습니다.


20장 질에서 양으로의 변화#

전통적인 분석에서는 소수라도 잘 정제된 데이터를 중요하게 생각하는 경향이 강했습니다.

빅데이터 시대에는 대규모 데이터를 활용해 기존에는 보기 어려웠던 Pattern을 발견하는 접근이 강조됩니다.

학습자료에서는 이를:

질
→ 양

의 변화로 표현합니다.

하지만 이것이:

데이터 품질은 중요하지 않다.

는 의미는 아닙니다.

5V의 Veracity가 존재하는 이유도 데이터 신뢰성과 품질이 여전히 중요하기 때문입니다.


21장 인과관계에서 상관관계로의 변화#

빅데이터에서는 대규모 데이터에서 무엇이 함께 움직이는가를 빠르게 발견할 수 있습니다.

예를 들어:

상품 A를 구매한 고객
→ 상품 B도 자주 구매

라는 Pattern을 발견할 수 있습니다.

이 단계에서는 반드시:

왜 그런가?

를 완전히 설명하지 않더라도 추천이나 분석의 중요한 단서가 될 수 있습니다.

학습자료에서는 이를:

인과관계
→ 상관관계

에 대한 관심 증가로 설명합니다.

다만 실제 분석에서는:

상관관계
≠
인과관계

라는 원칙을 반드시 기억해야 합니다.


22장 빅데이터에서는 어떤 분석 기술을 사용하는가#

제공된 ADsP 학습자료에서는 빅데이터 활용기술을 일곱 가지로 정리합니다.

연관 규칙 학습

유형 분석

유전자 알고리즘

기계 학습

회귀 분석

감정 분석

소셜 네트워크 분석

각각 어떤 문제를 해결하는지 이해하는 것이 중요합니다.


23장 연관 규칙 학습이란 무엇인가#

연관 규칙 학습은 여러 항목 사이에서 함께 발생하는 Pattern을 찾는 방법입니다.

대표적인 사례가 장바구니 분석입니다.

커피 구매
↓
탄산음료도 자주 구매

같은 Pattern을 발견할 수 있습니다.

또:

상품 A를 구매한 고객이
상품 B도 자주 구매한다.

라는 관계를 찾을 수도 있습니다.

핵심#

연관 규칙
→ 무엇과 무엇이 함께 나타나는가?

입니다.


24장 유형 분석이란 무엇인가#

유형 분석은 데이터의 특징을 이용해 대상을 여러 유형으로 분류합니다.

예를 들어 고객을:

고가 상품 선호 고객

할인 중심 고객

신규 고객

충성 고객

처럼 특성에 따라 나눌 수 있습니다.

문서를 성격에 따라 분류하거나 조직을 여러 그룹으로 나누는 것도 유형 분석의 사례로 볼 수 있습니다.

핵심#

유형 분석
→ 비슷한 특징에 따라 분류

입니다.


25장 유전자 알고리즘이란 무엇인가#

유전자 알고리즘 Genetic Algorithm은 자연의 진화 과정을 모방한 최적화 방법입니다.

생물이 세대를 거치며 환경에 적응하는 아이디어를 이용해 더 좋은 해결책을 찾습니다.

개념적으로는:

여러 후보 Solution
↓
평가
↓
좋은 후보 선택
↓
교차
↓
변이
↓
새로운 후보 생성
↓
반복

과정을 사용합니다.

제공된 학습자료에서는 존 홀랜드 John Holland와 함께 연결해 기억하도록 설명하고 있습니다.

핵심#

유전자 알고리즘
→ 진화를 모방해
최적의 해를 찾는 방법

입니다.


26장 기계학습이란 무엇인가#

기계학습 Machine Learning은 컴퓨터가 데이터에서 Pattern을 학습하고 이를 이용해 예측이나 분류를 수행하도록 하는 방법입니다.

예:

과거 영화 시청 기록
↓
사용자 취향 학습
↓
새로운 영화 추천

또는:

과거 Spam Mail
↓
Pattern 학습
↓
새 Email Spam 여부 분류

처럼 활용할 수 있습니다.

핵심#

Machine Learning
→ Training Data에서 Pattern을 학습
→ 새로운 데이터를 예측

입니다.


27장 회귀분석이란 무엇인가#

회귀분석은 변수 사이의 관계를 분석하고 한 변수의 변화에 따라 다른 변수가 어떻게 변하는지를 설명하거나 예측하는 데 사용합니다.

예를 들어:

나이
↔
자동차 구매 유형

같은 관계를 분석할 수 있습니다.

또 실무에서는:

광고비
→ 매출

집 크기
→ 집값

온도
→ 전력 사용량

같은 관계를 분석하는 데도 활용할 수 있습니다.

핵심#

회귀분석
→ 변수 사이의 관계를 분석

입니다.


28장 감정 분석이란 무엇인가#

감정 분석 Sentiment Analysis은 Text에서 사람의 감정이나 의견을 분석합니다.

예를 들어 호텔 Review가 다음과 같다고 생각해봅시다.

방은 정말 깨끗했고
직원들도 친절했습니다.

이를:

긍정

으로 판단할 수 있습니다.

반대로:

방이 너무 시끄럽고
응대도 불친절했습니다.

는:

부정

으로 분석할 수 있습니다.

활용 사례#

상품 Review

SNS 게시글

고객 상담 내용

호텔 평가

등이 있습니다.


29장 소셜 네트워크 분석이란 무엇인가#

소셜 네트워크 분석 Social Network Analysis은 사람·조직·계정 등 객체 사이의 관계망을 분석하는 방법입니다.

예를 들어 SNS에서:

누가 누구를 Follow하는가?

누가 가장 많은 사람과 연결되어 있는가?

어떤 사용자가 정보 전파의 중심인가?

를 분석할 수 있습니다.

구조를 단순하게 표현하면:

사람 A ─ 사람 B
  │       │
사람 C ─ 사람 D

같은 Network에서 중요한 Node와 관계를 찾습니다.

핵심#

소셜 네트워크 분석
→ 관계망을 분석
→ 영향력 있는 대상 발견

입니다.


30장 빅데이터 활용 기술 한눈에 보기#

기술 핵심 예
연관 규칙 학습 함께 발생하는 관계 발견 상품 A·B 동시 구매
유형 분석 특징에 따라 분류 고객 그룹화
유전자 알고리즘 진화 방식의 최적화 최적 조건 탐색
기계학습 데이터 학습 후 예측 추천 시스템
회귀분석 변수 사이 관계 분석 매출 예측
감정분석 Text의 감정 분석 Review 긍정·부정
소셜 네트워크 분석 관계망 분석 영향력 있는 사용자 탐색

31장 빅데이터를 쇼핑몰 사례로 한 번에 이해하기#

대형 쇼핑몰을 생각해봅시다.

매일 다음 데이터가 만들어집니다.

주문
결제
검색
Click
Review
Image
문의
접속 Log

Volume#

하루 수천만 건의 Event

데이터의 양이 많습니다.

Variety#

DB
JSON
Text
Image

형태가 다양합니다.

Velocity#

사용자가 Click하고
주문하고
결제하는 순간
계속 Data 생성

생성속도가 빠릅니다.

Veracity#

중복 Log

Bot Traffic

잘못된 고객정보

등을 걸러 데이터 품질을 확보해야 합니다.

Value#

분석 결과를 활용해:

상품 추천

재고 최적화

이탈 고객 예측

Fraud 탐지

매출 개선

으로 연결합니다.

즉:

Volume
+
Variety
+
Velocity
+
Veracity
↓
Analysis
↓
Value

가 빅데이터 활용의 핵심 흐름입니다.


32장 IoT에서 빅데이터는 어떻게 만들어지는가#

공장에 10,000개의 Sensor가 있다고 생각해봅시다.

각 Sensor가 1초마다 데이터를 보냅니다.

온도

압력

진동

전류

습도

한 번의 값은 작지만 계속 쌓이면 엄청난 양이 됩니다.

Volume#

Sensor 수가 많아 전체 데이터 양이 커집니다.

Velocity#

1초 또는 밀리초 단위로 계속 데이터가 생성됩니다.

Variety#

숫자 Sensor뿐 아니라:

Camera Video

장비 Log

Alarm Event

까지 함께 사용할 수 있습니다.

Value#

데이터를 분석해:

장비 고장 예측

이상징후 감지

생산량 최적화

에너지 절감

같은 가치를 만들 수 있습니다.


33장 AI 시대에는 빅데이터가 왜 중요한가#

AI와 머신러닝 Model은 데이터를 이용해 Pattern을 학습합니다.

예를 들어 이미지 인식 AI를 만들려면 많은 이미지와 Label이 필요할 수 있습니다.

Image Data
↓
Training
↓
Pattern 학습
↓
새로운 Image 분류

LLM과 같은 생성형 AI 역시 대규모 데이터와 컴퓨팅을 기반으로 학습됩니다.

따라서 현대 AI에서는:

Data

Computing

Algorithm

이 서로 연결됩니다.

다만 데이터의 양만 많다고 좋은 AI가 만들어지는 것은 아닙니다.

Volume
+
Veracity
+
Value

까지 함께 고려해야 합니다.


34장 빅데이터와 일반 데이터의 경계는 명확한가#

실무에서는:

몇 GB 이상이면 Big Data다.

처럼 하나의 숫자로 빅데이터를 정의하기 어렵습니다.

같은 1TB 데이터도 어떤 시스템에서는 쉽게 처리할 수 있고 어떤 환경에서는 처리하기 어려울 수 있습니다.

따라서 빅데이터는 단순한 파일 크기보다:

규모

다양성

속도

기존 처리환경의 한계

분석 목적

을 함께 고려해 이해하는 것이 좋습니다.

ADsP 시험에서는 이러한 복잡한 논의보다 3V와 5V의 의미를 정확하게 구분하는 것이 우선입니다.


35장 빅데이터 시험에서 자주 헷갈리는 함정#

함정 1. Variety는 다양한 시각으로 분석한다#

X

정확한 의미는:

Variety
→ 다양한 형태의 데이터

입니다.

함정 2. Velocity는 정확성이다#

X

Velocity는:

데이터 생성·처리 속도

입니다.

정확성과 신뢰성은 Veracity와 관련됩니다.

함정 3. 3V에 Value가 포함된다#

X

기본 3V는:

Volume
Variety
Velocity

입니다.

함정 4. 5V 추가 요소를 Velocity와 Value로 기억#

X

추가되는 요소는:

Veracity
Value

입니다.

함정 5. 빅데이터의 궁극적 목적은 Veracity다#

학습자료의 기준에서 궁극적인 목적은:

Value

즉 가치 창출입니다.

함정 6. 1 ZB는 1024 PB다#

X

정확한 관계는:

1 ZB
=
1024 EB

입니다.


36장 ADsP 시험 핵심 비교표#

빅데이터 3V#

Volume
→ 양

Variety
→ 형태의 다양성

Velocity
→ 속도

빅데이터 5V#

Volume

Variety

Velocity

Veracity
→ 진실성

Value
→ 가치

데이터 단위#

KB
↓
MB
↓
GB
↓
TB
↓
PB
↓
EB
↓
ZB
↓
YB

빅데이터 시대 변화#

사전처리 → 사후처리

표본조사 → 전수조사

질 → 양

인과관계 → 상관관계

37장 시험 직전 30초 암기#

Big Data 3V

Volume
→ 양

Variety
→ 다양성

Velocity
→ 속도
Big Data 5V

3V
+
Veracity
→ 진실성

Value
→ 가치
데이터 단위

K
M
G
T
P
E
Z
Y
1 ZB
=
1024 EB
1 YB
=
1024 ZB
빅데이터 시대

사전 → 사후

표본 → 전수

질 → 양

인과 → 상관
활용 기술

연관규칙
유형분석
유전자 알고리즘
기계학습
회귀분석
감정분석
소셜 네트워크 분석

빅데이터 FAQ#

빅데이터란 무엇인가#

기존의 일반적인 처리 방식으로 효율적인 저장·처리·분석이 어려울 정도로 규모가 크고 형태가 다양하며 빠르게 생성되는 데이터를 다루는 개념입니다.

빅데이터 3V는 무엇인가#

Volume
Variety
Velocity

입니다.

한국어로는 데이터의 양·다양성·속도를 의미합니다.

Volume은 무엇인가#

데이터의 규모와 양입니다.

TB·PB·EB·ZB처럼 대규모 데이터 환경과 연결됩니다.

Variety는 무엇인가#

정형·반정형·비정형 등 데이터 유형과 형태의 다양성을 의미합니다.

JSON, XML, Image, Audio, Video 등이 대표적인 사례입니다.

Velocity는 무엇인가#

데이터가 생성되고 전달되고 처리되는 속도를 의미합니다.

실시간 Streaming이나 Sensor Data 같은 환경에서 중요합니다.

빅데이터 5V는 무엇인가#

기존 3V에:

Veracity
Value

를 추가한 것입니다.

Veracity란 무엇인가#

데이터가 얼마나 정확하고 신뢰할 수 있는지를 나타내는 개념입니다.

Value란 무엇인가#

데이터 분석을 통해 실제 의미 있는 결과나 비즈니스 가치를 만들어내는 것을 의미합니다.

빅데이터의 궁극적인 목적은 무엇인가#

제공된 ADsP 학습자료에서는 Value, 즉 가치 창출을 궁극적인 목적으로 강조합니다.

1 ZB는 몇 EB인가#

ADsP 학습자료 기준:

1 ZB
=
1024 EB

입니다.

데이터 크기 단위 순서는 어떻게 되는가#

KB
→ MB
→ GB
→ TB
→ PB
→ EB
→ ZB
→ YB

순서입니다.

Variety는 다양한 분석방법을 의미하는가#

아닙니다.

Variety는 데이터 형태가 다양하다는 의미입니다.

상관관계가 빅데이터에서 강조되는 이유는 무엇인가#

대규모 데이터를 이용하면 많은 변수 사이에서 함께 움직이는 Pattern을 발견할 수 있기 때문입니다.

다만 상관관계가 인과관계를 자동으로 증명하는 것은 아닙니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 빅데이터를 단순히 큰 데이터라고만 정의하면 부족한 이유를 설명할 수 있는가?
  2. 빅데이터 3V를 모두 말할 수 있는가?
  3. Volume의 의미를 설명할 수 있는가?
  4. Variety가 다양한 분석 관점이 아니라 데이터 유형의 다양성이라는 것을 알고 있는가?
  5. Velocity가 무엇을 의미하는지 설명할 수 있는가?
  6. 빅데이터 5V에서 추가되는 두 요소를 말할 수 있는가?
  7. Veracity와 Value의 차이를 설명할 수 있는가?
  8. Value가 왜 빅데이터 활용의 중요한 목적이 되는지 설명할 수 있는가?
  9. KB부터 YB까지 데이터 단위 순서를 말할 수 있는가?
  10. 1 ZB가 몇 EB인지 알고 있는가?
  11. 빅데이터 시대의 네 가지 변화를 말할 수 있는가?
  12. 연관 규칙과 유형 분석의 차이를 설명할 수 있는가?
  13. 유전자 알고리즘이 무엇을 모방하는지 알고 있는가?
  14. 감정분석과 소셜 네트워크 분석의 목적을 구분할 수 있는가?

이 글을 마치며#

빅데이터를 이해할 때 가장 중요한 것은 단순히 데이터가 많다는 한 가지 특징만 보는 것이 아닙니다.

먼저 기본적인 3V를 기억합니다.

Volume
→ 많다

Variety
→ 다양하다

Velocity
→ 빠르다

그리고 데이터가 많고 다양하고 빠르다고 해서 그것만으로 좋은 결과가 만들어지는 것은 아닙니다.

데이터가 믿을 만해야 하고:

Veracity

그 데이터를 실제 의미 있는 결과로 연결해야 합니다.

Value

따라서 빅데이터 5V를 하나의 문장으로 표현하면 다음과 같습니다.

많고
다양하고
빠른 데이터를
신뢰할 수 있게 관리하고
가치를 만들어낸다.

이것이:

Volume
→ Variety
→ Velocity
→ Veracity
→ Value

의 의미입니다.

ADsP 시험에서는 우선 다음 세 묶음을 확실하게 기억하면 됩니다.

3V
→ Volume · Variety · Velocity
5V
→ 3V + Veracity + Value
데이터 단위
→ K · M · G · T · P · E · Z · Y

그리고 개념 자체를 이해할 때는 마지막 질문 하나를 기억하면 됩니다.

이 많은 데이터를 모아서
결국 무엇을 만들어낼 것인가?

그 질문에 대한 답이 바로 빅데이터의 마지막 V인 Value, 가치입니다.

이 페이지의 목차