ADsP 1과목 데이터 이해 핵심요약: DIKW·SECI·빅데이터·데이터웨어하우스·Hadoop·NoSQL 총정리

ADsP 1과목인 데이터 이해는 복잡한 계산보다는 용어의 의미와 서로 비슷한 개념의 차이를 정확하게 구분하는 것이 중요합니다.

시험 직전이라면 모든 내용을 처음부터 다시 외우기보다 다음 관계를 우선 기억하는 것이 좋습니다.

아직 학습 전 이해가 되지 않는 내용이나 추가로 설명이 필요한 경우 하단 하위 페이지를 참고 하시면 좋습니다.

Data → Information → Knowledge → Wisdom

암묵지 ↔ 형식지
공통화 → 표출화 → 연결화 → 내면화

인과관계 ↔ 상관관계

정형 ↔ 반정형 ↔ 비정형

OLTP ↔ OLAP

Volume · Variety · Velocity

HDFS → 저장
MapReduce → 처리
YARN → 자원 관리

Histogram → 분포
Bar Chart → 범주 비교
Scatter Plot → 변수 관계
Line Chart → 시간 변화

이 글은 각각의 용어를 따로 나열하기보다 무엇인지, 무엇과 다른지, 시험에서는 어디서 헷갈리는지를 함께 설명합니다.


1장 ADsP DIKW 피라미드란 무엇인가#

DIKW 피라미드는 데이터가 단순한 사실에서 출발해 의미 있는 정보와 지식으로 발전하고, 최종적으로 판단과 통찰에 활용되는 과정을 설명하는 모델입니다.

순서는 반드시 다음과 같이 기억합니다.

Data
↓
Information
↓
Knowledge
↓
Wisdom

Data는 무엇인가#

Data는 아직 해석이나 의미가 부여되지 않은 가공 전의 사실과 수치입니다.

예를 들어 다음 두 값이 있다고 가정해봅시다.

A마트 상품 가격: 100원
B마트 상품 가격: 300원

이 단계에서는 단순히 두 개의 숫자가 존재할 뿐입니다.

아직 어느 마트가 더 저렴한지 판단하지 않았으므로 Data입니다.

Information은 무엇인가#

Information은 Data를 비교하거나 분석해 의미를 부여한 결과입니다.

A마트가 B마트보다 200원 저렴하다.

100원과 300원이라는 원시 Data를 비교하면서 새로운 의미가 만들어졌습니다.

따라서 Information입니다.

Knowledge는 무엇인가#

Knowledge는 Information을 이용해 판단하거나 행동할 수 있는 상태입니다.

A마트가 더 저렴하므로 A마트에서 구매해야겠다.

단순히 가격 차이를 아는 수준을 넘어 의사결정에 활용하고 있습니다.

Wisdom은 무엇인가#

Wisdom은 Knowledge를 더 넓은 상황으로 확장하거나 일반화해 새로운 판단과 통찰을 만드는 단계입니다.

A마트가 지속적으로 저렴한 경향을 보인다면
다른 상품을 구매할 때도 A마트 가격을 우선 확인해보자.

하나의 정보를 넘어 경험과 지식을 일반화하고 있다는 점이 핵심입니다.

DIKW 핵심 비교#

단계 의미 핵심 질문 예
Data 원시 사실 무엇이 있는가 A마트 100원
Information 의미가 부여된 데이터 무엇을 알 수 있는가 A마트가 더 싸다
Knowledge 판단에 활용 가능한 정보 어떻게 행동할 것인가 A마트에서 사자
Wisdom 일반화된 통찰 앞으로 어떻게 활용할 것인가 다른 상품에도 적용

DIKW 시험 포인트#

가장 중요한 것은 순서입니다.

Data
→ Information
→ Knowledge
→ Wisdom

그리고 위로 올라갈수록 단순한 데이터에서 벗어나 의미와 활용 가치가 높아진다는 점을 기억합니다.


2장 암묵지와 형식지는 무엇이 다른가#

ADsP에서는 지식을 암묵지와 형식지로 구분합니다.

암묵지란 무엇인가#

암묵지는 개인의 경험이나 숙련 과정에서 형성되어 쉽게 문서로 표현하기 어려운 지식입니다.

대표적인 예가 있습니다.

자전거 타는 감각
숙련 기술자의 작업 감각
고객 응대 노하우
오랫동안 요리하면서 익힌 맛 조절 방법

말로 완벽하게 설명하기는 어렵지만 사람은 경험을 통해 알고 있습니다.

따라서 암묵지는 쉽게 말해 머릿속과 몸에 축적된 경험적 지식입니다.

형식지란 무엇인가#

형식지는 문서나 언어처럼 다른 사람에게 전달할 수 있는 형태로 표현된 지식입니다.

예를 들면 다음과 같습니다.

교과서
업무 매뉴얼
작업 절차서
교육 자료
데이터베이스

암묵지와 비교하면 차이가 명확합니다.

암묵지
→ 경험으로 알고 있는 지식

형식지
→ 기록하고 전달할 수 있는 지식

3장 SECI 모델이란 무엇인가#

SECI 모델은 암묵지와 형식지가 서로 변환되면서 새로운 지식이 만들어지는 과정을 설명합니다.

시험에서는 네 단계의 순서와 변환 방향을 함께 기억해야 합니다.

공통화
암묵지 → 암묵지

↓

표출화
암묵지 → 형식지

↓

연결화
형식지 → 형식지

↓

내면화
형식지 → 암묵지

공통화#

공통화는 한 사람의 암묵지가 다른 사람의 암묵지로 전달되는 과정입니다.

견학
멘토링
숙련자의 작업을 직접 관찰
선배와 함께 업무 수행

문서보다 경험과 관찰이 중요합니다.

표출화#

표출화는 머릿속의 암묵지를 문서와 언어로 표현하는 과정입니다.

숙련자의 노하우
↓
업무 매뉴얼 작성

즉:

암묵지 → 형식지

입니다.

연결화#

연결화는 기존의 여러 형식지를 결합해 새로운 형식지를 만드는 과정입니다.

영업 보고서
+
고객 분석 보고서
+
시장 조사 자료
↓
종합 경영 보고서

내면화#

내면화는 문서화된 형식지를 사람이 실제로 익혀 자신의 암묵지로 만드는 과정입니다.

매뉴얼 학습
↓
교육
↓
실습
↓
숙련

SECI 빠른 암기#

단계 변환
공통화 암묵 → 암묵
표출화 암묵 → 형식
연결화 형식 → 형식
내면화 형식 → 암묵
공 → 표 → 연 → 내

순서로 기억하면 됩니다.

시험에서 추상화 같은 용어가 섞여 나올 경우 SECI 네 단계와 혼동하지 않도록 주의합니다.


4장 인과관계와 상관관계의 차이는 무엇인가#

데이터 분석에서 가장 중요한 기본 개념 중 하나입니다.

인과관계란 무엇인가#

인과관계는 한 현상이 다른 현상의 원인이 되는 관계입니다.

원인
↓
결과

예:

전등 스위치를 켰다.
↓
전등이 켜졌다.

핵심은:

A 때문에 B가 발생했다.

라고 설명할 수 있다는 것입니다.

상관관계란 무엇인가#

상관관계는 두 현상이 함께 변화하지만 한쪽이 다른 쪽의 직접적인 원인이라고 단정할 수 없는 관계입니다.

대표적인 예가 아이스크림 판매량과 익사 사고입니다.

여름
├─ 기온 상승 → 아이스크림 판매 증가
└─ 물놀이 증가 → 익사 사고 증가

아이스크림 판매량과 익사 사고가 동시에 증가한다고 해서:

아이스크림이 익사 사고를 발생시킨다.

라고 결론 내릴 수는 없습니다.

인과관계와 상관관계 비교#

구분 인과관계 상관관계
의미 원인과 결과 함께 변화하는 관계
핵심 A 때문에 B 발생 A와 B가 함께 움직임
원인 확인 필요 반드시 확인되지 않음

시험에서 가장 중요한 문장은 다음입니다.

상관관계가 있다고 해서
인과관계가 성립하는 것은 아니다.

5장 정성적·정량적 데이터와 정형·반정형·비정형 데이터#

데이터 유형은 서로 다른 기준이 섞여 출제될 수 있으므로 구분해서 이해해야 합니다.

정성적 데이터란 무엇인가#

정성적 데이터는 숫자로 단순하게 표현하기 어려운 성질이나 특성을 나타내는 데이터입니다.

예:

고객 의견
SNS 게시물
인터뷰
기상 특보

정량적 데이터란 무엇인가#

정량적 데이터는 수치로 표현할 수 있는 데이터입니다.

나이
온도
습도
풍속
매출액
판매량

정형 데이터란 무엇인가#

정형 데이터는 구조와 Schema가 일정하게 정의된 데이터입니다.

대표적인 예:

Database Table
CSV

반정형 데이터란 무엇인가#

반정형 데이터는 일정한 구조나 Tag를 가지고 있지만 관계형 Database Table처럼 고정된 구조는 아닌 데이터입니다.

대표적인 예:

HTML
XML
JSON

비정형 데이터란 무엇인가#

비정형 데이터는 미리 정해진 고정 구조가 없는 데이터입니다.

Image
Video
Audio
자연어 Text

한 번에 비교하기#

유형 대표 예
정형 Database Table·CSV
반정형 HTML·XML·JSON
비정형 Image·Video·Audio·Text

시험에서는 HTML이나 JSON을 무조건 정형 데이터라고 판단하지 않도록 주의합니다.


6장 데이터베이스란 무엇인가#

데이터베이스는 여러 사용자가 필요한 데이터를 체계적으로 저장하고 관리하기 위한 데이터 집합입니다.

ADsP에서는 데이터베이스의 특징을 다음 네 가지로 구분합니다.

통합된 데이터#

불필요한 중복을 최소화하고 데이터를 통합하여 관리합니다.

저장된 데이터#

컴퓨터가 접근할 수 있는 저장매체에 저장됩니다.

공용 데이터#

여러 사용자가 서로 다른 목적으로 함께 사용할 수 있습니다.

운영 데이터#

조직이나 기업의 실제 업무 수행을 위해 사용되는 데이터입니다.

데이터베이스 설계 절차#

순서는 다음과 같습니다.

요구 분석
↓
개념 설계
↓
논리 설계
↓
물리 설계

DBMS란 무엇인가#

DBMS는 Database Management System의 약자로 데이터베이스를 생성하고 조회하며 수정·관리할 수 있도록 지원하는 소프트웨어입니다.


7장 데이터베이스 정규화란 무엇인가#

정규화는 데이터의 불필요한 중복을 줄이고 데이터 이상 현상을 방지하기 위해 Table 구조를 체계적으로 나누는 과정입니다.

쉽게 표현하면:

같은 정보를 여기저기 중복 저장해 데이터가 꼬이는 문제를 줄이는 과정

입니다.

삽입 이상#

데이터 하나를 추가하기 위해 관계없는 값까지 함께 입력해야 하는 문제입니다.

삭제 이상#

하나의 데이터를 삭제했는데 필요한 다른 데이터까지 같이 사라지는 문제입니다.

갱신 이상#

같은 데이터가 여러 곳에 저장되어 일부만 수정되면서 값이 서로 달라지는 문제입니다.

1NF#

제1정규형은 모든 속성 값이 원자값을 가지도록 합니다.

1NF
→ 원자값

2NF#

제2정규형은 1NF를 만족하면서 부분 함수 종속을 제거합니다.

2NF
→ 부분 종속 제거

3NF#

제3정규형은 2NF를 만족하면서 이행 함수 종속을 제거합니다.

A → B
B → C

이면

A → C

처럼 간접적으로 종속되는 관계를 제거합니다.

3NF
→ 이행 종속 제거

BCNF#

BCNF에서는 모든 결정자가 후보키가 되어야 합니다.

BCNF
→ 결정자가 후보키

정규화 핵심 암기#

1NF
원자값

2NF
부분 종속 제거

3NF
이행 종속 제거

BCNF
결정자 = 후보키

정규화를 많이 한다고 무조건 시스템 성능이 좋아지는 것은 아닙니다. 실제 시스템에서는 JOIN 증가 등으로 조회 비용이 커질 수 있어 필요에 따라 역정규화를 고려하기도 합니다.


8장 데이터웨어하우스와 데이터마트의 차이는 무엇인가#

데이터웨어하우스란 무엇인가#

데이터웨어하우스, DW는 기업의 의사결정을 지원하기 위해 여러 시스템의 데이터를 통합해 저장하는 데이터 환경입니다.

핵심 특징은 네 가지입니다.

주제 지향적
통합
시계열성
비휘발성

주제 지향적#

업무 처리 과정 자체보다 분석 대상이 되는 특정 주제를 중심으로 데이터를 구성합니다.

고객
상품
매출
지역

통합#

서로 다른 시스템에서 수집한 데이터를 일관된 형태로 통합합니다.

시계열성#

현재 데이터뿐 아니라 시간에 따른 변화와 이력을 저장합니다.

비휘발성#

분석용으로 적재된 데이터는 일반적인 운영 Database처럼 지속적으로 수정·삭제되는 성격과 다릅니다.

데이터마트란 무엇인가#

Data Mart는 특정 조직이나 업무 영역을 위해 구성된 데이터 집합입니다.

쉽게 구분하면:

Data Warehouse
→ 전사 단위

Data Mart
→ 특정 부서·조직·업무 단위

입니다.


9장 OLTP와 OLAP의 차이는 무엇인가#

OLTP와 OLAP는 이름이 비슷해 시험에서 자주 혼동됩니다.

OLTP#

Online Transaction Processing.

실제 업무에서 발생하는 거래를 빠르게 처리하는 시스템입니다.

예:

입금
출금
주문
결제
재고 변경

핵심:

T = Transaction

OLAP#

Online Analytical Processing.

여러 데이터를 분석해 의사결정을 지원하는 시스템입니다.

예:

월별 매출 분석
지역별 고객 분석
상품별 판매 추세 분석

핵심:

A = Analysis

OLTP와 OLAP 비교#

구분 OLTP OLAP
중심 거래 분석
목적 업무 처리 의사결정
데이터 현재 업무 데이터 통합·과거 데이터
변경 빈번 상대적으로 적음

시험에서는 가장 간단하게:

OLTP = 거래
OLAP = 분석

으로 기억하면 됩니다.


10장 데이터 품질 6요소#

첨부 학습자료에서는 데이터 품질을 다음 여섯 요소로 정리합니다.

정확성
완전성
일관성
유효성
유일성
적시성

정확성#

데이터 값이 실제 값과 일치하는가.

완전성#

필요한 데이터가 빠짐없이 존재하는가.

일관성#

서로 다른 시스템의 동일 데이터가 서로 충돌하지 않는가.

유효성#

데이터가 정해진 형식이나 규칙을 준수하는가.

유일성#

동일한 데이터가 불필요하게 중복되어 있지 않은가.

적시성#

필요한 시점에 최신 데이터가 제공되는가.

암기법은 다음과 같습니다.

정완일유유적

특히 시험에서는:

완전성
→ 누락이 없는가

유일성
→ 중복이 없는가

를 구분해야 합니다.


11장 빅데이터란 무엇인가#

빅데이터는 단순히 용량이 큰 파일만을 의미하지 않습니다.

대량의 다양한 데이터가 빠르게 생성되고 처리되는 환경과 이를 분석해 가치를 만들어내는 기술과 방법을 함께 포함하는 개념으로 이해해야 합니다.

빅데이터 3V#

ADsP에서 가장 먼저 기억해야 하는 것은 다음 세 가지입니다.

Volume
Variety
Velocity

Volume#

데이터의 규모를 의미합니다.

TB
PB
EB
ZB

처럼 매우 큰 규모의 데이터를 처리합니다.

Variety#

데이터 형태의 다양성입니다.

Database
JSON
XML
Text
Image
Audio
Video

같이 여러 형태의 데이터를 처리합니다.

Velocity#

데이터가 생성되고 처리되는 속도를 의미합니다.

실시간 거래
Sensor Data
Streaming
실시간 Log

등이 대표적입니다.

빅데이터 5V#

3V에 두 가지가 추가됩니다.

Volume
Variety
Velocity
Veracity
Value

Veracity는 데이터의 진실성과 신뢰성에 관련된 개념이고, Value는 데이터를 통해 실제 가치를 만들어내는 것을 의미합니다.

3V와 5V 빠른 암기#

3V
Volume
Variety
Velocity

5V
3V
+
Veracity
+
Value

12장 데이터 크기 단위#

데이터 크기 단위는 순서를 먼저 기억하는 것이 좋습니다.

KB
<
MB
<
GB
<
TB
<
PB
<
EB
<
ZB
<
YB

첨부 학습자료에서는 각 단계가 1024배씩 증가하는 관계로 정리되어 있습니다.

시험에서는 특히 다음 관계를 주의해서 기억합니다.

1 ZB
=
1024 EB

13장 빅데이터 시대의 변화#

첨부 자료에서는 전통적인 데이터 분석과 빅데이터 시대의 차이를 다음 네 가지 방향으로 설명합니다.

사전처리 → 사후처리

표본조사 → 전수조사

질 → 양

인과관계 → 상관관계

시험에서는 각각의 방향을 반대로 제시하는 선택지를 주의해서 확인해야 합니다.


14장 빅데이터 활용 기술#

빅데이터에서는 데이터를 단순히 저장하는 것뿐 아니라 다양한 방법으로 패턴을 발견하고 예측에 활용합니다.

기술 핵심
연관 규칙 학습 변수 사이의 연관관계 탐색
유형 분석 특성에 따라 대상을 분류
유전자 알고리즘 진화 개념을 이용한 최적화
기계 학습 학습 데이터로부터 예측
회귀 분석 변수 사이 관계 분석
감정 분석 Text의 감정이나 의견 분석
소셜 네트워크 분석 사람이나 객체의 관계망 분석

15장 빅데이터의 위기요인과 대응#

빅데이터는 유용하지만 데이터가 많아질수록 새로운 위험도 발생합니다.

첨부 자료에서 제시하는 대표적인 위기요인은 다음과 같습니다.

사생활 침해

책임 원칙 훼손

데이터 과신·오용

데이터 저장소 보안 취약

사생활 침해#

여러 데이터를 결합하면 개인을 예상보다 상세하게 파악할 수 있어 개인정보 침해 문제가 발생할 수 있습니다.

책임 원칙 훼손#

알고리즘의 판단으로 사람이 불이익을 받았을 때 책임 주체가 명확하지 않을 수 있습니다.

데이터 과신과 오용#

데이터 분석 결과를 절대적인 사실처럼 받아들이면 잘못된 의사결정으로 이어질 수 있습니다.

데이터 저장소 보안#

대량의 데이터가 한곳에 집중되면 유출이나 공격이 발생했을 때 피해 규모도 커질 수 있습니다.

개인정보 비식별화 방법#

첨부 자료에서는 다음과 같은 방법을 정리합니다.

방법 의미
데이터 마스킹 일부 값을 가림
가명 처리 실제 값을 다른 값으로 변경
총계 처리 개별 데이터 대신 합계를 제공
데이터 값 삭제 식별 가능한 값을 삭제
데이터 범주화 구체적인 값을 범위로 변경

예:

홍길동
→ 홍**

25세
→ 20~29세

16장 데이터 사이언스란 무엇인가#

데이터 사이언스는 다양한 데이터를 분석해 의미 있는 정보를 찾아내고 이를 실제 문제 해결에 활용하는 영역입니다.

단순 통계 분석에만 국한되지 않고 여러 기술과 역량이 결합됩니다.

통계
Programming
Machine Learning
Data Analysis
Visualization
Business Understanding

데이터 사이언티스트에게 필요한 역량#

데이터 사이언티스트는 분석 기술뿐 아니라 결과를 해석하고 전달하는 능력도 필요합니다.

Hard Skill#

통계
Programming
Machine Learning
데이터 분석 기술

Soft Skill#

통찰
문제 이해
Communication
Storytelling
협업

따라서 데이터 사이언티스트에게 Hard Skill만 필요하다고 생각하면 안 됩니다.


17장 ERP·CRM·SCM의 차이는 무엇인가#

기업 데이터 솔루션에서는 약어가 많이 등장합니다.

ERP#

Enterprise Resource Planning.

전사적 자원관리입니다.

회계
인사
생산
구매
재고

같은 기업의 자원을 통합적으로 관리합니다.

CRM#

Customer Relationship Management.

고객관계관리입니다.

고객 정보를 활용해 마케팅·영업·서비스와 고객 관계를 관리합니다.

SCM#

Supply Chain Management.

공급망관리입니다.

원재료부터 생산·물류·판매까지 연결되는 공급망을 효율적으로 관리합니다.

빠르게 구분하기#

ERP
→ 기업 전체 자원

CRM
→ 고객

SCM
→ 공급망

18장 BI와 BA의 차이는 무엇인가#

BI#

Business Intelligence.

기업 데이터를 조회하고 분석해 의사결정을 지원하는 데 초점을 둡니다.

Report
Dashboard
과거 데이터 조회

BA#

Business Analytics.

통계적·수학적 분석을 이용한 예측과 최적화에 초점을 둡니다.

예측
통계 분석
최적화
Modeling

시험에서는 대략 다음 흐름으로 구분하면 이해하기 쉽습니다.

BI
→ 현재와 과거 데이터를 이해

BA
→ 분석을 바탕으로 예측과 최적화

19장 플랫폼·IoT·블록체인 핵심 개념#

플랫폼이란 무엇인가#

플랫폼은 여러 참여자가 공동으로 활용할 수 있도록 만들어진 기반 구조입니다.

기업이나 IT 환경에서는 다양한 서비스와 사용자가 하나의 기반 위에서 상호작용합니다.

IoT란 무엇인가#

IoT는 Internet of Things의 약자로 여러 사물을 Network로 연결해 데이터를 주고받는 기술과 서비스를 의미합니다.

사물
↓
Sensor
↓
Network
↓
Server
↓
분석
↓
Service 또는 제어

블록체인이란 무엇인가#

블록체인은 거래 정보를 Block 단위로 기록하고 이를 순서대로 연결해 관리하는 분산형 장부 구조입니다.

첨부 자료에서는 기존 중앙 집중형 거래기록 방식과 달리 여러 참여자가 거래내역을 공유하고 대조함으로써 위·변조를 어렵게 만드는 구조로 설명합니다.


20장 Hadoop이란 무엇인가#

Hadoop은 대용량 데이터를 여러 컴퓨터에 나누어 저장하고 처리하기 위한 분산 처리 환경입니다.

ADsP에서는 다음 세 가지를 우선 기억하는 것이 중요합니다.

HDFS
MapReduce
YARN

HDFS#

Hadoop Distributed File System.

대용량 파일을 여러 Node에 분산 저장합니다.

HDFS
→ 분산 저장

MapReduce#

대규모 데이터를 여러 Node에서 분산 처리하는 방식입니다.

Map
→ 나누어 처리

Reduce
→ 처리 결과 결합

따라서:

MapReduce
→ 분산 처리

로 기억하면 됩니다.

YARN#

Cluster의 자원을 관리하고 작업 실행을 조정합니다.

YARN
→ 자원 관리

Hadoop 핵심 암기#

HDFS
→ 저장

MapReduce
→ 처리

YARN
→ Resource 관리

21장 Hadoop Ecosystem 주요 도구#

Hive#

SQL과 유사한 방식으로 Hadoop 데이터를 분석할 수 있도록 지원합니다.

Hive
→ Hadoop 데이터 + SQL 형태의 분석

HBase#

HDFS 기반에서 사용할 수 있는 Column 계열 NoSQL Database입니다.

Sqoop#

관계형 Database와 Hadoop 사이에서 데이터를 이동하는 용도로 사용됩니다.

RDB
↔
Hadoop

Pig#

Pig Latin을 이용해 대규모 데이터를 처리합니다.


22장 NoSQL이란 무엇인가#

NoSQL은 관계형 Database와 다른 형태로 데이터를 저장하는 Database 계열입니다.

ADsP에서는 NoSQL의 종류와 대표 제품을 연결해 기억하는 것이 중요합니다.

유형 대표 제품 특징
Document MongoDB Document 단위 저장
Column HBase·Cassandra Column 중심 저장
Key-Value Redis Key와 Value 구조
Graph Neo4j 관계 중심 저장

NoSQL이 아닌 Database#

다음 제품은 대표적인 관계형 Database입니다.

MySQL
Oracle
PostgreSQL
SQL Server

따라서 NoSQL이 아닌 것은 무엇인가라는 문제에서 자주 구분 대상이 됩니다.

빠른 암기#

MongoDB
→ Document

Redis
→ Key-Value

HBase · Cassandra
→ Column

Neo4j
→ Graph

23장 데이터 시각화 유형은 어떻게 구분하는가#

데이터 시각화 문제는 Chart 이름 자체보다 어떤 데이터와 목적에 적합한가를 기억하는 것이 중요합니다.

히스토그램#

Histogram은 연속형 수치 데이터의 분포를 확인할 때 사용합니다.

시험 점수 분포
연령 분포
Sensor 측정값 분포

막대 차트#

Bar Chart는 서로 다른 범주를 비교합니다.

지역별 매출
제품별 판매량
부서별 인원

히스토그램과 막대 차트의 차이#

구분 Histogram Bar Chart
데이터 연속형 범주형
목적 분포 확인 항목 비교
X축 수치 구간 범주
막대 보통 붙어 있음 보통 구분됨

상자그림#

Box Plot은 데이터 분포와 이상치를 확인하는 데 사용됩니다.

핵심 값은 다음과 같습니다.

Q1
Median
Q3
IQR

IQR은:

IQR = Q3 - Q1

입니다.

일반적인 이상치 기준은:

Q1 - 1.5 × IQR 미만

또는

Q3 + 1.5 × IQR 초과

입니다.

상자그림에서 반드시 기억할 것#

Q1
→ 25%

Median
→ 50%

Q3
→ 75%

Box Plot에서 대표적으로 확인하는 값은 중앙값이며 평균과 혼동하면 안 됩니다.

파이 차트#

Pie Chart는 전체에서 각 범주가 차지하는 구성비를 표현합니다.

시장 점유율
예산 구성

산점도#

Scatter Plot은 두 연속형 변수 사이의 관계를 확인합니다.

키 ↔ 몸무게
광고비 ↔ 매출

이를 통해 양의 상관관계, 음의 상관관계 또는 뚜렷한 상관관계가 없는 모습을 확인할 수 있습니다.

선 그래프#

Line Chart는 시간의 흐름에 따른 변화와 추세를 표현하는 데 적합합니다.

월별 매출
일별 온도
주가 변화

히트맵#

Heatmap은 값의 크기나 밀도를 색상의 강도로 표현합니다.

대표적으로 상관관계 행렬처럼 행과 열을 가진 데이터를 표현할 때 사용할 수 있습니다.


24장 ADsP 1과목 시험 직전 핵심 암기표#

개념 반드시 기억할 내용
DIKW Data → Information → Knowledge → Wisdom
암묵지 경험 속 지식
형식지 문서화 가능한 지식
공통화 암묵 → 암묵
표출화 암묵 → 형식
연결화 형식 → 형식
내면화 형식 → 암묵
인과관계 원인 → 결과
상관관계 함께 변화하나 원인 단정 불가
정형 Database Table 등
반정형 HTML·XML·JSON
비정형 Image·Video·Audio·Text
1NF 원자값
2NF 부분 함수 종속 제거
3NF 이행 함수 종속 제거
BCNF 결정자가 후보키
DW 주제지향·통합·시계열·비휘발
Data Mart 특정 조직·업무용
OLTP 거래 처리
OLAP 분석
3V Volume·Variety·Velocity
5V 3V + Veracity·Value
ERP 전사적 자원관리
CRM 고객관계관리
SCM 공급망관리
HDFS 분산 저장
MapReduce 분산 처리
YARN 자원 관리
MongoDB Document
Redis Key-Value
HBase·Cassandra Column
Neo4j Graph
Histogram 연속형 데이터 분포
Bar Chart 범주 비교
Box Plot 분포·이상치
Scatter Plot 두 변수 관계
Line Chart 시간에 따른 추세
Pie Chart 구성비

25장 ADsP 1과목에서 자주 헷갈리는 개념#

시험 직전에 다음 항목만 다시 확인해도 많은 실수를 줄일 수 있습니다.

Data
→ 원시 사실

Information
→ 의미 부여

Knowledge
→ 판단

Wisdom
→ 일반화·통찰
공통화
암묵 → 암묵

표출화
암묵 → 형식

연결화
형식 → 형식

내면화
형식 → 암묵
완전성
→ 누락 없음

유일성
→ 중복 없음
Volume
→ 양

Variety
→ 다양한 데이터 형태

Velocity
→ 속도
OLTP
→ Transaction

OLAP
→ Analysis
HDFS
→ 저장

MapReduce
→ 처리

YARN
→ 자원 관리
Histogram
→ 연속형 분포

Bar Chart
→ 범주 비교

Scatter Plot
→ 변수 관계

Line Chart
→ 시간 추세

26장 ADsP 1과목 5분 최종 요약#

시험장에 들어가기 직전이라면 아래 내용부터 확인합니다.

DIKW
D → I → K → W

SECI
공 → 표 → 연 → 내

정형
DB Table

반정형
HTML · XML · JSON

비정형
Image · Audio · Video · Text

정규화
1NF → 원자값
2NF → 부분 종속 제거
3NF → 이행 종속 제거
BCNF → 결정자 후보키

Data Warehouse
주제 지향
통합
시계열
비휘발

OLTP
거래

OLAP
분석

Big Data 3V
Volume
Variety
Velocity

Big Data 5V
3V
+
Veracity
Value

ERP
전사

CRM
고객

SCM
공급망

Hadoop
HDFS → 저장
MapReduce → 처리
YARN → 자원 관리

NoSQL
MongoDB → Document
Redis → Key-Value
HBase · Cassandra → Column
Neo4j → Graph

Visualization
Histogram → 분포
Bar → 비교
Box Plot → 분포·이상치
Scatter → 관계
Line → 시간
Pie → 구성비

ADsP 1과목 데이터 이해 FAQ#

ADsP 1과목에서는 무엇을 공부해야 하나#

데이터의 기본 개념부터 DIKW, 암묵지와 형식지, SECI, 데이터 유형, 데이터베이스, 데이터웨어하우스, 빅데이터, 데이터 사이언스, 기업 데이터 시스템, Hadoop, NoSQL, 데이터 시각화 등을 학습합니다.

DIKW 순서는 어떻게 외우면 되나#

다음 순서를 그대로 기억하면 됩니다.

Data
→ Information
→ Knowledge
→ Wisdom

원시 데이터가 의미 있는 정보가 되고, 이를 판단에 활용하면서 지식이 되며, 다시 일반화된 통찰로 발전한다고 이해하면 암기하기 쉽습니다.

SECI 모델 네 단계는 무엇인가#

다음 네 단계입니다.

공통화
→ 표출화
→ 연결화
→ 내면화

변환 방향까지 함께 기억합니다.

암묵 → 암묵
암묵 → 형식
형식 → 형식
형식 → 암묵

빅데이터 3V는 무엇인가#

빅데이터의 대표적인 세 가지 특징입니다.

Volume
Variety
Velocity

즉 데이터의 규모, 다양한 형태, 빠른 생성과 처리 속도를 의미합니다.

빅데이터 5V는 무엇인가#

3V에 다음 두 요소를 추가합니다.

Veracity
Value

따라서:

Volume
Variety
Velocity
Veracity
Value

가 됩니다.

OLTP와 OLAP는 어떻게 구분하나#

가장 간단한 방법은 알파벳을 이용하는 것입니다.

OLTP
T = Transaction
→ 거래 처리

OLAP
A = Analysis
→ 데이터 분석

Hadoop의 핵심 구성요소는 무엇인가#

ADsP 학습에서는 다음 세 가지를 우선 기억하면 됩니다.

HDFS
→ 분산 저장

MapReduce
→ 분산 처리

YARN
→ 자원 관리

대표적인 NoSQL Database에는 무엇이 있나#

대표적으로 다음과 같이 구분할 수 있습니다.

MongoDB
→ Document

Redis
→ Key-Value

HBase · Cassandra
→ Column

Neo4j
→ Graph

MySQL, Oracle, PostgreSQL, SQL Server는 관계형 Database이므로 이 구분에서 NoSQL에 포함되지 않습니다.

히스토그램과 막대 차트는 무엇이 다른가#

Histogram은 연속형 데이터의 분포를 확인하고 Bar Chart는 범주형 데이터를 서로 비교할 때 사용합니다.

시험에서는 두 Chart의 생김새보다 데이터의 유형과 목적을 중심으로 구분하는 것이 좋습니다.


자기 점검#

다음 질문에 바로 답할 수 있다면 ADsP 1과목의 핵심 개념이 어느 정도 정리된 것입니다.

  1. Data와 Information의 차이를 설명할 수 있는가?
  2. DIKW 네 단계를 순서대로 말할 수 있는가?
  3. 암묵지와 형식지의 차이를 설명할 수 있는가?
  4. SECI 네 단계의 변환 방향을 말할 수 있는가?
  5. 상관관계가 인과관계를 의미하지 않는 이유를 설명할 수 있는가?
  6. 정형·반정형·비정형 데이터를 예와 함께 구분할 수 있는가?
  7. 1NF·2NF·3NF·BCNF의 핵심 차이를 말할 수 있는가?
  8. 데이터웨어하우스의 네 가지 특징을 기억하는가?
  9. OLTP와 OLAP를 구분할 수 있는가?
  10. 빅데이터 3V와 5V를 말할 수 있는가?
  11. HDFS·MapReduce·YARN의 역할을 구분할 수 있는가?
  12. MongoDB·Redis·HBase·Neo4j의 유형을 연결할 수 있는가?
  13. Histogram·Bar Chart·Box Plot·Scatter Plot·Line Chart의 사용 목적을 구분할 수 있는가?

이 글을 마치며#

ADsP 1과목 데이터 이해는 각각의 용어를 무작정 외우는 것보다 서로 비슷한 개념을 비교하면서 관계를 이해하는 것이 중요합니다.

DIKW를 공부할 때는 Data·Information·Knowledge·Wisdom을 따로 외우지 말고 데이터가 어떻게 지식과 판단으로 발전하는지를 하나의 흐름으로 이해합니다.

SECI 역시 네 용어만 외우기보다는:

암묵지
↓
형식지
↓
다시 개인의 경험과 지식

이라는 지식 순환 구조로 이해하는 것이 좋습니다.

데이터웨어하우스를 공부할 때는 OLTP와 OLAP를 함께 비교하고, Hadoop을 공부할 때는 HDFS·MapReduce·YARN의 역할을 연결해서 봅니다.

데이터 시각화 역시 Chart 이름을 외우는 것보다:

분포인가?
비교인가?
관계인가?
시간 변화인가?
구성비인가?

를 먼저 판단하는 방식이 훨씬 이해하기 쉽습니다.

결국 ADsP 1과목의 핵심은 수많은 용어를 따로 암기하는 것이 아니라 비슷한 개념 사이의 경계를 정확하게 구분하는 것입니다. 이 페이지의 비교표와 핵심 암기 부분을 반복해서 확인하면 1과목 전체 구조를 빠르게 복습하는 데 활용할 수 있습니다.

이 페이지의 목차