ADsP 1과목 데이터 이해 핵심요약: DIKW·SECI·빅데이터·데이터웨어하우스·Hadoop·NoSQL 총정리
ADsP 1과목인 데이터 이해는 복잡한 계산보다는 용어의 의미와 서로 비슷한 개념의 차이를 정확하게 구분하는 것이 중요합니다.
시험 직전이라면 모든 내용을 처음부터 다시 외우기보다 다음 관계를 우선 기억하는 것이 좋습니다.
아직 학습 전 이해가 되지 않는 내용이나 추가로 설명이 필요한 경우 하단 하위 페이지를 참고 하시면 좋습니다.
Data → Information → Knowledge → Wisdom
암묵지 ↔ 형식지
공통화 → 표출화 → 연결화 → 내면화
인과관계 ↔ 상관관계
정형 ↔ 반정형 ↔ 비정형
OLTP ↔ OLAP
Volume · Variety · Velocity
HDFS → 저장
MapReduce → 처리
YARN → 자원 관리
Histogram → 분포
Bar Chart → 범주 비교
Scatter Plot → 변수 관계
Line Chart → 시간 변화이 글은 각각의 용어를 따로 나열하기보다 무엇인지, 무엇과 다른지, 시험에서는 어디서 헷갈리는지를 함께 설명합니다.
1장 ADsP DIKW 피라미드란 무엇인가#
DIKW 피라미드는 데이터가 단순한 사실에서 출발해 의미 있는 정보와 지식으로 발전하고, 최종적으로 판단과 통찰에 활용되는 과정을 설명하는 모델입니다.
순서는 반드시 다음과 같이 기억합니다.
Data
↓
Information
↓
Knowledge
↓
WisdomData는 무엇인가#
Data는 아직 해석이나 의미가 부여되지 않은 가공 전의 사실과 수치입니다.
예를 들어 다음 두 값이 있다고 가정해봅시다.
A마트 상품 가격: 100원
B마트 상품 가격: 300원이 단계에서는 단순히 두 개의 숫자가 존재할 뿐입니다.
아직 어느 마트가 더 저렴한지 판단하지 않았으므로 Data입니다.
Information은 무엇인가#
Information은 Data를 비교하거나 분석해 의미를 부여한 결과입니다.
A마트가 B마트보다 200원 저렴하다.100원과 300원이라는 원시 Data를 비교하면서 새로운 의미가 만들어졌습니다.
따라서 Information입니다.
Knowledge는 무엇인가#
Knowledge는 Information을 이용해 판단하거나 행동할 수 있는 상태입니다.
A마트가 더 저렴하므로 A마트에서 구매해야겠다.단순히 가격 차이를 아는 수준을 넘어 의사결정에 활용하고 있습니다.
Wisdom은 무엇인가#
Wisdom은 Knowledge를 더 넓은 상황으로 확장하거나 일반화해 새로운 판단과 통찰을 만드는 단계입니다.
A마트가 지속적으로 저렴한 경향을 보인다면
다른 상품을 구매할 때도 A마트 가격을 우선 확인해보자.하나의 정보를 넘어 경험과 지식을 일반화하고 있다는 점이 핵심입니다.
DIKW 핵심 비교#
| 단계 | 의미 | 핵심 질문 | 예 |
|---|---|---|---|
| Data | 원시 사실 | 무엇이 있는가 | A마트 100원 |
| Information | 의미가 부여된 데이터 | 무엇을 알 수 있는가 | A마트가 더 싸다 |
| Knowledge | 판단에 활용 가능한 정보 | 어떻게 행동할 것인가 | A마트에서 사자 |
| Wisdom | 일반화된 통찰 | 앞으로 어떻게 활용할 것인가 | 다른 상품에도 적용 |
DIKW 시험 포인트#
가장 중요한 것은 순서입니다.
Data
→ Information
→ Knowledge
→ Wisdom그리고 위로 올라갈수록 단순한 데이터에서 벗어나 의미와 활용 가치가 높아진다는 점을 기억합니다.
2장 암묵지와 형식지는 무엇이 다른가#
ADsP에서는 지식을 암묵지와 형식지로 구분합니다.
암묵지란 무엇인가#
암묵지는 개인의 경험이나 숙련 과정에서 형성되어 쉽게 문서로 표현하기 어려운 지식입니다.
대표적인 예가 있습니다.
자전거 타는 감각
숙련 기술자의 작업 감각
고객 응대 노하우
오랫동안 요리하면서 익힌 맛 조절 방법말로 완벽하게 설명하기는 어렵지만 사람은 경험을 통해 알고 있습니다.
따라서 암묵지는 쉽게 말해 머릿속과 몸에 축적된 경험적 지식입니다.
형식지란 무엇인가#
형식지는 문서나 언어처럼 다른 사람에게 전달할 수 있는 형태로 표현된 지식입니다.
예를 들면 다음과 같습니다.
교과서
업무 매뉴얼
작업 절차서
교육 자료
데이터베이스암묵지와 비교하면 차이가 명확합니다.
암묵지
→ 경험으로 알고 있는 지식
형식지
→ 기록하고 전달할 수 있는 지식3장 SECI 모델이란 무엇인가#
SECI 모델은 암묵지와 형식지가 서로 변환되면서 새로운 지식이 만들어지는 과정을 설명합니다.
시험에서는 네 단계의 순서와 변환 방향을 함께 기억해야 합니다.
공통화
암묵지 → 암묵지
↓
표출화
암묵지 → 형식지
↓
연결화
형식지 → 형식지
↓
내면화
형식지 → 암묵지공통화#
공통화는 한 사람의 암묵지가 다른 사람의 암묵지로 전달되는 과정입니다.
견학
멘토링
숙련자의 작업을 직접 관찰
선배와 함께 업무 수행문서보다 경험과 관찰이 중요합니다.
표출화#
표출화는 머릿속의 암묵지를 문서와 언어로 표현하는 과정입니다.
숙련자의 노하우
↓
업무 매뉴얼 작성즉:
암묵지 → 형식지입니다.
연결화#
연결화는 기존의 여러 형식지를 결합해 새로운 형식지를 만드는 과정입니다.
영업 보고서
+
고객 분석 보고서
+
시장 조사 자료
↓
종합 경영 보고서내면화#
내면화는 문서화된 형식지를 사람이 실제로 익혀 자신의 암묵지로 만드는 과정입니다.
매뉴얼 학습
↓
교육
↓
실습
↓
숙련SECI 빠른 암기#
| 단계 | 변환 |
|---|---|
| 공통화 | 암묵 → 암묵 |
| 표출화 | 암묵 → 형식 |
| 연결화 | 형식 → 형식 |
| 내면화 | 형식 → 암묵 |
공 → 표 → 연 → 내순서로 기억하면 됩니다.
시험에서 추상화 같은 용어가 섞여 나올 경우 SECI 네 단계와 혼동하지 않도록 주의합니다.
4장 인과관계와 상관관계의 차이는 무엇인가#
데이터 분석에서 가장 중요한 기본 개념 중 하나입니다.
인과관계란 무엇인가#
인과관계는 한 현상이 다른 현상의 원인이 되는 관계입니다.
원인
↓
결과예:
전등 스위치를 켰다.
↓
전등이 켜졌다.핵심은:
A 때문에 B가 발생했다.
라고 설명할 수 있다는 것입니다.
상관관계란 무엇인가#
상관관계는 두 현상이 함께 변화하지만 한쪽이 다른 쪽의 직접적인 원인이라고 단정할 수 없는 관계입니다.
대표적인 예가 아이스크림 판매량과 익사 사고입니다.
여름
├─ 기온 상승 → 아이스크림 판매 증가
└─ 물놀이 증가 → 익사 사고 증가아이스크림 판매량과 익사 사고가 동시에 증가한다고 해서:
아이스크림이 익사 사고를 발생시킨다.라고 결론 내릴 수는 없습니다.
인과관계와 상관관계 비교#
| 구분 | 인과관계 | 상관관계 |
|---|---|---|
| 의미 | 원인과 결과 | 함께 변화하는 관계 |
| 핵심 | A 때문에 B 발생 | A와 B가 함께 움직임 |
| 원인 확인 | 필요 | 반드시 확인되지 않음 |
시험에서 가장 중요한 문장은 다음입니다.
상관관계가 있다고 해서
인과관계가 성립하는 것은 아니다.5장 정성적·정량적 데이터와 정형·반정형·비정형 데이터#
데이터 유형은 서로 다른 기준이 섞여 출제될 수 있으므로 구분해서 이해해야 합니다.
정성적 데이터란 무엇인가#
정성적 데이터는 숫자로 단순하게 표현하기 어려운 성질이나 특성을 나타내는 데이터입니다.
예:
고객 의견
SNS 게시물
인터뷰
기상 특보정량적 데이터란 무엇인가#
정량적 데이터는 수치로 표현할 수 있는 데이터입니다.
나이
온도
습도
풍속
매출액
판매량정형 데이터란 무엇인가#
정형 데이터는 구조와 Schema가 일정하게 정의된 데이터입니다.
대표적인 예:
Database Table
CSV반정형 데이터란 무엇인가#
반정형 데이터는 일정한 구조나 Tag를 가지고 있지만 관계형 Database Table처럼 고정된 구조는 아닌 데이터입니다.
대표적인 예:
HTML
XML
JSON비정형 데이터란 무엇인가#
비정형 데이터는 미리 정해진 고정 구조가 없는 데이터입니다.
Image
Video
Audio
자연어 Text한 번에 비교하기#
| 유형 | 대표 예 |
|---|---|
| 정형 | Database Table·CSV |
| 반정형 | HTML·XML·JSON |
| 비정형 | Image·Video·Audio·Text |
시험에서는 HTML이나 JSON을 무조건 정형 데이터라고 판단하지 않도록 주의합니다.
6장 데이터베이스란 무엇인가#
데이터베이스는 여러 사용자가 필요한 데이터를 체계적으로 저장하고 관리하기 위한 데이터 집합입니다.
ADsP에서는 데이터베이스의 특징을 다음 네 가지로 구분합니다.
통합된 데이터#
불필요한 중복을 최소화하고 데이터를 통합하여 관리합니다.
저장된 데이터#
컴퓨터가 접근할 수 있는 저장매체에 저장됩니다.
공용 데이터#
여러 사용자가 서로 다른 목적으로 함께 사용할 수 있습니다.
운영 데이터#
조직이나 기업의 실제 업무 수행을 위해 사용되는 데이터입니다.
데이터베이스 설계 절차#
순서는 다음과 같습니다.
요구 분석
↓
개념 설계
↓
논리 설계
↓
물리 설계DBMS란 무엇인가#
DBMS는 Database Management System의 약자로 데이터베이스를 생성하고 조회하며 수정·관리할 수 있도록 지원하는 소프트웨어입니다.
7장 데이터베이스 정규화란 무엇인가#
정규화는 데이터의 불필요한 중복을 줄이고 데이터 이상 현상을 방지하기 위해 Table 구조를 체계적으로 나누는 과정입니다.
쉽게 표현하면:
같은 정보를 여기저기 중복 저장해 데이터가 꼬이는 문제를 줄이는 과정
입니다.
삽입 이상#
데이터 하나를 추가하기 위해 관계없는 값까지 함께 입력해야 하는 문제입니다.
삭제 이상#
하나의 데이터를 삭제했는데 필요한 다른 데이터까지 같이 사라지는 문제입니다.
갱신 이상#
같은 데이터가 여러 곳에 저장되어 일부만 수정되면서 값이 서로 달라지는 문제입니다.
1NF#
제1정규형은 모든 속성 값이 원자값을 가지도록 합니다.
1NF
→ 원자값2NF#
제2정규형은 1NF를 만족하면서 부분 함수 종속을 제거합니다.
2NF
→ 부분 종속 제거3NF#
제3정규형은 2NF를 만족하면서 이행 함수 종속을 제거합니다.
A → B
B → C
이면
A → C처럼 간접적으로 종속되는 관계를 제거합니다.
3NF
→ 이행 종속 제거BCNF#
BCNF에서는 모든 결정자가 후보키가 되어야 합니다.
BCNF
→ 결정자가 후보키정규화 핵심 암기#
1NF
원자값
2NF
부분 종속 제거
3NF
이행 종속 제거
BCNF
결정자 = 후보키정규화를 많이 한다고 무조건 시스템 성능이 좋아지는 것은 아닙니다. 실제 시스템에서는 JOIN 증가 등으로 조회 비용이 커질 수 있어 필요에 따라 역정규화를 고려하기도 합니다.
8장 데이터웨어하우스와 데이터마트의 차이는 무엇인가#
데이터웨어하우스란 무엇인가#
데이터웨어하우스, DW는 기업의 의사결정을 지원하기 위해 여러 시스템의 데이터를 통합해 저장하는 데이터 환경입니다.
핵심 특징은 네 가지입니다.
주제 지향적
통합
시계열성
비휘발성주제 지향적#
업무 처리 과정 자체보다 분석 대상이 되는 특정 주제를 중심으로 데이터를 구성합니다.
고객
상품
매출
지역통합#
서로 다른 시스템에서 수집한 데이터를 일관된 형태로 통합합니다.
시계열성#
현재 데이터뿐 아니라 시간에 따른 변화와 이력을 저장합니다.
비휘발성#
분석용으로 적재된 데이터는 일반적인 운영 Database처럼 지속적으로 수정·삭제되는 성격과 다릅니다.
데이터마트란 무엇인가#
Data Mart는 특정 조직이나 업무 영역을 위해 구성된 데이터 집합입니다.
쉽게 구분하면:
Data Warehouse
→ 전사 단위
Data Mart
→ 특정 부서·조직·업무 단위입니다.
9장 OLTP와 OLAP의 차이는 무엇인가#
OLTP와 OLAP는 이름이 비슷해 시험에서 자주 혼동됩니다.
OLTP#
Online Transaction Processing.
실제 업무에서 발생하는 거래를 빠르게 처리하는 시스템입니다.
예:
입금
출금
주문
결제
재고 변경핵심:
T = TransactionOLAP#
Online Analytical Processing.
여러 데이터를 분석해 의사결정을 지원하는 시스템입니다.
예:
월별 매출 분석
지역별 고객 분석
상품별 판매 추세 분석핵심:
A = AnalysisOLTP와 OLAP 비교#
| 구분 | OLTP | OLAP |
|---|---|---|
| 중심 | 거래 | 분석 |
| 목적 | 업무 처리 | 의사결정 |
| 데이터 | 현재 업무 데이터 | 통합·과거 데이터 |
| 변경 | 빈번 | 상대적으로 적음 |
시험에서는 가장 간단하게:
OLTP = 거래
OLAP = 분석으로 기억하면 됩니다.
10장 데이터 품질 6요소#
첨부 학습자료에서는 데이터 품질을 다음 여섯 요소로 정리합니다.
정확성
완전성
일관성
유효성
유일성
적시성정확성#
데이터 값이 실제 값과 일치하는가.
완전성#
필요한 데이터가 빠짐없이 존재하는가.
일관성#
서로 다른 시스템의 동일 데이터가 서로 충돌하지 않는가.
유효성#
데이터가 정해진 형식이나 규칙을 준수하는가.
유일성#
동일한 데이터가 불필요하게 중복되어 있지 않은가.
적시성#
필요한 시점에 최신 데이터가 제공되는가.
암기법은 다음과 같습니다.
정완일유유적특히 시험에서는:
완전성
→ 누락이 없는가
유일성
→ 중복이 없는가를 구분해야 합니다.
11장 빅데이터란 무엇인가#
빅데이터는 단순히 용량이 큰 파일만을 의미하지 않습니다.
대량의 다양한 데이터가 빠르게 생성되고 처리되는 환경과 이를 분석해 가치를 만들어내는 기술과 방법을 함께 포함하는 개념으로 이해해야 합니다.
빅데이터 3V#
ADsP에서 가장 먼저 기억해야 하는 것은 다음 세 가지입니다.
Volume
Variety
VelocityVolume#
데이터의 규모를 의미합니다.
TB
PB
EB
ZB처럼 매우 큰 규모의 데이터를 처리합니다.
Variety#
데이터 형태의 다양성입니다.
Database
JSON
XML
Text
Image
Audio
Video같이 여러 형태의 데이터를 처리합니다.
Velocity#
데이터가 생성되고 처리되는 속도를 의미합니다.
실시간 거래
Sensor Data
Streaming
실시간 Log등이 대표적입니다.
빅데이터 5V#
3V에 두 가지가 추가됩니다.
Volume
Variety
Velocity
Veracity
ValueVeracity는 데이터의 진실성과 신뢰성에 관련된 개념이고, Value는 데이터를 통해 실제 가치를 만들어내는 것을 의미합니다.
3V와 5V 빠른 암기#
3V
Volume
Variety
Velocity
5V
3V
+
Veracity
+
Value12장 데이터 크기 단위#
데이터 크기 단위는 순서를 먼저 기억하는 것이 좋습니다.
KB
<
MB
<
GB
<
TB
<
PB
<
EB
<
ZB
<
YB첨부 학습자료에서는 각 단계가 1024배씩 증가하는 관계로 정리되어 있습니다.
시험에서는 특히 다음 관계를 주의해서 기억합니다.
1 ZB
=
1024 EB13장 빅데이터 시대의 변화#
첨부 자료에서는 전통적인 데이터 분석과 빅데이터 시대의 차이를 다음 네 가지 방향으로 설명합니다.
사전처리 → 사후처리
표본조사 → 전수조사
질 → 양
인과관계 → 상관관계시험에서는 각각의 방향을 반대로 제시하는 선택지를 주의해서 확인해야 합니다.
14장 빅데이터 활용 기술#
빅데이터에서는 데이터를 단순히 저장하는 것뿐 아니라 다양한 방법으로 패턴을 발견하고 예측에 활용합니다.
| 기술 | 핵심 |
|---|---|
| 연관 규칙 학습 | 변수 사이의 연관관계 탐색 |
| 유형 분석 | 특성에 따라 대상을 분류 |
| 유전자 알고리즘 | 진화 개념을 이용한 최적화 |
| 기계 학습 | 학습 데이터로부터 예측 |
| 회귀 분석 | 변수 사이 관계 분석 |
| 감정 분석 | Text의 감정이나 의견 분석 |
| 소셜 네트워크 분석 | 사람이나 객체의 관계망 분석 |
15장 빅데이터의 위기요인과 대응#
빅데이터는 유용하지만 데이터가 많아질수록 새로운 위험도 발생합니다.
첨부 자료에서 제시하는 대표적인 위기요인은 다음과 같습니다.
사생활 침해
책임 원칙 훼손
데이터 과신·오용
데이터 저장소 보안 취약사생활 침해#
여러 데이터를 결합하면 개인을 예상보다 상세하게 파악할 수 있어 개인정보 침해 문제가 발생할 수 있습니다.
책임 원칙 훼손#
알고리즘의 판단으로 사람이 불이익을 받았을 때 책임 주체가 명확하지 않을 수 있습니다.
데이터 과신과 오용#
데이터 분석 결과를 절대적인 사실처럼 받아들이면 잘못된 의사결정으로 이어질 수 있습니다.
데이터 저장소 보안#
대량의 데이터가 한곳에 집중되면 유출이나 공격이 발생했을 때 피해 규모도 커질 수 있습니다.
개인정보 비식별화 방법#
첨부 자료에서는 다음과 같은 방법을 정리합니다.
| 방법 | 의미 |
|---|---|
| 데이터 마스킹 | 일부 값을 가림 |
| 가명 처리 | 실제 값을 다른 값으로 변경 |
| 총계 처리 | 개별 데이터 대신 합계를 제공 |
| 데이터 값 삭제 | 식별 가능한 값을 삭제 |
| 데이터 범주화 | 구체적인 값을 범위로 변경 |
예:
홍길동
→ 홍**
25세
→ 20~29세16장 데이터 사이언스란 무엇인가#
데이터 사이언스는 다양한 데이터를 분석해 의미 있는 정보를 찾아내고 이를 실제 문제 해결에 활용하는 영역입니다.
단순 통계 분석에만 국한되지 않고 여러 기술과 역량이 결합됩니다.
통계
Programming
Machine Learning
Data Analysis
Visualization
Business Understanding데이터 사이언티스트에게 필요한 역량#
데이터 사이언티스트는 분석 기술뿐 아니라 결과를 해석하고 전달하는 능력도 필요합니다.
Hard Skill#
통계
Programming
Machine Learning
데이터 분석 기술Soft Skill#
통찰
문제 이해
Communication
Storytelling
협업따라서 데이터 사이언티스트에게 Hard Skill만 필요하다고 생각하면 안 됩니다.
17장 ERP·CRM·SCM의 차이는 무엇인가#
기업 데이터 솔루션에서는 약어가 많이 등장합니다.
ERP#
Enterprise Resource Planning.
전사적 자원관리입니다.
회계
인사
생산
구매
재고같은 기업의 자원을 통합적으로 관리합니다.
CRM#
Customer Relationship Management.
고객관계관리입니다.
고객 정보를 활용해 마케팅·영업·서비스와 고객 관계를 관리합니다.
SCM#
Supply Chain Management.
공급망관리입니다.
원재료부터 생산·물류·판매까지 연결되는 공급망을 효율적으로 관리합니다.
빠르게 구분하기#
ERP
→ 기업 전체 자원
CRM
→ 고객
SCM
→ 공급망18장 BI와 BA의 차이는 무엇인가#
BI#
Business Intelligence.
기업 데이터를 조회하고 분석해 의사결정을 지원하는 데 초점을 둡니다.
Report
Dashboard
과거 데이터 조회BA#
Business Analytics.
통계적·수학적 분석을 이용한 예측과 최적화에 초점을 둡니다.
예측
통계 분석
최적화
Modeling시험에서는 대략 다음 흐름으로 구분하면 이해하기 쉽습니다.
BI
→ 현재와 과거 데이터를 이해
BA
→ 분석을 바탕으로 예측과 최적화19장 플랫폼·IoT·블록체인 핵심 개념#
플랫폼이란 무엇인가#
플랫폼은 여러 참여자가 공동으로 활용할 수 있도록 만들어진 기반 구조입니다.
기업이나 IT 환경에서는 다양한 서비스와 사용자가 하나의 기반 위에서 상호작용합니다.
IoT란 무엇인가#
IoT는 Internet of Things의 약자로 여러 사물을 Network로 연결해 데이터를 주고받는 기술과 서비스를 의미합니다.
사물
↓
Sensor
↓
Network
↓
Server
↓
분석
↓
Service 또는 제어블록체인이란 무엇인가#
블록체인은 거래 정보를 Block 단위로 기록하고 이를 순서대로 연결해 관리하는 분산형 장부 구조입니다.
첨부 자료에서는 기존 중앙 집중형 거래기록 방식과 달리 여러 참여자가 거래내역을 공유하고 대조함으로써 위·변조를 어렵게 만드는 구조로 설명합니다.
20장 Hadoop이란 무엇인가#
Hadoop은 대용량 데이터를 여러 컴퓨터에 나누어 저장하고 처리하기 위한 분산 처리 환경입니다.
ADsP에서는 다음 세 가지를 우선 기억하는 것이 중요합니다.
HDFS
MapReduce
YARNHDFS#
Hadoop Distributed File System.
대용량 파일을 여러 Node에 분산 저장합니다.
HDFS
→ 분산 저장MapReduce#
대규모 데이터를 여러 Node에서 분산 처리하는 방식입니다.
Map
→ 나누어 처리
Reduce
→ 처리 결과 결합따라서:
MapReduce
→ 분산 처리로 기억하면 됩니다.
YARN#
Cluster의 자원을 관리하고 작업 실행을 조정합니다.
YARN
→ 자원 관리Hadoop 핵심 암기#
HDFS
→ 저장
MapReduce
→ 처리
YARN
→ Resource 관리21장 Hadoop Ecosystem 주요 도구#
Hive#
SQL과 유사한 방식으로 Hadoop 데이터를 분석할 수 있도록 지원합니다.
Hive
→ Hadoop 데이터 + SQL 형태의 분석HBase#
HDFS 기반에서 사용할 수 있는 Column 계열 NoSQL Database입니다.
Sqoop#
관계형 Database와 Hadoop 사이에서 데이터를 이동하는 용도로 사용됩니다.
RDB
↔
HadoopPig#
Pig Latin을 이용해 대규모 데이터를 처리합니다.
22장 NoSQL이란 무엇인가#
NoSQL은 관계형 Database와 다른 형태로 데이터를 저장하는 Database 계열입니다.
ADsP에서는 NoSQL의 종류와 대표 제품을 연결해 기억하는 것이 중요합니다.
| 유형 | 대표 제품 | 특징 |
|---|---|---|
| Document | MongoDB | Document 단위 저장 |
| Column | HBase·Cassandra | Column 중심 저장 |
| Key-Value | Redis | Key와 Value 구조 |
| Graph | Neo4j | 관계 중심 저장 |
NoSQL이 아닌 Database#
다음 제품은 대표적인 관계형 Database입니다.
MySQL
Oracle
PostgreSQL
SQL Server따라서 NoSQL이 아닌 것은 무엇인가라는 문제에서 자주 구분 대상이 됩니다.
빠른 암기#
MongoDB
→ Document
Redis
→ Key-Value
HBase · Cassandra
→ Column
Neo4j
→ Graph23장 데이터 시각화 유형은 어떻게 구분하는가#
데이터 시각화 문제는 Chart 이름 자체보다 어떤 데이터와 목적에 적합한가를 기억하는 것이 중요합니다.
히스토그램#
Histogram은 연속형 수치 데이터의 분포를 확인할 때 사용합니다.
시험 점수 분포
연령 분포
Sensor 측정값 분포막대 차트#
Bar Chart는 서로 다른 범주를 비교합니다.
지역별 매출
제품별 판매량
부서별 인원히스토그램과 막대 차트의 차이#
| 구분 | Histogram | Bar Chart |
|---|---|---|
| 데이터 | 연속형 | 범주형 |
| 목적 | 분포 확인 | 항목 비교 |
| X축 | 수치 구간 | 범주 |
| 막대 | 보통 붙어 있음 | 보통 구분됨 |
상자그림#
Box Plot은 데이터 분포와 이상치를 확인하는 데 사용됩니다.
핵심 값은 다음과 같습니다.
Q1
Median
Q3
IQRIQR은:
IQR = Q3 - Q1입니다.
일반적인 이상치 기준은:
Q1 - 1.5 × IQR 미만
또는
Q3 + 1.5 × IQR 초과입니다.
상자그림에서 반드시 기억할 것#
Q1
→ 25%
Median
→ 50%
Q3
→ 75%Box Plot에서 대표적으로 확인하는 값은 중앙값이며 평균과 혼동하면 안 됩니다.
파이 차트#
Pie Chart는 전체에서 각 범주가 차지하는 구성비를 표현합니다.
시장 점유율
예산 구성산점도#
Scatter Plot은 두 연속형 변수 사이의 관계를 확인합니다.
키 ↔ 몸무게
광고비 ↔ 매출이를 통해 양의 상관관계, 음의 상관관계 또는 뚜렷한 상관관계가 없는 모습을 확인할 수 있습니다.
선 그래프#
Line Chart는 시간의 흐름에 따른 변화와 추세를 표현하는 데 적합합니다.
월별 매출
일별 온도
주가 변화히트맵#
Heatmap은 값의 크기나 밀도를 색상의 강도로 표현합니다.
대표적으로 상관관계 행렬처럼 행과 열을 가진 데이터를 표현할 때 사용할 수 있습니다.
24장 ADsP 1과목 시험 직전 핵심 암기표#
| 개념 | 반드시 기억할 내용 |
|---|---|
| DIKW | Data → Information → Knowledge → Wisdom |
| 암묵지 | 경험 속 지식 |
| 형식지 | 문서화 가능한 지식 |
| 공통화 | 암묵 → 암묵 |
| 표출화 | 암묵 → 형식 |
| 연결화 | 형식 → 형식 |
| 내면화 | 형식 → 암묵 |
| 인과관계 | 원인 → 결과 |
| 상관관계 | 함께 변화하나 원인 단정 불가 |
| 정형 | Database Table 등 |
| 반정형 | HTML·XML·JSON |
| 비정형 | Image·Video·Audio·Text |
| 1NF | 원자값 |
| 2NF | 부분 함수 종속 제거 |
| 3NF | 이행 함수 종속 제거 |
| BCNF | 결정자가 후보키 |
| DW | 주제지향·통합·시계열·비휘발 |
| Data Mart | 특정 조직·업무용 |
| OLTP | 거래 처리 |
| OLAP | 분석 |
| 3V | Volume·Variety·Velocity |
| 5V | 3V + Veracity·Value |
| ERP | 전사적 자원관리 |
| CRM | 고객관계관리 |
| SCM | 공급망관리 |
| HDFS | 분산 저장 |
| MapReduce | 분산 처리 |
| YARN | 자원 관리 |
| MongoDB | Document |
| Redis | Key-Value |
| HBase·Cassandra | Column |
| Neo4j | Graph |
| Histogram | 연속형 데이터 분포 |
| Bar Chart | 범주 비교 |
| Box Plot | 분포·이상치 |
| Scatter Plot | 두 변수 관계 |
| Line Chart | 시간에 따른 추세 |
| Pie Chart | 구성비 |
25장 ADsP 1과목에서 자주 헷갈리는 개념#
시험 직전에 다음 항목만 다시 확인해도 많은 실수를 줄일 수 있습니다.
Data
→ 원시 사실
Information
→ 의미 부여
Knowledge
→ 판단
Wisdom
→ 일반화·통찰공통화
암묵 → 암묵
표출화
암묵 → 형식
연결화
형식 → 형식
내면화
형식 → 암묵완전성
→ 누락 없음
유일성
→ 중복 없음Volume
→ 양
Variety
→ 다양한 데이터 형태
Velocity
→ 속도OLTP
→ Transaction
OLAP
→ AnalysisHDFS
→ 저장
MapReduce
→ 처리
YARN
→ 자원 관리Histogram
→ 연속형 분포
Bar Chart
→ 범주 비교
Scatter Plot
→ 변수 관계
Line Chart
→ 시간 추세26장 ADsP 1과목 5분 최종 요약#
시험장에 들어가기 직전이라면 아래 내용부터 확인합니다.
DIKW
D → I → K → W
SECI
공 → 표 → 연 → 내
정형
DB Table
반정형
HTML · XML · JSON
비정형
Image · Audio · Video · Text
정규화
1NF → 원자값
2NF → 부분 종속 제거
3NF → 이행 종속 제거
BCNF → 결정자 후보키
Data Warehouse
주제 지향
통합
시계열
비휘발
OLTP
거래
OLAP
분석
Big Data 3V
Volume
Variety
Velocity
Big Data 5V
3V
+
Veracity
Value
ERP
전사
CRM
고객
SCM
공급망
Hadoop
HDFS → 저장
MapReduce → 처리
YARN → 자원 관리
NoSQL
MongoDB → Document
Redis → Key-Value
HBase · Cassandra → Column
Neo4j → Graph
Visualization
Histogram → 분포
Bar → 비교
Box Plot → 분포·이상치
Scatter → 관계
Line → 시간
Pie → 구성비ADsP 1과목 데이터 이해 FAQ#
ADsP 1과목에서는 무엇을 공부해야 하나#
데이터의 기본 개념부터 DIKW, 암묵지와 형식지, SECI, 데이터 유형, 데이터베이스, 데이터웨어하우스, 빅데이터, 데이터 사이언스, 기업 데이터 시스템, Hadoop, NoSQL, 데이터 시각화 등을 학습합니다.
DIKW 순서는 어떻게 외우면 되나#
다음 순서를 그대로 기억하면 됩니다.
Data
→ Information
→ Knowledge
→ Wisdom원시 데이터가 의미 있는 정보가 되고, 이를 판단에 활용하면서 지식이 되며, 다시 일반화된 통찰로 발전한다고 이해하면 암기하기 쉽습니다.
SECI 모델 네 단계는 무엇인가#
다음 네 단계입니다.
공통화
→ 표출화
→ 연결화
→ 내면화변환 방향까지 함께 기억합니다.
암묵 → 암묵
암묵 → 형식
형식 → 형식
형식 → 암묵빅데이터 3V는 무엇인가#
빅데이터의 대표적인 세 가지 특징입니다.
Volume
Variety
Velocity즉 데이터의 규모, 다양한 형태, 빠른 생성과 처리 속도를 의미합니다.
빅데이터 5V는 무엇인가#
3V에 다음 두 요소를 추가합니다.
Veracity
Value따라서:
Volume
Variety
Velocity
Veracity
Value가 됩니다.
OLTP와 OLAP는 어떻게 구분하나#
가장 간단한 방법은 알파벳을 이용하는 것입니다.
OLTP
T = Transaction
→ 거래 처리
OLAP
A = Analysis
→ 데이터 분석Hadoop의 핵심 구성요소는 무엇인가#
ADsP 학습에서는 다음 세 가지를 우선 기억하면 됩니다.
HDFS
→ 분산 저장
MapReduce
→ 분산 처리
YARN
→ 자원 관리대표적인 NoSQL Database에는 무엇이 있나#
대표적으로 다음과 같이 구분할 수 있습니다.
MongoDB
→ Document
Redis
→ Key-Value
HBase · Cassandra
→ Column
Neo4j
→ GraphMySQL, Oracle, PostgreSQL, SQL Server는 관계형 Database이므로 이 구분에서 NoSQL에 포함되지 않습니다.
히스토그램과 막대 차트는 무엇이 다른가#
Histogram은 연속형 데이터의 분포를 확인하고 Bar Chart는 범주형 데이터를 서로 비교할 때 사용합니다.
시험에서는 두 Chart의 생김새보다 데이터의 유형과 목적을 중심으로 구분하는 것이 좋습니다.
자기 점검#
다음 질문에 바로 답할 수 있다면 ADsP 1과목의 핵심 개념이 어느 정도 정리된 것입니다.
- Data와 Information의 차이를 설명할 수 있는가?
- DIKW 네 단계를 순서대로 말할 수 있는가?
- 암묵지와 형식지의 차이를 설명할 수 있는가?
- SECI 네 단계의 변환 방향을 말할 수 있는가?
- 상관관계가 인과관계를 의미하지 않는 이유를 설명할 수 있는가?
- 정형·반정형·비정형 데이터를 예와 함께 구분할 수 있는가?
- 1NF·2NF·3NF·BCNF의 핵심 차이를 말할 수 있는가?
- 데이터웨어하우스의 네 가지 특징을 기억하는가?
- OLTP와 OLAP를 구분할 수 있는가?
- 빅데이터 3V와 5V를 말할 수 있는가?
- HDFS·MapReduce·YARN의 역할을 구분할 수 있는가?
- MongoDB·Redis·HBase·Neo4j의 유형을 연결할 수 있는가?
- Histogram·Bar Chart·Box Plot·Scatter Plot·Line Chart의 사용 목적을 구분할 수 있는가?
이 글을 마치며#
ADsP 1과목 데이터 이해는 각각의 용어를 무작정 외우는 것보다 서로 비슷한 개념을 비교하면서 관계를 이해하는 것이 중요합니다.
DIKW를 공부할 때는 Data·Information·Knowledge·Wisdom을 따로 외우지 말고 데이터가 어떻게 지식과 판단으로 발전하는지를 하나의 흐름으로 이해합니다.
SECI 역시 네 용어만 외우기보다는:
암묵지
↓
형식지
↓
다시 개인의 경험과 지식이라는 지식 순환 구조로 이해하는 것이 좋습니다.
데이터웨어하우스를 공부할 때는 OLTP와 OLAP를 함께 비교하고, Hadoop을 공부할 때는 HDFS·MapReduce·YARN의 역할을 연결해서 봅니다.
데이터 시각화 역시 Chart 이름을 외우는 것보다:
분포인가?
비교인가?
관계인가?
시간 변화인가?
구성비인가?를 먼저 판단하는 방식이 훨씬 이해하기 쉽습니다.
결국 ADsP 1과목의 핵심은 수많은 용어를 따로 암기하는 것이 아니라 비슷한 개념 사이의 경계를 정확하게 구분하는 것입니다. 이 페이지의 비교표와 핵심 암기 부분을 반복해서 확인하면 1과목 전체 구조를 빠르게 복습하는 데 활용할 수 있습니다.