텍스트 마이닝이란? 형태소 분석·TF-IDF·BOW·LDA·감성 분석 쉽게 이해하기

1장 텍스트 마이닝이란 무엇인가#

텍스트 마이닝 Text Mining은 비정형 텍스트 데이터에서 패턴, 관계, 의미 있는 정보를 추출하는 데이터 마이닝 기법입니다.

데이터 분석이라고 하면 숫자로 정리된 표를 먼저 떠올리기 쉽습니다.

하지만 현실에는 숫자보다 훨씬 많은 텍스트 데이터가 존재합니다.

예를 들어:

  • 고객 리뷰
  • 뉴스 기사
  • 이메일
  • SNS 게시글
  • 상담 기록
  • 게시판 글
  • 챗봇 대화

등이 있습니다.

이런 데이터는 표의 숫자처럼 바로 계산하기 어렵기 때문에 먼저 텍스트를 분석 가능한 형태로 변환해야 합니다.

핵심#

Text Mining = 비정형 텍스트에서 유용한 정보 추출

입니다.


2장 텍스트 마이닝은 어디에 활용되는가#

제공된 학습자료에서는 다음 활용 분야를 제시합니다.

  • 감성 분석
  • 문서 분류
  • 정보 추출
  • 챗봇

예를 들어 쇼핑몰 리뷰를 분석해:

고객이 이 상품을 긍정적으로 평가하는가?

를 판단할 수 있습니다.

뉴스 기사를 분석해:

경제 기사인가, 스포츠 기사인가?

처럼 문서를 자동 분류할 수도 있습니다.


3장 텍스트 데이터는 왜 전처리가 필요한가#

사람은 문장을 읽고 뜻을 이해할 수 있지만 컴퓨터는 문장을 그대로 이해하지 못합니다.

예를 들어:

이 제품은 정말 좋고 배송도 빨라서 만족합니다.

라는 문장을 컴퓨터가 분석하려면:

  • 어떤 단어가 있는지
  • 어떤 단어가 중요한지
  • 불필요한 표현은 무엇인지
  • 각 단어를 숫자로 어떻게 바꿀지

정리해야 합니다.

그래서 텍스트 마이닝에서는 텍스트 전처리가 매우 중요합니다.


4장 텍스트 마이닝의 주요 과정#

제공된 학습자료에서는 텍스트 마이닝의 주요 흐름을 다음과 같이 설명합니다.

형태소 분석

↓

불용어 제거

↓

벡터화

↓

분석

그리고 시험에서 더 세부적인 전처리 순서는 다음과 같이 제시합니다.

토큰화

↓

불용어 제거

↓

어간추출 또는 표제어화

↓

벡터화

이 순서는 ADsP에서 자주 출제되는 부분입니다.


5장 토큰화 Tokenization이란 무엇인가#

토큰화는 텍스트를 단어 또는 문장 단위로 분리하는 과정입니다.

예를 들어:

나는 데이터 분석을 공부한다.

라는 문장을 단어 단위로 나누면:

  • 나는
  • 데이터
  • 분석을
  • 공부한다

처럼 분리할 수 있습니다.

이렇게 텍스트를 작은 단위로 나눈 각각을 토큰 Token이라고 합니다.

핵심#

Tokenization = 텍스트를 단위별로 나누기

입니다.


6장 형태소 분석이란 무엇인가#

형태소 분석은 텍스트를 의미를 가진 최소 단위인 형태소로 분리하는 과정입니다.

특히 한국어는 조사와 어미가 결합되는 경우가 많기 때문에 단순히 공백만 기준으로 단어를 나누는 것만으로는 충분하지 않을 수 있습니다.

예를 들어:

학생들이 공부한다.

라는 문장에서:

학생

들

이

공부

한다

처럼 더 작은 의미 단위로 분석할 수 있습니다.

핵심#

형태소 분석 = 의미를 가진 최소 단위로 분리

입니다.


7장 한국어 형태소 분석 도구#

제공된 학습자료에서는 한국어 형태소 분석 도구의 예로 다음을 제시합니다.

  • KoNLP
  • MeCab

이러한 도구를 이용하면 한국어 문장을 형태소 단위로 분석할 수 있습니다.

ADsP에서는 도구의 세부 사용법보다:

형태소 분석 = 텍스트를 최소 의미 단위로 분리

라는 개념이 중요합니다.


8장 불용어 Stopword란 무엇인가#

불용어 Stopword는 분석에 큰 도움이 되지 않는 단어입니다.

제공된 학습자료에서는 대표적으로:

  • 조사
  • 접속사

등을 불용어로 설명합니다.

예를 들어:

  • 은
  • 는
  • 이
  • 가
  • 그리고
  • 그러나

같은 단어들이 문맥에 따라 분석에서 제거 대상이 될 수 있습니다.

핵심#

Stopword = 분석에 불필요한 단어

입니다.


9장 불용어를 왜 제거하는가#

텍스트 안에 자주 등장한다고 해서 모두 중요한 단어는 아닙니다.

예를 들어:

이 상품은 배송이 빠르고 품질도 좋다.

라는 문장에서:

이

은

이

도

같은 단어는 문법적으로 필요하지만 상품의 특징을 파악하는 데는 상대적으로 중요도가 낮을 수 있습니다.

반면:

배송

빠르다

품질

좋다

같은 단어는 분석에 더 유용할 수 있습니다.

따라서 불필요한 단어를 제거하면 중요한 정보에 더 집중할 수 있습니다.


10장 어간추출 Stemming이란 무엇인가#

어간추출은 단어에서 변화하는 부분을 제거해 공통된 어간 형태로 단순화하는 과정입니다.

예를 들어:

  • 먹는다
  • 먹었다
  • 먹고

같은 표현을 공통된 형태로 묶어 처리할 수 있습니다.

핵심은 여러 형태로 변형된 단어를 비슷한 형태로 통합하는 것입니다.


11장 표제어화 Lemmatization이란 무엇인가#

표제어화는 단어를 사전에 등록된 기본형 형태로 변환하는 방식입니다.

시험에서는 제공된 학습자료 기준으로 어간추출과 함께 다음 단계로 묶어 기억하면 됩니다.

어간추출/표제어화

→ 단어를 기본형으로 변환

입니다.


12장 벡터화 Vectorization이란 무엇인가#

컴퓨터가 텍스트를 분석하려면 결국 텍스트를 숫자로 표현해야 합니다.

이 과정을 벡터화 Vectorization이라고 합니다.

대표적인 방법으로 제공된 학습자료에서는:

  • BOW
  • TF-IDF

를 제시합니다.

핵심#

Vectorization = 텍스트를 수치 벡터로 변환

입니다.


13장 텍스트 전처리 순서#

ADsP에서 매우 중요한 순서 문제입니다.

제공된 학습자료에서는 다음 순서를 제시합니다.

1단계#

토큰화 Tokenization

2단계#

불용어 제거 Stopword Removal

3단계#

어간추출 또는 표제어화 Stemming/Lemmatization

4단계#

벡터화 Vectorization

즉:

토큰화 → 불용어 제거 → 어간추출 → 벡터화

입니다.


14장 전처리 순서를 쉽게 기억하면#

텍스트를 분석한다고 생각해봅시다.

먼저:

쪼갠다

→ 토큰화

그다음:

쓸모없는 것을 버린다

→ 불용어 제거

그다음:

단어 형태를 정리한다

→ 어간추출·표제어화

마지막으로:

숫자로 바꾼다

→ 벡터화

입니다.

한 줄로:

쪼개고 → 버리고 → 정리하고 → 숫자로 바꾼다

고 기억하면 됩니다.


15장 TF란 무엇인가#

TF는 Term Frequency, 단어빈도입니다.

특정 문서 안에서 어떤 단어가 얼마나 자주 등장하는지 나타냅니다.

예를 들어 한 문서에서:

데이터 → 10회

AI → 3회

분석 → 7회

등으로 등장한다면 "데이터"라는 단어의 TF가 상대적으로 높습니다.

핵심#

TF = 문서 안에서 많이 나오면 높음

입니다.


16장 IDF란 무엇인가#

IDF는 Inverse Document Frequency, 역문서빈도입니다.

제공된 학습자료의 공식은:

log(전체 문서 수 / 해당 단어를 포함한 문서 수)

입니다.

핵심은 전체 문서에서 너무 흔하게 등장하는 단어는 중요도를 낮게 평가한다는 것입니다.

핵심#

IDF = 여러 문서에 흔할수록 낮음

입니다.


17장 IDF가 왜 필요한가#

단순히 TF만 사용하면 어떤 문제가 생길까요?

예를 들어 대부분의 문서에:

  • 이
  • 은
  • the

같은 단어가 매우 자주 등장할 수 있습니다.

빈도만 보면 중요한 단어처럼 보이지만 실제로는 대부분의 문서에 나타나는 흔한 단어라 문서를 구분하는 데 도움이 적습니다.

IDF는 이런 흔한 단어의 중요도를 낮춰줍니다.


18장 IDF가 낮다는 것은 무엇인가#

제공된 학습자료의 핵심입니다.

IDF가 낮다

는 것은:

많은 문서에 등장하는 흔한 단어

라는 의미입니다.

예를 들어:

"the"

"이"

"은"

같은 단어는 여러 문서에 자주 등장할 수 있습니다.

따라서 문서를 구분하는 데 상대적으로 중요한 정보가 적습니다.

핵심#

흔한 단어 → IDF 낮음

입니다.


19장 TF-IDF란 무엇인가#

TF-IDF는 Term Frequency-Inverse Document Frequency, 단어빈도-역문서빈도입니다.

공식은 매우 간단합니다.

TF-IDF = TF × IDF

즉:

문서 안에서 자주 등장하면서

다른 문서에서는 흔하지 않은 단어

의 값을 높게 평가합니다.

핵심#

TF-IDF = 단어 중요도 측정

입니다.


20장 TF-IDF가 높은 단어는 어떤 단어인가#

높은 TF-IDF 값을 가지려면 두 조건이 중요합니다.

첫째#

해당 문서 안에서 자주 등장

→ TF 높음

둘째#

전체 문서에서는 흔하지 않음

→ IDF 높음

예를 들어 머신러닝 관련 문서에서:

"머신러닝"

이라는 단어가 많이 등장하면서 다른 분야 문서에는 거의 등장하지 않는다면 TF-IDF 값이 높아질 수 있습니다.


21장 TF-IDF를 쉽게 이해하면#

TF-IDF는 다음 질문에 답하는 지표라고 생각하면 쉽습니다.

이 단어가 이 문서에서는 자주 나오는데 다른 문서에서는 보기 드문가?

그렇다면 그 단어는 해당 문서를 대표하는 중요한 단어일 가능성이 높습니다.

반대로:

모든 문서에서 늘 나오는 단어인가?

라면 IDF가 낮아져 TF-IDF도 낮아질 수 있습니다.


22장 TF·IDF·TF-IDF 비교#

지표 의미 특징
TF 문서 내 단어빈도 많이 등장할수록 높음
IDF 역문서빈도 많은 문서에 등장할수록 낮음
TF-IDF TF × IDF 문서를 대표하는 중요 단어일수록 높음

시험에서는 특히:

IDF는 흔한 단어일수록 낮다

라는 문장을 기억해야 합니다.


23장 TF-IDF 시험 함정#

다음 문장을 주의합니다.

어떤 단어가 많은 문서에 등장할수록 IDF는 커진다.

틀립니다.

제공된 학습자료 기준:

많은 문서에 등장 → IDF 낮음

입니다.

또:

TF-IDF는 단어 순서를 분석하는 기법이다.

도 틀린 설명입니다.

TF-IDF는 단어의 중요도를 수치화하는 방법입니다.


24장 BOW Bag of Words란 무엇인가#

BOW는 Bag of Words의 약자입니다.

문서를 단어들의 집합으로 표현하는 방법입니다.

핵심 특징은:

단어의 순서를 무시하고 단어의 빈도만 고려

한다는 것입니다.

핵심#

BOW = 순서 무시 + 단어 빈도

입니다.


25장 BOW를 쉽게 이해하면#

다음 두 문장이 있다고 하겠습니다.

문장 A:

나는 사과를 좋아한다.

문장 B:

사과를 나는 좋아한다.

두 문장은 단어 순서가 조금 다르지만 포함된 단어는 비슷합니다.

BOW에서는 단어의 순서보다는:

  • 나는 몇 번?
  • 사과 몇 번?
  • 좋아한다 몇 번?

처럼 각 단어가 등장한 횟수에 초점을 둡니다.


26장 BOW의 장점#

제공된 학습자료에서는 BOW의 장점으로:

단순하고 구현이 쉬움

을 제시합니다.

문서 안에서 각 단어의 등장 횟수를 세는 방식이기 때문에 구조가 단순합니다.

따라서 텍스트를 기본적인 숫자 데이터로 변환하기 쉽습니다.


27장 BOW의 단점#

BOW의 가장 큰 단점은:

단어 순서와 문맥을 무시

한다는 것입니다.

예를 들어:

나는 이 영화를 좋아한다.

와:

나는 이 영화를 좋아하지 않는다.

는 의미가 다릅니다.

하지만 단어 빈도만 단순하게 보면 문장의 세밀한 의미를 충분히 표현하기 어려울 수 있습니다.

핵심#

BOW = 쉽지만 문맥 손실

입니다.


28장 DTM이란 무엇인가#

DTM은 Document-Term Matrix, 문서-단어 행렬입니다.

제공된 학습자료에서는:

BOW의 대표적인 구현

으로 설명합니다.

예를 들어 문서가 3개 있고 단어가:

  • 데이터
  • 분석
  • AI

라고 하겠습니다.

각 문서에서 단어가 몇 번 등장했는지 행렬 형태로 표현할 수 있습니다.

문서 데이터 분석 AI
문서1 3 2 1
문서2 0 1 4
문서3 2 0 1

이런 구조가 DTM입니다.


29장 BOW와 DTM의 관계#

BOW는 문서를 단어의 빈도로 표현하는 개념입니다.

DTM은 그 결과를 여러 문서에 대해 행렬 형태로 정리한 대표적인 구현 방식입니다.

따라서:

BOW → 단어 빈도 표현

DTM → 문서×단어 행렬

로 연결하면 됩니다.


30장 LDA란 무엇인가#

LDA는 Latent Dirichlet Allocation입니다.

제공된 학습자료에서는:

토픽 모델링 Topic Modeling의 대표적인 기법

으로 설명합니다.

LDA는 여러 문서를 분석하여 문서 집합 안에 숨어 있는 공통 주제 Topic를 자동으로 찾습니다.

핵심#

LDA = 토픽 모델링

입니다.


31장 토픽 모델링이란 무엇인가#

토픽 모델링은 많은 문서들을 보고:

이 문서들에는 어떤 주제가 숨어 있는가?

를 찾는 방법입니다.

예를 들어 수천 개 뉴스 기사를 분석했더니 다음과 같은 단어들이 함께 자주 나타난다고 하겠습니다.

토픽 1:

주가, 증시, 금리, 투자

토픽 2:

축구, 선수, 경기, 감독

토픽 3:

AI, 모델, 데이터, 알고리즘

이런 단어 패턴을 이용해 각각:

경제

스포츠

AI

같은 숨은 주제를 찾을 수 있습니다.


32장 LDA에서 문서는 하나의 토픽만 가지는가#

아닙니다.

제공된 학습자료에서는:

각 문서는 여러 토픽의 혼합으로 구성

된다고 설명합니다.

예를 들어 어떤 기사가:

경제 60%

정치 30%

사회 10%

처럼 여러 토픽을 함께 가질 수 있습니다.

핵심#

문서 = 여러 토픽의 혼합

입니다.


33장 LDA에서 토픽은 어떻게 표현되는가#

제공된 학습자료에서는:

각 토픽은 여러 단어의 확률 분포로 표현

된다고 설명합니다.

예를 들어 경제 토픽에서는:

금리 → 높은 확률

주가 → 높은 확률

투자 → 높은 확률

축구 → 낮은 확률

처럼 단어별 확률을 가질 수 있습니다.

즉:

토픽 = 단어들의 확률 분포

입니다.


34장 LDA는 지도학습인가#

아닙니다.

ADsP에서 매우 중요한 함정입니다.

제공된 학습자료에서는 LDA를:

비지도 학습

으로 설명합니다.

미리:

경제

스포츠

IT

라는 정답을 붙여주는 방식이 아니라 문서 내부의 단어 패턴을 이용해 숨은 토픽을 찾기 때문입니다.

핵심#

LDA = 비지도 학습

입니다.


35장 LDA의 K는 무엇인가#

LDA에서는 찾을 토픽 수를 K라고 표현할 수 있습니다.

제공된 학습자료에서 중요한 점은:

토픽 수 K는 사용자가 사전에 지정

한다는 것입니다.

알고리즘이 아무 설정 없이 자동으로 토픽 개수를 정하는 것으로 이해하면 안 됩니다.

핵심#

LDA K = 사용자가 설정

입니다.


36장 K-means의 K와 LDA의 K#

앞에서 K-means에서도 K가 등장했습니다.

K-means#

K = 군집 수

LDA#

K = 토픽 수

두 경우 모두 제공된 학습자료에서는 사용자가 사전에 설정하는 값으로 설명합니다.

하지만 의미는 다릅니다.

K-means → 군집 개수

LDA → 토픽 개수

입니다.


37장 LDA 시험 함정#

다음 문장을 주의합니다.

LDA는 정답 레이블을 이용하는 대표적인 지도학습 알고리즘이다.

틀립니다.

비지도 학습입니다.

또:

LDA의 토픽 수는 알고리즘이 반드시 자동으로 결정한다.

도 틀립니다.

제공된 학습자료에서는:

사용자가 K를 설정

합니다.


38장 감성 분석 Sentiment Analysis이란 무엇인가#

감성 분석은 텍스트에서 표현되는 감정이나 의견의 방향을 분류하는 기법입니다.

제공된 학습자료에서는 다음 세 가지를 제시합니다.

  • 긍정
  • 부정
  • 중립

예를 들어 상품 리뷰를 자동으로 분석하여 고객 반응을 파악할 수 있습니다.


39장 감성 분석 사례#

상품 리뷰가 다음과 같다고 하겠습니다.

배송이 빠르고 제품도 아주 만족스럽습니다.

→ 긍정

품질이 너무 나쁘고 다시 사고 싶지 않습니다.

→ 부정

제품을 오늘 받았습니다.

→ 중립

처럼 텍스트에서 감정을 분류할 수 있습니다.


40장 감성 분석 활용 분야#

제공된 학습자료에서는 대표적인 활용 사례로:

  • 상품 리뷰 분석
  • SNS 여론 분석

을 제시합니다.

기업은 수많은 고객 의견을 사람이 하나씩 읽지 않고 텍스트 분석을 통해 전체적인 긍정·부정 반응을 파악할 수 있습니다.


41장 나이브 베이즈와 감성 분석 연결#

앞에서 나이브 베이즈의 활용 분야로도 감성 분석이 등장했습니다.

텍스트 마이닝에서는 감성 분석이라는 분석 목적이 있고, 나이브 베이즈 같은 분류 알고리즘을 그 목적에 활용할 수 있습니다.

따라서:

감성 분석 = 문제·활용 분야

Naive Bayes = 사용할 수 있는 분류 알고리즘

처럼 구분해 이해하면 좋습니다.


42장 텍스트 마이닝과 데이터 마이닝의 관계#

텍스트 마이닝은 데이터 마이닝의 한 영역입니다.

일반적인 데이터 마이닝이 다양한 구조화 데이터를 분석한다면 텍스트 마이닝은 특히:

비정형 텍스트 데이터

를 대상으로 합니다.

따라서 시험에서:

텍스트 마이닝은 정형 숫자 데이터만 분석한다.

라고 나오면 틀립니다.


43장 ADsP 시험 함정 1#

텍스트 마이닝은 비정형 텍스트에서 정보를 추출한다.

맞습니다.

제공된 학습자료의 핵심 정의입니다.


44장 ADsP 시험 함정 2#

불용어는 분석에서 반드시 중요한 핵심 단어이므로 유지해야 한다.

틀립니다.

제공된 학습자료에서는 조사·접속사 등 분석에 불필요한 단어로 제거 대상이라고 설명합니다.


45장 ADsP 시험 함정 3#

TF는 전체 문서 중 특정 단어가 등장한 문서 비율이다.

틀립니다.

TF는 하나의 문서 안에서 특정 단어가 등장하는 빈도입니다.


46장 ADsP 시험 함정 4#

IDF는 여러 문서에 자주 등장하는 단어일수록 높아진다.

틀립니다.

반대입니다.

많은 문서에 등장 → IDF 낮음

입니다.


47장 ADsP 시험 함정 5#

TF-IDF는 TF와 IDF를 더해서 계산한다.

틀립니다.

제공된 학습자료에서는:

TF-IDF = TF × IDF

입니다.


48장 ADsP 시험 함정 6#

BOW는 문장 안에서 단어의 순서를 중요하게 고려한다.

틀립니다.

BOW는:

단어 순서 무시

단어 빈도 중심

입니다.


49장 ADsP 시험 함정 7#

DTM은 의사결정나무의 한 종류다.

틀립니다.

DTM은 문서-단어 행렬이며 BOW의 대표적인 구현입니다.


50장 ADsP 시험 함정 8#

LDA는 지도학습이다.

틀립니다.

비지도 학습입니다.


51장 ADsP 시험 함정 9#

LDA에서 토픽 수 K는 항상 자동 결정된다.

틀립니다.

제공된 학습자료에서는 사용자가 사전에 설정합니다.


52장 ADsP 시험 함정 10#

LDA에서 하나의 문서는 반드시 하나의 토픽만 가진다.

틀립니다.

제공된 학습자료에서는:

각 문서는 여러 토픽의 혼합

이라고 설명합니다.


53장 ADsP 시험 함정 11#

감성 분석은 텍스트의 긍정·부정·중립을 분류할 수 없다.

틀립니다.

제공된 학습자료에서는 바로 이러한 분류를 감성 분석으로 설명합니다.


54장 전처리 순서 시험 직전 암기#

반드시 순서를 기억합니다.

1. 토큰화

↓

2. 불용어 제거

↓

3. 어간추출·표제어화

↓

4. 벡터화

암기:

토·불·어·벡

입니다.


55장 TF-IDF 시험 직전 암기#

TF#

문서 내 단어빈도

→ 많이 나오면 높음

IDF#

역문서빈도

→ 여러 문서에 나오면 낮음

TF-IDF#

TF × IDF

→ 중요한 단어일수록 높음

한 줄로:

문서에서는 자주, 전체에서는 드물게 → 중요

입니다.


56장 BOW 시험 직전 암기#

BOW = Bag of Words

→ 문서를 단어 집합으로 표현

→ 단어 순서 무시

→ 빈도 중심

장점:

단순하고 구현 쉬움

단점:

순서·문맥 무시

그리고 대표 구현:

DTM

입니다.


57장 LDA 시험 직전 암기#

LDA = 토픽 모델링

→ 비지도 학습

→ 문서 = 여러 토픽 혼합

→ 토픽 = 여러 단어의 확률 분포

→ 토픽 수 K는 사용자가 설정

한 줄로:

LDA = 비지도 + 토픽 + K 직접 설정

입니다.


58장 감성 분석 시험 직전 암기#

Sentiment Analysis

→ 긍정

→ 부정

→ 중립

대표 활용:

상품 리뷰

SNS 여론

입니다.


59장 텍스트 마이닝 핵심 비교표#

개념 핵심
Text Mining 비정형 텍스트에서 정보 추출
Tokenization 텍스트 분리
형태소 분석 최소 의미 단위로 분리
Stopword 불필요한 단어
Stemming/Lemmatization 기본형 변환
Vectorization 텍스트를 숫자로 변환
TF 문서 내 단어빈도
IDF 많은 문서 등장 시 낮음
TF-IDF TF × IDF
BOW 순서 무시, 빈도 중심
DTM 문서-단어 행렬
LDA 비지도 토픽 모델링
LDA의 K 사용자가 설정
Sentiment Analysis 긍정·부정·중립 분류

텍스트 마이닝 FAQ#

텍스트 마이닝이란 무엇인가#

비정형 텍스트 데이터에서 패턴, 관계, 의미 있는 정보를 추출하는 데이터 마이닝 기법입니다.

텍스트 마이닝의 대표 활용 분야는 무엇인가#

제공된 학습자료에서는 감성 분석, 문서 분류, 정보 추출, 챗봇을 제시합니다.

형태소 분석이란 무엇인가#

텍스트를 의미를 가진 최소 단위인 형태소로 나누는 과정입니다.

한국어 형태소 분석 도구에는 무엇이 있는가#

제공된 학습자료에서는 KoNLP와 MeCab 등을 예로 제시합니다.

불용어란 무엇인가#

조사나 접속사처럼 분석에 불필요한 단어입니다.

텍스트 전처리 순서는 무엇인가#

토큰화 → 불용어 제거 → 어간추출·표제어화 → 벡터화

입니다.

TF란 무엇인가#

하나의 문서에서 특정 단어가 등장하는 빈도입니다.

IDF란 무엇인가#

특정 단어가 전체 문서에서 얼마나 드문지를 반영하는 역문서빈도입니다.

많은 문서에 등장하는 단어의 IDF는 높은가#

아닙니다. 제공된 학습자료에서는 낮다고 설명합니다.

TF-IDF 공식은 무엇인가#

TF × IDF

입니다.

BOW란 무엇인가#

문서를 단어의 집합으로 표현하면서 단어 순서를 무시하고 빈도만 고려하는 방식입니다.

DTM은 무엇인가#

Document-Term Matrix, 즉 문서-단어 행렬이며 BOW의 대표적인 구현입니다.

LDA란 무엇인가#

문서 집합에서 공통된 숨은 주제를 추출하는 대표적인 토픽 모델링 기법입니다.

LDA는 지도학습인가#

아닙니다. 비지도 학습입니다.

LDA의 토픽 수는 누가 정하는가#

제공된 학습자료에서는 사용자가 사전에 K를 지정한다고 설명합니다.

LDA에서 문서는 하나의 토픽만 가지는가#

아닙니다. 여러 토픽의 혼합으로 구성됩니다.

감성 분석이란 무엇인가#

텍스트에서 긍정·부정·중립과 같은 감정을 분류하는 기법입니다.


자기 점검#

다음 질문에 바로 답할 수 있는지 확인해봅니다.

  1. 텍스트 마이닝의 정의를 설명할 수 있는가?
  2. 비정형 텍스트가 무엇인지 알고 있는가?
  3. 형태소 분석이 무엇인지 설명할 수 있는가?
  4. 불용어가 왜 제거 대상인지 알고 있는가?
  5. 텍스트 전처리 순서를 정확히 말할 수 있는가?
  6. 토큰화와 형태소 분석의 역할을 구분할 수 있는가?
  7. 벡터화가 무엇인지 설명할 수 있는가?
  8. TF의 의미를 알고 있는가?
  9. IDF가 흔한 단어일수록 낮아진다는 것을 알고 있는가?
  10. TF-IDF 공식을 기억하고 있는가?
  11. BOW가 단어 순서를 무시한다는 것을 알고 있는가?
  12. DTM이 무엇인지 설명할 수 있는가?
  13. LDA가 토픽 모델링이라는 것을 알고 있는가?
  14. LDA가 비지도학습이라는 것을 알고 있는가?
  15. LDA의 K를 사용자가 지정한다는 것을 알고 있는가?
  16. 문서가 여러 토픽의 혼합이라는 것을 이해하고 있는가?
  17. 감성 분석이 긍정·부정·중립을 분류한다는 것을 알고 있는가?

이 글을 마치며#

텍스트 마이닝은 비정형 텍스트 데이터를 분석 가능한 정보로 바꾸는 과정입니다.

가장 먼저 기억해야 할 것은 전처리 순서입니다.

토큰화

↓

불용어 제거

↓

어간추출·표제어화

↓

벡터화

입니다.

텍스트를 숫자로 바꾸는 대표적인 방법으로 BOW와 TF-IDF를 사용할 수 있습니다.

TF-IDF에서는:

TF = 문서 안에서 얼마나 자주 등장하는가

IDF = 전체 문서에서 얼마나 드문가

를 봅니다.

따라서:

TF-IDF = TF × IDF

이며 여러 문서에 흔하게 등장하는 단어일수록 IDF는 낮아집니다.

BOW는:

단어 순서를 무시하고 빈도만 고려

하며 DTM은 이를 문서-단어 행렬로 표현한 대표적인 방식입니다.

LDA는:

비지도 토픽 모델링

으로:

문서는 여러 토픽의 혼합

토픽은 여러 단어의 확률 분포

로 표현되며 토픽 수 K는 사용자가 설정합니다.

시험 직전에는 다음 다섯 줄로 압축해서 기억하면 됩니다.

Text Mining = 비정형 텍스트에서 정보 추출

전처리 = 토큰화 → 불용어 → 어간·표제어 → 벡터화

TF-IDF = TF × IDF / 흔한 단어는 IDF 낮음

BOW = 순서 무시·빈도 중심 / DTM = 문서-단어 행렬

LDA = 비지도 토픽 모델링 / K는 사용자가 지정

이 페이지의 목차