텍스트 마이닝이란 무엇인가?
텍스트 마이닝(Text Mining)은 '텍스트 분석(Text Analysis)'이라고도 불리며, 비정형 텍스트를 누구나 쉽게 분석할 수 있는 정형 데이터로 변환하는 일련의 과정을 말합니다. 텍스트 마이닝은 자연어 처리(NLP, Natural Language Processing) 기술을 활용하여 기계가 인간의 언어를 이해하고 이를 자동으로 처리할 수 있도록 만듭니다.
쉽게 말해 텍스트 마이닝은 일상 언어로 작성된 텍스트에서 핵심 정보를 추출하는 기술입니다. 문자 메시지, 기록물, 이메일, 각종 문서처럼 일반 언어로 작성된 데이터로부터 유용한 인사이트나 패턴을 도출하는 데 널리 활용됩니다.
텍스트 마이닝은 자연어 처리를 기반으로 비정형 텍스트에서 가치 있는 통찰을 자동으로 끌어내는 방법론입니다. 데이터를 기계가 학습할 수 있는 정보 형태로 변환함으로써, 텍스트를 감성(sentiment), 주제(topic), 의도(intent)별로 구분하는 작업까지 자동화할 수 있습니다.
텍스트 마이닝의 두 가지 전처리 방법
텍스트 마이닝에는 크게 필터링(Filtering)과 어간 추출(Stemming) 두 가지 방법이 사용됩니다. 필터링은 불필요한 단어나 분석과 관련 없는 데이터를 제거하는 작업이며, 어간 추출은 서로 연관된 단어들을 어근(root) 형태로 통합하여, 처리 후 각 단어가 고유한 어근 노드로 정의되도록 하는 기법입니다.
텍스트 마이닝의 주요 목표
텍스트 마이닝의 궁극적인 목표는 사용자가 텍스트 기반 자산에서 정보를 효율적으로 추출할 수 있도록 돕는 것입니다. 대표적인 처리 작업은 다음과 같습니다.
- 검색(Retrieval) − 필요한 문서나 정보를 찾아내는 작업
- 추출(Extraction) − 텍스트에서 핵심 정보를 뽑아내는 작업
- 요약(Summarization) − 방대한 문서의 핵심 내용을 압축하는 작업
- 분류(Categorization, 지도학습) − 사전에 정의된 범주에 따라 텍스트를 나누는 작업
- 군집화(Clustering, 비지도학습) − 유사한 특성을 가진 텍스트끼리 그룹화하는 작업
- 세그먼테이션(Segmentation) 및 연관 분석(Association)
텍스트 마이닝이 필요한 이유
기업들이 텍스트 마이닝을 적극적으로 도입하는 가장 큰 이유는 날로 치열해지는 비즈니스 경쟁입니다. 많은 조직이 경쟁사보다 우위를 점하기 위해 부가가치 솔루션을 찾고 있으며, 시장 경쟁이 심화되고 고객의 니즈가 빠르게 변화함에 따라, 고객 데이터와 경쟁사 데이터를 분석해 경쟁력을 강화할 수 있는 솔루션에 막대한 투자를 진행하고 있습니다.
또한 텍스트 데이터는 비정형이고 다루기 어려우며 모호성이 커서, 일반적인 데이터 마이닝만으로는 충분한 분석이 어렵습니다. 이런 이유로 텍스트 데이터의 교환과 분석에는 텍스트 마이닝이 가장 효과적인 방법으로 꼽힙니다. 데이터 마이닝이 주로 정형화된 비즈니스 데이터에 적용된다면, 텍스트 마이닝은 방대한 텍스트 자료를 다루는 데 최적화되어 있습니다.
경제, 학술, 사회 활동을 통해 매일 방대한 양의 새로운 기록과 데이터가 생성되고 있으며, 그중 상당수는 상당한 경제적·사회적 잠재 가치를 지니고 있습니다. 이러한 잠재력을 실현하려면 텍스트·데이터 마이닝과 분석 기법이 반드시 필요합니다. 이 방법론의 목표는 방대한 텍스트 문서 집합에서 데이터를 확보하는 데 드는 노력과 비용을 최소화하는 것입니다.
데이터의 세 가지 유형
- 정형 데이터(Structured Data) − SQL 데이터베이스의 행(row)과 열(column)로 구성된 테이블에 저장할 수 있는 모든 기록을 의미합니다. 관계형 키(relational key)를 가지며 사전에 설계된 필드에 손쉽게 매핑할 수 있습니다. 현재 가장 널리 처리되는 데이터 유형으로, 정보를 관리하기가 가장 수월합니다.
- 반정형 데이터(Semi-structured Data) − 관계형 데이터베이스에는 속하지 않지만, 분석을 용이하게 만들어 주는 일정한 조직적 특징을 지닌 데이터입니다. 일부 처리 과정을 거치면 관계형 데이터베이스에 저장할 수도 있지만(데이터 유형에 따라 매우 까다로울 수 있음), 반정형 구조는 저장 공간 절약, 안정성 확보 또는 연산 효율을 위해 존재합니다.
- 비정형 데이터(Unstructured Data) − 전체 데이터의 약 80%를 차지하는 유형으로, 텍스트와 멀티미디어 콘텐츠를 포함합니다. 이메일, 워드 프로세싱 파일, 동영상, 사진, 오디오 파일, 프레젠테이션, 웹페이지, 각종 비즈니스 문서 등이 여기에 해당합니다.