텍스트 마이닝이란 무엇인가?
텍스트 마이닝(Text Mining)은 텍스트 분석(Text Analysis)이라고도 불리며, 비정형화된 텍스트 데이터를 구조화된 데이터로 변환하여 손쉽게 분석할 수 있도록 만드는 과정을 의미합니다.
텍스트 마이닝은 자연어 처리(NLP, Natural Language Processing) 기술을 활용하여 기계가 인간의 언어를 이해하고 자동으로 처리할 수 있게 해줍니다. 즉, 일상 언어로 작성된 텍스트로부터 의미 있는 정보를 추출하는 절차라고 정의할 수 있습니다.
문자 메시지, 기록물, 이메일, 각종 문서 파일 등 우리 주변에는 방대한 양의 일반 언어 텍스트 데이터가 존재하며, 텍스트 마이닝은 이러한 데이터로부터 유용한 인사이트나 패턴을 도출하는 데 널리 활용됩니다.
데이터 마이닝에서 텍스트 마이닝의 주요 영역
데이터 마이닝 관점에서 텍스트 마이닝은 다음과 같은 네 가지 핵심 영역으로 나눌 수 있습니다.
1. 정보 검색(Information Retrieval)
정보 검색(IR)은 문서 검색(Document Retrieval)의 확장 개념으로, 선언된 텍스트들을 처리하여 통합하는 작업을 포함합니다. 따라서 문서 검색 이후에는 텍스트 요약 절차가 뒤따르며, 사용자가 작성한 질의(Query)를 중심으로 결과를 제공합니다.
IR 시스템은 특정 문제와 관련된 문서 집합의 범위를 좁혀주는 역할을 합니다. 텍스트 마이닝은 매우 복잡한 알고리즘을 사용해 대규모 문서 컬렉션을 처리하며, 정보 검색은 분석 대상 문서의 수를 줄임으로써 전체 분석 속도를 크게 향상시킬 수 있습니다.
2. 데이터 마이닝(Data Mining)
데이터 마이닝은 저장소에 축적된 대량의 데이터를 탐색하여 유용한 새로운 상관관계, 패턴, 추세를 발견하는 과정입니다. 이때 통계 및 수학적 기법을 포함한 패턴 인식 기술이 활용됩니다.
핵심은 사실적인 데이터셋을 분석하여 예상치 못한 관계성을 발견하고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 기록을 요약하는 것입니다.
데이터 마이닝에서는 숨겨진 데이터 패턴을 여러 범주에 따라 분류하여 유용한 정보로 재구성합니다. 이렇게 정제된 데이터는 데이터 웨어하우스 같은 공간에 모아 분석되며, 데이터 마이닝 알고리즘이 적용됩니다. 그 결과 비용을 절감하고 수익을 증대시키는 효과적인 의사결정을 내리는 데 큰 도움이 됩니다.
3. 자연어 처리(Natural Language Processing, NLP)
자연어 처리는 인간의 언어를 다루는 기술입니다. 텍스트 마이닝에서 NLP의 목적은 데이터 추출 과정에서 시스템에 입력값을 제공하는 것입니다.
다만 NLP 애플리케이션을 개발하는 일은 결코 쉽지 않습니다. 컴퓨터는 일반적으로 특정하고, 자유롭고, 매우 구조화된 프로그래밍 언어로 사람이 '말걸기'를 기다리기 때문입니다. 반면 인간의 언어는 은어, 사회적 맥락, 지역 방언 등 수많은 복합 변수에 따라 달라지므로 형식적이지 않은 경우가 많습니다.
4. 정보 추출(Information Extraction, IE)
정보 추출(IE)은 비정형 데이터로부터 구조화된 데이터를 자동으로 추출하는 작업입니다. 일반적인 경우 이 작업은 NLP를 활용하여 인간 언어 텍스트를 처리하는 방식으로 수행됩니다.
예를 들어 뉴스 기사에서 인물, 조직, 날짜, 장소 같은 개체명을 자동으로 식별해 내는 것이 대표적인 정보 추출의 사례입니다. 이를 통해 방대한 텍스트 속에서 필요한 정보만 체계적으로 뽑아낼 수 있습니다.
마무리
텍스트 마이닝은 정보 검색, 데이터 마이닝, 자연어 처리, 정보 추출이라는 네 가지 핵심 영역이 유기적으로 결합되어 강력한 분석 도구로 자리 잡았습니다. 비정형 텍스트 데이터가 폭발적으로 증가하는 오늘날, 이러한 기술들을 이해하고 활용하는 것은 데이터 기반 의사결정의 필수 요소라고 할 수 있습니다.