데이터 마이닝이란 무엇인가?
데이터 마이닝(Data Mining)은 저장소에 축적된 방대한 데이터를 통계학적·수리적 기법 등 패턴 인식 기술로 분석하여, 유용한 새로운 상관관계·패턴·추세를 발견하는 단계입니다. 이는 사실에 기반한 데이터셋을 분석해 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 정보를 요약하는 작업입니다.
동시에 데이터 마이닝은 대량의 정보를 선택·탐색·모델링하여 처음에는 알려지지 않았던 규칙성이나 관계를 밝혀내고, 데이터베이스 소유자에게 명확하고 유익한 결과를 제공하는 절차이기도 합니다.
데이터 마이닝의 특징과 활용
데이터 마이닝은 데이터 과학(Data Science)과 유사한 개념으로, 특정 인물이 특정 상황에서 구체적인 목표를 가지고 특정 데이터셋을 대상으로 수행합니다. 텍스트 마이닝, 웹 마이닝, 오디오·비디오 마이닝, 기술(descriptive) 데이터 마이닝, 소셜 미디어 마이닝 등 다양한 유형의 기능이 포함되며, 단순한 소프트웨어부터 고도로 전문화된 솔루션까지 폭넓은 도구를 통해 진행됩니다.
데이터 마이닝을 외주에 맡기면 운영 비용을 낮추면서 작업 속도를 크게 높일 수 있습니다. 전문 업체는 최신 기술을 활용해 수작업으로는 찾기 어려운 데이터까지 저장·분석할 수 있습니다. 여러 플랫폼에 방대한 데이터가 존재하지만, 실제 활용 가능한 지식은 극히 제한적인 것이 현실입니다.
따라서 핵심 과제는 문제 해결이나 기업 성장에 활용할 수 있는 필수 정보를 추출하기 위해 데이터를 분석하는 것입니다. 다행히 현재는 데이터를 마이닝하고 그로부터 더 나은 의사결정을 이끌어낼 수 있는 다양한 동적 도구와 기법이 존재합니다.
빈발 항목집합 마이닝이 왜 어려운가?
빈발 항목집합(frequent itemset) 마이닝은 복잡한 작업입니다. 다차원 공간에서 정보의 희소성 때문에 저수준 또는 원시적인 추상화 방법으로는 데이터 항목 간의 강력한 관계를 찾기 어렵기 때문입니다.
강한 연관성은 대개 상식적 지식을 나타낼 수 있는 높은 개념 수준에서 발견됩니다. 그러나 한 사용자에게 상식처럼 보이는 것이 다른 사용자에게는 새로운 정보일 수 있습니다. 따라서 데이터 마이닝은 여러 추상화 수준에서 연관 규칙(association rule)을 도출할 수 있는 기능을 제공하고, 여러 추상화 공간 사이를 자유롭게 오갈 수 있어야 합니다.
빈발 항목집합 마이닝이 어려운 4가지 이유
기하급수적인 계산량: 연관 규칙 생성에 필요한 계산량은 항목 수와 고려 중인 규칙의 복잡도에 따라 기하급수적으로 증가합니다.
항목 동질성 가정의 한계: 항목들은 제품 유형과 같은 하나의 식별 특징을 제외하면 동일한 것으로 간주되지만, 모든 문제가 이러한 조건에 부합하지는 않습니다.
적절한 항목 집합 선정의 어려움: 가장 어려운 작업은 분석에 사용할 올바른 항목 집합을 결정하는 것입니다. 항목을 일반화하면 분석에 사용되는 항목들의 빈도가 거의 비슷하도록 보장할 수 있습니다.
희귀 항목 처리 문제: 극소수의 거래에서만 드물게 나타나는 항목들이 존재할 경우, 연관 규칙을 생성하기가 매우 어렵습니다.