데이터 마이닝이란 무엇인가?
데이터 마이닝(Data Mining)은 저장소에 축적된 대량의 데이터를 통계학 및 수학 기법을 포함한 패턴 인식 기술로 분석하여, 유용한 새로운 상관관계·패턴·추세를 발견하는 과정입니다. 즉, 사실에 기반한 데이터셋을 분석해 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 레코드를 요약하는 작업이라 할 수 있습니다.
데이터 마이닝 쿼리와 작업 프리미티브
데이터 마이닝 작업은 데이터 마이닝 시스템에 입력되는 데이터 마이닝 쿼리(data mining query)의 설계를 통해 정의됩니다. 이 쿼리는 데이터 마이닝 작업 프리미티브(task primitives)라 불리는 기본 요소들로 표현됩니다.
이러한 프리미티브 덕분에 사용자는 지식 발견 과정에서 데이터 마이닝 시스템과 끊임없이 상호작용하며, 마이닝 프로세스의 방향을 지시하거나 결과물을 다양한 각도와 깊이에서 검증할 수 있습니다.
데이터 마이닝 작업의 5가지 핵심 프리미티브
1. 마이닝 대상이 되는 작업 관련 데이터 집합
사용자가 관심을 갖는 데이터베이스의 영역 또는 정보 집합을 정의합니다. 여기에는 관심 있는 데이터베이스 속성(attribute)이나 데이터 웨어하우스의 차원(dimension)이 포함되며, 이를 '관련 속성' 또는 '관련 차원'이라고 부릅니다.
2. 마이닝할 지식의 종류
수행하고자 하는 데이터 마이닝 기능을 정의합니다. 여기에는 특성화(characterization), 판별(discrimination), 연관성 및 상관 분석, 분류(classification), 예측(prediction), 군집화(clustering), 이상값 분석(outlier analysis), 진화 분석(evolution analysis) 등이 포함됩니다.
3. 발견 과정에서 활용할 배경 지식
마이닝 대상 도메인에 대한 지식으로, 지식 발견 과정의 방향을 설정하고 도출된 패턴을 평가·계산하는 데 도움을 줍니다. 대표적인 배경 지식 형태로는 개념 계층(concept hierarchy)이 있으며, 이를 통해 다양한 추상화 수준에서 데이터를 마이닝할 수 있습니다.
4. 패턴 평가를 위한 흥미도 측정 기준과 임계값
흥미도(interestingness) 측정 기준은 마이닝 프로세스를 안내하거나, 발견 이후 도출된 패턴을 평가하는 데 활용됩니다. 지식의 유형에 따라 서로 다른 흥미도 측정 기준이 적용될 수 있다는 점이 특징입니다.
5. 발견된 패턴 시각화를 위한 표현 형식
발견된 패턴을 사용자에게 어떤 형태로 제시할지를 정의합니다. 규칙(rules), 표(tables), 차트(charts), 그래프(graphs), 결정 트리(decision trees), 큐브(cubes) 등 다양한 표현 방식이 사용될 수 있습니다.
데이터 마이닝 쿼리 언어의 역할과 설계의 어려움
위에서 살펴본 프리미티브들을 통합하도록 데이터 마이닝 쿼리 언어를 설계하면, 사용자는 데이터 마이닝 시스템과 매우 유연하게 상호작용할 수 있습니다. 이러한 쿼리 언어는 사용자 친화적인 그래픽 인터페이스(GUI)를 구축할 수 있는 기반이 되며, 데이터 마이닝 시스템이 다른 데이터 시스템과 원활히 소통하고 전체 데이터 처리 환경과 자연스럽게 통합되는 데에도 기여합니다.
다만 포괄적인 데이터 마이닝 언어를 설계하는 것은 결코 쉽지 않은 과제입니다. 데이터 마이닝은 데이터 특성화부터 진화 분석까지 폭넓은 범위의 기능을 아우르며, 각 작업마다 고유한 요구사항이 존재하기 때문입니다. 따라서 효과적인 데이터 마이닝 쿼리 언어를 설계하려면 다양한 유형의 마이닝 작업이 지닌 능력, 한계, 그리고 근본적인 구조에 대한 폭넓은 이해가 반드시 필요합니다.