데이터 마이닝(Data Mining)이란?
데이터 마이닝은 저장소에 보관된 대량의 데이터를 패턴 인식 기술과 통계·수학적 기법을 활용해 분석함으로써, 의미 있는 새로운 상관관계·패턴·추세를 발견하는 과정입니다. 관찰된 데이터셋을 분석하여 예상치 못한 관계를 찾아내고, 데이터 소유자가 이해하기 쉽고 실질적으로 유용한 방식으로 데이터를 요약하는 작업이기도 합니다.
즉, 데이터 마이닝은 방대한 정보 속에서 처음에는 알려지지 않았던 규칙성이나 관계를 찾아내어 데이터베이스 소유자에게 명확하고 유익한 결과를 제공하기 위한 선택(selection), 탐색(exploration), 모델링(modeling)의 절차라고 할 수 있습니다. 자동 또는 준자동 방식으로 대량의 데이터를 탐색·분석하여 의미 있는 패턴과 방법을 도출해 내는 것이 핵심입니다.
데이터 마이닝은 이전에 알려지지 않았으면서 잠재적으로 유용한 정보를 방대한 데이터에서 추출해 내는 중요한 방법론입니다. 데이터 마이닝 프로세스는 여러 구성 요소로 이루어져 있으며, 이 구성 요소들이 모여 하나의 데이터 마이닝 시스템 아키텍처를 형성합니다.
데이터 마이닝 아키텍처의 주요 구성 요소
1. 정보 저장소(Information Repository)
하나 이상의 데이터베이스, 데이터 웨어하우스, 스프레드시트 또는 여러 유형의 데이터 저장소를 의미합니다. 이곳에 저장된 데이터에는 데이터 클리닝(data cleaning)과 데이터 통합(data integration) 기술을 적용할 수 있습니다.
2. 데이터베이스 또는 데이터 웨어하우스 서버
사용자의 데이터 마이닝 요청에 따라 필요한 관련 데이터를 가져오는 역할을 담당하는 서버입니다.
3. 지식 베이스(Knowledge Base)
검색 과정을 안내하거나 도출된 패턴의 흥미도(interestingness)를 평가하는 데 활용되는 도메인 지식입니다. 해당 분야에 대한 사전 지식이 있을수록 더 정확하고 의미 있는 결과를 얻을 수 있습니다.
4. 데이터 마이닝 엔진(Data Mining Engine)
데이터 마이닝 시스템의 핵심 부분으로, 다음과 같은 작업을 수행하는 기능 모듈들의 집합을 포함합니다.
- 특성화(Characterization)
- 연관 및 상관 분석(Association & Correlation Analysis)
- 분류(Classification)
- 예측(Prediction)
- 군집 분석(Cluster Analysis)
- 이상값 분석(Outlier Analysis)
- 진화 분석(Evolution Analysis)
5. 패턴 평가 모듈(Pattern Evaluation Module)
이 모듈은 일반적으로 흥미도 측정 기준(interestingness measures)을 활용하며, 데이터 마이닝 모듈과 상호작용하여 검색이 흥미로운 패턴에 집중되도록 유도합니다. 흥미도 임계값(threshold)을 설정하여 발견된 패턴 중 불필요한 것들을 걸러낼 수도 있습니다.
사용된 데이터 마이닝 기법의 실행 방식에 따라 패턴 평가 모듈은 마이닝 모듈과 통합되어 운영될 수 있습니다. 효율적인 데이터 마이닝을 위해서는 패턴 흥미도 평가를 마이닝 과정 안에 최대한 포함시켜, 검색 범위를 흥미로운 패턴으로만 한정하는 것이 권장됩니다.
6. 사용자 인터페이스(User Interface)
사용자와 데이터 마이닝 시스템을 연결하는 모듈입니다. 사용자가 데이터 마이닝 질의나 작업을 직접 정의하고, 검색에 도움이 되는 정보를 제공하며, 중간 결과를 바탕으로 탐색적 데이터 마이닝을 수행할 수 있도록 지원합니다.
또한 이 인터페이스를 통해 사용자는 데이터베이스나 데이터 웨어하우스의 패턴 또는 데이터 구조를 자유롭게 탐색하고, 마이닝된 패턴을 평가하며, 다양한 형태로 패턴을 시각화하여 확인할 수 있습니다.
마무리
데이터 마이닝 아키텍처는 정보 저장소부터 사용자 인터페이스까지 여러 계층의 구성 요소가 유기적으로 협력하는 구조입니다. 각 구성 요소의 역할을 명확히 이해하면, 대용량 데이터 속에서 숨겨진 가치를 효과적으로 발굴하는 데 큰 도움이 됩니다.