Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 마이닝의 이론적 토대란 무엇일까? 핵심 이론 완벽 정리

데이터 마이닝을 지탱하는 이론적 기반

데이터 마이닝은 단일한 이론 위에 세워진 기술이 아니라, 여러 학문적 관점에서 그 기반을 설명할 수 있습니다. 대표적인 이론들을 하나씩 살펴보겠습니다.

1. 데이터 축소(Data Reduction)

이 이론에서는 데이터 마이닝의 본질을 '데이터 표현의 축소'로 봅니다. 방대한 데이터베이스에 대한 질의에 빠르고 근사적인 답변을 제공해야 한다는 요구에 대응하기 위해, 어느 정도의 정확성을 희생하는 대신 처리 속도를 얻는 것이 핵심입니다.

대표적인 데이터 축소 기법으로는 특잇값 분해(SVD, 주성분 분석의 핵심 구성 요소), 웨이블릿, 회귀 분석, 로그 선형 모델, 히스토그램, 클러스터링, 샘플링, 인덱스 트리 개발 등이 있습니다.

2. 데이터 압축(Data Compression)

이 이론에 따르면 데이터 마이닝의 기반은 주어진 정보를 비트, 연관 규칙, 결정 트리, 클러스터 등의 형태로 인코딩하여 압축하는 것입니다.

3. 패턴 발견(Pattern Discovery)

이 이론은 데이터베이스 속에 나타나는 패턴을 찾는 것을 데이터 마이닝의 본질로 간주합니다. 여기에는 연관성(association), 분류 모델, 순차 패턴 등이 포함됩니다. 머신러닝, 신경망, 연관 규칙 마이닝, 순차 패턴 마이닝, 클러스터링 등 다양한 하위 분야가 이 이론에 기여하고 있습니다.

4. 확률 이론(Probability Theory)

통계 이론에 기반한 이 관점에서는 데이터 마이닝의 목표를 확률 변수들의 결합 확률 분포를 찾는 것으로 봅니다. 베이지안 신뢰 네트워크(Bayesian Belief Network)나 계층적 베이지안 모델(Hierarchical Bayesian Model)이 대표적인 예입니다.

5. 미시경제학적 관점(Microeconomic View)

미시경제학적 관점은 데이터 마이닝을 '기업의 의사결정 과정에 실제로 활용할 수 있는 만큼만 가치 있는 패턴을 발견하는 서비스'로 정의합니다. 예를 들어 마케팅 전략이나 생산 계획 수립에 활용되는 패턴이 그 대상입니다.

이 관점에서 패턴은 의사결정의 근거로 삼을 수 있을 때 비로소 '흥미로운' 것으로 평가되며, 기업은 서비스나 의사결정의 가치를 최대화하려는 최적화 문제에 직면한 것으로 봅니다. 따라서 데이터 마이닝은 하나의 비선형 최적화 문제가 됩니다.

6. 귀납적 데이터베이스(Inductive Databases)

이 이론에 따르면 데이터베이스 스키마에는 데이터뿐 아니라 저장된 패턴까지 포함됩니다. 데이터 마이닝은 데이터베이스에 대해 귀납(induction)을 수행하는 문제로, 데이터베이스의 데이터와 이론(즉, 패턴)을 질의하는 것이 목표입니다. 이 관점은 데이터베이스 시스템 분야 연구자들 사이에서 특히 널리 받아들여지고 있습니다.

이론들 간의 관계와 이상적인 프레임워크

이러한 이론들은 서로 배타적이지 않습니다. 예를 들어 패턴 발견은 데이터 축소나 데이터 압축의 한 형태로도 해석할 수 있습니다.

이상적인 이론적 프레임워크는 다음 조건을 충족해야 합니다.

- 연관 분석, 분류, 클러스터링 등 일반적인 데이터 마이닝 작업을 모델링할 수 있어야 함
- 확률적 특성을 가져야 함
- 다양한 형태의 데이터를 처리할 수 있어야 함
- 데이터 마이닝의 반복적·상호작용적 본질을 반영해야 함

아직 이 모든 요구 사항을 만족하는 통일된 이론 체계는 확립되지 않았으며, 이를 위한 후속 연구와 노력이 계속되고 있습니다.