데이터 웨어하우스 응용 프로그램은 크게 정보 처리(Information Processing), 분석 처리(Analytical Processing), 데이터 마이닝(Data Mining) 세 가지 유형으로 나눌 수 있습니다. 이 세 가지는 서로 다른 목적과 기능을 가지지만, 데이터로부터 가치를 추출한다는 공통점을 지니고 있습니다.
1. 정보 처리(Information Processing)
정보 처리는 질의(query)를 기반으로 기본적인 수치 분석과 문서화를 수행하는 기능입니다. 교차표(crosstab), 표, 차트, 그래프 등을 활용해 데이터를 시각적으로 정리하고 보여줍니다. 최근에는 웹 브라우저와 통합된 저비용 웹 기반 접근 도구를 만드는 것이 데이터 웨어하우스 데이터 처리의 주요 트렌드로 자리 잡고 있습니다.
2. 분석 처리(Analytical Processing)
분석 처리는 OLAP(Online Analytical Processing) 연산이라 불리는 슬라이스 앤 다이스(slice-and-dice), 드릴다운(drill-down), 롤업(roll-up), 피벗팅(pivoting) 같은 기본 연산을 제공합니다. 주로 요약된 형태와 상세한 형태 모두의 과거 데이터를 대상으로 작동하며, 정보 처리와 구별되는 핵심 특징은 데이터 웨어하우스 데이터에 대한 다차원 정보 분석이라는 점입니다.
3. 데이터 마이닝(Data Mining)
데이터 마이닝은 숨겨진 패턴과 연관성을 발견하고, 분석 모델을 생성하며, 분류(classification)와 예측(prediction)을 수행하고, 시각화 도구를 통해 마이닝 결과를 제시함으로써 지식 발견(knowledge discovery)을 실현합니다.
정보 처리는 왜 데이터 마이닝이 아닐까?
정보 처리는 질의 기반으로 유용한 데이터를 찾아낼 수 있습니다. 그러나 여기서 얻은 답변은 데이터베이스에 직접 저장된 데이터나 집계 함수로 계산 가능한 결과에 불과합니다. 즉, 데이터베이스 속에 숨어 있는 정교한 패턴이나 예측 가능성까지는 반영하지 못합니다. 따라서 정보 처리는 데이터 마이닝이라고 볼 수 없습니다.
OLAP과 데이터 마이닝의 관계
온라인 분석 처리(OLAP)는 사용자가 정의한 데이터 웨어하우스의 부분 집합에서 여러 세분화 수준(granularity)으로 요약된 데이터를 다룰 수 있기 때문에, 데이터 마이닝보다 한 걸음 더 가까운 위치에 있습니다. 다만 두 기술의 역할은 서로 구분됩니다.
- OLAP: 데이터 요약 및 집계 도구로서, 사용자가 손쉽게 데이터를 분석할 수 있도록 지원합니다.
- 데이터 마이닝: 방대한 양의 데이터 속에 숨겨진 암묵적 패턴과 흥미로운 지식을 자동으로 발견합니다.
OLAP 도구는 대화형 데이터 분석을 단순화하고 지원하는 데 초점을 맞추는 반면, 데이터 마이닝 도구는 프로세스를 최대한 자동화하면서도 사용자가 개입해 프로세스를 조율할 수 있도록 하는 것을 목표로 합니다. 이러한 관점에서 데이터 마이닝은 전통적인 온라인 분석 처리보다 한 단계 더 나아간 기술이라 할 수 있습니다.
대안적 관점: 데이터 정의와 데이터 모델링을 아우르는 데이터 마이닝
데이터 마이닝을 데이터 정의(data definition)와 데이터 모델링(data modeling)을 모두 포괄하는 개념으로 바라보는 대안적 관점도 존재합니다. OLAP 시스템은 데이터 웨어하우스의 일반적인 데이터 정의를 보여줄 수 있으므로, OLAP 서비스는 본질적으로 드릴링, 피벗팅, 슬라이싱, 다이싱 등을 통한 사용자 주도형 데이터 요약 및 비교에 해당합니다.
데이터 마이닝은 데이터 웨어하우스를 넘어선다
데이터 마이닝은 데이터 웨어하우스에 저장된 데이터 분석에만 국한되지 않습니다. 데이터 웨어하우스가 지원하는 요약 레코드보다 더 세밀한 세분화 수준의 데이터도 탐색할 수 있으며, 현대의 다차원 데이터베이스 기술로는 모델링하기 어려운 트랜잭션, 공간(spatial), 텍스트, 멀티미디어 데이터 역시 분석 대상이 됩니다.
결국 데이터 마이닝은 OLAP에 비해 분석 서비스의 범위가 더 넓고, 다루는 데이터의 복잡성 또한 한층 크다고 정리할 수 있습니다.