개념 설명(Concept Description)이란?
개념 설명은 데이터 마이닝의 한 유형으로, 자주 구매하는 고객이나 졸업 예정자처럼 특정 조건에 해당하는 데이터 집합을 명확하게 정의하는 작업입니다. 이는 데이터의 특성화(characterization)와 비교(comparison)를 통해 수행되며, 설명하려는 개념이 객체의 클래스로 정의되는 경우에는 '클래스 설명(class description)'이라고도 부릅니다. 이러한 설명은 데이터 특성화 기법의 도움을 받아 도출할 수 있습니다.
데이터 특성화(Data Characterization)
데이터 특성화는 대상 클래스에 속한 데이터의 일반적인 특징을 요약하는 과정입니다. 사용자가 정의한 특정 클래스와 관련된 데이터는 주로 데이터베이스 질의(query)를 통해 추출됩니다. 특성화 결과는 막대 그래프, 곡선, 원형 차트, 동적 그래프 등 다양한 형태로 시각화하여 표현할 수 있습니다.
특성화가 하나의 데이터 집합에 대한 간결한 요약을 제공한다면, 개념 또는 클래스 비교(concept/class comparison)는 둘 이상의 데이터 집합을 서로 비교하는 설명을 지원합니다.
OLAP(온라인 분석 처리)란?
OLAP(On-Line Analytical Processing)는 분석가, 관리자, 경영진이 다양한 관점에서 데이터를 빠르고 일관되게, 그리고 대화형으로 접근할 수 있도록 지원하는 소프트웨어 기술의 범주를 의미합니다. 여기서 다루어지는 데이터는 원시 정보(raw data)로부터 변환된 것으로, 사용자가 실제로 인식하는 기업의 다차원적 구조를 반영합니다.
OLAP 서버는 데이터 웨어하우스나 데이터 마트에 저장된 데이터를 다차원 형태로 사업 담당자에게 제공하므로, 사용자는 데이터가 어떻게 어디에 저장되어 있는지 신경 쓸 필요가 없습니다. 다만 OLAP 서버의 물리적 구조와 성능을 설계할 때는 데이터 저장 문제를 반드시 고려해야 합니다.
개념 설명과 OLAP의 주요 차이점
그렇다면 대규모 데이터베이스의 개념 설명과 OLAP 도구는 어떤 점에서 다를까요? 아래 비교표에서 핵심 차이점을 확인할 수 있습니다.
| 대규모 데이터베이스의 개념 설명 | OLAP 도구 |
|---|---|
| 데이터베이스의 속성은 숫자형, 비숫자형, 공간(spatial), 텍스트, 이미지 등 다양한 유형으로 구성될 수 있습니다. | 데이터 웨어하우스와 OLAP 도구는 데이터를 큐브(data cube) 형태로 바라보는 다차원 데이터 모델에 기반합니다. 속성은 측정값(measure)과 차원(dimension)으로 구분되며, 차원은 주로 비숫자형 데이터로 제한됩니다. |
| 집계(aggregation)를 활용하면 개념 설명은 복잡한 데이터 유형의 속성도 처리할 수 있습니다. | OLAP는 활용 가능한 차원과 측정값 유형에 제약이 있기 때문에, 데이터 분석을 위해 단순화된 모델을 정의합니다. |
| 데이터 마이닝의 개념 설명은 보다 자동화된 프로세스를 필요로 합니다. 사용자가 분석에 포함할 속성과 데이터를 어느 수준까지 일반화(generalization)할지 결정하도록 지원하여, 의미 있는 데이터 요약을 만들어냅니다. | 데이터 웨어하우스의 OLAP는 사용자가 직접 제어하는 프로세스입니다. 드릴다운(drill-down), 롤업(roll-up), 슬라이싱(slicing), 다이싱(dicing)과 같은 OLAP 연산의 선택과 적용은 모두 사용자가 감독하고 통제하며, 사용자가 일련의 OLAP 연산을 직접 정의해야 합니다. |
핵심 요약
정리하면, 개념 설명은 다양한 데이터 유형을 다루고 집계를 통해 복잡한 데이터까지 처리할 수 있으며, 자동화된 일반화 과정을 지원하는 것이 특징입니다. 반면 OLAP는 다차원 큐브 모델 위에서 사용자가 직접 차원을 선택하고 연산을 수행하는 대화형 분석 도구라는 점에서 큰 차이가 있습니다.