Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

디스커버리 기반 탐색(Discovery-Driven Exploration)이란? 개념부터 예외 지표까지


디스커버리 기반 탐색(Discovery-Driven Exploration)이란?

디스커버리 기반 탐색은 데이터 큐브(data cube)를 탐색하는 대표적인 분석 방식 중 하나입니다. 이 기법에서는 사전에 계산된 측정값(precomputed measure), 즉 데이터의 예외 여부를 나타내는 값들을 활용하여, 사용자가 모든 집계 수준(aggregation level)에서 데이터 분석을 진행할 때 올바른 방향을 잡을 수 있도록 안내합니다. 이러한 측정값을 예외 지표(exception indicator)라고 부릅니다.

예외(Exception)의 의미

직관적으로 말하면, 예외란 통계 모델(statistical model)에 기반해 예상되는 값과 비교했을 때 현저히 차이가 나는 데이터 큐브 셀(cell) 값을 의미합니다. 이 모델은 해당 셀이 적용되는 모든 차원(dimension) 전반에서 나타나는 측정값의 변동성과 패턴을 함께 고려합니다.

예를 들어, 품목 판매 데이터를 분석했을 때 12월의 매출이 다른 달보다 증가했다면, 이는 시간(time) 차원 관점에서는 예외로 볼 수 있습니다. 그러나 품목(item) 차원까지 고려하면 다른 품목들 역시 12월에 비슷하게 매출이 증가했기 때문에 예외가 아니라고 판단할 수 있습니다.

시각적 단서를 통한 예외 표현

이 모델은 데이터 큐브의 특정 집계 그룹(group-by) 수준에서만 알 수 있는 예외까지도 처리할 수 있습니다. 사전에 계산된 예외 지표에 따라 각 셀의 예외 정도를 배경색과 같은 시각적 단서(visual cue)로 표현함으로써, 사용자가 방대한 데이터 속에서도 이상값을 한눈에 파악할 수 있도록 돕습니다.

세 가지 예외 지표

데이터의 이상 현상을 인식하기 위해 세 가지 측정값이 예외 지표로 사용됩니다. 이 값들은 셀의 값이 예상치(expected value)에 비해 얼마나 '놀라운지', 즉 놀람의 정도(degree of surprise)를 나타내며, 모든 집계 수준의 모든 셀에 대해 계산되어 연결됩니다.

  • SelfExp − 동일한 집계 수준의 다른 셀들과 비교했을 때, 해당 셀 값 자체가 가지는 놀람의 정도를 나타냅니다.
  • InExp − 해당 셀에서 드릴다운(drill-down)할 경우, 그 하위에 숨어 있을 수 있는 놀람의 정도를 나타냅니다.
  • PathExp − 해당 셀로부터의 각 드릴다운 경로별 놀람의 정도를 나타냅니다.

실제 적용 예시

예를 들어 AllElectronics사의 월별 매출을 전월 대비 백분율 변화율로 분석하고 싶다고 가정해 보겠습니다. 이때 분석에 포함되는 차원은 품목(item), 시간(time), 지역(region)입니다.

예외 지표를 확인하려면 화면에서 'highlight exceptions'(예외 강조) 버튼을 클릭하면 됩니다. 그러면 SelfExp와 InExp 값이 시각적 단서로 변환되어 각 셀에 함께 표시됩니다. 각 셀의 배경색은 해당 셀의 SelfExp 값에 따라 결정됩니다.

또한 모든 셀 주위에는 상자(box)가 그려지는데, 상자의 두께와 색상은 해당 셀의 InExp 값에 따라 달라집니다. 상자가 두꺼울수록 InExp 값이 높다는 것을 의미합니다. 배경색과 상자 두 경우 모두, 색이 짙을수록 예외의 정도가 더 높음을 나타냅니다.

품목 차원으로 드릴다운하면 품목별 시간에 따른 매출 추이를 보여주는 큐브 슬라이스(cube slice)가 화면에 나타나며, 여러 판매 값들이 분석 대상으로 표시됩니다. 이때 'highlight exceptions' 버튼을 누르면 시각적 단서가 표시되어, 사용자의 주의를 예외적인 값들에 자연스럽게 집중시켜 줍니다.

정리

디스커버리 기반 탐색은 방대한 데이터 큐브의 모든 값을 일일이 검토하지 않고도 통계적으로 유의미한 이상값을 빠르게 발견할 수 있게 해주는 효율적인 OLAP 탐색 기법입니다. SelfExp, InExp, PathExp라는 세 가지 예외 지표와 배경색·상자 두께 같은 직관적인 시각화 요소를 활용하면 데이터 분석의 정확도와 생산성을 동시에 높일 수 있습니다.