대규모 데이터베이스에서 통계적 측정이란?
관계형 데이터베이스 시스템은 count(), sum(), avg(), max(), min()이라는 다섯 가지 기본 집계 함수를 제공합니다. 이러한 집계 함수들은 다차원 정보를 대상으로 하는 기술적 마이닝(descriptive mining)에서 기본적인 측정값으로 활용될 수 있습니다.
고차원 데이터베이스에서 효과적으로 사용할 수 있는 대표적인 기술통계 측도는 두 가지입니다. 바로 중심 경향성 측도(measures of central tendency)와 데이터 산포도 측도(measures of data dispersion)입니다.
1. 중심 경향성 측도
중심 경향성 측도는 데이터가 어떤 값을 중심으로 분포하는지를 나타내며, 대표적으로 평균(mean), 중앙값(median), 최빈값(mode), 중간범위(mid-range)가 있습니다.
평균(Mean)
산술 평균은 모든 값을 더한 뒤 값의 개수로 나누어 구하며, 모든 개별 데이터를 활용한다는 점이 특징입니다. 급여처럼 N개의 관측값 x1, x2, ... , xn이 있을 때 평균은 다음과 같이 정의됩니다.
X̄ = (x1 + x2 + ... + xn) / N
이는 관계형 데이터베이스가 지원하는 집계 함수 avg()에 해당합니다. 많은 데이터 큐브(data cube)에서는 sum과 count가 사전 계산되어 저장되기 때문에, 평균은 다음과 같이 매우 간단하게 도출할 수 있습니다.
average = sum / count
중앙값(Median)
중앙값은 값의 분포 형태에 따라 두 가지 방법으로 계산합니다.
n이 홀수인 경우: x1, x2, ... , xn을 크기 순으로 정렬했을 때 (n+1)/2번째 값이 중앙값입니다.
예: 1, 4, 6, 7, 12, 14, 18 → 중앙값 = 7
n이 짝수인 경우: n/2번째 값과 (n/2 + 1)번째 값의 평균이 중앙값입니다.
예: 1, 4, 6, 7, 8, 12, 14, 16 → 중앙값 = (7 + 8) / 2 = 7.5
중앙값은 분배적 측도(distributive measure)나 대수적 측도(algebraic measure)가 아니라 전체적 측도(holistic measure)에 해당합니다. 초대형 데이터베이스에서 정확한 중앙값을 직접 계산하기는 어렵지만, 근사 중앙값(approximate median)은 효율적으로 산출할 수 있습니다.
최빈값(Mode)
최빈값은 값의 집합에서 가장 자주 나타나는 값입니다. 분포의 형태에 따라 단봉(unimodal), 이봉(bimodal), 다봉(multimodal) 분포로 구분할 수 있습니다. 데이터가 범주형(명목 척도로 측정된 경우)일 때는 최빈값만 계산할 수 있으며, 서열 척도 이상의 데이터에서도 계산 자체는 가능하지만 통계적으로 적합하지 않습니다.
2. 데이터 산포도 측정
수치 데이터가 퍼져 있는 정도를 데이터의 산포(dispersion) 또는 분산(variance)이라고 합니다. 가장 널리 사용되는 산포도 측도는 범위(range), 사분위 범위(interquartile range), 표준편차(standard deviation)입니다.
범위(Range)
범위는 데이터 집합에서 최댓값과 최솟값의 차이로 정의됩니다.
Range = XL − XS
여기서 XL은 최댓값(largest value), XS는 최솟값(smallest value)을 의미합니다.
사분위수와 사분위 범위(IQR)
중앙값 다음으로 가장 널리 쓰이는 백분위수는 사분위수(quartiles)입니다. 제1사분위수 Q1은 25번째 백분위수, 제3사분위수 Q3는 75번째 백분위수를 나타냅니다. 사분위수는 중앙값을 포함하여 데이터의 중심, 산포, 분포 형태에 대한 유용한 정보를 제공합니다.
데이터의 중간 절반이 차지하는 범위를 보여주는 간단한 산포 측도를 사분위 범위(IQR, Interquartile Range)라고 하며, 다음과 같이 정의됩니다.
IQR = Q3 − Q1
표준편차(Standard Deviation)
분산을 계산할 때 편차 값을 제곱하면 측정 단위 역시 함께 제곱됩니다. 따라서 원래의 단위로 해석하기 위해서는 분산의 양의 제곱근을 취한 표준편차를 사용합니다. 표준편차가 작을수록 데이터가 평균 주변에 밀집되어 있음을 의미하며, 클수록 데이터가 넓게 퍼져 있음을 나타냅니다.