Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 마이닝 측정값(Measure) 계산 방식 – 분배적, 대수적, 전체적 측정값 완벽 정리

데이터 마이닝에서 측정값(measure)은 사용되는 집계 함수(aggregate function)의 유형에 따라 분배적(distributive), 대수적(algebraic), 전체적(holistic)의 세 가지로 분류할 수 있습니다. 각 유형별 특징과 계산 방식을 자세히 살펴보겠습니다.

1. 분배적(Distributive) 측정값

집계 함수가 다음과 같은 방식으로 계산될 수 있다면 분배적이라고 합니다. 먼저 데이터를 n개의 독립적인 집합으로 분할하고, 각 파티션에 함수를 적용하여 n개의 집계값을 얻습니다. 그다음 이 n개의 집계값에 다시 같은 함수를 적용한 결과가, 데이터를 분할하지 않고 전체 데이터셋에 한 번에 함수를 적용한 결과와 동일하다면 해당 함수는 분산 방식으로 평가할 수 있는 것입니다.

예를 들어 count()는 데이터 큐브를 여러 개의 하위 큐브(subcube)로 분할한 뒤, 각 하위 큐브에 대해 count()를 계산하고 그 결과값들을 모두 더하는 방식으로 구할 수 있습니다. 따라서 count()는 분배적 집계 함수입니다.

분배적 집계 함수를 통해 얻어지는 측정값을 분배적 측정값이라고 하며, 분산 방식으로 계산이 가능하기 때문에 매우 효율적으로 처리할 수 있다는 장점이 있습니다.

2. 대수적(Algebraic) 측정값

집계 함수가 유계 양의 정수 M개의 인수를 갖는 대수적 함수로 계산될 수 있고, 각 인수가 분배적 집계 함수를 통해 얻어질 수 있다면 이를 대수적 집계 함수라고 합니다.

대표적인 예로 avg()(평균)는 sum()/count()로 계산할 수 있으며, sum()과 count()는 모두 분배적 집계 함수입니다. 마찬가지로 주어진 집합에서 N개의 최솟값과 N개의 최댓값을 찾는 min_N(), max_N(), 그리고 표준편차(standard deviation) 역시 대수적 집계 함수임을 보일 수 있습니다. 대수적 집계 함수로부터 얻어지는 측정값을 대수적 측정값이라고 합니다.

3. 전체적(Holistic) 측정값

하위 집계(subaggregate)를 정의하는 데 필요한 저장 공간의 크기에 고정된 상한이 없는 경우, 즉 상수 M개의 인수를 가지는 어떤 대수적 함수로도 계산 과정을 기술할 수 없는 집계 함수를 전체적 집계 함수라고 합니다.

median()(중앙값), mode()(최빈값), rank()(순위) 등이 전체적 함수의 대표적인 예입니다. 전체적 집계 함수를 통해 얻어지는 측정값을 전체적 측정값이라고 합니다.

효율적인 계산 관점에서의 비교

대부분의 대규모 데이터 큐브 애플리케이션은 분배적 측정값과 대수적 측정값의 효율적인 계산을 요구하며, 이를 위한 효율적인 방법들이 이미 존재합니다. 반면 전체적 측정값을 효율적으로 계산하는 것은 상당히 복잡한 문제입니다. 그럼에도 불구하고 일부 전체적 측정값의 계산을 근사(approximation)하는 효율적인 접근 방식은 존재합니다.

예를 들어, 정확한 median() 값 계산 대신 근사 알고리즘을 활용하면 대규모 데이터셋에 대한 근사 중앙값을 빠르게 구할 수 있습니다. 이러한 방법은 경우에 따라 전체적 측정값의 효율적인 계산 문제를 해결하기에 충분합니다.