Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 수량 감소(Numerosity Reduction)란 무엇인가?

데이터 수량 감소(Numerosity Reduction)란 무엇인가?

수량 감소는 원본 데이터를 더 작은 크기의 대체 표현 형태로 변환하여 전체 데이터의 양을 줄이는 기법입니다. 이러한 기법은 매개변수적(parametric) 방식과 비매개변수적(nonparametric) 방식으로 나눌 수 있습니다.

매개변수 방식에서는 모델을 사용해 데이터를 추정하므로, 실제 데이터 자체가 아니라 모델의 매개변수만 저장하면 됩니다. 대표적인 예로 로그-선형 모델(log-linear model)이 있습니다. 반면 비매개변수 방식은 축소된 형태의 데이터 표현을 그대로 저장하는 방식으로, 히스토그램, 클러스터링, 샘플링 등이 여기에 해당합니다.

대표적인 수량 감소 기법은 다음과 같습니다.

1. 회귀 및 로그-선형 모델

회귀와 로그-선형 모델은 주어진 데이터를 근사적으로 표현하는 데 활용됩니다. 선형 회귀(linear regression)에서는 데이터가 하나의 직선에 맞도록 모델링됩니다. 예를 들어, 확률 변수 y(반응 변수)를 다른 확률 변수 x(예측 변수)의 선형 함수로 표현할 수 있으며, 이때 방정식은 y = wx + b 형태가 됩니다. 단, y의 분산은 일정하다고 가정합니다.

로그-선형 모델은 이산형 다차원 확률 분포를 근사하는 데 사용됩니다. n차원(n개의 속성으로 구성된)의 튜플 집합이 주어지면, 각 튜플을 n차원 공간상의 한 점으로 간주할 수 있습니다. 로그-선형 모델은 차원 조합 중 작은 부분집합에만 의존하여 다차원 공간에서 각 점의 확률을 계산할 수 있게 해줍니다. 덕분에 저차원 공간으로부터 고차원 데이터 공간을 구성하는 것이 가능해집니다.

2. 히스토그램

히스토그램은 구간화(binning)를 통해 데이터 분포를 근사하는, 널리 알려진 데이터 축소 방식입니다. 속성 A에 대한 히스토그램은 A의 데이터 분포를 서로 겹치지 않는 부분집합, 즉 버킷(bucket)으로 나눕니다. 만약 각 버킷이 하나의 속성값/빈도 쌍만을 나타낸다면, 이를 싱글톤 버킷(singleton bucket)이라고 부릅니다.

3. 클러스터링

클러스터링 기법은 데이터 튜플을 객체로 간주하고, 이 객체들을 그룹(클러스터)으로 분할합니다. 이때 동일한 클러스터 내부의 객체들은 서로 "유사"하고, 다른 클러스터의 객체들과는 "유사하지 않도록" 구성됩니다. 유사성은 일반적으로 거리 함수(distance function)를 기준으로 한 공간상의 "근접성"으로 정의됩니다.

클러스터의 품질은 지름(diameter), 즉 클러스터 내 임의의 두 객체 사이의 최대 거리로 정의할 수 있습니다. 또 다른 품질 척도로는 중심 거리(centroid distance)가 있으며, 이는 클러스터의 "평균 객체", 즉 대표점 역할을 하는 클러스터 중심(centroid)으로부터 각 객체까지의 평균 거리를 의미합니다.

4. 샘플링

샘플링은 데이터 축소 기법으로 활용될 수 있습니다. 방대한 데이터 집합을 훨씬 작은 크기의 무작위 표본(부분집합)으로 대표할 수 있기 때문입니다. 이를 통해 전체 데이터를 일일이 처리하지 않고도 원래 데이터의 특성을 상당 부분 유지하면서 분석 효율을 크게 높일 수 있습니다.