Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

고차원 데이터 이상치 탐지의 주요 과제와 해결 접근법

고차원 데이터 이상치 탐지의 주요 과제

고차원 데이터에서 이상치(outlier)를 탐지하는 작업은 저차원 환경보다 훨씬 복잡하며, 여러 가지 고유한 어려움이 따릅니다. 대표적인 과제는 다음과 같습니다.

1. 이상치 해석(Interpretation of Outliers)

이상치 탐지는 단순히 이상치를 식별하는 데 그쳐서는 안 되며, 해당 객체가 왜 이상치인지에 대한 해석을 함께 제공해야 합니다. 고차원 데이터셋은 수많은 특징(feature)과 차원을 포함하고 있기 때문에, 근거 없이 이상치만 나열해서는 실질적인 도움이 되지 않습니다.

이상치에 대한 해석은 크게 두 가지 형태로 제공될 수 있습니다. 첫째, 이상치가 드러나는 특정 부분 공간(subspace)을 제시하는 것이고, 둘째, 객체의 '이상 정도(outlierness)'를 정량적으로 평가하는 것입니다. 이러한 해석은 사용자가 이상치의 의미와 중요성을 깊이 이해하는 데 큰 도움을 줍니다.

2. 데이터 희소성(Data Sparsity)

차원이 증가할수록 객체 간 거리는 잡음(noise)에 의해 지배되며, 데이터는 매우 희소(sparse)해집니다. 따라서 이상치 탐지 방법은 고차원 공간에서 나타나는 이러한 희소성을 효과적으로 처리할 수 있어야 합니다.

3. 데이터 부분 공간(Data Subspaces)

이상치를 적절하게 모델링하려면, 이상치를 나타내는 부분 공간에 적응하고 데이터의 국소적(local) 행동을 포착할 수 있어야 합니다. 일부 부분 공간에 고정된 거리 임계값을 적용해 이상치를 판별하는 것은 바람직하지 않습니다. 차원이 증가함에 따라 두 객체 간의 거리가 단조롭게 증가하기 때문입니다.

4. 차원에 대한 확장성(Scalability)

차원이 늘어나면 가능한 부분 공간의 수는 기하급수적으로 증가합니다. 따라서 모든 후보 부분 공간을 대상으로 하는 전수 조합 분석(exhaustive combinatorial analysis)은 확장 가능한(scalable) 접근 방식이 될 수 없습니다.

고차원 데이터 이상치 탐지의 세 가지 주요 접근법

1. 기존 이상치 탐지 기법의 확장

첫 번째 접근법은 기존의 근접성(proximity) 기반 이상치 탐지 모델을 고차원 환경에 맞게 개선하는 것입니다. 고차원 공간에서 근접성 측도의 성능 저하 문제를 극복하기 위해, 대체 측도를 사용하거나 부분 공간을 구성하여 그 안에서 이상치를 탐지합니다.

대표적인 예로 HilOut 알고리즘이 있습니다. HilOut은 거리 기반 이상치를 발견하지만, 절대 거리 대신 거리 순위(rank)를 활용합니다. 구체적으로 각 객체 o에 대해 k개의 최근접 이웃 nn1(o), ..., nnk(o)를 찾으며(여기서 k는 소프트웨어 종속적 매개변수), 객체 o의 가중치는 다음과 같이 정의됩니다.

$$\mathrm{w(o) = \displaystyle\sum\limits_{i=1}^k dist(o,nn_{i}(o))}$$

2. 부분 공간에서의 이상치 탐색

두 번째 접근법은 여러 부분 공간에서 이상치를 찾는 것입니다. 이 방법의 큰 장점은, 어떤 객체가 훨씬 낮은 차원의 부분 공간에서 이상치로 발견되면, 해당 부분 공간이 그 객체가 왜, 그리고 어느 정도까지 이상치인지 설명하는 핵심 정보를 제공한다는 점입니다. 차원의 수가 압도적으로 많은 고차원 데이터 응용 분야에서 이는 매우 유용한 특성입니다.

3. 고차원 이상치 모델링

세 번째 접근법은 고차원 이상치를 위한 새로운 모델을 직접 개발하는 것입니다. 기존 방법을 단순히 수정하는 대신, 고차원 데이터의 특성을 충분히 반영한 이상치 모델을 처음부터 새롭게 설계함으로써 보다 정확한 탐지를 목표로 합니다.