Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

이상 탐지에서 이상치가 발생하는 3가지 핵심 원인

이상 탐지(anomaly detection)란?

이상 탐지의 목표는 다수의 객체들과 뚜렷이 구별되는 객체를 찾아내는 것입니다. 이러한 이상 객체는 데이터 산점도(scatter plot)에서 대다수 데이터 포인트로부터 멀리 떨어져 있기 때문에 흔히 이상치(outlier)라고 불립니다. 또한 이상 객체는 기대되는 일반적인 속성값에서 크게 벗어난 값을 가지므로 '편차 탐지(deviation detection)'라고도 하며, 여러 의미에서 예외적이기 때문에 '예외 마이닝(exception mining)'이라고 지칭하기도 합니다.

전 세계, 인간 사회, 데이터 집합의 영역에서 대부분의 사건과 객체는 본질적으로 평범하거나 정규적인 특성을 보입니다. 하지만 드물거나 특이한 객체의 가능성을 정확히 파악하는 것 역시 매우 중요합니다. 예컨대 유례없는 가뭄이나 집중호우, 스타급 운동선수, 혹은 나머지 값보다 훨씬 크거나 작은 속성값 등이 그 대표적인 예입니다.

이상 현상의 주요 원인

이상 현상이 발생하는 원인은 크게 다음 세 가지로 정리할 수 있습니다.

1. 서로 다른 클래스에서 비롯된 데이터

어떤 객체가 다수의 객체와 다르다고 판단되는 이유는, 해당 객체가 다른 유형이나 클래스에 속해 있기 때문일 수 있습니다. 예를 들어 신용카드 사기를 저지르는 사람은 카드를 정상적으로 사용하는 사람들과는 다른 클래스의 신용카드 사용자에 속합니다.

사기 행위, 침입(intrusion), 질병 발생, 비정상 검사 결과와 같은 사례들은 서로 다른 클래스에 속한 요소들을 보여주는 이상 현상의 전형적인 예입니다. 이런 유형의 이상은 데이터 마이닝 분야에서 이상 탐지의 핵심적인 관심 대상이 됩니다.

2. 자연스러운 변동(natural variation)

일부 데이터 집합은 정규분포(가우시안 분포)와 같은 통계적 분포로 모델링할 수 있습니다. 이 경우 분포의 중심에서 멀어질수록 해당 데이터 객체가 나타날 확률은 점점 낮아집니다.

다시 말해 대부분의 객체는 중심(평균 객체) 근처에 위치하고, 평균 객체와 크게 다른 객체가 나타날 가능성은 매우 낮습니다. 예를 들어 매우 키가 큰 사람은 별개의 클래스에 속해서가 아니라, 키라는 속성값 자체가 극단적이기 때문에 이상으로 간주됩니다. 이처럼 극단적이거나 발생 가능성이 낮은 변동을 보이는 이상치가 바로 흥미로운 분석 대상입니다.

3. 데이터 측정 및 수집 오류

데이터 집합이나 측정 과정에서 발생하는 오류 역시 이상 현상의 원인이 됩니다. 예를 들어 사람의 실수, 계산 장치의 문제, 노이즈(noise)의 존재 등으로 인해 측정값이 잘못 기록될 수 있습니다.

이런 종류의 이상치는 유의미한 정보를 제공하지 못하고 오히려 데이터 품질과 후속 분석의 정확도만 떨어뜨리므로 제거하는 것이 바람직합니다. 실제로 이러한 이상치를 제거하는 작업은 데이터 전처리, 특히 데이터 클렌징(data cleaning)의 핵심 목표 중 하나입니다.