Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

불일치 검정(Discordancy Test)의 원리와 진행 방법 총정리

통계적 불일치 검정이란?

통계적 불일치 검정(statistical discordancy test)은 두 가지 가설을 전제로 분석을 진행합니다. 하나는 작업 가설(working hypothesis)이며, 다른 하나는 이에 반대되는 대립 가설(alternative hypothesis)입니다.

작업 가설 H는 n개의 객체로 이루어진 전체 데이터 집합이 초기 분포 모델 F에서 생성되었다는 명제입니다. 수식으로 표현하면 다음과 같습니다.

H : oi ∈ F, 여기서 i = 1, 2, …, n

불일치 검정의 진행 절차

가설을 기각해야 한다는 통계적으로 유의한 증거가 없다면 작업 가설은 그대로 유지됩니다. 불일치 검정은 특정 객체 oi가 분포 F를 기준으로 비정상적으로 큰 값(또는 작은 값)인지를 확인하는 절차입니다. 데이터에 대한 사전 지식의 정도에 따라, 불일치 검정에 활용할 수 있는 다양한 검정 통계량(test statistic)이 제안되어 왔습니다.

검정 과정을 단계별로 살펴보겠습니다. 먼저 불일치 검정에 사용할 통계량 T를 선택하고, 객체 oi에 대한 통계량 값을 vi라고 합시다. 그다음 T의 분포를 구성한 뒤 유의 확률(significance probability)을 계산합니다.

SP(vi) = Prob(T > vi)

계산된 SP(vi) 값이 충분히 작다면 oi는 불일치(disordant) 객체로 판정되고, 작업 가설은 기각됩니다. 이후에는 oi가 또 다른 분포 모델 G에서 나왔다는 대립 가설이 채택됩니다.

여기서 주의할 점은 결과가 어떤 F 모델을 선택하느냐에 따라 크게 달라진다는 것입니다. 동일한 객체라도 어느 모델에서는 이상치(outlier)로 식별되지만, 다른 모델에서는 완전히 정상적인 값으로 간주될 수 있기 때문입니다.

대립 분포의 역할과 세 가지 유형

대립 분포는 검정의 검정력(power), 즉 oi가 실제로 이상치일 때 작업 가설이 기각될 확률을 결정하는 데 핵심적인 역할을 합니다. 대립 분포는 크게 세 가지 유형으로 나눌 수 있습니다.

1. 고유 대립 분포 (Inherent Alternative Distribution)

모든 객체가 분포 F에서 나왔다는 작업 가설을 기각하고, 모든 객체가 또 다른 분포 G에서 나왔다는 대립 가설을 채택하는 경우입니다.

H : oi ∈ G, 여기서 i = 1, 2, …, n

F와 G는 서로 다른 분포일 수도 있고, 동일한 분포이면서 모수(parameter)만 다를 수도 있습니다. 단, G는 이상치를 만들어낼 수 있는 형태여야 한다는 제약이 있습니다. 예컨대 평균이나 산포가 다르거나, 긴 꼬리(long tail)를 가지는 경우가 이에 해당합니다.

2. 혼합 대립 분포 (Mixture Alternative Distribution)

혼합 대립 가설에서는 불일치 값을 F 모집단의 이상치로 보지 않고, 다른 모집단에서 유입된 오염(contamination)으로 해석합니다. 이 경우 대립 가설은 다음과 같습니다.

H : oi ∈ (1 – λ)F + λG, 여기서 i = 1, 2, …, n

3. 미끄러짐 대립 분포 (Slippage Alternative Distribution)

이 대립 가설에 따르면, 일부 소수의 객체를 제외한 나머지 객체들은 모수 μ와 σ²를 가진 원래 모델 F로부터 독립적으로 발생합니다. 반면 나머지 객체들은 모수가 변경된 F의 변형된 버전으로부터 얻은 독립 관측값으로 간주됩니다.