통계 기반 알고리즘의 두 가지 유형
통계(statistics)에 기반한 알고리즘은 크게 회귀(Regression)와 베이지안 분류(Bayesian Classification), 두 가지 유형으로 나눌 수 있습니다.
1. 회귀(Regression)
회귀는 입력값(input values)에 근거하여 출력값(output value)을 평가·추정하는 문제를 다룹니다. 분류(classification) 목적으로 사용할 때는 입력값으로 데이터베이스의 값들을 활용하고, 출력값은 해당 클래스를 정의하는 역할을 합니다.
회귀는 분류 문제를 해결하는 데 활용될 수 있지만, 그 외에도 예측(forecasting) 등 다양한 응용 분야에서 널리 사용됩니다. 가장 기본적인 형태의 회귀는 예측 변수(predictor) 하나와 예측 대상 하나만을 포함하는 단순 선형 회귀(simple linear regression)입니다.
회귀를 통해 분류를 구현하는 방법은 다음의 두 가지로 나눌 수 있습니다.
분할(Division) – 데이터를 클래스에 따라 여러 영역(region)으로 나누는 방식입니다.
예측(Prediction) – 출력 클래스의 값을 예측하기 위한 수식(공식)을 만드는 방식입니다.
2. 베이지안 분류(Bayesian Classification)
베이지안 분류는 통계적 분류기(statistical classifier)를 활용해 분류를 수행합니다. 이름 그대로 베이즈 정리(Bayes theorem)에 기반하며, 대용량 데이터베이스에 적용할 때도 높은 효율과 빠른 처리 속도를 보이는 것으로 알려져 있습니다.
베이즈 정리(Bayes Theorem)
X를 하나의 데이터 튜플(data tuple)이라고 하겠습니다. 베이지안 방식에서 X는 일종의 “증거(evidence)”로 취급됩니다. 또한 H를 “데이터 튜플 X가 특정 클래스 C에 속한다”와 같은 하나의 가설(hypothesis)이라고 합시다. 이때 확률 P(H|X)를 구하는 것이 목표가 됩니다. 즉, P(H|X)는 관찰된 데이터 튜플 X라는 “증거”가 주어졌을 때 가설 H가 성립할 확률을 의미합니다.
P(H|X)는 X에 대해 조건화된 H의 사후 확률(posterior probability)입니다. 예를 들어, 데이터 튜플이 나이(age)와 소득(income) 속성으로 정의되는 고객들이라고 가정해 보겠습니다. X는 나이가 30세이고 소득이 20,000루피인 고객이며, H는 “해당 고객이 컴퓨터를 구매할 것이다”라는 가설입니다. 이 경우 P(H|X)는 고객의 나이와 소득이 주어졌을 때, 고객 X가 컴퓨터를 구매할 확률을 나타냅니다.
반면 P(H)는 H의 사전 확률(prior probability)입니다. 예컨대 나이, 소득 등 어떤 정보도 고려하지 않고 임의의 고객이 컴퓨터를 구매할 확률을 말합니다. 사후 확률 P(H|X)가 X에 대한 추가 정보를 반영하는 것과 달리, 사전 확률 P(H)는 X와 무관하게 정의됩니다.
마찬가지로 P(X|H)는 H에 대해 조건화된 X의 사후 확률입니다. 이는 “어떤 고객 X가 나이 30세이고 소득이 20,000루피일 확률”에 해당합니다.
P(H), P(X|H), P(X)는 주어진 데이터로부터 추정할 수 있습니다. 베이즈 정리는 이 세 값을 이용하여 사후 확률 P(H|X)를 계산하는 방법을 제공합니다. 수식은 다음과 같습니다.
$$P(H|X)=\frac{P(X|H)P(H)}{P(X)}$$