베이지안 분류기란 무엇인가?
베이지안(Bayesian) 분류기는 통계학에 기반한 분류기로, 특정 샘플이 어떤 클래스에 속할 확률을 예측하는 데 활용됩니다. 예를 들어, 주어진 데이터가 특정 클래스에 속할 확률을 계산하여 가장 가능성이 높은 클래스를 판별하는 방식입니다. 베이지안 분류기는 대규모 데이터베이스 환경에서도 뛰어난 효율성과 빠른 처리 속도를 보여주는 것으로 알려져 있습니다.
분류 규칙의 학습 과정
클래스가 정의되면 시스템은 분류를 지배하는 규칙을 추론해야 하며, 이를 위해 각 클래스에 대한 설명(description)을 도출할 수 있어야 합니다. 이 설명은 학습 데이터셋의 예측 속성들을 정의해야 하며, 긍정적인 인스턴스만 해당 설명을 만족하고 부정적인 인스턴스는 만족하지 않아야 합니다. 어떤 규칙의 설명이 한 클래스의 모든 긍정적 사례를 포괄하면서 부정적 사례는 하나도 포함하지 않을 때, 그 규칙을 '올바르다(correct)'고 판단합니다.
나이브 베이즈 분류의 기본 개념
모든 속성(attribute)들이 서로 독립적이며 분류 문제에 동등하게 기여한다고 가정하는 단순한 분류 방식을 나이브 베이즈(Naïve Bayes) 분류라고 합니다.
나이브 베이즈 분류가 '나이브(순진)'라고 불리는 이유는 클래스 조건부 독립(class conditional independence)을 가정하기 때문입니다. 즉, 주어진 클래스에서 한 속성 값의 영향은 다른 여러 속성 값들과 무관하다고 봅니다. 이러한 가정은 계산 비용을 크게 줄이기 위해 도입된 것이며, 그래서 '나이브'하게 취급됩니다.
네트워크 위상 학습과 전문가의 역할
관측 가능한 변수들과 학습 레코드로부터 네트워크 위상(topology)을 파악하는 다양한 알고리즘이 존재합니다. 이 문제는 본질적으로 이산 최적화(discrete optimization) 문제에 해당합니다. 인간 전문가들은 일반적으로 분석 대상 도메인에 영향을 미치는 직접적인 조건부 의존 관계를 잘 이해하고 있으며, 이는 네트워크 설계에 큰 도움이 됩니다. 전문가는 직접 의존 관계에 참여하는 노드들의 조건부 확률을 정의해야 합니다.
이렇게 정의된 확률은 나머지 확률 값을 평가하는 데 활용될 수 있습니다. 네트워크 위상이 확인되고 변수들이 관측 가능하다면 네트워크 학습은 비교적 간단합니다. 이 과정은 CPT(조건부 확률 테이블) 항목을 계산하는 것으로, 나이브 베이즈 분류에서 확률을 평가하는 방식과 유사합니다.
나이브 베이즈 분류기의 주요 특징
1. 고립된 노이즈 포인트에 대한 강건성
나이브 베이즈 분류기는 고립된 노이즈(noise) 포인트에 강건합니다. 조건부 확률을 데이터로부터 추정할 때 이러한 노이즈 포인트들이 평균화되어 그 영향이 상쇄되기 때문입니다. 또한 모델 구축 및 분류 과정에서 결측값(missing values)이 있는 인스턴스를 제외함으로써 결측값 문제도 효과적으로 처리할 수 있습니다.
2. 무관한 속성에 대한 강건성
나이브 베이즈 분류기는 무관한(irrelevant) 속성에 대해서도 강건합니다. 만약 Xi가 무관한 속성이라면 P(Xi|Y)는 균등 분포(uniform distribution)를 따르게 됩니다. 따라서 Xi에 대한 클래스 조건부 확률은 사후 확률(posterior probability)의 전체 계산에 아무런 영향을 미치지 않습니다.
3. 상관된 속성이 성능에 미치는 영향
반면, 서로 상관관계가 있는(correlated) 속성들은 나이브 베이즈 분류기의 성능을 저하시킬 수 있습니다. 이는 조건부 독립 가정이 더 이상 성립하지 않기 때문입니다. 다음 확률을 살펴보겠습니다.
P(A=0|Y=0) = 0.4, P(A=1|Y=0) = 0.6
P(A=0|Y=1) = 0.6, P(A=1|Y=1) = 0.4
여기서 A는 이진(binary) 속성이고 Y는 이진 클래스 변수입니다. Y=0일 때 A와 완전히 상관된 또 다른 이진 속성 B가 있고, Y=1일 때는 A와 독립이라고 가정해 보겠습니다. 편의상 B의 클래스 조건부 확률은 A와 동일하다고 간주합니다. 이처럼 속성 간 상관관계가 존재하면 조건부 독립 가정이 깨지므로, 실제 적용 시에는 속성 선택(feature selection)을 통해 상관성을 줄이는 것이 중요합니다.