Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

베이지안 믿음 네트워크(Bayesian Belief Network)란? 개념부터 구성 요소까지 총정리

베이지안 믿음 네트워크의 등장 배경

나이브 베이즈 분류기(Naïve Bayesian Classifier)는 클래스 조건부 독립(class conditional independence) 가정을 전제로 합니다. 즉, 튜플의 클래스 레이블이 주어졌을 때 각 속성값들은 서로 조건부로 독립이라고 가정하는데, 이를 통해 계산 과정이 크게 단순화됩니다.

이 가정이 실제 데이터에서 참에 가까울 때, 나이브 베이즈 분류기는 다른 여러 분류기와 비교해도 매우 효율적으로 작동합니다. 하지만 현실 세계의 많은 변수들은 서로 독립적이지 않은 경우가 많습니다. 이러한 한계를 보완하기 위해 등장한 것이 바로 베이지안 믿음 네트워크(Bayesian Belief Network)입니다.

베이지안 믿음 네트워크란 무엇인가?

베이지안 믿음 네트워크는 결합 조건부 확률 분포(joint conditional probability distribution)를 정의하는 확률 모델입니다. 이 모델은 변수들의 부분 집합 사이에서 클래스 조건부 독립성을 표현할 수 있도록 해주며, 인과 관계(causal relationship)를 그래프 구조로 나타내고 그 위에서 학습을 수행할 수 있습니다.

학습된 베이지안 믿음 네트워크는 분류(classification) 작업에 활용됩니다. 베이지안 믿음 네트워크는 '믿음 네트워크(belief network)', '베이지안 네트워크(Bayesian network)', '확률적 네트워크(probabilistic network)' 등으로도 불립니다.

베이지안 믿음 네트워크의 두 가지 핵심 구성 요소

민감 벨리프 네트워크는 다음 두 가지 구성 요소로 표현됩니다.

1. 방향성 비순환 그래프(DAG, Directed Acyclic Graph)

2. 조건부 확률 테이블(CPT, Conditional Probability Table)의 집합

방향성 비순환 그래프(DAG)와 노드

DAG 내의 모든 노드(node)는 하나의 확률 변수(random variable)를 나타냅니다. 이 변수들은 이산형(discrete) 또는 연속형(continuous) 값을 가질 수 있습니다.

변수는 데이터에 명시적으로 주어진 속성에 해당할 수도 있고, 관계를 형성한다고 여겨지는 숨겨진 변수(hidden variable)에 해당할 수도 있습니다. 예를 들어 의료 기록의 경우, 숨겨진 변수는 특정 증후군(syndrome)을 나타낼 수 있으며, 이 증후군은 함께 나타날 때 특정 질병을 확정적으로 식별할 수 있는 여러 증상들을 설명합니다.

아크(Arc)와 확률적 의존성

그래프의 각 아크(arc)는 확률적 의존성(probabilistic dependence)을 정의합니다. 노드 Y에서 노드 Z로 아크가 그려져 있다면, Y는 Z의 부모(parent) 또는 직접적인 선행 노드이며, Z는 Y의 자손(descendant)입니다.

핵심 원칙은 다음과 같습니다. 모든 변수는 부모 노드가 주어졌을 때, 그래프 상의 자신의 자손이 아닌(non-descendant) 노드들과 조건부로 독립입니다.

조건부 확률 테이블(CPT)

베이지안 믿음 네트워크에서는 모든 변수마다 하나의 조건부 확률 테이블(CPT)이 존재합니다. 변수 Y에 대한 CPT는 조건부 분포 P(Y | Parents(Y))를 정의하며, 여기서 Parents(Y)는 Y의 부모 노드들을 의미합니다.

출력 노드와 분류 절차

네트워크 내의 하나 이상의 노드를 '출력(output)' 노드로 지정할 수 있으며, 출력 노드는 클래스 레이블 속성을 나타냅니다. 출력 노드는 두 개 이상 존재할 수도 있습니다.

네트워크에는 추론(inference)과 학습(learning)에 사용할 수 있는 다양한 알고리즘이 적용될 수 있습니다. 흥미로운 점은 분류 절차가 단일 클래스 레이블만 반환하는 것이 아니라, 각 클래스가 가질 확률을 보여주는 확률 분포(probability distribution)를 반환할 수 있다는 것입니다. 이를 통해 결과에 대한 불확실성까지 함께 전달할 수 있습니다.

베이지안 믿음 네트워크의 주요 응용 분야

베이지안 믿음 네트워크는 여러 잘 알려진 문제들을 모델링하는 데 활용됩니다. 대표적인 예로 유전자 연관 분석(genetic linkage analysis)이 있으며, 이는 염색체 위에 유전자를 위치시키는 매핑(mapping) 작업입니다. 유전자 연관 문제를 베이지안 네트워크 추론의 형태로 공식화하고 최첨단 알고리즘을 활용함으로써, 분석의 확장성(scalability)이 크게 향상되었습니다.

그 외에도 베이지안 믿음 네트워크의 도움을 받은 응용 분야는 다음과 같습니다.

  • 컴퓨터 비전(computer vision)
  • 영상 복원(image restoration) 및 입체 시각(stereo vision)
  • 문서 및 텍스트 분석
  • 의사결정 지원 시스템(decision support systems)
  • 민감도 분석(sensitivity analysis)

다양한 응용 문제들이 베이지안 네트워크 추론으로 환원될 수 있다는 점은 큰 장점입니다. 응용 분야마다 별도의 특화 알고리즘을 새로 개발해야 하는 부담을 줄여주기 때문입니다.