속성 선택 측정이란 무엇인가?
속성 선택 측정(attribute selection measure)은 클래스 레이블이 부여된 학습 튜플로 구성된 데이터 파티션 D를 개별 클래스별로 '가장 잘' 분리하는 분할 검사(splitting test)를 고르기 위한 휴리스틱(경험적 판단 기준)입니다.
분할 기준에 따라 D가 더 작은 파티션으로 나뉘었을 때, 이상적으로는 모든 파티션이 순수(pure)해야 합니다. 즉, 특정 파티션에 속한 튜플들이 모두 동일한 클래스에 속하는 상태가 가장 바람직합니다.
개념적으로 '최선의' 분할 기준이란 바로 그러한 순수한 분할에 가장 근접한 결과를 만들어내는 방식을 의미합니다. 속성 선택 측정은 특정 노드에서 튜플을 어떻게 나눌지 결정하기 때문에 분할 규칙(splitting rule)이라고도 불립니다.
속성 선택 측정은 주어진 학습 튜플에 대해 모든 속성에 대한 순위를 매깁니다. 그중 해당 측정 기준에서 가장 좋은 평가를 받은 속성이 분할 속성(splitting attribute)으로 선택됩니다.
만약 분할 속성이 연속값(continuous-valued)이거나 이진 트리(binary tree) 구조로 제한되어 있다면, 분할 기준의 일부로서 분할 지점(split point) 또는 분할 부분집합(splitting subset) 역시 함께 결정되어야 합니다.
파티션 D에 대해 생성된 트리 노드에는 분할 기준이 라벨로 붙고, 기준의 각 결과마다 가지(branch)가 생성되며, 튜플들은 그에 따라 분리됩니다. 대표적인 속성 선택 측정 방법으로는 정보 획득량(information gain), 이득 비율(gain ratio), 지니 지수(Gini index) 세 가지가 널리 알려져 있습니다.
1. 정보 획득량(Information Gain)
정보 획득량은 하나의 클래스에 대해 최대한 많은 정보를 제공하는 최적의 속성·특징을 선택하는 데 사용됩니다. 루트 노드에서 리프 노드로 내려가는 과정에서 엔트로피(entropy) 수준을 줄여나가는 방식을 따릅니다.
노드 N이 파티션 D의 튜플들을 담고 있다고 할 때, 정보 획득량이 가장 큰 속성이 노드 N의 분할 속성으로 선택됩니다. 이 속성은 결과적으로 생성되는 하위 파티션들의 튜플을 분류하는 데 필요한 정보량을 최소화하며, 하위 파티션 내부의 무작위성, 즉 '불순도(impurity)'가 가장 낮음을 의미합니다.
2. 이득 비율(Gain Ratio)
정보 획득량 측정은 결과(outcome)의 수가 많은 검사에 편향되어 있다는 한계가 있습니다. 즉, 값의 종류가 지나치게 많은 속성을 선호하는 경향이 있습니다. 예를 들어 제품 ID(product ID)처럼 각 레코드를 고유하게 식별하는 속성을 생각해 볼 수 있습니다.
제품 ID를 기준으로 분할하면 각 파티션에 튜플이 하나씩만 포함된 수많은 파티션이 만들어집니다. 모든 파티션이 순수하기 때문에, 이 분할 방식에 기반한 데이터 집합 D를 분류하는 데 필요한 정보량은 Infoproduct_ID(D) = 0이 됩니다. 그러나 이러한 분할은 실제 분류 성능에 전혀 도움이 되지 않으며, 이 문제를 보완하기 위해 고안된 것이 바로 이득 비율입니다.
3. 지니 지수(Gini Index)
지니 지수는 CART(Classification And Regression Tree) 알고리즘에서 사용되는 측정 기준입니다. 지니 지수는 데이터 파티션 또는 학습 튜플 집합인 D의 불순도를 다음과 같이 계산합니다.
Gini(D) = 1 − Σ(i=1~m) pᵢ²
여기서 pi는 D에 속한 임의의 튜플이 클래스 Ci에 속할 확률이며, |Ci,D| / |D|로 계산됩니다. 지니 값이 작을수록 해당 파티션의 순도가 높다는 것을 의미합니다.