분석적 특성화란 무엇인가?
속성 관련성 분석(attribute relevance analysis)은 데이터를 사전 처리하기 위한 통계적 접근법으로, 개념 묘사(concept description) 과정에서 제거해도 무방한 불필요한 속성을 걸러내거나 관련성 높은 속성의 순위를 매기는 데 활용됩니다. 이러한 전처리 단계를 클래스 특성화(class characterization) 또는 클래스 비교(class comparison) 과정에 통합한 것을 분석적 특성화(analytical characterization)라고 정의합니다.
데이터 판별(Data Discrimination)
데이터 판별은 목표 클래스(target class)와 대조 클래스(contrasting class)라는 두 클래스 간의 객체들이 가진 일반적인 특징을 비교하여 판별 규칙(discrimination rule)을 도출하는 작업입니다. 즉, 대상 클래스 데이터 객체의 일반적 특성을 하나 또는 여러 개의 대조 클래스 객체들의 일반적 특성과 비교하는 것이며, 사용자가 직접 목표 클래스와 대조 클래스를 정의할 수 있습니다.
데이터 판별에 사용되는 방법은 데이터 특성화에 쓰이는 기법과 매우 유사하지만, 분석 결과에 비교 측정치(comparative measures)가 포함된다는 점에서 차이가 있습니다.
속성 관련성 분석이 필요한 이유
- 어떤 차원(dimension)을 분석에 포함해야 하는지 결정할 수 있습니다.
- 높은 수준의 일반화를 달성할 수 있습니다.
- 속성의 수를 줄여 패턴을 더욱 쉽게 파악할 수 있도록 도와줍니다.
속성 관련성 분석의 기본 개념은 주어진 클래스나 개념에 대해 속성의 관련성을 정량적으로 계산할 수 있는 측도(measure)를 평가하는 것입니다. 대표적인 측도로는 정보 획득량(information gain), 모호성(ambiguity), 상관계수(correlation coefficient) 등이 있습니다.
속성 관련성 분석의 수행 단계
1단계: 데이터 수집
질의 처리(query processing)를 통해 목표 클래스와 대조 클래스 양쪽에 해당하는 데이터를 수집합니다.
2단계: 보수적 AOI를 이용한 예비 관련성 분석
이 단계에서는 선택된 관련성 측도를 적용할 차원과 속성의 집합을 식별합니다. 서로 다른 값을 지나치게 많이 가진 속성을 제거하는 방식으로 속성 지향 귀납(AOI, Attribute-Oriented Induction)을 활용해 데이터에 대한 예비 분석을 수행합니다. 이때 보수적으로 접근하여, 속성 일반화 임계값을 충분히 크게 설정함으로써 더 많은 속성이 이후의 관련성 분석 단계에서 선택된 측도로 평가될 수 있도록 해야 합니다.
3단계: 속성 제거(Remove)
선택한 관련성 분석 측도를 이용해 무관하거나 관련성이 약한 속성들을 제거합니다.
4단계: AOI를 이용한 개념 묘사 생성
2단계보다 덜 보수적인 속성 일반화 임계값을 적용하여 AOI를 수행합니다. 묘사적 마이닝 기능이 클래스 특성화(class characterization)라면 원래 목표 클래스의 작업 관계(working relation)만 포함되며, 클래스 비교(class comparison)라면 목표 클래스와 대조 클래스의 작업 관계가 모두 포함됩니다.