클래스 비교란 무엇인가?
클래스 판별(class discrimination) 또는 클래스 비교(class comparison)는 대상 클래스(target class)를 대조 클래스(contrasting classes)와 구분 짓는 특성화 정보를 추출하는 데이터 마이닝 기법입니다. 대상 클래스와 대조 클래스가 서로 비교 가능하려면 두 클래스가 동일한 차원과 속성을 공유해야 합니다.
예를 들어 '사람', '주소', '원소'라는 세 클래스는 서로 비교할 수 없습니다. 반면 최근 3년간의 매출 데이터는 비교 가능한 클래스이며, 컴퓨터공학 지원자와 물리학 지원자처럼 성격이 유사한 그룹 역시 비교 대상이 될 수 있습니다.
여러 클래스에 대한 비교 확장
개발된 클래스 비교 기법은 두 개 이상의 비교 가능한 클래스를 다루는 상황으로도 확장할 수 있습니다. 예를 들어, 클래스 특성화를 위해 정의된 속성 일반화(attribute generalization) 과정을 수정하면, 비교 대상인 모든 클래스에 대해 일반화가 동기적으로(synchronously) 수행되도록 만들 수 있습니다. 이를 통해 여러 클래스의 속성들이 유사한 추상화 수준으로 일반화됩니다.
구체적인 예를 들어 보겠습니다. AllElectronics의 2003년 매출 데이터와 2004년 매출 데이터가 주어져 있고, 이 두 클래스를 비교한다고 가정합시다. 위치(location) 차원을 도시(city), 주(province/state), 국가(country) 수준의 추상화 단계로 나눌 때, 모든 데이터 클래스는 반드시 동일한 위치 수준으로 일반화되어야 합니다.
즉, 모든 데이터가 동시에 도시 수준, 또는 주 수준, 또는 국가 수준으로 일반화되어야 한다는 의미입니다. 2003년 밴쿠버의 매출과 2004년 미국 전체의 매출처럼 서로 다른 수준으로 일반화된 데이터를 비교하는 것보다, 같은 수준에서 비교하는 것이 훨씬 더 의미 있는 분석 결과를 제공합니다.
물론 사용자는 자동화된 동기식 비교 방식을 자신이 원하는 설정으로 덮어쓸(overwrite) 수 있는 옵션을 가져야 합니다.
클래스 비교의 수행 절차
클래스 비교는 일반적으로 다음과 같은 단계를 거쳐 수행됩니다.
1. 데이터 수집 (Data Collection)
쿼리 처리(query processing)를 통해 데이터베이스에서 관련 레코드 집합을 수집하고, 이를 대상 클래스와 하나 이상의 대조 클래스로 분리합니다.
2. 차원 관련성 분석 (Dimension Relevance Analysis)
차원이 여러 개 존재하는 경우, 차원 관련성 분석을 수행하여 이후 분석에 활용할 고관련성 차원만 선별합니다. 불필요한 차원을 제거함으로써 분석의 효율성과 정확성을 높일 수 있습니다.
3. 동기적 일반화 (Synchronous Generalization)
사용자 또는 전문가가 지정한 차원 임계값(threshold)에 따라 대상 클래스에 일반화를 수행합니다. 그 결과 주요 대상 클래스 관계(prime target class relation)가 도출됩니다.
4. 비교 결과 표현 (Presentation of the Derived Comparison)
도출된 클래스 비교 설명은 표, 그래프, 규칙 등 다양한 형태로 제시될 수 있습니다. 이러한 표현에는 대상 클래스와 대조 클래스 간의 비교를 반영하는 count%(백분율 카운트)와 같은 '대조(contrasting)' 측정값이 일반적으로 포함됩니다.
OLAP 연산을 활용한 결과 조정
사용자는 드릴다운(drill-down), 롤업(roll-up) 등 다양한 OLAP 연산을 대상 클래스와 대조 클래스에 적용하여 비교 설명을 자유롭게 조정할 수 있습니다. 이를 통해 요약된 수준에서 세부 수준까지, 필요한 만큼 유연하게 데이터를 탐색하고 비교 분석을 심화할 수 있습니다.