단일 속성 평가자(Single-Attribute Evaluator)는 데이터 마이닝에서 각 속성을 개별적으로 평가하여 그 중요도를 측정하는 방법입니다. 이 평가자는 Ranker 검색 방법과 함께 사용되어 순위 목록을 생성할 수 있으며, 이때 Ranker는 지정된 수만큼 하위 속성을 제거합니다. 또한 RankSearch 방법에서도 활용됩니다.
주요 단일 속성 평가자 종류
Relief Attribute Eval
Relief는 인스턴스 기반(instance-based) 평가 방식입니다. 인스턴스를 무작위로 샘플링한 후, 동일 클래스와 다른 클래스에 속하는 인접 인스턴스들을 검사합니다. 이산형(discrete) 및 연속형(continuous) 클래스 데이터 모두에 적용 가능하며, 파라미터를 통해 샘플링할 인스턴스 수, 검사할 이웃 수, 거리 기반 가중치 적용 여부, 그리고 거리에 따라 가중치가 얼마나 빠르게 감쇠하는지를 결정하는 지수 함수 등을 설정할 수 있습니다.
InfoGain Attribute Eval
InfoGain은 각 속성이 클래스와 관련하여 지니는 정보 획득량(information gain)을 계산해 속성을 평가합니다. 수치형 속성은 먼저 MDL(Minimum Description Length) 기반 이산화 기법으로 변환됩니다. 이 방법과 뒤에서 소개할 세 가지 방법은 결측값(missing value)을 하나의 독립적인 값으로 취급하거나, 다른 값들의 빈도에 비례하여 분배하는 방식으로 처리할 수 있습니다.
Chi-Squared Attribute Eval
카이제곱 평가자는 클래스와 관련된 카이제곱 통계량(chi-squared statistic)을 계산하여 속성을 평가합니다. 범주형 데이터에서 속성과 클래스 간의 독립성 여부를 판단하는 데 유용하게 사용됩니다.
Gain-Ratio Attribute Eval
획득 비율(Gain Ratio) 평가자는 클래스에 대한 속성의 획득 비율을 계산하여 속성을 평가합니다. 정보 획득량이 많은 속성이라도 값의 종류가 지나치게 많으면 편향이 발생할 수 있는데, 획득 비율은 이러한 편향을 보정해 줍니다.
Symmetrical Uncertainty Attribute Eval
대칭 불확실성(Symmetrical Uncertainty) 평가자는 클래스와 속성 간의 대칭 불확실성 값을 계산하여 속성을 평가합니다. 이는 정보 획득량을 정규화한 값으로, 속성과 클래스 사이의 상호 의존성을 균형 있게 반영합니다.
OneR Attribute Eval
OneR 평가자는 OneR 분류기에서 사용되는 순수 오차율(one-error rate) 측도를 활용합니다. OneR처럼 학습 데이터를 직접 사용해 계산할 수도 있고, 내부 교차 검증(internal cross-validation)을 사용할 수도 있습니다. 이때 폴드(fold) 수는 파라미터로 지정됩니다. 또한 OneR의 단순 이산화 방식을 선택할 수 있으며, 최소 버킷 크기(minimum bucket size)가 파라미터로 제공됩니다.
SVM Attribute Eval
SVM 평가자는 선형 서포트 벡터 머신(linear support vector machine)을 이용한 재귀적 특징 제거(recursive feature elimination) 방식으로 속성을 평가합니다. 속성들은 계수(coefficient) 크기를 기준으로 하나씩 제거되며, 매번 모델을 다시 학습시킵니다.
특정 비율만큼 속성을 제거하다가 일정 개수의 속성이 남으면, 고정 개수 방식으로 전환할 수 있습니다. 이렇게 하면 많은 속성을 빠르게 제거한 후 남은 속성들을 더 세밀하게 검토할 수 있습니다.
서포트 벡터 머신에는 복잡도(complexity), 엡실론(epsilon), 허용 오차(tolerance), 사용할 필터링 방법 등 다양한 파라미터가 전달됩니다.
속성 변환 기반 평가 방법
주성분 분석(Principal Components)
주성분 분석은 속성 집합 자체를 변환합니다. 새로운 속성들은 고유값(eigenvalue) 순서대로 정렬되며, 필요에 따라 주어진 분산 비율(기본값 95%)을 설명하기에 충분한 고유벡터만 선택하여 부분 집합을 구성할 수 있습니다. 최종적으로 축소된 데이터는 원래 공간으로 역변환할 수도 있습니다.
잠재 의미 분석(Latent Semantic Analysis)
잠재 의미 분석(LSA)은 학습 데이터에 특이값 분해(singular value decomposition)를 적용합니다. 특이값 분해는 주성분 분석과 밀접한 관련이 있습니다. 두 방법 모두 원래 속성 값들의 선형 조합으로 이루어진 방향을 생성하지만, 차이점은 특이값 분해가 상관 행렬이나 공분산 행렬이 아닌 원본 데이터 값 자체를 담은 행렬로부터 계산된다는 점입니다.