Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

연관 패턴 평가란? 흥미로운 규칙을 골라내는 객관적·주관적 기준

연관 패턴 평가가 필요한 이유

연관 분석(association analysis) 알고리즘은 어마어마한 수의 패턴을 생성할 수 있습니다. 예를 들어 데이터 집합에 항목이 여섯 개뿐이더라도, 특정 지지도와 신뢰도 임계값에서 수천 개의 연관 규칙이 만들어질 수 있습니다. 실제 금융 데이터베이스처럼 규모와 차원이 큰 데이터에서는 수천 개, 심지어 수백만 개의 패턴이 손쉽게 생성되며, 그중 상당수는 전혀 가치 없는 것들입니다.

생성된 패턴 가운데 가장 흥미로운 것들을 골라내는 일은 결코 쉬운 작업이 아닙니다. 어떤 사람에게는 쓸모없는 정보가 다른 사람에게는 보물이 될 수 있기 때문입니다. 따라서 연관 패턴의 품질을 평가하기 위한 잘 정립된 방법론을 마련하는 것이 필수적입니다.

객관적 평가 기준: 통계적 접근

첫 번째 평가 기준은 통계적 논거에서 출발합니다. 서로 독립적인 항목들로 구성되었거나 거의 모든 트랜잭션을 포괄하는 패턴은 데이터에 실제로 존재하지 않는 가짜 연관성(spurious association)을 드러낼 수 있으므로 흥미롭지 않은 것으로 간주됩니다.

이런 패턴은 데이터에서 도출한 통계량을 바탕으로 패턴의 흥미도를 판단하는 객관적 흥미도 측도(objective interestingness measure)를 사용하면 제거할 수 있습니다. 대표적인 객관적 흥미도 측도로는 지지도(support), 신뢰도(confidence), 상관계수(correlation) 등이 있습니다.

주관적 평가 기준: 도메인 지식의 반영

두 번째 평가 기준은 주관적 논거에 기반합니다. 패턴이 데이터에 대한 예상치 못한 통찰을 제공하거나, 수익성 있는 의사결정으로 이어질 수 있는 실행 가능한(actionable) 지식을 뒷받침하지 못한다면 주관적으로 흥미롭지 않다고 판단됩니다.

예를 들어 {버터}→{빵}이라는 규칙은 지지도와 신뢰도가 아무리 높아도 그 관계가 너무나 자명하기 때문에 흥미롭지 않습니다.

반면 {기저귀}→{맥주}라는 규칙은 관계 자체가 예상 밖이며, 소매업자에게 새로운 교차 판매(cross-selling) 기회를 시사할 수 있으므로 흥미로운 패턴입니다. 다만 주관적 지식을 패턴 평가에 통합하는 작업은 도메인 전문가로부터 상당한 사전 지식을 요구하기 때문에 매우 복잡한 과제입니다.

주관적 지식을 패턴 발견에 통합하는 세 가지 방법

1. 시각화(Visualization)

사용자가 분석 과정에 직접 참여할 수 있는 사용자 친화적인 환경이 필요합니다. 이를 통해 도메인 전문가가 데이터 마이닝 시스템과 상호작용하면서 발견된 패턴을 탐색하고 검증할 수 있습니다.

2. 템플릿 기반 접근법(Template-based Approach)

사용자가 마이닝 알고리즘이 추출할 패턴의 유형을 직접 제약할 수 있게 합니다. 추출된 모든 규칙을 일일이 나열하는 대신, 사용자가 지정한 템플릿에 부합하는 규칙만 선별하여 제공함으로써 불필요한 정보의 홍수를 막습니다.

3. 주관적 흥미도 측도(Subjective Interestingness Measure)

개념 계층(concept hierarchy)이나 항목의 이익률(profit margin) 같은 도메인 지식에 기반하여 주관적 측도를 정의할 수 있습니다. 이 측도는 접근은 가능하지만 실행 가능하지 않은(non-actionable) 패턴을 걸러내는 필터로 활용됩니다.