Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

지지도 기댓값을 결정하는 두 가지 핵심 기법: 개념 위계와 간접 연관

데이터 마이닝에서 패턴의 지지도 기댓값(expected support)을 결정하는 방법은 크게 두 가지가 있습니다. 하나는 개념 위계(concept hierarchy)를 활용하는 방식이고, 다른 하나는 간접 연관(indirect association)이라 불리는 이웃 기반(neighborhood-based) 접근법입니다.

개념 위계에 기반한 지지도 기댓값

객관적인 측도만으로는 흥미 없는 저빈도(infrequent) 패턴을 걸러내기에 충분하지 않습니다. 예를 들어 빵과 노트북 컴퓨터는 각각 자주 구매되는 품목입니다. 이 둘로 이루어진 품목 집합 {빵, 노트북}은 저빈도이며 음의 상관관계를 보일 수 있지만, 도메인 전문가 입장에서는 두 품목이 함께 구매되지 않는 것이 당연해 보이기 때문에 특별히 흥미롭지 않습니다. 따라서 이런 불필요한 저빈도 패턴의 생성을 막으려면 지지도 기댓값을 정하는 주관적(subjective) 접근이 필요합니다.

간접 연관에 기반한 지지도 기댓값

고객들이 거의 함께 구매하지 않는 품목 쌍 (a, b)을 생각해 봅시다. 만약 a와 b가 빵과 DVD 플레이어처럼 서로 관련 없는 품목이라면, 두 품목의 지지도는 낮을 것으로 예상됩니다. 반대로 a와 b가 서로 관련 있는 품목이라면 지지도는 높아야 합니다. 앞서 개념 위계를 이용해 지지도 기댓값을 계산하는 방법을 살펴보았는데, 여기서는 두 품목과 함께 자주 구매되는 '다른 품목들'을 관찰함으로써 품목 쌍 사이의 지지도 기댓값을 결정하는 방법을 소개합니다.

예를 들어 침낭을 구매하는 고객은 다른 캠핑 용품도 함께 구매하는 경향이 있고, 데스크톱 컴퓨터를 구매하는 고객은 광학 마우스나 프린터 같은 컴퓨터 주변기기를 함께 구매하는 경향이 있습니다. 그런데 침낭과 데스크톱 컴퓨터 양쪽 모두와 함께 자주 구매되는 품목이 없다면, 이처럼 관련 없는 두 품목의 지지도는 낮을 것으로 예상됩니다.

반면, 다이어트 탄산음료와 일반 탄산음료는 감자칩이나 쿠키와 함께 구매되는 경우가 많습니다. 개념 위계를 사용하지 않더라도 이 두 품목은 적당히 관련이 있다고 볼 수 있으며, 지지도 역시 높아야 합니다. 그런데 실제 지지도가 낮다면, 다이어트 탄산음료와 일반 탄산음료는 주목할 만한 저빈도 패턴을 형성하게 됩니다. 이렇게 나타나는 패턴을 간접 연관 패턴(indirect association pattern)이라고 부릅니다.

간접 연관의 응용 분야

간접 연관은 다양한 분야에서 활용됩니다. 장바구니 분석(market basket analysis)에서는 a와 b가 데스크톱과 노트북 컴퓨터처럼 경쟁 관계에 있는 품목을 나타낼 수 있습니다. 텍스트 마이닝에서는 간접 연관을 통해 동의어, 반의어, 또는 여러 문맥에서 사용되는 단어들을 식별할 수 있습니다. 예를 들어 문서 집합이 주어졌을 때, 'data'라는 단어는 중개자(mediator)인 'mining'을 통해 'gold'와 간접적으로 연관될 수 있습니다.