데이터 마이닝에서 지지도와 신뢰도를 사용하는 이유
지지도(Support)의 중요성
지지도는 연관 규칙 분석에서 매우 중요한 척도입니다. 지지도가 지나치게 낮은 규칙은 우연히 쉽게 나타날 수 있어 신뢰하기 어렵기 때문입니다.
비즈니스 관점에서도 마찬가지입니다. 지지도가 낮은 규칙은 실질적인 가치가 떨어집니다. 사용자가 함께 구매하는 경우가 드문 상품을 대상으로 프로모션을 진행해도 수익을 기대하기 어렵기 때문입니다.
연관 규칙이란?
연관 규칙(association rule)은 X→Y 형태의 함축 표현으로, 여기서 X와 Y는 서로 교집합이 없는(disjoint) 아이템 집합입니다. 즉, X∩Y=∅를 만족합니다.
연관 규칙의 강도(strength)는 지지도와 신뢰도를 통해 계산할 수 있습니다. 지지도는 주어진 데이터셋에서 해당 규칙이 얼마나 널리 적용되는지를 나타내며, 신뢰도는 X를 포함하는 거래 중에서 Y가 등장하는 빈도를 결정합니다.
신뢰도(Confidence)의 의미
신뢰도는 규칙이 만들어내는 추론의 정확성을 측정합니다. X→Y라는 규칙에서 신뢰도가 클수록, X를 포함하는 거래에 Y가 존재할 가능성이 높다고 판단할 수 있습니다.
신뢰도는 통계적으로 X가 주어졌을 때 Y가 발생할 조건부 확률의 추정치로도 해석됩니다.
연관 분석 결과 해석 시 주의점
연관 분석 결과는 반드시 신중하게 해석해야 합니다. 연관 규칙이 도출한 추론이 곧 인과관계(causality)를 의미하지는 않기 때문입니다.
연관 규칙은 규칙의 선행부(antecedent)와 후행부(consequent)에 있는 요소들 사이에 강한 동반 출현(co-occurrence) 관계가 있음을 보여줄 뿐입니다. 진정한 인과관계를 파악하려면 데이터 내 원인 속성과 결과 속성에 대한 도메인 지식이 필요하며, 일반적으로 시간의 흐름에 따라 나타나는 관계까지 함께 고려해야 합니다.
연관 규칙 마이닝 문제의 정의
연관 규칙 마이닝 문제는 다음과 같이 정의할 수 있습니다.
연관 규칙 발견(Association Rule Discovery) — 거래 집합 T가 주어졌을 때, 지지도가 최소 지지도(minsup) 이상이고 신뢰도가 최소 신뢰도(minconf) 이상인 규칙들을 모두 찾아냅니다.
무차별 대입 방식의 한계
가장 단순한 방법은 가능한 모든 규칙에 대해 지지도와 신뢰도를 일일이 계산하는 무차별 대입(brute-force) 방식입니다. 그러나 데이터셋에서 도출될 수 있는 규칙의 수는 지수적으로 증가하기 때문에 이 방법은 계산 비용이 매우 커서 현실적으로 비효율적입니다.
효율적인 알고리즘 설계 전략
알고리즘 성능을 개선하기 위한 핵심 아이디어는 지지도와 신뢰도 요구 조건을 분리(decouple)하는 것입니다. 예를 들어 어떤 아이템 집합이 드물게(infrequent) 나타난다면, 신뢰도 값을 계산할 필요 없이 해당 집합에서 파생되는 후보 규칙들을 즉시 가지치기(pruning)할 수 있습니다.
따라서 대부분의 연관 규칙 마이닝 알고리즘이 공통적으로 채택하는 전략은 문제를 두 가지 주요 하위 작업으로 분해하는 것입니다.
두 가지 하위 작업
1. 빈발 아이템 집합 생성(Frequent Itemset Generation)
목표는 미리 정한 임계값(최소 지지도)을 충족하는 아이템 집합을 모두 찾아내는 것입니다. 이렇게 발견된 아이템 집합을 빈발 아이템 집합(frequent itemsets)이라고 부릅니다.
2. 규칙 생성(Rule Generation)
목표는 앞 단계에서 발견한 빈발 아이템 집합으로부터 높은 신뢰도를 가진 규칙들을 추출하는 것입니다. 이렇게 얻어진 규칙을 강규칙(strong rules)이라고 합니다.
일반적으로 빈발 아이템 집합 생성 단계가 규칙 생성 단계보다 계산 비용이 훨씬 크기 때문에, 전체 알고리즘의 효율은 빈발 아이템 집합을 얼마나 효과적으로 탐색하느냐에 달려 있다고 할 수 있습니다.