연관 규칙 학습(Association Rule Learning)이란?
연관 규칙 학습은 비지도 학습(Unsupervised Learning) 기법의 하나로, 한 데이터 요소가 다른 데이터 요소에 얼마나 의존하는지를 검증하고 그 관계를 매핑함으로써 보다 상업적인 가치를 창출할 수 있도록 돕는 기술입니다. 데이터셋 내 변수들 사이에 숨겨진 흥미로운 관계나 연관성을 발견하는 것이 핵심 목표이며, 데이터베이스 안의 변수들 간 의미 있는 패턴을 찾기 위해 여러 가지 규칙에 기반합니다.
연관 규칙 학습은 머신러닝의 필수 개념 중 하나로, 장바구니 분석(Market Basket Analysis), 웹 사용 패턴 마이닝(Web Usage Mining), 지속 생산 공정 등 다양한 분야에서 활용됩니다.
장바구니 분석과 연관 규칙의 활용
장바구니 분석은 대형 소매업체들이 고객의 구매 습관을 파악하기 위해 널리 사용하는 대표적인 접근 방식입니다. 고객들이 장바구니에 함께 담는 서로 다른 상품들 사이의 연관성을 분석함으로써 구매 행동 패턴을 도출합니다.
이러한 연관성을 발견하면 소매업체는 어떤 상품이 함께 구매되는 경향이 있는지 파악하여 효과적인 마케팅 전략을 세울 수 있습니다. 선택적 마케팅(selective marketing)을 실행하고 진열대 배치를 계획하는 데 활용되어, 결과적으로 매출 증대로 이어질 수 있습니다.
다단계 연관 규칙(Multi-level Association Rules)
다단계 연관 규칙의 가장 대표적인 적용 분야 역시 장바구니 분석입니다. 자주 함께 구매되는 상품 집합을 탐색하여 고객의 구매 습관을 연구하며, 이때 개념 계층(concept hierarchy) 구조가 활용됩니다.
다차원 연관 규칙(Multidimensional Association Rules)의 정의
두 개 이상의 차원 또는 술어(predicate)를 포함하는 연관 규칙을 다차원 연관 규칙이라고 부릅니다. 예시는 다음과 같습니다.
Age(X, "20...29") ∧ Occupation(X, "Student") ⇒ Buys(X, "Laptop")
차원 간 연관 규칙(Interdimensional Association Rules)
위 규칙은 나이(age), 직업(occupation), 구매(buys)라는 세 개의 술어를 포함하며, 각 술어가 규칙 안에서 단 한 번만 나타납니다. 이처럼 반복 없이 서로 다른 차원의 속성들을 결합한 규칙을 차원 간(interdimensional) 연관 규칙이라고 합니다.
혼합 차원 연관 규칙(Hybrid-dimension Association Rules)
반면 동일한 술어가 반복되거나 일부 술어가 여러 번 등장하는 규칙은 혼합 차원(hybrid-dimension) 연관 규칙이라고 부릅니다. 예시는 다음과 같습니다.
Age(X, "20...29") ∧ Buys(X, "Laptop") ⇒ Buys(X, "Printer")
이 규칙에서는 'Buys'라는 술어가 두 번 등장하므로 혼합 차원 연관 규칙에 해당합니다.
속성 유형: 범주형 속성과 수치형 속성
다차원 연관 규칙을 마이닝할 때 데이터베이스의 속성은 범주형(categorical) 또는 수치형(quantitative)이어야 합니다.
- 범주형 속성: 가능한 값의 개수가 유한하며 값들 사이에 순서가 존재하지 않습니다. 명목형(nominal) 속성이라고도 불립니다.
- 수치형 속성: 숫자 값을 가지며 값들 사이에 암묵적인 순서가 존재합니다.
수치형 속성을 처리하는 세 가지 기본 접근 방식
- 사전 정의된 개념 계층 기반 이산화: 마이닝을 수행하기 전에 미리 정의된 개념 계층을 사용해 수치형 속성을 이산화(discretization)합니다. 이산화된 숫자 속성과 그 범위 값들은 범주형 속성으로 간주될 수 있습니다.
- 데이터 분포 기반 구간화(Binning): 데이터의 분포를 기준으로 수치형 속성을 구간(bin)으로 분류합니다. 이 구간들은 마이닝 과정에서 추가로 병합될 수 있으며, 따라서 이산화 과정은 동적(dynamic)으로 수행됩니다.
- 거리 기반 의미론적 이산화: 구간 데이터가 지니는 의미론적 의미를 포착할 수 있도록 이산화를 수행합니다. 이 강력한 이산화 단계에서는 데이터 포인트들 사이의 거리(distance)를 고려하여 처리합니다.
정리
다차원 연관 규칙 마이닝은 관계형 데이터베이스와 데이터 웨어하우스에서 여러 속성 간의 복잡한 관계를 발견하는 강력한 기법입니다. 차원 간 규칙과 혼합 차원 규칙의 구분, 그리고 범주형·수치형 속성에 맞는 적절한 이산화 전략을 이해하면 장바구니 분석을 비롯한 실무 데이터 마이닝 프로젝트에서 훨씬 정확하고 유의미한 인사이트를 얻을 수 있습니다.