Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

연관 규칙 학습(Association Rule Learning)의 작동 원리 완벽 정리

연관 규칙 학습이란?

연관 규칙 학습(Association Rule Learning)은 비지도 학습(unsupervised learning) 방법의 한 종류로, 하나의 데이터 요소가 다른 데이터 요소에 의존하는 관계를 검토하고 이를 바탕으로 더 효과적인 규칙을 만들어내는 기법입니다. 데이터셋 내 변수들 사이에서 흥미로운 연관성이나 패턴을 발견하는 것이 핵심 목표이며, 데이터베이스 안의 변수 간 관계를 찾기 위해 여러 가지 규칙에 의존합니다.

연관 규칙 학습은 머신러닝의 중요한 기술 중 하나로, 장바구니 분석(Market Basket Analysis), 웹 사용 마이닝(Web Usage Mining), 생산 공정 최적화 등 다양한 분야에서 활용되고 있습니다. 특히 장바구니 분석에서는 여러 대형 소매업체가 상품 간의 관계를 파악하는 데 폭넓게 사용하고 있습니다.

장바구니 분석에서의 활용

장바구니 분석에서는 고객이 장바구니에 담은 서로 다른 상품들 사이의 연관성을 발견함으로써 고객의 구매 습관을 분석합니다. 이러한 연관성을 파악하면 소매업체는 어떤 상품들이 함께 자주 구매되는지 알 수 있고, 이를 바탕으로 효과적인 마케팅 전략을 수립할 수 있습니다. 선택적 마케팅과 진열대 공간 설계가 가능해지면서 매출 증대로까지 이어질 수 있는 것입니다.

다층 연관(multi-level association)의 대표적인 응용 분야 역시 장바구니 분석입니다. 개념 계층(concept hierarchy)이라는 개념을 바탕으로 함께 자주 구매되는 상품 그룹을 탐색함으로써 고객의 구매 습관을 보다 깊이 이해할 수 있습니다.

거래 데이터와 연관 규칙의 도출 과정

연관 규칙은 하나 이상의 제품이나 서비스가 포함된 거래(transaction)와 해당 거래에 대한 기본적인 정보에서 출발합니다. 분석 목적상 이러한 제품과 서비스를 '아이템(item)'이라고 부릅니다.

거래 데이터에는 구매된 아이템만 담기도 하지만, 날짜와 시간, 고객이 현금으로 결제했는지 신용카드로 결제했는지와 같은 추가 정보도 함께 활용할 수 있습니다.

모든 거래는 어떤 상품이 다른 어떤 상품과 함께 구매되었는지에 대한 정보를 제공합니다. 이 정보는 동시출현표(co-appearance table)로 정리되며, 특정 상품 쌍이 함께 구매된 횟수를 한눈에 보여줍니다.

지지도(Support)와 신뢰도(Confidence)

이러한 관찰 결과들은 연관성의 실제 사례이며, "고객이 탄산음료를 구매하면 오렌지 주스도 함께 구매한다"와 같은 형식적인 규칙으로 표현할 수 있습니다. 예를 들어 전체 5건의 거래 중 2건에 탄산음료와 오렌지 주스가 모두 포함되어 있다면, 이 두 거래가 바로 규칙의 근거가 됩니다. 따라서 이 규칙의 지지도(support)는 5건 중 2건, 즉 40%입니다.

동시에 탄산음료가 포함된 거래 3건 중 2건에 오렌지 주스도 함께 담겨 있으므로, "탄산음료 → 오렌지 주스"라는 규칙의 신뢰도(confidence)는 약 67%로 높습니다. 반면 그 역의 규칙인 "오렌지 주스 → 탄산음료"의 신뢰도는 상대적으로 더 낮게 나타납니다. 이처럼 지지도와 신뢰도를 함께 평가하면, 어떤 상품 조합이 실질적으로 의미 있는 연관성을 가지는지 판단할 수 있습니다.