Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

웹 사용 마이닝이란? 핵심 규칙과 4단계 프로세스 완벽 정리

웹 마이닝(Web Mining)의 개념

웹 마이닝은 데이터 마이닝 기법을 활용하여 웹 기반 기록과 서비스, 서버 로그, 하이퍼링크 등으로부터 유용한 패턴, 트렌드, 정보를 추출하는 과정을 의미합니다. 웹 마이닝의 목적은 방대한 웹 데이터를 수집하고 분석함으로써 의사결정에 필요한 핵심 인사이트를 도출하는 것입니다.

웹 마이닝은 지식 발견(Knowledge Discovery) 과정에 알고리즘을 적용해 구조화된 데이터에서 패턴을 찾아내는 일반적인 데이터 마이닝을, 인터넷 환경에 맞게 변형·적용한 형태로 이해할 수 있습니다.

웹 마이닝만의 특징

웹 마이닝은 다양한 유형의 데이터를 다룰 수 있다는 점에서 독특한 특징을 지니고 있습니다. 웹은 마이닝 절차에 여러 가지 접근 방식을 제공하는 요소들로 구성되어 있습니다.

  • 텍스트를 포함하는 웹 페이지
  • 하이퍼링크로 서로 연결된 웹 페이지 간의 관계
  • 웹 서버 로그를 통해 추적 가능한 사용자 행동 데이터

웹 사용 마이닝(Web Usage Mining)의 4가지 핵심 규칙

웹 사용 마이닝은 크게 네 가지 단계로 진행됩니다. 각 단계별로 살펴보겠습니다.

1. 전처리(Preprocessing)

웹 사용 로그는 마이닝 애플리케이션이 바로 처리하기 어려운 형식으로 되어 있기 때문에, 분석에 활용하려면 반드시 재구성하고 정제하는 작업이 필요합니다. 특히 웹로그를 다룰 때 발생하는 고유한 문제들을 해결해야 하며, 전처리 단계에는 데이터 클렌징(cleansing), 사용자 식별(user identification), 세션 식별(session identification), 경로 완성(path completion), 그리고 포맷팅(formatting)이 포함됩니다.

2. 데이터 구조(Data Structure)

웹 사용 마이닝 과정에서 발견되는 패턴을 효율적으로 저장하고 추적하기 위해 여러 가지 특수한 데이터 구조가 제안되어 왔습니다. 가장 기본적으로 활용되는 구조는 트리(tree)입니다. 루트(root)가 있는 트리에서는 루트에서 잎(leaf)까지의 각 경로가 하나의 시퀀스(sequence)를 나타내며, 이러한 트리는 패턴 매칭 애플리케이션을 위해 문자열을 저장할 수 있습니다. 다만 트리 구조의 단점은 상당한 공간(메모리)을 요구한다는 점입니다.

3. 패턴 발견(Pattern Discovery)

클릭스트림(clickstream) 데이터에 적용되는 가장 대표적인 데이터 마이닝 기법은 탐색 패턴(traversal pattern)을 찾아내는 것입니다. 탐색 패턴이란 하나의 세션 동안 사용자가 조회한 페이지들의 집합을 의미합니다. 이 외에도 웹 사용 마이닝을 통해 다양한 유형의 패턴을 발견할 수 있으며, 서로 다른 조합을 활용해 목적에 맞는 여러 특징을 도출하게 됩니다.

4. 패턴 분석(Pattern Analysis)

패턴이 발견된 후에는 해당 정보를 실제로 어떻게 활용할지 판단하기 위한 분석 과정이 필요합니다. 이 단계에서는 관심 없는 패턴을 제거하고, 발견 활동의 결과물을 해석합니다. 중요한 점은 단순히 빈번하게 나타나는 탐색 패턴을 확인하는 것에 그치지 않고, 희소성이나 통계적 특성 때문에 의미 있는 패턴까지 식별하는 것입니다.