Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

웹 마이닝 방법론이란? 사용성·구조·콘텐츠 마이닝 3가지 유형 총정리

웹 마이닝(Web Mining)은 머신러닝과 데이터 마이닝 기법을 웹 기반 데이터에 적용하여 새로운 지식을 학습하거나 의미 있는 정보를 도출하는 기술입니다. 인터넷에는 방대한 데이터가 존재하기 때문에, 이를 체계적으로 분석하기 위해 웹 마이닝은 크게 세 가지 방법론으로 구분됩니다.

1. 웹 사용성 마이닝 (Web Usage Mining)

웹 사용성 마이닝은 사용자가 웹 페이지에 접속하고 이용한 기록 데이터를 수집·분석하는 웹 마이닝의 한 유형입니다. 이러한 사용 데이터는 어떤 웹 페이지가 방문되었는지, 어떤 경로로 이동했는지 등 접근 흐름의 방향성을 파악하는 데 활용됩니다.

사용 데이터는 대부분 웹 서버의 접속 로그(connection log)를 통해 자동으로 수집됩니다. 여기에 CGI 스크립트가 제공하는 리퍼러(referrer) 로그, 사용자 가입 정보, 설문 조사 기록 등을 함께 활용하면 더욱 풍부한 분석이 가능합니다. 이 범주는 조직의 인터넷·인트라넷 기반 애플리케이션과 데이터 접근에 데이터 마이닝을 온전히 적용하는 데 필수적인 역할을 합니다.

사용성 마이닝을 통해 기업은 비즈니스 서비스의 미래 가능성에 대한 생산적인 데이터를 확보할 수 있습니다. 누적된 데이터에서는 고객 생애 가치(lifetime user value), 제품 교차 마케팅 전략, 프로모션 캠페인의 효과 등 다양한 인사이트가 도출됩니다.

수집된 사용 데이터는 기업이 업무 효율을 높이고 매출을 증대하는 데 직접적으로 기여합니다. 또한 경쟁사보다 우위에 설 수 있는 마케팅 역량을 개발하고, 회사의 서비스나 제품을 더 큰 규모로 성장시키는 데에도 유용하게 활용됩니다.

2. 웹 구조 마이닝 (Web Structure Mining)

웹 구조 마이닝은 데이터나 직접적인 링크 연결로 이어진 웹 페이지 간의 관계를 식별하는 도구입니다. 이러한 구조 정보는 웹 페이지의 구조 스키마를 데이터베이스 방식으로 분석함으로써 발견할 수 있습니다.

이러한 연결 정보 덕분에 검색 엔진은 검색 질의와 관련된 레코드를, 해당 콘텐츠가 실제로 존재하는 웹사이트의 연결된 페이지로 직접 가져올 수 있습니다. 이 과정은 스파이더(spider)가 웹사이트를 탐색하고 홈페이지를 가져온 뒤, 참조 링크를 통해 정보를 연결하여 원하는 데이터가 담긴 특정 페이지를 찾아내는 방식으로 이루어집니다.

구조 마이닝의 궁극적인 목표는 웹 페이지들 사이에서 이전에 알려지지 않았던 관계를 도출하는 것입니다. 이러한 데이터 마이닝 구조는 기업이 자사 웹사이트의 데이터를 연결하여 탐색을 용이하게 하고, 데이터를 군집화(cluster)하여 사이트맵(site map)을 구축하는 데도 도움을 줍니다. 이를 통해 사용자는 키워드 관계와 콘텐츠 마이닝을 통해 원하는 데이터에 손쉽게 접근할 수 있습니다.

3. 웹 콘텐츠 마이닝 (Web Content Mining)

웹 콘텐츠 마이닝은 웹 페이지의 텍스트, 이미지, 그래프 등을 탐색하고 분석하여 해당 콘텐츠가 검색 질의와 얼마나 관련성이 있는지 판단하는 기술입니다.

이러한 탐색은 구조 마이닝을 통해 웹 페이지들이 군집화된 이후에 수행되며, 제출된 질의와의 관련성 정도에 따라 결과를 정렬·제공합니다. 월드 와이드 웹(WWW)에는 방대한 양의 데이터가 존재하기 때문에, 콘텐츠 마이닝은 검색 엔진의 결과 목록을 질의 내 키워드와의 관련성이 높은 순서대로 정렬하는 데 핵심적인 역할을 합니다.

마무리

웹 마이닝은 사용성, 구조, 콘텐츠라는 세 가지 관점에서 웹 데이터를 분석함으로써 기업의 의사결정, 검색 엔진 최적화, 마케팅 전략 수립 등 다양한 분야에 활용될 수 있습니다. 세 가지 방법론을 상황에 맞게 조합하면 웹에 축적된 방대한 데이터로부터 더욱 가치 있는 통찰을 얻을 수 있습니다.