웹 마이닝(Web Mining)의 기본 개념
웹 마이닝은 데이터 마이닝 기법을 웹 환경에 맞게 조정하여 적용하는 것으로 널리 이해할 수 있습니다. 반면 데이터 마이닝은 주로 구조화된 데이터를 대상으로, 지식 발견(Knowledge Discovery) 프로세스 안에서 알고리즘을 활용해 숨겨진 패턴을 찾아내는 작업을 의미합니다.
웹 마이닝의 가장 큰 특징은 다양한 유형의 데이터를 동시에 처리할 수 있다는 점입니다. 웹은 그 자체로 여러 측면을 지니고 있으며, 이에 따라 마이닝 접근 방식도 다양하게 나뉩니다.
- 웹 페이지는 텍스트 콘텐츠를 포함합니다
- 웹 페이지들은 하이퍼링크를 통해 서로 연결됩니다
- 사용자 활동은 웹 서버 로그를 통해 추적·분석할 수 있습니다
즉, 웹 마이닝은 텍스트 마이닝, 링크 구조 분석, 사용자 행동 분석이라는 세 가지 축을 모두 아우르는 포괄적인 분야라고 할 수 있습니다.
웹이 자원 및 지식 발견에 던지는 4가지 도전 과제
웹은 방대한 정보의 보고이지만, 동시에 효과적인 자원 발견(Resource Discovery)과 지식 발견(Knowledge Discovery)에 큰 어려움을 안겨줍니다. 그 배경이 되는 핵심 관찰 내용은 다음과 같습니다.
1. 웹은 너무나 방대하다
웹의 규모는 수백 테라바이트(terabytes)에 달하며, 지금도 빠른 속도로 계속 성장하고 있습니다. 수많은 조직과 단체가 공개적으로 접근 가능한 데이터를 웹에 올리고 있습니다. 물론 데이터 웨어하우스를 구축해 웹상의 일부 데이터를 복제·저장·통합하는 방법도 가능하지만, 웹 전체를 하나의 창고에 담아 효율적으로 마이닝하기에는 그 규모가 너무나 방대합니다.
2. 웹 페이지의 복잡성이 전통 문서보다 훨씬 높다
웹 페이지는 어떤 통일된 구조도 갖추고 있지 않습니다. 일반 서적이나 전통적인 텍스트 기반 문서 모음과 비교했을 때, 저작 스타일과 콘텐츠 형식의 편차가 훨씬 큽니다.
웹을 하나의 거대한 디지털 도서관으로 생각해 볼 수 있습니다. 그러나 이 도서관의 방대한 장서들은 어떤 특정한 정렬 순서로도 배열되어 있지 않습니다. 제목별, 저자별, 목차별 색인도 존재하지 않습니다. 이런 환경에서 원하는 정보를 찾는 일은 매우 어려운 과제가 됩니다.
3. 웹은 끊임없이 변화하는 동적 정보원이다
웹은 단순히 빠르게 성장하는 데 그치지 않고, 담긴 정보 역시 끊임없이 갱신됩니다. 뉴스, 주식 시장, 날씨, 스포츠, 쇼핑, 기업 광고 등 수많은 웹 페이지가 정기적으로 업데이트되며, 링크 정보와 접속 기록 역시 수시로 변동합니다. 따라서 어느 한 시점에 수집한 데이터가 곧바로 구버전이 되어버릴 수 있다는 점이 웹 마이닝의 큰 난제입니다.
4. 웹은 폭넓고 다양한 사용자층을 보유한다
현재 인터넷은 1억 대가 넘는 워크스테이션을 연결하고 있으며, 사용자 커뮤니티는 여전히 급속히 확장되고 있습니다. 사용자들은 저마다 배경, 관심사, 이용 목적이 천차만별입니다.
일부 사용자는 데이터 네트워크의 구조에 대한 깊은 지식이 없어 특정 검색에 드는 비용이 얼마나 큰지조차 인식하지 못합니다. 이들은 네트워크라는 '어둠 속'에서 방황하며 길을 잃기 쉽고, 수많은 접속 '홉(hop)'을 거치며 정보 한 조각을 애타게 기다리다 지쳐버리기도 합니다.
맺음말
이처럼 웹 마이닝은 단순한 데이터 마이닝의 확장이 아니라, 웹 고유의 방대함·비정형성·동적 변화·사용자 다양성이라는 네 가지 도전 과제를 해결하기 위해 발전한 분야입니다. 이러한 특성을 이해하는 것이 효과적인 웹 마이닝 전략을 세우는 첫걸음입니다.