웹에서 신뢰할 수 있는 정보원을 찾는 데 유용한 개념이 바로 '허브(hub)'입니다. 허브란 권위 있는 페이지(authority)들을 가리키는 링크 집합을 담고 있는 웹페이지 모음을 의미합니다.
허브 페이지의 특징
허브 페이지 자체는 대체로 잘 알려져 있지 않거나, 이를 가리키는 외부 링크가 거의 없을 수 있습니다. 그러나 특정 주제에 관해 권위 있는 사이트들로 연결되는 링크를 다수 포함하고 있다는 점이 특징입니다. 예를 들어 개인 홈페이지의 추천 사이트 목록, 강좌 홈페이지가 소개하는 참고 자료 사이트, 상업 사이트에 전문적으로 정리된 리소스 문서 등이 허브 페이지에 해당합니다. 허브 페이지는 특정 주제에 대해 권위를 암묵적으로 부여하는 중요한 역할을 수행합니다.
허브와 권위 페이지의 상호 강화 관계
일반적으로 좋은 허브는 여러 좋은 권위 페이지를 가리키는 페이지이며, 좋은 권위 페이지는 여러 좋은 허브로부터 지목되는 페이지입니다. 이러한 상호 강화(mutual reinforcement) 관계 덕분에 권위 있는 웹페이지를 발굴하고, 고품질의 웹 구조와 자원을 자동으로 발견하는 것이 가능해집니다.
HITS 알고리즘의 작동 원리
허브 개념을 활용한 대표적인 알고리즘이 HITS(Hyperlink-Induced Topic Search)입니다. HITS는 다음과 같은 단계로 진행됩니다.
1단계: 초기 집합 수집과 확장
먼저 검색어를 이용해 색인 기반 검색 엔진에서 약 200개 정도의 페이지를 수집합니다. 이 페이지들이 '핵심 집합(core set)'을 구성합니다. 검색 주제와 관련된 페이지 중 일부는 대부분의 권위 있는 페이지로 향하는 링크를 포함하고 있을 가능성이 높습니다. 따라서 핵심 집합의 페이지가 링크하는 페이지들과, 핵심 집합의 페이지를 링크하는 페이지들을 추가하여 기준 크기(예: 1,000~5,000개)까지 확장한 '기본 집합(base set)'을 만듭니다.
2단계: 가중치 전파 과정
다음으로 가중치 전파(weight-propagation) 과정이 시작됩니다. 이 반복 단계에서는 허브 가중치와 권위 가중치에 대한 통계적 추정치를 계산합니다. 단, 동일한 웹 도메인 내 두 페이지 간의 링크(즉, URL의 최상위 수준이 같은 경우)는 단순한 내비게이션 목적이므로 권위를 부여하지 않는 것으로 간주하여, 가중치 전파 분석에서 제외됩니다.
구글 PageRank와 링크 분석 알고리즘
구글의 PageRank 알고리즘도 유사한 원리에 기반합니다. 웹 링크와 텍스트 맥락 데이터를 함께 활용하면, AltaVista 같은 단순 용어 색인 기반 검색 엔진이나 Yahoo!처럼 사람이 직접 분류한 온톨로지보다 우수한 품질의 검색 결과를 얻을 수 있다는 것이 입증되었습니다.
링크 분석 알고리즘의 두 가지 전제
링크 분석 알고리즘은 다음 두 가지 가정 위에서 작동합니다. 첫째, 링크는 사람의 추천(endorsement)이라는 점입니다. 페이지 A에서 B로의 링크가 존재하고 두 페이지의 작성자가 서로 다르다면, A의 작성자가 B를 가치 있다고 판단했다는 의미입니다. 따라서 한 페이지의 중요도는 그 페이지가 링크하는 대상 페이지들로 전달될 수 있습니다. 둘째, 특정 페이지에 의해 함께 인용된 페이지들은 같은 주제와 관련이 있을 가능성이 높다는 점입니다.