링크 마이닝(Link Mining)은 데이터 객체들 사이의 연결 관계를 분석하고 활용하는 데이터 마이닝 기법으로, 여러 가지 중요한 작업을 포함합니다. 대표적인 작업들을 하나씩 살펴보겠습니다.
1. 링크 기반 객체 분류 (Link-based Object Classification)
전통적인 분류 방식에서는 객체를 정의하는 속성만을 기준으로 분류를 수행합니다. 반면 링크 기반 분류는 객체 자체의 속성뿐만 아니라 해당 객체가 가진 링크, 그리고 링크로 연결된 객체들의 속성까지 함께 고려하여 범주를 예측합니다.
웹 페이지 분류는 링크 기반 분류의 대표적인 사례입니다. 페이지에 실제로 등장하는 단어와 앵커 텍스트(하이퍼링크를 클릭할 때 보이는 단어)를 속성으로 활용해 웹 페이지의 분류를 예측합니다. 나아가 페이지 간의 링크 구조와 페이지 및 링크가 지닌 다양한 속성도 분류 결과에 영향을 미칩니다.
2. 객체 유형 예측 (Object Type Prediction)
객체의 속성과 링크, 그리고 연결된 객체들의 속성을 바탕으로 해당 객체의 유형을 예측하는 작업입니다. 서지 정보 분야에서는 논문이 발표된 곳이 학회(conference), 학술지(journal), 워크숍(workshop) 중 어디에 해당하는지 예측하는 작업이 이에 해당합니다. 통신 분야에서는 연락이 이메일, 전화, 우편 중 어떤 방식으로 이루어졌는지 예측하는 것이 같은 유형의 과제입니다.
3. 링크 유형 예측 (Link Type Prediction)
객체들이 지닌 특성을 근거로 링크의 유형이나 목적을 예측합니다. 예를 들어 역학(epidemiological) 데이터가 주어졌을 때, 서로 아는 사이인 두 사람이 가족 관계인지, 직장 동료인지, 아니면 단순한 지인인지를 예측할 수 있습니다.
4. 링크 존재 여부 예측 (Predicting Link Existence)
링크 유형 예측은 두 객체 사이에 연결이 이미 존재한다고 가정하고 그 유형을 맞추는 반면, 링크 존재 여부 예측은 두 객체 사이에 링크 자체가 존재하는지를 예측합니다. 두 웹 페이지 사이에 링크가 생성될지 여부, 한 논문이 다른 논문을 인용할지 여부를 예측하는 것이 대표적인 예입니다.
5. 링크 카디널리티 추정 (Link Cardinality Estimation)
링크 카디널리티 추정에는 두 가지 형태가 있습니다. 첫 번째는 하나의 객체로 향하는 링크의 수를 예측하는 것입니다. 이는 인링크(in-link)의 개수를 기반으로 웹 페이지의 권위성을 평가하는 데 유용하게 활용됩니다. 두 번째는 아웃링크(out-link)의 수를 활용해 허브(hub) 역할을 하는 웹 페이지를 식별하는 것입니다. 여기서 허브란 동일한 주제의 여러 권위 있는 페이지들을 가리키는 하나 또는 일련의 웹 페이지를 의미합니다.
6. 객체 조정 (Object Reconciliation)
객체 조정은 객체들의 속성과 링크를 근거로 두 객체가 실제로 동일한 객체인지를 판별하는 작업입니다. 이 기능은 정보 추출, 중복 제거, 객체 통합, 인용 매칭 등에서 폭넓게 활용되며, 레코드 연계(record linkage) 또는 신원 불확실성(identity uncertainty)이라는 이름으로도 불립니다.