클러스터링(Clustering)은 물리적 또는 추상적인 객체들의 집합을 성격이 유사한 클래스로 묶는 과정을 의미합니다. 하나의 클러스터는 같은 클러스터 내부에서는 서로 유사하고, 다른 클러스터의 객체들과는 뚜렷이 구별되는 데이터 객체들의 집합입니다. 여러 응용 분야에서 클러스터에 속한 데이터 객체들은 하나의 그룹으로 간주되어 활용됩니다. 클러스터 분석은 인간이 오랫동안 수행해 온 본질적인 활동이기도 합니다.
클러스터 분석은 레코드에 대한 다양한 측정값을 기반으로 유사한 레코드들을 그룹으로 형성하는 데 사용됩니다. 여기서 핵심 설계 원칙은 분석 목적에 실질적으로 유용한 방식으로 클러스터를 정의하는 것입니다. 이러한 기법은 천문학, 고고학, 의학, 화학, 교육, 심리학, 언어학, 사회학 등 폭넓은 분야에서 활용되고 있습니다.
클러스터링의 대표적인 활용 예시
1. 생물학
생물학자들은 왕국, 문, 강, 목, 과, 속, 종으로 이어지는 계층적 분류 체계인 분류학(taxonomy)을 구축하는 데 오랜 시간을 투자해 왔습니다. 그렇기 때문에 클러스터 분석의 초기 연구 중 상당수가 이러한 분류 구조를 자동으로 찾아내는 수치 분류학(numerical taxonomy) 분야를 확립하려는 시도였다는 점은 자연스러운 일입니다.
또한 생물학자들은 클러스터링을 활용해 방대한 유전 데이터를 분석해 왔습니다. 대표적인 예로, 동일한 기능을 수행하는 유전자 그룹을 발견하는 데 클러스터링 기법이 사용되었습니다.
2. 정보 검색
월드 와이드 웹에는 수십억 개의 웹 페이지가 존재하며, 검색 엔진에 질의(query)를 하면 수백만 개에 달하는 페이지가 결과로 반환될 수 있습니다. 클러스터링을 활용하면 이러한 검색 결과를 몇 개의 클러스터로 그룹화할 수 있으며, 각 클러스터는 질의의 특정 측면을 담당하게 됩니다.
예를 들어 '영화'라는 키워드로 검색하면, 결과 페이지들이 리뷰, 예고편, 출연 배우, 상영관 등의 카테고리로 묶일 수 있습니다. 각 클러스터는 다시 하위 카테고리(하위 클러스터)로 세분화되어, 사용자가 검색 결과를 체계적으로 분석할 수 있도록 돕는 계층 구조를 형성합니다.
3. 기후
지구의 기후를 이해하려면 대기와 해양에 나타나는 패턴을 파악해야 합니다. 클러스터 분석은 극지방의 대기압 패턴이나 육지 기후에 중요한 영향을 미치는 해양 지역의 패턴을 발견하는 데 활용되어 왔습니다.
4. 심리학과 의학
질병이나 특정 상태는 여러 가지 하위 유형을 가지는 경우가 많으며, 클러스터 분석을 통해 이러한 하위 범주들을 식별할 수 있습니다. 예를 들어 클러스터링은 우울증을 여러 유형으로 분류하는 데 사용될 수 있습니다. 또한 특정 질병의 공간적·시간적 분포에서 나타나는 패턴을 파악하는 데에도 클러스터 분석이 활용됩니다.
5. 비즈니스
기업들은 현재 고객과 잠재 고객에 대한 방대한 데이터를 수집합니다. 이 데이터는 고객을 소수의 그룹으로 세분화하는 고객 세분화(customer segmentation)에 활용되며, 세분화된 그룹은 이후 심층 분석과 타깃 마케팅 활동의 기초 자료로 사용됩니다.