데이터 마이닝 방법론과 사용자 상호작용 문제 개요
데이터 마이닝은 단순히 알고리즘만으로 완성되는 것이 아니라, 실제 사용자가 데이터를 탐색하고 활용하는 전 과정과 밀접하게 연결되어 있습니다. 따라서 효과적인 데이터 마이닝 시스템을 설계하려면 사용자 관점에서 발생하는 여러 상호작용 문제를 반드시 고려해야 합니다. 아래에서는 데이터 마이닝 방법론과 관련된 대표적인 사용자 상호작용 문제 8가지를 살펴봅니다.
1. 데이터베이스에서 다양한 종류의 지식 마이닝
사용자마다 관심 있는 지식의 유형은 서로 다릅니다. 어떤 사용자는 데이터의 전반적인 특성을 파악하고 싶어 하는 반면, 어떤 사용자는 분류나 군집화 같은 구체적인 분석 결과를 원합니다. 따라서 데이터 마이닝 시스템은 데이터 특성화(data characterization), 판별(discrimination), 연관(association), 분류(classification), 군집화(clustering), 추세 및 편차 분석, 유사도 분석에 이르기까지 폭넓은 데이터 분석과 지식 발견 작업을 포괄할 수 있어야 합니다.
2. 다양한 추상화 수준에서의 대화형 지식 마이닝
데이터베이스 안에 정확히 어떤 패턴이 숨어 있는지 사전에 알기는 어렵습니다. 그렇기 때문에 데이터 마이닝 과정은 필수적으로 대화형(interactive)이어야 합니다. 대화형 마이닝을 통해 사용자는 탐색하고자 하는 패턴을 직접 지정할 수 있고, 반환된 결과를 바탕으로 마이닝 요청을 계속 다듬어 나갈 수 있습니다. 이러한 방식은 사용자가 여러 세부 수준(granularity)과 다양한 관점에서 정보를 조회하고 패턴을 발견하는 데 큰 도움이 됩니다.
3. 배경 지식의 통합
데이터베이스와 관련된 도메인 지식, 예를 들어 무결성 제약조건(integrity constraints)이나 연역 규칙(deduction rules)은 데이터 마이닝 과정의 방향을 설정하고 속도를 높이는 데 활용될 수 있습니다. 나아가 이러한 배경 지식은 발견된 패턴이 얼마나 흥미로운지(interestingness)를 판단하는 기준으로도 사용됩니다.
4. 데이터 마이닝 질의 언어와 애드혹(ad-hoc) 데이터 마이닝
사용자가 임시로 필요한 마이닝 작업을 자유롭게 정의하려면 고수준의 데이터 마이닝 질의 언어가 필요합니다. 이 언어는 데이터베이스나 데이터 웨어하우스 질의 언어와 통합되어야 하며, 분석 대상 데이터 집합, 활용할 도메인 지식, 마이닝할 지식의 유형, 그리고 발견된 패턴에 적용할 조건과 흥미도 제약 조건을 명시할 수 있어야 합니다.
5. 데이터 마이닝 결과의 표현 및 시각화
발견된 지식은 사람이 쉽게 이해하고 바로 활용할 수 있는 형태로 제공되어야 합니다. 이를 위해 고수준 언어, 시각적 표현, 또는 기타 직관적인 표현 방식을 통해 마이닝 결과를 전달하는 것이 중요합니다. 좋은 시각화는 복잡한 패턴도 한눈에 파악할 수 있게 해줍니다.
6. 이상치(outlier) 및 불완전 데이터 처리
데이터베이스에 저장된 데이터에는 노이즈, 예외적인 사례, 불완전한 데이터 객체가 포함될 수 있습니다. 이런 데이터가 그대로 남아 있으면 발견된 패턴의 정확도가 크게 떨어질 수 있습니다. 따라서 이상치를 효과적으로 다룰 수 있는 데이터 클렌징(data cleaning) 기법과 견고한 데이터 분석 방법이 반드시 필요합니다.
7. 패턴 평가
데이터 마이닝 시스템은 한 번의 실행으로 수백 개에 달하는 패턴을 발견할 수 있습니다. 그러나 그중 일부는 해당 사용자에게 흥미롭지 않거나, 이미 널리 알려진 상식이거나, 참신성이 부족한 경우가 많습니다. 이러한 문제를 해결하기 위해 흥미도 평가 기준을 발견 과정 자체에 반영하여 검색 공간을 줄이는 연구가 활발히 진행되고 있습니다.
8. 병렬, 분산 및 증분 갱신 알고리즘
일부 데이터베이스는 그 규모가 매우 방대하고, 데이터가 광범위하게 분산되어 있으며, 특정 데이터 마이닝 방법은 계산 복잡도가 높습니다. 이러한 요인들이 병렬(parallel) 및 분산(distributed) 데이터 마이닝 알고리즘 개발을 촉진하는 주요 동기가 되고 있습니다. 또한 새로운 데이터가 지속적으로 유입되는 환경에서는 기존 결과를 효율적으로 갱신하는 증분(incremental) 알고리즘도 중요한 연구 과제입니다.
결론
데이터 마이닝 방법론이 실질적인 가치를 발휘하려면 다양한 지식 유형 지원, 대화형 탐색, 배경 지식 활용, 질의 언어, 결과 시각화, 데이터 품질 관리, 패턴 평가, 확장 가능한 알고리즘까지 사용자 중심의 상호작용 문제들을 종합적으로 해결해야 합니다. 이러한 과제들이 충족될 때 비로소 사용자는 데이터 속에서 신뢰할 수 있고 의미 있는 지식을 발견할 수 있습니다.