데이터 마이닝의 대표적인 특징
데이터 마이닝 시스템을 선택하거나 이해할 때 반드시 살펴봐야 할 핵심 특징들이 있습니다. 크게 데이터 유형, 시스템 운영 환경, 데이터 소스, 데이터 마이닝 기능과 방법론 네 가지로 나누어 자세히 알아보겠습니다.
1. 데이터 유형(Data Types)
업계에서 사용 가능한 대부분의 데이터 마이닝 시스템은 통계적, 범주형, 기호형 속성을 갖춘 정형화된 레코드 기반의 관계형 데이터를 처리합니다. 다루는 데이터는 ASCII 텍스트, 관계형 데이터베이스 데이터 또는 데이터 웨어하우스 데이터 형태일 수 있으며, 각 시스템이 어떤 형식을 지원하는지 사전에 확인하는 것이 중요합니다.
일부 데이터나 응용 분야는 패턴 탐색을 위해 특수한 알고리즘을 필요로 하기 때문에, 범용 데이터 마이닝 시스템만으로는 요구 사항을 충족하기 어렵습니다. 이런 경우에는 텍스트 보고서, 지리 공간 데이터, 멀티미디어 데이터, 스트림 데이터, 시계열 데이터, 생물학 데이터, 웹 데이터 등을 전문적으로 분석하는 특화된 데이터 마이닝 시스템을 활용하는 것이 좋습니다. 금융, 소매업, 통신 등 특정 산업 분야에 최적화된 시스템도 존재합니다.
2. 시스템 운영 환경(System Issues)
데이터 마이닝 시스템은 하나 또는 여러 개의 운영체제에서 실행될 수 있습니다. 데이터 마이닝 소프트웨어가 구동되는 대표적인 운영체제는 UNIX/Linux와 Microsoft Windows이며, Macintosh나 OS/2에서 실행되는 시스템도 있습니다.
대규모 상업용 데이터 마이닝 시스템은 대개 클라이언트/서버 아키텍처를 채택합니다. 이때 클라이언트는 개인용 PC가 될 수 있고, 서버는 고성능 병렬 컴퓨터들의 집합으로 구성됩니다. 최근에는 웹 기반 인터페이스를 지원하고 XML 데이터를 입력·출력으로 처리할 수 있는 데이터 마이닝 시스템이 하나의 추세로 자리 잡고 있습니다.
3. 데이터 소스(Data Sources)
데이터 소스는 데이터 마이닝 시스템이 작동할 구체적인 데이터 형식을 의미합니다. 일부 시스템은 ASCII 텍스트 파일에서만 작동하는 반면, 어떤 시스템은 여러 관계형 데이터 소스에 접근하여 관계형 데이터나 데이터 웨어하우스 데이터를 처리할 수 있습니다.
데이터 마이닝 시스템은 ODBC 연결 또는 OLE DB for ODBC 연결을 제공해야 합니다. 이러한 개방형 데이터베이스 연결을 통해 IBM DB2, Microsoft SQL Server, Microsoft Access, Oracle, Sybase 등 다양한 관계형 데이터와 포맷된 ASCII 텍스트 데이터에 접근할 수 있습니다.
4. 데이터 마이닝 기능과 방법론(Functions & Methodologies)
데이터 마이닝 기능은 데이터 마이닝 시스템의 심장이라 할 수 있습니다. 일부 시스템은 분류(classification)처럼 단일 기능만 지원하지만, 다른 시스템은 개념 설명, 발견 기반 OLAP 분석, 연관 규칙 마이닝, 링크 분석, 통계 분석, 분류, 예측, 군집화(clustering), 이상치 분석, 유사도 검색, 순차 패턴 분석, 시각적 데이터 마이닝 등 다양한 기능을 함께 제공합니다.
동일한 데이터 마이닝 기능이라 하더라도, 시스템에 따라 하나의 방법만 제공하는 경우와 결정 트리 분석, 베이지안 네트워크, 신경망(neural networks), 서포트 벡터 머신(SVM), 규칙 기반 분류, k-최근접 이웃(k-NN), 유전 알고리즘, 사례 기반 추론 등 폭넓은 방법론을 제공하는 경우로 나뉩니다.
여러 데이터 마이닝 기능과 기능별 다양한 방법을 동시에 지원하는 시스템은 사용자에게 더 높은 유연성과 강력한 분석 능력을 제공합니다. 문제에 따라 여러 마이닝 기능을 조합해 활용해야 하는 경우도 있으며, 데이터의 종류에 따라 서로 다른 방법이 더 효율적으로 작동할 수 있기 때문입니다.