데이터 마이닝 기능이란?
데이터 마이닝 기능(Data Mining Functionalities)은 데이터 마이닝 작업에서 발견해야 할 패턴의 유형을 나타내는 데 사용됩니다. 일반적으로 데이터 마이닝 작업은 크게 두 가지 유형으로 분류할 수 있습니다.
- 기술적(Descriptive) 마이닝: 데이터베이스에 저장된 데이터의 공통적인 특징을 정의하고 요약합니다.
- 예측적(Predictive) 마이닝: 현재 가지고 있는 정보를 바탕으로 추론을 수행하여 미래를 예측합니다.
그렇다면 데이터 마이닝에는 어떤 구체적인 기능들이 있을까요? 주요 기능들을 하나씩 살펴보겠습니다.
1. 데이터 특성화 (Data Characterization)
데이터 특성화는 특정 객체 클래스에 속한 데이터의 일반적인 특징을 요약하는 기능입니다. 사용자가 지정한 클래스에 해당하는 데이터는 보통 데이터베이스 질의(query)를 통해 수집되며, 그 결과는 다양한 형태로 표현될 수 있습니다.
2. 데이터 판별 (Data Discrimination)
데이터 판별은 대상 클래스(target class) 데이터 객체의 일반적인 특징을 하나 이상의 비교 클래스(contrasting class) 객체의 특징과 비교하는 기능입니다. 대상 클래스와 비교 클래스는 사용자가 지정할 수 있으며, 해당하는 데이터 객체는 데이터베이스 질의를 통해 가져옵니다.
3. 연관 분석 (Association Analysis)
연관 분석은 거래 데이터셋에서 함께 자주 발생하는 아이템들의 집합을 분석하는 기능입니다. 연관 규칙(association rule)을 결정하는 데 사용되는 두 가지 핵심 지표가 있습니다.
- 지지도(Support): 데이터베이스에서 해당 아이템 집합이 얼마나 자주 나타나는지를 나타냅니다.
- 신뢰도(Confidence): 한 아이템이 거래에 포함되었을 때 다른 아이템도 함께 포함될 조건부 확률을 의미합니다.
4. 분류 (Classification)
분류는 데이터 클래스나 개념을 표현하고 구별하는 모델을 발견하는 절차입니다. 이렇게 만들어진 모델은 클래스 레이블이 알려지지 않은 객체의 클래스를 예측하는 데 활용됩니다. 도출된 모델은 학습 데이터(training data), 즉 클래스 레이블이 이미 알려진 데이터 객체들을 분석하여 구축됩니다.
5. 예측 (Prediction)
예측은 아직 알려지지 않은 데이터 값이나 향후 추세를 미리 파악하는 기능입니다. 객체의 속성 값과 클래스의 속성 값을 기반으로 객체를 예측할 수 있으며, 누락된 수치 값의 추정이나 시간 관련 정보에서의 증가·감소 추세 분석 등이 여기에 해당합니다.
6. 군집화 (Clustering)
군집화는 분류와 유사하지만 사전에 정의된 클래스가 없다는 점이 다릅니다. 클래스는 데이터 속성에 따라 자연스럽게 형성되며, 레이블 없이 학습하는 비지도 학습(unsupervised learning) 방식입니다. 객체들은 클래스 내 유사도는 최대화하고 클래스 간 유사도는 최소화하는 원칙에 따라 그룹화됩니다.
7. 이상치 분석 (Outlier Analysis)
이상치(outlier)는 주어진 클래스나 군집에 속하기 어려운 데이터 요소를 말합니다. 이는 다른 데이터 객체들의 일반적인 행동 양식과 확연히 다른 행동을 보이는 객체로, 이런 데이터를 분석하면 숨겨진 지식을 발굴하는 데 중요한 단서를 얻을 수 있습니다. 예를 들어 신용카드 부정 거래 탐지 등에 활용됩니다.
8. 진화 분석 (Evolution Analysis)
진화 분석은 시간의 흐름에 따라 행동 양식이 변화하는 객체들의 추세를 분석하는 기능입니다. 시간에 따른 데이터 변화 패턴을 파악함으로써 장기적인 변화 방향을 이해할 수 있습니다.
마무리
데이터 마이닝은 특성화, 판별, 연관 분석, 분류, 예측, 군집화, 이상치 분석, 진화 분석 등 다양한 기능을 통해 방대한 데이터 속에서 의미 있는 패턴과 지식을 발견합니다. 각 기능은 목적과 활용 분야가 다르므로, 분석 목표에 맞는 적절한 기능을 선택하는 것이 성공적인 데이터 마이닝의 첫걸음입니다.