데이터 마이닝에서 분류(Classification)와 예측(Prediction)은 가장 널리 활용되는 두 가지 핵심 기법입니다. 두 기법은 모두 기존 데이터로부터 패턴을 학습하여 새로운 데이터에 대한 결론을 도출한다는 공통점이 있지만, 그 목적과 결과물에는 중요한 차이가 있습니다. 이 글에서는 두 개념의 정의, 작동 원리, 그리고 실제 활용 사례를 자세히 살펴보겠습니다.
분류(Classification)란?
분류는 데이터 인스턴스가 어느 집단(그룹)에 속하는지 판별하는 데 사용되는 데이터 마이닝 기법입니다. 분류 문제에는 반드시 목표가 되는 범주형 변수(target categorical variable)가 존재합니다. 대표적인 예로 소득 구간을 들 수 있는데, 이를 고소득층, 중간소득층, 저소득층이라는 세 개의 클래스 또는 범주로 나누는 것이 가능합니다.
데이터 마이닝 모델은 방대한 양의 레코드를 분석합니다. 각 레코드에는 목표 변수에 대한 정보와 함께 이를 설명하는 입력 변수(예측 변수)들의 집합이 포함되어 있습니다. 예를 들어, 아래 표와 같은 데이터 세트의 일부를 생각해 볼 수 있습니다.
소득 분류를 위한 데이터 세트 발췌
| 대상 | 나이 | 성별 | 직업 | 소득 구간 |
|---|---|---|---|---|
| 001 | 47 | 여성 | 소프트웨어 엔지니어 | 고소득 |
| 002 | 28 | 남성 | 컨설턴트 | 중간소득 |
| 003 | 35 | 남성 | 무직 | 저소득 |
이제 연구자가 나이, 성별, 직업과 같은 특성을 바탕으로 데이터베이스에 아직 존재하지 않는 사람들의 소득 구간을 분류하고자 한다고 가정해 보겠습니다. 이것이 바로 전형적인 분류 작업이며, 데이터 마이닝 방법론과 기법이 매우 적합하게 적용될 수 있는 영역입니다.
분류 알고리즘의 작동 원리
알고리즘은 대략 다음과 같은 절차로 진행됩니다. 먼저 예측 변수들과 이미 분류가 완료된 목표 변수(소득 구간)를 모두 포함하는 데이터 세트를 살펴봅니다. 이 과정에서 알고리즘은 어떤 변수 조합이 어떤 소득 구간과 연관되는지 학습합니다. 예를 들어, 연령이 높은 여성은 고소득 구간과 관련이 있을 수 있다는 식입니다. 이처럼 모델 학습에 사용되는 데이터 세트를 학습 데이터 세트(training set)라고 부릅니다.
분류의 실제 활용 사례
비즈니스와 연구 분야에서 활용되는 분류 작업의 대표적인 예는 다음과 같습니다.
특정 신용카드 거래가 사기 거래인지 여부를 판별합니다.
특정 요건에 따라 새로운 지원자를 적합한 부문(트랙)에 배치합니다.
주택담보대출 신청자가 신용도가 좋은 고객인지, 나쁜 위험 고객인지 판단합니다.
환자에게 특정 질병이 나타나는지 여부를 진단·조사합니다.
특정 금융 거래나 개인 행동이 잠재적 테러 위협을 시사하는지 판단합니다.
예측(Prediction)이란?
예측은 분류와 매우 유사한 기법이지만, 한 가지 결정적인 차이가 있습니다. 바로 결과가 미래 시점에 대한 것이라는 점입니다. 분류가 현재 데이터의 소속 범주를 판별하는 데 초점을 맞춘다면, 예측은 아직 발생하지 않은 미래의 값을 추정하는 데 그 목적이 있습니다.
예측의 실제 활용 사례
비즈니스와 연구 분야에서 활용되는 예측 작업의 대표적인 예는 다음과 같습니다.
3개월 후의 주가를 예측합니다.
속도 제한이 상향될 경우 내년 교통사고 사망률이 몇 퍼센트 증가할지 예측합니다.
팀 간 통계의 유사성을 바탕으로 올가을 야구 월드시리즈 우승팀을 예측합니다.
신약 개발 과정에서 특정 분자가 제약 회사에 수익성 있는 신약이 될지 예측합니다.
분류와 예측의 핵심 차이
분류와 예측은 모두 지도 학습(supervised learning)에 속하며, 학습 데이터를 기반으로 모델을 구축한다는 점에서 동일합니다. 그러나 분류는 '어느 범주에 속하는가'라는 불연속적인 값을 다루는 반면, 예측은 '미래에 어떤 값이 될 것인가'라는 연속적인 값이나 미래 시점의 결과를 추정합니다. 두 기법을 상황에 맞게 적절히 선택하고 활용하는 것이 성공적인 데이터 마이닝 프로젝트의 첫걸음입니다.