Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 분류란 무엇인가? 개념부터 2단계 프로세스까지 한눈에 보기

데이터 분류(Data Classification)의 기본 개념

분류(Classification)는 데이터 인스턴스가 어떤 집단에 속할지를 예측하기 위해 사용되는 데이터 마이닝 기법입니다. 이 과정은 크게 두 단계로 진행됩니다. 첫 번째 단계에서는 미리 정의된 데이터 클래스 또는 개념의 집합을 나타내는 모델을 구축합니다. 이 모델은 속성(attribute)으로 정의된 데이터베이스 튜플(tuple)을 분석하여 만들어집니다.

각 튜플은 사전에 정의된 클래스 중 하나에 속한다고 간주되며, 이는 '클래스 레이블 속성(class label attribute)'이라 불리는 특정 속성에 의해 결정됩니다. 분류 관점에서 데이터 튜플은 샘플(sample), 예제(example), 객체(object)라고도 부릅니다. 모델을 만들기 위해 분석된 데이터 튜플들의 전체 집합을 훈련 데이터 세트(training data set)라고 하며, 이를 구성하는 개별 튜플은 훈련 샘플(training sample)이라고 합니다. 훈련 샘플은 전체 모집단에서 무작위로 추출됩니다.

지도 학습과 비지도 학습의 차이

각 훈련 샘플의 클래스 레이블이 이미 알려져 있기 때문에, 이러한 절차를 지도 학습(supervised learning)이라고 부릅니다. 반면 비지도 학습(unsupervised learning)은 훈련 샘플의 클래스 레이블이 알려져 있지 않고, 학습해야 할 클래스의 수조차 사전에 파악되어 있지 않은 경우에 해당합니다.

학습된 모델의 표현 방식

학습이 완료된 모델은 분류 규칙(classification rule), 의사결정 트리(decision tree), 또는 수학적 공식 등의 형태로 표현됩니다. 예를 들어 고객 신용 정보 데이터베이스가 주어졌다면, 고객을 '우수한 신용등급' 또는 '보통 신용등급'으로 판별하는 분류 규칙을 도출할 수 있습니다. 이렇게 학습된 규칙은 향후 새로운 데이터 샘플을 분류하는 데 활용될 수 있으며, 데이터베이스의 내용을 깊이 이해하는 데에도 큰 도움이 됩니다.

홀드아웃(Holdout) 방법을 이용한 모델 평가

홀드아웃 방법(holdout method)은 클래스 레이블이 부여된 테스트 세트(test set)를 사용하는 간단하면서도 효과적인 평가 기법입니다. 테스트 샘플은 무작위로 선정되며, 훈련 샘플과는 독립적입니다. 특정 테스트 세트에서 모델의 정확도(accuracy)는 모델이 올바르게 분류한 테스트 샘플의 비율로 측정됩니다. 즉, 각 테스트 샘플에 대해 실제 클래스 레이블과 모델이 예측한 클래스를 서로 비교하게 됩니다.

그렇다면 왜 굳이 별도의 테스트 세트가 필요할까요? 만약 모델의 정확도를 훈련 데이터 세트만으로 측정한다면, 그 추정치는 지나치게 낙관적일 수 있습니다. 학습된 모델은 훈련 데이터에 과적합(overfitting)되는 경향이 있기 때문입니다. 과적합이란 모델이 전체 모집단에는 존재하지 않는 훈련 데이터만의 특이한 노이즈나 예외까지 학습해버리는 현상을 말합니다. 따라서 객관적인 성능 평가를 위해서는 훈련에 사용되지 않은 별도의 테스트 세트가 반드시 필요합니다.

분류의 2단계 프로세스 요약

  • 1단계 — 학습(Learning): 분류 알고리즘이 훈련 데이터를 분석합니다. 이때 클래스 레이블 속성은 신용등급과 같은 대상이 되며, 학습된 모델 즉 분류기(classifier)는 분류 규칙의 형태로 표현됩니다.

  • 2단계 — 분류(Classification): 테스트 데이터를 사용하여 분류 규칙의 정확도를 측정합니다. 측정된 정확도가 만족스러운 수준이라면, 해당 규칙을 새로운 데이터 튜플의 분류에 실제로 적용할 수 있습니다.