데이터 마이닝이란 무엇인가?
데이터 마이닝(Data Mining)은 저장소에 대량으로 축적된 데이터 속에서 통계학 및 수학 기법을 포함한 패턴 인식 기술을 활용하여, 유용한 새로운 상관관계·패턴·트렌드를 발견하는 과정입니다. 즉, 사실에 기반한 데이터셋을 분석해 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적으로도 실용적으로도 가치 있는 방식으로 기록을 요약·정리하는 작업이라 할 수 있습니다.
데이터 마이닝에는 여러 가지 핵심 개념이 있으며, 대표적인 것들은 다음과 같습니다.
1. 분류(Classification)
분류는 데이터 클래스나 개념을 표현하고 구별하는 모델을 발견하는 절차입니다. 이렇게 만들어진 모델은 클래스 레이블이 알려지지 않은 객체의 클래스를 예측하는 데 활용됩니다. 도출된 모델은 클래스 레이블이 이미 확인된 학습 데이터(훈련 레코드) 집합을 분석한 결과를 바탕으로 구축됩니다.
2. 예측(Prediction)
예측은 분류와 유사하지만, 미래의 결과값을 추정한다는 점에서 차이가 있습니다. 비즈니스와 연구 분야에서 활용되는 예측 함수의 예는 다음과 같습니다.
- 3개월 후 주가 전망 예측
- 속도 제한 상향 시 내년 교통사고 사망률 증가율 예측
- 팀 통계 데이터 비교를 기반으로 한 올 가을 야구 월드시리즈 우승팀 예측
- 신약 개발 과정에서 특정 분자가 제약 회사에 수익성 있는 신약이 될 가능성 예측
3. 연관 규칙(Association Rules)과 추천 시스템
연관 규칙 또는 친화도 분석(affinity analysis)은 대규모 데이터베이스 안에서 항목들 간의 일반적인 연관 패턴을 찾아내기 위한 기법입니다. 이러한 규칙은 다양한 방식으로 활용될 수 있습니다. 예를 들어, 식료품점은 고객의 구매 패턴 정보를 활용해 상품 진열 위치를 최적화하거나, 주간 프로모션 기획, 상품 번들링(묶음 판매) 전략을 세우는 데 사용할 수 있습니다.
또한 병원 데이터베이스에서 환자의 입원 기록별 증상을 분석해 도출한 연관 규칙은 "어떤 증상 뒤에 어떤 증상이 나타나는가"를 파악하는 데 도움을 주며, 재방문 환자의 향후 증상을 예측하는 데도 활용될 수 있습니다.
4. 데이터 축소(Data Reduction)
데이터 마이닝은 방대한 데이터베이스에서 선별된 데이터를 대상으로 수행되는데, 대량의 레코드를 분석하고 마이닝하면 처리 시간이 매우 오래 걸려 현실적으로 불가능하거나 비효율적일 수 있습니다.
이를 해결하기 위해 데이터 축소 기법이 사용됩니다. 원본 데이터의 무결성을 유지하면서 부피가 훨씬 작은 축약된 데이터셋 표현을 얻어, 분석 처리 시간을 단축하는 것입니다. 데이터 크기를 줄이면 데이터 마이닝 프로세스의 효율이 향상되면서도 동일한 분석 결과를 얻을 수 있습니다.
데이터 축소의 목표는 데이터를 더 간결하게 표현하는 것입니다. 데이터 크기가 작아질수록 성숙한 알고리즘이나 계산 비용이 높은 알고리즘을 더 쉽게 적용할 수 있습니다. 축소는 행(레코드)의 수를 줄이는 방식과 열(차원)의 수를 줄이는 방식, 두 가지 관점에서 이루어질 수 있습니다.