데이터 마이닝이란 무엇인가?
데이터 마이닝(Data Mining)은 방대한 양의 데이터 속에서 유용한 지식을 추출하고 발굴하는 과정을 의미합니다. 일반적으로 막대한 양의 데이터를 저장하고 처리하는 환경에서 활용되며, '데이터 속에서 금광을 캐내는 작업'이라는 표현으로 비유되기도 합니다.
여러 학문이 융합된 학제간 분야
데이터 마이닝은 단일 학문이 아니라 데이터베이스 시스템, 통계학, 머신러닝, 시각화, 데이터 과학 등 다양한 분야가 결합된 학제간(interdisciplinary) 영역입니다. 사용되는 접근 방식에 따라 인공 신경망, 퍼지 이론 및 러프 집합 이론, 지식 표현, 귀납 논리 프로그래밍, 고성능 컴퓨팅 등 다른 분야의 기술이 함께 적용될 수 있습니다.
또한 마이닝할 데이터의 유형이나 특정 응용 분야에 따라서는 공간 데이터 분석, 정보 검색, 패턴 인식, 이미지 분석, 신호 처리, 컴퓨터 그래픽스, 네트워크 기술, 경제학, 경영학, 바이오인포매틱스, 심리학 등의 방법론이 통합되기도 합니다.
데이터 마이닝 시스템의 4가지 분류 기준
1. 마이닝 대상 데이터베이스의 종류에 따른 분류
데이터 마이닝 시스템은 어떤 종류의 데이터베이스를 대상으로 하는지에 따라 구분할 수 있습니다. 데이터베이스 시스템 자체도 데이터 모델, 데이터 유형, 응용 분야 등 다양한 기준으로 나뉘기 때문에, 각 유형마다 요구되는 마이닝 기법 역시 달라집니다.
예를 들어 데이터 모델을 기준으로 분류하면 관계형(relational), 트랜잭션(transactional), 객체-관계형(object-relational), 데이터 웨어하우스 마이닝 시스템으로 나눌 수 있습니다. 처리하는 데이터의 특수 유형을 기준으로 삼으면 공간(spatial) 데이터, 시계열(time-series) 데이터, 텍스트, 스트림(stream) 데이터, 멀티미디어 데이터 마이닝 시스템, 그리고 월드 와이드 웹(WWW) 마이닝 시스템 등으로 구분할 수 있습니다.
2. 발굴하는 지식의 종류에 따른 분류
데이터 마이닝 시스템은 어떤 종류의 지식을 발굴하는지에 따라서도 분류할 수 있습니다. 이는 데이터 마이닝의 기능적 특성과 직결되며, 특성화(characterization), 변별(discrimination), 연관 및 상관 분석, 분류(classification), 예측(prediction), 군집화(clustering), 이상치(outlier) 분석, 진화(evolution) 분석 등이 대표적인 기능입니다. 실제 데이터 마이닝 시스템은 대개 이러한 여러 기능을 통합하여 동시에 지원하는 경우가 많습니다.
3. 활용되는 기법에 따른 분류
데이터 마이닝 시스템은 내부적으로 사용하는 핵심 마이닝 기법에 따라서도 구분됩니다. 사용자와의 상호작용 정도를 기준으로 하면 자율형(autonomous) 시스템, 대화형 탐색(interactive exploratory) 시스템, 질의 주도(query-driven) 시스템 등으로 나눌 수 있으며, 데이터 분석 방법론의 차이를 기준으로 분류할 수도 있습니다.
4. 적용 분야에 따른 분류
마지막으로 데이터 마이닝 시스템은 실제 적용되는 응용 분야에 따라 분류할 수도 있습니다. 예컨대 금융, 통신, DNA 분석, 주식 시장, 전자우편(e-mail) 등 특정 도메인에 맞춰 맞춤형으로 설계된 시스템이 이에 해당합니다. 이러한 응용 분야들은 각 영역의 특수성 때문에 해당 분야에 특화된 방법론의 통합을 필요로 하는 경우가 많습니다.