데이터 마이닝(Data Mining)이란?
데이터 마이닝은 방대한 원시 데이터(raw data) 속에서 유용한 정보, 패턴, 추세를 추출하는 과정을 말합니다. 데이터 마이닝은 정교한 수치 알고리즘을 활용해 데이터를 분할하고 미래 사건의 발생 확률을 계산합니다.
데이터 마이닝에는 다양한 유형의 서비스가 포함됩니다. 대표적으로 텍스트 마이닝(text mining), 웹 마이닝(web mining), 오디오 및 비디오 마이닝, 이미지 데이터 마이닝, 소셜 네트워크 데이터 마이닝 등이 있습니다.
데이터 마이닝은 기본적인 소프트웨어부터 고급 소프트웨어까지 다양한 도구를 통해 수행되며, '데이터 내 지식 발견(KDD, Knowledge Discovery in Data)'이라고도 불립니다.
데이터 마이닝은 분석 도구를 포함한 여러 종류의 소프트웨어 패키지를 활용할 수 있습니다. 자동화된 방식으로 진행할 수도 있고, 경우에 따라서는 개별 작업자가 아카이브나 데이터베이스에 특정 정보 조회 요청을 보내는 노동 집약적인 방식으로 이루어지기도 합니다.
데이터 과학(Data Science)이란?
데이터 과학은 정보를 중심으로 하는 컴퓨터 과학의 신흥 분야입니다. 다양한 장치, 알고리즘, 머신러닝 원리를 결합하여 구조화된 데이터와 비정형 데이터 모두에서 실질적으로 활용 가능한 데이터를 추출하는 학제 간(interdisciplinary) 영역입니다.
데이터 과학은 단순히 통계학이나 머신러닝만으로 구성되는 것이 아니라, 그 자체로 하나의 독립된 분야입니다. 복잡한 데이터의 세계를 탐구하기 위해 데이터 분석과 모델링을 다룹니다.
이러한 업무를 수행하는 사람이 바로 데이터 사이언티스트(data scientist)입니다. 데이터 사이언티스트는 여러 소스로부터 데이터를 수집하고, 이를 체계적으로 정리·분석한 뒤, 그 결과를 비즈니스 의사결정에 실질적으로 반영될 수 있는 형태로 연결합니다. 궁극적인 목표는 데이터로부터 유의미한 인사이트(insight)를 도출하는 것입니다.
데이터 마이닝과 데이터 과학 비교
그렇다면 데이터 마이닝과 데이터 과학은 어떤 점에서 다를까요? 아래 표를 통해 두 분야의 주요 차이점을 살펴보겠습니다.
| 데이터 마이닝 | 데이터 과학 |
|---|---|
| 대규모 데이터베이스에서 유용한 데이터, 패턴, 추세를 추출하는 단계입니다. | 다양한 도구와 방법론을 활용해 구조화된 데이터와 비정형 데이터로부터 가치 있는 인사이트를 얻는 전체 과정을 의미합니다. |
| 주된 목적은 기존 정보에서 이전에 알려지지 않았던 특성을 발견하고, 해당 데이터로부터 통계적 규칙이나 패턴을 찾아 복잡한 연산 문제를 해결하는 것입니다. | 주된 목적은 특수화된 계산 방법을 사용해 데이터셋 내에서 의미 있고 유용한 데이터를 찾아내어 중요한 의사결정을 내리는 데 활용하는 것입니다. |
| 발견된 추세와 패턴은 조직이 운영, 마케팅, 재무 전략을 수립하고 비즈니스 성장을 촉진하는 데 활용됩니다. | 데이터 과학은 프로젝트, 프로그램 또는 포트폴리오 중심의 분석을 위한 길을 여는 과학적 연구 활동입니다. |
| 여러 소스에서 데이터를 발견하고 이를 유용한 도구로 변환하는 데 초점을 맞추며, 다양한 산업 분야에서 활용될 수 있습니다. | 조직을 위해 데이터 중심의 제품을 만들고 데이터를 바탕으로 의사결정을 이끌어내며, 역시 다양한 산업 분야에서 활용됩니다. |