데이터 마이닝(Data Mining)은 통계학·수학적 기법을 포함한 패턴 인식 기술을 활용하여, 저장소(repository)에 축적된 방대한 데이터 속에서 유용한 새로운 상관관계, 패턴, 추세를 발견하는 과정입니다. 이는 사실에 기반한 데이터셋을 분석해 기존에 알려지지 않았던 관계를 찾아내고, 데이터 소유자에게 논리적으로도 실질적으로도 도움이 되는 방식으로 기록을 요약하는 작업을 의미합니다.
쉽게 말해 데이터 마이닝은 대량의 정보를 대상으로 선택(selection), 탐색(exploration), 모델링(modeling)을 수행하여, 처음에는 알려지지 않았던 규칙성이나 관계를 밝혀내고 데이터베이스 소유자에게 명확하고 유익한 결과를 제공하는 절차라고 할 수 있습니다.
데이터 마이닝의 특징과 수행 방식
데이터 마이닝은 데이터 사이언스(Data Science)와 성격이 매우 유사합니다. 특정한 사람이 특정한 상황에서 구체적인 목표를 가지고 특정 데이터셋에 대해 수행한다는 점이 특징입니다. 이 과정에는 텍스트 마이닝, 웹 마이닝, 오디오·비디오 마이닝, 이미지 데이터 마이닝, 소셜 미디어 마이닝 등 다양한 유형의 서비스가 포함되며, 단순한 소프트웨어부터 고도로 전문화된 솔루션까지 다양한 도구를 통해 수행됩니다.
데이터 마이닝 아웃소싱의 장점
데이터 마이닝 업무를 외부 전문 업체에 아웃소싱하면 작업 속도를 크게 높이면서도 운영 비용은 낮출 수 있습니다. 또한 전문 기업들은 최신 기술을 활용해 사람이 일일이 찾기 어려운 데이터까지 효율적으로 저장하고 분석할 수 있습니다.
여러 플랫폼에 쏟아지는 데이터는 방대하지만, 실제로 활용 가능한 지식은 극히 제한적입니다. 바로 이 간극을 메워주는 것이 데이터 마이닝의 핵심 가치입니다.
데이터 마이닝의 다양한 이름
데이터 속에서 유용한 패턴을 찾아내는 이러한 접근 방식은 여러 이름으로 불려 왔습니다. 데이터 마이닝 외에도 지식 추출(Knowledge Extraction), 데이터 디스커버리(Data Discovery), 데이터 하베스팅(Data Harvesting), 데이터 아키퀄로지(Data Archaeology), 데이터 패턴 프로세싱(Data Pattern Processing) 등이 그 예입니다.
데이터 마이닝은 통계학자, 데이터 분석가, 경영정보시스템(MIS) 분야 전문가들이 오랫동안 활용해 온 방법론이며, 최근에는 데이터베이스 분야에서도 그 중요성이 크게 높아졌습니다. 데이터 마이닝에서는 대형 데이터베이스를 분석하여 의사결정 문제를 해결합니다.
과거 정보(Historical Data)란 무엇인가?
그렇다면 데이터 마이닝에서 말하는 '과거 정보'란 무엇일까요? 한 가지 예를 들어보겠습니다. 어떤 가게 주인이 신제품에 대한 정보를 얻고 싶어 한다고 가정해 봅시다. 데이터 마이닝 과정에서 활용되는 정보는 바로 과거 고객과의 상호작용 이력이 담긴 역사적(과거) 데이터베이스에 저장되어 있습니다. 여기에는 고객의 연령, 소득 수준, 제품에 대한 반응 등 고객 관련 특성 정보도 함께 포함됩니다.
데이터 마이닝 소프트웨어는 이러한 과거 정보를 바탕으로 고객 행동 모델(customer behavior model)을 구축합니다. 이렇게 만들어진 모델은 어떤 고객이 신제품에 긍정적으로 반응할 가능성이 높은지 예측하는 데 활용됩니다. 즉, 과거 정보는 단순한 기록이 아니라 미래를 예측하는 강력한 기반이 되는 것입니다.
과거 정보의 또 다른 활용: 사기 탐지
과거 정보는 신용카드 사기(card fraud)처럼 비교적 흔하게 발생하는 범죄를 발견하는 데에도 중요한 기초 자료가 됩니다. 과거 데이터에 나타난 패턴과 현재 데이터의 패턴을 서로 비교함으로써, 고객의 거래에서 비정상적인 변화가 감지되었는지 검증할 수 있습니다.
이처럼 과거 정보는 패턴 발견 도구로서 해당 분야에서 폭넓게 인정받고 있으며, 이러한 분석 과정을 통해 고객 역시 경제적인 혜택을 누릴 수 있습니다. 사기 피해를 사전에 차단하고 맞춤형 상품을 제안받는 것 등이 대표적인 예입니다.