데이터 마이닝이란?
데이터 마이닝(data mining)은 저장소에 축적된 방대한 데이터 속에서 통계학·수학 기법 등 패턴 인식 기술을 활용해 유용한 상관관계, 패턴, 추세를 발견하는 과정입니다. 즉, 사실에 기반한 데이터셋을 분석하여 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 기록을 요약하는 작업을 의미합니다.
여러 학문이 융합된 학제간 분야
데이터 마이닝은 데이터베이스 시스템, 통계학, 머신러닝, 시각화, 데이터 과학 등 다양한 분야가 결합된 학제간(interdisciplinary) 분야입니다. 적용되는 접근 방식에 따라 인공 신경망, 퍼지 이론(fuzzy set theory) 또는 러프 집합 이론(rough set theory), 지식 표현, 귀납 논리 프로그래밍, 고성능 컴퓨팅 등 타 분야의 기법이 함께 활용되기도 합니다.
데이터 마이닝과 데이터 사이언스의 관계
데이터 마이닝은 데이터 사이언스와 매우 유사합니다. 특정 목표를 가진 사람이 특정 상황에서 구체적인 데이터셋을 대상으로 수행하는 작업으로, 텍스트 마이닝, 웹 마이닝, 오디오·비디오 마이닝, 이미지 데이터 마이닝, 소셜 미디어 마이닝 등 다양한 서비스 유형을 포함합니다. 간단한 소프트웨어부터 고도로 전문화된 도구까지 폭넓게 활용됩니다.
데이터 마이닝 아웃소싱의 장점
데이터 마이닝을 외부 전문 업체에 위임하면 낮은 운영 비용으로 작업 속도를 크게 높일 수 있습니다. 전문 업체들은 최신 기술을 통해 수작업으로는 찾아내기 어려운 데이터까지 저장하고 분석할 수 있습니다. 여러 플랫폼에 쏟아지는 데이터는 방대하지만, 실제 활용 가능한 지식은 매우 제한적이라는 점이 문제입니다.
따라서 핵심 과제는 문제 해결이나 기업 성장에 활용할 수 있는 필수 정보를 데이터에서 추출하는 것입니다. 다행히 데이터를 마이닝하고 더 나은 의사결정을 내리는 데 도움을 주는 다양한 동적 도구와 기법들이 존재합니다.
데이터 마이닝의 주요 한계
데이터 마이닝의 한계는 대부분 기술 자체의 문제라기보다 데이터 또는 인력과 관련된 경우가 많습니다. 대표적인 제약 요소는 다음과 같습니다.
- 숙련된 전문 인력 필수: 데이터 마이닝 소프트웨어는 강력한 도구지만, 그 자체로 완결된 애플리케이션은 아닙니다. 분석을 체계적으로 설계하고 결과물을 올바르게 해석할 수 있는 기술·분석 전문가가 반드시 필요합니다.
- 패턴의 가치 판단 불가: 데이터 마이닝은 패턴과 관계를 도출할 뿐, 해당 패턴의 가치나 중요성까지 알려주지 못합니다. 이러한 최종 판단은 사용자가 직접 내려야 합니다.
- 현실 세계와의 검증 필요: 발견된 패턴의 타당성은 실제 상황과 얼마나 부합하는지에 따라 좌우됩니다. 예를 들어 대규모 인구 집단에서 잠재적 테러 용의자를 식별하도록 설계된 애플리케이션의 경우, 알려진 테러범 정보가 포함된 데이터로 모델을 검증함으로써 그 유효성을 평가할 수 있습니다.
- 인과관계 확인 불가: 데이터 마이닝은 행동과 변수 간의 연관성을 식별할 수 있지만, 반드시 인과관계를 밝혀주는 것은 아닙니다. 예컨대 항공편 출발 직전 항공권을 구매하는 행동 패턴이 소득, 교육 수준, 인터넷 사용량 같은 특성과 연관되어 있음은 파악할 수 있지만, 어느 것이 원인인지는 별도로 분석해야 합니다.