Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

과학·공학 분야에서 데이터 마이닝의 역할은 무엇일까?

데이터 마이닝은 방대한 데이터 속에서 숨겨진 패턴과 지식을 발견하는 핵심 기술로, 과학 및 공학 분야에서 그 활용 범위가 빠르게 확장되고 있습니다. 이번 글에서는 과학과 공학 영역에서 데이터 마이닝이 수행하는 주요 역할을 하나씩 살펴보겠습니다.

1. 데이터 웨어하우스와 데이터 전처리

데이터 전처리와 데이터 웨어하우스 구축은 데이터 교환과 데이터 마이닝의 기반이 되는 필수 과정입니다. 여러 환경과 서로 다른 시점에서 수집된 일관성 없거나 호환되지 않는 정보를 통합하려면, 의미 체계(시맨틱), 참조 시스템, 수학적 표기, 측정 단위, 성능, 정확도 등을 조율하는 작업이 필요합니다.

또한 이질적인 소스에서 생성된 데이터를 통합하고 다양한 이벤트를 식별할 수 있는 체계적인 방법론이 함께 요구됩니다.

2. 복잡한 데이터 유형의 마이닝

현대의 수치 데이터 집합은 본질적으로 이질적입니다. 멀티미디어 데이터나 위치 정보가 담긴 스트림 데이터 같은 반정형·비정형 데이터는 물론, 게놈(genome) 및 프로테옴(proteome) 기록처럼 복잡하고 깊이 숨겨진 의미를 가진 데이터도 포함합니다.

따라서 시공간(spatiotemporal) 데이터, 생물학적 데이터, 개념 계층 구조, 복잡한 의미 관계를 효과적으로 처리할 수 있는 강력하고 전문화된 분석 기법이 필요합니다.

3. 그래프 기반 및 네트워크 기반 마이닝

그래프 또는 네트워크 모델링에서는 마이닝 대상 객체를 그래프의 정점(vertex)으로 정의하고, 정점 사이의 간선(edge)으로 객체 간 관계를 표현합니다. 예를 들어 화학 구조, 생물학적 경로, 유체 흐름 시뮬레이션과 같은 정수 기반 시뮬레이션이 생성하는 데이터를 모델링하는 데 그래프가 폭넓게 활용됩니다.

이러한 그래프·네트워크 기반 모델링의 성공 여부는 분류, 빈번한 패턴 마이닝, 클러스터링 등 다양한 그래프 기반 데이터 마이닝 서비스의 확장성과 효율성이 얼마나 개선되느냐에 달려 있습니다.

4. 시각화 도구와 도메인 특화 지식

고급 데이터 마이닝 시스템에는 고수준 그래픽 사용자 인터페이스(GUI)와 시각화 도구가 필수적입니다. 이러한 도구는 기존의 도메인 특화 데이터 및 데이터 시스템과 통합되어야 하며, 연구자와 일반 사용자가 패턴을 탐색하고, 발견된 패턴을 표현·시각화하며, 도출된 지식을 의사결정에 실질적으로 활용할 수 있도록 지원해야 합니다.

공학 분야 데이터 마이닝의 특징

공학 분야의 데이터 마이닝은 과학 분야와 여러 공통점을 지닙니다. 두 분야 모두 대량의 데이터를 수집하며, 데이터 전처리, 데이터 웨어하우징, 복잡한 유형의 데이터에 대한 확장 가능한 마이닝이 필요합니다. 또한 시각화를 적극 활용하고 그래프와 네트워크를 효과적으로 사용한다는 점도 같습니다.

특히 많은 공학 프로세스는 실시간 응답을 요구하기 때문에, 데이터 스트림의 실시간 마이닝이 필수적인 구성 요소로 자리 잡고 있습니다.

사회과학으로 확장되는 데이터 마이닝

오늘날 뉴스, 블로그, 기사, 웹 페이지, 온라인 토론, 제품 리뷰, SNS 게시물, 메시지, 방송 등 인터넷과 각종 소셜 네트워크를 통해 막대한 양의 인간 커뮤니케이션 데이터가 매일 쏟아지고 있습니다.

이러한 흐름 속에서 사회과학 및 사회 연구 분야에서의 데이터 마이닝이 급격히 주목받고 있습니다. 제품, 연설, 기사에 대한 고객이나 독자의 피드백을 분석하면 사회 전반의 여론과 감성(sentiment)을 파악할 수 있으며, 그 분석 결과는 추세 예측, 업무 개선, 의사결정 지원에 유용하게 활용될 수 있습니다.