데이터 웨어하우징(Data Warehousing)은 다양한 소스에서 데이터를 수집하고 관리하여 기업에 의미 있는 비즈니스 인사이트를 제공하는 기술입니다. 데이터 웨어하우스는 특히 경영진의 의사결정을 지원하도록 설계되었습니다.
쉽게 말해, 데이터 웨어하우스는 조직의 운영 데이터베이스(Operational Database)와는 독립적으로 유지·관리되는 데이터베이스를 의미합니다. 데이터 웨어하우스 시스템은 여러 애플리케이션 시스템의 통합을 가능하게 하며, 분석에 필요한 통합된 과거 정보의 견고한 플랫폼을 제공함으로써 안정적인 데이터 처리 환경을 구축합니다.
데이터 웨어하우스와 데이터 마이닝의 관계
데이터 웨어하우스는 다차원 공간에서 데이터를 일반화하고 중앙 집중화합니다. 데이터 웨어하우스 구축 과정에는 데이터 정제(Data Cleaning), 데이터 통합(Data Integration), 데이터 변환(Data Transformation)이 포함되며, 이는 데이터 마이닝(Data Mining)의 중요한 전처리 단계로 볼 수 있습니다.
또한 데이터 웨어하우스는 온라인 분석 처리(OLAP) 도구를 제공하여 다양한 입자성(Granularity)을 가진 다차원 데이터를 대화형으로 분석할 수 있게 하고, 이를 통해 효율적인 데이터 일반화와 데이터 마이닝을 지원합니다. 연관 규칙(Association), 분류(Classification), 예측(Prediction), 군집화(Clustering) 등 여러 데이터 마이닝 기능을 OLAP 연산과 결합하면, 다양한 추상화 수준에서 지식을 대화형으로 발굴할 수 있습니다.
데이터 웨어하우스의 세 가지 유형
데이터 웨어하우스는 크게 다음의 세 가지 유형으로 나눌 수 있습니다.
1. 엔터프라이즈 데이터 웨어하우스(EDW)
엔터프라이즈 데이터 웨어하우스(Enterprise Data Warehouse)는 중앙 집중식 웨어하우스로, 데이터를 체계적으로 조직화하고 표현하는 데 활용됩니다. EDW를 사용하면 사용자가 주제(Subject)별로 데이터를 분류할 수 있습니다.
2. 운영 데이터 스토어(ODS)
운영 데이터 스토어(Operational Data Store)에서는 데이터 웨어하우스가 실시간으로 갱신됩니다. 따라서 기록 저장 등 일상적인 업무 활동에 더 널리 활용됩니다.
3. 데이터 마트(Data Mart)
데이터 마트(Data Mart)는 데이터 웨어하우스의 하위 집합으로 정의할 수 있으며, 영업, 재무 등 특정 부서나 목적에 맞게 설계됩니다.
데이터 웨어하우스의 4대 특징
데이터 웨어하우스는 다음과 같은 특징을 가집니다.
- 주제 지향적(Subject-Oriented) — 데이터 웨어하우스는 의사결정자를 위한 정보 모델링과 분석에 초점을 맞춥니다. 따라서 의사결정 지원에 불필요한 정보를 제외하고, 특정 주제에 대해 단순하고 명확한 관점을 제공합니다.
- 통합성(Integrated) — 데이터 웨어하우스는 관계형 데이터베이스, 플랫 파일, 온라인 트랜잭션 기록 등 서로 다른 이기종 소스를 통합하여 구축되는 경우가 많습니다. 그렇기 때문에 명명 규칙, 인코딩 방식, 속성 측정 단위 등의 일관성을 확보하기 위해 데이터 정제 및 데이터 통합 기법을 적용해야 합니다.
- 시간 가변성(Time-Variant) — 데이터는 과거 5~10년과 같은 역사적 관점에서 조회할 수 있도록 저장됩니다. 데이터 웨어하우스 내 모든 키 구조에는 명시적이든 암시적이든 시간 요소가 포함됩니다.
- 비휘발성(Non-Volatile) — 데이터 웨어하우스는 운영 환경의 데이터를 변환하여 물리적으로 독립된 저장소에 보관합니다. 이러한 분리 구조 덕분에 트랜잭션 처리, 복구, 동시성 제어 메커니즘이 필요하지 않습니다. 데이터 접근은 초기 데이터 로딩과 데이터 조회라는 두 가지 작업만으로 충족됩니다.