데이터 집계란 무엇인가?
데이터 집계(Data Aggregation)는 여러 출처에서 수집한 데이터를 통계 분석 등의 목적에 맞게 요약된 형태로 모으고 표현하는 과정입니다. 이는 데이터 마이닝 절차의 일종으로, 데이터를 검색·수집한 뒤 보고서 형식의 요약본으로 제공함으로써 특정 비즈니스 목표를 달성하거나 사람의 분석 업무를 지원하는 역할을 합니다.
데이터 집계는 수작업으로도 구현할 수 있지만, 일반적으로는 전문 소프트웨어를 통해 수행됩니다. 집계의 핵심 목적은 연령, 직업, 소득과 같은 특정 변수를 기준으로 특정 집단(그룹)에 관해 더 많은 정보를 얻는 것입니다.
이렇게 확보된 집단별 데이터는 웹사이트 개인화에 활용될 수 있습니다. 즉, 기록이 수집된 하나 이상의 집단에 속한 개인에게 어필할 만한 콘텐츠와 광고를 선별하는 데 사용되는 것입니다.
활용 예시
예를 들어 음악 CD 판매 사이트는 고객의 나이와 해당 연령대 집단의 데이터 집계 결과를 바탕으로 특정 CD 광고를 노출할 수 있습니다. 또한 온라인 분석 처리(OLAP)는 거래자가 온라인 보고 체계를 통해 데이터를 처리하는 대표적인 데이터 집계 방식 중 하나입니다.
사용자 기반 데이터 집계
개인 데이터 집계 서비스는 다른 웹사이트에 흩어져 있는 사용자 자신의 데이터를 한곳에서 확인할 수 있는 단일 창구를 제공합니다. 사용자는 개인 식별 번호(PIN) 하나만으로 금융기관, 항공사, 독서·음악 클럽 등 여러 계정에 접근할 수 있습니다. 이러한 유형의 데이터 집계는 '스크린 스크래핑(Screen Scraping)'이라고 정의됩니다.
데이터 집계 솔루션이 필요한 이유
데이터 애그리게이터(집계 전문업체)에게 데이터는 사업의 부산물이 아니라 그 자체가 사업입니다. 데이터를 구매하고, 변환하고, 정제(스크럽·클렌징)하고, 표준화하고, 매칭하고, 검증하고, 분석하고, 통계적으로 추정한 뒤 판매할 수 있어야 하기 때문입니다. 이를 위해서는 운영의 기반이 되는 견고한 데이터 집계 솔루션이 필수적입니다.
1. 핵심 프로세스의 완전 자동화
데이터 집계 솔루션은 집계 과정의 핵심 단계를 완전히 자동화합니다. 이를 통해 IT팀은 생산성을 높이고 납기 시간을 단축하며 비용을 크게 절감할 수 있습니다. 자동화 덕분에 조직은 고유의 데이터 샘플링, 데이터 추정, 데이터 조립 같은 핵심 역량, 즉 경쟁사와 차별화되는 강점에 집중할 수 있습니다.
2. 모든 형식·소스의 데이터 변환
어떤 형식이든, 어떤 소스에서 나온 데이터든 변환할 수 있어야 기업이 새로운 시장을 위한 신제품을 만들 수 있습니다.
3. 데이터 품질 문제의 조기 감지
데이터 품질 문제를 초기 단계에서 발견하면, 기업은 고품질의 마케팅 리서치, 판매시점(POS) 분석 등 다양한 데이터 제품을 더 빠르고 낮은 비용으로 생산할 수 있습니다.