Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 집계(Data Aggregation)란 무엇인가? 개념부터 활용 사례까지

데이터 집계란?

데이터 집계(Data Aggregation)는 흩어져 있는 데이터를 수집하여 요약된 형태로 정리·표현하는 과정을 말하며, 주로 통계 분석 등의 목적으로 활용됩니다. 데이터 마이닝의 한 종류로, 특정 비즈니스 목표를 달성하거나 사람의 분석 업무를 지원하기 위해 데이터를 검색·수집한 뒤 보고서 형태의 요약본으로 제공하는 일련의 절차입니다.

데이터 집계는 사람이 직접 수행할 수도 있고, 전문 소프트웨어를 통해 구현할 수도 있습니다. 집계의 궁극적인 목적은 연령, 직업, 소득과 같은 특정 변수를 기준으로 특정 집단(그룹)에 대한 더 깊이 있는 데이터를 확보하는 것입니다.

이렇게 수집된 집단별 데이터는 웹사이트 개인화에 활용되어, 해당 데이터가 수집된 하나 이상의 집단에 속한 개인에게 어필할 만한 콘텐츠와 광고를 선별하는 데 사용됩니다.

데이터 집계의 대표적인 예시

예를 들어 음반(CD) 판매 사이트는 고객의 나이와 해당 연령대 집단의 집계 데이터를 바탕으로 특정 CD 광고를 노출할 수 있습니다. 또한 온라인 분석 처리(OLAP)는 데이터 집계의 한 유형으로, 분석 담당자가 온라인 보고 체계를 통해 데이터를 처리하는 방식을 의미합니다.

사용자 기반 데이터 집계

데이터 집계는 사용자 중심으로 이루어질 수도 있습니다. 개인 데이터 집계 서비스는 여러 웹사이트에 흩어져 있는 사용자의 개인 정보를 한곳에서 확인할 수 있는 단일 창구를 제공합니다. 사용자는 하나의 개인 식별 번호(PIN)만으로 금융기관, 항공사, 도서·음악 클럽 등 여러 계정에 접근할 수 있습니다. 이러한 유형의 데이터 집계는 '스크린 스크래핑(Screen Scraping)'이라고 정의됩니다.

데이터 애그리게이터와 집계 솔루션

데이터 애그리게이터(데이터 집계업체)에게 데이터는 사업의 부산물이 아니라 그 자체가 핵심 사업입니다. 데이터를 구매하고, 변환하고, 스크러빙·클렌징·표준화한 뒤, 매칭·검증·분석과 통계적 추정을 거쳐 판매할 수 있어야 하기 때문입니다. 따라서 이러한 운영의 기반이 되는 견고한 데이터 집계 솔루션이 반드시 필요합니다.

효과적인 데이터 집계 솔루션은 다음과 같은 세 가지 특징을 갖추어야 합니다.

  • 핵심 프로세스의 완전 자동화: 데이터 집계 과정의 주요 단계를 완전히 자동화하여 IT 팀의 생산성을 높이고, 전달 시간을 단축하며, 비용을 획기적으로 절감할 수 있습니다. 덕분에 기업은 고유의 데이터 샘플링, 데이터 추정, 데이터 조립 등 경쟁사와 차별화되는 핵심 역량에 집중할 수 있습니다.

  • 모든 형식·모든 소스의 데이터 변환 지원: 어떤 형식이든, 어떤 출처의 데이터든 변환할 수 있어야 새로운 시장을 겨냥한 신규 제품과 서비스를 만들 수 있습니다.

  • 데이터 품질 문제의 조기 탐지: 데이터 품질 문제를 초기 단계에서 발견하면 고품질의 마케팅 리서치, 판매 시점(POS) 분석 등 다양한 데이터 제품을 더 빠르고 낮은 비용으로 생산할 수 있습니다.