빅데이터 시리즈에서는 빅데이터의 기능적 계층에 대해 다룬 바 있으며, 지난 글에서는 클라우드 데이터 저장 도구 11선을 소개했습니다. 데이터 저장 이후의 다음 단계는 바로 '데이터 클렌징(Data Cleansing)' 과정입니다.
빅데이터를 이야기할 때, 비즈니스 데이터든 개인 데이터든 데이터가 놀라운 속도로 증가하고 있다는 점은 자명합니다. 실제 통계에 따르면 전 세계에서 하루에만 약 25경(2.5 Quintillion) 바이트의 데이터가 생성됩니다. 이러한 데이터에는 중복되거나 오류가 있는 레코드가 포함되어 있어, 인사이트를 도출하기 전에 반드시 걸러내야 합니다. 부정확한 데이터는 잘못된 가정과 분석으로 이어지고, 결국 프로젝트 실패로까지 번질 수 있습니다.
데이터 클렌징이란 특정 데이터베이스에서 부정확한 레코드를 수정하거나 필요에 따라 삭제하는 과정을 의미합니다. 그 목적은 이른바 '더티 데이터(Dirty Data)'를 탐지해 수정 또는 삭제함으로써, 해당 데이터 집합이 정확하고 시스템 내 다른 데이터 집합과도 일관성을 유지하도록 만드는 것입니다.
다양한 데이터 클렌징 도구가 존재합니다. 좋은 데이터 클렌징 도구는 데이터베이스에서 중복 데이터, 잘못된 항목, 부정확한 정보를 정리하는 데 큰 도움이 됩니다. 이러한 도구들은 사용 환경에 따라 아래와 같이 분류할 수 있습니다.
- 오프라인 데이터 클렌징 도구
- 클라우드 기반 데이터 클렌징 도구
- Salesforce 데이터 전용 데이터 클렌징 도구
이번 글에서는 그중 유용한 오프라인 데이터 클렌징 도구들을 소개해 드리겠습니다.
1. Drake

Drake는 사용이 간편하고 확장성이 뛰어난 텍스트 기반 데이터 워크플로 도구로, 명령 실행을 데이터와 그 의존성 중심으로 구성합니다. 데이터 처리 단계를 입력값과 출력값과 함께 정의하면, Drake가 의존성을 자동으로 해결하고 워크플로를 제어할 수 있는 다양한 옵션을 제공합니다. 여러 입출력을 지원하며 HDFS 지원도 기본 내장되어 있습니다.
2. OpenRefine

OpenRefine(구 Google Refine)은 지저분한 데이터를 다루기 위한 강력한 독립형 오픈소스 데스크톱 애플리케이션입니다. 데이터 랭글링 기능, 즉 데이터 정리와 형식 간 변환 기능을 제공합니다. 스프레드시트 애플리케이션과 비슷해 보이지만 실제로는 데이터베이스에 더 가까운 방식으로 작동합니다.
관계형 데이터베이스 테이블과 유사하게 열 아래 셀들이 있는 행 단위 데이터를 처리합니다. 하나의 OpenRefine 프로젝트는 하나의 테이블에 해당하며, 사용자는 다양한 필터링 조건으로 행의 표시 방식을 자유롭게 변경할 수 있습니다. 데이터셋에 수행한 모든 작업은 프로젝트에 기록되며, 다른 데이터셋에 그대로 재적용할 수 있다는 점도 큰 장점입니다.
3. Trifacta Wrangler

이 도구는 데이터 랭글링(Data Wrangling) 과정을 지원합니다. 데이터 랭글링이란 반자동화 도구를 활용해 원시(raw) 형태의 데이터를 더 쉽게 소비할 수 있는 다른 형식으로 변환하거나 매핑하는 과정을 넓은 의미로 지칭합니다.
Wrangler는 조직이 다양한 데이터로부터 가치를 창출하는 방식을 획기적으로 개선합니다. Trifacta Wrangler는 데이터 시각화, 머신러닝, 인간-컴퓨터 상호작용, 데이터 처리 분야의 최신 기법을 활용해 분석가가 데이터를 활용 가능한 형태로 만드는 새로운 접근 방식을 제시합니다. 목표는 단순합니다. 서식 작업에 쓰는 시간은 줄이고, 데이터 분석에 쓰는 시간을 늘리는 것입니다. 복잡한 실제 데이터를 분석 도구에 적합한 데이터 테이블로 대화형 방식으로 변환할 수 있습니다.
4. DataCleaner

DataCleaner는 데이터 품질 분석 애플리케이션이자 데이터 품질 솔루션 플랫폼입니다. 핵심은 강력한 프로파일링 엔진으로, 확장 가능한 구조 덕분에 데이터 클렌징, 변환, 보강(enrichment), 중복 제거, 매칭 및 병합 기능을 추가할 수 있습니다. 주요 기능은 다음과 같습니다.
- 데이터 값의 패턴, 누락값, 문자 집합 등 다양한 특성을 파악합니다.
- 이름 및 주소 검증을 통해 연락처 정보를 정제합니다.
- 퍼지 로직(fuzzy logic)과 설정 가능한 가중치·임계값으로 중복을 감지하고, 최종적으로 단일 버전을 생성합니다.
- 자체 클렌징 규칙을 직접 만들고, 여러 사용 시나리오와 대상 데이터베이스에 맞게 조합할 수 있습니다.
5. Winpure Clean & Match

데이터 품질 관리는 프로젝트나 캠페인 성공을 좌우하는 가장 중요한 요소입니다. Winpure Clean & Match는 비즈니스 또는 소비자 데이터의 정확도를 높이도록 특별히 설계된 데이터 클렌징 및 매칭 스위트입니다. 수상 경력이 있는 이 소프트웨어 스위트는 메일링 리스트, 데이터베이스, 스프레드시트, CRM의 정리·수정·중복 제거에 이상적입니다. Access, Dbase, SQL Server 같은 데이터베이스는 물론 Excel 표와 Txt 파일에도 사용할 수 있습니다.
6. TIBCO Clarity
TIBCO Clarity는 웹을 통해 SaaS(Software-as-a-Service) 형태로 온디맨드 소프트웨어 서비스를 제공하는 데이터 준비 도구입니다. 서로 다른 소스에서 수집한 원시 데이터를 발견, 프로파일링, 클렌징, 표준화하여 정확한 분석과 현명한 의사결정에 필요한 양질의 데이터를 제공합니다. TIBCO Clarity의 원시 데이터 관리 기능은 다음과 같습니다.
- 원활한 통합
- 데이터 발견 및 프로파일링
- 중복 제거
- 주소 표준화
- 데이터 변환
7. Data Ladder
Data Ladder는 데이터 품질 소프트웨어 전문 기업으로, 데이터 매칭, 프로파일링, 중복 제거, 보강 도구를 통해 비즈니스 사용자가 데이터를 최대한 활용하도록 돕는 것을 목표로 합니다. DataMatch Enterprise 스위트는 고객 및 연락처 데이터 품질 문제 해결에 특화된 고시각성 데스크톱 데이터 클렌징 애플리케이션입니다. DataMatch Enterprise는 음성학적 변형, 퍼지 매칭, 잘못 입력된 값, 축약형 변형을 감지하기 위한 다양한 독점 및 표준 알고리즘을 포함합니다.
Data Deduplication Software는 데이터 품질, 클렌징, 매칭, 중복 제거 기능을 하나의 사용하기 쉬운 소프트웨어 스위트로 완벽하게 통합한 올인원 솔루션입니다.
8. Star DQ Pro

Star DQ Pro는 데이터가 정확하고 진본이며 최신 상태로 유지되도록 도와줍니다. 정확성, 완전성, 일관성, 적시성, 고유성, 유효성 같은 데이터 품질의 핵심 요건을 모두 다룹니다. 주요 기능은 다음과 같습니다.
- 클렌징(Cleansing): 결함 유형을 판별하고, 코멘트와 함께 미정제 데이터의 로그를 생성합니다.
- 중복 제거(De-duping): 그룹핑과 클러스터링, 잘못 표현된 항목 식별, 지속적인 증분식 중복 제거를 지원합니다.
- 모니터링(Monitoring): 트랜잭션 로그, 메일/SMS 기반 프로세스 상태 알림, 사용자 인증을 제공합니다.
대량의 데이터를 저장할 때 데이터 클렌징은 특히 중요합니다. 더티 데이터에 대한 교정 조치의 궁극적인 목표는 오류를 최대한 무의미한 수준으로 줄이는 것입니다. 정기적으로 데이터 클렌징을 수행하지 않으면 오류가 누적되어 업무 효율이 점차 저하될 수 있습니다. 다음 빅데이터 글에서는 클라우드 기반 데이터 클렌징 도구와 Salesforce 데이터베이스용 도구를 소개할 예정입니다.