Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 마이닝 변환이란? 핵심 개념과 4가지 주요 변환 기법

데이터 마이닝(Data Mining)은 저장소에 축적된 대량의 데이터 속에서 통계학 및 수학적 기법을 포함한 패턴 인식 기술을 활용해 유용한 상관관계, 패턴, 추세를 발견하는 과정입니다. 즉, 사실(fact) 데이터셋을 분석하여 예상치 못한 관계를 찾아내고, 데이터 소유자에게 논리적이면서도 실질적으로 도움이 되는 새로운 방식으로 기록을 요약하는 작업이라 할 수 있습니다.

데이터 마이닝의 주요 변환 기법

데이터 마이닝에서 활용되는 대표적인 변환 기법은 다음과 같습니다.

1. 정상·비정상·범위 이탈·불가능한 사실에 플래그 지정

측정된 사실에 특수 플래그를 표시하면 분석 품질을 크게 높일 수 있습니다. 일부 측정값은 정확하지만 극히 드문 경우일 수 있습니다. 예를 들어 작은 표본이나 특정 상황에 기반한 값이라면 실제로 유효하면서도 평소와 전혀 다른 수치를 보일 수 있습니다.

반면, 데이터에는 존재하지만 물리적으로 불가능하거나 설명할 수 없는 값도 있습니다. 이러한 경우 테이블에서 비정상 값을 삭제하기보다는 상태 플래그를 부여하여 분석에 포함하거나 제외할 수 있도록 관리하는 것이 바람직합니다.

이를 효과적으로 처리하는 방법은 팩트 레코드를 위한 별도의 데이터 상태 차원(status dimension)을 만드는 것입니다. 이 차원을 제약 조건으로 활용하면 각 팩트의 상태를 명확하게 정의할 수 있습니다.

2. 문맥상 무작위 값 또는 노이즈 식별 후 마스킹

앞선 변환의 특수한 사례로, 레거시 시스템이 실제 사실이 아닌 무작위 숫자를 전달했는지 식별하는 작업이 있습니다. 레거시 시스템이 값을 전달할 의도가 없었음에도 버퍼에 남아 있던 숫자가 그대로 데이터 웨어하우스로 넘어가는 경우가 대표적입니다. 이러한 사례를 확인했다면 해당 무작위 숫자는 반드시 널(NULL) 값으로 대체해야 합니다.

3. 널(Null) 값에 대한 일관된 처리 적용

데이터 마이닝 도구는 "존재할 수 없는 값"과 "존재하지만 알 수 없는 값"의 구분에 매우 민감합니다. 일부 데이터 마이닝 전문가들은 후자의 경우 가장 가능성 높은 값이나 중앙값(median)을 할당하여, 나머지 팩트 테이블 레코드가 분석에서 누락되지 않도록 처리합니다.

이러한 처리는 두 가지 방식으로 수행할 수 있습니다. 하나는 원본 데이터에서 널 값을 추정값으로 직접 덮어쓰는 방식이며, 다른 하나는 다양한 분석 옵션에 따라 널 데이터를 처리하는 방법을 내장한 고급 데이터 마이닝 도구를 활용하는 방식입니다.

4. 상태가 변경된 팩트 레코드에 플래그 지정

실무에서 유용하게 쓰이는 또 다른 변환은 팩트 테이블 레코드에 특수 상태 표시기를 추가하는 것입니다. 이를 통해 해당 계정(또는 고객, 제품, 위치)의 상태가 방금 변경되었거나 곧 변경될 예정임을 나타낼 수 있습니다. 상태 표시기는 스타 조인(star join) 설계에서 상태 차원으로 구현됩니다.

마무리

데이터 마이닝 변환은 원본 데이터를 분석에 적합한 형태로 다듬는 필수 과정입니다. 이상값 플래깅, 노이즈 제거, 널 값 처리, 상태 변경 추적과 같은 변환을 체계적으로 적용하면 분석 결과의 신뢰성과 정확도를 한층 높일 수 있습니다.