Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

KDD란 무엇일까? 데이터베이스 지식 발견의 핵심 개념과 프로세스

KDD의 정의

KDD(Knowledge Discovery in Databases, 데이터베이스 지식 발견)는 대량의 데이터 속에서 유용한 지식을 발견하는 전반적인 과정을 가리키는 개념입니다. KDD는 특정 데이터 마이닝 기법의 실질적인 응용에 중점을 두며, 인공지능, 머신러닝, 패턴 인식, 데이터베이스, 통계학, 전문가 시스템을 위한 지식 획득, 데이터 시각화 등 다양한 분야의 연구자들이 깊은 관심을 보이는 학문 영역입니다.

KDD의 주요 목표

KDD 프로세스의 핵심 목표는 방대한 데이터베이스 속에서 정보를 기반으로 의미 있는 데이터를 추출하는 것입니다. 이를 위해 데이터 마이닝 알고리즘을 활용하여 어떤 것이 '지식'으로 간주될 수 있는지 식별합니다. KDD는 대규모 데이터 저장소에 대한 체계적인 탐색적 분석 및 모델링 활동으로 정의되며, 크고 복잡한 데이터 집합에서 유효하고 유용하며 이해하기 쉬운 패턴을 찾아내는 조직화된 과정입니다.

비자명(Non-trivial)한 탐색 과정

KDD는 데이터 안에서 유효하고 새롭으며 잠재적으로 유용하고 궁극적으로 이해 가능한 패턴을 식별하는 비자명(non-trivial)한 절차입니다. 여기서 '비자명'이라는 표현은 단순히 숫자 집합의 평균값을 계산하는 것처럼 미리 정의된 값을 산출하는 쉬운 연산이 아니라, 일종의 탐색(search) 또는 추론(inference)이 포함됨을 의미합니다. 또한 KDD는 데이터 준비, 패턴 탐색, 지식 평가 및 정제 등 여러 단계로 구성되며, 이러한 단계들은 여러 차례 반복(iteration)하여 수행됩니다.

데이터 마이닝과 KDD의 관계

데이터 마이닝은 KDD 프로세스의 핵심에 해당합니다. 데이터 마이닝은 레코드를 조사하고 모델을 구축하며, 이전에 알려지지 않았던 패턴을 발견하는 알고리즘 기반의 추론 작업을 포함합니다. 이렇게 구축된 모델은 데이터로부터 지식을 추출하고, 데이터를 분석하며, 미래의 값을 예측하는 데 활용됩니다.

데이터 마이닝은 KDD 프로세스의 한 단계로서, 허용 가능한 계산 효율 범위 내에서 데이터 위에 존재하는 특정 패턴(또는 모델)들을 열거(enumeration)하는 데이터 분석 및 발견 알고리즘을 적용하는 작업을 말합니다.

패턴 공간과 계산적 제약

탐색 대상이 되는 패턴의 공간은 종종 무한대에 가까우며, 패턴을 열거하는 작업은 이 공간 안에서 일종의 탐색 과정을 수반합니다. 따라서 현실적인 계산 자원의 제약은 데이터 마이닝 알고리즘이 실제로 분석할 수 있는 하위 공간(subspace)에 상당한 한계를 부여하게 됩니다.

KDD 프로세스의 전체 흐름

완전한 KDD 프로세스는 다음과 같은 요소들로 구성됩니다.

  • 데이터베이스를 활용하면서 필요한 선택(selection), 전처리(preprocessing), 서브샘플링(subsampling), 변환(transformation) 수행
  • 데이터 마이닝 방법(알고리즘)을 적용하여 데이터로부터 패턴을 열거
  • 데이터 마이닝 결과물을 평가하여 열거된 패턴 중 '지식'으로 인정할 부분집합을 식별

KDD 프로세스에서 데이터 마이닝 구성 요소는 레코드로부터 패턴을 추출하고 열거하는 알고리즘적 방법에 초점을 맞춥니다. 반면 전체 KDD 프로세스는 마이닝된 패턴에 대한 평가와 해석까지 포함하여, 어떤 패턴이 새로운 지식으로 인정될 수 있는지 최종적으로 결정하는 역할을 담당합니다.