Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

데이터 마이닝으로 분석할 수 있는 데이터 유형 완벽 정리

데이터 마이닝(Data Mining)은 방대한 양의 데이터 속에서 숨겨진 지식과 패턴을 추출하고 발굴하는 기술을 의미합니다. 데이터 마이닝은 대량의 데이터가 저장되고 끊임없이 처리되는 환경에서 주로 활용되는데, 대표적인 예로 은행 시스템을 들 수 있습니다. 은행은 막대한 규모의 데이터를 지속적으로 저장하고 처리해야 하기 때문에 데이터 마이닝 기술을 적극적으로 사용합니다.

데이터 마이닝의 작동 방식

데이터 마이닝에서는 여러 범주에 걸쳐 숨겨져 있던 데이터 패턴을 분석하여 유용한 정보로 가공합니다. 이렇게 수집된 데이터는 데이터 웨어하우스(data warehouse)에 통합된 후 다양한 데이터 마이닝 알고리즘이 적용되어 분석됩니다. 그 결과 비용 절감과 수익 증대로 이어지는 효과적인 의사결정을 내리는 데 큰 도움이 됩니다.

데이터 마이닝의 주요 대상 데이터 유형

데이터 마이닝에 활용되는 데이터는 저장 방식과 특성에 따라 여러 유형으로 나눌 수 있습니다. 각 유형의 특징을 자세히 살펴보겠습니다.

1. 관계형 데이터베이스(Relational Database)

관계형 데이터베이스는 데이터베이스 관리 시스템(DBMS)이라고도 불립니다. 상호 연관된 데이터의 집합인 '데이터베이스'와, 이를 관리하고 접근하기 위한 소프트웨어 프로그램들의 집합으로 구성됩니다.

관계형 데이터베이스는 여러 개의 테이블로 이루어지며, 각 테이블은 고유한 이름을 부여받습니다. 각 테이블은 속성(컬럼 또는 필드)들의 집합으로 구성되고, 일반적으로 대량의 튜플(레코드 또는 행)을 저장합니다. 각 튜플은 고유 키로 식별되는 하나의 객체를 나타내며, 일련의 속성 값으로 표현됩니다. 관계형 데이터베이스를 설계할 때는 개체-관계(ER) 모델과 같은 의미론적 데이터 모델이 널리 사용되며, ER 모델은 데이터베이스를 개체(entity)와 그들 간의 관계(relationship)의 집합으로 정의합니다.

2. 트랜잭션 데이터베이스(Transactional Database)

트랜잭션 데이터베이스는 각 레코드가 하나의 트랜잭션(거래)을 나타내는 파일로 구성됩니다. 하나의 트랜잭션은 일반적으로 고유한 거래 식별 번호(trans ID)와 해당 거래를 구성하는 항목 목록(예: 매장에서 구매한 상품들)을 포함합니다.

또한 트랜잭션 데이터베이스에는 이와 연관된 추가 테이블이 존재할 수 있습니다. 여기에는 거래 일자, 고객 ID, 판매원 ID, 거래가 발생한 지점 정보 등 판매와 관련된 부가 데이터가 함께 저장됩니다.

3. 객체-관계형 데이터베이스(Object-Relational Database)

객체-관계형 데이터베이스는 객체-관계형 데이터 모델을 기반으로 구축됩니다. 이 모델은 기존의 관계형 모델을 확장하여, 복잡한 객체를 처리할 수 있는 풍부한 데이터 타입과 객체지향(object orientation) 개념을 지원합니다.

4. 시간(Temporal) 데이터베이스

시간 데이터베이스는 시간과 관련된 속성을 포함하는 관계형 데이터를 저장합니다. 이러한 속성에는 여러 개의 타임스탬프(timestamp)가 포함될 수 있으며, 각 타임스탬프는 서로 다른 의미를 가질 수 있습니다.

5. 시퀀스(Sequence) 데이터베이스

시퀀스 데이터베이스는 실제 시간 개념의 유무와 관계없이 순서화된 이벤트들의 연속을 저장합니다. 대표적인 예로 고객의 쇼핑 순서, 웹 클릭 스트림(web click stream), 생물학적 서열(biological sequence) 등이 있습니다.

6. 시계열(Time-Series) 데이터베이스

시계열 데이터베이스는 반복적인 시간 측정(예: 매시간, 매일, 매주)을 통해 수집된 값이나 이벤트의 연속을 저장합니다. 주식 거래소 데이터, 재고 관리 데이터, 기온이나 풍속과 같은 자연 현상의 측정 데이터가 대표적인 예입니다.