Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

시퀀스 데이터 마이닝의 유형은 무엇일까? 핵심 개념 총정리

시퀀스(sequence)는 사건(event)들이 순서대로 나열된 목록을 의미합니다. 시퀀스 데이터는 다루는 사건의 특성에 따라 크게 세 가지 유형으로 나눌 수 있으며, 각 유형마다 분석 목적과 기법이 다릅니다. 이 글에서는 시퀀스 데이터 마이닝의 주요 유형과 핵심 개념을 살펴보겠습니다.

1. 시계열 데이터의 유사도 검색

시계열(time-series) 데이터셋은 일정한 시간 간격(예: 매분, 매시간, 매일)으로 반복 측정하여 얻은 수치 값들의 연속입니다. 측정 주기가 균일하다는 점이 시계열 데이터의 중요한 특징입니다.

시계열 데이터베이스는 주식 시장 분석, 경제 및 판매 예측, 예산 분석, 유틸리티 조사, 재고 관리, 매출 추정, 업무량 예측, 공정 및 품질 관리 등 매우 다양한 응용 분야에서 활용됩니다. 또한 자연 현상 연구, 수학·공학 실험, 약물 치료 분석 등 학술 연구에서도 유용하게 사용됩니다.

2. 시계열 데이터의 회귀 및 추세 분석

시계열 데이터의 회귀 분석은 데이터 및 신호 분석 분야에서 오랫동안 발전해 온 기법입니다. 추세 분석은 다음 네 가지 주요 변동 요소를 통합한 모델을 구축함으로써 시계열 데이터를 체계적으로 설명합니다.

추세(Trend) 또는 장기적 변동

시간의 흐름에 따라 시계열 그래프가 향하는 전반적인 방향을 의미합니다. 가중 이동 평균(weighted moving average)이나 최소제곱법(least squares)을 적용하면 추세 곡선을 도출할 수 있습니다.

순환 변동(Cyclic Movements)

추세선이나 추세 곡선을 중심으로 나타나는 장기적인 진동을 말합니다. 경기 순환처럼 비교적 긴 주기를 가진 변동이 여기에 해당합니다.

계절 변동(Seasonal Variations)

연속되는 여러 해의 같은 계절마다 반복적으로 나타나는 유사한 패턴입니다. 명절 쇼핑 성수기가 대표적인 예입니다. 효과적인 추세 분석을 위해서는 자기상관(autocorrelation)으로 계산한 계절 지수(seasonal index)를 바탕으로 데이터를 '비계절화(deseasonalized)'하는 과정이 필요합니다.

우연 변동(Random Movements)

파업 등 노동 분쟁이나 조직 내 인사 변동 발표처럼 우연한 사건으로 인해 발생하는 산발적인 변화를 의미합니다. 이러한 변동은 예측하기 어렵기 때문에 분석 시 잔차로 처리되는 경우가 많습니다.

3. 기호 시퀀스의 순차 패턴 마이닝

기호 시퀀스(symbolic sequence)는 구체적인 시간 개념이 있든 없든, 순서를 가진 요소나 사건들의 집합입니다. 사용자의 쇼핑 순서, 웹 클릭 스트림, 프로그램 실행 순서, 생물학적 서열, 과학·공학 및 자연·사회 현상에서의 사건 순서 등 다양한 형태의 데이터가 기호 시퀀스에 해당합니다.

특히 생물학적 서열은 복잡한 의미론적 정보를 담고 있어 여러 어려운 연구 과제를 제시하기 때문에, 관련 연구의 상당 부분이 바이오인포매틱스(bioinformatics) 분야에 집중되고 있습니다.

4. 생물학적 서열의 정렬(Alignment)

생물학적 서열은 뉴클레오타이드(nucleotide)나 아미노산(amino acid)의 배열을 의미합니다. 생물학적 서열 분석은 서열을 비교하고, 정렬하고, 색인하며 연구하는 작업 전반을 포괄하며, 바이오인포매틱스와 현대 생물학에서 핵심적인 역할을 담당합니다.

서열 정렬(sequence alignment)은 모든 생명체가 진화적으로 연관되어 있다는 사실에 기반합니다. 즉, 진화적으로 가까운 종일수록 뉴클레오타이드(DNA, RNA)와 단백질 서열에서 더 높은 유사성을 보여야 한다는 원리입니다. 정렬(alignment)은 서열들을 나란히 맞추어 최대 일치도를 얻는 과정이며, 이 일치도는 곧 서열 간 유사성의 정도를 나타내는 지표가 됩니다.