Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

생물학적 데이터 분석을 위한 데이터 마이닝의 핵심 측면

생물학 데이터 분석에 활용되는 데이터 마이닝은 여러 가지 중요한 측면으로 구성됩니다. 각 측면은 방대하고 복잡한 생명과학 데이터를 효과적으로 처리하고 새로운 지식을 도출하는 데 필수적인 역할을 합니다.

1. 이질적·분산된 유전체 및 단백질체 데이터베이스의 의미적 통합

유전체(genomic)와 단백질체(proteomic) 데이터는 다양한 연구실에서 서로 다른 실험 방법을 통해 생성됩니다. 따라서 이러한 데이터는 분산되어 있고, 형식도 제각각이며, 종류 또한 매우 다양합니다. 이런 데이터의 의미적 통합(semantic integration)은 여러 기관에 흩어진 생물학 기록을 교차 분석하는 데 반드시 필요합니다.

또한 연구 논문과 그에 해당하는 생물학적 개체 간의 올바른 연결 관계를 찾아내는 것 역시 중요합니다. 이러한 통합 및 연계 분석은 유전체와 생물학 기록에 대한 체계적이고 조율된 분석을 가능하게 하며, 기본 데이터와 변형된 데이터를 저장·관리하기 위한 통합 데이터 웨어하우스와 분산형 연합 데이터베이스(federated database)의 발전을 촉진했습니다.

데이터 클리닝(data cleaning), 데이터 통합, 참조 조정(reference reconciliation), 분류(classification), 군집화(clustering) 등의 기법은 생물학 데이터의 통합과 생물학 데이터 분석용 데이터 웨어하우스 구축을 효과적으로 지원합니다.

2. 다중 뉴클레오티드/단백질 서열의 정렬, 인덱싱, 유사성 검색 및 비교 분석

지난 수십 년간 다양한 생물학 서열 정렬(sequence alignment) 방법이 개발되어 왔습니다. 특히 BLASTFASTA는 유전체 및 단백질체 데이터를 체계적으로 분석하는 대표적인 도구입니다. 다만 생물학 서열 분석 방법은 일반적인 데이터 마이닝 연구에서 제안된 순차 패턴 분석 알고리즘과는 몇 가지 중요한 차이가 있습니다.

첫째, 삽입(insertion), 삭제(deletion), 돌연변이(mutation)를 처리하기 위해 질의 서열(query sequence)과 검색 대상 서열 사이의 갭(gap)과 불일치(mismatch)를 허용해야 합니다. 둘째, 단백질 서열의 경우 자연계에서 실제로 일어날 수 있는 치환(substitution)으로 서로 전환될 수 있는 아미노산 두 개는 '일치(match)'로 간주해야 합니다.

3. 구조 패턴 발견과 유전자 네트워크 및 단백질 경로 분석

생물학에서 단백질 서열은 3차원 구조로 접히며(folding), 이러한 구조들은 상대적 위치와 거리에 따라 서로 상호작용합니다. 이처럼 복잡한 상호작용이 모여 정교한 유전자 네트워크단백질 경로(protein pathway)의 기반이 됩니다.

거대하면서도 복잡한 이러한 생물학 네트워크 속에서 구조적 패턴과 규칙성을 발견하는 것이 매우 중요합니다. 이를 위해 근사적(approximate)이고 빈번한(frequent) 구조 패턴을 효율적으로 찾아내고, 상호 연결된 생물학 네트워크 내부의 규칙성과 비규칙성을 연구할 수 있는 강력하고 확장 가능한(scalable) 데이터 마이닝 기법의 개발이 요구됩니다.

4. 연관 분석 및 경로 분석

연관 분석(association analysis)은 함께 나타나는(co-occurring) 유전자 서열을 식별하고, 유전자를 질병 진행의 여러 단계와 연결하는 데 활용됩니다. 연관 분석 기법을 통해 표적 샘플에서 나타날 가능성이 있는 유전자 유형을 규명할 수 있습니다.

또한 이러한 분석은 유전자 집단(group of genes)을 발견하고, 유전자들 간의 상호작용과 관계를 연구하는 데 중요한 기초 자료를 제공함으로써 질병 메커니즘 규명과 신약 개발에 기여할 수 있습니다.