서열 정렬(Alignment)의 기본 원리
서열 정렬은 모든 생명체가 진화적으로 서로 연결되어 있다는 사실에 기반합니다. 즉, 진화 계통상 서로 가까운 종일수록 뉴클레오티드(DNA, RNA) 서열과 단백질 서열에서 더 높은 유사성을 보인다는 점을 활용하는 것입니다.
서열 정렬이란 여러 서열을 나란히 배열하여 최대한의 일치도(identity)를 얻는 과정을 말하며, 이 일치도가 곧 서열 간의 유사도를 결정합니다. 두 서열이 공통 조상을 공유한다면, 그 두 서열은 상동(homologous) 관계에 있다고 말합니다.
서열 정렬로 알 수 있는 것
서열 정렬을 통해 얻은 유사도 정보는 두 서열 간의 상동성 가능성을 판단하는 데 매우 유용합니다. 또한 이러한 정렬 결과는 다양한 종 간의 상대적 위치를 파악하는 데 도움을 주며, 이렇게 만들어진 계통 관계도를 계통수(phylogenetic tree)라고 부릅니다.
생물학적 서열 정렬 문제의 정의
생물학적 서열 정렬 문제는 다음과 같이 정의할 수 있습니다. 두 개 이상의 입력 생물학적 서열이 주어졌을 때, 보존된(conserve된) 부분 서열이 많은 공통 영역을 찾아내는 것입니다. 정렬 대상 서열이 두 개라면 '쌍별 서열 정렬(pairwise sequence alignment)', 세 개 이상이라면 '다중 서열 정렬(multiple sequence alignment)'이라고 합니다.
정렬하고 비교하려는 서열은 뉴클레오티드(DNA/RNA)일 수도 있고 아미노산(단백질)일 수도 있습니다. 뉴클레오티드의 경우 두 기호가 완전히 동일해야 정렬됩니다. 반면 아미노산의 경우, 두 기호가 동일하거나 자연계에서 실제로 관찰되는 치환(substitution)으로 서로 변환될 수 있다면 정렬이 허용됩니다.
국소 정렬과 전역 정렬
서열 정렬에는 국소 정렬(local alignment)과 전역 정렬(global alignment)의 두 가지 방식이 있습니다. 국소 정렬은 서열의 일부 영역만을 정렬하는 방식이고, 전역 정렬은 서열 전체 길이에 걸쳐 정렬을 수행하는 방식입니다.
치환 행렬과 갭(Gap)
뉴클레오티드나 아미노산에서 삽입(insertion), 삭제(deletion), 치환(substitution)은 자연계에서 각기 다른 확률로 발생합니다. 치환 행렬(substitution matrix)은 뉴클레오티드 또는 아미노산의 치환 확률과 삽입·삭제 발생 확률을 정량화하여 정의한 것입니다.
두 기호를 정렬하지 않는 것이 바람직한 위치를 표시하기 위해 흔히 갭(gap) 문자 '-'를 사용합니다. 정렬의 품질을 평가하기 위해서는 일반적으로 스코어링 체계(scoring scheme)가 정의되며, 이 체계는 동일한 기호의 정렬에는 양수 점수를, 갭에는 음수 점수를 부여합니다.
정렬 점수와 최적화
모든 점수의 대수적 합이 곧 정렬 점수(alignment score)가 되며, 정렬의 목표는 가능한 모든 정렬 중에서 최대 점수를 얻는 것입니다. 하지만 최적의 정렬을 찾는 것은 계산 비용이 매우 큽니다. 따라서 준최적(suboptimal) 정렬을 효율적으로 찾기 위한 다양한 휴리스틱(heuristic) 기법들이 개발되어 활용되고 있습니다.
게놈과 RNA의 역할
게놈(genome)은 한 생물체가 지닌 유전자의 전체 집합을 의미합니다. 특정 단백질이 필요할 때, 해당 유전자는 RNA로 전사(transcription)됩니다. RNA는 뉴클레오티드가 연결된 사슬 구조이며, DNA는 세포 내에서 각각 고유한 기능을 수행하는 여러 RNA 분자의 합성을 지휘합니다.