Computer >> 컴퓨터 >  >> 프로그래밍 >> 프로그래밍

정형·반정형·비정형 데이터의 차이점 한눈에 정리

빅데이터(Big Data)는 방대한 양의 데이터와 이를 처리하는 과정 전반을 다루는 개념입니다. 데이터의 규모가 워낙 거대하다 보니, 데이터가 얼마나 체계적으로 구조화되어 있는지에 따라 크게 세 가지 유형으로 분류할 수 있습니다. 바로 정형 데이터(Structured Data), 반정형 데이터(Semi-Structured Data), 비정형 데이터(Unstructured Data)입니다.

세 유형은 데이터의 구조화 수준을 기준으로 구분되며, 이 기준에 따라 저장 방식, 트랜잭션 관리, 버전 관리, 유연성, 성능 등 여러 측면에서 뚜렷한 차이를 보입니다. 아래 표에서 각 항목별 차이점을 자세히 살펴보겠습니다.

정형·반정형·비정형 데이터 비교표

번호구분 기준정형 데이터반정형 데이터비정형 데이터
1구조화 수준이름 그대로 데이터가 매우 체계적으로 조직되어 있어 구조화 수준이 가장 높음.일부만 구조화되어 있고 나머지는 비구조적인 형태로, 정형 데이터보다는 낮고 비정형 데이터보다는 높은 중간 수준.데이터가 전혀 구조화되어 있지 않아 구조화 수준이 가장 낮음.
2데이터 조직화 수단관계형 데이터베이스(RDBMS)를 통해 구조화됨.XML, RDF 등의 형식으로 부분적으로 구조화됨.단순 문자(character) 및 바이너리(binary) 데이터 형태로 존재함.
3트랜잭션 관리데이터 관리와 동시성(concurrency) 제어가 지원되므로 멀티태스킹 환경에 가장 적합함.트랜잭션이 기본 제공되지 않으며 DBMS에서 가져와 적용해야 하고, 동시성 제어는 지원되지 않음.트랜잭션 관리와 동시성 제어가 모두 존재하지 않음.
4버전 관리관계형 데이터베이스를 지원하므로 튜플(tuple), 행(row), 테이블(table) 단위로 버전 관리가 가능함.부분적으로 데이터베이스를 지원하므로 튜플 또는 그래프 구조가 가능한 경우에만 버전 관리가 이루어짐.데이터베이스 지원이 전혀 없기 때문에 전체 데이터 단위로만 버전 관리가 가능함.
5유연성과 확장성관계형 데이터베이스 기반이므로 스키마에 의존적이며, 유연성과 확장성이 상대적으로 낮음.정형 데이터보다는 유연하지만, 비정형 데이터에 비해서는 유연성과 확장성이 떨어짐.특정 데이터베이스에 종속되지 않으므로 세 유형 중 가장 유연하고 확장성이 뛰어남.
6성능복잡한 조인(join)이 가능한 구조화된 쿼리를 실행할 수 있어 성능이 가장 우수함.익명 노드(anonymous node) 대상의 쿼리만 실행 가능하므로, 정형 데이터보다는 느리고 비정형 데이터보다는 빠름.텍스트 기반 쿼리만 가능하여 세 유형 중 성능이 가장 낮음.

세 가지 데이터 유형의 대표적인 예시

정형 데이터

행과 열로 구성된 고정된 스키마를 따르는 데이터로, 관계형 데이터베이스 테이블, 엑셀 스프레드시트, ERP·CRM 시스템의 거래 기록 등이 대표적입니다.

반정형 데이터

태그나 마커를 통해 일정 수준의 구조를 가지지만 관계형 스키마에는 맞지 않는 데이터로, XML·JSON 문서, 이메일, 시스템 로그 파일 등이 여기에 해당합니다.

비정형 데이터

미리 정의된 구조나 스키마 없이 존재하는 데이터로, 이미지, 동영상, 오디오 파일, SNS 게시물, PDF 문서 등이 대표적입니다. 실제로 전체 빅데이터의 약 80% 이상이 비정형 데이터로 알려져 있습니다.

마무리

정형 데이터는 안정적인 관리와 높은 쿼리 성능이 필요한 경우에, 반정형 데이터는 어느 정도의 구조와 유연성을 동시에 원할 때, 비정형 데이터는 최대한의 유연성과 확장성이 요구되는 경우에 각각 적합합니다. 따라서 프로젝트의 목적과 데이터의 특성을 정확히 파악한 뒤, 어떤 유형의 데이터를 어떤 방식으로 저장하고 처리할지 결정하는 것이 빅데이터 아키텍처 설계의 핵심이라 할 수 있습니다.