집합 값 속성(Set-valued Attribute)의 일반화
집합 값 속성은 동질적(homogeneous) 유형일 수도 있고 이질적(heterogeneous) 유형일 수도 있습니다. 일반적으로 집합 형태의 정보는 다음과 같은 방식으로 일반화할 수 있습니다.
- 상위 개념으로의 치환: 집합에 포함된 모든 값을 그에 해당하는 더 높은 수준의 개념으로 일반화합니다.
- 집합의 전형적인 행위 도출: 집합 내 원소의 개수, 원소들의 유형이나 값 범위, 통계 데이터의 가중 평균, 집합이 형성하는 주요 클러스터 등 집합이 나타내는 일반적인 특성을 추출합니다.
- 다중 일반화 경로 분석: 여러 일반화 연산자(generalization operator)를 활용해 다양한 일반화 경로를 분석할 수도 있습니다. 이 방법을 사용하면 일반화 결과가 하나의 이질적(heterogeneous) 집합으로 도출됩니다.
예시
어떤 사람의 취미가 집합 값 속성이며, 값의 집합이 {테니스, 하키, 축구, 바이올린, 심시티(SimCity)}라고 가정해 보겠습니다. 이 집합은 {스포츠, 음악, 컴퓨터 게임}과 같은 상위 개념의 집합으로 일반화할 수 있으며, 아니면 집합에 포함된 취미의 개수인 숫자 5로 일반화할 수도 있습니다.
나아가 일반화된 값에 개수(count)를 함께 표기하여 몇 개의 원소가 해당 값으로 일반화되었는지 나타낼 수 있습니다. 예를 들어 {스포츠(3), 음악(1), 컴퓨터 게임(1)}에서 스포츠(3)는 세 종류의 스포츠가 '스포츠'라는 상위 개념으로 일반화되었음을 의미합니다.
집합 값 속성은 집합 값 속성으로 일반화될 수도 있고, 단일 값(individual-valued) 속성으로 일반화될 수도 있습니다. 반대로 단일 값 속성도 그 값들이 격자(lattice)나 '계층(hierarchy)' 구조를 이루거나, 일반화가 여러 경로를 따라 진행되는 경우에는 집합 값 속성으로 일반화될 수 있습니다. 이렇게 일반화된 집합 값 속성에 대해 추가 일반화를 수행할 때는 집합 내 모든 값의 일반화 경로를 따라야 한다는 점에 유의해야 합니다.
리스트 값·시퀀스 값 속성의 일반화
리스트 값(list-valued) 속성과 시퀀스 값(sequence-valued) 속성도 집합 값 속성과 유사한 방식으로 일반화할 수 있습니다. 다만 리스트나 시퀀스에서는 원소들의 순서가 일반화 과정에서도 반드시 보존되어야 한다는 점이 다릅니다.
또한 리스트는 그 자체의 일반적인 행위를 기준으로 일반화할 수 있습니다. 여기에는 리스트의 길이, 리스트 원소의 유형, 값 범위, 수학적 데이터의 가중 평균값 산출, 또는 리스트에서 중요하지 않은 구성 요소를 제거하는 방법 등이 포함됩니다. 이러한 과정을 통해 리스트는 리스트, 집합, 또는 단일 값으로 일반화될 수 있습니다.
복잡한 구조 값 속성의 일반화
복잡한 구조 값(structure-valued) 속성은 집합, 튜플(tuple), 리스트, 트리(tree), 레코드(record)와 이들의 조합을 포함할 수 있으며, 하나의 구조가 임의의 수준까지 다른 구조 안에 중첩(nested)될 수 있습니다.
일반적으로 구조 값 속성은 다음과 같은 여러 가지 방식으로 일반화할 수 있습니다.
- 구조 형태 유지: 구조의 형태를 그대로 유지하면서 구조 내부의 각 속성을 개별적으로 일반화합니다.
- 구조 평탄화 후 일반화: 복잡한 구조를 평탄화(flattening)한 뒤, 평탄화된 구조에 대해 일반화를 수행합니다.
- 상위 개념 또는 집계를 통한 요약: 하위 수준의 구조들을 상위 개념이나 집계(aggregation) 기법으로 요약합니다.
- 유형 또는 개요 반환: 세부 내용 대신 구조의 유형이나 전체적인 개요만을 반환합니다.