MongoDB에서 요소가 일치하는 두 목록 집계하기
하나 이상의 요소가 일치하는 경우 두 목록을 하나로 집계하려면 MongoDB의 $group 연산자를 사용합니다. 여기에 $unwind, $addToSet 등의 연산자를 함께 조합하면 배열 형태의 데이터도 손쉽게 처리할 수 있습니다.
먼저 실습에 사용할 문서가 포함된 컬렉션을 생성해 보겠습니다.
> db.demo456.insertOne(
... { _id: 101, StudentName: ["Chris", "David"] }
... );
{ "acknowledged" : true, "insertedId" : 101 }
>
> db.demo456.insertOne(
... { _id: 102, StudentName: ["Mike", "Sam"] }
... );
{ "acknowledged" : true, "insertedId" : 102 }
> db.demo456.insertOne(
... { _id: 103, StudentName: ["John", "Jace"] }
... );
{ "acknowledged" : true, "insertedId" : 103 }
> db.demo456.insertOne(
... { _id: 104, StudentName: ["Robert", "John"] }
... );
{ "acknowledged" : true, "insertedId" : 104 }
컬렉션 데이터 조회하기
find() 메서드를 사용하여 컬렉션에 저장된 모든 문서를 확인합니다.
> db.demo456.find();
위 명령을 실행하면 다음과 같은 출력 결과를 얻을 수 있습니다.
{ "_id" : 101, "StudentName" : [ "Chris", "David" ] }
{ "_id" : 102, "StudentName" : [ "Mike", "Sam" ] }
{ "_id" : 103, "StudentName" : [ "John", "Jace" ] }
{ "_id" : 104, "StudentName" : [ "Robert", "John" ] }애그리게이션 쿼리 작성하기
다음은 하나 이상의 요소가 일치할 때 두 목록을 집계하는 파이프라인 쿼리입니다.
> db.demo456.aggregate([
... {$unwind:"$StudentName"},
... {$group:{_id:"$StudentName", combine:{$addToSet:"$_id"}, size:{$sum:1}}},
... {$match:{size: {$gt: 1}}},
... {$project:{_id: 1, combine:1, size: 1, combine1: "$combine"}},
... {$unwind:"$combine"},
... {$unwind:"$combine1"},
... {$group:{_id:"$combine", l:{$first:"$_id"}, size:{$sum: 1}, set: {$addToSet:"$combine1"}}},
... {$sort:{size:1}},
... {$group:{_id: "$l", combineIds:{$last:"$set"}, size:{$sum:1}}},
... {$match: {size:{$gt:1}}}
... ])
쿼리 실행 결과는 다음과 같습니다.
{ "_id" : "John", "combineIds" : [ 103, 104 ], "size" : 2 }결과 해석
실행 결과를 보면 "John"이라는 학생 이름이 _id 103과 _id 104 두 문서의 배열에 공통으로 포함되어 있습니다. 따라서 이 두 문서는 하나 이상의 공통 요소를 가진 것으로 판별되어 하나의 그룹으로 집계되었습니다.
파이프라인의 주요 단계를 간단히 정리하면 다음과 같습니다.
$unwind – 배열 필드인 StudentName을 개별 문서로 분해합니다.
$group + $addToSet – 동일한 이름별로 문서의 _id 값을 집합으로 묶습니다.
$match – 두 번 이상 등장한 이름(즉, 공통 요소가 존재하는 경우)만 필터링합니다.
$sort 및 재집계 – 일치하는 항목들을 기준으로 최종적으로 목록을 병합합니다.
이처럼 $unwind와 $group을 적절히 조합하면 배열 안의 중복 요소를 기준으로 여러 문서를 유연하게 집계할 수 있습니다.