MongoDB에서 특정 필드를 기준으로 데이터를 그룹화한 뒤, 각 그룹에 속한 고유(unique) 값의 개수를 구하려면 aggregate() 메서드와 $group 연산자를 함께 사용하면 됩니다. 이 글에서는 실제 예제를 통해 단계별로 살펴보겠습니다.
1. 샘플 컬렉션 생성하기
먼저 테스트에 사용할 컬렉션을 만들고 문서를 삽입합니다.
> db.demo354.insertOne({"Name1":"Chris","Name2":"David"});
{
"acknowledged" : true,
"insertedId" : ObjectId("5e5685a6f8647eb59e5620c0")
}
> db.demo354.insertOne({"Name1":"Chris","Name2":"David"});
{
"acknowledged" : true,
"insertedId" : ObjectId("5e5685a9f8647eb59e5620c1")
}
> db.demo354.insertOne({"Name1":"Chris","Name2":"Bob"});
{
"acknowledged" : true,
"insertedId" : ObjectId("5e5685aff8647eb59e5620c2")
}
> db.demo354.insertOne({"Name1":"Carol","Name2":"John"});
{
"acknowledged" : true,
"insertedId" : ObjectId("5e5685c4f8647eb59e5620c3")
}
> db.demo354.insertOne({"Name1":"Carol","Name2":"John"});
{
"acknowledged" : true,
"insertedId" : ObjectId("5e5685c5f8647eb59e5620c4")
}2. 저장된 문서 확인하기
find() 메서드를 사용하면 컬렉션에 저장된 모든 문서를 조회할 수 있습니다.
> db.demo354.find();
위 명령을 실행하면 다음과 같은 결과가 출력됩니다.
{ "_id" : ObjectId("5e5685a6f8647eb59e5620c0"), "Name1" : "Chris", "Name2" : "David" }
{ "_id" : ObjectId("5e5685a9f8647eb59e5620c1"), "Name1" : "Chris", "Name2" : "David" }
{ "_id" : ObjectId("5e5685aff8647eb59e5620c2"), "Name1" : "Chris", "Name2" : "Bob" }
{ "_id" : ObjectId("5e5685c4f8647eb59e5620c3"), "Name1" : "Carol", "Name2" : "John" }
{ "_id" : ObjectId("5e5685c5f8647eb59e5620c4"), "Name1" : "Carol", "Name2" : "John" }3. 고유 필드 수를 집계하는 쿼리
다음은 Name1 필드를 기준으로 그룹화한 후, 각 그룹 내에서 서로 다른 Name2 값이 몇 개 있는지 계산하는 쿼리입니다.
> db.demo354.aggregate([
... {
... $group: {
... _id: {
... "Name1": "$Name1",
... "Name2": "$Name2"
... },
... }
... },
... {
... $group: {
... _id: "$_id.Name1",
... "Name2": { $sum: 1 }
... }
... },
... {
... $project: {
... _id: 0,
... Name1: "$_id",
... Name2: 1
... }
... }
... ])쿼리 동작 원리
이 파이프라인은 세 단계로 구성되어 있습니다.
첫 번째 $group 단계: Name1과 Name2의 조합을 기준으로 문서를 묶어 중복 조합을 제거합니다. 즉, (Chris, David), (Chris, Bob), (Carol, John)처럼 고유한 쌍만 남게 됩니다.
두 번째 $group 단계: Name1 값을 기준으로 다시 그룹화하고, $sum: 1을 사용해 각 Name1에 해당하는 고유한 Name2 값의 개수를 합산합니다.
$project 단계: _id 필드는 출력에서 제외하고, 결과를 보기 좋게 Name1과 Name2 형태로 재구성합니다.
위 쿼리를 실행하면 다음과 같은 결과가 출력됩니다.
{ "Name2" : 2, "Name1" : "Chris" }
{ "Name2" : 1, "Name1" : "Carol" }결과 해석
출력 결과를 보면 Chris에는 David와 Bob이라는 두 가지 서로 다른 Name2 값이 존재하므로 개수가 2로 집계되었고, Carol에는 John 하나뿐이므로 1로 집계되었습니다. 이처럼 두 단계의 $group을 조합하면 MongoDB에서도 SQL의 COUNT(DISTINCT ...)와 유사한 집계를 손쉽게 구현할 수 있습니다.