Computer >> 컴퓨터 >  >> 프로그래밍 >> MySQL

MySQL에서 중복 레코드만 조회하고 개수까지 확인하는 방법

데이터베이스에서 중복된 레코드만 선택하고 그 개수를 함께 표시하려면 HAVING 절과 집계 함수인 COUNT()를 함께 사용하면 됩니다. GROUP BY로 데이터를 그룹화한 뒤, HAVING 조건을 통해 중복 건수가 1보다 큰 값만 필터링하는 방식입니다.

먼저 예제에 사용할 테이블을 생성해 보겠습니다.

mysql> create table duplicateRecords
-> (
-> ClientId int NOT NULL AUTO_INCREMENT PRIMARY KEY,
-> ClientName varchar(20)
-> );
Query OK, 0 rows affected (0.49 sec)

테이블에 데이터 삽입하기

INSERT 명령을 사용해 테이블에 레코드를 삽입하는 쿼리는 다음과 같습니다.

mysql> insert into duplicateRecords(ClientName) values('John');
Query OK, 1 row affected (0.16 sec)
mysql> insert into duplicateRecords(ClientName) values('Carol');
Query OK, 1 row affected (0.17 sec)
mysql> insert into duplicateRecords(ClientName) values('John');
Query OK, 1 row affected (0.29 sec)
mysql> insert into duplicateRecords(ClientName) values('Sam');
Query OK, 1 row affected (0.19 sec)
mysql> insert into duplicateRecords(ClientName) values('Sam');
Query OK, 1 row affected (0.11 sec)
mysql> insert into duplicateRecords(ClientName) values('Bob');
Query OK, 1 row affected (0.12 sec)
mysql> insert into duplicateRecords(ClientName) values('John');
Query OK, 1 row affected (0.13 sec)
mysql> insert into duplicateRecords(ClientName) values('Sam');
Query OK, 1 row affected (0.12 sec)

전체 레코드 확인하기

SELECT 문을 사용해 테이블의 모든 레코드를 조회해 보겠습니다.

mysql> select * from duplicateRecords;

위 쿼리는 다음과 같은 결과를 출력합니다.

+----------+------------+
| ClientId | ClientName |
+----------+------------+
| 1 | John |
| 2 | Carol |
| 3 | John |
| 4 | Sam |
| 5 | Sam |
| 6 | Bob |
| 7 | John |
| 8 | Sam |
+----------+------------+
8 rows in set (0.00 sec)

결과를 보면 'John'은 3번, 'Sam'은 3번, 'Carol'과 'Bob'은 각각 1번씩 저장되어 있습니다.

중복 레코드만 조회하는 쿼리

이제 중복된 레코드만 선택하고 개수를 함께 표시하는 쿼리입니다.

mysql> select ClientName,count(*) as DuplicateRecord
-> from duplicateRecords
-> group by ClientName
-> having DuplicateRecord > 1;

실행 결과는 다음과 같습니다.

+------------+-----------------+
| ClientName | DuplicateRecord |
+------------+-----------------+
| John | 3 |
| Sam | 3 |
+------------+-----------------+
2 rows in set (0.00 sec)

쿼리 동작 원리

이 쿼리가 동작하는 방식을 단계별로 살펴보면 다음과 같습니다.

1. GROUP BY: ClientName 컬럼을 기준으로 레코드를 그룹화합니다. 즉, 'John', 'Carol', 'Sam', 'Bob' 각각 하나의 그룹이 됩니다.

2. COUNT(*): 각 그룹에 속한 레코드 수를 계산하여 DuplicateRecord라는 별칭으로 출력합니다.

3. HAVING: WHERE 절은 집계 함수와 함께 사용할 수 없기 때문에, 그룹화 이후 조건을 적용하려면 HAVING 절을 사용해야 합니다. 여기서는 개수가 1보다 큰 경우, 즉 실제로 중복이 존재하는 이름만 최종 결과에 포함됩니다.

그 결과 'John'(3건)과 'Sam'(3건)만 출력되며, 한 번만 등장한 'Carol'과 'Bob'은 제외됩니다. 이 패턴은 이메일 중복 검사, 회원명 중복 확인 등 실무에서 매우 자주 활용되므로 꼭 익혀두시길 권장합니다.