MySQL에서 특정 열(하나 또는 두 개)을 기준으로 중복된 행을 모두 조회하려면 서브쿼리(subquery)와 HAVING 절을 함께 사용하면 됩니다. 이 글에서는 예제 테이블을 만들고, 이름이 두 번 이상 나타나는 즉, 중복된 데이터를 찾아내는 과정을 단계별로 살펴보겠습니다.
1. 예제 테이블 생성
먼저 학생 정보를 저장할 테이블을 생성합니다.
mysql> create table DemoTable
(
StudentId int NOT NULL AUTO_INCREMENT PRIMARY KEY,
StudentFirstName varchar(20),
StudentLastName varchar(20)
);
Query OK, 0 rows affected (0.27 sec)2. 샘플 데이터 삽입
INSERT 명령을 사용해 몇 개의 레코드를 추가합니다. 여기서 'John'이라는 이름이 의도적으로 여러 번 들어가 있어 중복 조회를 확인할 수 있습니다.
mysql> insert into DemoTable(StudentFirstName,StudentLastName) values('John','Smith');
Query OK, 1 row affected (0.04 sec)
mysql> insert into DemoTable(StudentFirstName,StudentLastName) values('Carol','Taylor');
Query OK, 1 row affected (0.04 sec)
mysql> insert into DemoTable(StudentFirstName,StudentLastName) values('John','Doe');
Query OK, 1 row affected (0.17 sec)
mysql> insert into DemoTable(StudentFirstName,StudentLastName) values('John','Brown');
Query OK, 1 row affected (0.05 sec)
mysql> insert into DemoTable(StudentFirstName,StudentLastName) values('David','Miller');
Query OK, 1 row affected (0.06 sec)3. 전체 데이터 확인
SELECT 문으로 테이블에 저장된 모든 레코드를 조회합니다.
mysql> select *from DemoTable;
실행 결과는 다음과 같습니다.
+-----------+------------------+-----------------+ | StudentId | StudentFirstName | StudentLastName | +-----------+------------------+-----------------+ | 1 | John | Smith | | 2 | Carol | Taylor | | 3 | John | Doe | | 4 | John | Brown | | 5 | David | Miller | +-----------+------------------+-----------------+ 5 rows in set (0.00 sec)
4. 중복 행 조회 쿼리
다음은 하나 또는 두 개의 열을 기준으로 중복된 행을 모두 선택하는 쿼리입니다. 서브쿼리에서 HAVING 절과 COUNT 함수를 사용하여 두 번 이상 등장하는 이름, 즉 중복되는 이름을 가진 행만 필터링합니다.
mysql> select StudentId from DemoTable where StudentFirstName=(select StudentFirstName from DemoTable having count(StudentFirstName) > 1);
위 쿼리를 실행하면 'John'이라는 이름이 세 번 등록되어 있으므로, 해당 이름을 가진 행들의 ID가 출력됩니다.
+-----------+ | StudentId | +-----------+ | 1 | | 3 | | 4 | +-----------+ 3 rows in set (0.03 sec)
정리
이처럼 서브쿼리와 HAVING 절을 조합하면 특정 열의 값이 반복해서 나타나는 중복 행을 손쉽게 찾을 수 있습니다. 실무에서는 GROUP BY와 HAVING COUNT(*) > 1을 활용한 방식도 널리 사용되므로, 상황에 맞게 응용하면 데이터 정합성 검사나 중복 데이터 정리 작업에 큰 도움이 됩니다.