
표절은 교사, 작가, 편집자 등 글과 아이디어를 다루는 모든 사람에게 늘 골칫거리였습니다. 인터넷의 등장과 복사-붙여넣기 기능이 보편화되면서 문제는 더욱 심각해졌습니다. 표절 검사 소프트웨어가 큰 도움이 되지만, 모든 프로그램이 방대한 데이터베이스나 정확한 알고리즘을 갖추고 있는 것은 아닙니다. 일부 불투명한 검사기는 제출된 콘텐츠를 자신들의 목적으로 활용하기도 합니다. 최고의 검사기조차도 100% 정확률을 보장하지 못합니다. 하지만 표절 검사 도구가 어떤 원리로 작동하는지 이해하면 어떤 도구가 시간을 들일 가치가 있는지 판단하는 데 큰 도움이 됩니다.
표절 검사기는 어떻게 작동할까?

모든 텍스트 매칭 소프트웨어는 저마다 고유한 접근 방식을 가지고 있지만, 대부분 같은 기본 원리 위에서 작동합니다. 입력된 콘텐츠를 원본 자료 데이터베이스와 대조하여 유사성을 찾는 것입니다. 그러나 잠재적으로 표절될 수 있는 콘텐츠의 양이 방대하다 보니 결코 간단한 작업이 아닙니다. 단순히 한 줄씩 일일이 검색한다면 시간이 너무 오래 걸리고 리소스 낭비도 심해 비현실적입니다.
그래서 대부분의 표절 검사 도구는 '지문 인식(fingerprinting)' 기법을 사용합니다. 데이터베이스에 있는 모든 텍스트와 검사 대상 텍스트에서 샘플 세트를 추출하고, 각 샘플을 해싱 알고리즘에 통과시켜 입력값마다 고유한 식별자를 생성하는 방식입니다.

어떤 논문의 지문이 데이터베이스의 지문과 동일하다면 두 텍스트가 같은 입력값을 공유한다는 뜻이며, 표절 가능성이 있습니다. 이 방식은 필연적으로 정확도가 다소 떨어질 수밖에 없지만, 잘 설계된 지문 인식 알고리즘은 논문에서 샘플을 추출하는 방식을 조정해 완전히 일치하는 경우뿐 아니라 일부 내용이 변경된 표절, 예컨대 '스피닝(spinning)' 프로그램으로 문구를 바꾼 경우까지도 탐지할 수 있습니다.
프로그램이 지문 일치를 발견하면 단순히 표절 가능성만 표시하고 끝내기도 합니다. 하지만 품질 높은 소프트웨어라면 이후 직접 문자열 매칭을 통해 텍스트를 한 줄씩 대조합니다. 데이터베이스가 1차적으로 좁혀진 상태에서는 계산 부담이 크게 줄어들기 때문입니다. 이 과정은 초기 지문 검출 결과를 확증하고, 최종 판단을 내리는 사람에게 훨씬 풍부한 정보를 제공합니다.
좋은 표절 검사기를 고르는 기준
훌륭한 표절 검사기는 다음 세 가지 조건을 충족해야 합니다.
- 강력한 개인정보 보호 정책(예: 사용자 콘텐츠를 저장하거나 판매하지 않음)
- 방대한 데이터베이스
- 우수한 알고리즘

개인정보 보호 정책
많은 무료(또는 주로 프리미엄형) 표절 검사기는 광고나 유료 버전 판매로 수익을 창출하는 정당한 서비스입니다. 그러나 일부 무책임한 업체는 검사를 위해 제출된 글을 자신들의 목적으로 사용하기도 합니다. 해당 글이 학습 사이트의 콘텐츠로 올라가거나, '스피너'로 돌려 문구를 바꾼 뒤 트래픽 유출용 아티클로 게시되는 경우도 있습니다. 따라서 개인정보 처리방침을 꼼꼼히 확인하고 사이트 평판을 빠르게 조사하는 것이 좋습니다. 특히 사이트가 수상쩍어 보이거나 너무 좋아서 믿기 어려운 조건이라면 반드시 확인하세요.
데이터베이스
표절 검사기가 적절한 원본 자료에 접근할 수 없다면 해당 자료가 표절되었는지 판단할 수 없습니다. 이것이 일반적으로 저품질 검사기와 프리미엄 검사기를 가르는 가장 큰 차이점입니다. 타인이 소유한 도서, 논문, 기타 콘텐츠 컬렉션에 대한 접근권은 무료도 쉽지도 않기 때문에 많은 도구가 인터넷 검색만 가능합니다. 물론 표절의 상당 부분은 인터넷에서 발생하지만, 누군가 좀 더 공을 들인 표절을 찾으려면 도서, 학술지 논문 등 비공개 자료에 대한 접근이 필수적입니다.
알고리즘
대부분의 표절 검사기는 자신들의 알고리즘을 명확히 공개하지 않지만, 결과물의 품질과 정확도가 알고리즘이 얼마나 잘 만들어졌는지 보여주는 좋은 지표입니다. 이를 직접 측정하기는 어렵지만, 결과가 얼마나 상세한지 살펴보고, 사용자 리뷰를 읽고, 다른 출처에서 복사한 자료를 실제로 감지하는지 테스트해 보면 사이트의 검색 범위가 얼마나 포괄적인지 가늠할 수 있습니다. 예를 들어 무료 버전이 위키백과 문서에서 복사-붙여넣기한 내용조차 잡아내지 못한다면, 유료 버전이 정교할 거라고 기대하기 어렵습니다.
최고의 표절 검사 도구
전문가 수준의 표절 검사기는 대부분 유료이며, 무료 옵션 대부분은 구글 검색보다 성능이 떨어지거나 개인정보 정책상 사용자 콘텐츠를 자신들의 목적으로 활용할 가능성을 시사합니다. 무료로 얻을 수 있는 최선의 결과는 몇 페이지 체험 검색이거나, 표절 여부만 알려주는 간단한 리포트입니다. 후자 역시 유용합니다. 더 정밀한 도구를 사용할지 아니면 직접 논문을 검토할지 빠르게 판단할 수 있기 때문입니다.
저는 아래 도구들을 직접 테스트했습니다. 제가 쓴 글, 위키백과 항목, 뉴스 소스 등 여러 텍스트를 사용했는데, 모든 도구가 표절된 콘텐츠와 출처를 정확히 식별했습니다. 완전 무료 사이트도 상당수 테스트했지만, 상당수가 제 글의 문단을 찾지 못했고 BBC나 위키백과에서 복사한 내용조차 놓치는 경우가 있었습니다. 반면 구글 검색 한 번이면 표절된 콘텐츠가 즉시 나타났습니다.
1. 구글(Google)
특정 텍스트가 표절되었는지 의심된다면 구글이 사실상 최고의 첫 번째 출발점입니다. 한 번에 32단어까지만 검색할 수 있지만, 몇 글자가 바뀌었더라도 복제된 웹사이트, 논문, 도서를 찾아내기에 충분한 경우가 많습니다.
2. Grammarly

Grammarly는 전체 표절 검사 결과를 받으려면 유료 구독이 필요하지만, 초기 검사는 무료이며 표절 가능성이 있는지 여부를 알려줍니다. 다른 많은 앱보다 나은 서비스이며, 실제 테스트에서도 대부분의 경우 표절을 정확히 표시해 1차 무료 옵션으로 손색이 없었습니다.
3. SearchEngineReports

본질적으로 구글 검색을 감싼 래퍼(wrapper) 서비스지만, 무료이면서 다른 무료 옵션들보다 실제로 성능이 좋습니다. 테스트한 대부분의 항목을 정확히 잡아냈습니다. SearchEngineReports는 한 번에 최대 2,000단어까지 검사할 수 있고(검색 횟수 제한 없음), 텍스트를 조각내어 구글에 순차적으로 조회하며 어떤 문장이 검색 결과에 걸리는지 알려줍니다. 참고로 표절된 콘텐츠를 재작성해 향후 검출을 피하는 기능도 제공하지만, 이런 용도로 사용하는 것은 권장하지 않습니다.
4. Copyleaks

Copyleaks는 무료로 2,500단어, 약 10페이지 분량을 검사할 수 있습니다. 사용자층이 넓고 인터페이스가 친숙하며, 학술·과학 저작물의 방대한 데이터베이스를 갖추고 있습니다. 인터넷 콘텐츠를 넘어선 검사가 필요하다면 믿을 만한 출발점입니다. 테스트한 모든 온라인 콘텐츠를 정확히 잡아냈습니다.
5. Quetext

무료로 500단어 검사를 세 번 제공하며, 이후에는 구독이 필요합니다. 다만 Quetext는 정확성과 철저함으로 좋은 평판을 얻고 있으며, 실제 테스트에서도 우수한 성능을 보였습니다. 데이터베이스에는 인터넷 콘텐츠 외에도 수많은 도서와 논문이 포함되어 있습니다. Copyleaks보다 저렴하면서도 포괄적인 도구를 찾는다면 좋은 시작점입니다.
6. PlagScan

PlagScan은 도서, 논문, 기타 텍스트의 방대한 데이터베이스를 보유하고 있으며, 상세한 분석 리포트를 제공합니다. 실제 테스트에서 거의 모든 표절 출처를 식별했습니다. 무료 체헌은 2,000단어까지 가능하며, 이후에는 크레딧을 구매해야 계속 사용할 수 있습니다. 검사할 텍스트 분량이 많지 않다면, 일정 단어 수만큼 크레딧을 구매하는 방식이 다른 검사기의 구독제보다 오히려 경제적일 수 있습니다.
만능 해결책은 없다
표절 검사기, 특히 저가형 도구는 모든 것을 잡아내지 못할 가능성이 높습니다. 표절자가 생소한 출처를 사용하거나 충분히 재작성했다면 기계가 이를 적발하기 어렵고, 지식이 풍부한 사람조차 속을 수 있습니다. 그럼에도 표절 검사기는 좋은 1차 방어선이 되며, 최소한 성의 없는 표절을 막는 억제력은 충분히 발휘합니다.