
Princiya 작성
페이스북 스캔들 이후 많은 사람들이 온라인 개인정보 문제에 큰 관심을 갖게 되었습니다. 이 글에서는 웹 추적(web tracking)이 어떻게 작동하는지 핵심만 쉽게 설명해 드리겠습니다.
이 글에서 다루는 내용
- 웹 추적이란 무엇이며, 어떻게, 왜 이루어지는가?
- 웹 추적은 나쁜 것일까?
- 1차(퍼스트 파티) 추적과 3차(서드 파티) 추적
- 추적 메커니즘
- 추적기를 추적하는 방법
웹 추적이란 무엇인가?
웹 추적은 웹사이트가 사용자를 식별하고 정보를 수집하는 행위를 말합니다. 일반적으로 웹 브라우징 기록의 일부 형태로 수집됩니다.
어떻게 작동할까?
인터넷을 사용할 때마다 방문한 웹사이트와 클릭한 모든 내용이 기록으로 남습니다. 이러한 정보를 추적하기 위해 많은 웹사이트는 작은 데이터 조각을 저장하거나, 눈에 보이지 않는 객체를 삽입하고, 사용자 계정이나 하드웨어 구성 정보를 활용합니다.
자세한 내용은 아래 '추적 메커니즘' 섹션에서 다룹니다.
왜 추적할까?
웹사이트 운영자와 추적업체 입장에서는 개인화, 사이트 분석, 타겟 광고 같은 유용한 기능을 제공할 수 있기 때문입니다.
추적 기술이 없다면 전자상거래 사이트는 모든 방문자를 낯선 사람처럼 취급해야 하고, 맞춤형 콘텐츠를 보여줄 수 없습니다.
웹 추적은 나쁜 것일까?
웹 추적이 100% 나쁜 것은 아니지만, 그 작동 방식은 잘 알려져 있지 않습니다. 다른 사이트로 이동했는데 방금 본 상품, 혹은 몇 주 전에 봤던 상품의 광고가 계속 따라온 경험이 있으실 겁니다. 가장 큰 우려는 서드 파티(제3자) 웹사이트의 추적기에서 비롯됩니다.
아래 트위터 스레드는 구글과 페이스북이 우리 정보를 얼마나 많이 수집하는지 보여줍니다.

1차 추적 vs 3차 추적
예를 들어 nytimes.com에 접속했다고 해봅시다. 뉴욕타임스는 당신이 방문했다는 사실과 어떤 기사를 읽고 있는지 알 수 있습니다. 이 경우 뉴욕타임스가 '1차(퍼스트 파티)'입니다.
1차 사이트는 당신이 직접 선택해 방문한 곳이므로, 방문 정보를 아는 것 자체에는 크게 문제가 없습니다. 반면 doubleclick.net 같은 서드 파티 추적기는 nytimes.com이 타겟 광고 등을 위해 삽입한 것으로, 사용자가 nytimes.com을 방문했다는 사실을 기록할 수 있습니다.
특정 웹사이트에 얼마나 많은 추적기가 존재하는지는 해당 사이트 운영자의 결정에 달려 있습니다.
서드 파티 추적이란?
서드 파티 웹 추적은 사용자가 직접 방문한 웹사이트가 아닌 다른 주체(추적기)가 사용자의 사이트 방문을 추적하거나 추적을 돕는 행위를 말합니다.
서드 파티 추적기는 소름 돋습니다
페이지에 서드 파티가 하나라도 존재하면, 그 서드 파티는 또 다른 서드 파티들을 마음대로 1차 웹페이지로 불러들일 수 있습니다.
당신의 개인 정보는 소중합니다. 자신에 대해 어떤 데이터가 수집되는지 알 권리는 당신에게 있습니다. 나이, 소득, 가족의 나이와 소득, 병력, 식습관, 즐겨 찾는 웹사이트, 생일까지… 목록은 끝이 없습니다.
문제는 이런 데이터를 수집해 서드 파티와 손잡고, 당신이 돈을 쓰거나 서비스에 가입하고 더 많은 정보를 내놓도록 유도하는 새로운 방법을 고안하는 데 쓰인다는 점입니다. 확실한 대가를 받고 정보를 제공한다면 괜찮겠지만, 대부분의 경우 광고 하나 외에는 아무런 혜택도 없으며, 아무도 당신을 그 결정에 참여시키지 않습니다.
추적은 익명이 아닙니다
추적은 익명이 아님을 보여주는 만화실명이 붙어 있지 않으니 추적이 익명이라고 생각할 수 있습니다. 하지만 많은 서드 파티는 당신의 실제 신원을 알고 있습니다.
예를 들어 페이스북이 서드 파티 추적으로 작동할 때, 페이스북 계정을 만들어 로그인한 상태라면 신원을 알 수 있고, 로그인하지 않았더라도 알아낼 수 있습니다.
또한 추적기는 브라우징 기록과 소셜 미디어 프로필 간의 통계적 유사성을 알고리즘으로 분석해 사용자를 재식별(de-anonymize)할 수도 있습니다.
눈에 보이는 서드 파티 추적기
대부분의 서드 파티는 눈에 보이지 않지만, 페이스북 '좋아요' 버튼, 삽입된 트위터 피드, 각종 상용 위젯 같은 눈에 보이는 페이지 요소 역시 서드 파티 추적의 한 방법입니다.
추적 메커니즘
가장 흔한 추적 메커니즘은 다음과 같습니다.
쿠키, 핑거프린팅, 비콘 — 추적 메커니즘쿠키(Cookie)는 사용자를 식별하는 가장 널리 알려진 방법입니다. 웹 서버가 브라우저 저장소에 넣는 작은 데이터 조각(각각 최대 4KB)으로, 사용자가 처음 웹사이트를 방문하면 고유한 사용자 식별자(무작위 생성 가능)가 담긴 쿠키 파일이 컴퓨터에 저장됩니다.
페이스북 페이지에 다시 방문할 때 로그인할 필요가 없는 이유가 바로 첫 로그인 때 저장된 쿠키 덕분입니다.
브라우저 핑거프린팅(Browser Fingerprinting)은 사용자가 온라인에 접속할 때마다 매우 정확하게 식별하고 추적하는 방법입니다. 수집되는 정보는 상당히 포괄적이며, 브라우저 종류와 버전, 운영체제와 버전, 화면 해상도, 지원 폰트, 플러그인, 시간대, 언어 및 글꼴 환경설정, 심지어 하드웨어 구성까지 포함되는 경우가 많습니다.
이런 식별자들은 평범해 보이고 개인을 특정하지 못할 것 같지만, 실제로는 수백만 명 중 단 한 사람만 당신과 정확히 같은 사양을 가집니다.
웹 비콘(Web Beacon)은 웹 페이지나 이메일에 삽입되는 아주 작고 대개 눈에 보이지 않는 객체입니다. '웹 버그(web bug)'라고도 하며, '태그', '페이지 태그', '추적 버그', '픽셀 트래커', '픽셀 GIF' 등으로도 불립니다.
가장 단순한 형태는 1픽셀 크기의 투명한 이미지입니다. 웹 페이지가 로드되거나 이메일이 열릴 때 이미지로 다운로드되면서 원격 서버에 요청을 보내고, 이 서버 호출을 통해 회사는 이메일이 열렸는지, 웹 페이지가 방문됐는지 알 수 있습니다.
그렇기 때문에 신뢰할 수 없는 발신자의 이메일에서는 이미지를 표시하지 않는 것이 좋습니다.
웹 비콘은 온라인 광고주가 광고에 삽입해 광고 노출 빈도를 독립적으로 추적하는 용도로도 사용됩니다.
추적기를 추적하는 방법!
작년 필자는 Outreachy 프로그램을 통해 모질라(Mozilla)에서 인턴으로 일했습니다. Lightbeam이라는 도구를 개발했는데, 이 프라이버시 브라우저 확장 프로그램은 웹을 탐색하는 동안 누가 당신을 추적하는지 발견하도록 도와줍니다.
Lightbeam이 보여주는 1차 및 3차 추적기 시각화Lightbeam을 활성화하고 웹사이트를 방문하면, 브라우저 확장 프로그램이 해당 페이지에서 활동 중인 모든 서드 파티 추적기를 실시간으로 시각화합니다. 두 번째 사이트로 이동하면 거기서도 활동 중인 서드 파티 추적기를 강조하고, 어느 서드 파티가 두 사이트 모두에서 당신을 봤는지 보여줍니다. 시각화는 방문하는 사이트와 브라우저가 보내는 요청이 늘어날수록 점점 커집니다.
참고 자료 및 추가 학습
웹 추적에는 여기서 다룬 것보다 훨씬 많은 내용이 있습니다. 더 배우기 좋은 곳들을 소개합니다.
- The WebTAP 프로젝트
- 웹의 서드 파티 추적
- Mozilla Privacy Basics
안전하게 인터넷을 이용하고, 더 건강한 인터넷을 만들어 가세요!
freeCodeCamp의 오픈소스 커리큘럼은 4만 명 이상이 개발자로 취업하는 데 도움을 줬습니다. 무료로 코딩을 배워보세요.