인터넷 연결은 오늘날 가장 중요한 요소 중 하나입니다. 재택근무부터 여가 활동까지 일상의 대부분이 인터넷에 의존하고 있으며, 보안 카메라로 주변을 확인하는 것조차 네트워크 연결이 필요합니다. 그럼에도 불구하고 우리는 때때로 사소한 인터넷 장애를 겪으며, 이는 곧바로 업무 차질로 이어지곤 합니다.
최근에는 주요 웹사이트와 미국 정부 웹사이트에서 대규모 접속 장애가 발생해 수천 명의 네티즌이 이를 목격했습니다. 이 사태는 사람들 사이에 불안감을 조성했을 뿐만 아니라 업무에도 심각한 차질을 빚었습니다. 피해를 입은 주요 사이트들은 '403 Bad Connection' 오류를 표시했고, 장애는 약 1시간 동안 지속되며 많은 사용자에게 손해를 안겼습니다.
무슨 일이 일어났나?
화요일 새벽, 사용자들은 Amazon, Reddit, Spotify, eBay, Twitch 등 주요 사이트에 접속하는 데 어려움을 겪었습니다. 화면에는 계속해서 '503 Service Unavailable' 오류 메시지가 나타났습니다. 각종 포럼과 인터넷 유명 서비스들뿐 아니라 영국 정부 웹사이트인 gov.uk마저 다운되었습니다. 가디언(The Guardian), CNET, 뉴욕타임스(The New York Times), 르몽드(Le Monde), 인디펜던트(The Independent), 파이낸셜타임스(Financial Times), 이브닝 스탠더드(Evening Standard) 등 굵직한 언론 매체들도 같은 문제를 겪었습니다.
원인은 피해를 입은 모든 웹사이트가 사용하던 글로벌 콘텐츠 전송 네트워크(CDN) 업체 'Fastly'였습니다. Fastly는 즉시 자사 측의 문제임을 인정하고 복구 작업에 착수했습니다. 정오 무렵에는 대부분의 사이트가 정상화되어 다시 원활하게 작동하기 시작했습니다. 일부 사이트는 완전한 복구까지 시간이 더 걸렸지만, 오류 없이 접속할 수 있게 되었습니다.
영국 국립 사이버 보안 센터(NCSC)도 해당 문제를 조사했으며, 그 결과 악성 공격 등 악의적인 요소의 흔적은 발견되지 않았다고 밝혔습니다.
인터넷 장애의 원인은?
트위터에서 #InternetOutage 해시태그가 유행한 이 사건의 원인은 24시간 이내에 밝혀졌습니다. Fastly 고객 중 한 곳이 자신의 계정 설정을 변경하는 과정에서 오류를 촉발한 것으로 알려졌습니다. Fastly는 트래픽이 많은 웹사이트에 빠른 속도와 성능을 제공하는 CDN 서비스입니다. 따라서 웹사이트는 자체 서버를 직접 사용하는 대신 방문자의 요청을 CDN 서버로 우회시킵니다. 빠른 접속 속도를 유지하기 위해 전 세계 곳곳에 여러 CDN 서버가 분산 배치되어 있습니다.
그러나 바로 이 지점에 문제의 근본 원인이 숨어 있습니다. CDN 구조는 경우에 따라 네트워크 전체 장애로 이어질 수 있기 때문입니다. 실제로 이번 사건에서는 Fastly의 관리 하에 있던 웹사이트들이 네트워크 장애로 인해 모든 트래픽이 차단되었습니다. 알려진 바에 따르면, 업데이트된 Fastly 시스템에서 한 고객이 특정 설정을 사용하면서 버그가 발생했고, 이것이 장애의 방아쇠가 되었습니다.
Fastly의 엔지니어링·인프라 담당 수석 부사장 닉 록웰(Nick Rockwell)은 공식 블로그를 통해 이에 대한 입장을 밝혔습니다.
앞으로 이런 문제를 어떻게 예방할 수 있을까?
Fastly가 정확한 경위를 모두 공개하지는 않았지만, 이번 사건은 CDN 시스템의 취약성을 되돌아보게 만듭니다. 우리는 거의 모든 것을 인터넷에 의존하고 있기 때문에 이러한 장애는 누구에게나 큰 영향을 미칩니다. 이제는 적극적으로 대안을 모색하고, 향후 유사 사고를 예방할 방안을 찾아야 합니다. 업무를 지속적으로 수행하기 위해서는 인터넷 의존도에 관한 논의를 활성화하고 함께 해결책을 모색해야 합니다.
최근에는 인터넷 트래픽의 상당 부분이 Amazon의 CloudFront, Cloudflare, Fastly 같은 주요 CDN을 통해 전송됩니다. 특히 Fastly는 주요 웹사이트와 모바일 애플리케이션을 포함해 전체 인터넷 트래픽의 10% 이상을 처리하는 것으로 알려져 있습니다. 사이버 보안 전문가들은 이러한 중앙집중식 시스템이 문제를 일으킬 가능성이 높다고 지적합니다. 특정 서비스에 과도하게 의존하는 구조는 여러 구성 요소 중 하나만 실패해도 전체 마비로 이어질 수 있어, 웹 생태계는 아직 이런 재난에 충분히 대비하지 못한 상태입니다. 지난 몇 년간 비슷한 장애가 잇달아 발생하면서 사용자들에게 불편을 초래했고, 서비스 제공업체 역시 상당한 손실을 입었습니다.
클라우드 서비스는 웹사이트의 도달 범위와 속도를 높여 소비자에게 최상의 경험을 제공하지만, 인터넷 장애로 인한 비용을 감수할 이유가 되어서는 안 됩니다. 장기적인 소비자 서비스의 안정성은 이러한 중앙집중식 시스템에만 의존해서는 안 됩니다.
함께 읽으면 좋은 글: 코로나19 시대, 인터넷 속도 저하는 다음 세계적 리스크인가?
마무리하며
이번 사건은 CDN 관련 인터넷 장애 역사상 처음 있는 일이 아닙니다. 그렇다면 근본적인 질문으로 돌아가야 합니다. 인터넷은 애초에 이토록 중앙집중화된 시스템을 지향하도록 설계된 것이었을까요? 개별 서버 기반의 전통적인 인터넷 구조처럼, 하나의 사이트나 애플리케이션에 장애가 생겨도 다른 서비스까지 함께 멈추지 않는 편이 좋지 않을까요?
CDN 문제로 인한 인터넷 장애에 대해 어떻게 생각하시나요? 아래 댓글로 여러분의 의견을 들려주세요.
여러분의 목소리를 기다립니다!
Facebook과 YouTube에서 저희를 팔로우하세요. 궁금한 점이나 제안 사항이 있다면 댓글로 알려주세요. 성심껏 답변드리겠습니다. 저희는 기술 관련 팁과 트릭, 그리고 흔히 발생하는 문제의 해결 방법을 꾸준히 공유하고 있습니다.
관련 글
- 간단한 DNS 설정으로 인터넷 속도 높이는 방법
- ISP로부터 검색 기록을 숨기는 방법
- 명령 프롬프트 트릭으로 Wi-Fi 속도 높이기
- 인터넷 업로드 속도를 높이는 7가지 방법