Computer >> 컴퓨터 >  >> 프로그래밍 >> Python

파이썬 BeautifulSoup 패키지로 웹사이트 도메인 이름 추출하는 방법

BeautifulSoup이란?

BeautifulSoup은 웹 페이지에서 데이터를 파싱(parse)할 때 사용되는 파이썬 서드파티 라이브러리입니다. 이 라이브러리는 다양한 소스에서 데이터를 추출하고 활용 및 가공하는 작업인 웹 스크래핑(Web Scraping)을 손쉽게 구현할 수 있도록 도와줍니다.

또한 BeautifulSoup은 개발자가 자연어 처리(NLP) 애플리케이션을 만들 때도 유용하게 활용됩니다. 데이터를 분석하고 그로부터 의미 있는 인사이트를 추출하는 데 큰 도움이 되기 때문입니다.

여기서 자연어 처리(Natural Language Processing, NLP)란 머신러닝의 한 분야로, 텍스트 데이터를 다루고 이를 머신러닝 문제의 입력값으로 제공하기 위해 사전에 전처리하는 방법론을 의미합니다.

웹 스크래핑의 주요 활용 분야

  • 연구 목적의 데이터 수집
  • 시장 동향 분석 및 비교
  • SEO(검색 엔진 최적화) 모니터링

BeautifulSoup 설치하기

Windows 환경에서 아래 명령어를 실행하면 BeautifulSoup을 설치할 수 있습니다.

pip install beautifulsoup4

예제 코드: 도메인 이름 추출하기

import requests
from bs4 import BeautifulSoup
from urllib.request import urlopen
import urllib

url = 'https://en.wikipedia.org/wiki/Algorithm'
parsed_uri = urllib.request.urlparse(url)
domainName = '{uri.scheme}://{uri.netloc}/'.format(uri=parsed_uri)
print("The domain name is : ")
print(domainName)

실행 결과

The domain name is :
https://en.wikipedia.org/

코드 설명

  • 필요한 패키지들을 임포트하고 별칭(alias)을 지정합니다.
  • 분석 대상이 되는 웹사이트 URL을 정의합니다.
  • urlparse 함수를 호출하여 URL을 구성 요소별로 분해합니다.
  • scheme(프로토콜)과 netloc(네트워크 위치) 속성을 조합하여 도메인 이름을 추출합니다.
  • 최종적으로 추출된 도메인 이름을 콘솔에 출력합니다.

이처럼 BeautifulSoup과 함께 파이썬 표준 라이브러리인 urllib를 활용하면 몇 줄의 코드만으로도 웹사이트의 도메인 이름을 간단하게 추출할 수 있습니다.