BeautifulSoup이란?
BeautifulSoup은 웹 페이지에서 데이터를 파싱(parse)할 때 사용되는 파이썬 서드파티 라이브러리입니다. 이 라이브러리는 다양한 소스에서 데이터를 추출하고 활용 및 가공하는 작업인 웹 스크래핑(Web Scraping)을 손쉽게 구현할 수 있도록 도와줍니다.
또한 BeautifulSoup은 개발자가 자연어 처리(NLP) 애플리케이션을 만들 때도 유용하게 활용됩니다. 데이터를 분석하고 그로부터 의미 있는 인사이트를 추출하는 데 큰 도움이 되기 때문입니다.
여기서 자연어 처리(Natural Language Processing, NLP)란 머신러닝의 한 분야로, 텍스트 데이터를 다루고 이를 머신러닝 문제의 입력값으로 제공하기 위해 사전에 전처리하는 방법론을 의미합니다.
웹 스크래핑의 주요 활용 분야
- 연구 목적의 데이터 수집
- 시장 동향 분석 및 비교
- SEO(검색 엔진 최적화) 모니터링
BeautifulSoup 설치하기
Windows 환경에서 아래 명령어를 실행하면 BeautifulSoup을 설치할 수 있습니다.
pip install beautifulsoup4
예제 코드: 도메인 이름 추출하기
import requests
from bs4 import BeautifulSoup
from urllib.request import urlopen
import urllib
url = 'https://en.wikipedia.org/wiki/Algorithm'
parsed_uri = urllib.request.urlparse(url)
domainName = '{uri.scheme}://{uri.netloc}/'.format(uri=parsed_uri)
print("The domain name is : ")
print(domainName)실행 결과
The domain name is : https://en.wikipedia.org/
코드 설명
- 필요한 패키지들을 임포트하고 별칭(alias)을 지정합니다.
- 분석 대상이 되는 웹사이트 URL을 정의합니다.
urlparse함수를 호출하여 URL을 구성 요소별로 분해합니다.scheme(프로토콜)과netloc(네트워크 위치) 속성을 조합하여 도메인 이름을 추출합니다.- 최종적으로 추출된 도메인 이름을 콘솔에 출력합니다.
이처럼 BeautifulSoup과 함께 파이썬 표준 라이브러리인 urllib를 활용하면 몇 줄의 코드만으로도 웹사이트의 도메인 이름을 간단하게 추출할 수 있습니다.