BeautifulSoup은 웹 페이지에서 데이터를 파싱(구문 분석)하기 위해 사용되는 서드파티(third-party) Python 라이브러리입니다. 이 라이브러리는 개발자가 자연어 처리(NLP) 애플리케이션을 구축하거나, 데이터를 분석하고 그로부터 의미 있는 인사이트를 추출하는 작업을 효율적으로 수행할 수 있도록 도와줍니다.
자연어 처리(Natural Language Processing, NLP)는 머신러닝의 한 분야로, 텍스트 데이터를 다루고 이를 머신러닝 문제의 입력값으로 활용할 수 있도록 사전 처리(pre-processing)하는 방법론을 연구합니다.
웹 스크래핑(web scraping)은 이 외에도 연구 목적의 데이터 수집, 시장 동향 분석 및 비교, SEO 모니터링 등 다양한 용도로 활용될 수 있습니다.
BeautifulSoup 설치하기
Windows 환경에서는 아래 명령어를 실행하여 BeautifulSoup을 설치할 수 있습니다.
pip install beautifulsoup4
예제 코드
다음은 BeautifulSoup을 사용하여 웹 페이지의 제목을 추출하는 예제입니다.
from bs4 import BeautifulSoup
import requests
url = "https://en.wikipedia.org/wiki/Algorithm"
req = requests.get(url)
soup = BeautifulSoup(req.text, "html.parser")
print("The titles are :")
print(soup.title)실행 결과
The titles are : <title>Algorithm − Wikipedia
코드 설명
필요한 패키지를 임포트하고 별칭(alias)을 지정합니다.
데이터를 가져올 웹사이트의 URL을 정의합니다.
requests 라이브러리로 해당 URL에 접속하여 데이터를 읽어옵니다.
'BeautifulSoup' 함수를 사용하여 웹 페이지에서 텍스트를 추출합니다.
'title' 속성을 통해 페이지의 제목을 가져옵니다.
추출한 제목을 콘솔에 출력합니다.