PHP에서 HTML 문서를 구문 분석(파싱)해야 할 때는 표준 라이브러리에 포함된 DOMDocument 클래스와 DOMXPath 클래스를 활용하는 것이 가장 안정적입니다. 정규표현식으로 HTML을 직접 처리하는 방식보다 구조화된 방법으로 요소에 접근할 수 있어 오류 발생 가능성이 크게 줄어듭니다.
예를 들어, class="main" 속성을 가진 <div> 태그 내부에 위치한 class="text" 속성의 <div> 태그 텍스트는 다음과 같은 코드로 손쉽게 추출할 수 있습니다.
예제 코드
$html = <<
This is text 1